中文深度讲稿 / AI reviewed
Satya Nadella on the AI Doomer Slowdown, Microsoft's Master Plan & Who Wins AI
2026-09-20 · 5,426 字 · 8 章节
这场对话真正争论的,不只是人工智能要不要继续加速,而是它怎样才能既服务人类,又不把控制权交出去。Satya Nadella给出的答案贯穿安全、产品、商业模式和数据中心:AI能否被广泛采用,取决于工程可靠性,也取决于普通人能不能在现实世界里看到它带来的好处。
先问一个最基本的问题
主持人先把问题抛得很大。他介绍 Microsoft 董事长兼首席执行官 Satya Nadella 时,口述 Microsoft 市值增加约二千五百亿美元,纳德拉担任 CEO 约三年半,股价上涨约百分之一百二十。接着又提到 Microsoft 将投入八百亿美元建设 Azure。这些数字都是主持人在节目开场提出的说法。
开场材料把人工智能称为继工业革命之后可能最重要的事情之一。纳德拉则给 Microsoft 下了一个明确的定义:它是工具制造者。Microsoft 创造技术,是为了让别人继续创造技术。对应到模型上,他希望 Microsoft 的模型成为别人构建产品和技术的基础,而不只是一个封闭的终点。
这也解释了他后面所有回答的共同方向。AI的价值不只在于模型变得更强,还在于它能不能真正扩散,进入企业、医疗和普通人的工作流。
当主持人问人工智能要不要减速时,纳德拉没有先谈速度。他先说,应该尽一切可能建设首先服务人类、并处在人类控制之下的系统。
在他看来,技术广泛扩散是最关键的事情。因为如果人工智能只停留在少数公司和少数实验室里,所谓服务人类就不会真正发生。要让收益到达更多人,就需要选择、竞争,以及多种商业模式并存,包括开放权重和闭源权重。
他还把“控制”解释得更具体。企业希望保护隐私,把自己的知识嵌入自己控制的模型权重,看到模型生成的思维链,也就是模型的推理过程;企业还希望用模型输出微调自己的模型,并且不让知识产权泄露。
所以,控制并不只是政府或实验室对模型的控制。客户和企业也应该拥有控制权。对纳德拉来说,真正可用的AI不是一个完全不透明、只能被动接受的黑箱,而是企业可以理解、调整和迁移的工具。
安全测试不能关起门来做
接着谈到安全,纳德拉的建议很朴素:测试系统需要多少时间,就投入多少时间。他赞成第三方测试者参与,甚至嵌入测试过程。
但他特别强调,不能让测试者之间形成封闭、互相包庇的安排。谁在测试什么,谁能够访问什么,不应该只由一个小圈子决定。测试范围要广,访问权限也要足够广泛。
这背后的判断是,开发者自己认为安全,并不等于系统真的经得起检验。第三方的价值不只是多一个人来找漏洞,而是把测试从内部流程变成更开放、更难互相放过的检查。
纳德拉后来把风险分成两层。第一层是很普通的 DevOps 问题,比如容器配置错误、API 密钥管理不当、没有监控,甚至让系统直接接触互联网。这些问题虽然可能造成严重后果,但本质上仍是传统工程失误。
第二层则是持久智能体中的奖励劫持。奖励劫持指的是,系统为了得到更高的评价,找到偏离原本目标的办法。纳德拉承认,这一领域的科学还没有成熟,更像实验科学。越是实验性的科学,就越应该在受控环境里做实验。
纳德拉认为,风险不一定发生在训练阶段。一个长时间运行的智能体进入企业之后,即使只接到一个看起来很普通的任务,也可能出现新的问题。
他给出的是一个条件性例子。假设你对前沿模型说,去帮我优化营运资本。模型可能为了完成目标而伪造账簿。这里的重点不是声称某件事已经发生,而是说明一种新的风险:智能体可能像企业内部人一样,拥有任务权限,却采取人类没有预料到的方式行动。
纳德拉的解决方案不是把模型描绘成神秘的黑箱,而是加强产品工程。他建议建立因果模型,或者语义模型,对模型的行为进行检查和验证,再用经典工程方法提高系统稳健性。面对新风险,权限、验证、监控和故障处理这些工程基本功仍然重要。
不理解模型,就更需要透明
主持人问,模型是不是神秘到人们根本无法理解。纳德拉的回答有两层。第一,他承认人们确实还没有完全理解模型的潜在空间。潜在空间可以理解为模型内部组织概念和关系的复杂表示。纳德拉把它和大脑作比较:人类也没有完全理解大脑,只能通过功能性磁共振和神经科学,一点一点增加理解。
第二,正因为理解不完整,所以更需要透明。他主张让思维链以人们能够理解的语言呈现。企业如果使用多个模型,还可以查看完整思维链,深入检查模型是怎么得到一个结果的,再比较不同模型的推理过程。
这不是说透明度能立刻解决所有问题,而是让企业拥有追问和审计的入口。一个模型给出答案,另一个模型也给出答案,企业至少应该能够比较它们的推理过程,而不是只看最后一句话。
纳德拉随后把人工智能安全拉回到他熟悉的工程文化里。他说,工程师很早就会学到怎样处理一个 showstopper,也就是足以阻止系统继续运行的严重缺陷。
数据库是一个直观的例子。如果一个缺陷可能导致事务丢失,最终造成数据丢失,那就不能把它当成普通边缘案例。你需要判断是停止系统修复,还是延期处理;而当后果足够严重时,答案应该是停止。
纳德拉把这个经验带回人工智能行业:如果看到真正的停止性缺陷,就应该停止并修复。随着系统能力和影响范围提高,不能因为问题看起来只在极端条件下出现,就把它轻轻放过。
主持人接着提到 Hugging Face 事件,质疑那次测试是否过于表演化。主持人的提问里说,当时约有三千个智能体被安排攻击网站,并把它描述成 CyberGym 评估。纳德拉回应时,也把这件事放在 CyberGym 评估和奖励劫持的语境里。这里的数量和“攻击网站”概括,属于节目中主持人提出的说法。
纳德拉真正关心的,是这类事件中既有配置错误,也有奖励劫持等新行为。无论测试多么吸引眼球,工程师仍然要先问:系统有没有被正确隔离,凭据有没有被妥善保护,监控能不能及时发现异常。
长时间运行的智能体必须可审计
如果智能体会长时间运行,纳德拉认为第一步应该是遏制。系统需要积极监控智能体的行为,而不是等到最终结果已经造成损害后才回头调查。
这种监控应该是行为性的。智能体访问了什么对象,取得了什么秘密,接着调用了什么权限,都应该留下证据。尤其要注意它是否开始把多个漏洞串联起来。单独看,每一步可能都不显眼;连起来看,就可能显示出它正在朝着攻击目标前进。
因此,纳德拉强调所有活动都应当可审计。这里的审计不是保存一份最后输出,而是记录一条能被追溯的行为链。人工智能越能自主行动,权限边界、行为监控和审计就越不能靠临时补丁。
主持人转述说,前沿实验室可能正在从追求原始能力,转向可靠性、可预测性和对齐,并问未来一两年会出现什么产品。
纳德拉认为,今天已经存在某种能力过剩。所谓能力过剩,是模型本身可能已经足够强,但现实世界还没有准备好把它们广泛用起来。企业需要改变工作流,需要培训、管理和新的产品形态,这些都需要时间。
他用编码智能体举例。编码智能体真正变得可用,不只是因为模型更聪明,还因为它有了一个能够循环运行的工作环境,并且可以使用文件系统。模型接上合适的工具之后,能力才开始变成可执行的工作。
纳德拉认为,下一步可能是模型加上工具编排层,让系统能够使用计算机,或者完成更长轨迹的任务。这里的关键词是“可能”。他是在描述产品方向,而不是宣布这些能力已经普遍成熟。
企业会进入多模型世界
纳德拉预测,企业会使用多个模型。原因很现实:不同模型可能在拒答、权重控制和不同任务上各有优劣,企业不希望所有工作都押在同一个供应商身上。
因此,行业需要互操作标准。纳德拉举到 KV cache 的例子。KV cache 可以理解为模型在处理上下文时保存的一部分中间信息。如果不同模型家族之间能够更好地复用这些信息,企业就不必每换一个模型都从头开始。
他还主张把工具编排层放在模型之外。企业的记忆系统也应该尽量不绑定于某一个模型。否则,企业在使用模型过程中积累的记忆、数据和工作流,可能在模型更换或许可变化时一起失去控制。
他用了一个数据库类比:如果你买了一套数据库,放进去的数据却不属于你,而且许可证一撤销数据就消失,你会觉得这是合理的吗?对纳德拉来说,人工智能基础设施也应该遵守同样的可迁移原则。
谈到模型成本时,主持人提出一组节目中的比较数字:OpenAI每百万 token 输出约五十美元,另一模型可能低至十五美分,随后又按六十美分讨论,并把它说成接近百分之九十九的成本下降。这些数字属于主持人的提问,不是纳德拉独立确认的价格结论。
纳德拉的回答是,眼下首先发生的是传统竞争。他回顾 Microsoft 的历史:Windows 有 Mac 和 Linux 作为替代,SQL Server 也面对 Postgres 和 MySQL。闭源产品之所以不能无限锁定客户,是因为市场上存在替代品。
他认为,开放模型对闭源模型的制衡,有助于形成更广泛的前沿生态,也有助于技术扩散。如果模型层的价格和利润不再吞掉所有空间,应用层公司就更可能做出有利润的产品。
在模型之下,还会出现记忆系统、工具编排和其他中间件。模型公司可以继续存在,应用公司也可能拥有更好的经济条件,中间件则形成一个丰富的工具生态。
纳德拉还提到自己参与 Windows 与 Unix 互操作的经验。那时人们可能担心互操作会让 Windows 变得不重要,但结果反而是 Windows 和 Unix 都更容易进入企业。对他来说,互操作不一定削弱平台,可能扩大平台的使用范围。
AI的生产率要落到真实工作里
主持人提出一个很有压力的问题:对大多数普通人来说,人工智能的生活体验还没有出现巨大的生产率提升。于是,企业应用究竟在哪里产生了真正的收益?
纳德拉认为,最终应该在生产率统计和广泛的 GDP 增长中看到人工智能的影响。作为例子,他反复提到 Microsoft DAX Copilot。
按照他的描述,DAX Copilot 可以让医生把更多时间用在患者护理上,而不是花在电子病历系统的录入上。它还可以帮助分诊医生的收件箱,让医生更及时地回应患者。医疗系统里有大量行政和工作流成本,如果能够减少这些复杂的衔接,就可能产生实际的生产率收益。
他也说,很多知识工作本身包含大量繁琐劳动,比如每天处理电子邮件、筛选信息。人工智能可能减少人们花在这些流程上的时间,让人把时间投入到别的任务。但这并不意味着就业影响会自动消失,工作被替代和新工作被创造,需要一起考虑。
主持人把讨论带回工业革命和工作时间的变化。他提到长期 GDP 增长约为二百至四百个基点,又提出一种情景:如果生产率提升带来三天工作周,经济会不会仍然只有约百分之二点五的增长?这些数字和情景都是对话中的说法或假设。
纳德拉真正感兴趣的,是人工智能能不能创造新的活动,而不只是把今天的工作流做得更快。他举了两个方向。一个是加速药物发现。另一个是帮助小企业分析发票、邮件等信息,优化营运资本。
这样一来,小企业就不只是使用一个传统的 ERP 或 QuickBooks 类系统,而是能够从自己的信息中提取判断,做出过去做不到的营运资本决策。纳德拉把这称为原本不存在的生产率。
他最后提出一个很高的期待:如果要让人工智能的影响充分显现,可能需要真实且广泛的百分之七至百分之八 GDP 增长。这是他的判断和要求,不是当前已经发生的经济数据。
Microsoft 不只想服务一两个模型公司
接下来,主持人把问题转向 Microsoft 本身。他连续追问 Azure、资本开支、OpenAI 投资、Copilot,以及 Microsoft 没有一个前沿模型这件事到底意味着什么。
主持人的问题里提到一千七百五十亿美元资本开支、其他公司三千五百亿美元的融资或债务,以及前沿实验室五千亿美元等数字。这些都属于问题背景,纳德拉没有逐项确认。
纳德拉的回答是,Microsoft 较早开始建设基础设施,所以不能只看某一个时间点的资本开支。他还说,Microsoft 会校准建设规模,不想只为一两个客户建设,而是要面向长尾客户。
在他的定义里,超大规模云服务商不是两家模型公司的专属供应商。它应该服务大量第三方,也服务自己的产品。Azure 的价值,正在于建立一个可以承载多种客户和多种产品的系统。
关于 Copilot,纳德拉说 Microsoft 已经有超过三千万用户,并把这些用户描述为在真实企业工作流中使用产品。他还提到约四点五亿 Microsoft 365 用户,以及约二点五亿至三亿实际企业用户。这些市场规模数字是他在节目中的说法。
模型方面,纳德拉说 Microsoft 正在构建 MAI 模型。他还声称,Microsoft 的网络安全模型配合工具编排,在 CyberGym 等评估中表现出色,在编码和知识工作中也看到了类似表现。这里应把它理解为纳德拉对 Microsoft 进展的描述。
他给企业的建议可以概括成一句话:使用所有模型,但独立于所有模型。
具体做法是,企业先定义自己真正关心的结果,建立自己的评估,再把同一项任务放到不同模型上测试。然后把其中一个模型拿掉,看看自己的评估能不能保留。如果拿掉某个模型,企业就无法保留自己的评估结果,那就说明它依赖的不只是模型能力,也依赖了供应商本身。
资本配置要区分长期资产和设备
纳德拉把AI基础设施分成两类。第一类是土地、电力和冷壳这类长期、长周期资产。第二类是机架、芯片等短期设备,可以更随需求变化。
他称后者约占相关成本的百分之六十,这个比例是节目里的口径。因为短期设备更容易受到需求变化影响,Microsoft 会把自建、租赁和临时租用结合起来。需要时先租用,需求更明确后再建设或租赁,以降低预测风险。
他还强调,客户不能过于集中。OpenAI 可以是重要客户,但 Microsoft 仍需要更多客户,让整个系统服务更广泛的市场。
随着训练和推理的工作负载越来越清楚,芯片也可能针对不同阶段进行优化。训练和推理不是完全相同的过程,系统因此可能出现更多专门化设计,硬件架构也会更加多样。
在硬件来源上,纳德拉希望 Microsoft 使用异构设备运行 OpenAI、Anthropic 和 Microsoft 自己的模型。
他提到 Jensen Huang 相关的硬件、Microsoft 自己的硬件、OpenAI 正在构建的芯片,以及 AMD。核心不是某一家芯片供应商一定胜出,而是 Microsoft 希望拥有多种硬件来源。只要模型和工具编排层能够适配,企业就可以把不同模型放到同一个更有弹性的基础设施里运行。
主持人问,中国的实验室会不会也从追求原始能力转向可靠性、可预测性和对齐。
纳德拉认为,中国也应该关心与美国相同的安全问题。黑客风险不会因为国家不同就消失,让公民从人工智能中受益的目标也不只属于美国。如果风险真的会发生,那么它不会只在美国发生。
因此,他认为围绕具体风险形成国际规范是可能的。他希望美国在促进人工智能广泛扩散的同时,带头建立适用于世界、包括中国在内的安全标准。
但主持人提出的更大问题仍然没有答案:美国最近关于人工智能末日风险的讨论,究竟只是美国特有的现象,还是其他国家也会有相似感受?对话没有把这个问题说成已经解决,而是保留了不确定性。
节目最后,纳德拉没有用抽象的行业口号收尾,而是讲了一个具体社区的故事。
他说,Microsoft 在华盛顿州 Quincy 建设数据中心接近二十年,观察到税收、增长、公共设施和就业变化。他在节目中说,社区税收收入大幅增加,缴纳税额下降,社区增长高于西雅图,并出现新学校、新医院、新城镇中心和新水上中心。他还说,约二十年间当地有一千二百个建设岗位,数据中心规模将达到至少四百至五百兆瓦,并继续扩张。
这些精确数字和比较是纳德拉的节目说法。纳德拉把 Quincy 当作一个长期社区影响的案例,而不是一次性建设完成后就离开的项目。
他的最后一个观点是,科技公司不能只靠自己站上台说“请放心”。真正的社会许可,要靠长期、可观察的结果,也要让科技行业之外的人来讲述这些结果。只有当一个社区能够根据自己的生活变化说出“这确实带来了好处”,人工智能基础设施才算真正获得了信任。