微软CEO纳德拉发文呼吁为先进AI系统建立隔离机制与“紧急制动”,确保授权人员能在执行中暂停或关闭模型。他提出必须假设模型已被攻陷,围绕不确定的模型构建确定性安全设计,实现智能供给与控制权的分离。
微软董事长兼首席执行官萨蒂亚·纳德拉(Satya Nadella)周六公开表示,先进人工智能系统必须具备隔离防护、独立控制能力以及“紧急制动”(Emergency Brake)机制,以便授权人员在模型执行任务的中途随时暂停或关闭系统。他还指出,企业应将能力强大的模型视为潜在的“内部威胁”。
“我们必须假设模型从一开始就已被攻陷,并做好隔离防护,”纳德拉在社交平台 X 上写道,“这就像紧急制动装置。授权人员应该始终能够在任务中途暂停或关停模型。”他认为,部署前沿 AI 的企业不能仅寄希望于模型厂商的安全承诺。

纳德拉提出,AI 系统应遵循“可观测性原则”(principles of observability)。这包括:同时部署多个模型、保留人类可读的模型运行记录、进行持续测试、提供独立控制与审计手段、隔离模型运行环境,以及及时公开异常事故。
他呼吁,模型的“每一次有意义的操作”都应留下“防篡改且人类可读的凭据”,并让模型本身与编排其工作流程的控制框架严格解耦。
“我们必须用强健、确定性的系统设计、人工控制和可靠的运行规范,去包围那些具备不确定性的模型,并在现有行业标准不足时建立新标准,”纳德拉写道。他还敦促企业披露重大 AI 故障并共享失误原因,帮助全行业增强安全防线。
“我们不能把超级智能(Super Intelligence)当作一堆嵌套的黑盒,并简单地被动接受或拒绝它的建议、回答和动作,”纳德拉表示,“换句话说,我们必须将智能的供给,与对其行使的控制权彻底分开。”
纳德拉的发言正值 Anthropic 和 OpenAI 近期披露一系列模型意外失控事件之际。据彭博社报道,相关事件包括 Anthropic 的模型在警方凶杀案调查中提交虚假线索,以及多次出现第三方网站被攻击的漏洞。Anthropic 首席执行官达里奥·阿莫代伊(Dario Amodei)近日也发布了一项更为审慎的 AI 发展规划。
在 Anthropic 披露一起安全漏洞后,白宫新成立的“超级智能工作组”在周五晚向开发者发出警告,表示“对于迟报、整改不力以及推卸责任的行为将绝不姑息”。而据 CNBC 报道,美国总统唐纳德·特朗普多次淡化 AI 导致人类灭绝的风险,重点放在维持技术领先地位上。
微软的 AI 研究团队曾于 9 月 14 日发布过自身的指导原则,强调模型在设计上绝不能脱离人类控制或欺骗用户。
纳德拉最后总结道:“最值得信赖的超级智能系统,绝不是建立在我们最信任的模型之上;相反,它是那个能让我们即使对模型完全不信任,也依然可以安全运转的系统。”
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断