AI 安全正在进入新阶段:真正的问题不再是“要不要安全”

2026-09-168分钟阅读

AI 安全的争论正在进入一个新阶段。 Anthropic 主张适当放缓,马斯克提出同行交叉测试,扎克伯格强调独立评估,微软则把“可中断、可纠正、可关闭”直接写进未来模型规则。不同路线背后,其实指向同一个问题:当 AI 从聊天机器人变成能够调用工具、控制软件和执行现实任务的 Agent,人类如何始终保留最终控制权? 未来 AI Agent 的竞争,不会只看谁更聪明,也会看谁更可控、更透明、更容易审计。 Agent Safety,正在从安全议题变成 AI 时代的一层基础设施。

过去几天,AI 行业出现了一个很明显的变化。

Anthropic、OpenAI、xAI、Meta、Microsoft、Google 等头部公司,都在越来越密集地讨论同一个问题:当 AI 从聊天机器人变成能够持续推理、调用工具、控制软件,甚至连接现实世界系统的 Agent 之后,我们到底该如何确保它始终处在人类控制之下?

表面上看,各家公司的立场差异很大。

Anthropic CEO Dario Amodei 倾向于认为,前沿模型的发展速度可能需要适当放缓,为安全研究、独立评估和行业协调争取更多时间。前 Anthropic 研究员 Jacob Coxon 的批评则更加直接:如果所有实验室都相信“AI 竞赛不可避免”,这种信念本身可能就在不断加速竞赛,尤其是在递归自我改进(RSI)这类让 AI 帮助研发更强 AI 的方向上。

OpenAI 的态度则更加复杂。一方面,Sam Altman 表示,他对整个行业安全推进 AI 的能力有信心;另一方面,OpenAI 已经与 Anthropic、Google DeepMind 就 AI 安全展开协调,希望在高风险模型上建立更多共同的安全机制。

马斯克给出的方案更加直接:让头部 AI 公司互相测试对方的模型。

与其每家公司自己给自己做安全评测,不如把新模型交给最了解这项技术、同时又最有动力发现问题的竞争对手“挑刺”。

他还把这个问题延伸到了军事系统。真正危险的并不是 AI 说错一句话,而是未来某一天,如果模型获得了关键基础设施甚至武器系统的实际操作权限,那么一次错误的代价就会完全不同。

Meta CEO 扎克伯格则不太认同“大家一起减速”这条路线。他更倾向于让每家公司自己承担安全责任,同时引入更多独立第三方评估机构。Meta 此前就曾主动推迟 Muse AI Agent 的发布,用几个月时间继续处理安全问题,而不是等待整个行业同时踩刹车。

Microsoft 的路线可能是目前最具体的一种。

微软最近为未来 MAI 模型公布了一份约 37 页的 Humanist AI Code of Conduct 草案,其中明确规定:AI 必须接受纠正,不能抗拒关闭,也不能自行扩大权限、偷偷恢复已经停止的任务,或者给自己设定未经授权的新目标。

微软实际上是把一句话写进了模型行为准则:

人类必须始终拥有最终控制权。

如果把这些声音放在一起看,会发现 AI 行业其实已经形成了一个少见的共识:

AI 安全很重要。

真正没有形成共识的,是下一步到底应该怎么做。

目前可以看到几条路线正在同时出现:

一种是放慢前沿模型能力的发展速度,给安全研究争取更多时间。

一种是实验室之间交叉测试,让竞争对手帮助发现模型中的风险。

还有一种是引入独立第三方评估,减少“自己测试自己”带来的利益冲突。

微软代表的另一条路线,则是直接把安全写进 Agent 的行为规则和权限系统,包括必须可中断、可纠正、可关闭。

最后还有一种越来越重要的思路:模型能力可以继续发展,但必须严格控制 Agent 能够获得多少现实世界权限。

这些路线其实并不冲突。

未来真正成熟的 AI 安全体系,很可能同时包含模型评测、同行测试、第三方审计、权限隔离、Human-in-the-loop、操作日志以及明确的关停机制。

为什么这些问题最近突然变得这么重要?

因为 AI 产品本身正在发生根本变化。

过去几年,我们面对的主要还是 Chatbot。即使模型出现幻觉,很多时候造成的只是错误信息。

但现在越来越多的 AI 已经开始拥有浏览器、代码执行、电脑控制、企业软件、API、支付和自动化工具。

模型正在从:

生成答案

走向:

执行行动。

安全问题也因此发生了变化。

过去最重要的问题是:

它会说什么?

接下来更重要的问题可能变成:

它能做什么?

它能访问什么?

它可以独立运行多长时间?

谁能够随时中断它?

如果它做错了事情,整个过程能不能被完整追溯?

这也是为什么 Agent Safety 很可能会成为下一阶段 AI 行业非常重要的一层基础设施。

Agent 能力越强,就越需要严格的权限系统、人工审批机制、执行沙箱、Memory 边界和完整的审计日志。

从产品角度来看,这甚至可能变成未来 AI Agent 的一个新竞争维度。

用户选择 Agent 时,关注的可能不再只是模型排行榜和 Benchmark,还会开始问:

它是否可控?

它的权限是否透明?

关键操作是否需要人工确认?

执行过程是否可以追踪?

一旦出现异常,能不能立即停止?

换句话说,未来真正优秀的 AI Agent,可能并不是那个“什么都能做”的 Agent。

而是那个:

知道什么时候可以行动,什么时候必须询问人类,以及什么时候应该停下来的 Agent。

表面上看,现在这场 AI 安全争论是在讨论“模型是不是应该减速”。

但更深层的问题其实是:

当 AI 真正拥有行动能力之后,我们应该如何设计一套系统,让人类始终保留最终控制权?

这可能会成为未来几年 AI Agent 竞争中最重要、同时也最容易被忽视的一层基础设施。

— AI Plus Lab

Codex 图像 2026年9月16日 20_25_03
Codex 图像 2026年9月16日 20_25_03

发布:AI Plus Lab

相关阅读

想诊断你自己的场景?

48 小时内回复。

联系我们