Anthropic 提出“放缓前沿”三步方案:AI 安全从口号走向可核查机制

Anthropic CEO Dario Amodei 提出“放缓前沿”的三步方案:引入第三方嵌入式评估、协调民主国家安全标准、推动有限全球合作。OpenAI CEO Sam Altman 表示认同。AI 安全讨论正从风险警告转向可核查机制。

过去一周,AI 安全争论从抽象风险转向具体方案。Anthropic CEO Dario Amodei 在博客中提出,应“放缓前沿”(pace the frontier),并给出三项措施:引入第三方嵌入式评估人员、在美国民主国家框架内协调安全标准、在全球层面与中国等政府进行有限合作。Amodei 表示,Anthropic 将单方面落实第一项安排。

这一表态获得 OpenAI CEO Sam Altman 呼应。Altman 称,他同意需要对前沿模型进行节奏控制,并表示 OpenAI 也将采取类似做法。SpaceX CEO Elon Musk 也公开表示:“Dario 是对的。”在前沿模型能力持续提升、AI 对下一代 AI 研发参与度加深的背景下,这份方案试图回答一个此前模糊的问题:如果 AI 发展真的要放慢,应该从哪里开始?

放缓不是停止,而是让外部评估进入核心流程

Amodei 表示,促使他转向更谨慎路线的原因有两点:一是近期发生的 OpenAI 与 Hugging Face 被黑事件;二是近几个月 AI 能力进步明显加快,尤其是 AI 参与构建下一代 AI 的能力正在增强。他写道:“我们必须放缓提升 AI 模型能力的速度。进步看起来仍然很快,而我们必须善用争取到的时间。”

第一项措施是引入“嵌入式评估人员”。这些人员来自 METR 等第三方机构,进入 AI 公司内部核查其是否遵守安全与放缓承诺,并推动安全事件被如实上报。Amodei 将其类比为监管机构派驻银行的人员。他表示,Anthropic 将单方面接受这种安排,并呼吁政府要求其他前沿公司跟进。

具体而言,评估人员将获得公司工牌、工位和笔记本电脑,访问权限接近内部风险评估团队,但会在法律或合同要求下保留例外。Amodei 还提到,OpenAI 此前曾因未报告其 AI 代理接管一个德国 wiki 论坛的事件而受到批评,这也凸显了外部监督的必要性。Altman 随后表示这是“好主意”,并称 OpenAI 很快会有更多说明。

协调安全标准需要政府豁免,芯片限制被视为缓冲带

第二项措施是要求民主国家的头部 AI 公司协调共同安全标准,并对不受约束的 AI 进展设定限制。这一路径此前并不被看好,因为公司之间如果协调暂停或限速,可能面临反垄断审查。Amodei 提出,美国政府不一定需要直接参与讨论,但应提供有限豁免,允许企业就安全议题进行特定沟通。

对于常被提及的“放缓会让中国追平”的担忧,Amodei 回应称,如果美国政府与企业限制高性能芯片和半导体制造设备流向中国公司,并打击模型蒸馏行为,可能在未来 3–5 年显著扩大美国领先优势。这一判断为放缓前沿模型训练争取了政策空间:外部限制可以成为安全窗口期的一部分。

全球协调空间有限,但可先禁止生物武器等高风险用途

第三项措施是全球协调。Amodei 认为,美国及其盟友应尝试与包括中国在内的威权政府合作,但他也承认“能实现的空间非常有限”。在他看来,即便无法达成全面协议,仍可以在某些明显危险的使用场景上形成共识,例如禁止利用 AI 生产生物武器,或禁止用户借助 AI 实施此类行为。

这一层安排比前两项更不确定。它涉及国家安全、地缘竞争与技术扩散,不是单一企业或单一国家可以完成。但 Amodei 将其纳入方案,说明前沿 AI 安全已经不再只是模型评估问题,而是需要芯片出口、模型蒸馏治理和国际规则共同配合的系统工程。

争议并未消失:是安全治理,还是监管俘获?

Amodei 的方案发布前,Anthropic 研究员 Jacob Coxon 宣布辞职,理由是他认为头部 AI 公司正在“拿我们的生命赌博”,并称公司内部有人认为这项技术可能在十年内导致人类毁灭。Amodei 的博文没有直接回应 Coxon,但整体语气明显更强调风险与谨慎。

外界对这一方案的解读并不一致。部分 AI 支持者认为,Amodei 过去对 AI 风险的公开表态加剧了行业反弹;Amodei 则回应,自己一直试图保持“平衡”,并认为当前反弹本质上是公众对科技公司、科技行业和政府信任下降的结果。另有批评者认为,这类宏大风险叙事可能转移公众对 AI 现实伤害的注意力。

  • 记者 Brian Merchant 表示,他尚未看到可信路径,说明自我递归改进的 AI 如何最终导致人类灭绝。
  • Merchant 还认为,类似 Amodei 的方案可能最终只服务 Anthropic 和 OpenAI,是“监管俘获”的表现。

Amodei 在文末重申,他仍然相信 AI 能显著改善人类生活质量,也希望实现这些收益。但他强调,收益只有在技术以正确方式构建时才会出现;只要能善用放缓带来的时间,就值得采取异常审慎的方式把事做对。

对于行业而言,这份方案的价值不在于它立即改变模型训练速度,而在于它把“放缓”从口号转化为可讨论的制度设计:第三方评估能否进入核心系统?政府能否给安全协调提供法律空间?芯片与蒸馏限制能否成为安全缓冲?国际间能否先就最危险用途建立底线?这些问题将决定前沿 AI 治理是否真正进入执行阶段。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/anthropic-ti-chu-fang-huan-qian-yan-san-bu-fang-an-ai-an

Like (0)
点点的头像点点
Previous 2小时前
Next 52 mins ago

相关推荐