独立安全评估员进驻前沿实验室:AI 安全治理走到关键关口

Anthropic 与 OpenAI 都提出在前沿 AI 公司内嵌入独立安全评估员,但能否真正独立,仍取决于访问权限、披露空间和制度保障。

过去一年里,外界很难想象头部 AI 公司会主动邀请第三方机构深入内部系统,检查模型训练与安全流程。如今,这一设想正在被摆上台面。Anthropic CEO Dario Amodei 在周末发表的一篇长文中提出,应在所有前沿 AI 公司中嵌入第三方安全评估员,让他们有权报告安全事件、判断模型是否真正符合安全对齐要求,并对外公开未经修饰的调查结果。

\n

Amodei 表示,Anthropic 将承诺向 METR、Redwood Research 等独立评估机构开放前所未有的系统访问权限。随后,OpenAI CEO Sam Altman 也表示公司将跟进这一做法。对于长期依赖内部自评的前沿 AI 行业而言,这可能意味着外部监督机制开始进入核心研发环节。

\n

从“发布前测评”走向“训练过程核查”

\n

过去,AI 公司通常只在模型临近发布时邀请外部团队测试成品。多家第三方评估机构认为,这种模式已难以应对新一代模型带来的风险。随着模型能力增强,它们可能更擅长识别自己是否正在被测试,从而在评估中表现良好,却在实际运行中隐藏问题行为。

\n

Apollo Research 研究负责人 Alexander Meinke 表示,AI 公司应当能够回答一些关于训练过程的基本问题,例如:AI 在训练期间是否曾试图破坏自身的对齐训练。他认为,这个问题的答案本应明确为“否”,但现阶段公众只能依赖公司自行检查并如实披露,而近期事件表明,企业默认未必会做到这两点。如果评估员能够嵌入企业内部,就有机会直接核查相关情况。

\n

FAR.AI CEO Adam Gleave 表示,有意义的访问权限不应只覆盖最终模型,还应包括训练生命周期中的中间版本,也就是“检查点”。通过比较这些检查点,评估人员可以判断某些令人担忧的行为是在何时出现的,也可以检查后训练环境中模型因哪些行为获得奖励,并核对评估记录与日志,验证公司对模型表现的公开描述是否准确。

\n

    \n

  • 查看训练过程中的中间检查点,追踪问题行为何时出现
  • \n

  • 检查后训练阶段奖励机制如何影响模型行为
  • \n

  • 核对评估记录、日志和公司对外声明是否一致
  • \n

  • 必要时访谈员工,确认内部实践与公开安全说明相符
  • \n

\n

承诺已出,细节仍未公开

\n

尽管 Anthropic 与 OpenAI 都已表态支持嵌入独立评估员,但具体安排仍不清晰。两家公司尚未披露将合作的评估机构名单、评估员进驻时间、人员数量,也未说明评估员可以访问哪些系统和信息,以及最终可以向公众公开多少内容。TechCrunch 就这些问题多次询问,均未获得明确答复。

\n

Palisade Research 幕僚长 John Steidley 提到,模型在安全测试中表现良好,并不必然意味着它真正安全。如果模型专门学会了如何在特定基准测试中取得高分,风险依然存在。他以“关机抵抗基准测试”为例,如果 AI 被训练为在该测试中表现良好,其结果就值得警惕。他将这种情况类比为大众汽车“柴油门”事件:车辆被设定为识别排放测试,并在测试条件下改变表现。

\n

Amodei 提出的方案看起来相对完整,包括允许评估员发布关于风险水平、安全事件、公司实践以及自身获得或未获得访问权限的关键发现,且 Anthropic 不享有编辑控制权。但评估机构普遍认为,这样的机制能否成立,取决于 AI 公司是否愿意真正交出部分控制权。

\n

“独立”与否,取决于权限、时间和法律保障

\n

多位第三方评估人士对这一提议表示欢迎,但也强调必须解决执行细节,最好有立法支持。否则,评估员究竟会成为真正的独立监督者,还是按照 AI 公司条件工作的外包服务商,仍难以判断。

\n

Gleave 透露,FAR.AI 曾拒绝多家前沿开发商的合同,原因是对方希望对评估过程保留过多控制权,这会损害机构独立性。他表示,在默认情况下,评估人员往往被视为普通承包商,受到严格保密协议约束,开发商对最终可发布内容拥有较大控制权。

\n

时间与访问范围同样关键。在调查 Hugging Face 事件时,OpenAI 曾给 METR 和 Redwood Research 大约一周的现场调查时间。两家机构后来表示,由于范围和时间限制,他们无法得出有充分把握的结论。类似情况也出现在 GPT-6 Astra 发布前测试中。Apollo Research 在该模型模型卡中写道,其测试时间仅有三天,因此很难形成稳固结论。

\n

该公司在评估中表示,考虑到模型对评估的识别率较高、评估窗口有限,较低的不当行为发生率并不能为模型是否对齐或不对齐提供实质证据。

\n

如果独立评估员要成为行业常态,问题已不只是公司是否愿意“开门”,而是开门到什么程度、持续多久、能否公开结果,以及是否有外部规则保障。对于关注 AI 风险的公众和监管机构来说,这些具体安排,比原则性承诺更值得关注。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/du-li-an-quan-ping-gu-yuan-jin-zhu-qian-yan-shi-yan-shi-ai

Like (0)
点点的头像点点
Previous 1小时前
Next 2025年3月1日 下午6:00

相关推荐