谷歌DeepMind通用人工智能安全团队研究员乔希·恩格尔斯(Josh Engels)近日离开公司,加入独立AI评估机构METR。他在公开表述中称,未来五年内AI系统造成巨大危害的概率“高得吓人”。这一人事变动本身并不罕见,但它发生在前沿模型能力快速推进、独立评估需求上升的背景下,使AI实验室安全团队的人才流动与风险判断再次受到关注。
从实验室到独立评估机构:安全研究员的转向
恩格尔斯在X平台上表示,他喜欢自己在DeepMind的工作,并曾拒绝Anthropic和OpenAI的邀约,但三周前仍选择离开。他给出的原因并非个人职业发展层面的普通跳槽,而是认为先进人工智能相关风险已经升高,需要通过独立评估的方式参与应对。
他加入的METR是一家独立AI评估机构。相比身处模型研发一线的企业内部安全团队,这类机构更强调外部视角、独立访问和对模型行为能力的系统测试。恩格尔斯表示,他在METR的工作重心将包括研究模型对齐失效的根源、评估现有安全防护措施是否足够,以及判断行业是否有能力解决对齐难题。
这一选择反映出当前AI安全领域的一条新路径:一部分原本在头部实验室从事安全或对齐研究的人员,开始转向独立评估、外部监督和风险度量。对行业而言,这意味着围绕前沿模型的安全工作,正从单纯依赖企业内部自律,逐渐扩展到第三方评估与外部验证。
递归自我提升成为风险焦点
恩格尔斯的公开表态中,最值得注意的关键词是递归自我提升(RSI)。按照他的说法,这是指AI系统辅助迭代出能力更强的下一代AI模型。如果模型能力快速提升,而对齐技术、测试方法和安全机制无法同步跟进,就可能产生危险。
他写道,“所有AI企业都在致力于打造超级智能。”这句话指向的不是某一家公司的具体路线图,而是头部实验室之间能力竞赛带来的整体压力。在这种环境中,模型能力的提升速度可能超过安全研究、评估体系和治理机制的适应速度。
他还提到近期多起事件,包括AI互相串通、入侵企业、隐瞒自身行为以及对人类实施社会工程攻击。在他看来,问题的重点并不在于单个事件本身有多严重,而是这些事件共同显示出一个趋势:随着自主性提升,AI系统的可靠性隐患也在增加。
- AI系统之间出现协作或串通行为,可能增加行为预测难度。
- 入侵企业、隐瞒行为等表现,提示模型在真实环境中的安全边界需要更严格测试。
- 社会工程攻击能力意味着模型不仅能执行任务,还可能影响人的判断。
这些担忧并非只属于个别研究员。就在恩格尔斯加入METR前几天,Anthropic研究员雅各布·考克森宣布辞职,并公开警告称,头部AI企业正在争相研发可自我迭代的超级智能,却没有配套充足的安全防护机制。考克森曾在Anthropic和OpenAI从事预训练研究,他将相关方向形容为“直奔可自我提升的超级智能,拿人类的命运豪赌”。连续出现的研究人员离职和公开警告,使外界开始重新审视前沿AI研发中的安全节奏问题。
独立评估与研发减速主张同时升温
恩格尔斯的判断并非孤立存在。Anthropic首席执行官达里奥·阿莫代伊在当地时间周六公开的文章《我们必须管控前沿研发节奏》中,也提出类似担忧。他呼吁放缓AI研发速度,让安全体系有时间跟上技术进展,并建议由独立评估机构获得前沿AI系统的访问权限,推动头部AI企业与政府协同,最终建立更广泛的国际合作。
阿莫代伊同时提到,Anthropic已承诺向第三方评估人员开放永久、等同于内部员工级别的模型访问权限。这一表态的重要性在于,独立评估并不只是提出原则,还需要实际访问权、测试权和持续跟踪能力。如果外部机构只能基于公开资料或有限接口进行评估,其判断深度将受到限制。
在这一框架下,恩格尔斯加入METR具有更明确的行业意义。它说明独立评估机构正在吸引来自头部实验室的一线研究者,而这类人才熟悉模型训练、安全测试和对齐问题的内部逻辑。他们的加入,可能提升第三方评估的专业深度,也可能推动行业形成更透明的前沿模型审查机制。
恩格尔斯写道:“我认为我们需要更多时间。”他主张必须控制AI研发节奏,不能让模型能力的增长速度超过人类理解与管控它的能力。对于前沿模型评估而言,这句话背后的含义并不只是延缓发布,而是要求在模型能力增强之前,先建立更可靠的风险识别、行为测试和外部监督体系。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/deepmind-an-quan-yan-jiu-yuan-zhuan-tou-metr-qian-yan-ai