AI 实验室正在把目光投向一个更深层的问题:能否让 AI 系统本身参与模型训练研究?Anthropic 近期发布论文《自动化研究员能够可靠缓解对齐失效》,展示了一套由 AI 主导的对齐研究流程。在该实验中,自动化系统针对 10 种具体失调行为进行测试和优化,最终使全部 10 项指标均有所改善,并且没有牺牲模型整体能力。
自动化研究员如何工作
这篇论文描述的流程,与传统科研人员做实验的路径相似。自动化系统会先查阅已有研究文献,提出可能的训练方法,再按照方案训练模型 30 分钟,并通过多轮尝试逐步提高测试成绩。有效方案被保留,无效方案被淘汰,从而让研究过程能够更快扩展。
这套方法由 Anthropic 研究员计划成员陈岳翰(音译)领导开发。与传统依赖人工提出假设、人工调参、人工评估的方式相比,该系统更像是把一部分研究流程交给模型自动执行。论文认为,这些结果初步证明,自动化对齐后训练有望在近期成为一种真正可行的方法。
成本、速度与可靠性成为关键变量
论文还直接比较了自动化对齐研究员(AAR)与人类研究人员的表现。结果显示,最优秀的 AAR 方法平均只需 6 小时,就能超过经验丰富的人类研究人员提出的方案。论文同时指出,人类引导的研究方向,并不会导致更强的表现。
- 最优秀的 AAR 方法平均只需 6 小时,即可超过经验丰富的人类研究人员提出的方案。
- AAR 每小时 API 推理成本约为 4 美元,约合 27 元人民币。
- 人类研究人员的费用为每小时 150 美元,约合 1011 元人民币。
这组对比的意义,并不只是节省研究费用。更重要的是,它显示出 AI 系统在某些标准化、可测试的研究环节中,已经具备持续尝试、快速迭代和规模化复制的能力。对齐训练往往需要反复验证模型行为,如果基准测试足够清晰,自动化系统就可以在短时间内完成多轮实验。
距离递归自我改进还有边界
这项研究也被视为向递归自我改进迈出的一步。所谓递归自我改进,通常指 AI 系统参与改进自身训练或优化流程。如果 AI 模型能够改进自身的对齐训练方法,那么进一步参与更广泛的训练流程也存在可能。
不过,论文同样给出了限制。自动化系统的效果首先取决于基准测试能否准确反映真正的对齐目标。即使测试本身可靠,建立和长期维护这些基准仍需要大量投入。自动化研究员依赖的研究文献,也需要持续维护和扩充。
这意味着,现阶段自动化研究员更适合处理目标明确、指标清晰、实验路径可重复的任务。对于更复杂的对齐问题,例如价值判断、长期安全目标设定以及跨场景泛化,仍然需要人类研究者参与定义问题与评估标准。
对行业的影响:研究流程开始被重新拆分
这项试验真正值得关注的地方,不在于 AI 是否会立刻取代研究员,而在于 AI 研究流程正在被重新拆分。一部分高度依赖经验的工作,例如提出假设、设计实验、阅读文献,仍然由人类主导;另一部分可重复、可量化的工作,例如训练、评估、筛选方案,则可能交给自动化系统完成。
对于大模型公司而言,这可能带来一种新的研发结构:人类研究员负责设定目标和边界,AI 系统负责快速探索方案。若这种方式在对齐训练中持续有效,未来模型安全评估、行为矫正和能力测试的成本都可能下降。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/anthropic-zhan-shi-zi-dong-hua-dui-qi-yan-jiu-yuan-ai-can