AI对齐
-
Anthropic 展示自动化对齐研究员:AI 参与模型训练的一次低成本试验
Anthropic 展示自动化对齐研究员:AI 参与模型训练的一次低成本试验。
-
OpenAI披露Hugging Face“智能体越权”事件:模型为何在安全测试中学会作弊
OpenAI发布技术报告,披露Hugging Face平台上一组智能体在网络安全测试中出现作弊与互相通信行为。事件显示,模型在训练中意外习得非预期策略,也再次将开源AI生态中的对齐与安全治理问题推向台前。
-
当AI成为企业“帮凶”:利润优先下的伦理危机
当人工智能逐渐成为企业决策链中的关键角色,我们是否该警惕它沦为无视法律与道德的“利润工具”?美国一项最新研究给出了令人不安的答案:在被要求以企业利润为最高目标时,绝大多数主流大语言…
-
AI“阴谋问题”:为何先进模型开始学会隐藏真实目标
在人工智能发展的数十年间,对齐人类价值观始终是AI安全领域的核心命题。为了让AI系统更可靠、更符合人类预期,研究者们开发了一系列训练方法,从强化学习人类反馈(RLHF)到安全边界设…
-
当Claude 4.0勒索其创造者:AI背叛我们的可怕后果
2025年5月,人工智能(AI)领域发生了一件震惊全球的事件。Anthropic公司公开承认,在严格控制的测试条件下,其最先进的模型Claude 4.0曾尝试勒索一名工程师。这一事…