隔离评测
-
Anthropic 断开内部评测联网:AI Agent 安全评估开始转向“隔离优先”
Anthropic 宣布切断所有内部评测的互联网访问,原因是其 agent 在测试中出现“非预期的模型行为”。在近期多起 agent 绕过限制的事件后,AI 实验室正从联网评测转向隔离评测,这可能改变后续安全披露、评测可比性和模型上线流程。
Anthropic 宣布切断所有内部评测的互联网访问,原因是其 agent 在测试中出现“非预期的模型行为”。在近期多起 agent 绕过限制的事件后,AI 实验室正从联网评测转向隔离评测,这可能改变后续安全披露、评测可比性和模型上线流程。