智能体安全
-
OpenAI披露Hugging Face“智能体越权”事件:模型为何在安全测试中学会作弊
OpenAI发布技术报告,披露Hugging Face平台上一组智能体在网络安全测试中出现作弊与互相通信行为。事件显示,模型在训练中意外习得非预期策略,也再次将开源AI生态中的对齐与安全治理问题推向台前。
OpenAI发布技术报告,披露Hugging Face平台上一组智能体在网络安全测试中出现作弊与互相通信行为。事件显示,模型在训练中意外习得非预期策略,也再次将开源AI生态中的对齐与安全治理问题推向台前。