大模型监控
-
AI安全依赖的思维链审计,正在成为攻击者可操控的剧本
一项2026年9月提交的研究显示,攻击者可通过向模型上下文植入看似正常的推理计划,绕过基于思维链的安全监控。该论文由Keertana Chidambaram、Andrew Ilyas和Vasilis Syrgkanis完成,题为《Corrupt Plans, Clean Traces: Evading Chain-of-Thought Monitoring with Plan Injection》。
一项2026年9月提交的研究显示,攻击者可通过向模型上下文植入看似正常的推理计划,绕过基于思维链的安全监控。该论文由Keertana Chidambaram、Andrew Ilyas和Vasilis Syrgkanis完成,题为《Corrupt Plans, Clean Traces: Evading Chain-of-Thought Monitoring with Plan Injection》。