推理链保护
-
当前沿大模型被持续“问”走推理能力:蒸馏攻击与防护的真实边界
Anthropic 披露多起针对 Claude 的大规模蒸馏攻击,攻击重点已从最终答案转向推理过程。本文梳理蒸馏攻击如何“问走”前沿模型的测试时算力,以及水印、扰动、签名和速率限制等防护手段的真实边界。
Anthropic 披露多起针对 Claude 的大规模蒸馏攻击,攻击重点已从最终答案转向推理过程。本文梳理蒸馏攻击如何“问走”前沿模型的测试时算力,以及水印、扰动、签名和速率限制等防护手段的真实边界。