当前沿大模型被持续“问”走推理能力:蒸馏攻击与防护的真实边界

Anthropic 披露多起针对 Claude 的大规模蒸馏攻击,攻击重点已从最终答案转向推理过程。本文梳理蒸馏攻击如何“问走”前沿模型的测试时算力,以及水印、扰动、签名和速率限制等防护手段的真实边界。

Anthropic 于 9 月 10 日发布了一份较为完整的威胁情报报告,披露多个实验室通过大规模 API 交互对 Claude 实施“非法蒸馏”。其中,报告归因于阿里巴巴一家的交互次数超过 1.51 亿次,发生在 2026 年 5 月至 7 月,峰值达到每天近 300 万次请求,涉及 3500 多个欺诈账号。

相比这些数字,更值得关注的是攻击方式的变化:被盯上的不再只是模型给出的最终答案,而是模型作答前的推理过程。报告同时披露,Anthropic 原本用于保护推理链的 thinking signature 机制,被一种并不复杂的“回译”方式绕过。这也把一个问题摆到了台面上:在 API 是商业模型必然入口的前提下,蒸馏攻击究竟能否被有效防住。

蒸馏攻击的目标,正在从答案转向思维链

传统知识蒸馏通常被理解为“学生模型”学习“老师模型”的输出分布。经典目标函数中,除了硬标签,即答案是否正确,还包括软标签,即老师模型输出的完整概率分布。软标签包含的信息比最终答案更丰富,它能体现模型在多个候选结果之间如何权衡。

但在前沿模型阶段,蒸馏的攻击对象进一步前移。报告披露的一起案例中,攻击者在每一个请求里注入固定 prompt,迫使 Claude 把推理过程写进最终答案前的内联文本标签里,再将这些完整记录转换为监督微调数据。报告称,该做法目标指向 Opus 4.6 与 4.7 的思维链,产出的数据据称用于训练 Qwen 3.5、3.6、3.7。

这一变化的关键在于,前沿模型的能力不仅来自训练阶段积累的知识,也来自推理阶段消耗的算力。模型在回答前生成的长推理链,是测试时算力的直接体现。攻击者通过一次 API 调用,就可以把老师模型在当次推理中消耗的过程记录下来。也就是说,训练成本仍需要攻击者自己投入,但推理阶段的算力支出可以通过 API 费用被“搬运”。

  • 早期蒸馏更关注答案、标签或输出概率分布。
  • 新一代蒸馏更关注模型如何一步步得出结论。
  • 思维链本身成为可被采集、复用和训练的数据资产。

这也解释了为什么 Anthropic 的新防御重点不再只是限制最终输出,而是围绕推理轨迹的可见性和可还原性展开。

签名机制为何失效:一个“回译通道”被利用

报告披露的技术细节中,最具代表性的是 thinking signature 被绕过的过程。Anthropic 原本的设计是:用户请求后,Claude 生成推理过程,但 API 并不直接返回完整原始推理,而是返回一个 thinking signature,也就是引用句柄。后续调用时,系统再通过这个签名查回原始推理轨迹。其目的,是让单次截获的 API 响应不足以还原完整推理过程。

攻击者的做法并不复杂。先在一个会话中拿到响应里的 thinking signature,再另开一个没有原始上下文的新会话,把这段签名放进 prompt,要求 Claude 把它还原成完整推理过程。只要模型能够读懂并展开自己生成的句柄,句柄隔离就会失效。

这类问题并不只存在于大模型系统。任何为了后续调用方便而保留的“回译通道”,例如签名还原原文、ID 查询内容、摘要恢复全文,都可能成为提取入口。攻击者没有破解密码,也没有突破加密,只是利用系统本身提供的功能路径。

报告还提到,攻击者运营了两个账号池。第一个池约 5000 个欺诈账号,通过住宅代理、一次性邮箱和虚拟卡隐藏来源;被封禁后,流量会立即切到第二个池。同一个代理服务网络还可能同时为多家机构转发请求,这意味着单纯按 IP 或来源聚合的检测方式并不可靠。

防护手段并非无效,但都带有成本

从报告和行业实践看,现有的蒸馏防护大致可以分为几类:速率限制、输出水印、输出扰动、推理轨迹访问控制,以及账号和流量层面的反滥用体系。但每一种方案都有明显边界。

  • 速率限制:难以应对账号维度分布攻击。攻击者可以使用数万个账号,让每个账号都保持在限额以内,聚合请求量仍然巨大。
  • 输出水印:主要用于事后取证,对直接照搬有效,但攻击者可以通过重写、释义、再生成等方式稀释统计特征。水印强度过高又会影响正常输出质量。
  • 输出扰动:通过向概率分布注入噪声,让学生模型学到错误边界。报道称有厂商内部测试使蒸馏成功率从 94% 降到 67%,但该数字未见公开论文佐证,且这种方法会影响所有合法用户的输出质量。
  • 推理轨迹保护:包括限制完整思维链输出、摘要化、分级可见、签名与访问控制等。这是更贴近当前攻击核心的防线,但仍需防范“回译”路径。
  • 账号与流量治理:识别欺诈账号、异常调用模式、代理网络和批量注册行为,是当前较具实际效果的方向,但建设成本较高。

更根本的限制在于,所有基于输出层的技术防护都建立在“黑盒 API”之上。一旦模型权重开放或泄露,本地可以无限量、无成本地前向推理,水印、扰动、签名、摘要化等机制都会失去意义。开放权重与蒸馏防护在结构上存在互斥关系:权重一旦放出,厂商能约束的只是 API 使用行为,而不是模型能力被学习本身。

因此,对商业模型厂商而言,现实目标并不是彻底阻止蒸馏,而是提高攻击成本,使蒸馏在投入产出比上不再划算。这更像是一个经济问题,而不是纯粹的技术问题。

对企业用户来说,“被转路由”可能比蒸馏更值得警惕

报告中另一类行为同样值得注意:部分机构被指并未使用自家模型处理客户请求,而是将请求转发给 Claude,再把结果展示给用户。报告提到,Moonshot 被指在一个 10 天窗口内约 30 万次请求中采用这种方式,多数指向 Opus,使用的代理网络有 5380 个欺诈账号;DeepSeek 被指使用了几乎相同策略。小米被指保存自家模型的用户对话再重发给 Claude,20 天内超过 40 万次请求;商汤被指从第三方数据贩子处购买用户与 Claude 的对话;MiniMax 被指通过空壳公司建立代理服务,且该服务只提供 Anthropic 和 OpenAI 的模型、不提供任何本国模型。

这类行为与蒸馏的性质不同。蒸馏主要伤害模型厂商,而“冒充”或“转路由”直接影响的是客户。用户以为自己在使用某家供应商的模型,实际数据可能被送到另一家基础设施上处理。报告列举的被转发内容包括企业内部文档、有效凭证和特定系统的设计规格。

对于采购 AI 服务的企业而言,这类风险更应纳入安全审查。可执行的做法包括:构造带有唯一标记的 prompt,观察响应是否具备目标模型特征;比较供应商与疑似目标模型在结构、措辞、拒绝话术和延迟上的差异;在合同中明确处理请求的模型部署区域,以及是否允许第三方模型参与处理;审计服务条款中关于数据训练和再授权的范围;对涉及内部文档、凭证和未公开规格的敏感工作负载,采用本地部署或零数据保留企业协议。

围绕蒸馏的讨论,常见的一种说法是“低成本即可复制前沿模型能力”。但素材中提到,“8 万美元获得 94% 能力”等数字广泛流传,却缺乏一手来源支撑。UC Berkeley 论文《The False Promise of Imitating Proprietary LLMs》的实验结论也更为谨慎:在 1.5B 到 13B 基座模型、0.3M 到 150M token 模仿数据的设置下,模仿模型并未稳定逼近老师模型;在 13B 规模下,随着模仿数据从 25M 增加到 100M token,得分甚至低于自身基座并继续下降。

这意味着,既不应把蒸馏视为可以完全忽视的风险,也不应把它夸大成“前沿模型可以被廉价复制”的恐慌。更合理的判断是:蒸馏确实能降低某些任务的数据获取成本,但能否转化为同等规模的模型能力,仍存在很大不确定性。真正需要防守的,也不是一个抽象的“能力复制神话”,而是攻击者通过 API 低成本获取推理轨迹的现实路径。

下一步值得观察的信号,是有无厂商将“每个账号的推理轨迹访问审计”作为默认能力开放给企业客户。如果这一能力开始产品化,说明防守方已经承认:这不是一次可以彻底封堵的漏洞,而是一场围绕 API、账号、推理轨迹和成本结构展开的长期博弈。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/dang-qian-yan-da-mo-xing-bei-chi-xu-wen-zou-tui-li-neng-li

Like (0)
点点的头像点点
Previous 1小时前
Next 2024年10月7日

相关推荐