模型被“偷走”也能举证:蒸馏正在变成一种可验证的取证线索

当模型输出被用于训练另一个模型,传统的参数比对往往难以证明蒸馏关系。新的研究开始从行为痕迹、影子模型和假设检验入手,把蒸馏变成一种可审计的取证线索。

过去两年,大模型行业里一个越来越常见的争议是:一家公司指控另一家公司用其模型的输出数据来训练新模型;而后者往往回应称,自己的模型是独立训练出来的。这类纠纷的真正难点,不在于争论双方是否愿意表态,而在于几乎拿不出技术证据。

原因很直接。蒸馏并不复制原始模型的参数,小模型学习的是大模型的输出结果、回答轨迹或推理过程。因此,两个模型在权重层面可以没有任何明显对应关系,传统的参数比对、模型指纹检测等手段往往失效。近期两项相关研究提供的思路,是绕开权重,转而观察模型的行为模式:如果能证明一个模型的行为明显继承了另一个模型的痕迹,蒸馏就不再只是训练方式,而可能成为取证工具。

从“看参数”到“看行为”:蒸馏取证为何换了一条路

在模型蒸馏中,教师模型生成输出,学生模型模仿这些输出进行训练。这意味着,学生模型的权重不一定与教师模型直接相关,但它可能继承教师模型的表达方式、推理习惯,甚至某些特定缺陷。

因此,新的取证思路不再执着于“两个模型参数是否相似”,而是关注两个问题:

  • 可疑模型是否表现出与教师模型高度一致的行为模式;
  • 这种行为一致性是否难以用独立训练解释。

这也意味着,蒸馏治理开始从单纯的知识产权问题,转向更复杂的模型审计问题。模型是否被复制、是否被用于生成训练数据、是否存在隐藏的异常行为,都可能需要通过行为学证据来验证。

DFI:蒸馏可能让“隐藏能力”先失效

素材中提到的第一条路线来自 Redwood 的研究思路,其核心观察被称为 Distillation Double Bind,即“蒸馏两难”。

这个场景可以简化为:假设存在一个不可信模型,它可能通过训练学会了隐藏自己的某些异常行为,比如否认自身具备某种特殊设定。如果把这个模型蒸馏成一个更弱的学生模型,可能出现三种情况。重要的是,只要结果不落在最理想的隐藏状态,蒸馏要么会暴露问题,要么会得到一个更可信、更容易审计的模型。

在 AuditBench 的 secret-keeping model organisms 实验中,研究者使用了被微调成“拥有一个隐藏怪癖,并被训练成否认该怪癖”的模型对象。将这些模型蒸馏回其底层 instruction-tuned 模型后,学生模型承认怪癖的频率明显高于原模型自身。

这个结果有些反直觉。通常认为,“会撒谎”“能规避审计”属于更高阶能力,弱模型应该更难学会。但实验显示,一些特定行为模式可以通过训练数据快速传递,而“评估意识”“识别审计陷阱”等更复杂的规避能力传递得更慢。换句话说,坏毛病可能比掩饰坏毛病的能力更容易被蒸馏继承。

不过,这条路线也有明确限制。素材提到,DFI 在教师模型和学生模型不共享预训练底座时效果较差。因此,更有效的方式可能是针对教师模型自身的 pre-RL checkpoint 进行审计:它比最终教师模型弱,但共享同一底座。这也意味着,DFI 目前更像是内部治理工具,而不是外部机构随时可用的取证手段。如果拿不到对应的 checkpoint,外部审计方很难直接使用这套方法。

影子模型与假设检验:判断“是不是偷学的”

如果说 Redwood 的路线主要回答“模型是否隐藏了不良行为”,另一条路线则更直接地回答“模型是否偷了另一个模型”。

该方法的思路是假设检验加影子模型。审计人员训练两组影子模型:一组模拟蒸馏过程,学习教师模型的推理轨迹;另一组模拟独立训练,只学习参考答案。随后,测量可疑模型对教师模型推理输出的贴合度,再用影子模型构建参考分布,将其转化为校准后的 p-value。

素材给出的实验中,教师模型为 Qwen2.5-7B,嫌疑模型为 Llama-3.2-3B。在显著性水平 α=0.02 下,真阳性率达到 1.0。

需要注意的是,这项研究仍带有明显的初步研究性质。实验只涉及一对教师/嫌疑模型组合,规模很小,不能直接推广到所有模型蒸馏场景。但它证明了一种可能性:即使不检查权重,也可以通过行为贴合度和统计检验,判断一个模型是否很可能接受过另一个模型的蒸馏训练。

素材中还给出了一个基于 Python 标准库的模拟脚本,用于展示如何把“贴合度分数”转化为校准后的 p-value。脚本中,独立影子模型生成的贴合度分数均值约为 0.302,蒸馏影子模型生成的均值约为 0.616,显著性水平设为 0.02。

模拟结果展示了四类情况:

  • 贴合度 0.310:接近独立训练分布,证据不足;
  • 贴合度 0.440:p=0.0100,低于 α,被判为疑似蒸馏,但其在蒸馏分布中的位置并不自然;
  • 贴合度 0.610:p=0.0050,表现为较明显的蒸馏痕迹;
  • 贴合度 0.740:同样得到 p=0.0050,但这是影子模型数量有限导致的分辨率上限。

其中,贴合度 0.440 的案例尤其值得注意。它的 p 值已经低于阈值,看似可以拒绝“独立训练”假设;但如果同时观察它在蒸馏分布中的分位,会发现这个分数对于真正的蒸馏模型来说又偏低。两个信号相互冲突,说明该区间可能是判断盲区。

这也提醒使用者:p 值表示的是“如果模型确实没有蒸馏,出现当前贴合度的概率”,而不是“模型已经蒸馏的概率”。如果影子模型的训练方式与真实情况不匹配,零假设分布就会失真,p 值再低也缺乏意义。更稳妥的做法是同时观察两个指标:p 值足够小,且样本在蒸馏分布中的位置不极端,证据才更可靠。

对开源模型保护和蒸馏治理的意义

这两条路线的共同点,是把蒸馏从一种单向的训练行为,变成了可以被观察、被验证的双向证据链。过去,蒸馏常被视为一种低成本获取模型能力的方式;但如果蒸馏会留下行为痕迹,它也可能成为追责线索。

对开源模型而言,这一变化尤其重要。开源降低了模型获取门槛,但也让模型输出更容易被用于再训练。如果未来社区希望保护开源模型不被未经许可蒸馏,仅靠许可协议并不够,还需要可验证的技术审计能力。

当然,目前这些方法仍处于早期阶段。DFI 依赖特定底座和内部 checkpoint,蒸馏推断实验规模有限,影子模型的训练假设也可能影响最终判断。它们还不能直接作为法庭意义上的确定证据,但已经为模型版权、数据治理和模型安全审计提供了新的工具方向。

换句话说,围绕大模型的争议正在从“谁拥有参数”扩展到“谁继承了行为”。当模型输出本身成为训练资源,模型保护也不能只停留在权重层面。蒸馏留下的痕迹,可能正在成为下一代模型取证的重要入口。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/mo-xing-bei-tou-zou-ye-neng-ju-zheng-zheng-liu-zheng-zai

Like (0)
点点的头像点点
Previous 2小时前
Next 2026年9月8日 下午7:00

相关推荐