4-bit 量化并非“免费午餐”:Agent 多步执行暴露隐性成本

4-bit量化在常规基准中分数稳定,但在Agent多步工具调用中,失败率最高可升至2.5倍。真正的问题不在总分,而在每一步的可靠性。

把一个大模型压缩到 4-bit,跑几个基准测试,分数几乎不掉——这几乎已经成为模型发布时的标准叙事。但最新的实验发现,一旦模型进入 Agent 场景,需要连续调用工具、处理多轮交互时,4-bit 量化带来的代价会迅速显形:任务总分看似不变,单步失败率却可能翻到原来的 2.5 倍。

问题并不在于量化“造假”,而在于评测口径不同。传统基准看的是“最后有没有做对”,而 Agent 真正消耗成本的地方,是“中间错了多少次”。当错误被重试机制吞掉之后,分数看起来依然平稳,但时延、token 消耗和潜在风险已经在上升。

显存账本:权重只是入场券

Meta 在 Muse Glimmer 的模型卡中提到,通过 4-bit 动态量化(K-Quant),可以把约 300 亿参数的模型压缩到 17–20 GB,从而运行在 24–32 GB 显存的消费级显卡上,并宣称对 Agent 任务“几乎没有性能损失”。

但从工程角度看,真正困难的并不是把模型权重塞进显卡,而是剩余显存如何分配。模型从 55 GB 压到 20 GB 后,一张 24 GB 显卡只剩下约 4 GB,需要同时承担随上下文线性增长的 KV 缓存、视觉编码器以及草稿模型等开销。

Muse Glimmer 的公开参数包括:52 层、隐藏维度 6656、32 个 Query 头,但只有 2 个 KV 头,原生上下文长度为 131,072 token。按文中估算,这种配置在长上下文下的 KV 缓存占用约为 2.8–3.0 GB,而同尺度全全局注意力模型约为 11.3 GB。

这项差异来自两项设计:

  • 2 个 KV 头,相比传统 32 个 KV 头压缩到 1/16;
  • 采用 [局部, 局部, 局部, 全局] 循环 13 次的混合注意力,只有 13 层需要保留完整 KV,其余 39 层只保留 2048 token 窗口。

换句话说,所谓“端侧长上下文 Agent”并不是靠简单堆显存实现的,而是通过限制多数层的远距注意力,并减少需要保留完整上下文的层数来完成的。

总分没变,失败率却在上升

韩国大学团队在 2026 年 7 月 29 日发布于 arXiv 的论文《Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents》中,对两个开源模型家族的 Dense 与 MoE 变体进行了测试,覆盖电信与零售两个领域,共 8 个单元、每单元 456 个回合,分别在 16-bit、8-bit 和 4-bit 权重下运行。

结果显示,按传统评分口径,8 个单元中没有任何一个单元的变化通过多重比较校正;在最严重的单元中,等价性检验也把变化界定在 ±7.5 分以内。也就是说,如果只看总分,4-bit 确实接近“无损”。

但当研究者记录每一次工具调用及其返回值后,情况发生了变化。量化并没有让模型产生大量新型错误,而是让既有错误重复出现。最明显的变化集中在“工具名幻觉”这一通道上,4-bit 下该通道的失败率从 19.5% 上升到 38.3%。

关键在于,工具调用的输出具有极强的结构刚性:字段名、类型、嵌套层级都必须准确。自然语言中个别 token 出错,语义往往还能自动修复;但 JSON 字段名或工具名一旦出错,就会直接导致调用失败。

错误预算掩盖了真实风险

τ²-bench 的每个回合允许最多 10 次失败工具调用,才会影响任务分数。这相当于给模型提供了一个“错误预算”,可以吸收量化带来的额外失败。

研究者将允许失败次数作为变量重新计算后发现:

  • 当错误预算为 10 时,BF16 与 INT4 的分数差约 1.3 分;
  • 当错误预算收紧到 2 时,两者差距扩大到 16.7 分。

这一差距只出现在量化确实增加错误量的单元中。也就是说,总分没有变化,并不代表模型没有受损,而是额外错误被宽松预算掩盖了。

对于涉及不可逆操作的 Agent 来说,这种掩盖尤其危险。转账、发送邮件、执行数据库删除等动作,并没有“重试 10 次”的空间。即使模型最终完成了任务,中间的失败调用也可能带来真实业务风险。

如何评估量化模型的真实可用性

论文给出的建议并不复杂。首先,在量化之前先用全精度模型跑一遍目标领域的失败通道统计。如果全精度下失败率本身偏高,4-bit 量化大概率会进一步放大问题。

其次,评测指标应从“任务是否完成”转向“每一步失败率”。对每一次工具调用进行通道级标注,可以更早发现量化带来的过程损伤。

第三,可以绘制“收缩预算曲线”,分别计算允许失败 1 次、2 次、5 次和 10 次时的成功率。如果高精度模型与量化模型在高预算下表现接近,但在低预算下明显分叉,就说明存在被掩盖的过程损伤。

另一个可行方案是定向修复提示。由于失败集合在不同精度下高度重合,模型可以针对已知错误通道进行自动诊断和重试。实验中,这种方式在电信领域的多个模型上显著降低了量化带来的额外失败。

此外,采样参数也会影响结果。MiniCPM5-2B 官方推荐 temperature=1.0、top_p=0.95,而较高温度会降低决策裕度,使量化噪声更容易导致输出翻转。如果同时使用高温采样和 4-bit 量化,低错误预算测试几乎是必要的。

行业意义:量化评价需要进入过程指标时代

这轮讨论并不是要否定量化。4-bit 在单轮问答、摘要、翻译等任务中仍然具有明显价值。真正的问题在于,过去“几乎无损”的结论大多来自单轮任务,而 Agent 场景对每一步可靠性都有更高要求。

对于端侧部署来说,未来更合理的路径可能不是“先做大模型,再压到 4-bit”,而是先在目标尺寸上完成蒸馏和训练,再根据任务风险选择精度。如果任务涉及复杂工具调用或不可逆动作,更小的模型加更高精度,可能比大模型强行 4-bit 更稳妥。

下一个值得关注的信号是:是否有 Agent 框架开始默认输出每步失败率。一旦这个指标进入常规日志,“几乎无损”的定义也会随之改变。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/4bit-liang-hua-bing-fei-mian-fei-wu-can-agent-duo-bu-zhi

Like (0)
点点的头像点点
Previous 1小时前
Next 2024年10月20日

相关推荐