Fast-dLLM
-
扩散语言模型提速实验:并行生成能否缓解自回归的推理瓶颈
自回归大模型在推理时需要逐个 token 生成,带来显存带宽和延迟压力。扩散语言模型尝试通过一次前向预测多个位置,将生成过程从串行变为多步去噪。但早期开源实现受限于缓存缺失和并行解码质量下降,实际速度并不占优。ICLR 2026 的 Fast-dLLM 研究通过块级缓存与高置信度并行解码,在保持精度的同时显著提升了吞吐,也让扩散语言模型在代码补全、结构化生成等场景中的价值更加清晰。
自回归大模型在推理时需要逐个 token 生成,带来显存带宽和延迟压力。扩散语言模型尝试通过一次前向预测多个位置,将生成过程从串行变为多步去噪。但早期开源实现受限于缓存缺失和并行解码质量下降,实际速度并不占优。ICLR 2026 的 Fast-dLLM 研究通过块级缓存与高置信度并行解码,在保持精度的同时显著提升了吞吐,也让扩散语言模型在代码补全、结构化生成等场景中的价值更加清晰。