大模型推理框架一度追求用一套代码覆盖尽可能多的模型与芯片。但随着新一代 GPU 对融合内核提出更高要求,MoE、注意力机制和通信模式又不断走向专用化,vLLM 给出的新路线不再是继续扩大一个万能抽象层,而是把热门模型放入硬件专用优化路径,同时为长尾模型和非主流加速器保留可编译、可扩展的通用路径。
PyTorch 基金会在 9 月 22 日发布了关于 vLLM 硬件无关模型层的技术说明。目前 vLLM 中同时存在新的 Flat Model、旧模型定义和 Transformers 后端。Flat Model 的目标是为特定模型与硬件直接做融合和专用优化,不依赖完整图的 torch.compile;代价则是旧 GPU、消费级显卡以及树外加速器可能需要各自维护实现。与此同时,新的硬件无关层在核心仓库中独立建设,试图为更广泛的硬件组合提供稳定基线。
从万能抽象到双轨路线
torch.compile 的优势在于可以追踪模型图,再由后端将图降低到目标硬件,树外插件也能覆盖少数特殊算子。这种方式有利于共享模型逻辑,但当模型出现动态控制、独特内存布局或硬件专用通信时,抽象层本身会限制优化空间。对于需要极限性能的热门模型而言,这类限制正在变得难以接受。
Flat Model 则采取了相反思路:直接按 NVIDIA、AMD 或其他硬件编写最合适的模型定义和融合内核。这条路线的性能上限更高,但维护矩阵也会迅速膨胀。硬件无关层的目标并不是击败专用路径,而是在“换卡仍能运行、性能损失可接受、插件仍能扩展”之间给出一个可用基线。换句话说,vLLM 不再试图让同一份模型代码自然兼顾极致性能和广泛可移植性,而是把两种目标拆开处理。
按照官方说明,新的硬件无关层遵循四项原则:
- 完整图可编译;
- 允许 CustomOp 或 PluggableLayer 覆盖;
- 与硬件专用层隔离;
- 优先使用原生 PyTorch 或 Triton、Helion 等可移植领域语言。
性能差距有限,但不能外推到所有场景
官方在 H100 上比较了三种近期模型,称几何平均总 Token 吞吐与原生路径相差不超过 3.4%。不过,这一结果来自有限模型和单类 GPU,不能直接外推到所有模型、延迟表现和显存场景。
素材中提到,当前主分支代码暴露的环境变量名为 VLLM_USE_HW_AGNOSTIC。由于预览功能变化较快,实际部署时应锁定提交,并以目标版本源码为准。素材还给出了一种最小验收思路:使用同一模型、提示分布、并发和生成长度分别运行原生路径与通用路径,将结果写入两个 JSON 文件,再统一比较吞吐、P99 延迟、峰值显存和通过状态。
在这个示例中,一次合成结果显示吞吐比为 0.970、P99 增长 5.0%、峰值显存增长 3.0%,判定通过。需要注意的是,这并非在 GPU 上对官方 3.4% 结论的复现,只是展示一种可执行的验收方法。
素材还强调,压测中的通过状态不应只看服务是否返回 200,至少还应覆盖固定随机种子下的输出一致性、结构化工具调用能否解析、长上下文是否越界,以及并发期间有没有静默回退到 CPU。吞吐也应同时报告输入与输出 Token,P99 则应按请求阶段拆成排队、预填充和解码,避免单一数字掩盖真实问题。
对推理部署意味着什么
双轨路线把选择权交还给部署团队。如果平台只服务少数热门模型、硬件固定,并且吞吐直接决定成本,专用路径更具吸引力;如果模型长尾、硬件供应经常变化,或需要支持自研加速器,通用路径可以减少移植与升级成本。
素材给出的一个典型场景是云平台临时拿不到目标 GPU。此时通用路径若能在另一类卡上以可接受性能启动,可以避免业务停摆。但“能启动”不等于结果一致,采样输出、工具调用 JSON、长上下文和并发下的尾延迟都需要重新验收。
对实际团队而言,更稳妥的做法可能不是简单二选一,而是维护一张可自动生成的兼容矩阵:横轴是模型版本与量化方式,纵轴是硬件和 vLLM 提交,单元格记录实现路径、已知回退、正确率、吞吐、P99 和峰值显存。升级前先跑受影响的单元格,而不是把一次 H100 成功当成整个集群的通行证。
当前实现仍在建设中,有限层已进入主分支,部分 Flat Model 的通用版本尚未落地。对于准备上线的团队,素材建议锁定 vLLM 提交和镜像,确认环境变量与模型实现路径,用真实流量分别测试吞吐、P50/P99、峰值显存和任务正确率,并故意禁用专用内核验证回退路径,最后把结果写进 CI,而不是只保存一次跑分截图。
对于强依赖尚未覆盖的定制算子、必须追逐 Blackwell 等最新硬件极限,或没有资源维护双套基准的场景,素材建议等待支持成熟,或者明确承担专用实现成本。
这次变化承认了一个现实:极致性能与广泛可移植性已经不是同一份模型代码自然兼得的属性。双轨架构比把所有差异藏进一层抽象更直接,也让推理框架的选择重新回到部署约束本身。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/vllm-bu-zai-ya-zhu-wan-neng-chou-xiang-xin-gpu-shi-dai-xuan