OpenAI 首次公布 Jalapeño 推理芯片成绩:以更省电方式追赶英伟达 GB300

OpenAI 在 Hot Chips 大会上首次披露 Jalapeño 推理系统基准成绩。在 InferenceX 测试中,其每瓦完成工作量为对比系统的 1.5 至 1.9 倍,端到端延迟约为 28% 至 59%。

8 月 25 日,OpenAI 在 Hot Chips 大会上首次披露与博通共同开发的推理系统 Jalapeño 的基准测试结果。在第三方平台 SemiAnalysis 的 InferenceX 测试中,这套系统被拿来与英伟达 GB200、GB300 等超级芯片系统对比。OpenAI 给出的核心结论是:在相同模型负载下,Jalapeño 的每瓦完成工作量更高,端到端延迟更低。

这是 OpenAI 首次公开 Jalapeño 的性能数据。与以往只强调算力规模不同,这次它把重点放在推理阶段的 token 处理量、每千瓦吞吐和响应速度上。对普通用户而言,这些指标对应的是模型回答是否更快、服务是否能承载更多并发请求;对云厂商和大模型公司而言,则意味着同样的电力和机房资源能否支撑更大的 AI 业务量。

首次公开基准:每瓦工作量更高,延迟明显下降

OpenAI 硬件负责人理查德 · 何在媒体电话会上表示,Jalapeño 相比目前最先进的产品实现了显著性能提升,可以用相同的电力处理更多 AI 工作负载,同时更快给出响应。他还提到,这套系统既能高效服务大量用户,也能保持较低延迟。

在具体测试中,OpenAI 选择了 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 三个模型。结果显示,Jalapeño 每瓦能够完成的 AI 工作量是对比系统的 1.5 至 1.9 倍;端到端延迟约为对比系统的 28% 至 59%。

  • 测试平台:SemiAnalysis InferenceX
  • 对比对象:英伟达 GB200、GB300 超级芯片系统
  • 测试模型:GPT-OSS 120B、DeepSeek R1、Kimi K2.5 1T
  • 效率指标:每瓦完成 AI 工作量为对比系统的 1.5 至 1.9 倍
  • 延迟指标:端到端延迟约为对比系统的 28% 至 59%

这些数字的意义不完全在于“超过”英伟达,而在于 OpenAI 把竞争指标从训练时代的峰值算力,转向了推理时代的能源效率和响应速度。随着 AI 应用从演示走向日常服务,推理成本正在成为比训练成本更长期、更稳定的支出项。

Jalapeño 的优化方向:减少数据搬运,压缩推理瓶颈

Jalapeño 并非一颗单纯追求高算力的通用 GPU,而是围绕 AI 推理场景设计的系统。所谓推理,是让已经训练好的模型实际运行,回答问题、生成内容或驱动 AI 智能体。OpenAI 表示,全栈协同开发让它可以更直接地优化推理过程中最容易拖慢速度的环节。

按照 OpenAI 的说法,Jalapeño 重点降低的是预填充和通信阶段的延迟。在其看来,这两个环节往往是推理性能的主要瓶颈。预填充决定模型在正式生成回答前能多快理解输入内容,通信阶段则影响芯片、内存和网络之间传递数据的效率。

OpenAI 在博客文章中称,Jalapeño 从设计之初就尽量减少数据搬运和通信延迟。生成响应时使用的 KV 缓存等模型状态可以明确存放并保留在本地,系统再根据不同推理阶段,调配合适的计算、内存和网络资源。

这种设计思路说明,Jalapeño 的优势并不是单点性能,而是把模型、芯片、内存和网络放在一起优化。对于大模型服务商来说,如果 KV 缓存能够更高效地保留在本地,长上下文请求、多轮对话和智能体任务的响应稳定性可能会得到改善。

与博通共研:OpenAI 想把芯片变成多代平台

Jalapeño 由 OpenAI 与博通共同开发,OpenAI 自有模型也参与了研发。这种合作方式不同于直接采购现成加速器,而是让模型团队更早介入底层硬件设计。OpenAI 表示,希望把 Jalapeño 发展成一个能够延续多代的技术平台,使 AI 产品、模型、芯片和内存从一开始就协同设计。

这也解释了 OpenAI 为什么不把 Jalapeño 简单定位成一颗“替代英伟达”的芯片。它更像是一条围绕自家模型推理需求建立的硬件路线。若这一平台能够持续迭代,OpenAI 未来可以在模型设计阶段就考虑芯片特性,例如缓存结构、内存带宽、通信拓扑和推理调度方式。

对算力供应链而言,这种路线的影响值得关注。过去大模型公司主要依赖通用 GPU 和云厂商算力,芯片供应、价格和交付周期都会影响 AI 服务扩张。自研推理芯片不一定能完全摆脱对外部供应商的依赖,但如果 OpenAI 能在特定推理负载上获得更高每瓦效率,它可以为部分稳定、长期的推理负载建立更可控的算力来源。

部署节奏仍偏谨慎:今年小规模上线,2027 年扩大规模

OpenAI 并未在发布会上给出激进的量产时间表。根据已披露信息,OpenAI 计划在今年年底前先“小规模”部署 Jalapeño,2027 年再逐步扩大部署量。目前没有公布明年具体会投入多少芯片。

这一节奏意味着,Jalapeño 短期内还不会对英伟达的推理市场形成大规模替代。它首先要通过真实业务验证稳定性、软件生态和运维成本。基准测试能够展示理论效率,但数据中心最终看重的是长期运行表现、故障率、升级路径以及与现有模型栈的兼容程度。

不过,OpenAI 选择公开基准成绩,本身已经释放出明确信号:AI 硬件竞争正在从“能不能训练大模型”,转向“谁能以更低成本、更低功耗运行大模型”。对 OpenAI 来说,Jalapeño 是一次把模型、芯片和部署成本绑定优化的尝试;对英伟达来说,这也意味着其推理系统的能效和延迟优势,将开始面对来自模型厂商自研平台的直接检验。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/openai-shou-ci-gong-bu-jalape-o-tui-li-xin-pian-cheng-ji-yi

Like (0)
点点的头像点点
Previous 12小时前
Next 2026年4月19日

相关推荐