在近日举行的Hot Chips大会上,OpenAI首次公布了其自研AI推理芯片Jalapeño的基准测试数据。根据SemiAnalysis的InferenceX测试结果,这款新芯片在两项关键指标上——每用户生成token数和每千瓦吞吐量——均超过当前可用的先进推理处理器。这一表现意味着,Jalapeño有望在不显著增加电力负担的前提下,同时提升服务规模和响应速度。
基准表现:同时改善吞吐与能效
此次测试基于SemiAnalysis推出的InferenceX基准,主要面向大模型推理场景。结果显示,Jalapeño能够比现有最先进推理处理器提供更高的每用户token数,同时也实现了更高的每千瓦吞吐量。对云服务商和模型开发商而言,这两个指标分别对应着用户体验和数据中心运营成本:前者关系到回答是否足够快,后者关系到长期运行是否省电、省成本。
OpenAI硬件负责人Richard Ho在媒体沟通会上表示,这些结果表明该系统在性能上实现了“非常、非常显著的进步”。他解释称,Jalapeño能够在单位功耗下承担更多AI计算任务,同时更快返回结果。换言之,它不仅适合大规模服务大量用户,也能保持较低延迟。
对标Blackwell,但竞争窗口仍在变化
值得注意的是,OpenAI此次用来对比的系统是Nvidia Blackwell平台。不过,到Jalapeño真正进入规模化部署阶段时,市场格局可能已经发生变化。Richard Ho表示,Jalapeño预计将在2026年底以“非常小的数量”开始部署,更大规模的落地要等到2027年。
这也意味着,虽然当前基准表现值得关注,但其真正竞争力仍取决于上市时的整体生态。随着Nvidia等厂商持续迭代下一代推理硬件,Jalapeño能否保持优势,还要看未来一年多的供应链、系统优化和软件适配进展。
与Broadcom合作,围绕推理瓶颈做系统优化
Jalapeño最早于2025年10月披露,由OpenAI与Broadcom紧密合作开发,OpenAI自己的模型也参与了研发过程。OpenAI计划将其打造为一个多代际平台,使AI产品、模型、芯片和内存能够协同演进。
这种全栈式设计让OpenAI可以针对推理过程中的具体瓶颈做优化。OpenAI表示,Jalapeño重点减少了prefill阶段和通信阶段的延迟。公司称,这些环节往往会成为推理过程中的瓶颈。
OpenAI在发布测试结果的博客中解释称,Jalapeño的设计目标是减少数据移动和通信延迟。这样一来,模型状态——包括生成回答时使用的KV cache——可以被明确放置并保留在本地,同时系统再根据不同推理阶段,调用合适的算力、内存和网络组合。
对推理成本和部署规模的意义
从行业角度看,Jalapeño的价值不只是跑分提升。随着大模型应用从演示阶段走向大规模日常服务,推理成本、能耗和响应速度正在成为比训练能力更现实的竞争点。如果一款芯片能够在每用户速度和每千瓦效率上同时取得优势,理论上就可以用更少硬件服务更多请求,或者在同等用电条件下承载更高流量。
- 对OpenAI自身而言,这类自研硬件有助于降低对单一供应商的依赖,并把模型与硬件深度绑定。
- 对行业而言,Jalapeño显示出推理芯片正从单纯拼算力,转向围绕真实业务负载做系统级优化。
- 对用户而言,更低延迟和更高能效最终可能带来更稳定的响应速度,以及更可持续的服务扩展能力。
目前,Jalapeño仍处于早期部署前阶段,其真实影响还需要等到2026年底至2027年的实际落地后进一步验证。但从首批基准数据来看,OpenAI显然不只是想做一颗通用加速器,而是在围绕大规模推理这一核心场景重新设计硬件。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/openai-gong-bu-jalape-o-tui-li-xin-pian-ji-zhun-mian-xiang