OpenAI 正在把自研算力推进到更具体的产品阶段。该公司周二发布博客称,其首款 AI 推理芯片 Jalapeño 在执行推理任务时,可以比现有方案更高效地完成任务,并缩短用户等待响应的时间。对于正在将 AI 助手、智能体和大规模推理服务推向更多场景的 OpenAI 来说,这类芯片的意义不只是提高单点性能,而是为其模型服务提供更可控的成本和供给基础。
面向推理场景的专用芯片
Jalapeño 是一款专用集成电路(ASIC),由 OpenAI 与博通合作开发,并于今年 6 月首次公开。该芯片的目标场景是 AI 推理,即运行已经训练好的模型来完成实际任务,而不是用于模型训练。随着大模型产品进入高频调用阶段,推理环节的延迟、吞吐和能耗正在成为影响服务体验和运营成本的关键变量。
OpenAI 硬件副总裁 Richard Ho 在记者会上表示,Jalapeño 在较低延迟和较高吞吐之间取得了更好的平衡。按照他的说法,AI 系统通常需要在两者之间做取舍,而 Jalapeño 试图同时改善这两项指标。这一表述指向的是推理服务中的现实问题:既要快速回复用户,也要在大规模并发请求下保持稳定供给。
基准测试中的性能表述
为了说明 Jalapeño 的表现,OpenAI 使用了推理基准平台 InferenceX,并将其与当时记录的最佳成绩进行比较。OpenAI 称,对比对象使用的是英伟达 GB200 或 GB300 超级芯片所取得的成绩。
OpenAI 给出的数据是:在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 三个模型上,Jalapeño 相比对照系统每瓦可完成 1.5 至 1.9 倍 AI 工作,同时端到端延迟降低至对照系统的 1.7 至 3.6 倍。按照公司说法,这意味着用户可以得到更快的响应、更具响应性的智能体,以及在需求增长时更可靠的服务接入。
不过,素材中只给出了 OpenAI 自身披露的测试结果,并未包含第三方复测数据,也没有列出完整测试环境、功耗口径和模型部署参数。因此,这些数据目前仍应视为厂商在特定基准下的性能表述,而不是已经在大规模生产环境中得到验证的结果。
部署节奏与英伟达关系
OpenAI 并未计划立刻用 Jalapeño 替换现有算力体系。Richard Ho 表示,公司预计今年年底前小批量部署 Jalapeño,并将在 2027 年逐步扩大规模。对于明年具体部署多少芯片,OpenAI 没有给出数量。
更关键的是,OpenAI 明确表示 Jalapeño 不会取代其整体芯片组合。Richard Ho 称,OpenAI 的整体算力战略仍包括“非常好的合作伙伴”,例如英伟达。公司还会继续推进 Jalapeño 第二代和第三代芯片的开发。
这意味着,OpenAI 的自研芯片路线并非与英伟达直接切割,而更像是在现有供应链之外增加一层面向自身推理负载的补充能力。对于 OpenAI 而言,推理芯片自研的价值不在于短期内摆脱外部供应商,而在于针对自家模型结构、服务延迟要求和数据中心运维方式做更深度的软硬件协同。
从模型公司走向算力自研
过去几年,OpenAI 的核心能力主要体现在模型研发和产品化上。但随着 ChatGPT、API 服务和智能体应用持续扩大,推理算力已经成为长期运营中的重要变量。模型越强、调用越多,推理侧的成本和响应速度就越会影响商业模式的可持续性。
Jalapeño 的推出,显示 OpenAI 正在向更完整的 AI 基础设施公司延伸。它一方面继续依赖英伟达等供应商满足通用和既有算力需求,另一方面通过专用芯片探索更适合自身推理负载的方案。这种双轨路径也符合当前大型 AI 公司的普遍选择:在保留成熟 GPU 生态的同时,逐步增加面向特定工作负载的自研硬件。
对行业而言,Jalapeño 当前最值得关注的不是它是否已经全面超越现有方案,而是 OpenAI 开始用自有芯片去约束推理成本、延迟和供给弹性。如果后续部署规模扩大,这款芯片可能会影响 OpenAI 模型服务的定价能力、智能体产品的响应体验,以及其与云厂商和芯片供应商之间的议价关系。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/openai-cheng-zi-yan-jalape-o-xin-pian-ke-dai-lai-geng-di