过去几年,市场理解英伟达的方式相对简单:它是先进 GPU 的主要供应商,并在 AI 基础设施扩张中获得高额回报。随着亚马逊、谷歌等云厂商推进自研芯片,投资者开始关注英伟达 GPU 优势的可持续性。该公司市值在 2023 年初至 2025 年中曾增长至原来的 10 倍,但过去一年股价走势相对温和,原因之一正是外界对 GPU 竞争加剧的担忧。
不过,本周财报发布后,一种新的判断开始浮现:英伟达的优势并不只停留在 GPU 本身。当 AI 计算规模走向 gigawatt 级别,算力集群的编排、数据流动和系统协同正在成为更复杂的问题。英伟达在 GPU 周边硬件上的布局,使其即便面对 GPU 竞争,也仍然在系统层保持较强位置。
单卡算力之外,数据中心开始拼“交通系统”
素材显示,英伟达正在推出 Vera Rubin 架构。这一架构并不只是 Rubin GPU,而是把 Rubin GPU 与 Vera CPU、Groq 3 LPX 推理加速器,以及存储和网络机架等组件组合在一起。换句话说,英伟达售卖的已经不只是单一计算芯片,而是一整套围绕 GPU 运转的基础设施。
这些组件的角色,可以被理解为给 GPU 这台“发动机”配齐整车系统。GPU 负责处理核心计算任务,而 CPU、存储、网络和推理加速器则负责让数据在正确的时间到达正确的位置,并尽可能减少等待、拥堵和浪费。
英伟达存储技术副总裁 Jason Hardy 表示,Vera CPU 的重要性在于,单台服务器或任何计算平台能容纳的内存终究有限。随着数据中心算力提升,内存容量也在增长,但如何让这些数据及时进入 GPU,并不是一道简单的问题。当企业开始关注降低 tokens-per-watt 时,流量调度和数据编排的价值被进一步放大。
Vera CPU 的价值:让存储不再成为瓶颈
Hardy 提到,在这些操作中,Vera CPU 带来了最高 3 倍的性能提升。其意义不只是让某个部件更快,而是让闪存能够更充分地发挥性能,避免系统因数据供给不足而形成瓶颈。
- GPU 负责核心计算,但计算效率取决于数据能否及时送达。
- 内存容量持续增加后,数据调度成为新的关键变量。
- 降低 tokens-per-watt 让“交通管理”比单纯增加算力更重要。
- Vera CPU 的作用,是提升 GPU 外部系统的整体效率。
这也解释了为什么新一代 AI 基础设施竞争不再只是比拼单卡性能。随着集群规模扩大,任何一个环节的低效都会被放大:存储响应慢一点、网络调度差一点、数据路径长一点,最终都会反映为算力利用率下降和成本上升。
OpenAI 的路径不同,但目标一致
这种对数据流动效率的关注,并不是英伟达独有的方向。素材提到,OpenAI 在开发 Jalapeño 芯片时,也把减少数据搬运和通信延迟作为重点。OpenAI 表示,Jalapeño 的设计目标是尽量减少数据移动和通信延迟,其 large domain 可以让整个工作负载留在一个连接系统内,从而减少数据搬运,并让完整请求从头到尾保持快速和高效。
这与英伟达的做法并不相同。英伟达选择通过更复杂的系统组件来管理和加速数据流动;OpenAI 则试图通过一体化设计,尽量把负载留在同一个系统域内,减少数据移动的必要性。但两者的共同点很清楚:AI 基础设施效率的来源,正在从“更多处理器周期”转向“更聪明的流量控制”。
英伟达的新护城河:系统整合能力
当然,数据编排并不会天然让英伟达获胜。它仍然需要在这一层与其他芯片公司和云厂商竞争。真正的变化在于,竞争焦点已经从单一 GPU 性能,转向整个系统的协同效率。谁能把计算、存储、网络和推理调度组合成更高效的完整方案,谁就更可能在下一代 AI 数据中心中占据主动。
至少在现阶段,素材给出的判断是:英伟达在这一新层面看起来已经建立了明显的领先位置。对行业而言,这意味着 AI 芯片竞赛正在进入第二阶段。GPU 仍然是核心,但决定胜负的,可能越来越多地取决于 GPU 之外的那套复杂系统。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/ai-shu-ju-zhong-xin-jing-zheng-huan-sai-dao-ying-wei-da-de