作者丨财报研究社Pro
9月中旬的AI基础设施峰会上,英伟达给数据中心换了一套考核办法。行业此前通常比较的是GPU算力、芯片数量和峰值性能,英伟达当前反复强调的衡量指标却是“每兆瓦能生产多少Token”。
指标一换,生意边界也跟着变了。单颗GPU再快,只要网络拥塞、功率分配、软件调度或存储系统跟不上,算力也发挥不上作用。为此,英伟达正在把芯片、网络、软件、机架、电力管理和建设标准装进同一个方案,将一批GPU变成一座能够持续生产Token、产生收入的AI工厂。
紧接着,Vera Rubin NVL72首次参加MLPerf Inference 6.1推理测试。英伟达披露,其在部分测试中的吞吐量最高达到GB300 NVL72的3.7倍;四个GB300机架组成的288颗GPU集群则实现了99%的扩展效率。
基准测试不能直接代替客户真实业务,但英伟达挑选的展示指标已经很直白:下一轮竞争要比整套系统能否高效扩展,以及同一份电力究竟能产出多少可收费的Token。GPU仍是入口,英伟达争夺的是整座AI数据中心的设计权和利润分配权。
GPU越贵,
系统协同反而越值钱
AI数据中心早期通常是先抢GPU,再想办法把GPU装进机房。随着规模慢慢扩大以后,数据传输、模型切分和节点通信开始影响集群利用率。
路透社9月15日报道AI网络芯片创业公司Delos Data融资时,前英特尔首席执行官帕特·基辛格说得很形象:计算设备如果无法有效通信,只会变成一堆发热、耗电、等数据的硬件。多种计算芯片并存,也让网络更加复杂。
这解释了英伟达为什么持续向GPU周围加东西。NVLink负责机架内互连,InfiniBand和Spectrum-X承担集群通信,BlueField处理数据、安全和存储任务,Vera CPU与Rubin GPU共同进入系统,CUDA、TensorRT负责开发和推理优化。
英伟达卖出的是一套协同设计的计算架构。客户可以用其缩短部署周期、降低调优难度;英伟达则可以把原本流向网卡、CPU和系统软件厂商的预算,留在自己的产品栈里。
这门生意真正有分量的地方,在于利润池扩大并不完全依赖GPU单价继续上涨。最新季度的计算与网络业务收入达到882.99亿美元,同比增长114%,网络收入同比增速也高于公司整体数据中心增速。
不过基于公司没有在财报中单独披露网络业务的绝对收入,因此不能把增长全部归因于交换机或网卡,但方向已经清楚:集群越大,数据搬运越重要,英伟达在一座AI数据中心中的内容价值也越高。
Broadcom和Marvell由此既是产业链伙伴,也是竞争者。云厂商借定制芯片降低成本,AMD继续追赶加速卡与软件生态;英伟达则用NVLink、网络、软件和参考架构抬高整套系统的替换成本。竞争对手可能赢下一颗芯片,英伟达想守住整座集群的设计权。
Rubin卖的不是升级周期,
是一张整座AI工厂的订单
Vera Rubin很容易被写成Blackwell的下一代产品,这种理解太窄。英伟达在最新财报中披露,Vera Rubin已经进入全面量产爬坡,合作伙伴机架正在CoreWeave、谷歌云、微软Azure、甲骨文云和Nebius运行;
同期推出的Spectrum-6交换系统同时支持可插拔光模块与共封装光学,Vera CPU、Rubin GPU、NVLink、BlueField和网络系统被放进统一平台。产品迭代的单位由芯片代际升级,扩大为整机架乃至整个数据中心架构的同步更新。
推理需求让这种打法更有现实基础。Agent调用、搜索、编程和工业模型运行会持续消耗算力,客户衡量基础设施的方式,也从单颗芯片峰值性能转向每兆瓦产出多少Token、每个Token花多少钱。英伟达近期围绕Rubin和DSX强调“每瓦Token产出”。
需要注意的是公司9月公布的MLPerf Inference 6.1属于厂商发布的基准测试,不能直接等同于真实工作负载,不过已经足以说明竞争已转向系统吞吐和能源效率。
DSX平台更能暴露英伟达的边界。按照公司定义,DSX覆盖芯片、系统、软件、设施及合作伙伴技术,为AI工厂提供设计、建设和运营蓝图。韩国NAVER今年6月宣布从55兆瓦起步,计划向吉瓦级基础设施扩张,并采用DSX建设端到端AI平台。
如此一来,英伟达无需亲自浇筑机房、铺设电缆,却可以规定一座高密度AI工厂怎样组合计算、网络、软件和能源系统。传统总包商赚工程交付的钱,英伟达更像技术总包商,赚架构标准、核心设备和生态锁定的钱。
这也解释了英伟达与云厂商关系里的微妙变化。云厂商是最大客户,同时在开发自研芯片;英伟达既要供货,又要让整套平台的建设速度快于客户自研替代。
与CoreWeave的新合作提供了一个样本:双方计划到2030年建设超过5吉瓦的AI工厂,英伟达投入20亿美元购买CoreWeave股票,并准备利用自身财务能力帮助其获取土地、电力和机房外壳。芯片供应商开始介入产能形成和项目融资,订单能见度随之拉长,资产负担与信用风险也顺着合作关系向上游传导。
英伟达拿走更多利润,
也开始替产业承担更多风险
英伟达季度收入翻倍,数据中心业务保持三位数增长,75%的毛利率说明平台化扩张暂未稀释盈利质量,整体的基本面仍然很强;Rubin、网络系统和DSX又把订单范围从计算芯片推向整套基础设施。英伟达甚至宣布与Apollo、贝莱德、黑石、博枫、高盛和KKR筹建独立计算融资平台,计划长期动员超过5000亿美元第三方资本,相关安排仍取决于最终协议。资本开始成为产品的一部分,客户缺钱、缺电、缺建设能力时,英伟达试图把这些堵点一起解决。
账的另一面也必须讲清。因为系统越完整,英伟达承担的间接风险可能越大。晶圆、先进封装、HBM、网络、电力和冷却,任何一项失衡都可能压制交付;云厂商自研ASIC若在特定推理任务上形成成本优势,也会分走通用GPU需求。英伟达生态的效率优势越强,客户寻找第二供应源的动力也越大。
因此,观察英伟达不能只盯GPU出货量。需要验证网络与系统收入能否更快增长,Rubin量产能否守住毛利率与交付质量,DSX能否复制,参与融资的项目能否形成稳定的付费需求。
其中任何一项边际恶化,都可能让“AI工厂总包商”重新被按周期芯片公司定价;若持续兑现,护城河将从CUDA延伸到数据中心的建设与运营标准。
可见英伟达并没有离开GPU,英伟达只是发现,卖完GPU就把客户交给网络商、服务器厂商和云平台,生意做得还不够彻底。
下一轮AI基础设施竞争,最大利润池更可能属于能够让芯片、网络、电力和软件一起高效工作的系统。英伟达正在抢这个位置,同时也把自己推到了整个AI资本开支周期最靠前、最不能出错的位置。
推荐阅读
Computex变了:AI硬件链的年中验货会来了!
英伟达之后,这三份财报才是AI热潮的真正分水岭
精彩评论