作者丨财报研究社Pro
9月,英伟达连续释放两个明确信号:Vera Rubin NVL72已进入全面生产,面向低延迟推理的Groq 3 LPX也已投产;最新MLPerf测试中,Vera Rubin NVL72在部分推理任务上的吞吐量达到GB300 NVL72的3.7倍。
英伟达讲述AI生意的口径也随之发生改变,关注点从训练出多少参数,转向每兆瓦能够生产多少Token、服务多少用户、产生多少收入。这个变化很现实。训练是一笔阶段性资本开支,推理却伴随每次提问、每轮代码生成和每个Agent任务持续发生。
模型进入企业流程后,调用次数、上下文长度与响应速度不仅共同决定了算力消耗,也决定了整个产业链的利润分配。接下来需要研究的更多的是谁能让Token生产得更快、更便宜,并把这些Token转化为企业收入。
英伟达正在把一次性卖芯片,
改造成持续生产Token的生意
2027财年第二季度,公司实现营收962亿美元,同比增长106%;其中数据中心收入890亿美元,同比增长117%,占公司收入超过九成。公司给出的下一季度营收指引达到1080亿美元,而且没有计入中国数据中心计算收入。
英伟达给出的最新财报增长十分迅猛,在高增长背后,英伟达对自身商业模式的描述已经发生变化。黄仁勋在财报中直接表示,Token正在产生生产力与利润,计算本身正在成为收入,该表达准确地概括了推理生意的特点。
模型训练完成不代表成本结束,一次普通问答只消耗有限Token,但Agent需要阅读资料、调用工具、反复推理、检查结果,还可能拆出多个子任务。英伟达披露,Agent类工作负载的Token消耗量最高可达传统AI应用的15倍。也就是说,应用越复杂,模型调用越频繁,基础设施的收入能见度反而越高。
Vera Rubin NVL72负责高带宽、大模型与复杂计算,LPX依靠SRAM提供确定性的低延迟Token生成,两类芯片共同处理推理中的预填充和解码环节。每个LPX机架包含256颗LPU,英伟达公布的测试数据显示,在长上下文、超大参数模型场景中,Vera Rubin配合LPX的每兆瓦Token吞吐量最高可达到GB200 NVL72的35倍。不过,该数据是在特定模型和测试条件下的,因此更适合用来观察架构方向,不能直接等同于所有生产环境的实际收益。
相比之下,更有说服力的是标准化测试。Vera Rubin NVL72在MLPerf Inference 6.1首次亮相,对Qwen3-VL的吞吐量最高达到GB300 NVL72的3.7倍,对DeepSeek-R1最高达到2.5倍;四个GB300 NVL72机架组成的288 GPU集群实现了99%的扩展效率,软件优化又将部分任务性能提高至上一版本的1.6倍。以上数据更好地讲清楚了英伟达的护城河。
当前行业内竞争已经超出单颗GPU性能,客户采购的是芯片、互联、推理框架、调度软件和电力管理共同构成的生产系统。英伟达希望控制的也不止算力入口,还包括Token的生产流程和成本结构。
Inference扩张后,
利润会沿着网络、电力和整机向外溢出
推理规模扩大,并等同于产业利润全部留在GPU厂商手里。Agent对延迟非常敏感,一个任务可能跨越多台服务器、多个模型和多个数据库,只要网络、存储、电力或散热出现瓶颈,昂贵的GPU就只能等待。Inference产业链由此形成了一种很有意思的局面:计算芯片决定上限,外围基础设施决定利用率。
AMD是英伟达最直接的挑战者。财报显示,2026年第二季度,AMD数据中心收入达到67亿美元,同比增长107%,EPYC处理器和Instinct GPU同时贡献增长。AMD近期还披露,MI350系列在512 GPU规模下实现每秒575万个Token的MLPerf推理成绩。
AMD的主要机会来自客户对第二供应源、开放软件栈和采购议价权的需求;至于压力,仍在ROCm生态、系统交付能力以及大规模部署的稳定性方面。硬件性能可以追赶,软件迁移成本和开发者习惯要慢得多。
Broadcom、Marvell和Arista的机会则来自定制芯片与数据搬运需求。Broadcom第三财季AI半导体收入达到167亿美元,同比增长221%,定制加速器与网络业务已经成为增长主轴;Marvell第二财季营收27.39亿美元,同比增长37%,AI数据中心连接需求继续推高订单;Arista第二季度收入30.36亿美元,同比增长37.7%,同时推出面向AI集群的1.6Tbps网络平台。
这一层的投资判断很直接:推理量增长会增加数据在芯片、机架和数据中心之间往返的频率,网络芯片、交换机和光连接的重要性也会随之提升。
不过,基于Broadcom与Marvell同时受益于云厂商自研ASIC,会分走通用GPU的部分工作负载。英伟达用NVLink、Spectrum-X以及对外开放的NVLink Fusion回应这种压力,目的就是让定制芯片即使进入机房,也尽量留在英伟达定义的互联体系内。
Dell在2027财年第二季度实现AI优化服务器收入164亿美元,期末相关订单积压达到950亿美元;HPE最新季度Cloud & AI收入90亿美元,同比增长25.4%,AI系统订单环比增长超过30%。
可见服务器厂商的增长已从概念进入交付、收入与订单能见度阶段。电力与整机正在成为另一条更容易兑现的主线。
电力设备公司的变化更有冲击力。Vertiv第二季度销售额32.74亿美元,同比增长24%;Generac近期与亚马逊签署约24亿美元的数据中心备用发电机供应协议,若后续采购全部兑现,相关支出最高可达80亿美元。
以上多个订单足以说明,推理需求最后都会落到一条物理约束上:电从哪里来,热怎么排出去,服务器能否稳定运行。英伟达推出DSX MaxLPS,正是在争夺这部分价值。
Lambda的部署测试显示,在相同电力预算下,相关软件将集群Token吞吐量从约每秒400万个提高到500万个,增幅24%。AI基础设施的比较单位正在从GPU数量转向每兆瓦产出,VRT、ETN、GNRC等公司因此获得了更长的订单周期,也获得了重新审视业务结构的机会。
推理最大的赢家,
可能要等企业账单出来才知道
Inference产业链很容易把Token增长简单换算成所有公司同步增长,实际上尽管算力需求会扩大,利润分配却可能更加残酷。因为模型价格下降、芯片效率提升、云厂商自研ASIC、客户压缩推理成本,都可能让Token数量与收入增长出现背离。
供应商最终要回答的是,同样一度电和一台服务器,究竟能完成多少有价值的任务。SNOW、PLTR、NOW和CRM处在这场检验的前端。
数据显示,Snowflake最新季度产品收入14.9亿美元,同比增长37%,管理层称AI产品贡献了近期增长加速的大约一半;Palantir第二季度收入同比增长93%至19.4亿美元。Salesforce则在Dreamforce发布基于英伟达Nemotron训练的CRM推理模型Koa,并将其运行在自有基础设施中。
真正能决定整条产业链能走多远的应用层。企业愿意持续购买Token,前提是Agent能够缩短销售周期、提高研发效率、减少人工操作,或者直接创造收入。调用量很大、业务回报模糊的项目,迟早会被财务部门砍掉;能够进入生产流程、掌握企业数据和客户关系的软件平台,才可能把算力成本变成持续收费。
所以,英伟达仍然是Inference扩张中确定性最高的受益者,其有着计算、网络、软件和系统协同等多方面的优势;Broadcom、Marvell与Arista可以分享定制计算和数据连接的增量;Dell、HPE、Vertiv、Eaton与Generac则承接机房落地和电力扩容;Snowflake、Palantir、ServiceNow与Salesforce负责证明这些Token确实能够赚钱。
接下来,等企业把Agent真正塞进经营流程,AI产业链才会迎来更严格的一轮筛选:订单、利用率、单位Token成本与客户现金回报,以上指标都会比发布会上的参数更有分量。
推荐阅读
Computex变了:AI硬件链的年中验货会来了!
英伟达之后,这三份财报才是AI热潮的真正分水岭
精彩评论