Hyperscaler自研晶片降低Nvidia依赖?

$HYPERSCALE DATA INC(GPUS)$  ‌‌$Amazon - main 2612(SAMZNmain)$  ‌‌$Alphabet(GOOG)$  ‌‌$MICROSOFT-T(04338)$  


生成式人工智能的竞赛,表面上是模型之争,背后其实也是算力成本与供应链控制权之争。当Nvidia凭借GPU、CUDA软件生态及高速互连技术,掌握AI基建的重要话语权,Amazon、Google、Microsoft及Meta等Hyperscaler纷纷加快自研晶片步伐。市场自然追问:云端巨头是否正在削弱Nvidia的护城河,还是为自己的数据中心增加另一层昂贵而复杂的系统?

Google是最早投入专用AI加速器的云端企业之一,其TPU已发展至第七代Ironwood。Google表示,Ironwood既可支援大型模型训练及强化学习,也针对高流量推理而设,单颗晶片的训练及推理效能较上一代Trillium提升逾四倍,并可把9,216颗晶片组成Superpod。更重要的是,TPU不只服务Gemini,也获Anthropic等外部客户采用,反映自研晶片正由内部成本工具转向云端商业产品。

Amazon的方向同样清晰。Trainium系列与AWS云端、网络及机器学习服务深度整合,第三代Trainium3采用3纳米制程,每套UltraServer最多配置144颗晶片。AWS宣称,其运算效能及能源效率较Trainium2显著提高,部分客户使用Trainium可把训练或推理成本降低最多约五成;然而,AWS仍同步提供Nvidia Blackwell系统,显示自研晶片并非全面取代GPU,而是建立第二个算力来源。

真正竞争的是整套系统,而非单一晶片

Hyperscaler自研晶片首先解决的是经济问题。云端企业每年投入数以百亿美元计的资本开支,若能把推荐、广告排序、内容审核及大模型推理等高频而相对固定的工作,转移至成本较低、能耗较佳的专用晶片,即使每个运算单位只节省一小部分开支,放大至全球数据中心后也足以产生庞大效益。自研能力亦增加采购议价权,避免算力供应完全受制於单一厂商的产能、定价与产品周期。

Microsoft于2026年推出专门处理推理的Maia 200,采用3纳米制程,配备216GB HBM3e,并以标准以太网络建立大规模互连。公司称其每美元效能较现有硬件提高约三成,计划用于Microsoft 365 Copilot、Azure AI服务及OpenAI模型。这说明自研晶片的首要目标并非赢取跑分,而是降低每个生成token的成本;当AI应用由训练走向每天数十亿次推理,单位成本比峰值性能更直接影响毛利率。

但晶片多元化也会带来新的代价。不同加速器拥有不同编译器、运算核心、记忆体架构及网络拓扑,同一模型要在GPU、TPU、Trainium或Maia之间迁移,往往需要重写核心程式、重新调校精度及验证模型输出。硬件型号愈多,工作负载调度、备件管理、散热设计与工程人才培训便愈复杂,甚至可能出现某类晶片供不应求,另一类晶片却因软件未成熟而闲置的情况。Meta也公开承认,每年管理五至六种硬件规格会增加调度难度,并可能造成设备使用率不足。

因此,Nvidia真正的护城河不只是晶片性能,而是CUDA、开发工具、互连网络和大量工程人才共同形成的完整生态。GPU具备较强通用性,特别适合架构仍在快速变化的前沿模型训练;自研ASIC则更适合规模庞大、重复度高及需求可以预测的工作。若模型演进方向突然改变,过度专用的晶片可能在折旧期尚未结束前便失去效率优势。

从投资角度看,Hyperscaler自研晶片不宜被理解为「Nvidia终结者」,而应视为算力市场由单一GPU主导,转向异质运算的开始。未来较可能出现的格局,是Nvidia继续掌握高端训练及通用运算,自研晶片承接内部推理、推荐和特定模型,AMD及其他供应商则补充第二来源。云端巨头确实能降低对Nvidia的边际依赖,但同时必须承担更高的研发、软件适配和数据中心管理成本。最后胜出的未必是拥有最快晶片的企业,而是能够把晶片、模型、网络、能源与软件调度整合得最有效率的平台。

义合控股投资者关系部

(芯片与算力系列之95) 

免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。

举报

评论

  • 推荐
  • 最新
empty
暂无评论