电力需求狂潮下,AI数据中心供电稳定性成基建优先级新锚点

暖阳财经
08-06

人工智能不稳定的电力需求正在损害其自身的数据中心。设备故障表明,这些价值数百亿美元的基础设施面临着成本与可靠性的双重挑战。

天量级AI训练与推理集群对电力的巨大需求早已广为人知,但数据中心用电需求的快速波动如何损坏关键设备,却较少被关注。在建设进程如火如荼的AI基础设施中,高容量电池、发电机、冷却装置及其他系统承受着巨大压力,频繁出现故障或过早达到使用寿命终点。

随着AI繁荣加速,这些技术问题意味着额外成本和此前未预料到的可靠性隐患。即使仅损失几分钟的正常运行时间,也会打击数据中心开发商的利润。投资者和贷款机构本就对超大规模云计算企业数千亿美元级别的支出感到不安,市场越来越担心,数据中心底层硬件基础设施的折旧速度可能远快于此前预期。

AI数据中心真正的隐性瓶颈,正从"能否获得足够电力"升级为"能否承受毫秒级、城市规模的剧烈功率波动":数十万枚GPU或数十个高功耗AI机架同步启停,会反复冲击燃气轮机、发电机、电池、变压器、UPS和冷却系统,造成设备开裂、异常磨损和提前报废。一旦故障导致算力中断,损失的核心并非零部件更换成本,而是昂贵GPU资产无法持续产生利润。这些动态负荷还可能通过电压、频率和次同步振荡威胁外部电网稳定,北美电力可靠性委员会(NERC)已将大型数据中心的快速负荷变化列为重要可靠性风险。

兆瓦级机架重构数据中心设备投资版图

"AI尽头是电力"正在演化为"AI尽头是稳定且可控的高质量电力"。储能、UPS、高压直流、电力电子、微电网和先进冷却设备将获得更高价值量,而数据中心项目的估值也必须计入设备加速折旧、停机损失和可靠性改造等隐性成本。

传统CPU机架功率密度相对较低、负载变化平缓,而Blackwell等机架级系统将数十枚GPU、CPU、NVSwitch和高速网卡同步耦合:GB200 NVL72满载功率约120千瓦,GB300 NVL72最高可达142千瓦。当训练任务进入集合通信、检查点保存或推理批次切换时,整柜GPU会在毫秒级同步升降功率,形成巨大浪涌、谐波与热负荷。英伟达预计2027年开始支持1兆瓦级及以上IT机架,传统54伏直流配电将遭遇铜排体积、传输损耗和转换级数的物理极限。

因此,AI集群每增加一单位算力,必须同步扩张中压变压器、开关柜、母线、整流器、UPS、电池储能、超级电容、备用发电机以及冷却液分配单元。功率转换、配电稳定与散热系统,正从辅助设施升级为决定GPU能否开机的核心生产资料。

高盛预计,全球数据中心电力需求到2030年将较2023年增长220%,相当于增加一个全球前十大用电国家。国际能源署(IEA)预计,全球数据中心耗电量将由2024年的约415太瓦时增至2030年的约945太瓦时,年均增长约15%,占全球用电量接近3%。其中AI加速服务器用电年均增长约30%,美国数据中心耗电量较2024年增加约240太瓦时、增幅约130%。

毫秒级功耗震荡,AI正在加速耗损自己的基础设施

为电力供应商和数据中心提供标准与可靠性咨询的Uptime Institute资深顾问安伯·维勒加斯-威廉姆森表示:"人工智能确实会产生非常异常的电力需求。这就像让汽车发动机持续超高转速运转,会比保持恒定速度更快地磨损发动机。"

AI数据中心的用电需求规模极其庞大,且波动幅度大得多。相当于工厂、城镇甚至城市用电量的负荷,可能在数秒内突然出现或消失,形成反复冲击,使连接设备难以承受。Mainspring Energy创始人香农·米勒表示,一座1吉瓦数据中心的用电规模相当于波士顿这样一座城市,其中一半的负荷可能每隔几秒就开关闪变一次。得克萨斯州和美国中西部规划中的部分AI园区,规模甚至超过这一水平的五倍。

AI数据中心在训练新模型时,会给供电系统带来尤其巨大的压力——这一过程会让所有GPU同时启动,数十万枚GPU会以毫秒为单位同时升高或降低功率。Heron Power Electronics创始人德鲁·巴格利诺表示,AI设施的功耗有时会飙升至设计容量以上50%。

大多数设备并不是按如此剧烈的用电波动设计的。Terraflow Energy首席执行官乔恩·帕雷拉将其比作驾驶法拉利时直接从六挡切换到一挡。多名受访者表示,这些设施承受的物理压力已经非常明显。用于在数据中心发电的小型天然气内燃机,其曲轴已经发生断裂;在田纳西州孟菲斯的xAI Colossus设施,燃气轮机出现裂纹,系统中随后安装了电池以帮助平抑功率波动。英国一些规模较小的数据中心也出现了涡轮开裂。

电池、电容器、变压器和飞轮等设备可帮助稳定电力流动,但在争分夺秒建设AI算力的过程中,新建数据中心并未充分采用这些技术。一些为此用途安装的电池,由于承受压力过大,仅使用数月甚至数周就不得不更换。

停机率侵蚀现金流,AI算力可靠性成为金融风险

这些问题已导致部分AI计算设施出现项目延期或运营受限,并由此减少收入。为确保规划容量达2.67吉瓦的AI园区实现99.999%可靠性,工程计划中预留了额外时间,供电从原定的2027年推迟至2028年。

数据中心建设及运营商Switch首席战略官杰森·霍夫曼表示,如果关键设备过早故障,"其财务后果主要不是更换部件的成本,而是昂贵算力因停机无法创造收入所损失的价值"。停机造成的收入损失根据设施类型和工作负载不同,估算范围从每分钟数千美元到数十万美元不等。

一名参与此类设施融资的人士表示,一些设施的实际正常运行率仅接近80%。如果问题得不到解决,未来12至24个月内部分项目的投资者可能受到冲击。数据中心GPU机架本身的折旧速度,也已引发外界对行业盈利能力的质疑。

这些可靠性问题还可能扰乱更广泛的电力系统。施耐德电气电能质量专家斯里曼特·罗伊表示:"这些负荷极具动态性,会造成电网不稳定;如果不加以纠正,可能导致停电或供电中断。"尤其令人担忧的是,数据中心可能在电力流动中引发次同步振荡,从而损坏连接在电网其他部分的设备。北美电力可靠性公司已多次发出警告,称数据中心是电网稳定面临的最大风险之一。

行业着手重构供电架构

从产业链上游到下游,AI行业已意识到这些问题并积极研究解决方案。英伟达在开发Blackwell GPU时开始与电力专家更密切合作,并努力让部署过程更加平稳。数据中心用户已采用一些技术平滑功率波动,例如运行辅助计算以保持GPU稳定运行,但这种方法因浪费电力而受到批评。

美国落基山国家实验室代表能源部建立了测试平台,用于研究如何安全地将AI接入电网,配备GPU和现场发电设备,开发商可借此判断系统能否承受AI负荷的波动。一家电力供应商表示将利用该设施测试电池、软件及其他设备,以平抑数据中心与电网之间可能造成损害的振荡。

AI数据中心的供电稳定性问题,正从技术细节演变为决定行业投资回报率的关键变量。全球约945太瓦时的电力需求增长预期,叠加设备可靠性挑战,正在推动AI算力基础设施的估值锚从"GPU数量"向"供电质量与系统稳定性"延伸。

免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。

精彩评论

我们需要你的真知灼见来填补这片空白
发表看法