从一块晶圆到600MW: Cerebras把推理速度做成基础设施生意

潘驴邓晓闲缺一
08-19

技术指标仍然重要,但市场的观察坐标已经向云推理增速、数据中心容量、系统交付与客户利用率移动。

Cerebras Wafer-Scale Engine 3

Supernova 2026之后,Cerebras的研究框架发生了明显变化。晶圆级处理器仍是技术底座,但公司的经营变量已经延伸到数据中心、云端推理、异构计算和机架级系统工程。对于资本市场而言,单次benchmark只能证明性能,持续收入需要容量、利用率和交付能力共同兑现

600MW之后,Cerebras开始按基础设施公司定价

2026年第二季度,Cerebras GAAP收入为1.801亿美元;Core Revenue达到2.10亿美元,同比增长103%。其中,Core Cloud Revenue同比增长287%,云业务增速明显快于整体收入。Core Gross Margin为41%,剩余履约义务(RPO)达到254亿美元

基础设施端,公司披露已有超过600MW数据中心容量处于运行或签约状态,并计划在2027年底前交付;2026年制造能力计划提升超过10倍。订单储备、数据中心和制造端同时扩张,商业模式已经从设备销售进一步向持续性的推理服务收入倾斜。

Cerebras经营数据图

图1|经营重心从单点芯片能力转向云推理、容量与交付

600MW给出了潜在供给规模。收入斜率取决于其中有多少容量能够按时上线,并转化为高利用率的推理收入。已签约容量决定潜在上限,上线节奏与利用率决定实际收入斜率

44GB对432GB:两套内存逻辑押注不同瓶颈

Cerebras CS-3拥有44GB片上SRAM,片上内存带宽约21PB/s。AMD MI455X的HBM4容量为432GB,峰值内存带宽23.3TB/s。两组参数处于不同内存层级,不能直接换算成模型性能倍数,但足以反映架构取向。

GPU路线持续增加HBM容量和带宽,以承载更大的模型工作集、KV Cache和高吞吐任务;Cerebras把大量SRAM放在晶圆内部,减少计算单元等待数据的时间。对实时推理而言,首token延迟和连续token生成速度直接影响用户体验,数据搬运效率因此成为Cerebras最核心的性能支点

AMD与Cerebras内存逻辑对比

图2|HBM与片上SRAM属于不同层级,比较重点在架构取向

AMD合作把Cerebras放进异构推理链条

AMD与Cerebras正在推进Disaggregated Inference,将一次LLM推理拆成prefill和decode两个阶段。AMD Helios承担高吞吐prompt处理,Cerebras Wafer-Scale Engine负责低延迟decode和token generation。双方预计,联合方案最高可实现5倍tokens/s/Watt,并计划在2026年下半年首先通过Cerebras Cloud提供。

这套架构的产业含义很直接:Cerebras无需覆盖全部AI计算负载,只要在延迟溢价最高的decode环节建立稳定优势,就能进入大型AI基础设施的生产链条。AWS也计划把类似的解耦式推理能力引入Amazon Bedrock,时间点指向2027年第一季度。

AMD与Cerebras解耦式推理流程

图3|AMD负责高吞吐prefill,Cerebras负责低延迟decode

判断:异构推理如果进入规模化生产,Cerebras的竞争边界会从“替代GPU”扩展为“占据GPU体系中的高价值推理节点”。这会降低生态完整度不足带来的进入门槛。

CS-4的重点已经延伸到机架级经济性

CS-4由三颗WSE-3 Turbo组成,并采用Nexus Rack-Scale Platform。公司给出的内部benchmark与预测数据显示,相比CS-3,CS-4最高可实现2倍性能和10倍token capacity;与GPU系统相比,推理速度最高可达30倍。上述性能结果会随模型、配置和工作负载变化,不能把峰值倍数直接外推到所有生产场景。

更值得跟踪的是系统工程指标:组件数量减少50%,自动化制造比例提高60%,部署时间由数天压缩到数小时,首批CS-4在本季度开始出货。数据中心运营商最终关心的是每MW能够产生多少有效token,机架密度、供电、液冷、部署速度和故障维护都会进入单位经济性。

Cerebras CS-4升级图

图4|CS-4的产品竞争由芯片性能延伸至机架、制造与部署效率

Cerebras数据中心系统

Cerebras系统集群

CrowdStrike给出了低延迟的商业化样本

CrowdStrike计划使用Cerebras推理能力支持Falcon AI Detection and Response。网络安全对延迟高度敏感:攻击窗口以秒计,模型需要完成上下文收集、推理、工具调用和响应,额外等待会直接削弱产品价值。对于这类负载,推理速度能够映射到实际业务结果。

同样的逻辑也适用于Coding Agent和实时工作流。Cerebras已经披露Cognition、Lovable等云容量合作,客户还覆盖Block、Figma、AlphaSense和GSK。投资判断需要继续追踪客户数量之外的两个变量:单客户算力消耗强度,以及高频应用能否拉高云端利用率

320美元估值情景,压力集中在2028年收入

估值情景(非公司指引)

2028E Core Revenue 71亿美元 × 14x EV/S

对应目标价格约320美元

这套估值框架的难点集中在收入兑现。Cerebras最新2026年Core Revenue指引为8.8亿—8.9亿美元;以中值8.85亿美元计算,2028年达到71亿美元意味着两年扩大约8倍,对应隐含年复合增速约183%。公司同时表示,2027年计划实现收入超过三倍增长。

14倍EV/S属于高成长基础设施资产的激进定价。若云业务利用率、毛利率或产能爬坡低于预期,估值倍数和收入基数可能同时承压。当前Core Gross Margin为41%,全年指引为41%—43%,后续扩张能否保持毛利率稳定,是验证商业质量的关键指标。

07接下来只看四组兑现指标

1上线MW:签约容量有多少按计划转为可计费算力。

2云利用率:Core Cloud Revenue高增速能否持续,并形成更稳定的收入结构。

3毛利率:重资产数据中心扩张下,Core Gross Margin能否维持40%以上。

4合作落地:AMD与AWS解耦式推理的生产时间表能否兑现。

Cerebras已经用晶圆级架构证明低延迟推理可以形成显著性能差异。接下来的核心问题只有一个:600MW能否转化为持续、可复制、具备合理毛利率的推理收入。

技术领先已经被市场看到,估值接下来只认兑现。

资料口径

经营数据、CS-4、AMD合作、CrowdStrike合作及产品参数来自Cerebras与AMD官方公开信息;估值部分为情景测算,非公司指引。涉及“最高”“最多”等性能数据均为公司benchmark、预测或特定配置口径,实际表现取决于模型、系统配置与工作负载。

免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。

精彩评论

我们需要你的真知灼见来填补这片空白
发表看法