KDA 的误读:K3 让算力需求更大,不是更小

线性注意力省下 KV cache,却把瓶颈推向 HBM 与机柜级互连

2026.07.19 · 技术前沿

[CHIP]市场把线性注意力读成"利空英伟达"。SemiAnalysis 说反了——省的是 KV cache,涨上来的是 HBM、专家路由与机柜级互连。

7月16日,月之暗面发布 Kimi K3,2.8 万亿参数,全球最大开源权重模型。当天英伟达收跌 2.2%,像极了 DeepSeek R1 那一夜。

空头逻辑很直接:KDA 属线性注意力,KV cache 的网络带宽压力最高降约 10 倍。一听,卡是不是要卖不动了。

SemiAnalysis 直接反驳:"the opposite is true" (事实恰恰相反)。KDA 省的是注意力状态,省不掉 2.8 万亿权重——单模型权重就要占 1.5TB 以上 HBM—— SemiAnalysis 2026.07.18

更关键的是 WideEP:896 个专家摊到多卡,每卡只放一部分,代价是每个 token 都要跨卡 all-to-all。省了这头,互连那头反而更饿。

瓶颈迁移:省下的与涨上来的KDA 降 KV cache,WideEP 与 2.8T 权重把压力推向 HBM 与互连KDA 线性注意力KV 带宽 ↓ 最高 10x2.8 万亿权重≥1.5TB HBM 常驻WideEP 896 专家token 跨卡 all-to-allHBM + 互连需求 ↑ 不降反升64 卡超节点起步来源:SemiAnalysis 2026.07.18 · Moonshot AI 官方技术说明 · Tenten AI 2026.07.18

于是官方建议 64 卡以上超节点部署。

这正是 GB300 NVL72 的主场:72 卡、20TB 显存、130 TB/s NVLink,机柜内带宽是 DGX B200 的 18 倍。

delta 在瓶颈迁移:省下的是单卡 FLOPS 叙事,涨上来的是 HBM、铜背板与 scale-up 域。

HBM 2026 年已被 SK 海力士、美光订到售罄,DRAM 一季 ASP 同比涨 136%。

被忽视的赢家是** 950——同走 64 卡超节点、自研 HBM。

出口管制逼出的,恰是国产 scale-up 的需求。越省,越买。

免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。

举报

评论

  • 推荐
  • 最新
empty
暂无评论