KDA 的误读:K3 让算力需求更大,不是更小
线性注意力省下 KV cache,却把瓶颈推向 HBM 与机柜级互连
2026.07.19 · 技术前沿
[CHIP]市场把线性注意力读成"利空英伟达"。SemiAnalysis 说反了——省的是 KV cache,涨上来的是 HBM、专家路由与机柜级互连。
7月16日,月之暗面发布 Kimi K3,2.8 万亿参数,全球最大开源权重模型。当天英伟达收跌 2.2%,像极了 DeepSeek R1 那一夜。
空头逻辑很直接:KDA 属线性注意力,KV cache 的网络带宽压力最高降约 10 倍。一听,卡是不是要卖不动了。
SemiAnalysis 直接反驳:"the opposite is true" (事实恰恰相反)。KDA 省的是注意力状态,省不掉 2.8 万亿权重——单模型权重就要占 1.5TB 以上 HBM。—— SemiAnalysis 2026.07.18
更关键的是 WideEP:896 个专家摊到多卡,每卡只放一部分,代价是每个 token 都要跨卡 all-to-all。省了这头,互连那头反而更饿。
瓶颈迁移:省下的与涨上来的KDA 降 KV cache,WideEP 与 2.8T 权重把压力推向 HBM 与互连KDA 线性注意力KV 带宽 ↓ 最高 10x2.8 万亿权重≥1.5TB HBM 常驻WideEP 896 专家token 跨卡 all-to-allHBM + 互连需求 ↑ 不降反升64 卡超节点起步来源:SemiAnalysis 2026.07.18 · Moonshot AI 官方技术说明 · Tenten AI 2026.07.18
于是官方建议 64 卡以上超节点部署。
这正是 GB300 NVL72 的主场:72 卡、20TB 显存、130 TB/s NVLink,机柜内带宽是 DGX B200 的 18 倍。
delta 在瓶颈迁移:省下的是单卡 FLOPS 叙事,涨上来的是 HBM、铜背板与 scale-up 域。
HBM 2026 年已被 SK 海力士、美光订到售罄,DRAM 一季 ASP 同比涨 136%。
被忽视的赢家是** 950——同走 64 卡超节点、自研 HBM。
出口管制逼出的,恰是国产 scale-up 的需求。越省,越买。
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。
点赞
举报
登录后可参与评论

暂无评论

