V4.1 把 HBM 需求砍到 1/4

一个模型的缓存工程,劈开了存储超级周期的成本曲线?

2026.09.11

DeepSeek V4.1 Flash 把 KV Cache 对 HBM 的需求压到上一代的 1/4,对 SSD 压到 1/8。与初代模型相比,缓存已缩小 437 倍

552B 参数 MoE,Causal-Encoder-Decoder 非对称结构。

输入激活仅 8B,输出激活 16B。上下文拉到 1M,输出上限 384K。

缓存胜利来自三处协同,缺一处都不成立。

技术参数对照

规格

V4 Flash

V4.1 Flash

每 token 全局 KV

3,514 B

890 B

HBM 需求

基准

1/4

SSD 持久化需求

基准

1/8

上下文

1M in / 384K out

推理吞吐

400 token/s

许可

MIT · 权重 510GB

架构上,CSA2 把全局缓存与 Top-K 索引跨层复用。

精度上,训练阶段就用 FP4 直存全局 KV,官方称性能损失可忽略。

部署上,SWA 有界重放让滑动窗口缓存不必再写入 SSD。

定价同步落地:闲时缓存命中 0.02 元,未命中 1.0 元,输出 4.0 元。

缓存命中比未命中便宜 50 倍。Agent 循环里,账单大头就是命中。

相对旧版,缓存输入降 60%,未命中降 33%,输出降 11%。

"V4.1-Flash's KV cache needs just 1/4 the HBM." (V4.1 Flash 的 KV 缓存只需 1/4 的 HBM)—— DeepSeek 官方公告 2026.09.10

同一天,港股智谱收跌 10.5%,MiniMax 跌 9%。

真正被改写的不是某家的定价,是算力成本的定义权

从"用多少卡"转向"缓存怎么分层"。存储厂、云厂、模型厂的毛利,都要重算。

9月14日12:00后,V4 Pro 请求将全部路由至 Flash。

继续触发:杰文斯悖论

免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。

举报

评论

  • 推荐
  • 最新
empty
暂无评论