V4.1 把 HBM 需求砍到 1/4
一个模型的缓存工程,劈开了存储超级周期的成本曲线?
2026.09.11
DeepSeek V4.1 Flash 把 KV Cache 对 HBM 的需求压到上一代的 1/4,对 SSD 压到 1/8。与初代模型相比,缓存已缩小 437 倍。
552B 参数 MoE,Causal-Encoder-Decoder 非对称结构。
输入激活仅 8B,输出激活 16B。上下文拉到 1M,输出上限 384K。
缓存胜利来自三处协同,缺一处都不成立。
技术参数对照
|
规格 |
V4 Flash |
V4.1 Flash |
|
每 token 全局 KV |
3,514 B |
890 B |
|
HBM 需求 |
基准 |
1/4 |
|
SSD 持久化需求 |
基准 |
1/8 |
|
上下文 |
— |
1M in / 384K out |
|
推理吞吐 |
— |
400 token/s |
|
许可 |
— |
MIT · 权重 510GB |
架构上,CSA2 把全局缓存与 Top-K 索引跨层复用。
精度上,训练阶段就用 FP4 直存全局 KV,官方称性能损失可忽略。
部署上,SWA 有界重放让滑动窗口缓存不必再写入 SSD。
定价同步落地:闲时缓存命中 0.02 元,未命中 1.0 元,输出 4.0 元。
缓存命中比未命中便宜 50 倍。Agent 循环里,账单大头就是命中。
相对旧版,缓存输入降 60%,未命中降 33%,输出降 11%。
"V4.1-Flash's KV cache needs just 1/4 the HBM." (V4.1 Flash 的 KV 缓存只需 1/4 的 HBM)—— DeepSeek 官方公告 2026.09.10
同一天,港股智谱收跌 10.5%,MiniMax 跌 9%。
真正被改写的不是某家的定价,是算力成本的定义权。
从"用多少卡"转向"缓存怎么分层"。存储厂、云厂、模型厂的毛利,都要重算。
9月14日12:00后,V4 Pro 请求将全部路由至 Flash。
继续触发:杰文斯悖论
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。
点赞
举报
登录后可参与评论

暂无评论

