DeepSeek发布V4.1-Flash,763B参数、100万token上下文
发布日期:2026-09-15
事件概述
DeepSeek 正式发布 V4.1-Flash,一个 7630 亿参数的开源权重 MoE 模型,采用新的因果编码器-解码器架构,具备原生多模态视觉与 100 万 token 上下文窗口,生成速度超过 400 tokens/s。尽管参数规模是上一代的 2.5 倍,架构改动把 KV-cache 占用压到前代的 13%-25%。
核心要点
- 架构:763B 参数 MoE + 因果编码器-解码器 + 原生视觉,100 万 token 上下文
- 效率:KV-cache 降至前代 13%-25%;官方口径下 HBM 与 SSD 需求分别降至 1/4 与 1/8(较初代 KV Cache 累计缩小 437 倍)
- 定价:错峰价输入 0.15 美元/百万 tokens、输出 0.60 美元/百万 tokens
- 节奏:V4 Pro 于 9 月 14 日退役,官方同步推进新模型路由过渡
行业意义
在数据增量枯竭、推理成本高企的双重约束下,这一版的看点不是参数量,而是“用架构换显存”——把长上下文与多模态的真实代价压下来。这与本站在《AI进入推理时代,内存(HBM)和闪存(NAND)将会如何演进》中的判断一致:推理时代的竞争,落在带宽、容量与成本的分层效率上。