模型排行榜

DeepSeek发布V4.1-Flash,763B参数、100万token上下文

发布日期:2026-09-15

事件概述

DeepSeek 正式发布 V4.1-Flash,一个 7630 亿参数的开源权重 MoE 模型,采用新的因果编码器-解码器架构,具备原生多模态视觉与 100 万 token 上下文窗口,生成速度超过 400 tokens/s。尽管参数规模是上一代的 2.5 倍,架构改动把 KV-cache 占用压到前代的 13%-25%。

核心要点

  • 架构:763B 参数 MoE + 因果编码器-解码器 + 原生视觉,100 万 token 上下文
  • 效率:KV-cache 降至前代 13%-25%;官方口径下 HBM 与 SSD 需求分别降至 1/4 与 1/8(较初代 KV Cache 累计缩小 437 倍)
  • 定价:错峰价输入 0.15 美元/百万 tokens、输出 0.60 美元/百万 tokens
  • 节奏:V4 Pro 于 9 月 14 日退役,官方同步推进新模型路由过渡

行业意义

在数据增量枯竭、推理成本高企的双重约束下,这一版的看点不是参数量,而是“用架构换显存”——把长上下文与多模态的真实代价压下来。这与本站在《AI进入推理时代,内存(HBM)和闪存(NAND)将会如何演进》中的判断一致:推理时代的竞争,落在带宽、容量与成本的分层效率上。

来源:AI Briefing(2026-09-13)

本站声明