模型排行榜

推理算力反超训练:GPU 一半时间在空转,内存与 CPU 接棒

发布日期:2026-10-09

2026 年 10 月,AI 算力的重心正式从训练挪到了推理:最新一期行业分析的结论是,推理已经成为规模更大、增长更快的那一类算力支出;而最反直觉的一组数字来自芯片巨头自己——旗舰 H100 在推理负载下有 50% 到 80% 的时间处于空转。原因藏在解码阶段:每生成一个 token,芯片都要把全部权重从内存重新读一遍,瓶颈从算力移到了内存带宽。本文先讲清推理和训练为什么是两种完全不同的活,再梳理四条绕开内存墙的芯片路线,接着看内存与电力两道硬约束、以及被推理推出水面的存储层,然后看 CPU 与 GPU 的配比怎么被改写,最后把厂商宣称与可核验的部分分开摆。

先给一个总览:训练和推理的差异,不是"轻量版"和"重量版"的差异,而是两种负载形状的差异。训练要同时更新几十亿个参数,能把计算核心连续压满几个小时;推理的参数是冻结的,却要把同一批权重反复搬进搬出。评价好芯片的尺子,也随之从"峰值算力"换成了"每瓦能出多少 token"。

维度 训练 推理
参数状态 反向传播持续更新全部参数 参数冻结,只读不写
负载特征 连续数小时压满计算核心 预填充算力密集、解码带宽密集
精度要求 高精度为主,低精度会伤收敛 可降到 8 位甚至 4 位量化
关键指标 训练吞吐、算力利用率 首 token 延迟、每 token 成本、每瓦 token 数
硬件取向 通用灵活,跟得上架构演进 单点优化,牺牲通用性换吞吐

一、推理和训练,是两种完全不同的活

推理内部还分成两个性格迥异的阶段。第一个是预填充(Prefill):把用户输入的整段提示一次性读完,算出中间结果存进 KV 缓存,这一步接近传统的前向计算,算术强度高,能把算力用起来。第二个是解码(Decode):模型一个 token 一个 token 地往外吐字,而每吐一个 token,都要把全部模型权重和 KV 缓存从显存重读一遍——计算没变多,搬运量却在无限叠加。

训练、预填充、解码:同一块芯片,三种活

这里的关键概念是算术强度:每读入 1 字节内存,能做多少次浮点运算。训练的算术强度高,芯片大部分时间在做真正的计算,属于"计算受限";解码的算术强度极低,芯片大部分时间在等数据到位,属于"带宽受限"。这条分界线在体系结构里有个名字叫屋顶线拐点——拐点左边,堆算力没用,堆带宽才有用。

英伟达的推理业务负责人和长期跟踪存储行业的分析师都指向同一个结论:即便是旗舰 H100,在真实推理负载下也只有两成到五成的时间在算数,剩下的一半以上时间都在等内存。这不是驱动写得不好,而是自回归生成的数学结构决定的——你没法让"逐字输出"变成"一次算完"。

那为什么这个问题现在才爆?因为需求侧的形状变了。推理型模型会把一道题拆成很多步再回答,一次回答生成的文本量最多是早期模型的 20 倍;智能体一次会话消耗的 token 可达传统应用的 15 倍。当"想得深"变成产品的默认形态,解码阶段的搬运量就按同样的倍数放大,内存墙从理论问题变成了账单问题。

阶段 在做什么 压力在哪 适合的硬件
预填充 Prefill 一次读完整个输入,算出 KV 缓存 计算密集,算术强度高 通用 GPU
解码 Decode 逐个生成 token,反复重读权重与缓存 内存带宽密集,算术强度低 大缓存、高带宽专用芯片

二、芯片开始分化:四条绕开内存墙的路线

瓶颈换位置,钱就跟着换方向。过去两年融资最凶的一批芯片公司,做的几乎都是同一件事:让解码阶段少等内存。打法分成四条路线,激进程度递增。

四条路线:目标一致,都在绕开同一堵墙

路线一是堆带宽。Groq 的 LPU 用极致的内存带宽换解码速度,带宽约为标准 GPU 的 7 倍。这家公司的结局颇具象征意义:2025 年底被英伟达以 200 亿美元收购,它的推理加速器如今作为"第七颗芯片"被并进英伟达新一代平台,专门处理延迟敏感的推理负载。在位者买下挑战者,然后把挑战者的长板装进自己的机柜。

路线二是缩距离。d-Matrix 的做法是把计算与内存的物理距离从毫米级压到微米级,用堆叠结构让数据搬运的路径尽可能短。带宽问题的另一种解法不是把路修宽,而是把路修短。

路线三是换算法。Tensordyne 用对数数制替代常规数值表示,把耗电的乘法器换成简单的加法器。这一步优化的是每一步运算本身的代价——在电力成为硬约束的当下,省下来的每一瓦都有人愿意付钱。

路线四是把架构刻进硅片,也是最激进的赌注。Etched 由两位哈佛辍学生创立于 2022 年,它的 Sohu 芯片把 Transformer 结构直接固化在 4 纳米硅片上:不做训练、不跑卷积、不支持扩散模型,只执行注意力通路的推理。官方口径是吞吐达到 H100 的 20 倍、单卡每秒 50 万 token、峰值算力利用率 80% 以上。今年 8 月 18 日,首台机架交付给了一家量化交易机构,签约订单超过 10 亿美元,10 月初的融资传闻把估值推到 400 亿美元以上。它赌的是 Transformer 会在未来几年持续统治 AI 架构——赌对了就是推理时代的专用机,赌错了就是一块昂贵的定制硅。

同样在"专用"方向上还有更极端的晶圆级路线:把一整片晶圆做成一颗芯片,用超大片上缓存把权重留在计算单元旁边,OpenAI 已经用它承载对响应速度敏感的编程场景,云厂商也开始把它与自研芯片组合使用。

路线 代表 切入点 现状
堆带宽 Groq LPU 带宽约为标准 GPU 的 7 倍 被英伟达收购,并入新一代平台
缩距离 d-Matrix Raptor 计算与内存距离毫米级压到微米级 已发布加速器产品
换算法 Tensordyne Napier 对数数制加法器替代乘法器 初创阶段
刻进硅片 Etched Sohu Transformer 专用,宣称吞吐 20 倍 H100 首台机架已交付,尚无第三方基准
晶圆级 Cerebras 整片晶圆一颗芯片,超大片上缓存 已商用,进入头部实验室推理栈

在位者没有坐视。英伟达 10 月 1 日确认新一代平台全面量产:一颗 88 核 CPU、一颗 GPU、三颗网络芯片,再加上被收编的 Groq 推理加速器,七颗芯片拼成一个机柜级系统;官方口径是每 token 推理成本降到上一代的十分之一、训练混合专家模型只需四分之一的卡。另一边,OpenAI 与博通合作的定制推理芯片已经部署,配套的服务器 CPU 选择了 AMD 而不是英伟达——头部实验室开始按自己的负载画芯片边界,这是分化的另一半:不只芯片公司在变,买芯片的人也在变。

定制 ASIC 有清晰的适用条件:推理需求足够大且可预测、模型架构足够稳定、软件栈完全自主、量足够大摊薄设计成本。四大云厂商的自研芯片都踩在这四条线上。而 AMD 在 10 月初拉上韩国 14 家芯片公司做的则是另一件事:让 CPU、GPU 和 NPU 在同一个系统里各干擅长的事,做成对外的参考设计。异构——而不是替代——正在成为绕开单一供应商的现实路径。

三、绕不过去的两道墙:内存与电力

芯片分化只是故事的一半,另一半在芯片外面。第一道墙是内存:前沿模型规模每 6 个月翻一番,上下文窗口一年增长 5 到 6 倍,而一座 DRAM 晶圆厂从开工到量产要以年计——需求的斜率和供给的斜率根本不在一个量级上。券商的判断是这轮短缺会贯穿整个产业周期,而不是一轮补库存能解决的波动。

内存按温度分层:热在 HBM,温在 CXL,冷在 NAND

产业界的应对不是等新厂,而是三件事。第一件是降配:新一代机架的本地内存规格被主动下调——单机架从原计划的 54TB 砍到 28TB,单 GPU 的高带宽内存从 288GB 降到 192GB,用降低堆叠高度换整机出货量。降配并没有消灭瓶颈,只是把压力往层级下面转移:被削掉的高速本地内存,由更便宜的下层存储和更宽的网络互联来补。第二件是解耦:把预填充和解码拆到不同硬件上,算力密集的预填充交给通用 GPU,带宽密集的解码交给大缓存专用芯片,两段各自跑在各自的甜区里。第三件是池化:用新的互联标准把内存从单颗处理器解绑成机架级共享池,让"这台机器内存不够"变成"这个池子还够不够",相关市场被预计到 2030 年做到约 60 亿美元。

在这三件事下面还有一个更便宜的手段:量化。把模型内部的高精度数字压成 4 位表示,内存占用和搬运量同时缩小。头部开源模型的实测是量化后跑得快 3 倍、基准成绩损失不到 1 个百分点——这种曾经被视为"生产环境不敢用"的折衷,如今是标准操作。本质上,量化是在软件层面把"墙"往里推:墙没动,但需要搬过墙的东西变少了。

降配的另一个后果落在存储那一层。被削掉的高速本地内存不会凭空消失,只是往下沉——KV 缓存这类"不常被访问、但丢了就要重算"的数据,正在从显存和内存写回企业级固态盘。研报把这条路径说得很直白:降配不消除瓶颈,只是让压力在存储层级之间转移,非高频数据下沉到 NAND,跨卡的数据交互随之变多,反过来又推高网络互联的需求。券商上调存储需求预测时,理由也是同一句话:上下文越来越长、智能体越来越复杂,这部分缓存不可能全部住在最贵的那层内存里。

产业侧的动作比研报更具体,分三个方向。一是往机房搬:有厂商把超节点的 KV 缓存从显存与内存扩展到固态盘,单集群做到 64PB、单颗加速器可用的缓存从 GB 级提到 TB 级,代价是这部分数据的访问时延来到几十微秒的量级——比内存慢得多,但比"重算一遍"便宜得多。二是往底层放:存储原厂把"只读、但占大头"的模型权重直接下沉到 NAND 阵列,模拟测试里内存成本降到约六分之一,推理性能与纯内存方案几乎持平。三是造新层:把 NAND 像 HBM 那样堆叠起来、贴着 GPU 放的高带宽闪存,已经从两家存储大厂牵头的联盟走到标准——规范今年 8 月经开放计算项目发布,同等空间容量可以做到 HBM 的 8 到 16 倍,量产预期在 2028 年。

层级 介质 放什么 这一轮发生的变化
热 HBM(显存) 活跃权重、当前这步的 KV 缓存 降配:单 GPU 从 288GB 砍到 192GB
温 内存 / CXL 内存池 运行中的上下文与任务状态 池化:从单颗处理器解绑成机架级共享
冷 NAND(企业级固态盘) 溢出的 KV 缓存、历史对话、冷数据 下沉:产能从消费端挪向企业级,合约价环比仍在涨
新层 高带宽闪存(NAND 堆叠) 为 KV 缓存量身定做的中间层 标准已发布:容量可达 HBM 的 8~16 倍,2028 年量产

为什么这一层绕不过去?因为存储分层的驱动力是价格,不是偏好。HBM 最快也最贵、堆叠高度有上限;内存够大但仍然贵,只放得下正在用的数据;NAND 最便宜、容量最大,适合放历史与冷数据。当上下文从十几万 token 涨到百万级,KV 缓存按 token 数线性增长,每一层都得接住上一层溢出来的东西——这也是为什么这一轮行情里,内存、固态盘和网络互联被同一批买家同时推上前台。

第二道墙是电力。这一代平台的发布口径里最值得注意的不是倍数,而是单位:每兆瓦吞吐成了新的军备竞赛指标,甚至有配套产品专门承诺"同样的电力预算多塞 30% 的算力"。原因很具体:有巨型数据中心因为输电审批,满功率供电推迟到 2028 或 2029 年,项目成本上涨 75%,每月近 9 亿美元营收跟着推迟兑现。算力的上限不再由芯片决定,而由变电站决定——资本也因此在押注更极端的杠杆:有公司为购置芯片洽谈 400 亿美元债务融资,有实验室被报道每月租金支出超过 10 亿美元。推理经济学成了重资产生意,而重资产生意的第一课是:瓶颈在哪,钱就堵在哪。

四、配比也在变:短板从「生成」挪到「编排」

前面讲的都是芯片和存储怎么变,还有一件更安静、但同样彻底的变化:伺候一块 GPU 的 CPU,变多了。训练时代,CPU 与 GPU 的配比大约是 1:8——一块 GPU 配 8 到 12 个 CPU 核心就够,CPU 干的是数据搬运和任务分发。到了推理,配比收紧到 1:4 上下;而在智能体推理里,同样的数字被推到 80 到 120 个核心。英特尔与 AMD 两边对这条曲线的判断一致:从 1:8 到 1:4,再到 1:1;AMD 的说法更直接——在智能体密集部署的场景里,CPU 的数量可能超过 GPU。

训练、推理、智能体推理:伺候一块 GPU 需要的 CPU 核心数

为什么是 CPU?因为延迟不在"生成"里。智能体的一次任务不是一问一答,而是"思考—执行—观察—反馈"的循环:模型只负责生成下一步,真正的活——跑代码、抓网页、查数据库、编译、跑测试、校验结果、把状态在多个子智能体之间传递——几乎都落在 CPU 和主机侧。一项联合研究把五类典型智能体负载放上机架实测:CPU 侧的工具处理最高占到端到端延迟的 90.6%。但同一份研究也给出了反向的例子:有的负载里模型推理仍吃掉 77% 到 88% 的时延,检索类负载则是向量检索一项就占 81% 到 89%。所以准确的说法不是"CPU 反超 GPU",而是"看负载"——只是这一轮最热的几类负载,恰好都压在 CPU 侧。

阶段 CPU 与 GPU 的配比 伺候一块 GPU 的 CPU 核心 CPU 在干什么
训练 约 1:8 8~12 个 数据搬运、任务分发,主机节点角色
推理 约 1:4 16~24 个 请求调度、前后处理、KV 缓存管理
智能体推理 向 1:1 靠拢 80~120 个 任务编排、工具调用、沙箱执行、状态管理

硬件侧其实早就在跟着改。上一代旗舰机柜是 36 颗 CPU 配 72 颗 GPU(1:2),新一代平台把 CPU 做得更重(88 核),今年还单独推出面向智能体与强化学习的 CPU 机架——单架最多 256 颗,官方口径可以并发运行两万两千多个 CPU 环境,这个数字同样出自厂商口径,还没有第三方复核。CPU 变多也改写了内存的角色:KV 缓存从显存溢到主机内存和固态盘之后,CPU 不只是编排者,还得当"第二个仓库"——内存容量、内存带宽和 CPU 与 GPU 之间的互联速度,一起变成了系统性能的关键。

券商据此上调服务器 CPU 市场的规模:从 2025 年约 300 亿美元到 2030 年约 1700 亿美元,五年近 5 倍。但同一件事在不同机构嘴里差得很远——另两家给的是 390 亿到 2230 亿、350 亿到 1710 亿,方向一致、绝对量级差了三分之一到一半。更要小心的是传播中的变形:有机构给的其实是"极端复杂负载下 4:1 到 40:1"的区间,传到市场上就变成了"配比涨到 40:1、CPU 需求暴增 40 倍";而第三方换一个角度测算,每吉瓦数据中心需要的 CPU 核心从传统架构的约 3000 万颗升到智能体时代的约 1.2 亿颗——3 到 4 倍,和 40 倍差了一个数量级。

五、哪些数字要打问号

把上面这些数字放在一张桌子上看,会发现它们并不是同一种东西。

数字清单:哪些已量产,哪些还只是自家口径

最需要标问号的是专用芯片的倍数。"成本降到十分之一"这类口径,通常是在特定模型、固定输入输出长度的条件下测出的最优值,换成你的负载、你的上下文长度,数字会立刻变形。而 Transformer 专用芯片的 20 倍吞吐至今没有第三方基准——第一台机架是交付了,但公开世界里还没有一份独立测试报告能验证那些营销数字。下单前把它当方向看,没问题;把它当产能规划,风险自负。

第二层问号在需求侧。硬件分化的前提是推理需求持续按现在的斜率增长,但需求本身已经开始被更仔细地审视:头部实验室披露的年化营收口径与市场此前引用的数字之间出现过明显差额,数据中心项目因为通不了电而推迟的案例不止一起。如果 token 的消耗速度跟不上芯片的出货速度,这场分化就会以另一种方式收场——不是谁赢了,而是大家一起等需求。

第三层问号押在最激进的路线上:把架构刻进硅片,意味着把命运绑在"Transformer 长盛不衰"这个假设上。过去十年间 AI 的主流架构换过好几代,专用芯片的教科书教训一直是同一句——通用芯片活过每一个冬天,专用芯片只活在自己的春天里。这一轮的不同之处在于,推理需求足够大、足够稳定,专用化的窗口确实比以往任何一轮都宽。窗口宽,不等于没有边界。

结语

回头看,这一轮变化可以压缩成四句话。第一,评价芯片的尺子换了:从峰值算力换成每瓦 token 数,谁把内存墙处理得更好,谁就拿到下一个时代的定价权。第二,钱在往层级下面走:HBM 装不下的东西一层层往下溢,内存、固态盘、连 NAND 都被推理重新定价——存储不再是"配多大硬盘"的问题,而是算力能不能被释放的问题。第三,配比在重排:芯片公司在分化、买方也在分化,连"一块 GPU 配几颗 CPU"这个二十年没大动过的比例,都开始往 CPU 那边倒。第四,一切倍数都要问口径:10 倍、20 倍、35 倍,还有被传成 40 倍的配比,出处分属官方发布、高管访谈和券商预测,先看清哪个是量出来的、哪个是讲出来的。

对我们这些旁观者来说,最实用的判断方法也很朴素:下一次看到任何推理性能的倍数,先问三个问题——在哪个模型上测的、输入输出长度是多少、有没有第三方复核过。三问过后还站得住的数字,才值得写进自己的决策里。

口径说明:本文数据截至 2026-10-09。"推理算力反超训练"的判断与 H100 空转比例来自行业刊物 2026 年 10 月刊的分析,属行业口径而非实测基准;芯片性能倍数(10 倍、20 倍、35 倍等)均为厂商发布口径,测试条件多为特定模型与固定输入输出长度,未独立复核的数字已在文中与图内标注;内存降配、三条缓解路径与 CXL 市场规模预测来自券商半导体研报,预测数字存在不确定性;CPU 与 GPU 配比、每吉瓦核心数与服务器 CPU 市场规模均为机构预测或厂商口径,机构之间绝对量级差异较大,文中已并列呈现;存储下沉涉及的容量、成本与时延数字多为厂商实验或模拟口径;智能体负载的延迟分布来自学术实测,但不同负载之间差异极大,不能外推为普遍结论;融资与租金额度为媒体报道的洽谈中或传闻口径,未获公司确认。文中对架构演进与需求增长的判断为作者观点。
资料来源:IEEE Spectrum 2026 年 10 月刊推理专题分析、摩根士丹利半导体行业研报(2026-10-05)、英伟达 Vera Rubin 平台官方发布与量产公告、Etched 官方进度页及多家科技媒体报道、云厂商与芯片厂商公开发布会内容(含英特尔与 AMD 财报电话会口径)、佐治亚理工学院与英特尔联合研究《以 CPU 为中心的智能体 AI 视角》(2025 年 11 月首发、2026 年 4 月修订)、瑞银及多家投行半导体研究报告、集邦咨询存储市场简报、开放计算项目发布的高带宽闪存规范、存储原厂技术大会发布内容、Moor Insights 与 Artificial Analysis 等第三方分析、彭博社与华尔街日报相关报道。
本文为公开信息梳理与技术讨论,不构成任何投资建议。

本站声明