模型排行榜

人类语料基本训练完毕,现在大模型的升级核心是在做什么?

发布日期:2026-09-15

"数据墙"这个词已经喊了三年。但 2026 年它不再是一个预测,而是一件已经发生的事——能被廉价、合法、干净地拿来预训练的人类文本,基本被读完了。高盛首席数据官在 2025 年说过一句很直白的话:"We've already run out of data." 到了 2026 年,这句话在工程上已经不需要解释。

很多人据此得出一个错误推论:大模型的进步要停了。事实恰恰相反——过去两年模型能力的跃升,正是在数据墙被撞上的同一年开始的。这两件事同时发生不是巧合。

先把结论摆在前面:当"人类写的字"不再是增量,升级的核心就从"读得更多"变成了"把每一分算力花在能验证的地方"。拆开看是四根杠杆:合成数据、可验证奖励的强化学习、测试时计算、以及数据来源的重构。下面逐个说清楚它们各自在解决什么、又卡在哪里。

一、先把"人类语料训练完毕"这件事说准

它不等于"网上没字了",而是"边际上最便宜的那部分高质量文本没有了"。Epoch AI 的估算是目前业界引用最多的口径:人类公开文本的有效存量约 300 万亿 tokens(重复训练折算后,90% 置信区间 100T 到 1000T),按当时的训练规模与过训练趋势推演,这个存量会在 2026 到 2032 年之间被完全用尽

更能说明问题的是"消耗速度"这一侧。训练数据集规模近年以每年约 2.7 倍的速度增长(约每十个月翻一倍);单个前沿模型的训练数据量,从 2020 年 GPT-3 的约 3000 亿 tokens,涨到 GPT-4 时代的约 12 万亿,再到 2025-2026 年前沿模型的 15 万亿以上——五年涨了约 50 倍,而存量的上限是固定的。

还有一个容易被忽略的加速器:过训练(overtraining)。为了让推理更便宜,现在的模型普遍用"更小的参数、更多的数据"来训,Llama 3-70B 就是约 10 倍的过训练。Epoch AI 的推演很直接——若按 5 倍过训练,存量会在 2027 年前后用尽;若按 100 倍过训练,2025 年就已经用尽。

数据墙不是一个时间点,而是三档数据依次到期的过程 2020 2026 2030 2040 2050 2060 已用尽 高质量语言数据(书籍、精选网页、编辑内容)——2026 年前 正在逼近 低质量语言数据 2030-2050 尚有窗口 图像与视觉数据 2030-2060 最大增量在多模态:网络上的图像与视频约 4,000 万亿视觉 tokens,可把可用池扩到 400T 至 20 千万亿级 口径:Epoch AI 对人类公开文本有效存量约 300 万亿 tokens(90% CI 100T-1000T)的推演

还有一个国内更贴身的事实:中文语料比英文更紧。公开估算里,英文文本与数据资料的规模大约是中文的 8 倍;同时中文高质量语料的开源生态不如英文成熟,企业更倾向于自采自用,导致可流通的、权属清晰的训练语料更少。所以"数据墙"对中文模型是更硬的约束。

到这里,摆在所有实验室面前的路其实只有三条:(向版权方授权付费)、(用模型生成合成数据)、(把训练信号从"文本"换到别的载体,比如多模态、比如可验证的任务)。而这三条路,正好定义了 2026 年大模型升级的全部核心。

二、升级的杠杆,已经从预训练挪到了后训练

这是全文最关键的一个转折点,也是外界最容易漏掉的一条数据。

欧盟《人工智能法案》起草时,"预训练算力"被当作模型能力的代理指标,因为那个时代预训练占训练总计算量的 90% 到 99%,算力越多、模型越大、能力越强,这条对应关系几乎不会错。Epoch AI 在 2026 年的分析里明确指出:这个代理指标已经失效了。原因很朴素——现在真正吃算力、也真正出能力的环节,是蒸馏、合成数据、奖励模型训练和推理后训练,而它们全都不在"预训练"这三个字里面。

最能说明边际回报已经反过来的,是 OpenAI 自己公布过的一组对比。GPT-4o 在 GPQA Diamond 上约 48%、在 MATH Level 5 上约 50%;而 o1-high——只是在 GPT-4o 基础上追加了推理训练与推理时扩展(也就是后训练那一段,用掉的额外算力相对很小),同样的两个指标跳到了 77% 和 95%。Epoch AI 的判断是:如果把同样这笔额外算力拿去继续预训练 GPT-4o,性能几乎不会动。

同一个基座,少量后训练算力带来的跃升:预训练的边际回报已被反超 GPQA Diamond GPT-4o 48% o1-high 77% MATH Level 5 GPT-4o 50% o1-high 95% 同样的额外算力若用于继续预训练,性能提升可忽略 — 边际回报的排序已经反转

由此带来三个非常具体的现象,你在 2025-2026 年的模型发布里都能看到:第一,参数规模不再狂飙,主流模型的参数级别趋于稳定,涨的是训练时长;第二,算力配比大幅右移,原本留给预训练的算力被挪去跑强化学习;第三,升级的战场从"读懂世界"变成"做对事情"——语言、知识、常识这些预训练最擅长的东西已经足够好,缺的是长链条推理、规划、工具使用和自我纠错。

换句话说,预训练解决的是"见过什么",而在人类语料读完之后,它已经接近饱和;真正还有大空间的,是"会不会想、会不会验证"。这就是后训练与推理时计算同时爆发的根本原因。

三、四根杠杆:各自解决什么,又卡在哪

3.1 合成数据:问题不是"能不能用",而是"怎么不塌"

数据墙最直接的反应,是让模型自己造数据来训下一代。这条路上最重要的一批研究结论,几乎是反直觉的:

第一,"模型坍缩"(Model Collapse)分两个阶段,而早期阶段最危险。Shumailov 等人在《自然》上给出的界定是:早期坍缩是模型开始丢失分布尾部信息(受影响的往往是少数类、冷门知识、小众语言),但整体指标可能看起来还在变好,所以极难察觉;晚期坍缩才是大面积性能崩坏、概念混淆、输出多样性丧失。

第二,不需要迭代自训练,单次训练就会出事。发表于 ICLR 2025 的"强模型坍缩"(Strong Model Collapse)证明:在 scaling law 的框架内,训练语料里只要有约 1% 的合成数据,scaling law 就可能失效——数据越多、性能不再提升,曲线变平甚至反转;而且更大的模型反而可能放大坍缩(因为容量越大,越有能力把合成数据带来的分布伪影记下来)。

第三,避免坍缩的关键动作是"累加"而不是"替换"。2024 年的一项工作证明:只要每一代合成数据都追加在原始真实数据之上(而不是替换掉真实数据),测试误差就有与迭代次数无关的有限上界,坍缩可以避免;一旦用合成数据替换真实数据,误差就会无界增长。这条结论在工程上的含义很直接——真实人类数据是这个系统的锚,不能被丢掉。

第四,验证器不是解药,而是把坍缩"挪了个地方"。2025 年的后续研究指出:在"生成-验证-重训练"的循环里引入外部验证器(人工或更强的模型),短期内能避免坍缩并提升性能,但长期迭代会让模型参数收敛到验证器的知识中心——它不再收敛于真实分布,而是收敛于"验证器眼中的分布"。验证器有系统性偏见,模型就继承这份偏见。验证不是消除坍缩,是转移坍缩。

2026 年 8 月的一篇工作从另一个角度补了一刀:在扩散模型上,坍缩的本质是从"泛化"退化为"记忆",而直接驱动它的是每一轮合成训练数据熵的急剧下降。于是论文干脆用"熵"作为数据筛选指标去反向缓解坍缩。与之呼应的是一个更早的旁证:2026 年 4 月 ChatGPT 输出频繁冒出"哥布林"(某些设置下 OpenAI 自述增幅超过 3881%),第三方评论普遍把它当作坍缩症状的一个现实注脚。

所以合成数据的真正天花板,不是生成能力,而是验证能力。这也解释了一个正在发生的价值重估:2022 年以前、能证明"纯人类产出"的数据集,稀缺性上升;数据溯源(provenance)从工程细节变成了资产本身。

3.2 后训练强化学习(RL/RLVR):训练流程从三步变成四步

如果只能用一句话概括 2025 年之后大模型能力提升的主因,是这句:训练流程从"预训练 → 监督微调 → 人类反馈强化学习"三步,变成了四步,新增的第四步叫 RLVR(可验证奖励的强化学习)。OpenAI 的 o1 在 2024 年底首次演示了这条路线,o3 在 2025 年初让它变成公认的转折点。

它的机制很朴素:不再依赖人类打分,而是构造确定性的、无法被"刷分"的奖励——数学题答案唯一且正确、代码是否通过测试、形式化命题是否被证明。因为奖励不可投机,模型没法靠迎合评分器取巧,只能真的把问题解决,于是可以支撑极长时间的优化,把大量算力真正烧在推理能力上。

但它带来的代价同样鲜明,且直接决定了大模型能力的"形状":

一是"锯齿状智能"。RLVR 在可验证领域(数学、编程、形式逻辑)形成能力尖峰,而在没有明确对错标准的开放场景里反而会犯低级错误——专业领域像天才、现实世界像新手,这种参差本身就是这套训练范式的产物。

二是探索能力被压缩。RLVR 训练容易出现策略熵快速下降,模型越来越集中在少数高奖励路径上,分布外泛化因此受限。

三是估计存在系统性偏差。GRPO 这类方法常用的组内优势估计,统计上会持续低估难题的优势、高估简单题的优势——结果是模型倾向于回避困难问题。

四是一部分研究者的质疑:RLVR 主要提升的是"从基础模型里采样出正确答案的效率",而不是挖掘出基础模型本来不具备的新推理能力。换言之,它更像是"把已有的潜力榨出来",而不是"长出新的能力"——这个判断目前仍有争议,但它划出了能力上限的位置。

2026 年的主要工作量,都花在修这些问题上。工程界的进展方向很清晰:信用分配(不只是给最终答案打分,而是把功劳分配给正确的推理步骤,代表方法有 ConSPO、SCRL、以及时间维度上的信用调度)、难题的梯度信号(把难题拆成可验证的子问题,SCRL 在 Qwen3-4B-Base 上平均比 GRPO 高 4.1 分,难度越高收益越大)、防止奖励作弊(SMEPO 用语义遮蔽把专家轨迹里的答案遮掉,只留解题路线,比 GRPO 最多高 3.2 分、训练时间最多降 4.2 倍)。还有一个有意思的发现:RLVR 训练中权重的变化惊人地线性,据此提出的"权重外推"可以在不训练的情况下直接算出未来的模型,实现了最高 6.1 倍的训练加速。

而真正的天花板不在算法,在验证的边界。RLVR 之所以强,是因为数学和代码有"客观裁判";可现实世界的大部分任务没有。行业公认的下一步挑战,就是把这个范式从"可验证"扩展到"半自动验证",乃至"不可验证"的广阔领域——这一步能不能走通,决定了大模型能不能从"解题能手"变成"办事能手"。

3.3 测试时计算:第二条 Scaling 轴,验证仍是硬骨头

第三条路不碰训练,而是改推理:模型权重一个字不改,让它想久一点。这条路在 o1 之后成为主流共识,被称作测试时计算(test-time compute)或推理时扩展。

常见的四种做法:更长的思维链(让它把中间步骤写出来)、多候选采样(生成多个答案再挑,如 best-of-N、自洽性投票)、在推理树上搜索(分支探索 + 剪枝)、自我验证与修订(先草稿再自查再改)。核心思想是:难题值得"多想一想",简单题不值得——于是算力第一次变成可以按查询动态调节的旋钮,而不是训练时一次性固定的成本。

有意思的是,加州大学伯克利分校的研究发现,在合适的算力预算与推理策略下,小模型在某些竞赛数学题上可以胜过体量大得多的模型。这给"小模型 + 更多思考时间"的部署路线提供了依据。

但这条路的瓶颈非常清晰,而且和 3.1 节是同一个:生成候选容易,判断哪个候选可信才是难的。代码可以跑测试、算式可以用工具重算、形式化命题可以交给证明器——这些"硬验证"只在有限领域有效(测试只覆盖一部分情况、证明器依赖形式化是否正确)。而开放式任务只能靠模型自己当裁判,已知的问题是:LLM 判别器存在系统偏见(偏好特定格式、偏好特定位置),更麻烦的是生成器和评估器往往共享同一套盲点——它自己审自己,错误会被原封不动地保留下来。

所以 2026 年这一块的工程共识大致是:只要有外部证据就用外部证据(跑测试、用工具重算、核对引用来源是否真的支持结论),实在没有就设置硬性的预算上限(token、候选数、时长、成本),并在高后果的动作上强制人工确认。测试时计算不是"想得越久越好",而是"把算力花在能验证的地方"。

3.4 数据来源重构:买、私有、多模态、以及"AI 之前"的数据

第四条路绕开"造",直接把数据来源换掉。这一块在 2026 年已经从技术问题变成了产业结构问题,也是资本开支之外最真实的"军备竞赛"之一。

买。过去两年,AI 公司从"全网抓"转向"签约授权"。OpenAI 累计签下约两打出版商与数据方协议,其中与新闻集团(News Corp)的交易据报道为 5 年 2.5 亿美元、与 Reddit 约 7,000 万美元/年、与《金融时报》约 500 万到 1,000 万美元/年;Google 与 Reddit 的协议据报道约 6,000 万美元/年,并与 Stack Overflow 达成授权;Amazon 与《纽约时报》据报道约每年 2,000 万到 2,500 万美元。Meta 也在 2025 年末与 CNN、福克斯新闻、《今日美国》等多家媒体达成 AI 数据授权,2026 年 3 月又与新闻集团签约。总体特征是:大部分交易金额从未公开,公开数字只是真实支出的下限。

而 Anthropic 走了一条完全不同的路:几乎不参与出版商授权,转而接受一份约 15 亿美元的版权和解(截至相关梳理时仍需法院最终批准)。两条路线的差别很值得琢磨——一条是"为数据付费",一条是"为过去的使用买单"。

私有与驻留。数据在哪、由谁控制,正在直接影响部署。一个典型的 2026 年现象是:国产开源模型开始被部署到美国与欧盟本地数据中心(DeepSeek、Kimi、GLM 等经第三方平台托管),动因不是性能,而是数据驻留要求。数据主权正在变成模型的第二张入场券。

多模态。这是存量的最大补充:网络上的图像与视频折合约 4,000 万亿视觉 tokens,能把可用训练池从"300 万亿级文本"扩到"400T 至 20 千万亿级"的总量。但这里的瓶颈不是量,而是标注、对齐与算力——视频 token 的获取成本远高于文本。

"AI 之前"的数据。这是最反直觉的一条:因为合成数据会污染训练集、且区分人写与机写越来越难,2022 年之前、可证明未被生成式模型污染的数据,正在从"廉价原料"变成"稀缺资产"。谁保存了带溯源信息的历史语料,谁就握着下一代模型的锚。

杠杆 在解决什么 代表进展(2025-2026) 真正的约束
合成数据 补上消失的增量文本 强模型坍缩(1% 污染即使 scaling law 失效);累加而非替换可避免坍缩;验证器路线;熵筛选 验证能力;验证器偏见会变成模型偏见
后训练强化学习 从"见过"到"会推理" o1 演示、o3 转折;ConSPO / SCRL / SMEPO;权重外推最高 6.1x 加速 只能用在可验证领域;锯齿智能;策略熵下降
测试时计算 不训练也变强,按查询调算力 更长思维链、best-of-N、推理树搜索、自验证;小模型可越级 候选的判定(验证);延迟与成本随 token 线性上涨
数据来源重构 把"抓"换成"买 / 私有 / 多模态" 出版商授权成常态;约 15 亿美元版权和解;多模态约 4,000 万亿视觉 tokens;数据驻留部署 成本、版权、合规;视频 token 获取昂贵

注:授权交易金额来自公开报道,多数协议未披露具体数字,公开值应视为下限;Anthropic 的版权和解在相关梳理时仍需法院最终批准。合成数据与 RLVR 部分为学术论文结论,其中"强模型坍缩"及"验证器收敛"含理论推导与简化设定,规模推广至前沿模型仍有待验证。

四、把四条路合起来看,升级的核心到底是什么

回到标题那个问题。

在过去十年,"让模型更强"这件事的答案非常单一:更大、更多、更久——参数更大、数据更多、训练更久。而 2026 年的答案变了,变成了一句听起来平淡、执行起来极难的话:让每一份算力都花在可以被验证的地方。

四条路看似各管一摊,实际上被同一件事串起来:它们都在为"缺少人类数据"之后的世界,寻找新的、可信任的信号源。预训练的信号是"下一个词是什么",这信号廉价、海量,但存量已尽;合成数据的信号是"模型自己生成的答案",但它会自我污染,需要一个外部裁判;测试时计算的信号是"多生成几个候选再挑",可它同样依赖裁判;RLVR 的信号是"数学与代码的客观判定",这是目前唯一一个既廉价又无法被投机、还能源源不断产生新信号的来源——所以它会成为这一轮的主角,也因此被牢牢限制在"可验证"这个圈里。

对比维度 预训练时代(数据充裕期) 现在(人类语料读完之后)
核心瓶颈 算力(芯片够不够) 可验证的信号(数据够不够、判得准不准)
算力分配 预训练占 90-99% 大量右移到后训练与推理时计算
主要动作 把参数和数据调大 优化推理策略、信用分配、数据筛选
能力增长点 知识广度与语言流畅度 长链条推理、规划、工具使用、自我纠错
能力形状 整体平滑提升 锯齿状:强项极强、弱项低级出错
最贵的东西 GPU 干净的、可溯源的、可验证的数据与任务
升级的杠杆从一根变成四根,但它们共用同一个瓶颈:谁来当裁判 后训练 + 推理时计算 算力右移的落点 合成数据 需要验证器过滤 RLVR 奖励本身即裁判 测试时计算 选谁要判得准 数据来源重构 买 / 私有 / 多模态 一句话 数据够不够只是第一关;能不能判对,才决定了这条路能走多远

结语

人类语料训练完毕,这不是大模型的终点,而是范式切换的分界线

在分界线之前,模型的能力靠"读"来换——喂进去更多更好的文本,它就自然地变聪明。这条路走到 2026 年,边际收益已经很低:最好读的读完了,剩下的要么贵、要么脏、要么不能读。在分界线之后,能力要靠"练"和"想"来换——用可验证的奖励去强化推理策略,用更多的推理时算力去换取更可靠的答案,用更严格的验证去筛选合成数据。

而这四根杠杆最终都压在同一件事上:谁有资格当裁判。数学和代码能当裁判,所以它们先突破了,也造就了今天这种"数学天才、生活白痴"的锯齿状智能;而现实世界里绝大多数任务没有现成裁判,所以这一步能不能迈过去,决定了大模型是继续留在"解题工具"的位置上,还是真的进入"能办事"的阶段。

对关注这个行业的人来说,值得盯的也不再只是"下一个模型有多少参数、多少 tokens",而是那几个更能说明问题的问题:它的验证信号从哪来?合成数据占比多少、有没有保留真实数据的锚?后训练算力占多大比重?评测体系有没有跟着更新——毕竟连 GPQA Diamond 都已经因为饱和而被主流的智能指数下掉了。

人类写的东西读完了,接下来要读的是世界本身。

资料来源:Epoch AI《Will we run out of data?》(人类公开文本有效存量约 300 万亿 tokens,2026-2032 用尽窗口)与《Will we run out of ML data?》(分层耗尽时间表)、Epoch AI《Three challenges facing compute-based AI policies》(预训练占训练算力 90-99% 的代理指标失效、GPT-4o 与 o1-high 对比)、Shumailov 等《Nature》模型坍缩研究、Dohmatob 等"强模型坍缩"(ICLR 2025)、Gerstgrasser 等《Is Model Collapse Inevitable?(2024)》、Yi 等合成数据验证器研究(2025)、arXiv 2509.16499(扩散模型坍缩的泛化到记忆转变,2026)、RLVR 学术与产业梳理(o1/o3 节点、ConSPO/SCRL/SMEPO、权重外推、GLM-4.7 相关表述)、LLM Pulse 与公开报道的 AI 内容授权交易梳理(2023-2026)、央视网关于头部 AI 企业与权威媒体合作的报道(2026-06)。
本文为公开信息梳理与技术讨论,不构成任何投资建议。文中训练数据规模、存量估算、授权金额与论文结论存在统计口径、样本设定与简化假设差异,引用请以原始论文、官方披露与一手报道为准。

本站声明