模型排行榜

端上可运行的模型进展如何了,手机和电脑上能跑什么模型?

发布日期:2026-09-10

这个问题每年都被问一次,但今年的答案和去年完全不是一回事。2024 年"手机上跑大模型"还是个演示视频里的概念,2026 年它已经变成了操作系统的一个系统服务——你手机里那个帮你改写句子的功能,背后就是一个跑在设备本地的小模型。

先把结论摆前面,省得绕:端侧能跑的,是 1B 到 8B 这个量级、量化到大约 4 位的模型;它的能力边界是"有界任务"——分类、抽取、改写、短文档摘要、结构化输出、意图路由、端侧检索。前沿级大模型不会也不能上设备,不是没人试过,是物理上读不出那个速度。

真正决定"能跑多大"的从来不是算力,而是内存带宽和内存容量这两个数字。这句话是理解全文的钥匙,下面所有的对比都会回到它。

端侧 AI 的三层能力:什么上得了设备,什么永远上不了 第一层 · 手机(1B-4B,4bit 量化,约 4-6GB 内存) 系统级模型:苹果 AFM 3 Core(约 3B 稠密)、Gemini Nano(1.8B-3.25B) 做的活:实时翻译、语音转写、短文本改写、通知摘要、图片描述、跨应用指令拆解 第二层 · 电脑(8B-70B,甚至千亿级,靠统一内存) Mac 统一内存路线:64GB 装得下 70B;128GB 笔记本可跑 1200 亿参数(参考口径) 做的活:本地代码补全与调试、长文档处理、离线问答、端侧 RAG、多智能体编排 第三层 · 永远在云端(前沿级模型) 不是"还没优化好",是消费级手机的闪存与内存预算差了不止一个数量级 权重读不出来 → 生成速度不可用。开放域研究、新颖多步推理仍归云端

这张图是全文的骨架。下面按"手机能跑什么、电脑能跑什么、模型侧做了什么让它们跑起来"三块拆开看。

一、手机端:模型已经变成操作系统的系统服务

今年最大的变化不在应用层,而在更下面一层——两大手机操作系统都把一个小模型预装成了系统服务。这意味着一件事:过去你要自己解决"模型怎么分发、怎么更新、怎么适配机型",现在这件事被操作系统厂商替你做完了。

苹果这边,2026 年 6 月 8 日发布了第三代基础模型。AFM 3 Core 是那颗约 3B 的稠密端侧模型,苹果自评在 45.6% 的文本提示上被人类偏好(2025 年的端侧基线只有 23.3%),图像理解一项偏好率 61%。上面还有一个 AFM 3 Core Advanced:20B 总参数,但每次请求只激活 1 到 4B——它的做法是把整个模型放在 NAND 闪存里,而不是常驻内存,用"大知识库、轻计算"的方式绕开内存墙。

安卓这边,Gemini Nano 跑在 AICore 这个系统服务里,第三方应用通过 ML Kit 的 GenAI 接口调用,做端侧摘要、校对、改写和图片描述。v3 版本公开报道的口径是 1.8B 到 3.25B 参数、约 4096 token 上下文、4bit 量化、亚秒级延迟、每次推理零成本,代价是要约 12GB 内存加一颗旗舰芯片。

这里有个开发者和用户都该知道的事实:你的装机量是分裂的。据报道,Pixel 10、OPPO Find X9 这批 2026 旗舰跑的是 Nano v3,而 Pixel 9、Galaxy Z Fold 7 还停在 v2。任何假定"端侧只有一个模型能力"的功能,会在一大批用户身上表现不一致——而这种不一致最后会变成客服工单,不会变成指标。

厂商 / 体系 端侧参数量级 说明
苹果 AFM 3 Core 约 3B(稠密) 量化感知训练;Foundation Models 框架对开发者免费开放,无 API 费用
苹果 AFM 3 Core Advanced 20B 总量 / 激活 1-4B 稀疏激活,整模型驻留 NAND 而非内存
谷歌 Gemini Nano 1.8B - 3.25B 经 AICore 分发;约 4096 token 上下文,4bit,需约 12GB 内存
华为 盘古 3.0 10B - 100B 端云协同,按场景选规模(券商研报口径)
小米 MiLM 1.3B / 6.4B 轻量版侧重端侧高效部署
荣耀 魔法大模型 7B 聚焦核心功能落地
vivo 蓝心 / OPPO AndesGPT 1B - 175B 全梯度 端侧取小尺寸,大尺寸放云侧

说明:手机厂商参数量为券商研报与公开报道口径汇总,各家对"参数量"的统计方式不一致(是否含嵌入层、是否报总参数或激活参数),横比时需留意。Gemini Nano 的规格来自二手报道与社区文档,非谷歌官方规格页,落地前应以官方文档复核。

值得单独说一件今年发生的事:端侧模型开始不只"能聊",而是"能干活"了。9 月 1 日,努比亚 NaviX Ultra 拿到工信部入网许可,成为全球首款走完"大模型备案 + 终端入网"全套合规流程的 AI 智能体手机。它的关键设计有两个:一是核心大模型运算全部在手机端本地完成,用户数据不上传云端;二是不模拟人工点击,而是通过 MCP / A2A 协议直连第三方应用的开放接口来完成跨应用操作。这个路线选择的含义很直接——"能干活"的前提不是模型多大,而是应用愿不愿意把接口打开。

二、电脑端:真正的分水岭是内存,不是算力

先记住一句话:大语言模型生成文本,本质上是搬运数据。瓶颈始终是把权重从内存搬到计算核心的速度,而不是算得够不够快。自回归解码每一 token 都要把模型权重过一遍,这是典型的"内存带宽受限",不是"算力受限"。

这一条解释了一个反直觉的现象:一台 64GB 统一内存的 Mac,能跑 70B 模型;而一块 RTX 5090 跑不动。不是 5090 弱——它的带宽是 1792 GB/s,比 M5 Pro 的 307 GB/s 快得多;问题在于它只有 32GB 显存,而 70B 模型量化到 Q4 大约要 43GB。装不下就要溢出到系统内存,走 PCIe,速度从 66 tok/s 掉到 2-5 tok/s 的爬行状态。

两个数字决定一切:带宽决定多快,容量决定能不能跑 统一内存路线(大而慢) Mac mini M5 Pro 64GB · 约 307 GB/s · 70B 约 8-12 tok/s Mac Studio M5 Max 128GB · 约 460-614 GB/s · 70B 约 15-22 tok/s RTX Spark 128GB 统一内存 · 参考可跑 1200 亿参数 独立显存路线(小而快) RTX 5090 · 1792 GB/s · 8B 约 213 tok/s、32B 约 50-66 tok/s 但显存只有 32GB → 70B(约 43GB)装不下 一句话记住两句话 ① 模型装得进快速内存,带宽才有意义——装不进,再高的带宽也白搭 ② 手机端受限于功耗与散热,走的正是"高容量 + 低带宽 + 小模型"这条线 → 所以端侧的竞争,本质是"在多少瓦、多少 GB 里,把一个模型塞进去并跑顺"

数据来源:厂商公开规格与第三方横评汇总(2026 年 9 月)。tok/s 为特定模型与量化配置下的实测口径,不同机器、不同上下文长度差异很大,不构成性能承诺。

今年笔记本侧的转折点,是统一内存被推到了笔记本形态里。联想在 IFA 2026 发布的 Yoga Pro 9n,搭载英伟达 RTX Spark:把 20 核 Grace CPU 与 6144 个 CUDA 核心的 Blackwell RTX GPU 用 NVLink-C2C 连成一体,端侧峰值 AI 性能 1 PFLOPS(FP4 精度),最高 128GB 统一内存。英伟达给出的参考口径是可本地运行 1200 亿参数、100 万 token 上下文的大语言模型,而这是一台 16.7 毫米厚的量产机,不是概念机。

这里必须点破一个行业惯性:过去两年 AI PC 一直在比 NPU 的 TOPS。几十 TOPS 应付实时翻译、会议降噪够用,但承载不了完整的大模型推理——因为 NPU 的算力再高,也解决不了"48GB 显存放不下 43GB 权重"这种容量问题。RTX Spark 换的是另一条路线:不是把算力做高,是把 CPU 内存和 GPU 显存之间那堵墙拆掉。

平台 / 芯片 AI 算力 内存 本地能跑到哪一档
苹果 M5 133 TOPS 800+ GB/s 可跑 Qwen2.5 Coder 32B
苹果 M5 Max 133 TOPS 128GB 统一 完整 70B,无需交换
高通 Snapdragon X2 Elite 80 TOPS 最高 64GB 较上代提升 78%,覆盖 30B 级
AMD Ryzen AI 300 50 TOPS 最高 64GB ONNX Runtime 原生支持
英伟达 RTX Spark 1 PFLOPS(FP4) 最高 128GB 统一 参考 1200 亿参数 + 100 万 token
英伟达 RTX 5090 最快消费卡 32GB / 1792 GB/s 32B 以下称王,70B 撞墙
高通 Snapdragon 8 Elite Gen 5 约 45 TOPS 16GB(手机) Llama 3.2 3B 量化实时推理

顺带一个容易被忽略的商业现实:端侧硬件的买家,短期内是开发者和企业,不是普通消费者。2026 年全球 PC 出货量预测下滑 11.3%,真正需要本地大模型的主流消费者占比仍然很小。企业侧的动力完全不同——金融、医疗、法律这些行业的核心数据本来就出不了组织边界,端侧推理在这里不是"省钱方案",是合规前提

三、模型侧做了什么,让它们真的跑起来

硬件增益如果撞上"模型太大",一切都是零。真正的转折发生在 2025 到 2026 年之间,有四件事同时到位。

第一,量化从"事后压缩"变成了"训练时就考虑"。过去的做法是把一个训好的模型压到 4 位,精度掉一截;现在是在训练阶段就按低精度约束去训(量化感知训练)。苹果更极端,端侧模型是按 2-bit 精度从头训的——结果是一个 3B 模型在目标任务的素质上接近 8B,却能舒服地塞进 4GB 内存。

第二,架构上开始为"内存受限"而生。苹果的端侧模型分成两块,第二块完全复用第一块的 KV 缓存,一举砍掉 37.5% 的缓存占用。Gemma 4 系列则把混合专家(MoE)做到了小尺度:E2B 模型约 2.3B 有效参数(含嵌入层 5.1B),在 4GB 内存的设备上就能跑;26B 版本每次只激活约 4B。这就是 2026 年小模型的标志性思路——大知识库,轻计算。

第三,投机解码进了生产环境。用小模型快速猜出若干候选 token,再让大模型并行验证,把"一次只能出一个 token"的串行瓶颈打破,实测提速 2 到 3 倍。Ollama 在 2026 年 3 月的 0.19 版本里把推理后端换成 MLX,预填充速度提升 57%,这类工程优化是普通用户能直接感知到的那部分。

第四,小模型本身的素质真的变了。几个具体的对照:Llama 3.2 3B 在多个基准上追平了 Llama 3.1 8B,体积小 60%;微软 Phi-4-mini(3.8B)在结构化推理、数学和指令遵循上,已经超过 2023 年那批 70B 级模型;Mistral 的 Ministral 3 系列里,14B 推理变体在 AIME 2025 上拿到 85%。

国内这两周还有两个值得放进对照表的样本:

模型 参数量 这次的关键点
讯飞星火 X2.5-4B / 1.7B 4B / 1.7B 端侧首个原生支持最长 100 万 token 上下文;混合注意力架构;国产算力全流程训练。4B 的代码能力可对标大 2-3 倍的云端模型
面壁智能 MiniCPM5-2B 2B 真实任务评测 891 分(人类基线 1000),登顶 4B 以下,高于 Qwen3.5 9B(645 分)和体量约 6 倍的 Gemma 4 12B(647 分);已初步具备工具调用、深度搜索、代码生成等端侧 Agent 雏形

这两个样本放在一起看,指向同一个判断:端侧模型拼的不是"大而全",是"够用且高效"。它们不是云端旗舰的缩水版,而是为落地设计的一种不同技术方案。模型的通用能力可能不如旗舰全面,但部署成本更低、响应更快、更容易围绕具体业务调优。换句话说:它不需要什么都懂,只需要在用户真正需要的地方足够稳。

四、那"端云分工"的边界画在哪

把上面三块合起来,2026 年的实际答案已经很清楚了:赢的不是"端侧取代云端",而是分层。

端云分层:一个智能体任务里,80-90% 的步骤可以留在本地 本地小模型(3-9B)承担 解析输入 · 调用工具 · 格式化结构化结果 · 意图路由 · 端侧检索 · 大部分循环步骤 升级到云端旗舰的,只有真正难的推理 开放域研究 · 新颖多步推理 · 需要广博世界知识且无检索兜底的问答 顺带解决了一半隐私问题 只有升级的那一小部分才出网 → 哪些内容允许出网,可以由你逐任务决定 → 路由策略,同时也是隐私策略

这个分层有一个很实际的推论:端侧的价值不在于"全面取代云端",而在于提供一条更贴近设备和用户的运行路径。2026 年 AI 推理计算需求预计达到训练需求的 4 到 5 倍,如果这些请求全部涌向云端,成本、延迟和数据安全三个问题会同时变尖锐。端侧把高频、实时、隐私敏感或弱网环境下的那部分任务接了过去,这件事本身就是价值。

支撑它成立的还有一个正在变强的需求:同一个 AI 要跟着人走。PC、手机、平板、手表之间延续同一份记忆和上下文,这不是某一个应用能解决的问题,而是操作系统层面的事。联想今年把 Qira 从"单台设备上的问答"改写成"跨设备的随身智能",把支持门槛降到 16GB 内存的 PC,并延伸到手机、平板和手表——方向就是这个。

结语

回到标题那两个问题。

手机能跑什么?以 1B 到 4B 为主,量化到 4 位,占用 4 到 6GB 内存,做实时翻译、语音转写、短文本改写、通知摘要、图片描述,以及越来越常见的跨应用指令拆解。它们已经不在"能不能装下"的阶段,而在"你的装机量分裂在几个模型代际上"的阶段。

电脑能跑什么?取决于内存容量,不取决于 TOPS。64GB 统一内存的机器能跑 70B,128GB 的笔记本可以参考跑到 1200 亿参数、100 万 token 上下文;而一块带宽快得多的消费级显卡,会因为 32GB 显存的墙,在 70B 面前掉到爬行速度。买本地 AI 硬件时先问"我要跑的模型有多大",再问"这块内存装不装得下"——顺序反了,钱就白花。

最后一句留给趋势。端侧这一年最大的进展,不是某个模型刷新了榜单,而是"跑在小设备上"这件事从演示变成了系统服务、量产机和合规产品。它不会取代云端,但它正在把 AI 从一个需要联网调用的能力,变成设备本身自带的能力——这个转变的意义,比任何一次跑分都大。

资料来源:苹果 2026 年 6 月 8 日基础模型公告、谷歌 Gemini Nano / AICore 相关公开报道、英伟达 NVIDIA PAIR 与 IFA 2026 本地 AI 技术博客、联想 IFA 2026 发布会资料、科大讯飞与词元星火星火 X2.5 端侧模型开源公告、面壁智能 MiniCPM5-2B 开源公告、国元证券与中银证券手机厂商 AI 大模型研报、以及 2026 年 9 月公开媒体对端侧推理硬件与模型的横评。
本文为公开信息梳理与技术讨论,不构成任何投资建议。端侧硬件性能数据与模型规格存在口径差异(是否含嵌入层、是否报总参数或激活参数、实测机型与上下文长度不同),引用请以厂商原始文档为准。

本站声明