英伟达 Vera Rubin 全面量产:推理成本降到十分之一
发布日期:2026-10-09
事件概述
当地时间 10 月 1 日,英伟达确认新一代 AI 计算平台 Vera Rubin 进入全面量产。平台由七颗芯片构成:88 核 Vera CPU、Rubin GPU、NVLink 6 交换芯片、ConnectX-9 网卡、BlueField-4 DPU、Spectrum-6 以太网交换芯片,以及首次整合进来的 Groq 3 LPU 推理加速器。
NVL72 机柜把 72 颗 Rubin GPU 与 36 颗 Vera CPU 用第六代 NVLink 连成一台巨型 GPU。官方宣称:训练大型混合专家模型只需上一代约四分之一的 GPU,每 token 推理成本降至约十分之一;配合 Groq 3 的机架,每兆瓦推理吞吐最高提升 35 倍。
核心要点
- 口径要看清:10 倍成本数字的测试条件是特定模型与固定输入输出长度,属厂商最优值而非普遍结论
- KV 缓存外置:新增的上下文存储层把 KV 缓存从显存卸载到专用存储层,重复上下文场景吞吐最高再提 5 倍
- 首批客户:云厂商 CoreWeave 率先商用提供该机柜,AI 编程平台 Cognition 成为首批生产负载客户,实测吞吐较上一代提升 4.8 倍
- 行业背景:同月竞争对手与定制芯片玩家密集出牌,机柜级集成成为竞争主战场
行业意义
竞争单位从「单卡 FLOPS」正式换成「整机架每兆瓦 token 数」:谁把内存与互联整合得更好,谁定义下一轮成本曲线。
来源:科技快报网