模型排行榜

智谱发布GLM-5.3-FlashX,10万卡国产算力支撑200 tokens/s

发布日期:2026-09-21

事件概述

2026年9月18日,智谱正式推出 GLM-5.3-FlashX,API 已开放,最高生成速度可达每秒200个 token,在 GLM-5.3-Flash 基础上进一步优化了推理基础设施与服务性能。

核心要点

  • 速度与价格:最高输出200 tokens/s,较 GLM-5.3-Flash 提速约5倍,价格相应提升约2.5倍
  • 算力底座:基于10万张国产芯片提供的推理算力,官方称此前已持续加大基础设施投入并优化推理流程
  • 匿名亮相:GLM-5.3-Flash 此前曾以"Ox Alpha"之名与全球开发者见面,上线后调用量持续增长
  • 升级范围:模型的能力体系与定位未变,本次升级集中在响应速度与交互流畅度

行业意义

国产算力集群不仅在高吞吐场景可用,低时延场景也具备持续优化空间;推理侧竞争开始从"能不能跑"进入"跑得多快、多便宜"。

来源:腾讯新闻

本站声明