IDC ATLAS产业情报控制台
正在同步专栏研究
事实变更
研究发布
日报版本
系统扫描
核验覆盖
EN
IDC ATLAS
EN返回实时情报站
IDC ATLAS COLUMN · MODEL INFRASTRUCTURE · 31

Ox Alpha 之后:GLM-5.3-Flash 如何把国产卡推理推向规模化

Ox Alpha 的热度来自匿名、免费和榜单,但 GLM-5.3-Flash 真正值得研究的部分发生在榜单背后:智谱把一个 320B 总参数、18B 激活参数的原生多模态模型,运行在数万颗国产加速器组成的大规模集群上,并通过模型架构、内核、量化、互联和分离式调度把端到端性能提升到初始基线的 3 倍。国产算力的竞争正在从‘能否适配’进入‘能否经济地提供生产服务’。

GLM-5.3-Flash 模型、国产 AI 加速器、高带宽互联与分离式推理集群的技术剖面
IDC Atlas 原创专栏封面 · MODEL INFRASTRUCTURE · 31

Ox Alpha 于 8 月 20 日以匿名 stealth model 身份出现在 OpenRouter,提供约 100 万 token 上下文、多模态输入和工具调用,并在免费窗口内迅速冲到平台使用榜前列。华尔街见闻转述彭博报道称,智谱已确认它是新的 GLM 系列模型,并计划当晚开放权重。

同日,Z.ai 正式发布 GLM-5.3-Flash,并在 Hugging Face 放出 MIT 权重。公开模型卡给出 320B 总参数、18B 激活参数、原生多模态、30T token 多模态预训练语料和新训练基座。产品形态、上下文、模态与发布时点都与 Ox Alpha 的预览高度一致,但官方博客没有逐字写出‘Ox Alpha 等于 GLM-5.3-Flash’。专业表述应保留这一个命名边界,而不是继续把匿名期流量当成正式产品披露。

OpenRouter 的榜单读数会随类别、时间窗口和抓取时点变化,因此只适合证明短期使用热度,不适合直接推算独立用户、付费收入、模型总调用或智谱商业收入。更有价值的证据来自智谱自己披露的生产集群与服务栈。

Flash 不是 GLM-5.3 的简单降价版,而是为推理成本重新设计的基座

GLM-5.3-Flash 与此前 GLM-5.3 的关系容易被误读。官方说明它采用新训练基座,不是只在 GLM-5.2 基座上继续后训练。模型总参数约 320B、每 token 激活 18B、45 层;相比 GLM-4.5 系列的 355B 总参数、32B 激活参数和 92 层,计算路径明显收缩。

长上下文成本由混合注意力处理:线性注意力负责局部依赖,稀疏注意力通过轻量 indexer 找全局相关信息,IndexPool 再把四个索引键压成一个。智谱称,相比 GLM-5.3,Flash 的注意力计算量降低 3 倍,KV cache 降低 4.4 倍。这些是厂商测算,不是独立云端成本审计,但它们解释了为什么 1M 上下文能在资源更受限的硬件上进入服务。

原生多模态同样不是附加接口。30T token 语料包含多模态预训练,模型卡把图像和视频编码器写入架构;智谱又用视觉反馈强化前端、游戏、3D、办公文档和 computer-use 工作流。对于推理基础设施,这会增加编码、prefill、decode 三类负载之间的差异,也推动分离式调度。

指标本次披露口径与边界
总参数 / 激活参数320B / 18B官方模型卡;MoE 每 token 仅激活部分专家。
层数45相较 GLM-4.5 系列的 92 层显著减少。
注意力计算约 1/3相较 GLM-5.3 的官方架构测算。
KV cache约 1/4.4相较 GLM-5.3 的官方测算,仍需真实工作负载验证。

正式结论是国产卡大规模推理,不是国产卡完成训练

智谱官方写明,过去一周已在大规模国产 AI 芯片集群上提供 GLM-5.3-Flash 服务,底层是高带宽互联和针对硬件优化的服务栈;生产架构覆盖数万颗国产加速器。这是比‘完成适配’更强的信号,因为它对应真实路由、并发、故障与持续服务,而不是单机 demo。

华尔街见闻转引《晚点 LatePost》称,线上推理可能调用超过 10 万张国产芯片,潜在供应商包括华为、摩尔线程与海光;报道同时写明智谱没有回应供应商信息。这个数量与厂商名单属于媒体线索,正文的正式规模口径仍采用智谱官方的‘数万颗’,不据此分配订单或收入。

但公开材料只谈 serving。它没有说明 30T token 基座训练使用了哪种硬件,也没有给出国产卡训练占比。把‘国产卡推理集群’写成‘全流程国产卡训练’会跨越证据边界。官方同样没有披露具体芯片品牌,因此不能据此在华为昇腾、寒武纪、摩尔线程、沐曦或其他厂商之间分配订单。

智谱称国产卡单芯片的计算和显存容量更受限,尤其在 1M 上下文下受内存容量与带宽约束。这一坦率描述反而提高了技术信息量:国产替代不是把 CUDA 调用改一个后端名称,而是需要模型架构、并行策略、缓存格式、通信和调度共同重写性能边界。

VERIFIED

数万颗国产加速器提供服务

智谱官方披露的是过去一周的规模化推理服务。

NOT DISCLOSED

具体芯片供应商

公开材料未点名,不能按厂商映射订单或收入。

NOT DISCLOSED

训练硬件

30T token 预训练语料不等于训练过程使用国产卡。

3 倍提升来自系统共设计,而不是芯片峰值算力突然改变

智谱在 SGLang 之上构建了针对 GLM-5.3-Flash 的推理引擎,组合了线性注意力与 LM head 的节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合 KV cache 量化以及 Layer Split。每一项都在用额外计算、通信或精度管理换显存与带宽。

集群层采用 Encode–Prefill–Decode 分离架构,把多模态编码、提示词 prefill 和逐 token decode 放入独立可扩展的 worker 池。这样做的意义是三类任务不再争抢同一块卡:长上下文 prefill 可以单独扩容,decode 可以按并发调度,视觉编码也能独立控制。国产卡的单芯片短板被集群级资源池部分吸收。

官方称相对同一硬件的初始基线,端到端服务性能提高 3 倍,并达到与主流 NVIDIA GPU 可比的硬件效率和单位 token 成本。这里的比较缺少芯片型号、精度、批次、延迟、功耗、SLA 和利用率,不能扩大为国产芯片对所有 NVIDIA GPU 的普遍等效;它更准确地证明了在一个已知模型和高度优化栈上,经济性可以被工程追回。

  1. 01
    模型先减少激活计算

    18B 激活参数和 45 层降低每 token 基础计算量。

  2. 02
    注意力压低长上下文缓存

    线性与稀疏注意力、IndexPool 减少 1M 上下文的 KV 压力。

  3. 03
    内核和量化适配硬件

    W8A8 与混合 cache 量化用精度管理换容量和带宽。

  4. 04
    EPD 把集群拆成资源池

    编码、prefill 与 decode 分别调度,提高数万卡集群利用率。

开源权重与低价 API 会把竞争从模型评分推向每个完成任务的成本

MIT 权重意味着开发者可以在自有集群部署、修改和商业使用,SGLang、vLLM、TokenSpeed 与 KTransformers 已提供或计划提供支持。对国产芯片厂商,这创造了一个公开目标:不再等待闭源厂商授权,而是围绕同一 checkpoint 优化内核、量化、互联和调度,并在相同任务上比较性能。

智谱称 Flash 价格只有 GLM-5.3 的十分之一,并给 Coding Plan 用户 3 倍可用额度。低价会扩大调用,却也可能把更多价值转移到服务效率而不是模型毛利。真正应比较的是完成一个可验收 coding/agent 任务的总成本,包括重试、上下文缓存、工具执行、延迟和人工接管,而不是输入 token 单价。

Ox Alpha 的匿名免费期提供了高强度流量测试,也可能帮助模型团队观察真实 agent 工作负载。OpenRouter 榜单可以证明开发者愿意尝试,但免费、匿名和限时供给会放大流量。只有转入正式付费端点后,留存、错误率、每任务成本与稳定性才构成商业验证。

对国产算力产业链,最重要的增量是软件栈开始形成规模经验

数万卡生产服务会产生单机适配无法提供的数据:不同长度请求如何排队、哪类 kernel 限速、通信如何放大尾延迟、量化在哪些任务失真、节点故障如何迁移。这些反馈可以回流模型架构和推理引擎,形成模型帮助优化自身服务系统的循环。

这也重新定义 NVIDIA 与国产卡的竞争边界。训练前沿大模型仍高度依赖最强算力、互联和成熟软件;推理则更容易围绕固定模型做专门优化。GLM-5.3-Flash 的证据首先指向推理替代加速,而不是训练市场已被重写。若类似工作负载持续扩大,竞争会从芯片峰值性能转向整套集群的单位任务成本。

接下来需要四类正式披露:具体硬件与卡数、不同上下文和并发下的吞吐与延迟、集群功耗与可用率、付费端点的留存和收入。缺少这些数据,最稳健的结论仍是‘国产卡已能支撑大规模前沿模型推理’,而不是‘国产卡已全面追平 NVIDIA’。

HARDWARE

点名芯片与拓扑

只有具体型号、节点和互联,产业链映射才成立。

PERFORMANCE

给出吞吐、P99 与功耗

平均成本可比不足以证明生产 SLA 可比。

COMMERCIAL

从免费流量转向付费留存

榜单热度不是收入,正式端点的续用才是需求。

TRAINING

单独核验训练底座

推理国产化不能自动推导训练国产化。

IDC ATLAS VIEW

Ox Alpha 是一个成功的发布事件,GLM-5.3-Flash 则是一项更重要的基础设施实验。智谱没有靠一句‘适配国产卡’结束叙事,而是公开了模型架构、缓存、量化、并行和 EPD 调度如何共同补偿硬件约束。它证明国产算力的可用性正在从兼容性走向经济性,但下一阶段必须用具体芯片、吞吐、延迟、功耗、SLA 和付费留存把这项公司披露变成可复现的行业结论。

资料截止 2026 年 8 月 27 日 09:20(北京时间)。GLM-5.3-Flash 的架构、国产芯片服务规模、性能提升与成本比较均为 Z.ai 官方披露,尚未经过 IDC Atlas 独立基准复现;具体芯片厂商和训练硬件未披露。Ox Alpha 身份来自媒体对智谱确认的报道,Z.ai 官方发布页未直接使用该别名。OpenRouter 使用量是动态平台读数,不等同于独立用户、收入或市场份额。

本网站内容仅用于信息展示与研究,不构成任何投资建议。