智谱发布GLM-5.3-Flash原生多模态模型

2026年8月26日,智谱正式发布并开源GLM-5.3-Flash原生多模态大模型。该模型总参数量为3200亿,激活参数为180亿。在性能表现方面,其Artificial Analysis(AA)智能指数得分为57分,能力与Claude Opus 4.8持平,且性能超过了此前的GLM-5.2。在成本控制上,该模型的定价约为前沿模型的1/100 或 Opus 4.8 的 1/40。

匿名测试期间刷新海外平台纪录

在正式发布前,GLM-5.3-Flash以匿名代号“Ox-Alpha”(或“牛来”)在OpenRouter和OpenCode两大海外平台开展测试。智谱首席科学家唐杰宣布,该模型在OpenRouter上拿到了接近20%的周Token份额,排名第一。官方数据显示,在8月20日至25日的七天窗口内,Ox-Alpha在OpenRouter处理了约23.2万亿Token,约为第二名模型的2.3倍。此外,该模型在双平台的Token调用量高达62T。

国产算力芯片大规模承载生产流量

GLM-5.3-Flash的全部线上流量由10万张国产芯片集群承载。这被视为国产算力芯片首次大规模集体“出海”,直接服务于全球真实业务负载。市场消息指出,算力供应商可能来自华为昇腾、海光及摩尔线程;另有资料提到该模型已完成与昇腾910B、寒武纪思元590等芯片的深度优化。

技术优化与架构突破

为了实现高性能与低成本的平衡,GLM-5.3-Flash在架构上进行了优化:

  • 架构设计:采用稀疏-线性混合注意力架构和流形约束超连接技术。在处理长文本时,关键信息使用稀疏注意力,非关键上下文使用线性注意力。
  • 资源占用:通过动态激活参数和4×Pooling压缩索引缓存技术,将KV Cache压至GLM-5.3的1/4.44,单任务能耗降低75%。
  • 推理增强:通过自研高带宽互联、SGLang改专用推理引擎及EPD分离架构,端到端吞吐较同硬件基线提升3倍。

应用场景与定价

该模型支持视频精剪、游戏开发、3D建模等复杂多模态任务,并已接入ZCode编码平台。在定价方面,输入价格为0.8元/百万Token,输出价格为2.8元/百万Token。