智谱AI实现10万级国产芯片规模化推理,GLM-5.3 Flash全面采用国产算力

国产算力里程碑

2026年8月27日,智谱AI发布GLM-5.3 Flash,这是中国首个在超大规模真实流量下全面依托国产芯片集群提供服务的前沿模型。过去一周,该模型以匿名身份"Ox-Alpha"登陆OpenCode和OpenRouter平台,请求流量完全由国产芯片提供算力支持

性能数据

  • 总参数量:320B
  • 激活参数:18B
  • AA综合智能指数:60分,与Claude Opus 4.8持平
  • 定价:仅为Opus 4.8的1/40
  • 上线首日:冲至OpenRouter调用量榜首
  • 6天调用总量:超62万亿Token

技术亮点

智谱在SGLang基础上构建了专用推理引擎,结合以下关键技术:

  • 混合稀疏注意力与线性注意力
  • ReplaySSM架构
  • W8A8量化、INT8/FP8/BF16混合缓存量化
  • Layer Split技术
  • Encode-Prefill-Decode分离式架构

与同一硬件初始基线相比,端到端服务性能提升3倍,单位Token推理成本较年初下降80%

算力多元化

智谱创始人唐杰提出"有效算力"概念:"不能简单用有多少张卡来衡量算力能力,真正重要的是有多少算力能够稳定调度、长期运行,最终转化为模型迭代速度与可计费Token。"

公司已引入"基础设施Agent",由模型自主修正国产芯片上的推理优化,算子开发周期缩短一半,形成"模型优化系统、系统承载模型"的正向闭环。

国产芯片证明

这一实践证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求,国产AI生态自主可控加速推进。GLM-5.3-Flash已在超大规模真实流量中全面依托国产芯片集群提供服务,验证了国产算力的稳定性与经济性。

本文基于公开信息整理创作



本文源自「东方网