2026年8月26日,智谱AI正式发布GLM-5.3-Flash模型,这是GLM-5系列首个原生多模态模型,总参数320B、激活参数18B,采用MIT许可证开源。

GLM-5.3-Flash以极具竞争力的价格提供领先的能力。每百万Token输入定价0.8元、输出2.8元,相比GLM-5.3降低约十分之一;限时优惠活动期间更降至输入0.4元、输出1.4元。官方表示,这是智谱首次在大模型能力与成本协同优化上取得显著突破。

该模型支持图像、视频和文本的三模态输入,原生上下文窗口达100万token。在Terminal-Bench 2.1基准测试中,GLM-5.3-Flash获得84.3分,接近Claude Opus 4.8的85.0分;DeepSWE 1.1达到63.4分,超过GPT-5.6 Sol的58.0分;Agent Last Exam为26.3分。智谱内部评测显示,模型在Office文档处理、代码生成和金融研究等多场景下均表现出色。

一个关键亮点是,GLM-5.3-Flash此前以Ox Alpha匿名身份在OpenRouter和OpenCode上进行了大规模压力测试,累计词元调用量高达62T,创双平台历史纪录。整个测试期间的线上流量全部由10万张国产AI芯片承载,验证了国产芯片在大规模真实场景下满足前沿模型推理需求的可行性。

智谱针对国产芯片的显存容量和带宽特点,重新优化了整套推理系统,实现了端到端服务性能3倍的提升。模型采用ReplaySSM、W8A8量化、混合INT8/FP8/BF16缓存量化等关键技术,推理效率与主流英伟达GPU相当。

目前,GLM-5.3-Flash已支持SGLang、vLLM和TokenSpeed等主流推理框架,权重已在Hugging Face开源。用户可通过智谱官方API、AutoClaw平台或直接下载开源权重进行部署。

业内分析认为,GLM-5.3-Flash的出现标志着国产大模型正式迈入原生多模态时代,其高性价比和国产化推理能力,有望推动AI在高频商业场景的规模化落地。