# 智谱开源GLM-5.3-Flash：320B原生多模态模型，能力对标Claude Opus 4.8，价格只要四十分之一

> 原标题：GLM-5.3-Flash：前沿智能进入普惠时代

- 来源：AI HOT 精选
- 发布时间：2026-08-26T14:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53135
- 原文：https://www.zhipuai.cn/zh/research/163

## 摘要

智谱上线并开源了GLM-5.3-Flash，一个总参数320B、激活参数18B的原生多模态模型。它在AA综合智能指数上拿了57分，和Anthropic的Claude Opus 4.8持平，编程表现也相当，但API定价只有Opus 4.8的四十分之一。模型用了稀疏注意力和线性注意力的混合架构，长文本下的注意力计算量比GLM-5.3低了3倍多。它还能在写代...

## 推荐理由

智谱开源了GLM-5.3-Flash，一个320B总参数、18B激活参数的原生多模态模型。它在AA综合智能指数上拿了57分，跟Anthropic的Claude Opus 4.8持平，编程表现也相当，但API定价只有后者的四十分之一。我会先打个折：AA指数是智谱自己推的评测体系，外部独立验证还没看到，这点先别太激动。不过模型用了稀疏注意力和线性注意力的混合架构，长文本下注意力计算量比GLM-5.3低了3倍多，这个技术点有单独的技术博客支撑，不是空口说白话。另外它跑在国产芯片上，对国内做私有化部署和成本敏感型应用的团队来说，是个能直接上手试的选项。综合...

## 锐评

GLM-5.3-Flash 最狠的一刀砍在价格上：能力对标 Claude Opus 4.8，但调用成本只有后者的 1/40。这背后是架构上的大改，总参数 320B 但激活参数压到 18B，层数也砍半，还用了稀疏注意力加线性注意力的混合方案，长文本下的注意力计算量比自家上一代低了 3 倍多。

不过，跑分持平不代表实际体感完全一样。文章引用的 AA 综合智能指数和自研的 Z.ai Code Bench 都是特定基准，在真实业务里的长尾表现、指令遵循的稳定性，还需要开发者自己上手测。另外，模型在国产芯片集群上跑通了大规模服务，端到端性能提升了 3 倍，单 token 成本追平了主流英伟达 GPU 方案，这点挺关键，但正文没披露国产芯片的具体型号和集群规模，也没给出高并发下的延迟数据。

视觉编码部分有个亮点：模型能自己看渲染结果来改代码，甚至自主跑了 16 个小时搭出一个 400 平米的厨房场景。这个能力听起来很酷，但文章只给了个例，没说明这种自主循环的成功率和翻车概率，实际用起来可能还得人盯着。
