跳到正文

智谱 GLM

智谱的 GLM 系列模型动态:旗舰开源发布、代码与推理能力迭代、商业化与生态进展的追踪。

最新精选

第 21–36 条 · 共 36 条

6月20日星期六

Hacker News 首页

GPT-5.5 的幻觉率是开源模型 GLM-5.2 的三倍,大模型迷信该破了

作者拿 GPT-5.5、DeepSeek V4 Pro 和智谱的 GLM-5.2 做了个对比测试。在 AA-Omniscience 幻觉基准上,GPT-5.5 的幻觉率高达 86%,DeepSeek V4 Pro 更是飙到 94%,而 GLM-5.2 只有 28%。这意味着前两者遇到不会的问题时,十次里有八九次会瞎编一个答案,而不是老实说“我不知道”。...

推荐理由:这篇是个人博客做的第一手对比测试,数字很具体、结论也反直觉,所以 H、K、R 三个维度都踩中了。分数定在 78 而不是更高,是因为样本量和测试方法没完全展开,权威性有限,我会先打个折。

6月19日星期五

Latent Space

GLM-5.2 通过社区实测,Z.ai 预告年底开源 Fable 级模型

智谱的 GLM-5.2 被多个独立来源认为是第一个在日常使用中摸到前沿水平的开源模型。Jeremy Howard 觉得它至少不输 Opus 4.8 和 GPT-5.5,但缺视觉能力。Artificial Analysis 在一个知识工作评测里把它排在 GPT-5.5 之上。架构上新增了 IndexShare,把稀疏注意力的 top-k 索引跨层复用,目...

推荐理由:GLM-5.2 被 Jeremy Howard 和 Artificial Analysis 分别给了正面评价,是少有的开源模型被独立来源推到和 GPT-5.5、Opus 4.8 同一档。扣分是因为原文是付费 newsletter,细节有限,但判断本身有多个信源交叉验证,可信度不低。

6月17日星期三

Hacker News 首页

GLM-5.2 登顶开源模型排行榜,在智能体任务上打平 GPT-5.5

Z.ai 的 GLM-5.2 在 Artificial Analysis 的 Intelligence Index v4.1 上拿了 51 分,超过 MiniMax-M3 和 DeepSeek V4 Pro(都是 44 分),成了目前最强的开源权重模型。模型体量没变,还是 744B 总参数、40B 活跃参数,但科学推理和智能体任务进步明显:HLE 涨了...

推荐理由:GLM-5.2 在 Artificial Analysis 的 Intelligence Index 上拿了 51 分,超过 MiniMax-M3 和 DeepSeek V4 Pro,成了最强开源权重模型。参数没变,分数涨了 11 分,科学推理和智能体任务有实打实的提升。但这是单一评测机构的单榜成绩,没有其他来源交叉验证,所以重要性给到 82 分,先打个折。

Hugging Face 博客

GLM-5.2 发布:第一个真正能用 100 万 token 上下文的开源模型,专啃长周期编程任务

Z.AI 开源了 GLM-5.2,一个为长周期编程任务设计的模型。它把上下文窗口做到了 100 万 token,而且不是光能塞进去,是在 agent 跑一长串操作后质量依然稳得住。架构上用了两个新东西:IndexShare 让每四层稀疏注意力共用一个索引器,在 100 万 token 长度下把每个 token 的计算量砍到了原来的约三分之一;MTP 投...

推荐理由:Z.AI 开源了 GLM-5.2,主打 100 万 token 上下文和长周期 agent 任务。架构上 IndexShare 和 MTP 投机解码都是新东西,不是换皮。不过正文没放完整 benchmark,我会先打个折,卡在 85 以下。

Latent Space

Z.ai 开源 GLM-5.2:744B 参数,前端编程跑分压过 Claude Opus 4.8

Z.ai 周末扔了个 MIT 许可的 GLM-5.2,744B 参数的 MoE 模型,主攻编程和长流程任务。第三方评测显示,它在 Code Arena 前端榜上把 Claude Opus 所有版本都超了,总榜也只比 Opus 4.8 差一点。模型支持 100 万 token 上下文,有 high 和 max 两档推理模式,API 价格和 5.1 一样,...

推荐理由:GLM-5.2 在 Code Arena 前端榜上压过了 Claude Opus 所有版本,总榜也只比 Opus 4.8 差一点。744B 的 MoE 加 MIT 许可,对前端和 agent 开发者来说是个实打实的新选项。没给到 85 分以上,是因为目前只有第三方评测和官方说法,正文没披露技术报告或自家复现结果,这点先别太激动。

6月14日星期日

Hacker News 首页

智谱发布 GLM-5.2,100 万 token 上下文窗口,下周 MIT 协议开源

智谱刚发了新旗舰模型 GLM-5.2,主打写代码和长时间跑任务的 agent 场景,上下文窗口能塞进 100 万个 token。现在买了 GLM Coding Plan 的人可以直接用,API 和开源权重都说下周放出来,而且用的是 MIT 协议,商用很友好。不过正文没给跑分,也没说参数量多大,模型实际水平还得等下周权重落地、第三方评测出来再看。另外评论...

推荐理由:智谱放出 GLM-5.2,100 万 token 上下文、主打代码和 agent 场景,下周 API 和 MIT 开源权重到位。正文没给跑分和参数量,所以分数先保守打,等第三方评测出来再看实际水平。

6月13日星期六

AI HOT 精选

智谱发了新旗舰 GLM-5.2,主打编程和 1M 上下文,下周开源

GLM-5.2 现在就能用,但只对 Coding Plan 的付费用户开放。模型强调编程能力强,上下文窗口拉到 1M token,也就是一次能塞进整本《三体》的量。API 和对话入口要等到下周,开源也同步,用 MIT 许可证,商用友好。正文没给跑分和具体定价,所以实际编程水平、长文本召回率都还不好说。如果是真的强,下周开源后社区会很快验出来。

推荐理由:智谱放出 GLM-5.2,主打编程能力,上下文拉到 1M token,下周用 MIT 许可证开源。正文没给跑分和定价,实际水平还没法验证,所以分数没给到 85 以上。但国产旗舰更新加开源,信号够强,值得放进 featured。

AI HOT 精选

智谱发布 GLM-5.2,1M 上下文窗口全量开放,下周开源

智谱今晚向 GLM Coding Plan 全量用户推送了 GLM-5.2,覆盖 Lite、Pro、Max 和团队版。这个模型支持 1M 上下文窗口,智谱说在长文本任务上继续领先,并称它是目前最强的国产编程模型。API 下周上线,模型下周会以 MIT 协议开源。

推荐理由:智谱这次发布有三个实打实的点:一是全量推送不墨迹,付费用户今晚就能用;二是 1M 上下文和'最强国产编程模型'的宣称,虽然自卖自夸但下周开源就能验证,不是空头支票;三是 MIT 协议开源,商用友好度拉满。整体判断和之前给的 86 分、featured 级别一致——这是国产旗舰模型的正常发布节奏,没有过度包装,信息密度够高。正文没提具体 benchmark 分数和推理成本,这点先别太激动,等开源后看实测。

6月3日星期三

Computing Life · Share · 鸭哥调研

MAI-Thinking-1:让模型持续思考几千步不崩,比让它开始思考难得多

微软 MAI-Thinking-1 的技术报告没在吹模型多会解题,而是在讲怎么让强化学习训练别崩。他们给 GRPO 算法打了三个补丁:一个像恒温器一样动态调节模型的“自信度”,防止它变得死板或乱猜;一个像断路器,在梯度爆炸时直接截断,保住整批训练数据;还有一套自蒸馏抢救流程,训练万一崩了,能把之前学会的推理能力搬到新模型上继续跑。这三个机制合起来,让模...

推荐理由:标题把卖点从“会思考”转到“持续思考”,一下就把训练崩溃这个真问题拎出来了。三种机制的名字虽然有点包装感,但至少给了具体抓手:恒温器控波动、断路器防崩、自蒸馏保风格。正文没披露具体实验数据和复现条件,所以“几千步不崩”这个数字先打个折看。整体对做推理模型训练的人有参考价值,但离落地验证还差一口气。

6月1日星期一

AI HOT 精选

智谱计划在科创板上市,拟发行新股占总股本 2% 到 8%

智谱在港交所发公告,准备申请在 A 股科创板上市。这次发行的全是新股,数量在 910 万到 3877 万股之间,占发行后总股本的 2% 到 8%,老股东不卖旧股。融来的钱主要投向三个地方:通用基座大模型、大模型 MaaS 一站式服务平台,以及补充流动资金。另外公司打算把英文名从 Knowledge Atlas 改成 Z.AI。公告没披露具体的募资金额和...

推荐理由:智谱申请 A 股科创板上市,是国产基础模型公司里第一个明确走这条路的。公告给了新股占比区间 2%-8%,也说了钱要花在通用基座大模型、MaaS 平台和补充流动资金上,但没披露具体募资金额和时间表。我会先打个折:没金额就没法算估值,这点先别太激动。不过动作本身信号很强,说明头部玩家已经在抢资本市场的座次了。

5月31日星期日

r/LocalLLaMA

我花 6400 美元搭了一台本地大模型服务器,一年下来比用 API 便宜了 700 多

作者晒了一台自组的本地大模型服务器,总花费 6406.45 美元,核心配置是 4 张 AMD MI100 显卡,主要跑 Qwen3.6 27B 模型。这台机器每天处理约 2040 万个输入 token 和 132 万个输出 token。他拿 OpenRouter 的 API 价格算了一笔账:第一年本地总成本(含电费)是 2992.72 美元,而调用同等...

推荐理由:这是一篇个人实测帖,不是厂商通稿。作者把账单摊开算:硬件折旧、电费、OpenRouter 比价,结论是首年能省 700 多美元。我会先打个折——这个结论绑定了他的特定负载(日处理 2000 多万 token)和二手 MI100 价格,换个人未必复现。但文章的价值不在普适性,而在把“自建推理服务器到底划不划算”这笔账算得清楚、可复现,对正在纠结买卡还是调 API 的人有参考意义。信息密度和话题性都够,放在 featured 低位合理。

5月22日星期五

AI HOT 精选

智谱发布 GLM-5.1 高速版,API 输出冲到每秒 400 个 token

智谱在 5 月 22 日给部分企业客户开放了 GLM-5.1-highspeed 接口,输出速度标称 400 tokens/s,说是目前大模型厂商里最快的。过去跑得快的模型通常能力会打折,这次智谱声称把旗舰模型的能力和低延迟同时塞进了生产环境。提速主要靠 GLM 团队和 TileRT 团队在三个层面做的系统优化:推理引擎重写了核心路径来提升单卡吞吐;调...

推荐理由:智谱扔出一个 400 tokens/s 的 API 速度数字,说是全球纪录,我会先打个折——正文没披露测试条件、并发数、上下文长度和定价,这些缺口让“纪录”暂时只能当个参考。但 GLM 和 TileRT 联手做系统级优化这件事本身有信息量,说明国产模型在推理加速上开始卷工程落地,不只是卷榜单。对从业者来说,速度快意味着同样任务花钱少、等得短,这点先别太激动,等看到实际压测和价格再判断值不值得切。

Computing Life · Share · 鸭哥调研

智谱 GLM-5.1 API 跑到每秒 400 个 token,靠的不是优化,是换了一套执行逻辑

智谱在 5 月 22 日放出了 GLM-5.1 高速版 API,输出速度标称 400 tokens/s,是人类阅读速度的 80 倍以上。这个速度不是靠传统编译优化“调”出来的,而是底层的 TileRT 推理引擎把 GPU 的工作模式从“批处理车间”改成了“连续流水线”——取消计算步骤之间的等待和隔离,让数据持续流动,GPU 不再频繁启停。模型本身也做了...

推荐理由:400 tokens/s 是个好钩子,但正文没交代测试条件、并发数、输入长度和计费规则,所以速度先打个折看。TileRT 的说法有信息量,不过没展开具体怎么重构执行模型,技术细节偏薄。整体对从业者有提醒价值,但缺少独立验证,所以分数停在 78 不动。

5月21日星期四

机器之心 · 公众号

智谱在千卡集群部署 ZCube,同样 GPU 推理吞吐提升超 15%

智谱把自研的 ZCube 通信方案用到了 GLM-5.1 的线上推理集群里,规模是千卡级别。它替换了原来的 ROFT 组网方式,但没动 GPU、软件栈和业务代码。效果上,吞吐量提升了超过 15%,首 token 延迟的 P99 下降了 40.6%,交换机加光模块的成本省了三分之一。正文没披露具体是怎么做到省硬件成本的,也没给更细的测试条件,所以这个 1...

推荐理由:智谱在 GLM-5.1 千卡推理集群上部署 ZCube,不增 GPU、不改代码就把吞吐提了 15%,首 token 延迟的 P99 降了 40.6%。这是纯工程层面的组网逻辑改动,不是模型能力升级,所以重要性给 81、放在 featured 里比较合适——对搞推理部署的人有用,但不会像新模型发布那样震动整个行业。

4月30日星期四

Hacker News 首页

SOB 基准测试:专门给大模型的结构化输出能力挑错

Interfaze 发布了一个叫 SOB 的基准测试,专门看大模型从文本、图片、音频里提取信息并输出成 JSON 时,到底靠不靠谱。它不像老测试只看 JSON 格式对不对,而是重点查字段里的值准不准——比如发票金额有没有瞎编。测试覆盖了 5000 条文本、209 张图片和 115 段音频,每道题都有人工核对过的标准答案。结果发现,大部分模型在格式上都能...

推荐理由:我会先打个折:这是 Show HN 首发,没有外部采用信号,所以分数压在 75。但内容本身对做结构化输出的团队有用——它不测模型会不会聊天,只测模型能不能老老实实按 schema 吐出对的类型和值。GLM-4.7 总榜第二是个钩子,但真正值得盯的是 GPT-5.4 在文本任务排第 3、图像任务掉到第 9,说明多模态下字段值错会明显放大。正文没披露测试集规模和领域分布,这点先别太激动,但方法论上把 schema 准确率、类型准确率、值准确率拆开算,比只看一个总分要实在。

1月16日星期五

阮一峰的网络日志

中国 AI 大模型领导者在想什么

阮一峰记录了1月10日北京一场闭门会上几位大模型负责人的发言。智谱唐杰说,对话式AI的范式基本到头了,下一步是让模型真正做事,他们把编程、智能体和推理能力整合在一起。阿里林俊旸坦言,美国可用的算力比国内大一到两个数量级,人家拿算力搞下一代研究,我们光交付就占掉绝大部分资源;他判断三到五年后全球最领先的AI公司是中国团队的概率只有20%。腾讯姚顺雨观察到...

推荐理由:这篇周刊摘录了一场闭门峰会的发言,把智谱、阿里 Qwen 和腾讯 AI 负责人对中国大模型路线的判断摆在一起。我会先打个折:它不是一手发布,是二手整理,所以分数没往更高走。但它的好处是给了具体数字和分歧点——唐杰押注 2025 年是 RLVR 爆发年,林俊旸押多模态基础智能体,姚顺雨强调企业愿意为强模型付 200 美元月费,林俊旸还给出中国团队 20% 概率诞生全球最领先 AI 公司。这些判断有可验证的时效,不是公关口径,对从业者判断方向有参考价值。