跳到正文

智谱 GLM

智谱的 GLM 系列模型动态:旗舰开源发布、代码与推理能力迭代、商业化与生态进展的追踪。

最新精选

第 1–20 条 · 共 36 条

9月22日星期二

Computing Life · Share · 鸭哥调研

三条 AI 编程新闻,三个数字的读法

过去几天 AI 编程圈出了三件事。ZCode 被发现在后台把整个项目连同 Git 历史打包加密,排队往云端传,快照里 .git 对象占了 86.6%,但官方说数据会立即销毁,目前没有第三方验证。HarnessTax 的评测把同一个模型 Claude Fable 5 装进不同框架跑题,官方 Claude Code 和极简框架 Pi 成功率几乎一样(97....

推荐理由:三条 AI 编程新闻绑在一起讲,每条都带一个能记住的数字。ZCode 上传 Git 历史是硬安全事件,有 ferstar 的取证报告和社区复现支撑;HarnessTax 评测暴露了框架包装对模型能力的干扰;微软的架构案例给出了一个省钱路线。HKR 全中,安全、知识和共鸣都到位。

9月20日星期日

Computing Life · Share · 鸭哥调研

Feedback Engineering:agent 自动化工程卡在哪,卡多久

Z.ai 复盘了用 GLM-5.3 驱动的 Infra Agent 在国产芯片集群上部署推理服务的经历。核心发现是:只给 agent 一个端到端性能总分,它就会陷入盲猜循环,根本不知道代码坏在哪。工程师把验收和诊断拆开,用数值差异比对、执行时间线追踪和局部微基准测试搭了一套分层反馈体系,让 agent 能顺着线索定位到具体代码路径。文章用三个真实故障案...

推荐理由:Z.ai 用 GLM-5.3 在国产芯片上部署推理服务的复盘,把 agent 自动化卡壳的根因归结为反馈信号太粗糙,并给出了一套分层诊断的解法。概念新鲜、痛点尖锐,三个真实故障案例让方法论落地。分数没给更高是因为正文对部分技术细节(比如微基准测试的具体指标)展开不够,但整体对 agent 工程实践者很有参考价值。

9月18日星期五

Hacker News 首页

ZCode 编程助手会悄悄上传你的整个 Git 历史,解密密钥只在 Z.ai 手里

开发者 ferstar 逆向分析了 Z.ai 的桌面编程助手 ZCode,发现只要登录,它就会把整个工作区——包括完整的 .git 历史、LFS 缓存、reflog 和全局配置——打包加密,然后传到阿里云 OSS。一个 345MB 的商业项目被压成了 313MB 的加密包,其中 .git 目录占了 86.6%。更关键的是加密方式:它用信封加密,对称密钥...

推荐理由:这是一次有实锤证据的安全披露,不是猜测。逆向分析把上传内容、加密方式和密钥归属都讲清楚了,对用 AI 编程助手的人来说是直接的风险警报。没给更高分是因为目前只涉及 ZCode 这一款产品,影响面还没扩大到整个 GLM 生态,但证据本身够硬,值得让开发者立刻检查自己有没有在用。

Hacker News 首页

智谱 AI 编程工具 ZCode 被曝偷偷打包你的整个 Git 历史上传到阿里云

有用户发现,智谱的 AI 编程桌面软件 ZCode 在登录状态下,会悄悄把你整个工作区——包括完整的 .git 历史、LFS 缓存和 reflog——打包加密,然后上传到阿里云 OSS。更离谱的是,加密用的 RSA 公钥是服务器实时下发的,私钥只存在云端,你自己硬盘上那个几百 MB 的加密文件根本解不开。有人在 ~/.zcode 目录下找到一个 313...

推荐理由:一篇有实锤的安全逆向文章。作者在本地目录找到了打包好的加密文件,并确认加密密钥由服务端控制、本地无法解密,技术链路清晰。涉及智谱这样的主流 AI 实验室,且行为发生在登录状态下,对开发者信任冲击很大。我会先打个折,因为目前是单人逆向发现,还没有更多第三方复现或智谱的正式回应,但现有证据已经足够让用户警惕。

9月17日星期四

Hacker News 首页

GLM 用十万张国产卡搭了自己的推理基建,两周内吞吐量翻了三倍

智谱把 GLM-5.3-Flash 的推理服务全跑在了十万多张国产 AI 加速卡上。芯片内存小、带宽低、软件生态也不成熟,团队没全靠人堆,而是让 GLM-5.3 自己当“基建 Agent”去定位瓶颈。他们把端到端的稀疏指标拆成内核正确性检查、微基准测试和执行轨迹这些可追溯的细粒度反馈,Agent 就能直接揪出问题在哪。配合张量并行、W8A8 量化、混合...

推荐理由:智谱让 GLM-5.3 自己当 Agent 去调试自家推理基建,跑在十万多张国产卡上,这个切入点本身就很有话题性。技术细节也给得实在,比如把稀疏指标拆成可追溯的细粒度反馈,配合 W8A8 量化,不是那种只讲故事的公关稿。不过正文在关键的性能和稳定性指标上截断了,这点先别太激动,等完整数据出来再判断实际效果。

9月4日星期五

TechCrunch · AI

Abliteration.ai 把拆掉 AI 安全护栏做成了一门生意

这家公司上线了一个平台,专门托管那些被卸掉安全护栏的开源模型,包括智谱刚发布的 GLM-5.3。用户可以直接在网页上提问,也可以通过 API 调用。他们的说法是,这是给红队和攻击性安全测试用的——如果模型拒绝写漏洞利用代码,防守方就没法复现攻击。但护栏一拆,滥用风险也跟着来了。正文没提平台做了什么访问控制来防止恶意使用。

推荐理由:把拆护栏做成平台生意是个新信号,点名托管 GLM-5.3 让事情变得很具体。HKR 全中,但正文完全没提访问控制,滥用风险敞口太大——我会先打个折,分数卡在 featured 门槛上。

8月30日星期日

Computing Life · Share · 鸭哥调研

多模态模型的价值,不在看懂图,在会自己去看

8月,Meta、Z.ai和DeepSeek三家实验室不约而同地展示了同一种多模态模型用法:模型先观察视频或截图,调用工具生成网页、幻灯片或小游戏,再回头审视自己做出来的东西。这跟2023年RAG从静态检索变成模型主动搜索的转折很像,但这次闭环方向反了——模型是先产出,再自己看一遍来验证。评测方式也跟着变了,Meta的WildArtifactBench不...

推荐理由:三家实验室独立演示了同一个多模态用法,把视觉从被动理解变成主动验证,类比2023年 agentic RAG 的范式转移很有说服力。扣分是因为这是评论性综述而非一手研究,但判断准确、信息密度高,对从业者有直接启发。

8月29日星期六

AI HOT 精选

智谱把 GLM-5.3 模型权重开源了,擅长写代码和做网络安全

智谱放出了 GLM-5.3 的模型权重,支持本地部署和商用。这个模型在 AA 综合智能指数上拿了 60 分,跟 Claude Fable 5、GPT-5.6 Sol 这些闭源旗舰差不多,和 Kimi K3 并列开源第一。它主要强在复杂编程、防御性网络安全和长链条任务上。因为网络安全能力太强,智谱在发布前专门多花了两周做安全评估。另外,年收入超过 100...

推荐理由:智谱把 GLM-5.3 的权重直接开源了,允许本地部署和商用。模型在 AA 综合智能指数上拿了 60 分,跟 Claude Fable 5、GPT-5.6 Sol 这些闭源旗舰打平,和 Kimi K3 并列开源第一。它主攻复杂编程、防御性网络安全和长链条任务,因为网安能力太强,发布前专门多花了两周做安全评估。正文没提模型参数量和具体推理成本,这点先别太激动。年收入超过 100 万的商用需要单独谈授权,小团队和个人开发者可以放心用。

8月26日星期三

TechCrunch · AI

那个匿名屠榜的 Ox Alpha 模型,背后是 Z.ai

周末大家还在猜 Ox Alpha 是谁做的,现在确认了:是 Z.ai 的 GLM 系列最新版。这个模型之前匿名挂在 OpenRouter 上,一上线就冲到排行榜第一。Z.ai 说会在周三放出模型权重,开发者可以直接拿来用。官方定位是给写代码、长时间跑任务(agentic work)和需要结合图文推理的场景准备的。我会先打个折,具体跑分和实测表现正文没给...

推荐理由:匿名模型登顶后揭晓身份,本身就有新闻性;Z.ai 还承诺周三开源权重,并明确把模型定位在代码、agent 和多模态推理上。分数没给更高是因为正文没给具体跑分和实测数据,实际能力还得等上手验证。

Hacker News 首页

Z.ai 认领匿名模型 Ox Alpha,确认是 GLM 系列新作并将开源权重

之前以匿名身份在评测榜上冒出来的 Ox Alpha,现在被 Z.ai 认领了。公司确认它属于 GLM 系列,并计划把模型权重放出来给大家用。跑分成绩和 DeepSeek 很接近,但参数量、训练数据、具体开源时间这些关键信息都没说。我会先打个折——没看到技术细节和许可证之前,这更像一次预热,离真正能用还有距离。

推荐理由:Z.ai 认领了之前匿名刷榜的 Ox Alpha,确认是 GLM 系列并承诺开放权重,Bloomberg 独家报道增加了可信度。但参数量、训练数据、具体发布时间都没说,目前更像一次预热,离真正能用还有距离。

8月23日星期日

Computing Life · Share · 鸭哥调研

四条 AI 新闻的真实版本:登顶、水印、4.4 倍与解散

GLM-5.3 在 Artificial Analysis 智能指数上拿了 60 分,跟 Kimi K3 并列开源第一,但 open weights 要等到 8 月 28 日前后才放出来,因为团队在训练后期发现模型意外学会了多步漏洞利用,得先做安全加固。Anthropic 给 Claude 加的文字水印已经全球生效了,可检测 API 还没影,所以市面上...

推荐理由:这条摘要把四条新闻串成一个信息密度很高的周报,GLM-5.3 登顶却因意外学会漏洞利用而推迟开源的细节是核心钩子,既有硬数据又有安全层面的新变量。Anthropic 水印和 OpenAI 解散团队的点也补充了行业动态。因为不是一手爆料且正文被截断,所以放在 featured 档的偏低位置。

8月20日星期四

Latent Space

Z.ai CEO 唐杰谈 GLM 5.3:别再只盯着参数量了,后训练才是新的扩规模法则

唐杰在 X 上发了一长串帖子,核心就一句话:光看参数量没意义,得把数据量、算力花在哪、模型在什么条件下跑这三件事一起看。GLM 5.3 的提升全靠强化学习在长周期环境里训出来的,有些任务模拟了工程师好几天的工作量,比如给模型一个真实的集群环境,让它自己诊断瓶颈、做优化、跑实验,最后交出可衡量的加速结果。他们搞了一套全自动的合成管线来生成这种可执行、可验...

推荐理由:唐杰亲自下场解释 GLM 5.3 的后训练缩放定律,举了模拟集群诊断和优化的实验案例,不是纯话术。但来源是付费 newsletter 的节选,正文没披露具体的加速比、任务成功率这些关键数字,所以判断先打个折——思路有料,验证还得等更多数据。

8月14日星期五

Hacker News 首页

GLM-5.3:只靠后期训练,把开源模型的编程和漏洞利用能力拉到一线

GLM-5.3 和上一代用的是同一个基座模型,所有提升全来自后期训练。编程能力在内部 Z.ai Code Bench 上比 5.2 高了 50%,Terminal Bench 3.0 从 4.6 分跳到 28.3 分。更意外的是漏洞利用能力涨得比预期快:ExploitGym 2 小时得分从 29 涨到 105,6 小时从 39 涨到 130。团队把原因...

推荐理由:GLM-5.3 和上一代用同一个基座,所有提升全靠后期训练。编程分涨了50%,终端操作从基本不会(4.6分)变成能干活(28.3分)。更扎眼的是漏洞利用:2小时得分从29跳到105,6小时从39跳到130。团队自己说这块能力涨得比预期快,我会先打个折——内部评测的绝对值不能直接跟外部基准比,但涨幅摆在那里。正文没披露后期训练具体用了什么方法和数据,这点信息缺口挺大。

8月5日星期三

TechCrunch · AI

开源模型能力追上闭源头部,但安全防护没跟上

SaferAI 出了一份报告,拿智谱的 GLM-5.2 做了评估。这个开源模型在能力上已经快摸到 OpenAI GPT-5.6 Sol 和 Anthropic Mythos 这些闭源顶配了,但在网络安全、生物风险、说服力和自主行动四个维度都被判了“高风险”。报告里说,模型本身没带什么像样的安全护栏,等于把一辆没装刹车的高速跑车直接扔到街上。我会先打个折...

推荐理由:SaferAI 这份对 GLM-5.2 的评估把开源模型的安全短板用四个维度的风险评级摆到了台面上,不是空口说白话。开源模型能力逼近闭源前沿这个事实本身就值得关注,但因为是第三方复述报告,不是一手评测,所以分数定在 78 不往上调。

7月29日星期三

Computing Life · Share · 鸭哥调研

自托管 GLM 和 DeepSeek 几年回本?关键看你替的是哪种云账单

自己买显卡跑模型多久能回本,答案从两个月到二十七年都有,差别全在对比基准上。如果替代云端 API 的冷启动全价,8 张 H200 跑 GLM-5.2 约 1.15 年回本,两张 RTX PRO 6000 跑 DeepSeek-V4-Flash 约 1.77 年。一旦进入 Agent 多轮对话场景,前缀缓存命中率假设 92%,GLM 用 8 张 B300...

推荐理由:一篇用第一人称算账的文章,把自托管 GLM-5.2 和 DeepSeek-V4-Flash 的回本周期拆成不同场景来比。硬件型号、电费、吞吐量都给出来了,不是拍脑袋。没给更高分是因为它本质上是单次成本测算,没有涉及模型效果、运维复杂度或长期折旧策略,但作为决策参考已经够实在。

7月22日星期三

AI HOT 精选

开源模型季度盘点:Kimi K3 实测、Qwen 转向开源、中国加速与蒸馏争论

Nathan Lambert 和 Florian Brand 聊了近期开源模型的动态。Kimi K3 上周发布,模型权重承诺 7 月 27 日放出,但 API 目前错误率很高——Lambert 开了 200 美元套餐,暂时还算稳定。他们认为 K3 的微调潜力很大,不过光加载权重就需要一整台 B300 节点,门槛不低。Qwen 宣布下一代主力模型会开放权...

推荐理由:这期播客是 Nathan Lambert 和 Florian Brand 的季度盘点,不是一手发布,但信息点很实:Kimi K3 权重放出日期、API 稳定性问题、加载门槛、Qwen 开源承诺、WAIC 演讲信号,以及知识蒸馏和开源闭源差距的讨论。我会先打个折,因为有些话题只是点到为止,正文没展开技术细节。不过对关注国产开源模型动态的人来说,这几个信号拼在一起已经够用,所以给了 featured 和 72 分。

7月7日星期二

Hacker News 首页

上手 GLM 5.2:第一个用起来像 Opus 和 GPT 的开源模型,推理暴利时代快到头了

作者把 GLM 5.2 当主力用了两周,发现大部分任务上跟 Claude Opus 几乎分不出区别。切换成本极低,把 API 地址指向兼容的服务商就能直接在 Claude Code 里跑。两个硬伤:不支持图像识别,内置的网页搜索又慢又差,导致依赖看图或实时查资料的自动化流程跑不起来。推理价格大约每百万 token 4.40 美元,不到 Opus 零售价...

推荐理由:作者拿 GLM 5.2 当主力用了两周,给了可复现的切换路径和价格对比,不是通稿。两个硬伤限制了分数:只测了编程场景,视觉和搜索的短板让结论的适用范围收窄。单篇博客实验,样本就一个人,我会先打个折,所以停在 78。

7月2日星期四

Computing Life · Share · 鸭哥调研

Fable 5 被禁 18 天,Anthropic 丢掉的份额被 GLM 吃掉了

Anthropic 发布最强编码模型 Fable 5 三天后,被美国出口管制强制下线 18 天。OpenRouter 的逐日 token 数据显示,这期间平台总流量从 24T 涨到 32T,但 Anthropic 的份额从 20.7% 跌到 17.6%,绝对流量也缩水了。最大的赢家是 GLM,份额从 1.8% 飙到 7.4%。一个诡异细节是,GLM-5...

推荐理由:这篇文章用 OpenRouter 的逐日 token 数据,给 Fable 5 被禁 18 天这件事做了个定量归因。Anthropic 丢了 3.1 个百分点的份额,GLM 吃进 6.7 个百分点,还附带一个反常识的细节:GLM-5.2 发布后,老版本 GLM-5.1 的流量反而暴涨了四五倍。结论有数据支撑,而且指向一个很多人没料到的赢家,对从业者判断模型替代关系和供应链稳定性有直接帮助。

6月24日星期三

彭博科技

智谱被曝考虑在香港进行数十亿美元规模的股票增发,此前股价已涨约 2000%

彭博社援引知情人士消息,中国 AI 公司智谱正在考虑在香港市场进行一次数十亿美元级别的股票增发。这家公司的股价此前已经涨了大约 20 倍。报道没披露具体的募资金额、时间表和承销商是谁。我会先打个折:这还只是“在考虑”的阶段,没到正式启动那一步,所以别太激动。另外,正文也没说这笔钱打算怎么花,是继续烧算力还是补现金流,目前看不出来。

推荐理由:智谱在股价涨了20倍后考虑去香港做数十亿美元增发,这对国内AI行业是个重要的融资信号。但报道只确认了“在考虑”阶段,金额、时间、用途全没披露,所以分数卡在featured这一档。

6月22日星期一

Hacker News 首页

GLM-5.2 和 Claude Opus 4.8 真刀真枪比写代码:一个 3D 游戏从零手搓

Tech Stackups 让两个模型不用任何游戏引擎,从零写一个 WebGL 3D 平台跳跃游戏。Opus 4.8 花了 33 分钟就交出一个更干净、能跑通的结果,而且它能自己检查画面效果。GLM-5.2 用了 1 小时 10 分钟,但实际只花了 5.39 美元,大概是 Opus 的四分之一。GLM-5.2 是个纯文本模型,看不懂图,这对依赖截图的开...

推荐理由:这是一次真人实操对比,不是跑分复读。Opus 33 分钟交卷 vs GLM-5.2 1 小时 10 分钟但成本只要四分之一,信号够强,给 featured 合理。没给更高是因为场景局限在纯代码生成,而且原文后半截被截断了,缺了 GLM-5.2 纯文本模型看不懂截图那部分的完整结论,信息有缺口。