# GPT-5.5 的幻觉率是开源模型 GLM-5.2 的三倍，大模型迷信该破了

> 原标题：GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2

- 来源：Hacker News 首页
- 发布时间：2026-06-19T16:11:25.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39526
- 原文：https://arrowtsx.dev/bigger-models/

## 摘要

作者拿 GPT-5.5、DeepSeek V4 Pro 和智谱的 GLM-5.2 做了个对比测试。在 AA-Omniscience 幻觉基准上，GPT-5.5 的幻觉率高达 86%，DeepSeek V4 Pro 更是飙到 94%，而 GLM-5.2 只有 28%。这意味着前两者遇到不会的问题时，十次里有八九次会瞎编一个答案，而不是老实说“我不知道”。...

## 推荐理由

这篇是个人博客做的第一手对比测试，数字很具体、结论也反直觉，所以 H、K、R 三个维度都踩中了。分数定在 78 而不是更高，是因为样本量和测试方法没完全展开，权威性有限，我会先打个折。

## 锐评

这篇博文的核心判断很直接：参数和数据堆得越多，模型反而越不会说“我不知道”。作者拿 GPT-5.5、DeepSeek V4 Pro 和智谱的 GLM-5.2 做了对比，在 AA-Omniscience 幻觉基准上，前两者的瞎编率分别是 86% 和 94%，GLM-5.2 只有 28%。也就是说，遇到拿不准的问题，那两个大模型十次里有八九次会硬编一个答案，而不是老实承认不会。

作者还举了个 Python 异步编程的例子：DeepSeek V4 Pro 花了近 4 分钟、烧了 7700 个推理 token，给了一个结构漂亮但完全错误的方案；GLM-5.2 只用了 12 秒、约 800 个 token 就指出题目本身在单线程、不轮询的约束下根本无解。这个对比挺直观，但要注意这只是单个案例，而且测试用的是 OpenRouter 上的 FP8 精度版本，不代表官方最优部署。

文章最后提了个“三难困境”：原始能力、幻觉校准、计算效率，目前没法同时做好。这个框架有意思，但作者没给出任何解决思路，更像是一个观察总结。另外，GLM-5.2 虽然幻觉率低，但在 AA 智能指数上还是比 GPT-5.5 低 4 分，比被美国政府禁掉的 Claude Fable 5 低 9 分——能力上确实还有差距。整体看，这篇博文的价值在于提醒你别只看 benchmark 分数，模型会不会闭嘴也很重要，但结论还需要更多第三方复现来验证。
