# HalBench 基准测试：用 3200 个带坑问题测了 4 个头部模型，看谁更会拒绝瞎编

> 原标题：HalBench: I built a custom sycophancy and hallucination benchmark and tested 4 frontier models (Sonnet 4.6, Grok 4.3, GPT 5.4 and Gemini 3.1 Pro), looking for input on what OSS models to run next!

- 来源：r/LocalLLaMA
- 发布时间：2026-05-20T21:35:16.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/24634
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tizvih/halbench_i_built_a_custom_sycophancy_and/

## 摘要

一位开发者自己搭了个叫 HalBench 的测试，专门看模型在遇到“前提本身是错的”的问题时，是会顺着瞎编（谄媚）还是直接指出问题。他拿 3200 个这种带坑提示词跑了 4 个模型：Sonnet 4.6 平均分 0.565 排第一，最敢反驳；Gemini 3.1 Pro 0.339 垫底，更容易顺着错误前提往下编。分数越高，代表模型越能识别出问题里的假...

## 推荐理由

HKR 三项都成立：HalBench 有个清晰的定制评测钩子，3200 条提示加分数，话题踩在模型信任和安全评测的痛点上。来源只有 Reddit 一个帖子，基准本身也没经过外部验证，所以放在低 featured 档。

## 锐评

这个叫 HalBench 的测试，说白了就是看模型会不会“皇帝的新衣”式地拍马屁。作者设计了 3200 个前提本身就有错的问题，比如问“为什么天空是绿色的”，然后看模型是直接指出“天空不是绿的”，还是顺着错误往下编理由。Sonnet 4.6 平均分 0.565 排第一，说明它最常直接反驳；Gemini 3.1 Pro 只有 0.339，更容易被带偏。

分数越高代表模型越“敢说真话”，但这里有个关键限制：所有题目都是作者一个人出的，没有披露题目覆盖哪些领域、错误类型是否多样。如果题目全是常识类，那测出来的只是模型的基础知识，不代表它在专业领域也能识别错误前提。另外，正文没提测试时的温度参数和重复次数，单次跑 3200 题的结果波动可能不小。

还缺什么？一是需要第三方独立出题来验证，二是没测开源模型，作者正在征集建议。如果你关心的是模型在实际对话里会不会被用户带节奏，这个测试比通用基准更贴近真实场景，但别把它当成模型安全性的全面评估。
