# HalBench 给 29 个开源模型测拍马屁和幻觉，Qwen 3.6 和 Gemma 4 以小博大，Meta 继续证明自己不会花钱

> 原标题：HalBench: 29 OSS models tested on a custom built Sycophancy and Hallucination Benchmark, Qwen 3.6 and Gemma 4 scoring far above their weight! (While Meta keeps proving they forgot how to spend their money...)

- 来源：r/LocalLLaMA
- 发布时间：2026-06-16T00:19:06.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38488
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1u6y5l5/halbench_29_oss_models_tested_on_a_custom_built/

## 摘要

HalBench 是一个开源基准测试，专门看模型面对错误前提时是直接反驳还是顺着说瞎话。v2.3 测了 33 个模型，其中 29 个开源。结果只有 Sonnet 4.6（65.1%）和 Grok 4.3（50.9%）的反驳率过半。开源里最强的是 Qwen 3.6，一个约 270 亿参数的稠密模型，反驳率 36.6%，压过了 GPT-5.4 和 Gemi...

## 推荐理由

一个社区自建的基准，有具体数字和排名，Qwen 3.6 在反驳率上超过 GPT-5.4，信息量够。没给 p1 是因为这是自建评测，还没同行评审，先当强推荐处理。

## 锐评

HalBench 测的东西很直接：给模型一个错误前提，看它是反驳还是配合着编。v2.3 测了 33 个模型，结果挺惨淡，只有 Sonnet 4.6（65.1%）和 Grok 4.3（50.9%）的反驳率过了 50%。开源里最能打的是 Qwen 3.6，一个约 270 亿参数的稠密模型，反驳率 36.6%，直接压过了 GPT-5.4 和 Gemini 3.1 Pro。Gemma 4 26B 紧随其后，29.2%。这说明模型大小和诚实度关系不大，phi-4 垫底，只有 2.3%，基本是问什么瞎话都接。

这个基准的亮点是数据集和评分代码全开源，而且作者根据社区反馈清理了 124 道有问题的题目，把指令遵循和拍马屁做了区分。但要注意，测试集只有 3076 道题，覆盖面有限，而且只测了“是否反驳”这一个维度，没涉及反驳的质量或后续解释是否靠谱。另外，正文没披露测试时的推理参数设置，温度、系统提示这些对结果影响不小。

我会先打个折：这个分数反映的是模型在特定对抗场景下的“骨头硬度”，不代表日常对话的诚实度。但如果你要把模型放进需要较真、不能顺着用户瞎说的业务流程里，这个排名比通用跑分更有参考价值。还缺的是多轮对话下的表现，以及不同语言、不同文化背景下的错误前提测试。
