HalBench 给 29 个开源模型测拍马屁和幻觉,Qwen 3.6 和 Gemma 4 以小博大,Meta 继续证明自己不会花钱
HalBench: 29 OSS models tested on a custom built Sycophancy and Hallucination Benchmark, Qwen 3.6 and Gemma 4 scoring far above their weight! (While Meta keeps proving they forgot how to spend their money...)
HalBench 是一个开源基准测试,专门看模型面对错误前提时是直接反驳还是顺着说瞎话。v2.3 测了 33 个模型,其中 29 个开源。结果只有 Sonnet 4.6(65.1%)和 Grok 4.3(50.9%)的反驳率过半。开源里最强的是 Qwen 3.6,一个约 270 亿参数的稠密模型,反驳率 36.6%,压过了 GPT-5.4 和 Gemi...
推荐理由:一个社区自建的基准,有具体数字和排名,Qwen 3.6 在反驳率上超过 GPT-5.4,信息量够。没给 p1 是因为这是自建评测,还没同行评审,先当强推荐处理。