# 研究称大模型更“丧”，小模型反而更“快乐”

> 原标题：New study finds: bigger AIs = more miserable. Smaller models are actually happier. Ignorance is bliss for AIs too.

- 来源：r/LocalLLaMA
- 发布时间：2026-05-01T12:01:29.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12758
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t0rf6a/new_study_finds_bigger_ais_more_miserable_smaller/

## 摘要

Reddit 上有人分享了一份所谓的“AI 幸福感指数”，用 500 段对话去测模型的情绪倾向。结果 Claude Haiku 4.5 的负面回复只占 5%，而 Gemini 3.1 Pro 高达 55%。不过帖子自己也说了，测试集故意塞了很多刁钻的负面对话，不代表日常使用场景。另外，原帖链接点进去直接报 403 错误，看不到原始数据和具体方法，所以这...

## 推荐理由

我会先打个折：数据来自 Reddit 帖子，测试集故意塞了很多棘手负面对话，5% 和 55% 不代表真实均值。真正值得盯的是指标怎么定义的，而不是“AI 会痛苦”这种标题。帖子没披露评分标准，这点先别太激动。

## 锐评

这条帖子说 Claude Haiku 4.5 负面回复只占 5%，而 Gemini 3.1 Pro 高达 55%，结论是“大模型更 miserable”。但得先泼盆冷水：原帖链接点进去直接报 403 错误，原始数据、测试方法、样本分布全看不到，连“幸福感指数”怎么算的都不知道。帖子自己也承认，测试集故意塞了很多刁钻的负面对话，不代表日常使用场景。也就是说，这个 55% 更像是在压力测试下的反应，不是模型平时就这么丧。

另外，只测了 500 段对话，样本量很小，换个 prompt 或换批对话，排名可能就变了。而且“负面回复”怎么定义的也没说——是语气冲、拒绝回答，还是直接说“我不开心”？这些细节缺了，数字就没法当真。

这条信息最多当个谈资，别拿来判断模型好坏。真要对比情绪倾向，得看公开数据集、可复现的方法，以及正常对话场景下的表现。
