一个 99 美元的 MUD 游戏,测出大模型当 NPC 时爱复读、会迷路,评分系统本身也不靠谱
Can a MUD evaluate LLMs? A $99 proof of concept
CrucibleBench 把 13 个模型扔进一个文字 MUD 世界,让它们跟有记忆和信任值的 NPC 打交道,完成隐藏的社交任务。50 轮对话跑下来,总共花了 99.59 美元。最大的发现不是谁排第一,而是评分系统里一个负责评判对话质量的 LLM 组件,能让排行榜上的名次上下浮动 6 位。去掉这个不稳定的裁判后,GPT-5.4 从第 1 掉到第 5...
推荐理由:一个用文字 MUD 测大模型社交能力的基准,全部跑完只花了 99.59 美元,光成本透明这一点就够吸引人。但真正的信号不是谁拿了第一,而是发现评分用的 LLM 裁判能让排名上下浮动 6 位,这对依赖排行榜的人是个具体警告。分数维持在 78,因为实验规模不大,正文也没说这个裁判不稳定是普遍现象还是这套题目的特例,结论先打个折。