# 一个 99 美元的 MUD 游戏，测出大模型当 NPC 时爱复读、会迷路，评分系统本身也不靠谱

> 原标题：Can a MUD evaluate LLMs? A $99 proof of concept

- 来源：Hacker News 首页
- 发布时间：2026-07-22T15:39:01.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45938
- 原文：https://cruciblebench.ai/

## 摘要

CrucibleBench 把 13 个模型扔进一个文字 MUD 世界，让它们跟有记忆和信任值的 NPC 打交道，完成隐藏的社交任务。50 轮对话跑下来，总共花了 99.59 美元。最大的发现不是谁排第一，而是评分系统里一个负责评判对话质量的 LLM 组件，能让排行榜上的名次上下浮动 6 位。去掉这个不稳定的裁判后，GPT-5.4 从第 1 掉到第 5...

## 推荐理由

一个用文字 MUD 测大模型社交能力的基准，全部跑完只花了 99.59 美元，光成本透明这一点就够吸引人。但真正的信号不是谁拿了第一，而是发现评分用的 LLM 裁判能让排名上下浮动 6 位，这对依赖排行榜的人是个具体警告。分数维持在 78，因为实验规模不大，正文也没说这个裁判不稳定是普遍现象还是这套题目的特例，结论先打个折。

## 锐评

这个测试把 13 个模型扔进一个文字 MUD 世界，让它们跟有记忆和信任值的 NPC 打交道，完成隐藏的社交任务。50 轮对话跑下来，总共花了 99.59 美元。

最值得看的结果不是谁排第一，而是评分系统本身的问题。他们发现一个负责评判对话质量的 LLM 组件，能让排行榜上的名次上下浮动 6 位。比如 GPT-5.4 在完整评分下排第 1，去掉这个不稳定的裁判后掉到第 5；Gemini 3.1 Pro 从第 3 掉到第 9。而这个裁判跟独立评判的一致性，在不同模型上从 21.7% 到 84.8% 不等，但汇总统计量 κ=0.04 完全看不出问题。作者的建议很实在：用 LLM 当裁判的测试，应该报告每个被评对象的裁判一致性，而不是只给一个汇总数字。

正文没披露这个裁判组件具体用的是哪个模型，也没说为什么一致性波动这么大。另外所有模型都有一个通病：14% 到 66% 的跑分会对着同一个 NPC 重复 8 次以上的对话指令，说明模型在社交场景里容易陷入循环。这个测试目前只是概念验证，不能当真用来衡量模型的社交能力或预测实际部署表现。
