# 实测 8 个模型当桌游主持人：27B 小模型叙事质量干翻了 405B 巨无霸

> 原标题：I tested 8 LLMs as tabletop GMs - a 27B model beat the 405B on narrative quality

- 来源：r/LocalLLaMA
- 发布时间：2026-04-19T01:59:17.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6375
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1spfz31/i_tested_8_llms_as_tabletop_gms_a_27b_model_beat/

## 摘要

作者用 6 个固定跑团场景测了 8 个模型，让它们当桌游主持人。评分用了 8 项自动指标加 3 个 LLM 裁判打分，整轮测试只花了约 0.02 美元。最终 google/gemma-3-27b-it 以 4.33 的综合叙事分排第一。标题说 27B 赢了 405B，但正文被屏蔽了，没披露那个 405B 具体是哪个模型，也没给出完整排名。这点先别太激动...

## 推荐理由

这篇来自 Reddit 的个人评测，钩子够锋利——小模型在叙事质量上干翻大模型，HKR 三项全中。我把它留在 featured 而不是更高，是因为正文截断了，405B 具体是哪个模型、完整排名都没给出来，信息有缺口，先别太激动。

## 锐评

这条测试本身挺有意思：用6个固定跑团场景考8个模型当桌游主持人，评分靠8项自动指标加3个LLM裁判打分，整轮只花了约0.02美元，成本低到可以随手复现。最终google/gemma-3-27b-it拿了4.33的综合叙事分排第一。标题说27B赢了405B，但Reddit原文被屏蔽了，正文没披露那个405B具体是哪个模型，也没给出完整排名。这就让结论打了折扣——不知道405B是哪个，就没法判断这个胜利是模型架构的差异，还是单纯某个大模型不擅长叙事。另外，LLM裁判打分的偏好也没交代，裁判模型本身有没有偏向小模型输出风格，这点缺信息。如果作者能补上完整排名和裁判模型选择，这个测试对选跑团用模型会更有参考价值。
