# Pac-Bench：一个 prompt 让模型写吃豆人，Claude Opus 5.5 拿了 99 分

> 原标题：Show HN: Pac-Bench – How well can models one-shot a Pac-Man game?

- 来源：Hacker News 首页
- 发布时间：2026-09-28T22:43:12.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/59665
- 原文：https://jonclegg.github.io/pacman-bakeoff/

## 摘要

Jon Clegg 搞了个吃豆人基准测试，只给模型一句“用单个 HTML 页面写个吃豆人游戏”，然后让 Opus 5.5 自动打分。Claude Opus 5.5 通过 Claude Code 跑出了 99/100 分，生成一个 10.8 KB 的页面，花了 9 分钟，成本 1.99 美元，音效几乎还原街机。Claude Fable 5.1 拿了 96...

## 推荐理由

30 个模型一次性生成吃豆人的横向对比，Claude Opus 5.5 通过 Claude Code 拿到 99/100 分，成本 1.99 美元，数据扎实。扣分是因为这是个人项目，不是官方发布，权威性有限，所以卡在 78 分。

## 锐评

Jon Clegg 这个测试很直接：只给模型一句“用单个 HTML 页面写个吃豆人游戏”，然后让 Opus 5.5 自动打分。Claude Opus 5.5 通过 Claude Code 拿了 99 分，生成一个 10.8 KB 的页面，成本 1.99 美元，音效几乎还原街机。Claude Fable 5.1 也拿了 96 分，但成本飙到 5.87 美元，贵了三倍。GPT-5.6-sol 只花 0.72 美元、不到 5 分钟就拿了 90 分，性价比突出。

打分维度包括操控、鬼魂行为、卡死检测、迷宫布局和音效，由 Opus 5.5 自动跑 90 秒测试加代码审计完成。但正文没解释为什么有些模型跑了 Phase 2，也没说工具链对分数的影响有多大。这点先别太激动——你看到的是“模型+脚手架”的组合表现，不是模型单打独斗的能力。另外，所有分数都由 Opus 5.5 评定，可能存在裁判偏好。
