Pac-Bench:一个 prompt 让模型写吃豆人,Claude Opus 5.5 拿了 99 分
Show HN: Pac-Bench – How well can models one-shot a Pac-Man game?
Jon Clegg 搞了个吃豆人基准测试,只给模型一句“用单个 HTML 页面写个吃豆人游戏”,然后让 Opus 5.5 自动打分。Claude Opus 5.5 通过 Claude Code 跑出了 99/100 分,生成一个 10.8 KB 的页面,花了 9 分钟,成本 1.99 美元,音效几乎还原街机。Claude Fable 5.1 拿了 96...
推荐理由:30 个模型一次性生成吃豆人的横向对比,Claude Opus 5.5 通过 Claude Code 拿到 99/100 分,成本 1.99 美元,数据扎实。扣分是因为这是个人项目,不是官方发布,权威性有限,所以卡在 78 分。