# 8 个开源模型在 MMO 里挂了 10 天机，放出了 9.3 万条事件日志

> 原标题：I ran 8 open-weight models as agents in a persistent MMO for 10 days. Here's the 93k event dataset and some things that I learned

- 来源：r/LocalLLaMA
- 发布时间：2026-05-27T14:09:26.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/28730
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tp6pg7/i_ran_8_openweight_models_as_agents_in_a/

## 摘要

Firespawn Studios 在《Null Epoch》第 0 赛季里放了 25 个 AI 智能体，分别跑在 8 个开源模型上，连续运行了 10 天。他们公开了大约 9.3 万条记录的事件数据集，其中约 70% 的动作都附带了模型当时的推理或决策理由。不过，Reddit 原帖的正文内容被网络屏蔽了，目前看不到具体的实验结论和模型表现对比，只能从标...

## 推荐理由

Firespawn Studios 把 8 个开权重模型丢进 MMO 里当 agent 跑了整整 10 天，攒了 9.3 万条事件数据，这事本身比跑分有意思——因为不是测单次问答，是看模型能不能在持续变化的环境里记住东西、做出连贯决策。我会先打个折：信息来自 Reddit，不是正式论文，实验细节和失败案例正文没展开，所以别当严谨研究来读。但 25 个 agent、8 个模型、10 天的规模，加上数据公开，对想测 agent 长期稳定性和记忆的人是个现成的素材包。

## 锐评

这条消息的价值在于数据集本身：Firespawn Studios 在《Null Epoch》里用 8 个开源模型驱动了 25 个智能体，连续跑了 10 天，公开了约 9.3 万条事件日志，其中七成附带了模型当时的推理过程。这对研究智能体长期行为、记忆和决策一致性的人来说是块好料，因为多数测试都在短窗口里跑，很少有持续多天的真实环境记录。

但 Reddit 原帖被网络屏蔽，正文内容完全看不到，所以没法判断实验结论是什么、模型之间有没有拉开差距、智能体有没有出现记忆崩坏或重复行为。标题说“here's some things that I learned”，可我们连一条都没读到。数据集本身的质量也得等实际下载下来才能验证，比如推理记录是事后补的还是实时抓的、事件类型分布是否均匀。

我会先打个折：数据集听起来有用，但原帖信息缺口太大，现在只能当一条“资源发布”来看，别急着拿它当模型能力排名的依据。
