# Pantograph 用网上视频训练了一个 4B 参数的 Minecraft 模型，给它一张目标截图就能自己干活

> 原标题：A General Goal-Conditioned Minecraft Model

- 来源：Hacker News 首页
- 发布时间：2026-07-15T16:35:09.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44515
- 原文：https://pantograph.com/journal/pan-1

## 摘要

Pantograph 发布了一个叫 Pan 的 Minecraft 模型，参数量 40 亿。它不靠人手工标注奖励，而是用“事后重标”的方法：把视频里后面发生的画面当成前面片段的目标，这样就能直接从海量网络视频里学怎么达成目标。实际用的时候，你给它一张目标截图，它就能在游戏里打怪、探索、搭建筑，甚至在没见过的环境里也能跑。正文没披露训练用了多少视频、什么...

## 推荐理由

方法挺干净：用事后重标从无标签视频里学目标导向行为，40 亿参数就能在 Minecraft 里完成没见过的目标。但正文没披露训练视频量、成功率、泛化边界，读起来更像研究预告，实际效果得打个折看。

## 锐评

Pantograph 放出了一个叫 Pan 的 Minecraft 模型，40 亿参数，核心卖点是训练时不用人手标奖励。做法很取巧：把视频后面出现的画面当成前面片段的目标，也就是“事后重标”，这样就能直接从海量网络视频里学怎么达成目标。推理时你给它一张目标截图，它就能在游戏里打怪、探索、搭建筑，甚至在没见过的环境里也能跑。

这个思路对机器人领域有参考价值——如果真能从纯视频数据里学到目标导向行为，就不用被带动作标签的数据卡脖子。但文章没披露关键信息：训练用了多少视频、什么硬件、跑了多久。这些数字直接决定方法能不能复现、成本划不划算。另外，模型目前只限 Minecraft 一个游戏，跨环境的泛化能力还停留在承诺阶段。

我会先打个折：演示看起来不错，但没给量化指标，也没跟其他方法做严格对比。等他们把训练规模和成本说清楚，再判断这方法是不是真能省钱。
