跳到正文
Hacker News 首页

Pantograph 用网上视频训练了一个 4B 参数的 Minecraft 模型,给它一张目标截图就能自己干活

A General Goal-Conditioned Minecraft Model

Pantograph 发布了一个叫 Pan 的 Minecraft 模型,参数量 40 亿。它不靠人手工标注奖励,而是用“事后重标”的方法:把视频里后面发生的画面当成前面片段的目标,这样就能直接从海量网络视频里学怎么达成目标。实际用的时候,你给它一张目标截图,它就能在游戏里打怪、探索、搭建筑,甚至在没见过的环境里也能跑。正文没披露训练用了多少视频、什么...

推荐理由:方法挺干净:用事后重标从无标签视频里学目标导向行为,40 亿参数就能在 Minecraft 里完成没见过的目标。但正文没披露训练视频量、成功率、泛化边界,读起来更像研究预告,实际效果得打个折看。

读原文 ↗导出 Markdown