# Eric Jang：从零手搓 AlphaGo，聊聊搜索、自对弈和 AI 研究的自动化

> 原标题：Eric Jang - 从零开始构建 AlphaGo

- 来源：AI HOT 精选
- 发布时间：2026-05-15T16:04:58.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21462
- 原文：https://www.dwarkesh.com/p/eric-jang

## 摘要

Eric Jang 在播客里拆解了他休假期间的项目——用现代工具从零复现 AlphaGo。他解释了 AlphaGo 为什么至今仍是理解智能系统的好范本：它把蒙特卡洛树搜索、从经验里学习和自我对弈这三件事结合得很干净。节目里聊到，这种搜索加自对弈的强化学习方式，能直接给每一步棋一个更优解，绕开了现在训大语言模型时常遇到的“功劳归谁”难题。Jang 还试了...

## 推荐理由

这是一篇机制拆解加评论，不是模型或产品发布。Eric Jang 把 AlphaGo 掰成三块讲，对做推理和智能体的同学有参考价值，但别当新成果看——正文没披露任何新指标，就是一次高质量的技术复盘。

## 锐评

Eric Jang 在播客里干了一件挺有意思的事：用现在的工具从零复现 AlphaGo。他不是在怀旧，而是想说明 AlphaGo 把搜索、从经验里学习和自我对弈这三件事结合得太干净了，至今仍是理解智能系统的好范本。

节目里最有信息量的一点，是拿 AlphaGo 的蒙特卡洛树搜索（MCTS）跟现在大语言模型的强化学习做对比。训大模型时，模型得从几万个 token 里猜哪一步做对了，这叫“功劳归谁”难题。而 AlphaGo 的 MCTS 能直接给每一步棋一个更优解，绕开了这个坑。Jang 认为人学习的方式更接近后者。

他还聊了用大模型搞自动化研究（Autoresearch）的尝试：实现实验、调超参数这些活，模型已经干得不错；但选下一个研究问题、从死胡同里退出来，模型还不行。正文没披露他复现 AlphaGo 的具体成本、训练时长和最终棋力，这部分信息缺口让判断得打个折。
