# Sakana AI 开源 Shinka Evolve：让大模型自己写程序进化，用更少样本跑赢 AlphaEvolve

> 原标题：大语言模型的自我进化 | 罗伯特·兰格 | Shinka Evolve | AlphaEvolve | 样本效率大幅提升 | 《伟大无法被规划》| POET | PowerPlay | UCB老虎机

- 来源：最佳拍档
- 发布时间：2026-04-10T09:01:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/2794
- 原文：https://www.youtube.com/watch?v=m17jqrqBZSc

## 摘要

Sakana AI 开源了一个叫 Shinka Evolve 的框架，核心思路是让大语言模型像进化算法一样自己改代码、写新程序，不断迭代出更强的解法。它主要想解决谷歌 DeepMind 之前 AlphaEvolve 的一个痛点：太费资源，动不动就要评估上千个程序。Shinka Evolve 在经典的圆堆积问题上，用少得多的评估次数就超过了 AlphaE...

## 推荐理由

这篇值得 featured，但不到 P1。钩子清楚——用更少评估超越 AlphaEvolve，机制也讲得明白，比如用 UCB 老虎机在 GPT-5、Claude Sonnet 4.5、Gemini 之间动态选模，还加了程序交叉和全文件重写。对做 agent 的人来说，评估贵、任务设计和硬验证一直是头疼的事，文章直接点出系统仍需人类给题、自动发明问题和严格验证没解决，这点很实在。我会先打个折：关键指标、成本和主发布链接都没给，所以停在 80 分。

## 锐评

这个 Shinka Evolve 框架最值得看的地方，是它用了一种类似“多臂老虎机”的算法，让系统自己决定什么时候用 GPT-5、什么时候用 Claude，而不是死绑一个模型。这解决了多模型协作时“功劳算谁的”这个麻烦事。另外，它允许模型直接重写整个文件，或者把两个程序的思路杂交一下，这比只改几行代码的变异方式探索空间大得多。

不过，先别太激动。文章里反复提“样本效率大幅提升”，在圆堆积问题上超过了 AlphaEvolve，但关键的评估次数、成本、性能差距这些硬数字一个都没给。而且，这个系统目前还只能处理单文件程序，离真实科研里动辄几十个文件的代码库还很远。

最大的限制还是验证。它现在依然需要人来定义问题和写评估器，自己没法判断一个新问题值不值得解。如果验证环节有漏洞，模型很容易学会钻空子拿高分，而不是真正解决问题。负责人自己也说，自动硬验证是未来的核心突破口，现在还没解决。
