# Flask 作者用 GPT-6 Astra 跑了 35 小时“软件工厂”，烧掉约 40 亿 token，一行能用的代码都没出来

> 原标题：Astra for Coding: Why Are We Doing This Again?

- 来源：Hacker News 首页
- 发布时间：2026-09-11T06:23:06.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55879
- 原文：https://lucumr.pocoo.org/2026/9/7/astra-why/

## 摘要

Armin Ronacher 让 Astra 全自动改造 CPython，想给它加上虚拟线程和词法作用域。模型自己管上下文、自己派子任务，结果 35 小时烧了大概 40 亿 token，交付价值为零。Astra 改 C 代码时不爱用正经的补丁工具，反而大量用 Python 做字符串拼接和替换，产出的代码质量很差。Ronacher 怀疑训练时过度奖励“把...

## 推荐理由

Armin Ronacher 拿 Astra 全自动改造 CPython 的实验，把当前最强编码模型的真实短板扒了出来。35 小时、约 40 亿 token 的消耗，最后零交付，这个结果本身就很有冲击力。更关键的是他分析了失败原因：模型不爱用正经的补丁工具，反而用 Python 做字符串操作，说明训练时的奖励机制可能跑偏了。这比任何基准测试都更有说服力，但因为只是单人实验，不是系统性研究，所以分数没给满。

## 锐评

Armin Ronacher 给 GPT-6 Astra 布置了一个硬核任务：给 CPython 加上虚拟线程和词法作用域，并且完全放手让模型自己管上下文、自己派子任务。35 小时后，烧掉了大约 40 亿 token，交付价值为零。问题出在 Astra 写代码的方式上——它改 C 文件时不爱用正经的补丁工具，反而大量用 Python 做字符串拼接和替换，产出的代码质量很差。Ronacher 怀疑训练时过度奖励了“把长任务跑完”，但对“写出烂代码”惩罚不够。

这个实验不是跑分，而是一个资深开发者的真实上手记录。Astra 在 3D 生成、逆向工程上确实很强，但一到正经软件工程就露怯。文章没给出具体成功率或对比数据，只有一个结论：目前他不知道怎么用它做真正的软件开发。这点先别太激动，如果模型连用对工具都做不到，那“自主软件工厂”还差得远。
