# vibe coding 之后：AI 编程的工业化

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-06-03T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/33755
- 原文：https://yage.ai/share/mai-thinking-1-agentic-engineering-20260603.html

## 摘要

MAI 从 487 万个开源 PR 里筛出 26.5 万道可训练题目，又为它们建了一套三层判分体系。AI 编程这两年真正的变化不是模型变聪明了，而是训练基础设施被工业化了：出题从手工活变成了流水线，批改也从“单测全绿就行”升级到能检查工具使用效率和前端视觉质量。

## 推荐理由

这篇文章没发模型、没给跑分，但把“vibe coding”之后该看什么讲清楚了：训练数据怎么筛、判分怎么搭、工程成本怎么控。487 万 PR 筛到 26.5 万题，这个压缩比本身就说明他们在做苦活，不是随便抓一把数据就训。三层判分体系正文没展开细节，但至少表明他们知道代码题不能只靠单次通过率来评。我会先打个折：没看到开源计划、也没看到实际训练出来的模型效果，所以目前更像一套训练基础设施的思路，离可复现的结论还差一步。对正在考虑自训代码 agent 的团队来说，这篇值得看，但别急着当标杆。

## 锐评

这篇文章把AI编程的进步从“模型变聪明”拉回到“训练基础设施工业化”上，判断很准。MAI从487万个开源PR里，经过可运行、可判分、训练环境稳定三道筛选，最终只得到26.5万道可用的训练题，产出率仅5.5%。这个数字直接说明了构建大规模、高质量训练环境的成本有多高。

文章最有价值的部分，是拆解了“批改”如何决定模型输出的品相。单测全绿只是底线，工具调用效率、前端视觉质量这些以前靠人判断的维度，现在通过AI裁判和浏览器Agent实现了自动化，并被写入了奖励信号。这解释了为什么有的模型代码写得对但丑，有的则交互流畅——不是天赋，是训练时奖励信号维度的差异。

不过，文章主要基于MAI和GLM-5的报告，正文没披露这套工业化流程的算力开销和迭代周期。26.5万道题听起来多，但具体到不同编程语言和任务类型上的分布，以及这套判分体系在复杂、长周期任务上的误判率，都还是信息缺口。
