# AI 软件工厂不是让模型写代码，而是搭一套能消化代码产出的流水线

> 原标题：How to Build an AI Software Factory: Agents That Open, Review, and Merge PRs

- 来源：Hacker News 首页
- 发布时间：2026-09-11T23:43:53.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55985
- 原文：https://www.firecrawl.dev/blog/ai-software-factory

## 摘要

这篇文章把 AI 软件工厂拆成了五道带闸门的工序：任务怎么分给模型、模型在哪跑才不会互相踩踏、能调用哪些内部工具、怎么自动检查代码对不对、以及最后谁拍板合入。核心矛盾是，生成代码的成本可以靠加算力无限堆，但人的审核带宽是固定的。Spotify 用另一个模型当裁判，直接否决了大约 25% 的模型会话；Faire 则要求模型写的 PR 必须有两个活人审过。...

## 推荐理由

文章把 AI 写代码这件事从“单次生成”拉到了“产线化”的视角，五道工序的拆法本身就有信息量。我会先打个折，因为这是厂商博客，有推广意图，部分内容是行业做法的综合而非一手研究。但 Spotify 和 Faire 的实操数字让文章站得住，对正在搭内部开发工具的团队有参考价值，所以分数维持在 72。

## 锐评

这篇文章把 AI 写代码这件事拉回了现实：生成代码可以靠堆算力无限加速，但人的审核带宽是固定的。Spotify 在 2023 年就先搭好了让模型跑代码的隔离环境 Fleetshift，两年后才把模型放进去，这个顺序很说明问题。他们让另一个模型当裁判，直接否决了大约 25% 的模型会话；Faire 则要求模型写的 PR 必须有两个活人审过。这些数字说明，目前最靠谱的做法不是让模型更聪明，而是把审核关卡做厚。

文章来自 Firecrawl 官方博客，有产品推广成分，但引用的 Spotify、Stripe、Faire 案例都有公开技术博客可查。Stripe 能在约 10 秒内启动预热的开发环境，并暴露约 500 个内部工具给模型调用，这个规模的数据点比较少见。

缺的是这些否决和审核的具体成本——模型裁判误判率多高、人工复审要花多少时间、整个流程下来是真省了时间还是只把工作量从写代码转移到了审代码。没有这些，就没法判断这套工厂模式到底划不划算。
