# 差 10%，但便宜 100 倍、快 1 万倍：为什么模拟正在接管 AI 训练

> 原标题：[AINews] 10% worse, 100x cheaper, 10000x faster: Why Simulation is taking over

- 来源：Latent Space
- 发布时间：2026-08-22T07:36:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/52461
- 原文：https://www.latent.space/p/ainews-10-worse-100x-cheaper-10000x

## 摘要

Latent Space 梳理了一条从 2022 年延续至今的暗线：AI 训练管线里的每一个环节，都在从人造转向模型造。最早是奖励信号，InstructGPT 用模型代替人来打分；接着是训练数据，微软 Phi 系列证明模型生成的教科书数据能让小模型越级打怪；然后是老师角色，Alpaca 用几百美元蒸馏出接近前沿模型的表现；2024 年 Meta 的自奖...

## 推荐理由

Latent Space把‘模型生成数据替代人工标注’这件事，从2022年一路串到现在，每个节点都有具体论文和产品落地支撑，不是泛泛聊趋势。扣分点在于这是付费newsletter的周五综述，不是独家爆料或新发布，信息密度高但时效性一般。我会先打个折：对还没系统梳理过这条技术线的从业者来说，是一份很好的阅读清单；对已经跟得很紧的人，可能只是复习。

## 锐评

这篇文章把 2022 年至今的一条暗线讲得很清楚：AI 训练里原本靠人的环节，一个接一个被模型替代了。先是打分（InstructGPT 用模型当裁判），再是训练数据（微软 Phi 系列用模型生成的教科书数据让小模型越级打怪），接着是老师角色（Alpaca 花几百美元蒸馏出接近前沿模型的表现），2024 年 Meta 让模型自己定学习顺序，2026 年 Karpathy 的自动研究循环一晚上跑了 700 次实验，把 GPT-2 训练时间从 2.02 小时压到 1.80 小时。最新一步是 Z.ai 的 GLM-5.3 直接合成整个强化学习环境。作者把这些统称为“人类模拟”——比真人差 10%，但便宜 100 倍、快 1 万倍。

这个框架挺有解释力，但正文没给出“差 10%”的具体衡量标准，也没说这些合成环节在哪些任务上会崩。另外，文章主要引用的是前沿实验室的论文和产品，对中小团队落地时踩的坑基本没提。如果你在考虑把自己的训练管线也换成模型造，得先想清楚你的场景里那 10% 的差距能不能接受。
