跳到正文
Dwarkesh Patel 播客

AI 的样本效率黑洞:模型学东西比人费数据一百万倍

The sample efficiency black hole

Dwarkesh Patel 这篇文章的核心判断是:这几年 AI 变强,主要靠喂更多、更好的数据,而不是学得更省。他把强化学习(RL)看作一种合成数据生成——砸算力去筛出“好”答案,再让模型去预测这些答案。每个技能都需要上百个人类专家写示例、定评分标准,催生出一个年收入几十亿美元的数据标注行业。文章对比了人和模型的数据量:人到成年大约接触 2 亿个 t...

推荐理由:Dwarkesh 把强化学习重新定义为一种合成数据生成方式,并用人脑接触2亿token对比模型几万亿token的消耗,数字很直观。文章是观点评论而非一手实验,部分论证靠类比支撑,所以重要性给到78分。

读原文 ↗导出 Markdown