# Anthropic 花 280 美元一单，请 1000 名工程师给 Claude 的代码打分

> 原标题：280美元一单！1000名工程师教Claude写好代码

- 来源：新智元 · 公众号
- 发布时间：2026-06-06T05:46:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34987
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652705304&idx=3&sn=1f5969b7cbfc0935fedabc3ec6407b62

## 摘要

Anthropic 通过 Snorkel 的 Marlin 项目招募了约 1000 名软件工程师，专门审查 Claude 写的代码。每完成一单任务给 280 美元，工作流包括在 GitHub 仓库里提 Pull Request、对 AI 生成的两版代码做 A/B 对比，然后从正确性、安全性、可靠性和可维护性四个维度打分。正文没披露这些工程师的资历门槛、...

## 推荐理由

HKR 三项都成立：价格和人数有传播力，流程和评估维度够细，对做代码 Agent 的团队有参考价值。放在 featured 合适，但不到 p1，因为这不是新模型或新能力发布，更像一次数据标注合作的具体披露。正文没披露工程师资历门槛和任务一致性控制，这点先别太激动。

## 锐评

Anthropic 通过 Snorkel 的 Marlin 项目招募了约 1000 名软件工程师，专门审查 Claude 写的代码。每完成一单给 280 美元，工作流是在 GitHub 仓库里提 Pull Request，对 AI 生成的两版代码做 A/B 对比，然后从正确性、安全性、可靠性和可维护性四个维度打分。这个做法本质上是用人工反馈来校准代码生成质量，比单纯跑基准测试更贴近真实开发场景。

但正文没披露这些工程师的资历门槛、审查标准的具体细则，也没说 280 美元一单对应多大规模的代码审查任务。如果只是看几十行代码，这个单价不低；如果要审一个完整模块，那可能请不到足够资深的工程师。另外，1000 人的规模听起来不小，但分散到不同语言和框架上，每个细分领域的样本量可能很有限。

还缺一个关键信息：这些人工评分最终怎么反馈到模型训练里，是直接做偏好对齐还是只当评估数据用。如果是前者，标注质量会直接影响模型行为；如果是后者，那更像是一次大规模的用户调研。
