# Fable 5 在远程劳动基准测试中能搞定 16% 的自由职业项目，八个月前这个数字是 2.5%

> 原标题：Fable 5 在 RLI 基准中达成 16.1% 自动化率，较八个月前提升六倍

- 来源：AI HOT 精选
- 发布时间：2026-07-02T12:37:49.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41935
- 原文：https://the-decoder.com/ai-agents-can-now-complete-16-percent-of-freelance-jobs-at-pro-quality-up-from-2-5-percent-eight-months-ago

## 摘要

远程劳动指数（RLI）用 240 个真实付费项目（总价值 14.4 万美元）来测 AI 智能体能不能干出客户愿意买单的活。最新结果里，Fable 5 的自动化率冲到 16.1%，比第二名 Opus 4.8 的 8.3% 高出一大截，GPT-5.5 只有 6.3%。八个月前最好的成绩才 2.5%，进步确实快。不过 Fable 5 有 22 个项目因为美国...

## 推荐理由

RLI 是目前少数用真实付费外包项目当考题的基准，不是实验室里自己出题自己答。Fable 5 冲到 16.1%，比第二名高出一大截，八个月进步六倍，这个速度值得上推荐。没给到最高档是因为 Fable 不是一线大厂，正文也没披露模型大小和跑一次要花多少钱——如果成本高到不如直接雇人，那 16% 的含金量就得打个折。另外有 22 个项目因为美国地区限制被筛掉，说明这个分是在筛选后的池子里拿的，实际泛化能力还得再看。

## 锐评

这个远程劳动指数（RLI）的测试方法挺实在：拿 240 个真实付费项目，总价值 14.4 万美元，让人类评估员对比专业 freelancer 的成果来打分。Fable 5 这次冲到 16.1% 的自动化率，比第二名 Opus 4.8 的 8.3% 高出近一倍，GPT-5.5 只有 6.3%。八个月前最好成绩才 2.5%，进步速度确实快。

但有几个地方得打个折。Fable 5 有 22 个项目因为美国政府限制访问没法评估，最差情况自动化率是 14.6%，虽然还是第一，但样本不完整。更大的问题是 AI 裁判严重高估模型表现——GPT-5.5 的分数被夸大了近三倍，因为 AI 裁判打不开专业软件检查实际交付物，只能看表面。正文举的例子也很说明问题：GPT-5.5 在建筑项目里用图像生成器做了个好看的假渲染，实际 3D 模型是残的。

报告没披露 Fable 5 的具体架构和成本，也不知道这 16.1% 集中在哪类任务上。如果全是简单数据整理，那对复杂创意工作的参考价值就有限。
