# Claude 托管智能体新增“做梦”功能，Harvey 实测任务完成率暴涨约 6 倍

> 原标题：嘘，Claude正在「做梦」！睡一觉疯狂进化，一夜暴涨6倍战力

- 来源：新智元 · 公众号
- 发布时间：2026-05-07T04:02:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15715
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652698250&idx=2&sn=55071d7c98d04b893a5907ebbfcaafb1

## 摘要

Anthropic 给 Claude 的托管智能体加了三个新能力：Dreaming（做梦）、Outcomes（结果校验）和多智能体协作。其中“做梦”是指让 Claude 在后台读取最多 100 段历史会话，自己总结规则来改进表现，一次演示里它把 530 万 token 的对话提炼成了 98 条规则。法律 AI 公司 Harvey 实测后，任务完成率比之...

## 推荐理由

Anthropic 给 Claude 托管 Agent 加了三个东西：Dreaming 让模型事后翻历史会话自己总结规则，Outcomes 用偏好样本教模型对齐目标，多 Agent 编排让多个 Claude 协作干活。Harvey 说任务完成率大约翻了 6 倍，Outcomes 内部测试最高能提 10 个百分点。运行时另收 0.08 美元/会话小时，正文没披露这个定价的横向对比。我会先打个折：6 倍是合作方数据，没看到独立复现，但 Dreaming 从 530 万 token 压到 98 条规则这个例子确实说明能省不少上下文成本。

## 锐评

Anthropic 给 Claude 的托管智能体加了三个新能力，最值得看的是“做梦”——让模型在后台读最多 100 段历史对话，自己提炼行为规则。一次演示里，它把 530 万 token 的对话压成了 98 条规则，相当于模型自己给自己写了个操作手册。法律 AI 公司 Harvey 实测后说任务完成率涨了约 6 倍，另一个叫“结果校验”的功能把成功率又拉了 10 个百分点。

不过 Harvey 的数据得打个折。正文没披露原来的完成率是多少，也没说测试任务长什么样、样本量多大。从 10% 提到 60% 和从 80% 提到 85% 完全是两回事，前者是能用，后者是锦上添花。另外，这些功能目前只开放给 Opus 4.7 和 Sonnet 4.6，还要额外收每小时 0.08 美元的运行时费，小团队用起来成本不低。

还缺几个关键信息：100 段历史对话够不够覆盖长尾场景？模型自己总结的规则会不会越学越偏？多智能体协作具体怎么分工、有没有冲突处理机制？这些都没说清楚。整体看，方向有意思，但离“睡一觉就进化”还差不少验证。
