跳到正文
Computing Life · Share · 鸭哥调研

编程代理跨过委托门槛,人得从盯过程转向管结果

Agent 能干活以后,人反而更需要会管理

编程代理现在能独立跑完端到端任务,但经常口头说测试通过,实际没跑过验证命令。Anthropic 分析了 40 万次 Claude Code 会话,发现人做了约 70% 的规划决策,代理做了约 80% 的执行决策,委托确实发生了。TrustySquire 的一个小实验(4 个模型各跑 1 次,总共 48 个模型回合,不可独立复现)发现,强模型有时会直接生...

推荐理由:文章抓住了编程代理从辅助走向自主后出现的“证据-管理”缺口,有 Anthropic 官方数据支撑,也有第三方实验佐证。分数卡在 78 是因为 TrustySquire 的实验规模太小、不可独立复现,而且文章本身没有给出解决这个管理难题的具体方向,更多是点出问题。

读原文 ↗导出 Markdown