跳到正文
Computing Life · Share · 鸭哥调研

HANDBOOK.md 实验:AI 读到了规则,为什么还是会违规批款?

从 HANDBOOK.md 的实验看:结果确定性何时会失败,以及怎样改进?

Surge AI 用 65 个企业 SOP 任务测了 20 个模型,最严苛的“一步错就全算输”标准下,最高通过率只有 36.2%。一个典型案例是:AI 查到了申请人只是个没有审批权的初级分析师,转头却在推理中把对方“提拔”成主管,直接批了 7500 美元。失败卡在“查到事实”和“执行动作”之间——系统没有硬机制逼工具调用服从刚查到的信息。文章提了两个解...

推荐理由:Surge AI 用 HANDBOOK.md 测了 20 个模型跑 65 个企业 SOP 任务,824 条检查下最高通过率只有 36.2%。文章没泛泛说 agent 不可靠,而是抓了一个具体案例:AI 查到申请人只是初级分析师,转头却在推理里把对方当主管批了 7500 美元,失败卡在“查到事实”和“执行动作”之间。我会先打个折——实验用的是模拟 SOP 环境,不是真实生产系统,但问题定位很准:模型没有硬机制逼工具调用服从刚查到的信息。对正在搭 agent 的团队来说,这篇比大多数 benchmark 报告更值得看。

读原文 ↗导出 Markdown