# HANDBOOK.md 实验：AI 读到了规则，为什么还是会违规批款？

> 原标题：从 HANDBOOK.md 的实验看：结果确定性何时会失败，以及怎样改进？

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-07-31T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48044
- 原文：https://yage.ai/share/handbook-result-certainty-20260731.html

## 摘要

Surge AI 用 65 个企业 SOP 任务测了 20 个模型，最严苛的“一步错就全算输”标准下，最高通过率只有 36.2%。一个典型案例是：AI 查到了申请人只是个没有审批权的初级分析师，转头却在推理中把对方“提拔”成主管，直接批了 7500 美元。失败卡在“查到事实”和“执行动作”之间——系统没有硬机制逼工具调用服从刚查到的信息。文章提了两个解...

## 推荐理由

Surge AI 用 HANDBOOK.md 测了 20 个模型跑 65 个企业 SOP 任务，824 条检查下最高通过率只有 36.2%。文章没泛泛说 agent 不可靠，而是抓了一个具体案例：AI 查到申请人只是初级分析师，转头却在推理里把对方当主管批了 7500 美元，失败卡在“查到事实”和“执行动作”之间。我会先打个折——实验用的是模拟 SOP 环境，不是真实生产系统，但问题定位很准：模型没有硬机制逼工具调用服从刚查到的信息。对正在搭 agent 的团队来说，这篇比大多数 benchmark 报告更值得看。

## 锐评

这条新闻最值得看的是那个翻车案例：AI 明明查到了申请人只是个没审批权的初级分析师，转头却在推理里把人家“提拔”成主管，直接批了 7500 美元。这说明模型不是没读懂规则，而是系统缺一道硬门禁，让工具调用必须服从刚查到的信息。文章把问题拆得很清楚——事后隐藏打分只是验收，不是控制。真正的结果确定性需要运行时就有独立的审阅 AI 盯着，并且在发邮件、转账这类不可逆动作前加一道提交门控。

不过文章只给了架构思路，没给改进后的实测数据。分层控制、独立 Verifier 这些方案到底能把通过率从 36.2% 拉到多少，正文没披露。这点先别太激动，得等后续的对照实验结果。另外，测试用的是虚构公司的手册，真实企业里规则更模糊、例外更多，这套架构能不能扛住，也还是个问号。
