长政策文件管不住 AI 代理——Handbook.md 基准测试给出实锤
Handbook.md shows that long policy documents do not reliably govern agents
Surge AI 搞了个叫 Handbook.md 的测试,专门看 AI 代理能不能照着几十页的公司手册干活。测试覆盖金融、医疗账单、保险、物流和 HR 五个领域,一共 65 个任务,每个任务都配了一份 20 到 124 页的标准操作流程。为了防止模型死记硬背,每份手册的规则和门槛都做了改动,没有两个任务共用同一套政策。打分很严,用 824 条程序化标...
推荐理由:Surge AI 的 Handbook.md 测试让模型照着几十页的公司手册干活,结果当前模型普遍靠不住。有具体数字和失败模式,不是泛泛而谈。分数没给到 85 是因为这是一份基准测试报告,不是产品发布,直接可操作性有限。