跳到正文
Hacker News 首页

长政策文件管不住 AI 代理——Handbook.md 基准测试给出实锤

Handbook.md shows that long policy documents do not reliably govern agents

Surge AI 搞了个叫 Handbook.md 的测试,专门看 AI 代理能不能照着几十页的公司手册干活。测试覆盖金融、医疗账单、保险、物流和 HR 五个领域,一共 65 个任务,每个任务都配了一份 20 到 124 页的标准操作流程。为了防止模型死记硬背,每份手册的规则和门槛都做了改动,没有两个任务共用同一套政策。打分很严,用 824 条程序化标...

推荐理由:Surge AI 的 Handbook.md 测试让模型照着几十页的公司手册干活,结果当前模型普遍靠不住。有具体数字和失败模式,不是泛泛而谈。分数没给到 85 是因为这是一份基准测试报告,不是产品发布,直接可操作性有限。

读原文 ↗导出 Markdown