跳到正文
Hacker News 首页

Claude 新模型在工具调用里自己编字段,把 Pi 的编辑流程搞崩了

Better Models: Worse Tools

Armin Ronacher 发现,Anthropic 最新的 Opus 4.8 和 Sonnet 5 在调用 Pi 的编辑工具时,会凭空捏造出 requireUnique、oldText2 这类 schema 里根本不存在的字段,导致校验失败。老模型反而没这毛病。在多轮 agent 对话里,Opus 4.8 大概有 20% 的调用会翻车;把历史里的思...

推荐理由:Armin Ronacher 亲手测出来的结果,Opus 4.8 和 Sonnet 5 在调用 Pi 的编辑工具时,会凭空捏造 requireUnique、oldText2 这类 schema 里不存在的字段,大约 20% 的调用会翻车,而老模型反而规规矩矩。这是一个可复现的工程发现,对正在用 Claude 搭 agent 的人来说是实打实的踩坑预警。没给更高分是因为问题范围目前局限在 Pi 的编辑工具这一个场景,还不确定是不是普遍现象,但就凭“新不如旧”这个反直觉结论和 20% 的翻车率,已经足够让做 agent 的人停下来看一眼了。

读原文 ↗导出 Markdown