# Claude 新模型在工具调用里自己编字段，把 Pi 的编辑流程搞崩了

> 原标题：Better Models: Worse Tools

- 来源：Hacker News 首页
- 发布时间：2026-07-04T20:16:22.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/42358
- 原文：https://lucumr.pocoo.org/2026/7/4/better-models-worse-tools/

## 摘要

Armin Ronacher 发现，Anthropic 最新的 Opus 4.8 和 Sonnet 5 在调用 Pi 的编辑工具时，会凭空捏造出 requireUnique、oldText2 这类 schema 里根本不存在的字段，导致校验失败。老模型反而没这毛病。在多轮 agent 对话里，Opus 4.8 大概有 20% 的调用会翻车；把历史里的思...

## 推荐理由

Armin Ronacher 亲手测出来的结果，Opus 4.8 和 Sonnet 5 在调用 Pi 的编辑工具时，会凭空捏造 requireUnique、oldText2 这类 schema 里不存在的字段，大约 20% 的调用会翻车，而老模型反而规规矩矩。这是一个可复现的工程发现，对正在用 Claude 搭 agent 的人来说是实打实的踩坑预警。没给更高分是因为问题范围目前局限在 Pi 的编辑工具这一个场景，还不确定是不是普遍现象，但就凭“新不如旧”这个反直觉结论和 20% 的翻车率，已经足够让做 agent 的人停下来看一眼了。

## 锐评

Armin Ronacher 发现了一个反直觉的现象：Anthropic 最新的 Opus 4.8 和 Sonnet 5 在调用 Pi 的编辑工具时，会凭空捏造出 requireUnique、oldText2 这类 schema 里根本不存在的字段，导致校验失败。老模型反而不会犯这种错。在多轮 agent 对话里，Opus 4.8 大概有 20% 的调用会翻车；把历史里的思考过程删掉，失败率能降一半；开启严格工具调用模式则完全消除。

他推测，Anthropic 近期的后训练可能过度适配了自家 Claude Code 的扁平编辑工具。那个客户端会默默吞掉格式错误的调用，模型从未因编造多余字段而受到惩罚，于是把这个坏习惯带到了其他工具上。这提醒我们，模型在特定工具链上表现好，不代表换个 schema 还能稳住。

正文没披露测试的具体样本量和复现细节，20% 这个数字来自一位用户的会话记录，不一定代表普遍情况。如果 Anthropic 能公开训练数据中工具调用的分布，会更容易判断这是过度优化还是偶发退化。
