# 工具调用代理的认知与行动脱节机制研究

> 原标题：工具使用代理认知与行动脱节机制研究

- 来源：AI HOT 精选
- 发布时间：2026-05-16T20:40:07.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21759
- 原文：https://x.com/omarsar0/status/2055750162526715926

## 摘要

这篇可解释性论文专门研究了让模型调用工具的代理，发现一个挺要命的问题：模型经常心里知道该调工具了，但手上就是没动作。这种“知道却做不到”的比例在 26% 到 54% 之间，而且毛病全出在从认知到行动的过渡阶段，不是模型没看懂。内部探测显示，模型在后期层处理最后一个 token 时，会把信号转歪，转出来的方向几乎和要执行的动作正交，导致行动失败。研究想通...

## 推荐理由

这篇可解释性论文盯着工具使用代理的一个具体毛病：模型能识别出该调用工具，但最后没执行，认知到行动的脱节率在 26% 到 54% 之间。我会先打个折——正文没披露具体模型、任务设置和论文全名，所以数字的适用范围还不清楚。但这点先别太激动，它确实点出了一个很常见的 agent 翻车场景：不是模型不懂，是懂了但没做。对做 agent 可靠性的同学来说，这个视角比单纯说“模型不会用工具”更有诊断价值。

## 锐评

这篇论文挖出了一个挺具体的 bug：模型调用工具时，认知和行动会脱节。不是模型没看懂该不该调，而是看懂之后，在最后几层处理时把信号方向转偏了，偏到几乎和要执行的动作正交，结果就是不动手。不匹配率在 26% 到 54% 之间，这个范围说明不同场景下严重程度不一样，但整体都不低。

研究用的是探测隐藏状态的方法，定位到问题完全卡在“认知到行动”的过渡阶段。这比泛泛说“提示没写好”或“训练不够”要精确得多，直接指向了模型后期层的几何结构。对做 agent 的人来说，这意味着单纯改 prompt 或加训练数据可能治标不治本，性能上限被这个内部信号旋转卡住了。

不过正文没披露实验用的是哪些具体模型和工具调用场景，也没说这个比例是在什么任务上测出来的。如果是在简单任务上就有 26% 的失败率，那放到复杂业务流程里只会更糟。另外，研究说想预测干预效果，但没给出实际干预后的改善数字，这点先别太激动。
