Anthropic 用 Jacobian Lens 透视大模型内心:嘴上说好话,心里在骂假消息
Anthropic 新论文:用 Jacobian Lens 读取大模型想说但没说出口的思考
Anthropic 在 7 月 6 日发了篇论文,介绍一种叫 Jacobian Lens 的观测工具。这东西计算成本很低,能读到模型在中间层“准备说但没说出口”的概念。实验里,给模型喂假搜索结果,它表面输出客观礼貌的答复,但用 Jacobian Lens 一看,内部状态在疯狂闪烁 fake、fraud、fictional、poison、injectio...
推荐理由:这篇论文最抓人的是那个假搜索结果实验:模型嘴上说得好听,内部却在疯狂报警。Jacobian Lens 本身成本低、思路巧,但论文刚出,还没被外部复现,工具的实际适用范围和误报率都还需要更多验证,所以分数先打个折,没给更高。