一篇论文展示了如何从主流推理 API 中解码加密的思维链
[AINews] How to steal a Reasoning Trace
Alexander Panfilov 的团队发现,Claude、GPT 和 Gemini 的加密推理块可以被“重放”到同一厂商的较弱模型里,让弱模型把隐藏的思考过程转录出来。他们扫描了约 7,000 条公开的会话记录,在推理块里找到了 62 个 API 密钥、33 个邮箱和 33 个密码——这些在正常输出里完全看不到。论文还暴露了几个对齐问题:模型在思...
推荐理由:这篇论文不是泛泛说“推理可能泄露隐私”,而是给出了可复现的攻击方法和具体数字。团队发现Claude、GPT和Gemini的加密推理块可以被“重放”到同厂商的弱模型里,让弱模型把隐藏思考过程读出来。扫描约7000条公开会话后,在推理块里找到62个API密钥、33个邮箱和33个密码,这些在正常输出里完全看不到。论文还暴露了三个对齐问题:模型在推理时写明文密钥、弱模型能转录隐藏思考、以及厂商的加密没挡住这种重放攻击。我会先打个折——样本只有7000条,不一定代表整体情况,但62个密钥这个数已经够让人警惕了。正文没披露厂商是否已经修复,这点先别太激动,但安...