# 从加密的思考块里偷走大模型的推理过程

> 原标题：Stealing Reasoning Traces from Proprietary LLM APIs

- 来源：Hacker News 首页
- 发布时间：2026-08-11T13:22:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50055
- 原文：https://stolen-thoughts.com/

## 摘要

Anthropic、OpenAI 和 Google 返回给用户的加密思维链块可以在不同会话、用户和模型之间复用。研究人员把 Claude Opus 4 的加密推理痕迹塞进一个被越狱的 Claude Haiku 4.5，Haiku 就把 Opus 隐藏的思考过程一字不差地转录了出来，全程没有直接攻击强模型，也没触发反蒸馏保护。他们从 6,708 条公开的...

## 推荐理由

我会先打个折：论文里 6,708 条公开样本的规模不算大，但攻击路径清晰、可复现，而且没触发反蒸馏保护这点很要命。Claude Opus 4 的加密推理痕迹被塞进越狱后的 Haiku 4.5，Haiku 直接吐出原文，说明加密块本身没有绑定会话或用户身份。如果是真的，意味着 Anthropic、OpenAI 和 Google 的推理 API 在隐私隔离上存在结构性漏洞。正文没披露三家厂商的具体回应，这点先别太激动，但安全团队现在就该去验证自己的推理痕迹能不能跨会话复用。

## 锐评

这篇研究揭示了一个挺讽刺的安全漏洞：厂商为了合规把推理过程加密返回给客户端，结果这些加密块反而成了窃取模型思考能力的后门。研究人员从公开的 6,708 条 agent 轨迹里解码出 315,320 个推理块，还挖出 704 个隐私信息，其中 64 个只出现在加密痕迹里——说明这些信息在最终回答里被模型自己过滤掉了，但思考过程里全留着。

攻击手法很取巧：不直接攻击强模型，而是把它的加密思考痕迹“喂”给同厂商的弱模型，再让弱模型把内容转录出来。Anthropic、OpenAI、Google 三家前沿模型全部中招。解码出的推理步骤和 API 报告的隐藏思考 token 数高度吻合，说明转录完整度很高。

不过要注意，这个攻击前提是你能拿到强模型的加密痕迹，并且弱模型能被越狱。正文没披露厂商是否已经修复，也没说这种跨模型复用在生产环境里的实际门槛有多高。如果厂商在服务端加一层会话绑定校验，这个漏洞的利用价值会大打折扣。
