# 厂商加密推理防蒸馏基本没用，还把开发者的密钥泄露风险拉满了

> 原标题：模型蒸馏攻防的秘诀：厂商藏不住的推理，和你删不掉的密钥

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-08-12T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50428
- 原文：https://yage.ai/share/reasoning-theft-20260812.html

## 摘要

厂商把模型的思考过程加密藏起来，想阻止别人拿强模型输出去训练小模型，但两篇新论文证明这招不太灵。第一篇发现，Anthropic、OpenAI 和 Google 的加密推理块可以跨模型互换，攻击者花 720 美元就能用 Haiku 4.5 这种便宜小模型批量解码 Opus 4.8 的真实推理。第二篇更直接：根本不用碰加密块，拿一个 15 亿参数的弱模型训...

## 推荐理由

我会先打个折，因为两篇都还是预印本，厂商没回应，也没看到大规模利用的实锤，所以分数压在 85 以下。但内容本身够硬：第一篇发现三家大厂的加密推理块能互换，攻击成本才 720 美元，门槛极低；第二篇更狠，用 15 亿参数的小模型就能把加密推理里的信息榨出来，根本不用解密。这对做模型蒸馏攻防的人是个明确的警告，也说明现在靠加密藏推理来防蒸馏，效果可能比厂商想的差很多。

## 锐评

这两篇论文给模型厂商的推理加密策略泼了盆冷水。第一篇发现Anthropic、OpenAI和Google的加密推理块可以跨模型互换，攻击者用便宜的Haiku 4.5就能批量解码Opus 4.8的真实推理，一万条轨迹的成本才720美元。这等于厂商花大力气上的锁，被自家便宜小模型轻易捅开了。第二篇更彻底，根本不用碰加密块，拿一个15亿参数的弱模型训练反演模型，光看GPT-5.4 mini的公开答案就能反推出推理过程，让一个70亿参数学生模型的数学准确率从68.4%涨到76.0%。这说明只要模型输出逻辑严密的正确答案，思考步骤就藏不住。

但真正让我觉得离谱的是安全副作用。研究者从GitHub上扒了6708条公开的Agent运行轨迹，解密加密块后翻出62个API密钥、33个密码和7个私钥，其中64个敏感信息在明文对话里从来没出现过。开发者分享调试日志时以为自己清理干净了，实际上加密块里夹带的私货根本删不掉。正文没披露这些泄露案例的具体厂商分布，也没说受影响开发者是否收到了通知。

厂商把推理藏起来保护商业资产可以理解，但把无法审查、无法清理的黑盒数据块塞给开发者，等于把安全成本和运维风险全转嫁出去了。文章没讨论厂商是否计划提供加密块审查工具或开发者端的擦除接口，这点缺口对实际做应用的人来说很关键。
