# 苹果新论文问：多模态模型没开口的 logits 里，到底藏了多少画面信息？

> 原标题：苹果新论文发出惊人一问：What do your logits know?

- 来源：机器之心 · 公众号
- 发布时间：2026-04-27T00:03:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/10541
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651030149&idx=2&sn=963ed37cae4a5dd3e0b48da968103ece

## 摘要

苹果这篇论文直接测了一个安全问题：视觉语言模型在生成回答前，内部那串“候选词概率”（logits）会不会把图片细节漏出去。他们在 CLEVR 和 MSCOCO 上做实验，发现只靠排名前 30 到 80 的 logits 值，就能反推出图片里有没有噪声、目标物体的特征，甚至部分背景属性。风险点在于，现在有些灰盒 API 会返回 top-k 的 log 概...

## 推荐理由

我会先打个折：这不是一个能直接拿来用的攻击工具，更像一次扎实的探针实验。但它的价值在于把“logits 能泄密”从直觉变成了可量化的证据，30–80 这个范围让风险变得具体。对做 VLM API 的团队来说，如果还在对外吐 top-k 对数概率，这篇论文值得立刻看一遍。

## 锐评

苹果这篇论文问得很直接：视觉语言模型在生成回答前，内部那串“候选词概率”（logits）会不会把图片细节漏出去。他们在 CLEVR 和 MSCOCO 上做实验，发现只靠排名前 30 到 80 的 logits 值，就能反推出图片里有没有噪声、目标物体的特征，甚至部分背景属性。这个发现对现在越来越流行的“灰盒 API”是个警钟——有些服务商会返回 top-k 的 log 概率，原本是为了方便开发者调模型，结果可能变成信息泄露的通道。

论文用的是 Qwen 和 Llama 系列模型，验证方式是通过探针（probe）去解码 logits 里藏的信息。正文没披露具体攻击场景下的成功率有多高，也没说这种泄露在真实部署中能被利用到什么程度。这点先别太激动，实验室条件和线上环境差距不小。

还缺一个关键信息：如果服务端对 logits 做裁剪或加噪，这种泄露还能剩多少。另外，论文没讨论防御成本，比如限制返回的 logits 数量会不会影响正常使用。整体看，这是个值得关注的安全方向，但离“紧急修补”还有距离。
