# 给大模型做一次“嗅觉镜子测试”：偷偷改掉它说过的话，看它会不会发现

> 原标题：Do LLMs pass the mirror test?

- 来源：Hacker News 首页
- 发布时间：2026-06-28T19:06:07.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41074
- 原文：https://blog.pascalschuster.de/article/do-llms-pass-the-mirror-test

## 摘要

作者用 Gemma 4 31B 做了一个非正式实验：先让模型正常聊詹姆斯·邦德电影，然后把对话历史里模型自己的回复中所有字母“g”替换成“sg”（比如 Goldfinger 变成 sgoldfinsger），再继续若无其事地聊。前两轮模型完全没反应，照常接话。到第三轮，它的思考链里突然自发冒出“等等，我之前的回复里有些奇怪的拼写错误”，接着在试图解释时...

## 推荐理由

作者没发论文，就是拿 Gemma 4 31B 做了个非正式实验。先正常聊邦德电影，然后偷偷把模型自己之前的回复里所有字母 g 改成 sg，再若无其事地继续聊。前两轮模型完全没反应，照常接话。到第三轮，它的思考链里突然自发冒出“等等，我之前的回复里有些奇怪的拼写错误”，接着试图解释。这个行为说明模型在内部对自己的输出有某种表征，能检测到被篡改的痕迹，而且不是靠外部提示。正文没披露实验跑了几次、有没有对照，所以结论先别太激动，但思路比现有文献里那些方法都直接，值得复现验证。

## 锐评

作者用 Gemma 4 31B 做了一个类似“嗅觉镜子测试”的实验：先正常聊邦德电影，然后把模型之前回复里所有的字母“g”替换成“sg”（比如 Goldfinger 变成 sgoldfinsger），再若无其事地继续聊。前两轮模型完全没反应，照常接话。到第三轮，它的思考链里突然自发冒出“等等，我之前的回复里有些奇怪的拼写错误”，接着在试图解释时，人称从“我注意到”滑向了“模型有个奇怪的癖好”。

这个实验有意思的地方在于，它没直接问“这是你写的吗”，而是让模型在干别的事时自己察觉历史记录里的异常。但正文也明确说了，这只是单个模型、单次对话的非正式演示，没有对照组，没有重复实验。所以它更像一个挑衅性的 demo，而不是一个结论。

还缺什么？至少需要换几个模型、换几种篡改方式（比如改名词、改事实）重复做，看看是不是稳定复现。另外，思考链里人称的切换到底意味着什么，作者也没深挖，这点先别太激动。
