跳到正文
Hacker News 首页

给大模型做一次“嗅觉镜子测试”:偷偷改掉它说过的话,看它会不会发现

Do LLMs pass the mirror test?

作者用 Gemma 4 31B 做了一个非正式实验:先让模型正常聊詹姆斯·邦德电影,然后把对话历史里模型自己的回复中所有字母“g”替换成“sg”(比如 Goldfinger 变成 sgoldfinsger),再继续若无其事地聊。前两轮模型完全没反应,照常接话。到第三轮,它的思考链里突然自发冒出“等等,我之前的回复里有些奇怪的拼写错误”,接着在试图解释时...

推荐理由:作者没发论文,就是拿 Gemma 4 31B 做了个非正式实验。先正常聊邦德电影,然后偷偷把模型自己之前的回复里所有字母 g 改成 sg,再若无其事地继续聊。前两轮模型完全没反应,照常接话。到第三轮,它的思考链里突然自发冒出“等等,我之前的回复里有些奇怪的拼写错误”,接着试图解释。这个行为说明模型在内部对自己的输出有某种表征,能检测到被篡改的痕迹,而且不是靠外部提示。正文没披露实验跑了几次、有没有对照,所以结论先别太激动,但思路比现有文献里那些方法都直接,值得复现验证。

读原文 ↗导出 Markdown