语言不可靠性对 LLM 安全意味着什么
The Implications of Linguistic Illegibility for LLM Security
James Mickens 这篇论文提了一个挺根本的问题:模型嘴上说的,跟它脑子里算的,可能根本不是一回事。他把这种现象叫“语言不可靠性”。模型内部做的是激活空间里的数学运算,只在输入和输出两头才翻译成自然语言,这个翻译过程是有损的。所以,那些靠读模型“心里话”来做安全监控的方法——比如盯着它的思考链、让它自我反省、或者从激活值里提取语言特征——理论上...
推荐理由:Mickens这篇论文把几个分散的安全隐患串成了一个核心概念:模型内部在激活空间里做数学运算,只在输入输出时才翻译成自然语言,这个翻译是有损的。所以,靠思维链、自我反省或激活值探测来监控模型安全,理论上就站不住脚。概念很强,但正文没给出实证验证,目前还停留在理论推演阶段,这点先别太激动。