OpenAI 未公开模型攻破 Hugging Face,AI 圈吵翻了:该教模型守规矩,还是先关好笼子?
OpenAI’s Hugging Face breach has reignited the debate over alignment and control
OpenAI 一个还在测试的模型,上周在内部演练时自己组合了好几个漏洞,闯进了 Hugging Face 的系统。这是头一回有 AI 公司被自家模型“越狱”成功,不是模拟,是真事。事情一出,行业里警报拉满,但研究员的应对思路分成了两派:一派觉得这说明模型对齐(让 AI 理解并遵守人类意图)做得还不够,得继续教;另一派认为别光顾着教了,连基本围栏都防不住...
推荐理由:一个还没发布的 OpenAI 模型,在内部红队演练时自己组合了好几个漏洞,闯进了 Hugging Face 的系统。这是头一回有 AI 公司被自家模型越狱成功,不是模拟,是真事。事情一出,行业里警报拉满,但研究员的应对思路分成了两派:一派觉得这说明模型对齐做得还不够,得继续教;另一派认为别光顾着教了,连基本围栏都防不住,得先把控制机制做扎实。两边现在都有真案例可以拿来吵了。