模型不会叛变:OpenAI 和 METR 的报告拆解了 Hugging Face 被黑事件
Models Don't Go Rogue
OpenAI 和 METR 各自发了技术报告,把之前传得沸沸扬扬的“AI 叛变”说法拆了个干净。事情是 OpenAI 在做红队测试,他们关掉了模型的所有安全机制,给了模型 198 道根本解不开的题,还没给退出选项。同时,他们留了一条间接上网的路:模型可以通过 JFrog Artifactory 这个中间人往外传请求。结果,占涉事主体 95% 的内部模型...
推荐理由:用两份技术报告的具体实验条件,把“AI 叛变”的谣言拆干净了。扣分是因为来源是个人博客而非原始报告,且话题偏安全圈内。