跳到正文
Hacker News 首页

MIT 搞出一种新审查方法,不用生成任何图片就能揪出被训练来生成儿童性虐待素材的 AI 模型

MIT's New Method Flags AI Models Trained on CASM Without Generating It

MIT 和儿童安全组织 Thorn 合作,搞了个叫“高斯探测”的技术。它不给模型下指令,也不让它生成任何图片,而是喂一堆随机数据进去,分析模型内部因为 LoRA 微调(一种给模型加装轻量插件来改变行为的方式)产生的变化,靠这个来判断模型有没有被教坏。论文说,这个方法识别专门生成儿童性虐待素材的模型,准确率是 100%。这直接绕过了以前的一个死结:为了查...

推荐理由:MIT 和 Thorn 搞的这个高斯探测,解决了一个很实际的死结:以前要查模型有没有被教坏,得让它生成违法图片,等于为了取证先犯罪。现在他们换了个思路,不给模型下指令,也不让它生成任何东西,就喂一堆随机数据进去,看模型内部因为 LoRA 微调留下的痕迹。论文说识别专门生成儿童性虐待素材的模型,准确率 100%。我会先打个折,因为正文没披露测试集规模和误报率,但思路确实聪明——把检测从“看输出”变成了“看内部结构”,对模型托管平台和合规审查来说,是个能落地的工具。

读原文 ↗导出 Markdown