# MIT 搞出一种新审查方法，不用生成任何图片就能揪出被训练来生成儿童性虐待素材的 AI 模型

> 原标题：MIT's New Method Flags AI Models Trained on CASM Without Generating It

- 来源：Hacker News 首页
- 发布时间：2026-07-13T21:44:18.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44104
- 原文：https://insideai.news/news/ai-safety/mits-new-method-flags-ai-models-trained-on-child-abuse-imagery-without-generating-it/3869/

## 摘要

MIT 和儿童安全组织 Thorn 合作，搞了个叫“高斯探测”的技术。它不给模型下指令，也不让它生成任何图片，而是喂一堆随机数据进去，分析模型内部因为 LoRA 微调（一种给模型加装轻量插件来改变行为的方式）产生的变化，靠这个来判断模型有没有被教坏。论文说，这个方法识别专门生成儿童性虐待素材的模型，准确率是 100%。这直接绕过了以前的一个死结：为了查...

## 推荐理由

MIT 和 Thorn 搞的这个高斯探测，解决了一个很实际的死结：以前要查模型有没有被教坏，得让它生成违法图片，等于为了取证先犯罪。现在他们换了个思路，不给模型下指令，也不让它生成任何东西，就喂一堆随机数据进去，看模型内部因为 LoRA 微调留下的痕迹。论文说识别专门生成儿童性虐待素材的模型，准确率 100%。我会先打个折，因为正文没披露测试集规模和误报率，但思路确实聪明——把检测从“看输出”变成了“看内部结构”，对模型托管平台和合规审查来说，是个能落地的工具。

## 锐评

MIT 和 Thorn 合作搞出的“高斯探测”，思路很巧：不给模型下指令让它画图，而是喂一堆随机噪声进去，看模型内部因为 LoRA 微调（一种给模型加轻量插件改行为的方式）留下的痕迹。论文说，靠这个痕迹识别专门生成儿童性虐待素材的模型，准确率是 100%。这个数字是在他们自己构建的测试集上跑出来的，正文没披露测试集具体覆盖了多少种模型变体，所以实际场景里能不能复现这个完美数字，得先打个折。

这个方法最大的价值是绕过了法律死结。以前想查一个模型有没有被教坏，得让它生成图片来验证，但这本身就违法。现在直接查“插件”留下的内部指纹，不用生成任何内容。NCMEC 2025 年收到超过 150 万份 AI 生成的此类报告，比 2024 年的 6.7 万份翻了二十多倍，平台确实急需这种能自动扫描上传模型的技术。

论文提到想绕过这个检测，得去改基础模型架构，门槛比改提示词高很多。但还缺一块关键信息：如果坏人用更隐蔽的微调方法，或者把恶意能力直接训练进基础模型而不是靠 LoRA 插件，这个方法还灵不灵，正文没说。
