# 亚马逊在 AI 训练数据里发现了儿童性虐待内容，已删除但没公布来源和规模

> 原标题：Amazon Discovered Child Sex Abuse Content in AI Training Data

- 来源：彭博科技
- 发布时间：2026-01-29T20:44:50.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6159
- 原文：https://www.bloomberg.com/news/videos/2026-01-29/amazon-finds-child-sex-abuse-content-in-ai-training-data-video

## 摘要

亚马逊在准备训练模型前，从数据里扫出了儿童性虐待材料（CSAM），并在训练前做了删除。正文没披露这批数据的具体来源、体量和发现时间。儿童安全官员担心，不公开来源会让执法部门没法追查上游。这点先别太激动——目前只知道亚马逊自己发现并处理了，没有外部审计或第三方验证，所以到底漏了多少、怎么进来的，都还是未知数。

## 推荐理由

Bloomberg 挖出一个罕见的数据治理事故：亚马逊在 AI 训练数据里发现了儿童性虐待内容，并在模型训练前删掉了。我会先打个折——正文没披露这些内容具体来自哪个数据集、有多少条、什么时候发现的，所以没法判断是偶发脏数据还是系统性污染。真正值得盯的是来源未公开这一点，儿童安全官员直接说这会妨碍执法调查，等于把亚马逊架在火上烤。对从业者来说，这是个实打实的提醒：爬回来的数据再大，也得有能交代来源的清洗流程，不然安全风险和合规风险一起爆。

## 锐评

亚马逊自己披露在准备训练模型时，从数据里发现了儿童性虐待材料（CSAM），并在训练前做了删除。这件事的核心不是“他们处理了”，而是“他们不说数据从哪来的”。儿童安全官员的担忧很直接：不公开来源，执法部门就没法追查上游，等于把线索掐断了。

目前所有信息都来自亚马逊单方面说法，没有第三方审计或外部验证。正文没披露这批数据的具体体量、来源渠道、发现时间，也没说用的是哪种检测手段、误报率如何。所以“删了”这个动作本身只能说明他们有一道筛查工序，不能说明这道工序有多可靠，也不能说明之前有没有类似数据漏进过其他训练集。

对从业者来说，这条新闻的价值在于提醒：大规模爬取数据做预训练，CSAM 污染不是会不会有的问题，而是什么时候发现的问题。亚马逊这次是训练前扫出来的，算运气好。但行业整体缺一套公开的污染溯源机制，各家都是关起门来处理，外面的人既不知道规模，也没法做横向对比。这点先别太激动——等有独立审计或执法部门介入，才算真正有进展。
