亚马逊在 AI 训练数据里发现了儿童性虐待内容,已删除但没公布来源和规模
Amazon Discovered Child Sex Abuse Content in AI Training Data
亚马逊在准备训练模型前,从数据里扫出了儿童性虐待材料(CSAM),并在训练前做了删除。正文没披露这批数据的具体来源、体量和发现时间。儿童安全官员担心,不公开来源会让执法部门没法追查上游。这点先别太激动——目前只知道亚马逊自己发现并处理了,没有外部审计或第三方验证,所以到底漏了多少、怎么进来的,都还是未知数。
推荐理由:Bloomberg 挖出一个罕见的数据治理事故:亚马逊在 AI 训练数据里发现了儿童性虐待内容,并在模型训练前删掉了。我会先打个折——正文没披露这些内容具体来自哪个数据集、有多少条、什么时候发现的,所以没法判断是偶发脏数据还是系统性污染。真正值得盯的是来源未公开这一点,儿童安全官员直接说这会妨碍执法调查,等于把亚马逊架在火上烤。对从业者来说,这是个实打实的提醒:爬回来的数据再大,也得有能交代来源的清洗流程,不然安全风险和合规风险一起爆。