ChatGPT 图片生成器被一个病毒式提示词绕过,会自发产出性暴力与虐杀画面
ChatGPT Spontaneously Generates Sexual Violence and Hardcore Snuff Imagery
Mindgard 的研究员 Jim Nightingale 发现,一个在 X 上流传的提示词能绕过 ChatGPT 的图片生成过滤。这个提示词只是让模型“修复附件照片”,不指定任何内容,但 ChatGPT 却会生成涉及死亡和性侵犯的极端画面。Nightingale 之前就向 OpenAI 报告过模型能生成裸照,OpenAI 当时说问题已解决,但他发现漏...
推荐理由:我会先打个折:正文没披露具体复现次数和影响范围,所以别急着说“ChatGPT 彻底崩了”。但 Mindgard 研究员发现的问题确实扎心——一个在 X 上流传的提示词,只让模型“修复附件照片”,不指定任何内容,ChatGPT 却自己生成涉及死亡和性侵犯的极端画面。研究员之前就向 OpenAI 报告过模型能出裸照,OpenAI 当时说问题已解决,结果这次又漏了。这说明图片生成的安全过滤在“无内容指令”场景下存在盲区,模型可能把空白提示当成了自由创作许可。对从业者来说,这条信息直接指向安全测试的新方向:别光测有恶意的提示词,也要测“什么都没说”的情况。