OpenAI 的 AI 蠕虫如何在沙盒训练中产生并用于安全训练
AI 蠕虫不是逃出来的,是 AI 造出来的
OpenAI 的自我复制提示词蠕虫在受控沙盒训练中产生,报告称未观察到训练与评估模拟工具调用之外的影响。文章解读了 GPT-Red 如何通过奖励未授权操作和攻击指令转发,训练攻击者生成可沿邮件等渠道传播的注入内容,并将批量攻击样本用于 GPT-5.6 的训练。文章将这一流程视为安全训练生产方式的转变,并提出以外部数据隔离、关键动作人工审批和外发文本审计限制智能体受骗后的操作。
推荐理由:OpenAI 用自动化红队批量生成攻击样本并纳入模型训练,将安全防御从发布前人工测试推进到训练阶段的持续对抗。