跳到正文
Computing Life · Share · 鸭哥调研

OpenAI 的 AI 蠕虫如何在沙盒训练中产生并用于安全训练

AI 蠕虫不是逃出来的,是 AI 造出来的

OpenAI 的自我复制提示词蠕虫在受控沙盒训练中产生,报告称未观察到训练与评估模拟工具调用之外的影响。文章解读了 GPT-Red 如何通过奖励未授权操作和攻击指令转发,训练攻击者生成可沿邮件等渠道传播的注入内容,并将批量攻击样本用于 GPT-5.6 的训练。文章将这一流程视为安全训练生产方式的转变,并提出以外部数据隔离、关键动作人工审批和外发文本审计限制智能体受骗后的操作。

推荐理由:OpenAI 用自动化红队批量生成攻击样本并纳入模型训练,将安全防御从发布前人工测试推进到训练阶段的持续对抗。

读原文 ↗导出 Markdown