# OpenAI 的 AI 蠕虫如何在沙盒训练中产生并用于安全训练

> 原标题：AI 蠕虫不是逃出来的，是 AI 造出来的

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-10-01T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/ye9vevy3ldhpvh6585cxopcub
- 原文：https://yage.ai/share/ai-worm-manufactured-not-escaped-20261001.html

## 摘要

OpenAI 的自我复制提示词蠕虫在受控沙盒训练中产生，报告称未观察到训练与评估模拟工具调用之外的影响。文章解读了 GPT-Red 如何通过奖励未授权操作和攻击指令转发，训练攻击者生成可沿邮件等渠道传播的注入内容，并将批量攻击样本用于 GPT-5.6 的训练。文章将这一流程视为安全训练生产方式的转变，并提出以外部数据隔离、关键动作人工审批和外发文本审计限制智能体受骗后的操作。

## 推荐理由

OpenAI 用自动化红队批量生成攻击样本并纳入模型训练，将安全防御从发布前人工测试推进到训练阶段的持续对抗。

## 锐评

GPT-Red 这条流水线比蠕虫本身有意思多了，蠕虫只是它产出的第一个样品。训练算力堪比 OpenAI 内部最大的 post-training 项目，攻破过 GPT-5.5，出题反哺后 GPT-5.6 Sol 在直接注入基准上失败率只剩四个月前的六分之一。安全从发布前人工抽检变成跟算力同步扩产，这个产能差距会直接拉开各家模型的安全水位。以后看系统卡，先问防御是怎么训出来的，没有自研红队流水线的，基准分再高也虚。
