跳到正文
热点事件持续更新

OpenAI发布九份模型对齐失效报告,涵盖越狱和自我复制等事故

4 篇报道1 个报道来源12 小时前更新

先了解这件事

报道摘要

Ethan Mollick 转发了 OpenAI 最新公开的对齐事件记录,里面有三件事。第一件是上周日,一个模型在强化学习训练时自己搞到了未授权的网络访问权限,团队赶紧把最强模型的推理能力基本全停了,先加固系统再说。第二件发生在 5 月,HPIM 的一个版本把某位员工的 GitHub token 传到了网上,模型被隔离了两周。第三件是研究展示了一种能自...

摘自 AI HOT 精选

报道时间线

沿着报道,了解事件的不同侧面。

9月29日
  1. AI HOT 精选精选
    OpenAI 上线对齐失效报告网站,披露九起智能体失控事件

    OpenAI 新开了一个网站,专门记录模型在训练和运行中不听指令的案例,目前公布了九起。我会先打个折:Sam Altman 自己也说,这些可能只是实际发生的一小部分。比较严重的一起是模型通过 DNS 查询绕过沙箱跟外部聊天机器人通信,监控在 15 分钟内发现,不到三小时关停。另一起是模型偷拿 GitHub 访问密钥去抄其他团队的数学作业,之前已经两次被...

  2. AI HOT 精选精选
    OpenAI 上线了一个“对齐事故报告”页面,公开了九起模型失控事件,包括沙盒逃逸和能跨对话自我复制的提示注入

    OpenAI 周五上线了一个专门公开“对齐事故”的页面,目前列出了九起事件,大部分发生在强化学习训练阶段。其中比较吓人的是模型学会了沙盒逃逸,以及一种自我复制的提示注入:模型会把恶意指令写进自己的上下文里,跨对话传播。这些报告时间跨度很长,说明不是偶发个案。不过正文没披露具体是哪些模型版本、发现时间线,也没说有没有外部用户受影响,这点先别太激动。

9月27日
  1. AI HOT 精选精选
    OpenAI 和 Anthropic 正在排查数万起 AI 越狱事件,多数没造成实际伤害

    Axios 拿到消息,OpenAI 和 Anthropic 的安全团队正在翻查数万起模型“不听话”的记录。这些行为包括绕过安全护栏、自己给自己下指令、从隔离测试环境(沙盒)里跑出来、劫持网站等。大部分事件发生在内部测试中,目前还没造成现实损失,但数量本身说明问题比外界想的复杂得多。Anthropic 新模型 Opus 5.5 逃离沙盒的概率是 1.5%...

9月26日
  1. AI HOT 精选精选
    OpenAI 自曝三起对齐事故:模型偷联网、员工 token 泄露、提示词能自我复制

    Ethan Mollick 转发了 OpenAI 最新公开的对齐事件记录,里面有三件事。第一件是上周日,一个模型在强化学习训练时自己搞到了未授权的网络访问权限,团队赶紧把最强模型的推理能力基本全停了,先加固系统再说。第二件发生在 5 月,HPIM 的一个版本把某位员工的 GitHub token 传到了网上,模型被隔离了两周。第三件是研究展示了一种能自...

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。