跳到正文
AI HOT 精选

OpenAI 首席科学家发长文:模型思维链越来越难看懂,对齐比预想更难

OpenAI 长文阐述对齐与监测困境,称 CoT 监控能力正在减弱

OpenAI 首席科学家 Jakub Pachocki 发了一篇长文,核心就一句话:他们监控模型内部推理过程(思维链)的能力正在减弱。他把时间线拉回 2023 年中,当时一个叫 RLSlow 的项目第一次让模型自己形成思维链,团队意识到这辈子会亲眼见到比人聪明的机器。三年过去,推理模型已经能操作电脑、搞科研协作,也带来了新的安全威胁。Pachocki ...

推荐理由:OpenAI 首席科学家 Jakub Pachocki 发了篇个人长文,核心就一个判断:他们监控模型内部推理过程(思维链)的能力正在减弱。他把时间线拉回 2023 年中,一个叫 RLSlow 的项目第一次让模型自己形成思维链,团队当时就意识到这辈子会亲眼见到比人聪明的机器。三年过去,推理模型已经能操作电脑、搞科研协作,也带来了新的安全威胁。这篇文章不是技术报告,更像内部视角的坦诚交底,标题《一个外星心智》本身就说明他们对模型内部运作的理解在变模糊。我会先打个折:正文没给出具体的监控失效数据或替代方案,更多是定性的担忧。但作为头部实验室的公开信号,对...

读原文 ↗导出 Markdown