跳到正文
TechCrunch · AI

OpenAI 新推理手法让安全专家坐不住了

OpenAI’s new reasoning technique alarms AI safety experts

OpenAI 的 Astra 模型用了一种叫“循环深度”的技术,让模型不再按顺序一步步想,而是可以跳回去反复琢磨。这直接导致它的思考过程更难被人类看懂和监控。Redwood 的 CEO Buck Shlegeris 直接说,如果 OpenAI 继续在这条路上加码,对思考链的监控能力可能会被“彻底摧毁”。安全倡导者 Zvi Mowshowitz 甚至觉得...

推荐理由:OpenAI 的 Astra 模型用了一种叫“循环深度”的推理方式,让模型能跳回之前的步骤反复琢磨,而不是一条直线想下去。这带来的问题是,它的思考链变得更绕、更难被人类看懂和监控。Redwood 的 CEO Buck Shlegeris 直接说,如果 OpenAI 继续在这条路上加码,对思考链的监控能力可能会被“彻底摧毁”。安全倡导者 Zvi Mowshowitz 也表达了类似的担忧。我会先打个折——正文没披露具体测试数据和监控失效的量化证据,但技术方向本身确实在挑战现有安全监控的假设,值得从业者留意。

读原文 ↗导出 Markdown