跳到正文

#安全/对齐

今日 9 条

2024年8月13日星期二

OpenAI News

OpenAI 发布 SWE-bench Verified:人工复核过的代码能力测试集

OpenAI 和 SWE-bench 原作者一起搞了个“验过货”的子集,叫 SWE-bench Verified。他们发现原版测试有坑:单元测试太死板、问题描述含糊、环境搭不起来,导致明明对的代码被判错,会系统性地低估模型写代码的真实水平。截至 2024 年 8 月 5 日,头部智能体在原版 SWE-bench 上得分约 20%,在 SWE-bench...

推荐理由:这不是一次常规发布。OpenAI 拉着原作者把 SWE-bench 翻了一遍,点出三类硬伤,还给出了新的分数天花板。我会先打个折:正文没披露修正后的完整新榜单,但现有数据已经足够让人重新审视那些代码智能体的评测成绩。

2024年8月8日星期四

OpenAI News

OpenAI 把卡内基梅隆的机器学习系主任 Zico Kolter 拉进了董事会和安全委员会

OpenAI 在 2024 年 8 月 8 日宣布,卡内基梅隆大学教授 Zico Kolter 加入董事会,同时进入安全与安保委员会。Kolter 的研究方向是 AI 安全、模型对齐,以及让机器学习分类器更稳健——说白了就是研究怎么让模型别轻易被忽悠、别输出危险内容。他之前搞出过给深度学习模型加“硬约束”的方法,2023 年还带队开发了自动评估大模型安...

推荐理由:我会先打个折:这就是个任命通知,别当产品发布看。真正值得盯的是治理层补进了一个有 AI 安全与鲁棒性技术底子的人,而且直接放进安全与安保委员会,以后所有项目的关键安全决策他都有份提建议。正文没披露他具体投票权有多大、委员会多久开一次会,这点先别太激动。

OpenAI News

GPT-4o 系统卡:语音响应快过人类,但声音安全是最大隐患

OpenAI 在 8 月 8 号发了 GPT-4o 的系统卡,把安全底牌摊开来看。这个模型能直接吃文本、音频、图片和视频,输出也一样,最快 232 毫秒就能回话,平均 320 毫秒,跟人聊天反应速度差不多。API 价格比 GPT-4 Turbo 便宜一半。在 OpenAI 自己的安全框架里,网络安全、生物威胁、模型自主性三项风险都是低,说服力这项擦边踩...

推荐理由:这不是一篇例行公事的发布。它把 preparedness 四类风险评级、232 毫秒语音延迟和明确的部署门槛都摆出来了。HKR 三项全中,但本质是安全披露而非新模型或重大产品发布,所以放在 featured 而不是 p1。

2024年7月24日星期三

OpenAI News

OpenAI 用“规则打分”替代部分人工反馈,让模型在安全问题上更听话

OpenAI 在 7 月 24 日公开了他们用在安全对齐上的新方法:Rule-Based Rewards(RBRs),也就是用一套事先写好的规则给模型回复打分,而不是每次都靠人反复标注。这套方法把模型面对敏感请求时的反应分成三类——硬拒绝(简短道歉并明确说不)、软拒绝(带同理心地拒绝)和正常遵从——然后针对每类行为设定具体的评判标准,比如“回复是否在说...

推荐理由:我会先打个折:正文截取部分没给具体效果数字,也没对比基线,所以分数压在 78–84 这个区间。但 OpenAI 把安全规则显式写进奖励模型这件事本身值得关注,因为它解决的是工程上很实际的麻烦——政策一改,不用重新雇人标一堆数据,改规则就行。三种响应模式(硬拒、软拒、合规)让模型拒绝时不会太生硬,这点对产品体验有帮助。不过别太激动,论文没披露误拒率或漏判率,实际线上表现还得看后续有没有更细的评测。

2024年7月18日星期四

OpenAI News

OpenAI 发布 GPT-4o mini,比 GPT-3.5 便宜六成,API 里首次用上指令层级防越狱

OpenAI 在 7 月 18 日推出了 GPT-4o mini,直接替换掉 ChatGPT 里的 GPT-3.5。价格是输入每百万 token 0.15 美元、输出 0.6 美元,比 GPT-3.5 Turbo 便宜了超过 60%。模型跑分还行,MMLU 82 分、HumanEval 87.2 分,都压过 Gemini Flash 和 Claude ...

推荐理由:这不是小修小补,GPT-4o mini 带着新定价、长上下文、明确的基准成绩和一套新的安全机制出来,直接替掉 GPT-3.5,对开发者的钱包和安全方案都有实际影响。HKR 三项全中,放在 P1 没问题。

2024年7月17日星期三

OpenAI News

OpenAI 用“证明者-验证者博弈”让大模型写的东西更好懂,人类评估错误率降了一半

OpenAI 让 GPT-4 家族里的大模型和小模型玩一个博弈游戏:大模型当“证明者”负责解题,小模型当“验证者”负责判对错。大模型如果只追求答案正确,写出来的解题步骤会越来越难读——人类评估员在限时条件下,错误率几乎翻倍。换成这种博弈训练后,大模型必须写出连小模型都能看懂的推理过程,结果人类评估的准确率也上来了。文章说大小模型之间的预训练算力差了大约...

推荐理由:OpenAI 这篇研究把可读性做成训练信号,强模型要写出弱模型能核验的答案,人类评审也证实有效果。我会先打个折:正文只给了部分数字,完整实验表没披露,所以不能把效果说死。但思路本身戳中了可扩展监督的痛点,加上 hook 清晰、机制新,放在 featured 没问题。

2024年5月28日星期二

OpenAI News

OpenAI 董事会成立安全委员会,90 天内要给所有项目定安全规矩

OpenAI 董事会新设了一个安全与安保委员会,由 Bret Taylor 牵头,成员包括 Adam D’Angelo、Nicole Seligman 和 Sam Altman。这个委员会的任务是对公司所有项目的关键安全和安保决策提出建议,第一件事就是在 90 天内重新评估并完善现有的安全流程和防护措施,之后向全体董事会交方案,OpenAI 承诺会公开...

推荐理由:OpenAI 董事会官宣成立安全与安保委员会,动作本身值得关注,因为董事会级的委员会有实权。但正文是空的,没给任何具体信息:谁进委员会、管多宽、向谁汇报、什么时候生效,全不知道。我会先打个折,因为光有个名字说明不了是真治理还是公关动作。安全从业者真正该盯的是这个委员会能不能独立叫停训练或部署,而不是它叫什么。