跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 581–582 条 · 共 582 条

2024年7月17日星期三

OpenAI News

OpenAI 用“证明者-验证者博弈”让大模型写的东西更好懂,人类评估错误率降了一半

OpenAI 让 GPT-4 家族里的大模型和小模型玩一个博弈游戏:大模型当“证明者”负责解题,小模型当“验证者”负责判对错。大模型如果只追求答案正确,写出来的解题步骤会越来越难读——人类评估员在限时条件下,错误率几乎翻倍。换成这种博弈训练后,大模型必须写出连小模型都能看懂的推理过程,结果人类评估的准确率也上来了。文章说大小模型之间的预训练算力差了大约...

推荐理由:OpenAI 这篇研究把可读性做成训练信号,强模型要写出弱模型能核验的答案,人类评审也证实有效果。我会先打个折:正文只给了部分数字,完整实验表没披露,所以不能把效果说死。但思路本身戳中了可扩展监督的痛点,加上 hook 清晰、机制新,放在 featured 没问题。

2024年5月28日星期二

OpenAI News

OpenAI 董事会成立安全委员会,90 天内要给所有项目定安全规矩

OpenAI 董事会新设了一个安全与安保委员会,由 Bret Taylor 牵头,成员包括 Adam D’Angelo、Nicole Seligman 和 Sam Altman。这个委员会的任务是对公司所有项目的关键安全和安保决策提出建议,第一件事就是在 90 天内重新评估并完善现有的安全流程和防护措施,之后向全体董事会交方案,OpenAI 承诺会公开...

推荐理由:OpenAI 董事会官宣成立安全与安保委员会,动作本身值得关注,因为董事会级的委员会有实权。但正文是空的,没给任何具体信息:谁进委员会、管多宽、向谁汇报、什么时候生效,全不知道。我会先打个折,因为光有个名字说明不了是真治理还是公关动作。安全从业者真正该盯的是这个委员会能不能独立叫停训练或部署,而不是它叫什么。