跳到正文

#评测/基准

今日 2 条

2024年8月13日星期二

OpenAI News

OpenAI 发布 SWE-bench Verified:人工复核过的代码能力测试集

OpenAI 和 SWE-bench 原作者一起搞了个“验过货”的子集,叫 SWE-bench Verified。他们发现原版测试有坑:单元测试太死板、问题描述含糊、环境搭不起来,导致明明对的代码被判错,会系统性地低估模型写代码的真实水平。截至 2024 年 8 月 5 日,头部智能体在原版 SWE-bench 上得分约 20%,在 SWE-bench...

推荐理由:这不是一次常规发布。OpenAI 拉着原作者把 SWE-bench 翻了一遍,点出三类硬伤,还给出了新的分数天花板。我会先打个折:正文没披露修正后的完整新榜单,但现有数据已经足够让人重新审视那些代码智能体的评测成绩。

2024年7月17日星期三

OpenAI News

OpenAI 用“证明者-验证者博弈”让大模型写的东西更好懂,人类评估错误率降了一半

OpenAI 让 GPT-4 家族里的大模型和小模型玩一个博弈游戏:大模型当“证明者”负责解题,小模型当“验证者”负责判对错。大模型如果只追求答案正确,写出来的解题步骤会越来越难读——人类评估员在限时条件下,错误率几乎翻倍。换成这种博弈训练后,大模型必须写出连小模型都能看懂的推理过程,结果人类评估的准确率也上来了。文章说大小模型之间的预训练算力差了大约...

推荐理由:OpenAI 这篇研究把可读性做成训练信号,强模型要写出弱模型能核验的答案,人类评审也证实有效果。我会先打个折:正文只给了部分数字,完整实验表没披露,所以不能把效果说死。但思路本身戳中了可扩展监督的痛点,加上 hook 清晰、机制新,放在 featured 没问题。