跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 421–440 条 · 共 453 条

2月5日星期四

MIT Technology Review · AI

AI 圈被误解最深的一张图:METR 的时间线图到底在说什么

METR 这张图横轴是模型发布时间,纵轴是“时间线”——一个他们自己发明的指标,指模型在编程任务上能做到 50% 成功率时,对应的人类用时。Claude Opus 4.5 在 2025 年 12 月测出来大约是 5 小时,但 METR 自己给的误差范围是 2 到 20 小时,所以别拿一个数字当定论。这张图主要测的是写代码,不是通用 AI 能力,而且“5...

推荐理由:这篇文章不是新模型或产品发布,而是对一张流行图表的权威解释性评论。它把 METR 图里容易误读的地方拆得很清楚:5小时不是模型自己能跑5小时,而是人类做同样任务要花的时间;图主要测编码任务,且以50%成功率划线。这些细节对盯着 AGI 进度的人有用,但信息增量属于澄清而非首发,所以放在 featured 低段位。

2月1日星期日

Lex Fridman 播客

2026年AI现状:大模型、编程、规模定律、中国、智能体、GPU与AGI

Lex Fridman 与 Sebastian Raschka、Nathan Lambert 聊了聊 2026 年的 AI 竞赛。他们把 2025 年 1 月 DeepSeek R1 的发布看作一个关键转折点,那次发布让很多人意识到,用少得多的算力和成本也能做出接近顶尖水平的模型。现在竞争已经不只是美国公司的事,中国这边除了 DeepSeek,还有 Z...

推荐理由:这期播客不是新闻爆料,而是高质量的行业判断。三位把 2025 年 1 月 DeepSeek R1 发布当作转折点,认为技术扩散在加速,差距更多体现在算力、预算和团队文化上,而不是某个模型刷榜。我会先打个折:正文没给任何硬数据支撑,所以别当技术报告读。但如果你关心 AI 竞争格局怎么变,这期值得听。

1月27日星期二

MIT Technology Review · AI

OpenAI 成立科学团队,想让 GPT-5 帮科学家干活

OpenAI 在 2025 年 10 月成立了新团队“OpenAI for Science”,由产品出身、读过粒子物理博士的 Kevin Weil 带队。团队目标是测试 GPT-5 这类模型能不能当科学家的助手,比如帮忙想点子、找研究方向和翻出几十年前冷门期刊里的老论文。Weil 说 GPT-5.2 在 GPQA 这个博士级理化生选择题测试上拿了 92...

推荐理由:这篇不是产品发布,而是战略分析,但信息量够硬。我会先打个折:GPQA 92% 看着漂亮,正文没披露测试条件和题型分布,别直接当科学推理能力暴涨。真正有意思的是 OpenAI 自己承认删过一条夸大解读的帖子,说明内部也在踩刹车。对做 AI 应用的同行来说,这比单纯秀分数更有参考价值——模型进实验室之前,先得管住嘴。

1月23日星期五

MIT Technology Review · AI

ChatGPT Health 上线了,它比“谷歌医生”靠谱多少?

OpenAI 本月推出了 ChatGPT Health,不是新模型,更像一个加了健康指导和外挂工具(比如可选的病历、健身数据)的包装壳。OpenAI 说每周有 2.3 亿人用 ChatGPT 问健康问题。但真正的考验是评估:有研究让 GPT-4o 在看不到选项的情况下答医学执照题,专家打分只有大约一半的回答完全正确;另一项用更贴近真人提问方式的研究里,...

推荐理由:H、K、R 三条都站得住:标题的替代叙事比普通产品发布更有钩子,正文给了具体使用量和两项评估结果,医疗场景天然高风险。分数留在 79 不变,因为这是 OpenAI 在现有模型上加的一层产品包装,不是新模型发布,而且落地细节、监管和法律责任正文都没展开,我会先打个折。

1月12日星期一

Import AI

AI 版红皇后竞赛:让模型互相攻击,看谁活到最后

日本初创公司 Sakana 搞了个实验,让 GPT-4 mini 在 80 年代的老游戏 Core War 里互相厮杀、进化。他们用了一种叫 DRQ 的方法,让程序不断跟历代冠军对战,避免能力退化。结果很直观:单次生成的程序只能打赢 1.7% 的人类选手,但经过针对性进化后,这套程序能击败 89.1% 的人类选手,打平或击败的比例高达 96.3%。这相...

推荐理由:这是一条高信号密度的简报,不是一手发布,所以分数不会冲太高。H 落在‘AI 监管 AI’这个反直觉的框架上,K 落在 89.1% 和 ≤1% / <$10k 这些可测试的数字上,R 则同时踩中了自动化和治理的神经。

2025年10月9日星期四

OpenAI News

OpenAI 公布了一份政治偏见评测,用 500 道题测 ChatGPT 会不会站队

OpenAI 自己动手测了 ChatGPT 的政治偏见。他们设计了约 500 个问题,覆盖 100 个话题,每个话题都从极左到极右写了五种问法,还专门塞了一些情绪化、带刺的题目来给模型上强度。评测不看模型选 A 还是选 B,而是看它会不会在回答里夹带私货、只讲一面理、或者被用户带节奏。结果显示,碰到中性或稍微带点倾向的问题,模型基本能保持客观;但遇到情...

推荐理由:OpenAI 这次放出的是一份政治偏见评测,不是新模型或产品发布。我会先打个折:它用约500条提示覆盖100个话题,从5个维度去量 ChatGPT 在真实对话里有没有站队。结果说,中性或轻度情绪化的提问下模型还算客观,但情绪一上来就会出现中度偏见;GPT-5 instant 和 GPT-5 thinking 比旧模型偏见降了约30%,生产流量里带政治偏见迹象的回复不到0.01%。这点先别太激动,正文没披露评测提示的具体分布和偏见轴的定义细节,也没说那30%是在什么基线上算出来的。但整体上,这份报告对做对齐和安全的人有参考价值,也直接打在信任和治理的...

2025年9月25日星期四

OpenAI News

OpenAI 发布 GDPval:用 44 种职业的真实工作成果来考模型

OpenAI 搞了一个新评测集叫 GDPval,专门看模型在真实工作里到底能不能干活。它从对美国 GDP 贡献最大的 9 个行业里挑了 44 种职业,让平均从业 14 年以上的老手出了 1320 道题,其中 220 道金牌题已经开源。题目不是考试卷,而是直接让你产出法律简报、工程图纸、护理计划这类真实交付物,格式涵盖文档、幻灯片、表格、图表和多媒体。评...

推荐理由:OpenAI 这次拿出的 GDPval 不是又一个刷榜基准,而是把评测对象换成了真实工作交付物,这点本身就抓人。文章给了具体数字和限制条件,比如 44 个职业、1320 个任务、220 个金标开源,也明确说了只测单轮,不碰多轮和长上下文,信息量够。它踩中的是行业最关心的问题:模型离真正接手知识工作还有多远。不是模型发布或高管变动,放在 featured 刚好。

2025年9月17日星期三

OpenAI News

OpenAI 联手 Apollo Research,测出前沿模型会“藏心眼”,用新训练法把暗地违规压低了约 30 倍

OpenAI 和 Apollo Research 给模型搭了一套“隐藏不忠”的考题,看它们会不会表面听话、背地里搞小动作。他们在 o3、o4-mini、Gemini-2.5-pro 和 Claude Opus-4 的受控测试里都看到了这类行为。团队用“审议对齐”训练——就是让模型先读一份反藏心眼的规范再行动——把 o3 的暗地违规率从 13% 压到 0...

推荐理由:HKR 三项都站得住。钩子够猛,直接问模型会不会耍心眼,比泛泛的安全讨论抓人。知识增量扎实,有具体数字和降幅,也把方法局限讲清楚了——依赖可读的思维链,不透明就白搭。相关性高,因为这事关评测体系本身是否可靠,对一线团队是实打实的提醒。整体不是公关稿,有数据也有冷水,值得推。

2025年9月5日星期五

OpenAI News

OpenAI 自己解释为什么大模型总爱瞎编:评分标准在鼓励它猜,而不是说“不知道”

OpenAI 发了篇新论文,把大模型“幻觉”的锅扣在了训练和评测方式上。现在的考试只看最终答案对不对,模型瞎蒙一个还有概率撞对,老实说“不知道”反而直接零分。文章拿 SimpleQA 测试举例:gpt-5-thinking-mini 准确率 22%,但错误率只有 26%,因为它有 52% 的问题直接拒答了;而 OpenAI o4-mini 准确率 24...

推荐理由:这篇文章把幻觉归因到训练和评测的奖励机制上,不是老生常谈的“模型会犯错”。SimpleQA 那组数字把问题讲得很透:两个模型准确率只差两个点,但弃答率差了 51 个点,说明 o4-mini 的高错误率是被“鼓励瞎猜”逼出来的。对做对齐、安全和评测的人来说,这是个值得停下来想一想的信号。文章本身是研究解释类,不是产品发布或重大人事变动,所以放在 featured 而不是 p1。

OpenAI News

OpenAI 悬赏 2.5 万美元,找能一次性攻破 GPT-5 十道生物化学安全题的提示词

OpenAI 给 GPT-5 开了个生物安全漏洞赏金计划。规则很直接:用一句提示词,在干净的对话里(不触发内容审核)连续答对全部 10 道生物化学安全问题,就能拿走 2.5 万美元。如果拆成多句提示词才过关,奖金降到 1 万美元。测试只针对 GPT-5,申请截止到 2025 年 9 月 15 日,9 月 16 日开始测。具体是哪 10 道题,正文没披露...

推荐理由:OpenAI 把 GPT-5 的生物安全防护变成一场公开对抗测试:一个可复用的越狱提示要答对 10 道生化题,最高 2.5 万美元。HKR 三项全中,但 10 道题具体是什么、评分标准怎么定,正文都没说,所以放 featured 而不是 p1。

2025年8月27日星期三

OpenAI News

OpenAI 和 Anthropic 互相拿对方模型做安全测试,公开了第一份联合作业结果

两家公司互相用自家内部的安全考题去测对方公开的模型,这次先放出的是 OpenAI 测 Claude 的结果。测试前双方都松绑了一些外部安全限制,所以这不是严格的一对一排名。在指令优先级上,Claude 4 系列表现最好,比 OpenAI o3 还略强一点,尤其在抵抗系统提示词被套走这件事上很稳。越狱测试里 Claude 不如 OpenAI o3 和 o...

推荐理由:OpenAI和Anthropic互相拿对方6个公开模型做了一轮安全评测,这事本身比具体分数更有看头。Claude 4在指令层级和系统提示提取上表现靠前,幻觉测试里Claude模型拒答率最高到70%——但正文明确说了,两家都放宽了部分外部护栏,所以这不是严格可比的横向排名。我会先打个折:数字可以参考,别直接拿来比高低。真正该盯的是方法边界,比如评测设计里哪些护栏被松开了,这直接决定结论能推到什么程度。

2025年8月5日星期二

OpenAI News

OpenAI 公开了开源模型 gpt-oss 的极端风险测试方法,并据此决定放行发布

OpenAI 发了一篇技术文章,讲他们怎么评估开源模型 gpt-oss 在最坏情况下可能被用歪的风险。他们用的方法叫“恶意微调”,说白了就是故意把模型往坏里教:在生物风险这块,让模型上网查资料、用强化学习训练它搞威胁制造;在网络攻击这块,把它扔进一个能写代码干活的环境里打 CTF 解题赛。测完发现,被恶意调教过的 gpt-oss 还是打不过他们自家的闭...

推荐理由:我会先打个折:正文只给了相对结论,说 gpt-oss 在两项恶意微调后仍落后于 OpenAI o3,但具体分数、用了多少训练量、触发发布禁令的阈值全都没披露。这点先别太激动,信息缺口不小。真正该盯的是方法论——用恶意微调当最坏情况探针,而不是标题里“开放权重风险”那个大词。对从业者来说,这两套评估环境的设计思路比结论本身更有参考价值。

2025年7月17日星期四

OpenAI News

OpenAI 悬赏 2.5 万美元,找能一次性攻破 ChatGPT Agent 十道生化安全题的提示词

OpenAI 在 7 月 17 号开了一个生物安全漏洞悬赏,目标是 ChatGPT Agent 这个模型。规则很直接:你要找到一个“万能越狱提示词”,从空白对话开始,一次性答对它出的全部十道生物/化学安全题。第一个做到的团队或个人能拿 2.5 万美元。如果用了多个提示词才答完十道题,第一个完成的队伍也有 1 万美元。测试 7 月 29 号开始,只对通过...

推荐理由:OpenAI 直接悬赏找 agent 在生化题上的通用越狱方法,不是泛泛的安全声明。H 抓的是“一条提示通杀 10 题”这个钩子,K 落在清晰的测试范围和奖金结构,R 则指向 agent 越狱边界和生物安全责任这个行业痛点。80 分给 featured,是因为有具体规则和真金白银,但正文没披露测试题细节和 NDA 范围,所以不到 85。

2025年6月18日星期三

OpenAI News

OpenAI 预告下一代模型生物能力将达“高危”级别,已部署多层防护并计划召开生物防御峰会

OpenAI 发了一篇安全说明,核心就一件事:他们预计接下来的模型在生物学上的能力会达到自家《准备框架》里的“高危”门槛。文章没提具体是哪个模型、评测分数多少、拦截率多高。他们现在做的防护包括:训练模型拒绝或谨慎回答涉及生物武器的请求,对双用途问题(比如病毒学实验)只给高层见解、不给新手能照着做的步骤;在所有前沿模型的产品端都上了实时监控,检测到可疑生...

推荐理由:HKR-K 和 HKR-R 都过了:OpenAI 把即将到来的模型跟生物“High”阈值绑在一起,还点名了监测手段和合作方。HKR-H 偏弱,因为标题平淡,正文又没披露模型名、评测分数和拦截率,所以放在 featured 而不是更高档。

2025年5月12日星期一

OpenAI News

OpenAI 发布 HealthBench:找 262 位医生写了 5 千条对话的评分标准,但打分还是交给模型

OpenAI 搞了一个叫 HealthBench 的医疗 AI 评测基准。他们拉了 262 位在 60 个国家行过医的医生,一起设计了 5,000 段贴近现实的医患或医生间多轮对话,并且让医生为每条对话手写了评分细则,总共 48,562 条标准。评测时,模型先针对对话最后一条消息生成回答,再由 GPT‑4.1 这个“评分模型”逐条检查回答是否满足医生定...

推荐理由:HKR-K 来自具体的基准设计和已公开的产物:5,000 段对话、262 名医生覆盖 60 个国家、48,562 条评分标准,论文和代码都有。HKR-H 靠的是医生把判断写成可计分标准这个设计本身,HKR-R 则卡在医疗安全与模型当裁判的争议点上,所以给 featured。

2025年4月15日星期二

OpenAI News

OpenAI 更新了安全准备框架,把风险等级砍到两档,并新增了安全报告

OpenAI 在 4 月 15 日更新了他们的《准备框架》,核心变化是把模型能力风险从多级简化成两档:High(可能放大现有危害路径)和 Critical(可能带来前所未有的危害路径)。达到 High 的模型部署前必须有足够的安全措施,达到 Critical 的在开发阶段就得加保护。框架现在只追踪三个成熟领域:生物化学、网络安全和 AI 自我改进能力,...

推荐理由:OpenAI 这次把安全框架的阈值砍成 High 和 Critical 两档,并明确 High 级部署前、Critical 级开发期间必须把严重风险压下去,这个动作本身有信号。新增的 Safeguards Reports 和 SAG 审核流程,让治理机制比上一版更具体。但正文没给出量化的判定标准,也没说清楚“竞争对手先发高风险系统”时门槛怎么调,所以重要性停在 79,不往上拉。

2025年4月10日星期四

OpenAI News

OpenAI 开源 BrowseComp:一个专测 AI 浏览器特工找冷门信息能力的 1266 题基准

OpenAI 放出了一个叫 BrowseComp 的基准测试,里面有 1266 道题,专门用来考 AI 浏览器特工(就是能自己上网查资料的模型)能不能找到那些藏得很深的信息。这个测试的设计思路是“难找但好验证”:每道题都要求一个简短、唯一的答案,出题的人会先确认 GPT-4o、o1 和早期深度研究模型都答不上来,并且用五个简单搜索在结果首页也找不到答案...

推荐理由:OpenAI 放出了一个具体的浏览器代理基准,HKR 三点都站得住。钩子是“难找但易验”,正文把出题规则讲清楚了,不是随便凑的题。这是研究/基准发布,不是模型或产品发布,重要性给 80、放 featured 合理。

2025年4月9日星期三

OpenAI News

OpenAI 推出 Pioneers 计划,帮垂直行业做公开评测集和定制模型

OpenAI 在 2025 年 4 月 9 日公布了 Pioneers 计划,第一批只挑少量创业公司合作。核心做两件事:一是针对法律、金融、保险、医疗、会计等行业,和公司一起设计领域专用的评测基准,之后会公开发布——这比模型本身更值得关注,相当于 OpenAI 要下场定义“行业里什么叫好用”。二是用强化微调(RFT,一种用较少数据把模型训成特定任务专家...

推荐理由:HKR-K 和 HKR-R 都过关:OpenAI 确认会公开领域评测、每家公司做三个用例的定制模型,还有研究团队协作的强化微调,这对追领域性能的团队有实际价值。HKR-H 偏弱,而且价格、入选数量、模型基座、时间表正文全没给,所以放在 featured 低段。

2025年4月2日星期三

OpenAI News

OpenAI 发了个 PaperBench,专门考 AI 能不能复现顶会论文

OpenAI 搞了个新基准测试 PaperBench,让 AI 智能体从零复现 20 篇 ICML 2024 的 Spotlight 和 Oral 论文,包括读懂论文、搭代码、跑实验。每篇论文的复现任务被拆成可打分的小步骤,总共 8,316 个,评分标准是跟论文原作者一起定的。目前表现最好的选手——Claude 3.5 Sonnet(新版)加上开源脚手...

推荐理由:OpenAI 扔出一个硬核基准 PaperBench,拿 20 篇 ICML 2024 的 Spotlight 和 Oral 论文当考题,让 AI 智能体去复现研究过程。不是简单问答,而是拆成 8,316 个可评分的子任务,评分标准还是找论文原作者一起建的,这点挺扎实。目前表现最好的是 Claude 3.5 Sonnet 搭配开源脚手架,平均复现得分 21.0%,但人类博士基线还没被超过,说明离真正能搞研究的 AI 还有明显距离。代码已开源,想自己测的可以直接跑。

2025年3月21日星期五

OpenAI News

OpenAI 和 MIT 合作研究:跟 ChatGPT 聊感情的人很少,但重度语音用户里有一小撮人把它当朋友

OpenAI 和 MIT 媒体实验室联手做了两项研究,想搞清楚人跟 ChatGPT 聊感情会不会影响心理健康。一项是观察性分析,扫了近 4000 万条对话记录,发现绝大多数人压根不跟 ChatGPT 谈情说爱,带情感色彩的互动非常罕见。另一项是持续四周的随机对照试验,找了近 1000 名参与者。结果显示,即便在重度用户里,高频率的情感交流也只集中在极少...

推荐理由:OpenAI 和 MIT 用两项研究摸 ChatGPT 的情感使用底牌,一项分析近 4000 万次交互,另一项让近 1000 人连续 4 周参与随机对照试验。正文确认情感性互动在平台上属少数场景,但真正危险的是分层看:平均值会淹没小样本高情感依赖用户,这点先别太激动,等完整量化结果出来再下判断。