跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 281–300 条 · 共 453 条

5月15日星期五

The Verge · AI

AI 写的论文越来越像真的,同行评审快扛不住了

The Verge 报道了一个具体案例:研究员 Peter Degen 发现一篇 2017 年的论文引用量突然暴增,从过去几年总共几十次,变成每隔几天就被引用一次。他怀疑这些引用来自 AI 生成的论文,因为 AI 写手会从训练数据里随机抓取看起来相关的文献塞进参考文献列表。文章指出,这种“看起来挺像回事”的 AI 论文正在大量涌入学术期刊的审稿流程,审...

推荐理由:这篇 The Verge 的报道抓到了一个很具体的信号——Peter Degen 发现一篇老论文的引用曲线突然反常飙升,但正文没披露他到底查了多少样本,所以这个异常有多普遍还不好说。我会先打个折,把它放在 featured 里偏低的位置,而不是必读。它好就好在用一个可查证的引用异常,把“AI 论文变好看了反而让审稿更难”这个矛盾讲清楚了,对做研究和搞评审的人都挺有触动。

r/LocalLLaMA

网友用百万级 token 实测 Qwen 3.6 35B MTP 版,速度比之前快了约一半

一位 Reddit 用户分三次跑了超过一百万 token 来测 Qwen3.6-35B-A3B 的多 token 预测(MTP)版本,上下文拉到 300k,量化用 KV Q8_0。他给出的结论是生成速度大概比之前测过的版本快了 1.5 倍。不过帖子正文被 Reddit 的安全策略挡了,看不到具体测试环境、硬件配置和任务类型,所以这个提速是在什么条件下跑...

推荐理由:一个 Reddit 用户拿 Qwen3.6-35B-A3B MTP 版跑了三轮百万 token 的测试,在 300k 上下文、KV Q8_0 量化下,速度大概是旧测试的 1.5 倍。这个多 token 预测版(一次预测多个 token)确实在本地跑出了可感知的加速,但正文没披露功耗、显存占用和不同量化级别的对比,所以这个 1.5 倍先别太激动,得看自己硬件上复现怎么样。帖子本身有细节、有实测,对想省钱跑长上下文的开发者有参考价值,但毕竟只是单篇个人测试,重要性我给 74。

Latent Space

AI 原生医疗:1 亿次问诊、每周省 10–20 小时、几分钟搞定预授权

Abridge 这家公司 2018 年就起步了,比 ChatGPT 火起来早了四年多。他们一开始做的事很实在:把医生和病人的对话录下来,自动生成病历草稿,帮医生省掉下班后补病历的“睡衣时间”,每周能省出 10 到 20 小时。现在他们铺得更开了,今年预计要覆盖超过 8000 万次医患对话,进了 250 家美国大型医疗系统,支持 28 种以上语言和 50...

推荐理由:Abridge 的 CEO 和 CTO 出来聊了聊,说今年要支持超过 8000 万次医患对话,覆盖 250 个美国大型医疗系统,医生每周能省下 10 到 20 小时的文书时间,预授权从几天缩到几分钟。这些数字是公司自己报的,不是第三方审计或独立基准测试,所以我会先打个折来看。但 1 亿次就诊这个量级确实少见,说明医疗 AI 不再只是试点项目,已经在规模化跑流程了。文章没披露准确率、漏诊率或患者满意度数据,也没说省钱具体怎么算的,这点先别太激动。整体看,它更像一次公司访谈放出的运营数据更新,不是重大产品发布或独立验证,所以放在低 featured 档。

AI HOT 精选

IBM 开源多语言嵌入模型 R2:不到 1 亿参数,32K 上下文,检索跑分在同级里最高

IBM 在 Hugging Face 上发了两个新的多语言嵌入模型,都走 Apache 2.0 协议。小号 9700 万参数,在 MTEB 多语言检索上拿了 60.3 分,正文说这是目前所有开源同尺寸模型里最高的。大号 3.11 亿参数,得分 65.2,在 5 亿参数以下的开放模型里排第二。两个模型都基于 ModernBERT,支持 200 多种语言(...

推荐理由:HKR 三项都过:一个不到 1 亿参数、支持 32K 上下文的多语言嵌入模型,给 RAG 开发者提供了一个轻量开源选项。影响面不如前沿模型发布那么大,放在 featured 档刚好。

5月14日星期四

AI HOT 精选

小米 MiMo V2.5 Pro 在 DesignArena 设计竞技场拿到第三,前端编码追平 Claude Sonnet 4.6

MiMo V2.5 Pro 的 Thinking 版本在 DesignArena 总榜上比上一代 MiMo-V2.5 爬了 8 个名次,直接冲到第三。前端编码任务的表现已经和 Claude Sonnet 4.6 打平。正文没披露具体评分和测试样本量,所以这个“追平”是在什么条件下达成的还不清楚,先别太激动。

推荐理由:H、K、R 三条都踩中了,但信息全来自官方一条推文,没公开测试方法、没开放试用、也没提价格,所以先别太激动。这更像一次产品更新和榜单占位,不是那种当天必须追的硬核发布。

新智元 · 公众号

OpenAI 企业市场王座被 Anthropic 踹了,三年头一回

根据 Ramp 从 5 万多家公司的信用卡和发票支出里拉出来的数据,Anthropic 的企业市场份额冲到了 34.4%,OpenAI 掉到 32.3%,这是 OpenAI 三年来第一次在这个指标上被反超。不过正文因为微信环境验证挂了,看不到具体细节,比如统计口径是只算 API 调用还是也包了 ChatGPT 企业版订阅、数据覆盖了多长时间,这些都没法...

推荐理由:我会先打个折:Ramp 的数据只反映它自家客户里的支出份额,不是全行业市占率,所以别直接当成“Anthropic 全面反超”。但 5 万多家企业的实际付款数据比调研问卷硬得多,34.4% 对 32.3% 这个交叉点确实说明 Anthropic 在付费企业里势头很猛。正文没披露统计周期和是否含 API 之外的订阅收入,这点信息有缺口。整体上,这是一条有事实、有数字、有竞争张力的消息,值得从业者看一眼。

机器之心 · 公众号

阿里达摩院用信息瓶颈做自奖励,让模型做数学题时多试几条不同的路

阿里达摩院发了篇 ACL 2026 论文,提出 I²B-LPO,解决强化学习微调时模型解题思路越来越像的问题。做法是在模型生成答案时,碰到它犹豫不决的节点就分叉出多条路径,再用一个基于信息瓶颈的自奖励机制筛掉重复的、留下真正不一样的解法。论文在 Qwen2.5-7B 和 Qwen3-14B 上跑数学题,准确率最多提了 5.3%,答案的语义多样性提了 7...

推荐理由:我会先打个折:这还是一篇训练方法论文,不是新模型或产品发布,所以重要性给 78 合理。亮点在于它把 RLVR 的探索问题讲得很具体——不是泛泛说“多样性不足”,而是用高熵节点定位、分支采样、自奖励这套组合拳给出可操作的解法。数字也实在,准确率和多样性双涨,没有只挑好看的说。正文没披露训练成本和延迟数据,这点先别太激动。整体适合推荐给做推理微调的人看,不是那种看完就忘的刷榜文章。

AI HOT 精选

企业付款数据首次显示 Anthropic 的 B2B 客户占比超过 OpenAI

企业支付平台 Ramp 的 AI 指数显示,2026 年 4 月 Anthropic 在美国企业客户中的付费采用率达到 34.4%,首次超过 OpenAI 的 32.3%。Anthropic 的覆盖率一年翻了四倍,而 OpenAI 几乎没动,只涨了 0.3 个百分点。这个数据来自通过 Ramp 走信用卡或账单付款的公司,主要反映美国市场,不直接代表全球...

推荐理由:这是一份来自企业支出平台 Ramp 的账单数据,不是模型发布或产品更新,所以先打个折。但 Anthropic 在美国企业采用率上首次压过 OpenAI,34.4% 对 32.3%,差距不大但信号明确。一年内业务覆盖涨了四倍,说明 Claude 在企业端确实在抢份额。正文没披露样本量和统计口径,所以不能直接当市场全貌看,但作为花钱投票的结果,比单纯比跑分更有参考价值。

5月13日星期三

TechCrunch · AI

Ramp 的企业支出数据里,付费用 Anthropic 的公司比例首次超过了 OpenAI

金融科技公司 Ramp 扒了自家客户的企业支出账单,发现 34.4% 的公司在给 Anthropic 花钱,OpenAI 这个比例是 32.3%,Anthropic 小胜一局。不过正文没披露到底统计了多少家公司、这些公司是初创还是大企业、以及每家每月花多少钱。光看这个比例,只能说在 Ramp 的客户池子里,Anthropic 的付费渗透率暂时领先,但差...

推荐理由:Ramp 是一家企业支出管理平台,它统计的是自己客户里的付费情况,不是全市场收入份额。34.4% 对 32.3%,差距不大,样本也局限在 Ramp 的客群,所以别直接当成“Anthropic 全面反超”。但至少说明在 Ramp 覆盖的那批公司里,Claude 的付费渗透已经压过 OpenAI 一头。正文没披露样本总量和客户行业分布,这点先打个折。

AI HOT 精选

阶跃星辰发了 Step Image Edit 2,35 亿参数在指令修图榜 KRIS-Bench 上拿了综合、事实、概念三项第一

这个 35 亿参数的图像模型在 KRIS-Bench 指令修图评测里,综合、事实和概念三个类别都排第一,跑赢了参数大它五六倍的模型。能干的事包括文生图、按指令改图、中英文文字渲染,以及保持主体一致的风格迁移。官方说生成快、单次编辑成本低,但没给出具体延迟和价格数字。模型已经上线阶跃开放平台,可以直接用。

推荐理由:我会先打个折:目前只有厂商自报成绩,没有第三方复现或定价信息,所以别急着全信。但35亿参数能在KRIS-Bench三个子项都排第一,说明小模型做图像编辑这条路走得通,对在意推理成本的人是个好消息。正文没披露训练数据规模和具体推理延迟,这两点会直接影响实际能用在哪。

5月12日星期二

r/LocalLLaMA

Reddit 网友实测 288 次模型调用,把本地模型输出 JSON 时的各种翻车方式全整理了一遍,还写了个修复库

Reddit 用户 kexxty 用 OpenRouter 跑了 288 次结构化输出测试,覆盖 Llama 3、Mistral、Command R、DeepSeek、Qwen 等模型,发现本地模型和纯 API 模型在 JSON 上出的错其实差不多。他把这些失败归类后,写了一个叫 outputguard 的 Python 修复库,用 MIT 协议开源。...

推荐理由:HKR 三项都成立:288 次调用不是随便跑跑,outputguard 库和 15 步修复链给了可复用的实操细节。信息源是单篇 Reddit 帖子,没有第三方验证或论文背书,所以放在 72-77 的 featured 档位,不往上走。

5月11日星期一

AI HOT 精选

菲尔兹奖得主实测 ChatGPT 5.5 Pro:17 分钟独立解决数学难题,成果够写博士论文

剑桥数学家、菲尔兹奖得主 Timothy Gowers 用 ChatGPT 5.5 Pro 做了个实验,只给简单提示,没做任何数学指导。AI 在 17 分钟内独立解决了一个加法数论公开问题,给出的构造在理论上是最优的。Gowers 判断这个成果完全够格写进博士论文。随后 AI 又在一个更难的 k 重求和集问题上,把已知上界从指数级改进到亚指数级,审阅者...

推荐理由:H、K、R 三项全中:有实名数学家、有 17 分钟出成果的具体说法、有对博士培养的警告。但正文没披露具体题目、提示词和验证路径,所以先别太激动,分数打 84 是合理的。

AI HOT 精选

OpenRouter 用真实市场需求给模型排座次,DeepSeek V4 Pro 排第一

OpenRouter 搞了个叫 Pareto Code 的排名方法,不看跑分,直接看用户在实际调用中怎么选模型,找出性价比最优的那条线。目前排第一的是 DeepSeek V4 Pro,后面跟着 GPT 5.4 Mini 和 Gemini 3.1 Pro。不过正文没披露具体怎么算分、样本量多大,所以这个排名到底多稳,我会先打个折。

推荐理由:我会先打个折:OpenRouter 只发了一篇帖子,没公布样本量、统计时间窗口和具体定价依据,所以这个排名不能当严谨评测用。但它的价值在于思路——用市场实际调用数据来反映模型性价比,比跑分更贴近真实使用场景。DeepSeek V4 Pro 排第一这点先别太激动,得看后续有没有更透明的数据支撑。整体上,这条信息对正在选模型的开发者有参考意义,但信息缺口明显,够 featured 但上不了更高分。

新智元 · 公众号

Agent 评测的下半场:为什么需要一个「活的」Benchmark?

这篇文章的正文被微信环境验证挡住了,实际内容没拿到。从标题和现有英文摘要看,它讨论的是 Claw-Eval-Live 这个基准测试,用 105 个任务测了 13 个前沿模型,表现最好的模型通过率也没超过 70%,HR 类任务平均通过率只有 6.8%。核心观点是静态评测不够用了,需要能动态更新的“活”基准来测 AI 智能体。但具体怎么个“活”法、任务怎么...

推荐理由:HKR 三项都成立:活的 benchmark 这个切入点具体,不是又一篇刷榜通稿;数据量够,105 道任务和 13 个模型的覆盖面说得过去,HR 任务 6.8% 的通过率尤其扎眼;它踩中了 Agent 从 demo 到落地之间那个“到底能不能用”的信任问题。Claw-Eval-Live 本身还没经过大规模实战检验,所以放在 featured 偏低的位置比较合适。

新智元 · 公众号

Claude Mythos 在 METR 长任务评测里拿到 50% 成功率,对应人类 16 小时的工作量

METR 的 Time Horizons 测试里,Claude Mythos 预览版在人类需要 16 小时才能完成的任务上,成功率达到了 50%。不过整个测试集一共 228 个任务,只有 5 个任务的时间跨度超过 16 小时,所以这个成绩能说明它在长任务上有进步,但样本太少,还测不出它在更长时间尺度上的真实水平。

推荐理由:我会先打个折:50% 成功率听起来很猛,但只测了 5 个超过 16 小时的任务,样本太少,不能当定论。正文自己也说更长区间样本不足。所以 2027 奇点加速这种说法先别太激动。不过这个结果确实把 AI 评测的天花板往上顶了一截,从跑分转向了按人类耗时衡量的任务,对做智能体和安全的团队有直接参考价值。整体给 82 分,因为数据有料但外推太远,不算当天必读的头条。

量子位 · 公众号

菲尔兹奖得主实测 ChatGPT 5.5 Pro,17 分钟跑出论文级数学结果

陶哲轩的同事、菲尔兹奖得主 Timothy Gowers 拿 ChatGPT 5.5 Pro 试了一道加法数论里的难题,模型在 17 分 05 秒内给出了一个最优的二次上界构造,相当于直接产出了一篇小论文的核心证明。之后他又让模型把整个过程写成 LaTeX 预印本,总共花了 47 分钟。Gowers 把结果发在了自己博客上,因为 arXiv 目前拒收 ...

推荐理由:三条都过:Gowers 的第一人称实测、17 分 5 秒和 47 分钟预印本都是可讨论的硬信息。不是模型发布,但有名有姓的实验和数学推理冲击让它必须写。

AI HOT 精选

本地 35B 模型扛下作者一半日常工作,响应速度是云端 Claude Opus 4.5 的两倍

作者用五周时间测了约 1400 个日常工作请求,发现本地跑的 Qwen 3.6 35B 这类模型能搞定其中一半,平均响应 2.8 秒,比云端 Claude Opus 4.5 的 5.8 秒快了 2.1 倍。像邮件草拟、日程安排、摘要和行政杂活这些任务,本地模型完全够用;市场调研和工程类任务则是对半开,简单查数据、修脚本可以本地跑,复杂的多源分析和架构决...

推荐理由:Tom Tunguz 拿本地35B模型做了五周实验,跑了约1400项日常工作任务,成功处理约一半,平均响应2.8秒,比Claude Opus 4.5快2.1倍。这个结果对从业者来说很实在:不是模型发布,也不是平台级更新,但给出了本地模型在延迟和成本上替代云端模型的一个具体参照点。我会先打个折——正文没披露任务类型分布和失败案例的具体原因,所以50%成功率不能直接当通用结论用。但速度对比和实验规模足够让关注推理成本和隐私的人认真看一眼。

r/LocalLLaMA

MTP 实测:写代码能加速 71%,写小说反而变慢 9%,任务类型决定投机推理是帮忙还是帮倒忙

一位 Reddit 用户用 Qwen 3.6 27B 的 MTP 量化模型跑了 300 多次测试,发现投机推理(让模型先猜后验证)的效果完全看任务类型。写代码时草稿被采纳的比例高达 79% 到 89%,用 F16 精度跑代码生成速度提升了 171%;但换成创意写作,Q4_K_M 量化下推理速度反而慢了 9%。结论很直接:别只看模型和量化,先看你要让模型...

推荐理由:我会先打个折:这只是 Reddit 上一个用户的单次实验,不是官方基准,但 300 多次测试把投机推理的任务依赖性讲得很清楚。编码任务接受率高、加速明显,创意写作接受率低、反而变慢,这个结论对本地跑模型的开发者有直接参考价值。正文没披露测试硬件和具体 prompt,但数据量够大,可以先信一半。

AI HOT 精选

《科学》研究:OpenAI 一年前的 o1 模型急诊诊断正确率 67%,超过医生的 50-55%

我会先打个折:这项研究用的是 OpenAI 一年前发布的 o1 模型,按现在标准已经算旧版了。测试数据来自真实急诊室,信息混乱、不完整,模型给出的正确或接近正确的诊断率达到 67%,而参与对比的医生是 50-55%。差距在早期分诊阶段最明显,那时能拿到的信息最少。研究还提到 o1 在处理结构化病例时临床推理几乎不出错。不过正文没披露样本量有多大、医生是...

推荐理由:我会先打个折:这只是一项诊断研究,没覆盖住院数据和影像诊断,别急着说 AI 能独立看急诊。但《科学》背书加上 o1 在真实急诊病例上比医生高出十几个百分点,确实值得从业者看一眼。它说明在特定文本诊断任务上,旧模型已经能摸到甚至超过人类平均水平,后续怎么落地、怎么担责才是真难题。

5月10日星期日

新智元 · 公众号

大模型预测太短视?Next-ToBE 让模型多看几步,ICLR 2026 新方法在 36 项测试里赢了 35 次

华东师大和复旦的研究者发现,现在大模型训练时只盯着“下一个词”来猜,容易让模型变得自信但目光短浅。他们提出 Next-ToBE,训练时给模型一个“软目标”,让它同时参考未来几个词的信息,但推理时不用改,还是正常的逐词生成。在 Qwen2.5-Math-1.5B、Qwen2.5-Math-7B 和 Llama3.1-8B-Instruct 上跑了 36 ...

推荐理由:这篇论文的卖点很清晰:不碰模型结构,只把训练时“猜下一个词”的目标换成“看未来一小段窗口的软目标”,就在36组实验里赢了35组。我会先打个折——正文没披露用了多大的模型、什么规模的数据,也没给复现细节或生产环境的验证,所以目前只能当学术信号看。如果是真的,这种改目标不改架构的思路确实省钱,但别急着把它当成下一个训练范式。