跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 21–40 条 · 共 453 条

9月23日星期三

AI HOT 精选

Claude Opus 5.5 进了 Arena 的 Agent 擂台,能联网、操作文件、跑终端,排名靠用户投票

Arena 把 Claude Opus 5.5 放上了 Agent Arena,让模型直接干长链条的活——可以自己上网搜资料、读写文件、敲命令行。排行榜不只看输赢,用的是因果追踪,看它比平均水平强多少。正文没具体说 Battle Mode 怎么打,也没给任务例子,所以实际有多能打还得等实测。

推荐理由:Opus 5.5 上 Agent Arena 是本周最值得盯的第三方评测信号。因果追踪的排行榜设计比原始胜率多一层信息,但正文没给具体任务例子,也没说 Battle Mode 规则,实际能打程度还得等社区跑完再看——这点先别太激动。

AI HOT 精选

Claude Opus 5.5 在智能评测中拿了最高分 58,还降了 20% 的价格

Claude Opus 5.5 在 Artificial Analysis 的智能指数上得了 58 分,是目前测过的最高分。它在 10 项评测里 6 项领先,比如在 Humanity's Last Exam 上正确率 61.4%,SciCode 上 66.9%,Terminal-Bench 4.0 上 59.6%,跟 GPT-6 Astra 打平。在模...

推荐理由:Anthropic 的旗舰模型在一个有分量的第三方基准上拿了第一,同时降价 20%,属于当天必写。没给 95 分是因为这毕竟只是基准测试结果,不是模型发布本身,但 6/10 项领先、跟 GPT-6 Astra 打平、价格还降了,放在 featured 档很合适。

9月22日星期二

Hacker News 首页

让 AI 代理反复优化 Rust 代码,直到跑赢顶尖开源库

Max Woolf 用了一年多时间验证一件事:给 AI 代理定一条硬规矩——每次改代码必须至少提速 5%,否则回滚——然后让它自己去迭代优化 Rust。从 Claude Opus 4.5 开始,这套玩法在 UMAP 等算法上拿到了 2 到 20 倍的加速,对比的是已经打磨多年的成熟库,而且全程没碰 unsafe 代码。文章把提示词和基准测试结果都贴出来...

推荐理由:Max Woolf 用一年时间验证了一个具体玩法:给 AI 代理下死命令,每次改 Rust 代码必须提速至少 5%,否则回滚。从 Claude Opus 4.5 开始,这套流程在 UMAP 等算法上跑出了 2 到 20 倍的加速,对比对象是已经打磨多年的成熟库,而且没动 unsafe 代码。文章把提示词和基准测试结果都公开了,属于少见的有数字、能复现的一手实验。我会先打个折——这些加速是在特定算法和场景下拿到的,不一定能泛化到所有 Rust 项目,但方法论本身值得关注。

Computing Life · Share · 鸭哥调研

三条 AI 编程新闻,三个数字的读法

过去几天 AI 编程圈出了三件事。ZCode 被发现在后台把整个项目连同 Git 历史打包加密,排队往云端传,快照里 .git 对象占了 86.6%,但官方说数据会立即销毁,目前没有第三方验证。HarnessTax 的评测把同一个模型 Claude Fable 5 装进不同框架跑题,官方 Claude Code 和极简框架 Pi 成功率几乎一样(97....

推荐理由:三条 AI 编程新闻绑在一起讲,每条都带一个能记住的数字。ZCode 上传 Git 历史是硬安全事件,有 ferstar 的取证报告和社区复现支撑;HarnessTax 评测暴露了框架包装对模型能力的干扰;微软的架构案例给出了一个省钱路线。HKR 全中,安全、知识和共鸣都到位。

AI HOT 精选

小米 MiMo-V2.6-Pro 在 Code Arena WebDev 排到第10名左右,开源模型里排第3

小米发了两个全模态模型 MiMo-V2.6-Pro 和 Flash。Pro 版在 Code Arena 的网页开发榜上拿了 1628 分,比上一代 MiMo-V2.5-Pro 的 1475 分涨了 153 分,整体排第10名上下,在 MIT 许可的开源权重模型里大概排第3。Flash 版的跑分和参数量正文都没提。

推荐理由:小米 MiMo-V2.6-Pro 在 Code Arena WebDev 榜上排第10名上下,开源权重模型里约第3,分数比上代涨了 153 分,有具体数字支撑。Flash 版参数量和跑分正文都没提,信息有缺口,所以重要性给到 78 比较合适,先别往更高拔。

AI HOT 精选

小米 MiMo-V2.6-Pro 在开放权重模型智能指数里排到第一,得分从 26 跳到 46

小米放出了 MiMo-V2.6-Pro,在 Artificial Analysis 的智能指数上拿了 46 分,比上一代 V2.5-Pro 的 26 分涨了不少,现在是开放权重模型里最高的。不过正文没提参数量、具体架构和什么时候能公开用,这些关键信息都还缺着,所以这个分数先别太激动。

推荐理由:小米的 MiMo-V2.6-Pro 在开放权重模型智能指数上登顶,分数从 26 涨到 46,进步明显,属于国产旗舰模型的正面信号。但正文没给参数量、架构和发布时间,关键信息缺着,所以分数先打个折。

AI HOT 精选

小米 MiMo-V2.6-Pro 在开源模型智能指数上拿了第一,但关键信息还没公布

小米发了新模型 MiMo-V2.6-Pro,在 Artificial Analysis 的智能指数上拿了 46 分,是目前开源权重模型里最高的。作为对比,上一代 MiMo-V2.5-Pro 只有 26 分,这次提升幅度不小。不过正文没披露模型大小、训练数据和开源协议,这些都会直接影响实际能用在哪、怎么用,所以分数先看着,等细节出来再判断。

推荐理由:小米这个模型分数翻倍、直接登顶,确实有新闻性。但正文没披露模型大小、训练数据和开源协议,这些直接决定能不能用、怎么用,所以分数先打 78,等细节出来再调整。

9月21日星期一

AI HOT 精选

Fireworks AI 发布 FireRouter:前沿不再是单个模型,而是路由器

Fireworks AI 在 DeepSWE 编程基准上测了 18 个模型,发现按任务挑模型比死用一个强得多。单用最强的 GPT-6 Astra 能解决 74.1% 的任务,每次成本 6.52 美元;但一个“事后诸葛亮”路由器从 18 个模型里给每个任务挑最合适的,解决率能到 97.6%,成本反而降到 1.88 美元。只用开源模型也能到 90.3%,成...

推荐理由:Fireworks 用 18 个模型在 DeepSWE 上跑了一轮,拿到的结论是:按任务挑模型的路由器,在解决率和成本上都把单一最强模型比下去了。97.6% 对 74.1% 的解决率,1.88 美元对 6.52 美元的单次成本,差距很明显。开源模型组合能到 90.3%,也给了一条不绑死闭源模型的路。我会先打个折——这是他们自家发布的路由器,数据肯定挑好看的放,但逻辑本身对做模型调度和成本控制的人有参考价值。

9月20日星期日

Hacker News 首页

提示词没那么重要,不如搭一套评估流水线来管住模型

Dan McKinley 在演讲里说,整天跟大模型来回改提示词是条死胡同。他做面向消费者的 agent 时发现,哪怕用了结构化输出,模型还是会在一小部分请求里发疯,比如把标题字段塞满废话直到爆掉。他试出来的一个离谱解法是把字段名从“title”改成“heading”,暂时管用,但随时可能失效。他的核心观点是,提示词本身靠不住,得靠 pass^k 测试和...

推荐理由:Dan McKinley 拿自己搭消费者 agent 的实战经验说话,案例具体、判断尖锐。但这是个人演讲,不是正式论文,正文也没披露 pass^k 测试的通过率和规模,所以我会先打个折。

9月19日星期六

Hacker News 首页

19 个模型打《星际争霸》,没有一个超过新手水平

Ben Swerdlow 让 19 个模型在《星际争霸:母巢之战》里互相对打,结果没有哪个模型能玩到新手以上的水平。Codex Astra 的 xhigh 版本以 18 胜 0 负排第一,但它靠的不是运营,而是早期派一个探机去骚扰对手工人,对面模型会花几十秒思考怎么处理,直接瘫痪。Grok 4.6 表现最差,xhigh 版本在 43 分钟里只发出了 6...

推荐理由:Ben Swerdlow 搞了个《母巢之战》模型对战测试,19 个模型互打,没一个能赢新手。Codex Astra 的 xhigh 版 18 胜 0 负排第一,但赢法不是靠运营,而是早期派一个探机去骚扰农民,对面模型会花几十秒想对策,直接卡死。Grok 4.6 最拉胯,xhigh 版 43 分钟里只发出 6 个有效动作。这个测试把模型在实时环境里的反应延迟和决策瘫痪暴露得很直观,数据也扎实,胜率、APM、单局成本都有。我会先打个折,因为这只是一个人做的非正式 benchmark,样本量和环境控制有限,但信号很强,值得从业者看一眼。

9月17日星期四

Hacker News 首页

编程助手的“外壳”可能让你多花一倍的钱,准确率却没变

UC Berkeley 和 Arena 的研究人员把 7 个模型装进 3 种不同的编程助手外壳(Claude Code、Codex CLI 和 Pi),在 SWE-bench Lite 和 Terminal-Bench 2.0 上各跑了 30 个任务,每个组合重复 3 次。结果发现,换外壳对任务成功率影响很小(±2–5%),但成本最多能差到 5 倍。比...

推荐理由:UC Berkeley和Arena的人做了件挺实在的事:把7个模型塞进3种不同的编程助手外壳里跑分,结果发现换壳对能不能完成任务影响很小,但花的钱最多能差5倍。这个结论对天天在终端里切工具的开发者来说很实用,而且实验设计干净、数字具体,没有吹牛成分。分数定在78,因为正文摘要没展开讲成本差异具体从哪来、不同外壳的失败模式有什么不同,信息有缺口,先不打更高。

Hacker News 首页

顶尖模型物理其实不差,是考题和评分标准本身出了大问题

耶鲁等机构的研究人员找来物理系教授和博士生,把六个常用物理基准测试的评分重新审了一遍。结果发现,之前被判错的答案,大部分是评分程序出错、参考答案本身是错的,或者题目问得不清不楚。以 GPT-5.6-Sol 为例,在 HLE-Physics 上,修正后的 mean@4 从 47.3% 跳到了 78.7%;在 CMT-Benchmark 上,从 61.0%...

推荐理由:耶鲁等机构的研究人员拉来物理系教授和博士生,把六个常用物理基准测试的评分重新审了一遍。结果发现,之前被判错的答案,大部分是评分程序出错、参考答案本身是错的,或者题目问得不清不楚。以 GPT-5.6-Sol 为例,在 HLE-Physics 上,修正后的 mean@4 从 47.3% 跳到了 78.7%;在 CMT-Benchmark 上,从 61.0% 跳到 89.1%,接近满分。这个涨幅说明,很多“模型物理不行”的判断,其实是基准本身质量不行。我会先打个折:正文没披露重新评分时有没有统一标准、不同评审之间一致性如何,这点先别太激动。但至少提醒我们...

Hacker News 首页

训练一个 4B 模型,让它生成的查询计划比 Postgres 默认的快 81%

Rohan Bansal 拿 Qwen 4B 模型做实验,先让 GPT-6 Astra 当老师,用 500 条示范轨迹做监督微调,再设计了一套强化学习变体,让模型自己生成查询计划、扔到 Postgres 里实测耗时,根据快慢给奖励信号来更新权重。在 113 条多表联查的 SQL 上,最终模型生成的计划比 Postgres 默认计划延迟降低 44.7%,...

推荐理由:一个 4B 小模型,靠强化学习训出来的查询计划比 Postgres 默认计划快 81%,方法本身有实用价值。但测试只跑了 113 条多表联查 SQL,能不能泛化到其他场景还没验证,所以分数卡在 78。

Latent Space

AIUC 拿了 4000 万美元 A 轮,给 AI 代理上保险,出事了你能直接告它

AIUC 刚宣布完成 4000 万美元 A 轮融资,由 Ribbit Capital 和 First Harmonic 领投。CEO Rune Kvist 是 Anthropic 第一个产品岗员工,他认为限制 AI 落地的不是能力,而是信任和出了事谁负责。他们搞了一套叫 AIUC-1 的标准,专门给 AI 代理做压力测试,查越狱、幻觉、数据泄露这些毛病...

推荐理由:AI 代理保险是个新品类,AIUC-1 标准加上 4000 万 A 轮让这事有实感,不是纯 PR。CEO 的 Anthropic 出身和 Ribbit Capital 背书增加了可信度,但产品还在早期——正文没披露实际理赔数据或保费定价,所以我会先打个折,不把它吹成已经跑通的生意。

9月16日星期三

AI HOT 精选

Arena 更新图片转网页排行榜:GPT-6 Astra 1733 分登顶,领先第二名 129 分

Arena 把四个新模型丢进了图片转网页的评测榜单。GPT-6 Astra(Max)拿了 1733 分排第一,比第二名的 GPT-5.6 Sol(xHigh)高出 129 分。Claude Fable 5.1(Max)1710 分排第三,Muse Spark 1.3(Max)1645 分第四,GLM-5.3-Flash 1588 分第十。正文没披露具体...

推荐理由:GPT-6 Astra 首秀就登顶,领先幅度 129 分,这个信号够硬,值得上首页。但正文只给了分数和排名,没展开方法细节或模型差异,读起来像一条快讯。H 和 K 都踩中了,R 缺位,整体重要性我给 72 分,放在 featured 里刚好。

Latent Space

在游戏里学到的技能,能用到真实工作中吗?

Good Start Labs 拿一款 30B 参数的模型在铁路经营游戏《1830》里训练,然后让它去做金融研究任务——查数据库、写 Excel 公式、边推理边算。结果发现,只有做成多轮终端智能体(让模型自己用工具探索环境、实时调整策略)的版本,技能才迁移得过去;单轮问答式的训练就没这个效果。这家公司去年 10 月从 Every 分拆出来,拿了 360...

推荐理由:实验设计有新意,给出了技能迁移的正面证据和一个失败对照组,对 agent 训练研究有参考价值。但公司刚分拆出来,产品路径不明,金融任务上也没给具体数字,所以我会先打个折,重要性给到 72。

Hacker News 首页

RL 训练大模型有个马太效应:难题越练越少,这篇博客提出“永不放弃”来纠正它

Michael Noukhovitch 写了篇博客介绍他新论文里的发现:用强化学习(RL)做模型后训练时,会出现马太效应——训练越往后,模型越爱挑简单题做,难题被采样的次数越来越少,因为早期在简单题上拿到的奖励把训练方向带偏了。他提出的修正方法叫 Never Give Up(NGU),核心是给难题设一个最低采样比例,不让它们被挤掉。在 Olmo 3.1...

推荐理由:Michael Noukhovitch 把自家论文写成了博客,讲的是 RL 后训练里一个隐蔽的退化现象:模型会越来越爱做简单题,难题采样率一路下滑,因为早期简单题的奖励把训练方向带偏了。他管这个叫马太效应,提出的修正方案 NGU 就是给难题设最低采样比例,强制保留训练信号。正文没披露 NGU 在 Olmo 3.1 之外更多模型上的验证结果,这点先别太激动,但思路本身对正在跑 RL 流程的团队有直接参考价值。

9月15日星期二

AI 群聊日报

空仓库让 Astra 写代码翻车,喂了 code review 经验后质量飞升

今天最直观的教训来自 @搞仁义毛义仁:给 Astra 一个空白 C++ 仓库,代码写得一塌糊涂;把积累了大量 code review 经验的 GacUI 上下文导进去,质量立刻飙升。这说明模型不是不会写,是得用具体规则去“规训”。@今天群内信息量极大 实测了 Ollama Cloud 跑 DeepSeek V4.1 Flash,解码吞吐是官方 API ...

推荐理由:今天群聊里两条实操经验比大多数论文都实在。第一条来自 @搞仁义毛义仁:用 Astra 写 C++,给个空仓库代码质量很差,但把积累了多年 code review 规则的 GacUI 上下文喂进去,质量立刻上来了。这说明模型不是不会写,是得用具体、有约束的规则去“规训”,光靠模型自己发挥不行。第二条是 @今天群内信息量极大 实测 Ollama Cloud 跑 DeepSeek V4.1 Flash,解码吞吐比官方 API 高出一截,但正文没披露具体延迟和成本数字,所以这个“快”到底在什么条件下成立、性价比如何,还得自己测了才知道。两条都指向同一个方向...

AI HOT 精选

Fireworks 实测 DeepSeek-V4.1-Flash:写代码能力看齐 GPT-6 Astra,单次成本只要 1/15

Fireworks 跑了一遍 DeepSeek-V4.1-Flash 的完整测试。在衡量自动修 bug、写代码能力的 DeepSWE 基准上,它的 pass@1 得分是 74.34%,跟 GPT-6 Astra 的 74.12% 在同一档,但每次任务成本只要 0.43 美元,比 Astra 便宜 15 倍,比 Claude Opus 5 便宜 28 倍...

推荐理由:DeepSeek V4.1-Flash 在 DeepSWE 上跟 GPT-6 Astra 平起平坐,成本却砍了一个数量级,是本周最强的性价比信号。扣分是因为数据来自 Fireworks 自己的评测,不是独立第三方,而且原文被 cookie 墙截断,看不到完整方法和误差范围,所以结论先打个折。

Hacker News 首页

GPT-5.6 Luna 对比 GPT-6 Astra:花 3.6% 的钱,能抓到 75% 的代码 bug 吗?

Entelligence 用 50 个真实 PR 测了这两个模型做代码审查。Luna 每百万输出 token 只要 1.2 美元,Astra 要 50 美元,单次审查成本差了 28 倍。最终 Luna 找到 69 个确认 bug,Astra 找到 92 个。但 Luna 的误报率高得多,93 条意见里有 24 条是错的,Astra 只有 4 条。在 S...

推荐理由:Entelligence 自己测了自己的模型,正文没交代这 50 个 PR 从哪来、有没有人类审查员做对照,独立性要打个折。但实验设计清楚,成本、召回、误报率都给了具体数字,对选模型做代码审查的人有参考价值。