跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 41–60 条 · 共 453 条

9月14日星期一

Hacker News 首页

2026年AI就业市场:谁在被抢、谁在拿高薪、哪些岗位正在消失

Maksim Ilin 把 LinkedIn、世界经济论坛、斯坦福、普华永道和贝恩的数据拼在一起,画出了 2026 年 9 月的 AI 就业图景。最抢手的岗位是 AI 工程师,就是把大模型塞进产品里干活的人,美国周均新增约 1550 个职位,年薪中位数 17.6 万美元。最顶尖的是前沿实验室的研究科学家,Anthropic 年薪中位数约 74.6 万美...

推荐理由:一篇个人博客把几份公开报告的数据揉在一起,给出了 2026 年 9 月 AI 岗位的薪资和需求全景。数字具体、来源可查,对从业者有直接参考价值。扣分是因为本质上是二手数据整合,不是一手调研,权威性有限,所以停在 72 分。

Hacker News 首页

30 个 SVG 画图题,看 2025-2026 年的大模型谁能画好“鹈鹕骑自行车”风格的图

Tom Gally 用 Claude Fable 5.1 搭了个站,把 Simon Willison 那个经典的“鹈鹕骑自行车”测试扩展成了 30 道 SVG 画图题,比如“章鱼弹管风琴”、“长颈鹿组装落地钟”。2026 年跑了 6 个模型,2025 年跑了 10 个。页面直接贴模型返回的原始 SVG,没做主观打分,你自己看图画得怎么样。每张图下面标了...

推荐理由:Simon Willison 那个经典的鹈鹕骑自行车测试,社区里玩了好几年了。Tom Gally 这次把它扩成 30 道题,还跑了 2025 和 2026 两批模型,信息量挺大。页面没做主观打分,就让你自己看图判断,这点反而实在——省得被一个分数带偏。缺点是你得一张张翻,没法一眼扫出排名,但当成一个原始素材库来用,价值很高。

Computing Life · Share · 鸭哥调研

谁在改尺子:AI 榜单的两重张力

OpenAI 发布 GPT-6 Astra 后,评测机构 Artificial Analysis 一周内两次修改评分规则,让 Astra 从落后 5 分变成与 Claude Fable 5.1 并列第一,模型本身没动过。榜单是门生意:评测方卖高价订阅需要大厂背书,厂商需要排名做营销,双方利益绑在一起。DeepSeek V4 Flash 只重训了后训练阶...

推荐理由:这篇评论用一件具体的事——Artificial Analysis 在 GPT-6 Astra 发布后一周内两次改评分规则,让排名从落后 5 分翻成并列第一——把 AI 榜单的商业逻辑讲透了。有版本号、有分数、有权重变化,信息扎实。对从业者来说,它不是在复述新闻,而是在提醒:你花钱订阅的排行榜,尺子可能随时跟着大厂的新模型重画。我会给高分,因为这种“拆台”视角比单纯报分数更有价值。

9月11日星期五

Hacker News 首页

代码能跑但写得烂:怎么衡量 AI 生成的代码有多“水”

Sebastian 在 Earendil 的博客里用 SlopCodeBench 的指标测了 AI 写代码的“水分”。AI agent 写的代码平均啰嗦度 0.33,人类仓库只有 0.15;侵蚀度 0.68,人类是 0.31——AI 代码的啰嗦和臃肿程度大概是人类的两倍。在多轮、清空上下文的迭代测试里,哪怕最顶尖的模型,严格通过率也是 0%,坏决策会越...

推荐理由:Sebastian 在 Earendil 的博客里用 SlopCodeBench 测了 AI 写代码的“水分”,给了两个新指标:啰嗦度(verbosity)和侵蚀度(erosion)。AI agent 写的代码啰嗦度 0.33,人类仓库 0.15;侵蚀度 0.68,人类 0.31——AI 代码的臃肿程度大概是人写的两倍。多轮迭代测试里,哪怕最顶尖的模型,严格通过率也是 0%,坏决策会越滚越多。这个角度比泛泛说“AI 代码质量差”具体得多,直接量化了“能用但脏”的状态。我会先打个折:这是单篇博客,不是同行评审,SlopCodeBench 也没开源,可...

9月10日星期四

Hacker News 首页

在真实的 Claude Code 会话里,LRU 缓存淘汰策略比很多新论文说的更难打败

这个仓库重放了 393 次真实 Claude Code 会话里的 6.8 万个请求,专门测试那些号称能替代 LRU 的 KV 缓存淘汰新策略。结果发现,很多新方法在论文的标准测试集上看着挺美,一碰到真实 agent 工作流(让模型进业务流程干活)的访问模式就露馅了。正文没给出具体的命中率数字,但核心结论很明确:真实场景下的访问规律跟学术基准差得远,生产...

推荐理由:这个仓库没走论文老路,而是拿真实 agent 工作流的访问模式来压测 KV 缓存淘汰策略。393 次会话、6.8 万个请求的规模够看,直接点出很多新方法在学术基准上好看、一上生产就露馅。不过正文没披露具体命中率数字,所以分数先停在 featured 这一档,等有数据再往上调。

AI HOT 精选

OpenRouter 推出 Fusion:让多个模型先辩论,再合成一个最终答案

Fusion 不是新模型,而是一套让模型“开会讨论”的流程。你提一个问题,它会同时发给最多 8 个模型(评审团)各自回答,然后由一个裁判模型对比它们的答案,找出共识、分歧和遗漏点,最后让主模型综合这些分析写出最终回复。默认三模型评审团的成本大约是单次调用的 4 到 5 倍,耗时 2 到 3 倍。在 DRACO 深度研究基准测试中,一个由 Gemini ...

推荐理由:Fusion是一套多模型辩论后合成的流程,不是新模型。成本和延迟数字、DRACO基准数据让它比纯营销稿扎实,但本质是路由层的产品更新,不是基础模型突破,所以放在featured低分段。

AI HOT 精选

Cognition 发布 SWE-2 编码模型,跑分逼近前沿但成本砍掉六成多

Cognition 推出了新模型 SWE-2,在 FrontierCode 1.1 Main 上拿到 50.0% 的分数,比自家上一代 SWE-1.7 高出 8 个百分点,同时成本比对手 Fable 5.1 低了 64%。它是在 2.8 万亿参数的 Kimi K3 基础上做强化学习后训练得到的,用的是一种单轮训练法,把不同思考深度的模式一起练出来。实际...

推荐理由:SWE-2 在 FrontierCode 1.1 Main 上跑到 50.0%,比前代涨了 8 个点,成本比 Fable 5.1 便宜 64%,是 Cognition 目前最接近前沿的一次。没给 85 分是因为它还是比 GPT-6 Astra 差几个点,而且基座用的是 Kimi K3 而不是自研模型。不过单轮 RL 训练法把不同思考深度揉在一起练,工程上省事,成本控制也漂亮,对想用第三方模型做编码 agent 的团队来说是个很实际的参考。

9月7日星期一

Computing Life · Share · 鸭哥调研

AI 把作业下限抬高了,但评分标准还在惩罚想得更深的人

两场千人级实验揭开了同一个真相。土耳其高中数学课上,用 ChatGPT 做练习的学生成绩暴涨 48%,但一关屏幕独立考试,分数反而比没用 AI 的对照组低了 17%。屏幕亮着时的漂亮卷面,只是向外部算力借来的下限,一断网就清零。米兰商学院的营销写作实验更微妙:用了 AI 的学生,作业得分在 5 分制上高出近 1 分,表达逼近专家水平。但实验同时发现,那...

推荐理由:两场千人级随机对照实验给出了硬数字,把 AI 辅助学习的幻觉拆得很清楚:练习分数虚高,闭卷考试反而倒退,学生跳过推理直接抄答案。HKR 三项都强,但文章是综述性质,不是一手研究发布,所以分数压在 85 以下。

r/LocalLLaMA

Qwen 3.8-27B 的 4-bit 量化版调两个参数后,跑分反超 Q5 量化并逼近官方满血版

一位老哥在 5090 上对比了 Qwen 3.8-27B 的两种本地运行方式:用 NInfer 跑的 NVFP4(4-bit 量化)和用 llama.cpp 跑的 Q5_K_M。一开始用默认采样参数(temp=1.0, min_p=0.0)跑 IFBench 指令遵循测试,Q5 严格分 76% 略高于 NVFP4 的 74%。但他发现 NVFP4 的宽...

推荐理由:这是一篇单人单卡、单模型的实测笔记,不是纸上谈兵。作者发现NVFP4默认参数下指令遵循能力被压住了,调参后直接反超更高比特的量化方案,还附了速度对比。我会先打个折:测试只在一张5090上跑了一个模型,依赖NInfer这个相对小众的推理引擎,普适性有限。但文章的价值在于给出了一个具体、可复现的调参思路,对本地部署党来说比泛泛的量化对比报告有用得多。

9月6日星期日

AI HOT 精选

OpenAI 在 GPT-6 Astra 发布后反复修改跑分,幻觉率一度从 4.2% 砍半到 2% 又改回去

Fortune 发现 OpenAI 在 9 月 3 日发布 GPT-6 Astra 后,多次悄悄修改了官方博客里的基准测试成绩。最夸张的是 Astra 的幻觉率,先是从 4.2% 降到 2%,后来又改回了 4.2%。Anthropic 的模型 Fable 5.1 也遭了殃,数学成绩一度被 OpenAI 下调了近 10 分。OpenAI 解释说这是发布前...

推荐理由:GPT-6 Astra 发布本身就是大事,Fortune 抓到发布后改基准测试成绩,还动了竞品分数,热点、知识增量、读者决策影响全占了。没给到 95 是因为目前只有 Fortune 一家报道,OpenAI 的回应也比较模糊,先观望一下后续。

AI HOT 精选

OpenAI GPT-6 Astra 在 Code Arena WebDev 榜单拿第一,比第二名 Claude Fable 5.1 高出 35 分

GPT-6 Astra(Max 版本)在 Code Arena 的网页开发专项榜上跑出 1797 分,排第一。第二名 Claude Fable 5.1(Max)是 1762 分,第三名 Claude Opus 5(Max)1688 分。这条信息只来自一条推文,正文没披露测试样本量、具体任务类型和响应延迟,所以这个领先幅度先别太当真,等有更多细节再判断。

推荐理由:GPT-6 在 Code Arena 网页开发专项上首次超过 Claude,35 分的差距值得聊一聊。但消息只来自一条推文,没给测试样本量、具体任务和响应延迟,分数先打个折,等更多信息出来再调整。

9月5日星期六

AI 群聊日报

GPT-6 Astra 全面开放首日实测:更快但更贵,额度战同步开打

GPT-6 Astra 今天向所有 Pro 用户开放,Codex CLI 和 Copilot 都已接入。群友实测同一个任务从 12 分钟缩到 6 分钟,但单次消耗比 Sol 贵约 75%,有人用 API 跑一轮代码审查直接烧掉 100 美元。Tibo 和 Anthropic 同一天都给用户重置了额度,Codex 则顺手封堵了一个能无限白嫖的漏洞。另外,...

推荐理由:GPT-6 Astra 全量上线是本周最大的产品动作,这份群聊日报用第一天的实测数字把速度和成本都摆出来了,比官方公告更有参考价值。打 78 分是因为来源是匿名群聊整理,不是一手官方公告,部分细节(比如漏洞具体怎么堵的)正文没展开,所以没给更高。

Hacker News 首页

Artificial Analysis 发布 v4.2 智能指数,用隐藏题库防刷分,并加入模拟知识工作的新测试

Artificial Analysis 更新了模型评测榜单到 v4.2 版,主要做了两件事:一是新增了 AA-Briefcase 和 GDP.pdf 两个更贴近真实场景的测试;二是把不公开的隐藏题库权重翻倍到 40%,专门防止模型厂商针对公开题刷分。AA-Briefcase 是它们自己出的隐藏题,模拟需要好几周才能完成的知识工作项目,让模型处理几千个源...

推荐理由:这次更新核心就一件事:防刷分。Artificial Analysis把不公开题库的权重从20%提到40%,摆明了告诉厂商别想靠背题拿高分。新增的AA-Briefcase和GDP.pdf两个测试也值得看一眼,前者让模型处理几千个源文件做长周期项目,后者直接扔一本4592页的文档考信息提取,比MMLU这类饱和基准更接地气。不过正文没披露具体模型排名变化,只说后续会陆续放出,所以现在只能当方法论预告看,别急着拿它做选型决策。

Hacker News 首页

AI 能画电路板了吗?EEBench 用仿真跑分告诉你还差多远

EEBench 搞了个电路设计基准测试,不让模型在 GUI 里点来点去,而是用声明式代码(atopile)直接操作元器件和约束,然后跑 SPICE 仿真检查电压、容差、成本和真实零件能不能买到。Claude Opus 5 目前最高,得分 61.6%,Grok 4.6 以 57.1% 紧随其后。在一个电能表任务里,有设计选了个标称 22µF 的电容,但在...

推荐理由:EEBench 用声明式代码加 SPICE 仿真测了几家大模型做电路板设计的能力,Claude Opus 5 目前最高 61.6%,Grok 4.6 紧随其后。文章正好接在 GPT-6 Astra 的 KiCad 演示后面,时机很巧,热度够。分数和翻车案例都有,信息量扎实。不过 PCB 设计话题本身比较垂直,普通 AI 从业者不一定追,所以可读性上我会先打个折。

9月4日星期五

r/LocalLLaMA

GPT-6 Astra 在 ARC AGI-3 跑出 98.6% 别激动,OpenAI 用了自家改装套件

OpenAI 宣称 GPT-6 Astra 在 ARC AGI-3 基准上拿了 98.6%,但用的是他们自己定制的测试套件,不是官方标准版。Nvidia 之前用自家的 AVO 套件已经跑到了 100%,更早的 Arc-Skill 和 VISTA 系统也接近满分。换成标准套件后,Astra 的成绩掉到 66%。这个分数依然不错,但远没到 AGI。Open...

推荐理由:这篇文章用两个数字拆掉了 OpenAI 的 98.6% 叙事——Nvidia 的 100% 和标准套件下的 66%,信息密度高,冲突直接。没给更高分是因为来源是 Reddit 个人帖,不是机构评测,正文也没披露标准套件的具体测试条件和样本量,验证力度有限。

AI 群聊日报

Flash 模型集体冲顶:Gemini 3.8 Flash 和 Muse Spark 1.3 同天发布,便宜模型已能搞定九成任务

Google 发布 Gemini 3.8 Flash,输入价格每百万 token 0.75 美元,在 DeepSWE 编程基准上拿到 71% 的分数,多项智能体跑分超过 Sol 和 Opus 5。同一天 Meta 放出 Muse Spark 1.3,智力分跟 Grok 4.6 持平,Contributor 档位输入价只要 0.1 美元,但默认会用你的数...

推荐理由:Gemini 3.8 Flash 以 Flash 档位定价在智能体跑分上超过 Sol 和 Opus 5,这个信号很炸。来源是群聊日报而非官方公告,所以我会先打个折,但里面给的数字和实测笔记密度很高,对做模型选型的人有直接参考价值。

AI HOT 精选

OpenAI 发布 GPT-6 Astra,能跨应用操作电脑,越狱率直接压到零

GPT-6 Astra 主打两件事:一是让模型像人一样操作电脑,二是安全对齐。在 OSWorld 真实桌面任务测试里,完成任务的时间从 75 分钟缩短到 40 分钟;职场自动化任务成功率从 18% 涨到 41%。对齐方面,上一代模型不加防护时越狱率是 48%,Astra 直接压到 0%。作者还提到,用 2000 美元的算力就让 Astra 解出了 10...

推荐理由:GPT-6 Astra 发布本身就是行业级事件。电脑操作和对齐两条线都给了具体数字,不是空泛宣传,所以 H、K、R 全中。没给 98-100 分,是因为目前只有推文摘要,缺官方博客或第三方复现,等更多材料出来可以再往上调。

Hacker News 首页

Claude Code、Codex 和 Cursor 写代码时爱装什么工具?我们跑了近 1.7 万次实测

Armature 在 75 个代码库里模拟了四种程序员(从完全不懂代码的“感觉流”到企业级老手),让三个主流编程智能体实际动手装工具、写代码,总共跑了 16,893 次。结果发现,一旦在流程里加一个“模拟人类”来打断和确认,智能体的选择就会变:比如在对象存储上,Cloudflare R2 开始反超 Amazon S3;数据库方面,Neon 被反复推荐。...

推荐理由:Armature 模拟了四种程序员让 Claude Code、Codex 和 Cursor 实际动手装工具写代码,样本量接近一万七千次,能看出一些有意思的偏好转移,比如加了人类确认环节后 Cloudflare R2 开始反超 S3。不过得先打个折:Armature 本身给开发工具公司做增长服务,虽然他们开头就坦白了,但这个利益关系让人对数据解读得留个心眼。

AI HOT 精选

Perplexity 要接 GPT-6 Astra,CEO 说它在 WANDR 评测里排第一

Perplexity 的 CEO Aravind Srinivas 发帖说,他们会接入 OpenAI 刚发布的 GPT-6 Astra,先推给 Computer Pro 和 Max 用户。他夸这个模型在又深又广的研究任务上把别的模型甩开一截,而且更省钱。不过帖子里没给出具体上线时间,也没放 WANDR 的分数或成本数字,所以实际强多少、省多少,现在还没...

推荐理由:头部 AI 搜索产品第一时间接入刚发布的旗舰模型,本身就有新闻性。但 CEO 的帖子没给出 WANDR 的具体分数、成本对比和上线时间,实际提升幅度还不清楚,所以重要性先打个折,不往上冲了。

AI HOT 精选

GPT-6 Astra 在 ARC-AGI-3 上标准跑分 66%,靠持续对话硬拉到接近满分,但每道题烧掉 360 美元

François Chollet 放出了 GPT-6 Astra 在 ARC-AGI-3 上的成绩。用标准测试流程只拿到 66%,但换成持续对话模式,加上自定义的上下文压缩,分数直接逼近 100%。这个接近满分的表现不是模型自己一次答出来的,而是靠多轮对话和额外处理堆上去的,所以别把它当成模型已经具备通用推理能力。每道题的成本大约 360 美元,正文没...

推荐理由:Chollet 自己公布了 GPT-6 Astra 在 ARC-AGI-3 上的成绩:标准流程只拿 66%,换成持续对话加自定义上下文压缩才逼近满分,每道题烧掉约 360 美元。我会先打个折——这不是模型自己一次答对的,是反复对话和额外处理堆出来的,别直接当成通用推理能力。但分数反差和成本摆在那,做推理评估的人不看说不过去。