跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 181–200 条 · 共 453 条

6月4日星期四

新智元 · 公众号

Claude Mythos 在 METR 基准上连续跑了 3 小时 6 分钟,比专家预测的年底时间提前了大半年

Anthropic 的 Claude Mythos 在 METR 的自主任务测试里撑了 186 分钟,成功率 80%。这个时长刚好落在专家们之前预测的 3 到 4 小时中位数区间,但预测的时间点是 2026 年底,现在提前到了。正文因为需要验证码没抓到具体细节,不知道任务类型、失败原因和是否有人工干预,所以这个 80% 成功率先打个折看。

推荐理由:这条消息的钩子很直接:预测年底才到的水平,今天就被打出来了。我会先打个折——正文没披露模型规模、任务类型和可复现细节,所以不能当完整评测看。但 80% 成功率加 186 分钟连续跑,对从业者来说是个可感知的信号:agent 的自主时长在拉长,而且比行业预期快。安全焦虑和落地想象空间同时被触发,适合放 featured 位置。

AI HOT 精选

Cloudflare 数据显示机器人流量首次超过人类,占 HTML 请求的 57.5%

Cloudflare Radar 统计了 5 月 28 日到 6 月 4 日这一周的全球流量,发现所有 HTML 网页请求里,57.5% 来自爬虫、AI 抓取和自动化脚本,真人浏览器只占 42.5%,这是机器人流量头一回超过人类。如果把所有 HTTP 返回内容都算上,JSON 格式(主要是机器对机器的 API 通信)占了 33.1%,排第一,HTML ...

推荐理由:Cloudflare Radar 这次给了一个很具体的窗口和比例,HKR 三项都踩实了。文章没把 AI 爬虫、搜索引擎蜘蛛和恶意自动化流量拆开讲,所以我会先打个折,不把它捧得太高。但“机器人过半”这个信号本身对做网站、做爬虫、做安全的人都有直接参考价值,放在 featured 档刚好。

Latent Space

Axiom 用形式化验证做数学推理,Putnam 竞赛 12 题全解,Verina 基准 187/189

Axiom 这家成立七个月的初创公司,在 2025 年 Putnam 数学竞赛里解出了全部 12 道题,限时内得分 8/12,不限时则拿到满分 120 分,超过了已知的 DeepSeek 成绩(103/120)。CEO Carina Hong 说,他们的模型在 Verina ProofGen 基准上跑出了 187/189(约 99%),而 OpenAI...

推荐理由:HKR 三项都站得住:Putnam 限时成绩和 o3 的 4.9% 一对比,故事性就出来了;187/189 和 12 道题的具体数字让信息有抓手;话题本身踩在推理能力、评测公信力和 OpenAI 竞争这几个热点上。分数定在 80 是合适的,因为这是一篇 Latent Space 的访谈和研究分享,不是一次大规模模型发布,影响力范围有限。

Latent Space

微软 CEO 纳德拉对谈:把 AI 做成生态,别只盯着一两个模型

纳德拉在 Build 大会的播客里聊了微软的 AI 思路,核心是把 AI 当成一个生态平台来做,而不是押注单个模型。他举了比尔·盖茨那条老原则:平台创造的价值得远超平台自己赚走的。微软这次主推的 MAI 系列模型,强调从预训练阶段就保证数据干净、可追溯,因为现在很多开源模型在榜单上看着漂亮,实际用起来不行。有意思的是他们拿一个 50 亿参数的小模型做“...

推荐理由:HKR 三项都踩中了:Satya 本人就是流量钩子,文章给出了微软企业级多模型平台的具体组件名,还透露了 5B 小模型用 traces 做 hill climbing 的机制,对从业者判断技术路线有参考价值。不过它终究是 Build 大会的访谈,不是独立模型发布,所以 78 分合理。

6月3日星期三

量子位 · 公众号

大晓机器人和南洋理工搞了个统一物理3D生成框架,刚体、软体、带关节的物体都能一次搞定

这个框架叫PhysX-Omni,目标是让生成的3D模型直接能进物理仿真跑起来,不用再手动修。它把刚体、软体和关节体三类物体的生成统一到一个流程里,省掉了以前要分开处理的麻烦。配套的PhysXVerse数据集有8700个资产,覆盖2900个类别,规模不小。评测基准PhysX-Bench从几何、尺寸、材质、可交互性、运动学和文字描述六个维度打分,但正文没披...

推荐理由:统一物理 3D 生成这个钩子很清晰,数据集和评测基准的规模也给了实锤,对做机器人仿真的团队确实有用。不过正文没提开源、没提落地案例,也没说生成质量跟现有方案比到底好多少,所以分数先不打满,78 分合理。

量子位 · 公众号

Papers with Code 复活了,Hugging Face 用 AI 代理把论文和排行榜重新串了起来

Hugging Face 的开源团队在 2026 年 5 月上线了 paperswithcode.co,用 AI 代理自动解析论文,把原来平台超过 9300 个基准测试的 SOTA 排行榜恢复了出来。这次复活正好赶上 CVPR,首页直接整理了会议论文和对应代码。正文没披露解析准确率和代理的具体工作流,但能看出他们想用自动化方式解决原平台长期停更的问题。

推荐理由:Hugging Face 把 Papers with Code 重新做回来了,这次用 AI 智能体自动解析论文,一口气恢复了 9300 个基准相关的排行榜。对做研究的人来说,这比手动翻论文找 SOTA 省事太多。我会先打个折:正文没披露智能体解析的准确率有多高,也没说排行榜更新频率和覆盖范围的具体边界,所以别急着当完全体用。但光是 CVPR 期间能一站式查代码和榜单,实用价值就摆在那。

Computing Life · Share · 鸭哥调研

vibe coding 之后:AI 编程的工业化

MAI 从 487 万个开源 PR 里筛出 26.5 万道可训练题目,又为它们建了一套三层判分体系。AI 编程这两年真正的变化不是模型变聪明了,而是训练基础设施被工业化了:出题从手工活变成了流水线,批改也从“单测全绿就行”升级到能检查工具使用效率和前端视觉质量。

推荐理由:这篇文章没发模型、没给跑分,但把“vibe coding”之后该看什么讲清楚了:训练数据怎么筛、判分怎么搭、工程成本怎么控。487 万 PR 筛到 26.5 万题,这个压缩比本身就说明他们在做苦活,不是随便抓一把数据就训。三层判分体系正文没展开细节,但至少表明他们知道代码题不能只靠单次通过率来评。我会先打个折:没看到开源计划、也没看到实际训练出来的模型效果,所以目前更像一套训练基础设施的思路,离可复现的结论还差一步。对正在考虑自训代码 agent 的团队来说,这篇值得看,但别急着当标杆。

AI HOT 精选

智能性价比

微软在模型发布卡里加了个新指标:平均 token 用量。他们的新模型在 SWE-Bench Verified 上拿了 71.6 分,但消耗的 token 只有 Claude Haiku 4.5 的三分之一。这意味着现在衡量模型得看两个维度:活儿干得怎么样,以及干这活儿花了多少钱。靠烧 token 刷榜、靠补贴打价格战的时代在翻篇。Uber 四个月烧光预...

推荐理由:H、K、R 三条都站得住。用“跑分除以 token 消耗”当钩子,比单纯报分数更让人想点进去看。71.6 分和三分之一的 token 量是实打实的新信息。不过文章没给出完整的测试配置和具体定价对比,所以重要性停在 78 分,我会先打个折,不往更高拉了。

AI HOT 精选

微软放出 MAI-Thinking-1,35B 活跃参数的 MoE 模型,没靠蒸馏自己从头训

微软发了 MAI-Thinking-1,一个混合专家(MoE)模型,总参数 1 万亿但每次只激活 350 亿,跑起来相对省算力。它用 30T token 从零预训练,没拿第三方模型做蒸馏,这点比较硬气。微软管自己的迭代优化流程叫“爬山机器”,听着像在反复试错往上拱。成绩单上,AIME 2025 拿了 97.0%,LiveCodeBench v6 拿了 ...

推荐理由:微软发了 MAI-Thinking-1,一个 MoE 架构的推理模型,活跃参数 35B,总参数 1T,用 30T tokens 从零开始预训练。我会先打个折:正文没给任何跑分、开放方式或定价,所以没法判断实际水平。光看参数规模,35B 活跃部分在推理时成本不会太高,但 1T 总参数意味着训练和存储都不便宜。这点先别太激动,等有 benchmark 和访问方式再说。

TechCrunch · AI

微软开源新工具,用文字描述就能给 AI 模型出考卷

微软发布了一个叫 ASSERT 的开源框架,让开发者直接用自然语言写测试要求,就能自动生成一套评估 AI 行为的考题和回归测试。正文没披露它具体支持哪些模型、打分指标怎么算,也没提使用限制。

推荐理由:我会先打个折:正文没披露这个框架支持哪些模型、具体用什么指标、以及跑起来的硬件或环境要求,所以实际能省多少事还不好说。但方向本身挺对——让开发者用自然语言写测试意图,而不是手搓脚本,确实能降低回归测试的门槛。微软把它开源出来,至少说明不是内部玩具。这点先别太激动,等看到跑分和兼容性再判断值不值得集成。

Hacker News 首页

微软 MAI-Code-1-Flash 用 50 亿活跃参数在 SWE-Bench Pro 上拿到 51% 的分数

微软新放出的 MAI-Code-1-Flash 是个代码模型,只激活 50 亿参数就在 SWE-Bench Pro(一个让模型修真实 GitHub 问题的测试集)上跑出 51% 的分数。这个成绩放在小模型里算亮眼,但正文没披露它是在什么评测设定下跑的、用了哪些训练数据、什么时候发布,也没说部署条件。所以这个 51% 我先打个折看——不知道是不是挑过题、...

推荐理由:HKR 三条都过,靠的是微软这个 5B 活跃参数拿 51% SWE-Bench Pro 的说法。但正文没披露评测设置、训练数据和发布时间,信息缺口明显,分数只能压在 72–77 这个区间。

AI HOT 精选

微软发布自研推理模型 MAI-Thinking-1,中等规模,没从第三方模型蒸馏

微软在 Build 2026 上掏出了自己的第一款高级推理模型 MAI-Thinking-1。官方说这是个中等尺寸的模型,在一些软件工程基准上能跟一线模型打平。训练数据完全自建,没走知识蒸馏的捷径——也就是没拿别家大模型当老师来教它。这是微软在模型自研上的一次表态,之前它主要靠 OpenAI,最近两家刚重新谈了合作,关系没那么紧了。

推荐理由:微软在 Build 2026 发了 MAI-Thinking-1,说是中等规模推理模型,在软件工程基准上能打平领先模型。我会先打个折——正文没披露具体分数、访问方式和定价,所以没法判断它到底多强、多便宜。这点先别太激动。但这是微软第一个自研高级推理模型,信号很明显:它在试着减少对 OpenAI 的依赖,同时往开发者工具链里塞自己的货。

r/LocalLLaMA

用 LiteRT 跑 Gemma 4 E4B,文字生成比 Q4 GGUF 快 2.4 倍,图片处理几乎没变

有人在 RTX 4060 Ti 16GB 上实测了 Gemma 4 E4B 模型。用 LiteRT 引擎跑文字生成,平均每秒能出 157.2 个 token,而用 llama.cpp 的 Q4 GGUF 格式只有 66.3 tok/s,快了大约 2.4 倍。不过图片标注任务就没这么乐观了:处理 111 张全分辨率图片,LiteRT 耗时约 72 秒,Q...

推荐理由:这是一篇个人在 Reddit 上发的实测,不是官方报告,权威性有限,所以分数没往上拉。但 H、K、R 三项都站得住:速度对比抓眼球,测试条件和数据都写清楚了,对想在自己机器上跑 Gemma 的人有直接参考价值。我会先打个折,因为只有单卡单次测试,没提功耗和精度变化,但作为一手体验已经够用。

r/LocalLLaMA

Reddit 网友在 6GB 显存的笔记本 4050 上跑了 20 个小模型的速度对比

这篇帖子本身被 Reddit 的安全策略拦住了,正文内容没抓到,只留下一个“被网络安全屏蔽”的提示。从标题和已有的英文摘要看,作者用 LM Studio 的接口测了 20 个小模型,统一在 6GB 显存的 RTX 4050 上跑,每个模型在 1k、8k、32k 三种上下文长度下各测了 5 次速度。目前能看到的唯一具体数据是 unsloth/lfm2.5...

推荐理由:我会先打个折,来源是 Reddit 帖子,权威性一般,但内容本身很实在。作者没搞虚的,就是拿 20 个模型在 LM Studio 里用 6GB 4050 实测,把速度、显存占用都列出来。对想本地跑小模型的人来说,这比看论文里的 A100 数据有用得多。正文没披露测试用的量化精度和具体 prompt,这点信息缺口让结论不能直接照搬,但作为一张低显存显卡的参考表,已经够用了。

6月2日星期二

Ben's Bites

Claude Opus 4.8 发布,Claude Code 学会写脚本派子任务并行干活

Anthropic 发了新模型 Claude Opus 4.8,主要卖点是 Claude Code 现在能先写一个调度脚本,再同时拉起多个子代理并行处理复杂任务。不过有开发者提醒,这并不证明松散的 multi-agent 架构靠谱,反而是围绕小代理循环的确定性工作流更稳。模型本身被 Simon Willison 评价为“温和但有用的升级”,更诚实、更少...

推荐理由:HKR 三项都成立,因为这是一次有实质内容的 Anthropic/Claude 发布和 Claude Code 代理更新。文章没给基准测试、定价和上下文窗口数据,所以分数压在 85–94 这个区间。

r/LocalLLaMA

我把多智能体调度器里的 Claude 换成本地 Qwen3.6-27B,跑了两个星期

作者用一张 RTX 3090 跑 Qwen3.6-27B,在 47 个多步骤编程工作流里顶替 Claude 试了两周。计划生成的结构合规率大约 95%,但工具调用格式错误率有 12% 左右,而且上下文一超过约 12k token,实际表现就开始明显下滑。正文没披露具体任务难度和对比基准,所以 95% 这个数只能当个参考,别直接当成“接近 Claude”...

推荐理由:这篇值得看,因为它是真人两周实测,不是跑分。作者用一张消费级显卡把 Qwen3.6-27B 塞进多智能体编排里,替换 Claude,给出了能用的上限和会翻车的点。95% schema 合规听着不错,但 12% 工具调用格式错误意味着每八九次就有一次格式炸了,生产环境还得加校验层。长上下文到 12k tokens 就吃力,复杂任务得拆。正文没披露延迟数据和总 token 消耗,这点先别急着算成本账。整体是份诚实的工程笔记,不是公关稿。

机器之心 · 公众号

DataMaster:让模型自己搜数据、洗数据、拼数据,MLE-Bench Lite 奖牌率从 35.91% 拉到 68.18%

这篇论文提出了 DataMaster,一个让大模型自己当数据工程师的流程。它不碰模型结构和训练算法,只做三件事:自动搜索外部数据、清洗脏数据、把多个数据集拼成一张表。在 MLE-Bench Lite 这个机器学习竞赛基准上,DataMaster 把奖牌率从 35.91% 提到了 68.18%,几乎翻倍。正文没披露具体用了哪些模型、单次任务耗时和额外算力...

推荐理由:DataMaster 做的事很直接:模型和训练代码都不动,只让系统自己去搜、洗、拼数据,结果 MLE-Bench Lite 奖牌率从 35.91% 拉到 68.18%,接近翻倍。我会先打个折——这还只是单篇研究,没有生产环境验证,benchmark 本身也不是完整 MLE-Bench,所以别急着当银弹。但“数据工程自动化”这个方向确实戳中很多团队的日常痛点,加上数字够具体,给 78 分 featured 合理。

新智元 · 公众号

墨芯 AI 完成近 10 亿元 C 轮融资,下一代推理卡 SparsePrime 年内亮相

墨芯人工智能刚拿了一笔近 10 亿人民币的 C 轮融资。他们做的是 AI 推理芯片,主打稀疏计算,简单说就是只算有用的部分来省电省时间。正文提到他们的 S30 和 S40 卡在 MLPerf 推理测试里拿了三连冠,但没展开说具体跑什么模型、跟谁比。下一代卡叫 SparsePrime,计划年内发布,目前还没公布详细规格和定价。

推荐理由:我会先打个折:这是一条融资加路线图消息,不是产品实测。墨芯拿了近10亿,计划年内出SparsePrime,还说自己S30、S40在MLPerf推理上三连冠——但正文没放具体分数和对比基线,这点先别太激动。对在找国产推理卡、被Token成本压着的团队来说,这条值得放进雷达,但下单前得等真机跑分和量产时间。

新智元 · 公众号

中科院开源 MobileGym:在浏览器里搭了个手机训练场,微信、原神都能跑

中科院自动化所开源了一个叫 MobileGym 的移动端智能体训练环境,直接在浏览器里模拟安卓手机。它覆盖了 28 款常用 App,包括微信、原神、淘宝这些,每个实例只占 400MB 左右,冷启动 3 秒就能跑起来。环境会把手机界面状态转成结构化的 JSON 快照,方便模型理解当前屏幕有什么、能点哪里,任务验证也是程序化自动完成的,不用人工盯着看。这套...

推荐理由:MobileGym 是一套开源的移动 agent 训练与评测基础设施,不是模型发布,但实用性强。我会先打个折:正文没披露判分准确率、任务完成率等验证数据,这点先别太激动。不过它用浏览器仿真 28 个 App,单实例约 400MB、3 秒冷启动,还支持 JSON 状态复制,意味着复现成本低、部署快,适合批量跑实验。对 agent 开发者来说,这比租真机或搭模拟器集群省钱省事。整体在 78–84 这个质量区间里算扎实的工程贡献,所以维持 featured 和现有评分。

纽约时报中文网

中国一家公司正尝试用 AI 预测谁会变成异见者,但美国芯片限制可能拖慢了进度

范德比尔特大学的研究人员翻看了 10 万份泄露的公司文件,发现一家叫积至的中国公司正在开发一套 AI 系统,想通过分析电信数据、社交媒体和位置信息,在一个人还没公开表达不满之前就判断他未来会不会批评政府。这听起来像《少数派报告》里的情节,但文件显示,这套预测技术目前还停留在研究阶段,美国官员也说没有证据表明它已经定型或实际部署。积至的团队在 2024 ...

推荐理由:这篇报道把 AI 监控从猜测推到有文件佐证的层面,10 万份泄露材料让讨论不再是空对空。我会先打个折:正文没披露模型效果、误报率、是否真的跑通了,美方也说没证据显示已定型或部署,所以别急着当成已落地的系统。但选题本身够重,安全、治理、芯片供应链伦理全搅在一起,从业者很难绕开。