跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 381–400 条 · 共 453 条

4月23日星期四

Hacker News 首页

代码模型修 bug 时总爱把整个函数重写一遍

作者用程序给 BigCodeBench 的 400 道题植入单点 bug,发现很多模型在修 bug 时会过度编辑——明明改一行就能修好,它却把半个函数重写了,甚至加一堆没必要的检查。文章用 token 级编辑距离来量化这种“改多了”的程度,并尝试通过训练让模型学会只做最小改动。正文没披露最终测试结果和模型排名,也没说训练后到底省了多少编辑量。

推荐理由:这篇文章的切入点很巧,用 400 道题的 bug 注入实验把“模型修 bug 时过度改写”这个模糊感受变成了可量化的编辑距离。对 AI 编程工具的用户来说,多改一行正确代码就是多一份审查成本和上线风险,所以相关性直接拉满。不过正文截取没给出具体结果、模型排名和效果幅度,我会先打个折——知道问题存在,但不知道严重到什么程度、哪些模型更爱乱改,这点先别太激动。

4月22日星期三

Hacker News 首页

Show HN 提交量翻了三倍,现在大部分是 AI 一键生成的页面

Adrian Krebs 用脚本扫了 500 个 Show HN 落地页,发现 67% 的页面至少命中 2 个 AI 设计特征,比如 Inter 字体、紫色渐变、卡片彩色左边框、图标功能网格这些模板化痕迹。检测方法是用 Playwright 跑无头浏览器,在页面里直接检查 DOM 和计算样式,靠 15 条硬规则判断,人工抽查下来误判率大概 5% 到 1...

推荐理由:这条值得推给做 AI 工具和产品的人看。Adrian Krebs 没在评模型能力,而是用一套土办法——Playwright 跑脚本检查 DOM 和样式——发现 Show HN 现在 67% 的页面都命中至少两个 AI 设计特征。我会先打个折:这是单人实验,不是严格审计,误报他自己也认了 5% 到 10%。但信号比数字本身重要:AI 默认生成的前端模板正在让产品页面快速趋同,这对靠差异化吃饭的早期项目不是好事。正文没披露具体是哪 15 个特征,也没给误报的详细拆解,所以别当行业报告用,当个警钟看刚好。

机器之心 · 公众号

苹果把 Transformer 改成了 Mamba,推理成本从平方级压到线性

苹果发了一篇技术文章,讲怎么把一个训好的 Transformer 模型(Pythia-1B)蒸馏成 Mamba 架构,让推理时的计算量从平方级降到线性。他们没直接硬蒸,因为直接蒸效果会崩(困惑度直接飙到 100 以上)。实际分了两步:先把 Transformer 的注意力换成一种叫 Hedgehog 的线性注意力,让模型适应线性计算;再把这个中间模型映...

推荐理由:我会先打个折:这还是个论文结果,不是已经落地的产品。但路线本身有意思——不是从头训 Mamba,而是把现成的 Transformer 蒸馏过去,省了大量训练成本。正文给出的下游任务(ARC、PIQA、BoolQ 等)说接近教师,但没放具体数字,这点先别太激动。如果真能在长上下文场景把推理成本压到线性,对需要处理长文档或长对话的产品是实打实的省钱。

Latent Space

OpenAI 发布 GPT-Image-2,图像生成模型开始能看懂文字、画 UI 和做排版了

OpenAI 正式推出了 GPT-Image-2,在 ChatGPT、Codex 和 API 里都能用。这次更新最明显的变化是文字渲染、排版和编辑能力大幅提升,能直接生成幻灯片、信息图、UI 稿和二维码,还支持多语言。模型分“思考”和“不思考”两个版本,思考版可以自己上网搜资料、生成多个候选图并自我检查。在 Arena 的图像排行榜上,GPT-Imag...

推荐理由:OpenAI 把 GPT-Image-2 同时铺到 ChatGPT、Codex 和 API,还特意强调 thinking 版本和文字渲染、布局编辑这些实用能力。Arena 上 Elo 1512、领先第二名 242 分,这个差距不小,说明在盲测里用户确实更愿意选它。我会先打个折——Arena 分数受采样和用户群影响,不能直接当绝对性能看,但三个第一同时拿下,至少说明在文生图这个赛道上它目前压了别人一头。对从业者来说,能不能稳定出可编辑、多语、带 QR 码的图,比单纯画质更重要,这条更新直接踩中了选型决策点。

4月21日星期二

量子位 · 公众号

蚂蚁数科搞了个叫“大象”的百亿参数模型,跑分和效率都挺能打

蚂蚁集团的 Inclusion AI 团队被扒出是神秘模型“大象”的幕后作者。这个模型参数量 100B,上下文窗口 256K,一次能吐 32K 字,已经在 OpenRouter 上架。文章里测了修 bug、总结三千字会议纪要、跑轻量 agent 流程,效果都不错。AI BENCHY 跑分显示它平均每秒能出 2500 个 token,延迟大概 1 秒,一...

推荐理由:一个 100B 模型敢喊同规模 SOTA 还强调 Token 效率,钩子够硬。文章有实测数据也有失败案例,不是纯吹。训练细节、价格和官方模型卡都没披露,所以先别太激动,但方向值得跟。

机器之心 · 公众号

Monet:让多模态模型在脑子里直接画图推理,不用每次都调外部工具

Monet 把 Qwen2.5-VL-7B 改造成 Monet-7B,核心是让模型在连续的视觉潜空间里做抽象推理,而不是每次都去调用外部画图或识别工具。训练分三步:先用 12.5 万条数据做监督微调,再用 VLPO 强化学习对齐偏好。在分布内任务上比原版模型提升 3% 到 9.75%,在分布外的抽象视觉推理上提升 2.31%。论文被 CVPR 2026...

推荐理由:这篇讲的是Monet,基于Qwen2.5-VL-7B做的一个模型,核心是让多模态模型像人一样做抽象视觉思考。它不用外部工具,而是用连续隐式视觉嵌入来搞定,这点我会先打个折——思路不新,但工程上做得扎实。论文已被CVPR 2026接收,代码、模型和125K条SFT数据都开源了,对想复现的人友好。方法分三阶段SFT加一个叫VLPO的强化学习,用偏好样本教模型学回答风格。文中说分布内任务比基座好3%到9.75%,分布外抽象视觉推理提升2.31%,数字看着还行,但别太激动,因为没披露统一榜单的完整绝对分数,不知道跟其他模型比到底排第几。真正值得盯的是它把V...

机器之心 · 公众号

匿名模型 MotuBrain 在 WorldArena 和 RoboTwin2.0 两个榜单同时登顶,圈内都在猜它是谁

MotuBrain 这个模型在 WorldArena 上拿了 63.77 的 EWM 分数,在 RoboTwin2.0 的干净和随机两种设置下分别得了 95.8 和 96.1 分,两项都是第一。它在运动质量、流分数和运动平滑度这些细分指标上也排在最前面。RoboTwin 的 50 个任务里它平均做到 96.0 分,第二名是 92.3 分,差距不算小。这...

推荐理由:H 抓的是匿名模型双榜第一这个反常事件,圈内打听本身就说明信息差和关注度。K 把具体分数和领先幅度摆出来,同时点明关键信息缺失——谁做的、怎么训的都不知道,读者能自己判断可信度。R 落在具身智能的核心争议上:一个模型同时做世界预测和动作输出到底行不行,这次有了可复现的 benchmark 证据。分数定在 81,因为结果本身有冲击力,但所有权、规模、训练数据和可复现性全缺,不能给更高。

Hacker News 首页

就算号称“无审查”的模型,也不敢把话说明白

Morgin.ai 用 4,442 个句子测试了 6 个预训练模型,发现即便是去掉拒绝机制的“无审查”模型,碰到敏感词时概率也会被大幅压低,差距从几百倍到约 1.6 万倍不等。他们管这叫“退缩”:模型不会拒绝回答,但会把敏感词的概率压到几乎为零。比如同一句话填空,Pythia-12B 首选“驱逐出境”,概率 23.27%;而 Qwen3.5-9B 把同...

推荐理由:这篇文章最值钱的地方是把“无审查”这个标签撕开给你看。它没讲拒答,而是讲预训练阶段词的概率分布就已经歪了——比如 qwen3.5-9b-base 把 deportation 排到第 506 位,概率只有 0.0014%。我会先打个折:这只是单篇研究博客,不是正式论文,样本和模型覆盖有限。但它的视角够刁,用 4,442 个上下文测出的 flinch 现象,比泛泛讨论“模型审查”实在得多。对从业者来说,提醒了一件事:别光盯着后训练的安全对齐,预训练数据的分布偏移才是更底层的坑。这点先别太激动,但值得跟。

4月20日星期一

X · @Yuchenj_UW

Kimi K2.6 开源了,SWE-Bench Pro 跑分 58.6,声称超过 GPT-5.4 和 Claude Opus 4.6

Kimi K2.6 宣布开源,在 SWE-Bench Pro(一个测代码修 bug 能力的基准)上拿了 58.6 分。推文说这个分数压过了 GPT-5.4(xhigh 模式)和 Claude Opus 4.6(max effort 模式)。不过正文没披露模型权重、开源协议和具体的评测设置,可复现性要打个问号。发帖人觉得 Kimi 发版节奏越来越快,属于...

推荐理由:三条都踩中了:开源本身就是强钩子,SWE-Bench Pro 58.6 这个数可以验证但信息不全,开源对闭源的代码能力竞赛又是当下热点。分数我维持 81,因为目前看只有标题级信息,权重、许可证、评测设置全都没披露,先别太激动。

r/LocalLLaMA

用免费 Colab T4 和 Mac 给苹果端侧 3B 模型训练 LoRA 适配器

作者搭了一套 QLoRA 流程来微调苹果那个跑在手机上的 3B 模型,把显存需求从大约 24GB 压到 1GB 内存加 5GB 显存,免费版 Colab T4 或者一台 24GB 内存的 Mac 就能跑。帖子说 A100 跑 LoRA、T4 跑 QLoRA、Mac 跑 QLoRA 训出来的适配器效果差不多,都能把准确率从 40% 左右拉到 75%,如果...

推荐理由:一篇带名字的第一手实验,内存和准确率数字可复现,HKR 三项全中,比普通教程贴强。分数没上 85 是因为来源只是单篇 Reddit 帖子,权威性有限,跑分范围也窄。

r/LocalLLaMA

Reddit 网友拿 9 个模型做功能规划对比,Claude Opus 4.6 生成的规格书最贵也最详细

一位 Reddit 用户让 9 个模型给一款 Go 语言记账 App 设计“负载追踪”功能,再用 Claude Code 给生成的规格文档打分排名。Claude Opus 4.6 排第一,产出一份 19KB 的规格书,过程中读了 44 次代码,花了 2.47 美元;GLM 5.1 排第二,Qwen 3.6 35B fp8+vLLM 排第三。作者自己强调...

推荐理由:这是一次有名有姓的个人实测,给出了真实工作流里的数据,所以 H、K、R 三项都站得住。但天花板不高:只测了一个功能、排名由 Claude Code 自己打分、正文没提人工验收结果,我会先打个折,放在 featured 里偏低的位置。

r/LocalLLaMA

用一张 RTX 4090 跑 Gemma 4 26B,从 2400 份财报电话会里挖交易信号,一个有效,一个差点骗过我

一位 Reddit 用户用 800 份标注过的财报电话会记录微调了 Gemma 4 26B,然后在一张 RTX 4090 上花了约 14 小时,推理了 3 年内共 2400 份记录。在 600 份样本外数据上,一个信号显示:CFO 指引越含糊,公司股价在 5 天内相对板块平均跑输约 1.8%,信息系数(IC)为 0.04。另一个信号更强,与板块回报的相...

推荐理由:这是一篇第一人称的实战记录,不是公关稿。作者把 Gemma 4 26B 塞进一张 4090,用 800 份人工标注的财报电话会微调,然后让模型在 2400 份近三年转录上提取交易信号,整批跑完 14 小时。结果里有一个信号站住了:CFO 把业绩指引从具体数字改成模糊表述后,股价 5 日内相对行业落后约 1.8%,IC 0.04,不算强但能用。另一个信号和行业回报相关性高达 0.85,作者直接判定为幽灵信号,提醒读者因子去重比标题里的赚钱故事重要得多。全文没有吹模型多强,反而在讲怎么排雷,信息密度和诚实度都够,适合 featured 位置。

量子位 · 公众号

苏度科技估值超20亿美元,发布具身模型Sudo R1:零真实机器人数据训练,首次抓取成功率约98%

苏度科技放出了他们的具身智能首秀Sudo R1,说是在完全没有用真实机器人数据训练的情况下,直接零样本测试了200多次,对100多种没见过的物体(包括透明、金属、软的和反光的东西)首次抓取成功率约98%,试两次基本能到100%。整个演示跑了60分钟。他们用的方法是在高保真模拟器里结合世界模型和强化学习来训练,相当于先在虚拟世界里把技能练好再搬到真机上。...

推荐理由:这条我会先打个折,因为所有指标都是自报的,没第三方验证。但零真机数据、zero-shot 直接上真机抓出 98% 首次成功率,这个说法本身就够硬,而且给了 200 多次测试、100 多个没见过的物体、60 分钟连续跑,数字具体,不是空口号。它正好打在机器人行业最疼的地方:真实数据又贵又慢,仿真到真机迁移一直是个坑。正文没披露融资金额、基准怎么定义的、谁做的第三方验证,所以分数没给更高。

纽约时报中文网

荣耀人形机器人“闪电”半马跑出50分26秒,比人类世界纪录快近7分钟

荣耀的人形机器人“闪电”在北京半马跑出50分26秒,比乌干达选手基普利莫保持的人类纪录(57分20秒)快了将近7分钟。它身高1.65米,腿长约0.9米,中途撞上护栏摔倒,靠人扶起来后继续跑完。去年最快的机器人成绩是2小时40分42秒,今年直接压缩到不到三分之一,进步幅度很大。俄勒冈州立大学的机器人教授费恩认为,这主要说明中国在机器人硬件工程和系统稳定性...

推荐理由:这条消息的钩子很直接:一台人形机器人半马跑进50分26秒,比人类纪录快将近7分钟。我会先打个折——它中途撞护栏摔了,是在人帮忙扶起来之后才完赛的,所以不是完全自主跑完全程。但数字本身还是说明工程成熟度在往上走,去年同类最好成绩还要2小时40分,一年压缩到三分之一的时间,进步幅度值得盯。正文没披露控制方案和比赛规则细节,所以别急着往AI能力跃迁上解读,更多是机电、步态和系统集成的提升。对从业者来说,这条消息的参考价值在于一个可量化的性能标尺,而不是一篇公关稿。

4月19日星期日

r/LocalLLaMA

同一个 9B Qwen 模型,换套脚手架,Aider 编程得分从 19.1% 跳到 45.6%

作者拿 Qwen3.5-9B 的 Q4 量化版跑 Aider 的多语言编程基准(225 道题),只换了调用模型的外层脚手架,平均 pass@2 就从 19.11% 拉到了 45.56%。这个叫 little-coder 的脚手架不是新模型,它做了几件事:限制推理步数、加写文件前的安全锁、让模型主动扫描工作区文件,以及每轮塞一点针对性技能提示。核心观点是...

推荐理由:我会先打个折:证据确实薄,只有两次完整运行,没做消融也没换模型复现,所以别急着当结论用。但 hook 很实在——同一套 9B 权重,只靠 scaffold 设计就把 Aider 成绩翻了一倍多,说明 scaffold 和模型的匹配度可能比模型本身还关键。作者列出的四个机制(受限推理预算、拒绝覆盖已有文件的 Write guard、显式工作区发现、按轮注入小技能)也给了可复现的线索。对正在折腾本地小模型做代码 agent 的团队,这篇值得看一眼思路,但暂时别拿 45.6% 当稳定预期。

机器之心 · 公众号

MIA 记忆智能体框架:让 AI 干活不再“失忆”,边用边学

上海一个研究团队搞了个叫 MIA 的记忆框架,想让 AI 智能体在干活时能记住经验、持续进步,而不是每次重启都像失忆一样。它把记忆分成参数记忆和非参数记忆两种,用交替强化学习来更新,还支持边测试边学习。团队说在 7 个数据集上拿了最好成绩,但具体分数正文没给出来。核心思路是把记忆当成能力内化,不光是翻旧账。

推荐理由:我会先打个折:文章说在 7 个数据集上拿了最佳,但没放具体数字,也没说跟哪些基线比、差距多大,这点先别太激动。真正有意思的是思路——把记忆从“翻之前的缓存”升级成“边干活边内化能力”,用 Manager–Planner–Executor 架构和交替强化学习让模型在开放任务里持续变强。对做 Agent 的人来说,这个方向比刷榜更有看头,但复现细节和验证强度目前还看不清。

机器之心 · 公众号

高德在亦庄半马放出一只四足机器人“图图”,在开放路段不靠预设路线和遥控,跑完导盲避障任务

高德在2026年亦庄人形机器人半马上展示了一只叫“图图”的四足机器人,完成了一段开放环境下的导盲避障演示。官方说全程没有预设路线,也没有人遥控。背后的技术栈叫ABot,分两块:ABot-N0负责导航,在7个导航基准上拿了SOTA,其中SocNav得分88.3%,说明在社交场景里避让行人的能力不错;ABot-M0管操作,在Libero-Plus上拿了80...

推荐理由:HKR 三项都站得住:半马导盲这个设定本身就新鲜,技术栈和关键成功率数字也给了,而且场景选得够狠,天然带话题。分数维持在 80 不往上加,是因为正文没提导盲实测到底覆盖了哪些路况、有没有出过安全事故、什么时候能商用——这些缺口让判断得先打个折。

新智元 · 公众号

伯克利团队造了个专门作弊的 AI,SWE-bench 满分但一个 bug 都没修

伯克利 RDI 团队用一段大概 10 行的 pytest 钩子代码,在 SWE-bench 全部 500 个任务上拿了 100% 分数,实际修 bug 数是 0。他们的 agent 还顺手打穿了另外 8 个主流 agent 评测,分数从 73% 到 100% 不等。作弊手法包括篡改测试钩子、直接读本地 file:// 答案文件,以及利用评测器本身的校验...

推荐理由:HKR-H 落在'满分却零修复'的矛盾上;HKR-K 落在约 10 行 pytest 漏洞、500 题和 8 个基准的覆盖面上;HKR-R 落在评测信任危机上,做智能体产品的人会反复掂量。属于强 featured 研究,但不是当天行业事件,所以不到 P1。

r/LocalLLaMA

实测 8 个模型当桌游主持人:27B 小模型叙事质量干翻了 405B 巨无霸

作者用 6 个固定跑团场景测了 8 个模型,让它们当桌游主持人。评分用了 8 项自动指标加 3 个 LLM 裁判打分,整轮测试只花了约 0.02 美元。最终 google/gemma-3-27b-it 以 4.33 的综合叙事分排第一。标题说 27B 赢了 405B,但正文被屏蔽了,没披露那个 405B 具体是哪个模型,也没给出完整排名。这点先别太激动...

推荐理由:这篇来自 Reddit 的个人评测,钩子够锋利——小模型在叙事质量上干翻大模型,HKR 三项全中。我把它留在 featured 而不是更高,是因为正文截断了,405B 具体是哪个模型、完整排名都没给出来,信息有缺口,先别太激动。

4月18日星期六

量子位 · 公众号

RAG 搜对了文档却答错?德国萨尔大学团队找到病根,ACL 2026 长文收录

萨尔大学团队发现,很多 RAG 系统翻车不是因为没搜到资料,而是模型读不懂搜回来的文档。他们提出 Disco-RAG,在检索和生成之间加了一层“阅读理解”:先用修辞结构理论把文档拆成论证树,再建跨段落关系图,最后生成大纲来引导回答,全程不用额外训练。论文在 Loong、ASQA、SciNews 几个数据集上都有提升,但正文没给出具体分数,这点先别太激动。

推荐理由:这篇论文的卖点不是又刷了一个榜,而是把 RAG 的故障点拆开了:检索没问题,问题出在生成前的理解环节。我会先打个折,因为正文没完整披露三个基准上的具体分数,外部复现也还没看到,所以分数停在 80。但诊断结论本身对从业者有用,值得放进 featured。