跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 301–320 条 · 共 453 条

5月10日星期日

新智元 · 公众号

硅谷顶尖 AI 甩开世界一年?这篇正文其实没给实锤

这篇文章的标题抛出一个很猛的判断,说硅谷最前沿的 AI 比外界领先一年,我们用的都是“技术余晖”。但点进去后,页面直接显示“环境异常,完成验证后即可继续访问”,正文内容完全没加载出来。所以,标题里提到的投资人 Elad Gil 的时间差说法(顶尖实验室员工领先硅谷 3-4 个月,硅谷又领先纽约 3-6 个月),以及 Mythos 在专家级网络攻击模拟中...

推荐理由:我会先打个折:这篇是二手评论,不是模型或产品发布,所以分数压在72–77这个区间。HKR三项都成立——“技术余晖”的钩子够抓人,时间差和73%成功率给了具体数字,地域焦虑感也拉满了。正文没披露Mythos测试的具体条件和样本量,这点先别太激动,但作为一篇制造FOMO的评论,它完成了任务。

量子位 · 公众号

浙大和腾讯优图搞了个会当“导演”的 AI 角色扮演框架,对话里能插旁白、场景和内心戏

浙大和腾讯优图在 ACL 2026 上发了 AdaMARP,让 AI 角色扮演不再只是你一句我一句,而是像导演一样调度四类消息:对话、旁白、场景描述和内心独白。框架里塞了个场景管理器,能根据剧情走向自动切分镜。训练数据从 81 部文学作品和 20 个合成主题里抽,评测集 AdaptiveBench 用 100 个种子场景来考模型能不能把故事讲下去。正文...

推荐理由:这篇 ACL 2026 的工作把角色扮演从“一问一答”拉到了多角色叙事,四通道消息和场景管理器是核心卖点,81 本书的数据集也算扎实。我会先打个折:它更像一个研究原型,没看到生产环境下的延迟、成本或安全约束,所以别急着想象它能直接跑在商业产品里。亮点在机制设计,短板在工程验证,整体值得关注但保持观望。

r/LocalLLaMA

NVIDIA 发布 Star Elastic:一个模型文件能直接切出 30B、23B、12B 三种推理模型

NVIDIA 放出了一个叫 Star Elastic 的模型,一个检查点文件里包含了 30B、23B 和 12B 三个尺寸的推理模型,不用额外训练就能直接“切片”取用。具体玩法是让 23B 的子模型负责思考过程,30B 的模型负责给出最终答案。在 AIME-2025、GPQA、LiveCodeBench v5 和 MMLU-Pro 这几个测试集上,这种...

推荐理由:我会先打个折:这还是个研究发布,不是大规模验证过的产品,影响力肯定比不上一个全新旗舰模型。但它的机制很具体——一个检查点通过“零样本切片”就能变出不同大小的推理模型,而且 23B 负责思考、30B 负责回答这种分工方式,在 AIME-2025 上确实跑出了 16% 的准确率提升和 1.9 倍延迟降低。对正在折腾推理部署的人来说,这种“一份权重、多种用法、精度可选”的思路,直接打中了成本和延迟的痛点,所以放在 featured 里是合适的。

5月9日星期六

r/LocalLLaMA

用 12GB 显存跑 Qwen3.6 35B A3B,llama.cpp MTP 实测跑到 80 tok/s、128K 上下文

Reddit 用户 janvitos 在 RTX 4070 Super(12GB 显存)上跑 Qwen3.6-35B-A3B-MTP-GGUF,搭配 llama.cpp 的一个 MTP 拉取请求。他贴出的实测数据是每秒 69.2 到 81.9 个 token,草稿接受率在 0.694 到 0.947 之间,上下文长度拉到 131072。关键设置是 -f...

推荐理由:这条帖子是单用户实测,不是官方数据,验证强度有限,但数字和配置都摆出来了,可复现。对想在家用显卡上跑长上下文模型的人来说,是个很具体的参考点。我会先打个折,毕竟只有一个人晒结果,但 12GB 显存跑 35B 还能 80 tok/s,这点确实让人想试试。

机器之心 · 公众号

港科大和社区开源了 StarVLA,一个框架把主流视觉-语言-动作模型串了起来

StarVLA 把 VLA(视觉-语言-动作模型)里常用的主干网络、动作输出头、训练策略和评测接口都做成了可插拔的模块,不用再为不同论文各搭一套代码。仓库在 GitHub 上已经拿到 2.2k 星,支持的基准包括 LIBERO、SimplerEnv、RoboTwin 2.0、RoboCasa-GR1 和 BEHAVIOR-1K。正文没披露具体训练成本和...

推荐理由:我会先打个折:StarVLA 目前是框架级发布,不是新模型,所以权重不会给到模型首发那么高。但它的价值很实在——把多种 VLA 架构塞进同一套接口,训练和评估不用再东拼西凑,2.2k star 说明社区已经用脚投票了。正文没披露框架内各方法的横向对比数据,这点先别太激动,但统一工具这件事本身对机器人方向的工程效率提升是实打实的。

机器之心 · 公众号

DeepSeek 被曝正在谈一笔 500 亿人民币的融资,梁文锋自己掏四成,估值可能到 3500 亿

这条消息来自机器之心,但原文页面被微信判定环境异常,需要验证才能看,所以正文内容没拿到。标题和摘要里提到的关键数字是:融资额约 500 亿人民币(折合约 73 亿美元),估值约 3500 亿人民币(折合约 515 亿美元)。梁文锋个人计划出资 40%,腾讯和 600 亿规模的国家 AI 基金也在谈。这些数字如果属实,说明 DeepSeek 这轮融资规模...

推荐理由:这条DeepSeek融资传闻数字大、出资比例明确、资方有名有姓,HKR三项都站得住。但正文也说了还在谈,没有官方确认,所以分数和级别不动,保持84分和featured,不升p1。

AI HOT 精选

Claude Mythos 预览版风险时间距评估:50% 任务完成时间至少 16 小时

METR 在 2026 年 3 月的一个短暂窗口里,对 Claude Mythos 的早期预览版做了风险评估。他们用一套任务测下来,模型有 50% 概率能独立完成的任务,所需时间至少是 16 小时,95% 置信区间在 8.5 到 55 小时之间。这个数字已经碰到了 METR 现有任务能测出的上限,也就是说,再长他们就测不准了。正文没披露具体是什么任务、...

推荐理由:METR 在 2026 年 3 月拿 Claude Mythos Preview 早期版做了有限窗口评估,测出一个 50% 时间范围至少 16 小时,95% 置信区间 8.5 到 55 小时。我会先打个折:这只是单次评估、早期版本,窗口也有限,别直接当最终结论。但“16 小时”这个数字本身够直接,说明模型在长时间自主任务上已经能跑一阵子了,安全团队得盯紧。正文没披露具体任务类型和失败模式,这点信息缺口让判断只能停在信号层面。

5月8日星期五

r/LocalLLaMA

Gemma 4 26B 在单张 RTX 5090 上跑到每秒 600 token

chain-77 用 vLLM 0.19.2rc1 测了 Gemma 4 26B,开了 DFlash 投机解码后,单张 RTX 5090 的输出吞吐从每秒 228 token 跳到 578 token。测试条件是输入 256 token、输出 1024 token、并发数 1、投机 token 数设为 13。这个速度意味着本地跑 26B 模型已经可以做...

推荐理由:这条帖子本身是单次测试,没对比其他卡或并发场景,所以我会先打个折。但一张消费级显卡把 26B 模型输出速度翻了一倍多,这个提升幅度够实在,而且给了可复现的版本号和参数,对想在家跑大模型的人有参考价值。

AI HOT 精选

自适应并行推理:让模型自己决定什么时候分头干活

BAIR 这篇博客梳理了并行推理的最新进展,核心观点是:与其让外部规则替模型决定怎么拆分任务、开几个线程,不如让模型自己判断。文章介绍了 ThreadWeaver 和 Multiverse 两种方法,它们能让模型在解题时动态决定是否并行、开多少并行分支、以及如何汇总结果。相比传统的多数投票、树搜索或固定并行结构,这种自适应方式更省算力,也更贴合问题本身...

推荐理由:BAIR 的出身让这篇有基本可信度,HKR 三项都过关。文章把动态控制并行线程的机制讲清楚了,但我会先打个折:没给任何量化结果,也没说怎么复现,所以分数卡在 74 不动。这点先别太激动,等他们把延迟降幅和基准跑出来再说。

新智元 · 公众号

用 token 级价值函数控制回答长度,3B 模型在长度控制上跑赢 GPT-5.4 和 Claude

加州大学圣塔芭芭拉分校和苹果的研究人员搞了个叫 LenVM 的方法,把“还剩多少 token 要生成”建模成一个 token 级别的价值函数,相当于给模型装了个实时字数进度条。他们拿 Qwen2.5-3B 搭配一个 1.5B 的 LenVM 去测 LIFEBench 的长度控制任务,得分 62.6,而 GPT-5.4 只有 37.4,Claude-Op...

推荐理由:我会先打个折:正文没披露 GPT-5.4 的具体版本和测试条件,这点先别太激动。但 LenVM 的思路很实用——把“还要写多长”变成一个 token 级的值函数,让 Qwen2.5-3B 搭配一个 1.5B 的小模型就能在长度控制上大幅领先大模型。LIFEBench 长度得分 62.6 比 GPT-5.4 的 37.4 高出不少,说明在特定任务上小模型加对方法可以很省钱。对做推理优化和想摆脱闭源模型绑定的团队来说,这是个值得跟的信号。

量子位 · 公众号

哈工大华为搞了个免训练加速框架,让扩散大模型推理快4.48倍还不掉精度

哈工大深圳、华为和深圳河套学院提出一个叫 Dynamic-dLLM 的框架,不用重新训练就能给扩散大语言模型加速。在 LLaDA-8B-Instruct 上跑 GSM8k 数学题,吞吐量从每秒 8.32 个 token 提到 37.29 个 token,快了 4.48 倍,而且精度几乎没降。正文没披露具体用了什么技术手段,也没说在其他任务上表现怎么样,...

推荐理由:HKR 三项都成立:4.48 倍提速是个好钩子,GSM8k 的 TPS 数据让说法有实感。这是推理优化研究,不是主流模型发布,放在 78–84 这个区间合适。

阮一峰的网络日志

软件开发的第三种方式:像老太太盖神秘屋一样用 AI 写代码

阮一峰这期周刊把 AI 辅助编程比作“神秘屋”式开发——没有整体规划,想到哪写到哪,代码层层堆叠,充满个性但外人看不懂。这种开发方式可能取代传统的大教堂和集市模式,成为个人和小团队的主流。另外介绍了一个叫 HN SOTA 的大模型人气榜,通过扫描 Hacker News 每天最热的 200 个帖子里对模型的讨论和好评来排名,本周前三名是 Claude ...

推荐理由:阮一峰这期周刊把 AI 编程总结成“第三种方式”,核心是“神秘屋”——你给需求,模型直接出结果,中间过程你看不到。这个说法比“低代码”或“辅助编程”更直白,也更容易让人理解为什么开发者会又爱又怕。HN SOTA 的榜单用每天 200 个 HN 热门话题来量模型人气,不是跑分,而是看社区讨论热度,算是一种接地气的 benchmark。整篇是评论性质,没有新模型或产品发布,所以重要性停在 72。HKR 三项都过:比喻够新、方法够简单、情绪够普遍。

AI HOT 精选

Anthropic 把开源对齐测试工具 Petri 捐给了独立机构 Meridian Labs

Anthropic 把自家用来测模型有没有撒谎、拍马屁、配合危险请求的开源工具箱 Petri,转交给了非营利评测机构 Meridian Labs。这么做是为了让工具脱离 AI 公司,评测结果更中立、更让人信服。Petri 从 Claude Sonnet 4.5 起就参与内部对齐检查,英国 AI 安全研究所也用它来评估模型会不会破坏 AI 研究。这次同步...

推荐理由:Anthropic 把对齐测试工具 Petri 捐给 Meridian Labs,条件是保持独立性和公信力,这件事本身就挺有意思——相当于把裁判权从自己手里交出去。Petri 3.0 的核心改动是把审计模型和目标模型拆开,Dish 能接真实部署环境,再加上 Bloom 做行为评估,让独立审计有了实操基础。正文说多轮 VQA 压缩 90% 视觉 Token 精度不掉,这个数字如果经得起第三方复现,确实挺省钱。不过目前还没看到独立验证结果,我会先把这个判断挂在信息缺口上。整体来看,这件事对做多模态推理优化和安全评测的人都有参考价值,放在 feature...

r/LocalLLaMA

单张 4090 跑出 11.67%:TOPAS 递归架构在 ARC-AGI-2 上的本地测试结果

Doug_Bitterbot 用一张 RTX 4090 训练了大约 14 天,让 TOPAS 模型在 ARC-AGI-2 抽象推理测试上拿到了 11.67% 的分数。这个模型只有 1 亿参数,本地跑分最高到过 36%,但它的递归测试时训练(TTT)机制在 Kaggle 的题目上出了问题,将近一半的谜题直接输出空结果。作者觉得调一下阈值、再训 3 到 5...

推荐理由:Doug_Bitterbot 在 Reddit 上发了个帖子,说他的 TOPAS 架构在 ARC-AGI-2 公榜拿了 11.67%,跑在一张 RTX 4090 上,训练大概花了 14 天。模型参数约 100M,本地 checkpoint 能到 36%,但 Kaggle 提交时因为递归 TTT 超时,近一半题目输出空数组,分数被拉低。作者自己预期调一下阈值能到 20%,还说 3-5 周后再训完。这事有意思的地方在于,它只用输入图片来决定怎么压缩视觉 Token,多轮 VQA 里能砍掉 90% 的 Token,正文说精度不掉。不过目前只有一篇帖子,K...

AI HOT 精选

冻结模型里藏着可读的行为信号,Cygnus 靠适配器把 Qwen-32B 的 ARC 得分从 82% 拉到近 95%

Proprioceptive AI 搞了个叫 Cygnus 的技术,给已经冻结的大模型外挂一个自感知适配器,不重新训练就能读出模型内部残留的行为信号。做法是把隐藏状态投影到一个用 gl(4,R) 李代数定义的数学空间里,从中分离出他们称为“暗模式”的精度信号。拿 Qwen-32B 试了一下,只用一张 RTX 3090,ARC-Challenge 准确率...

推荐理由:HKR 三项都成立:12.77 个点的提升数字扎实,李代数投影的做法够新,压缩 90% 视觉 Token 对实际部署很省钱。但来源是 X 上的帖子,正文没给出完整评测集和对照实验,复现性存疑,所以只给低 featured。真正值得盯的是后续有没有第三方复现,如果复现成立,这个“冻结模型+适配器”的省钱路线对多模态推理会是实打实的利好。

5月7日星期四

r/LocalLLaMA

Qwen 发布 WebWorld 系列模型,用 100 多万条真实网页操作轨迹训练,让模型学会在浏览器里干活

Qwen 在 Qwen3 基础上微调出了 WebWorld 32B、14B、8B 三个尺寸的模型,专门用来训练和评测能在网页上执行任务的智能体。训练数据包含超过 100 万条真实网页操作轨迹,模拟环境支持 30 步以上的连续操作,并且能同时看懂无障碍树、HTML、XML、Markdown 和自然语言描述这五种页面状态。用这套数据生成的合成轨迹再去训智能...

推荐理由:我会先打个折:正文没披露合成轨迹的具体生成方式,也没说这 100 万条数据覆盖了哪些网站类型,所以别急着当通用方案。但亮点很实在——用合成轨迹训练小模型做网页操作,在 MiniWob++ 和 WebArena 上都拿到了 10% 左右的提升,说明这条路走得通。对正在折腾 Web agent 的人来说,数据和评测结果比模型本身更有用。

新智元 · 公众号

浙大与哈佛开源 UniGeo:用几何信息做相机可控的 3D 场景编辑

浙大和哈佛放出了 UniGeo 的代码、报告和在线演示。它解决的是 3D 场景编辑里一个老问题:你让 AI 换个角度生成画面,结果物体形状、位置全乱套了。UniGeo 的做法是把几何约束直接塞进模型结构、表示层和损失函数里,相当于给模型装了个空间坐标系,让它知道物体该在哪、长什么样。核心不是简单套个视频模型,而是用视频预训练里的先验知识,加上几何锚点注...

推荐理由:我会先打个折:这篇是正经的 CV 研究,不是公关稿。UniGeo 的核心不是把模型换成视频生成模型,而是在表示、架构、损失函数三层都塞进统一的几何引导,相当于给模型画了三条辅助线,让它别乱跑。视频先验加几何锚点注意力这个组合,比单纯换 backbone 有意思。开源程度不错,代码、报告、Space 都给了,在三个数据集上跟 5 个方法比过,SOTA 的说法暂时可以接住。但别太激动,正文没披露推理延迟、显存占用和实际可控编辑的失败案例,这些对从业者判断能不能用很关键。整体看,可测试性强,但离产业神经还差一截,所以 H 和 K 给过,R 不给。

新智元 · 公众号

Claude 托管智能体新增“做梦”功能,Harvey 实测任务完成率暴涨约 6 倍

Anthropic 给 Claude 的托管智能体加了三个新能力:Dreaming(做梦)、Outcomes(结果校验)和多智能体协作。其中“做梦”是指让 Claude 在后台读取最多 100 段历史会话,自己总结规则来改进表现,一次演示里它把 530 万 token 的对话提炼成了 98 条规则。法律 AI 公司 Harvey 实测后,任务完成率比之...

推荐理由:Anthropic 给 Claude 托管 Agent 加了三个东西:Dreaming 让模型事后翻历史会话自己总结规则,Outcomes 用偏好样本教模型对齐目标,多 Agent 编排让多个 Claude 协作干活。Harvey 说任务完成率大约翻了 6 倍,Outcomes 内部测试最高能提 10 个百分点。运行时另收 0.08 美元/会话小时,正文没披露这个定价的横向对比。我会先打个折:6 倍是合作方数据,没看到独立复现,但 Dreaming 从 530 万 token 压到 98 条规则这个例子确实说明能省不少上下文成本。

机器之心 · 公众号

SWE-Bench 作者出新基准 ProgramBench,Claude、GPT、Gemini 全拿零蛋

这个新基准让模型从零复刻完整软件项目,只给可执行文件和说明文档,不给源码和测试。评测不看单函数写得对不对,而是用模糊测试跑行为一致性,看整个系统能不能用。结果 Claude Opus 4.7、GPT-5.4、Gemini 3.1 Pro 全部零完成率,一个都没跑通。这说明现在的模型离独立做系统工程还差得远,之前靠刷单函数题拿高分那套在这不管用。

推荐理由:我会先打个折:这只是单个基准测试报告,不是模型或产品发布。但 0% 的完成率太刺眼,而且测试设计很刁——只给可执行文件和说明文档,让模型从零重建项目,再用行为等价和 agent-driven fuzzing 判分。正文没披露样本量和任务难度分布,这点先别太激动。真正值得盯的是它把评测从函数级代码生成拉到了系统级工程能力,这对做 coding agent 的团队是个实打实的压力测试。

r/LocalLLaMA

Reddit 实测:双卡跑大模型,PCIe 带宽可能没你想的那么吃紧

用户 ziphnor 用两张 RTX 5060 Ti 16GB 跑 vLLM,开启张量并行(TP=2)处理 32k 上下文预填充。实测 PCIe 峰值带宽只跑到 3–4 GB/s,大约占满一条 PCIe 4.0 x4 通道的 40%–50%。预填充速度在不同设置下分别达到约 840–850、1500 和 1600–1700 tokens/s。帖子没提解...

推荐理由:这篇 Reddit 实测值得一看,因为它用具体数字回应了一个常见焦虑:双卡跑大模型,PCIe 带宽到底够不够。ziphnor 拿 2 张 RTX 5060 Ti 16GB 在 vLLM 里开张量并行,32k 上下文预填充时 PCIe 峰值只有 3–4 GB/s,就算把链路砍到 PCIe 4.0 x4,实际也只用了 40–50% 的带宽。三组模型的预填充速度分别约 840–850、1500、1600–1700 tokens/s,说明瓶颈不在 PCIe 线速上。我会先打个折:正文没披露解码阶段的带宽,那才是持续通信的大头,这点先别太激动。真正该盯的是张...