跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 201–220 条 · 共 453 条

6月2日星期二

AI HOT 精选

NVIDIA Cosmos 3 在开放权重模型里拿了图像和视频生成双料第一

NVIDIA 的 Cosmos 3 在 Artificial Analysis 的开放权重榜单上,文本生图和图片转视频两项都排到了第一。它用了一种叫 Mixture-of-Transformers 的架构,把自回归推理器和扩散生成器拼在一起,有 16B 参数的 Nano 版和 64B 参数的 Super 版。Super 版在两项任务上分别超过了 HiD...

推荐理由:Cosmos 3 在 Artificial Analysis 的开放权重榜上把图像和视频生成的头名都拿了,我会先打个折——这只是单一基准的排名,不代表实际场景一定最强。但亮点在于它直接给了 16B 和 64B 两个尺寸,而且权重、代码、数据、微调方案全开源,这点对想自己训模型的人挺实在。正文没披露训练成本和推理延迟,所以别急着下“省钱”的结论。整体看,这条消息对关注开源多模态竞争的从业者有参考价值,放在 featured 档合适。

6月1日星期一

AI HOT 精选

MiniMax 开源 M3 模型,把写代码、读长文和看图听声塞进一个系统,跑分压过 GPT-5.5 但成本只要十二分之一

MiniMax 放出了一个叫 M3 的开源模型,把代码能力、一次能读 100 万 token 的长上下文和原生多模态(能直接处理图像、音频)做在了一起。在 SWE-Bench Pro 这个代码基准上拿了 59.0%,比 GPT-5.5 的 58.6% 和 Gemini 3.1 Pro 的 54.2% 都高一点;在 BrowseComp 自主浏览任务上 ...

推荐理由:我会先打个折:目前只有一条 X 帖子,没看到官方技术报告或第三方独立评测,所以分数压在 78–84 区间。但 M3 确实把编码、超长上下文和多模态打包开源,SWE-Bench Pro 59.0% 不算顶尖但够用,成本只有 GPT-5.5 的约 1/12,对想省钱又有长上下文需求的团队是个实在选项。这点先别太激动,等正式文档和更多实测出来再调判断。

Import AI

AI 监管比想象中难;蛋白质折叠模型也找到了规模定律;有人给 AI 灭绝风险估了个价

这期 Import AI 聊了几件事。美国 AI 经济的真实增速可能被严重低估了:名义 GDP 在 2025 年约 2500 亿美元,但算上质量提升,实际年增速接近 2600%。之所以在常规统计里看不出来,是因为 AI 推理价格跌得和性能涨得几乎一样快,而且数据中心建设规模还没大到能明显拉动 GDP。作者提醒,AI 跟过去的半导体、互联网不一样,它可能...

推荐理由:这篇是 Import AI 的周报汇总,不是一手突发新闻,所以我会先打个折。但它的选题角度很刁钻,把“AI 灭绝风险”当成一个可以算账的经济问题来聊,比单纯喊安全口号有意思。里面给的美国 AI GDP 数字和质量调整增速,能让读者对行业体量有个具体感知。监督那部分也点出了当前对齐工作的实际困难,不是空谈。整体信息密度够,对关注 AI 政策与安全的从业者有参考价值。

r/LocalLLaMA

网友在双 DGX Spark 上跑 DeepSeek V4 Flash:预填充 1680 token/s,解码 39.8 token/s

一位 Reddit 用户用两台华硕 GX10(DGX Spark)组了个小集群,通过 vLLM 加载 DeepSeek-V4-Flash 模型。在 256K 上下文窗口、开启多 token 预测(MTP=2)的设置下,测得预填充速度 1680 token/s,解码速度 39.8 token/s。部署用了张量并行(TP=2),两台机器通过 RoCE 网络...

推荐理由:这不是行业大新闻,但胜在是第一手实测,配置细节都给了:TP=2、RoCE 网络、fp8 KV 缓存、256K 上下文,还估出了约 1M tokens 的安全 KV 上限。对想对比自己机器性能的人来说,这些数字比官方宣传实在。HKR 三项都踩中,放在低 featured 位置刚好。

AI HOT 精选

MWC26 上海要办人形机器人点球大战,宇树科技等 8 支队伍上场,全程自主、不靠遥控

GSMA 宣布在 2026 年 6 月 24 日至 25 日的 MWC 上海搞一场人形机器人点球比赛,这是全球头一回。8 支国内具身智能团队参加,包括宇树科技、灵心巧手等。规则参照世界杯点球,双方各罚 5 轮,射门和守门的都是机器人,平局后一球定胜负。关键限制是机器人必须自己识别球和守门员位置、决定射门角度并控制发力,不能由人遥控,也不能跑预设脚本。这...

推荐理由:我会先打个折:这是活动预告,不是模型发布或可复现的测试结果,所以分数压在 72–77 之间。但选题本身够抓人,规则里“不许遥控、不许脚本”把门槛拉高了,不再是展台走秀。正文没披露具体评分标准、场地条件和机器人硬件细节,所以别急着当技术里程碑看。如果现场真能稳定自主对抗,那才算数。

5月31日星期日

r/LocalLLaMA

用 44 小时 RTX 5090 给 Gemma 4 E2B 做了 13 个“去限制”变体,有害指令成功率从 32% 飙到 82% 以上

这篇帖子来自 Reddit 的 r/LocalLLaMA,作者 Abliterlitics 用 44 小时的 RTX 5090 算力,对 Gemma 4 E2B 模型做了 13 种不同强度的“去限制”(abliteration)处理。简单说,就是通过修改模型内部参数,削弱它对敏感问题的拒绝回答倾向。结果很直接:原版模型在 HarmBench 有害指令测...

推荐理由:我会先打个折:这只是一次个人发起的去审查实验,不是官方发布,结论别直接当生产依据。但文章把 13 个变体的基准分、GPU 开销和有害指令通过率都列清楚了,读起来像朋友在群里甩了一份跑分记录。对想了解 Gemma 4 安全边界、或者自己动手做 abliration 的人,这份数据比泛泛的讨论有用得多。

r/LocalLLaMA

PolyRange:一个防考题泄露、专测 AI 攻击能力的靶场,每次出题都不一样

PolyRange v1.0 把 OWASP 测试指南里的 12 大类、84 种攻击手法做成了动态靶场。它不靠固定题库,而是每次部署时让一个大模型现场生成新靶机和防守策略,分两档难度,最后用“AI 提交攻击结果、裁判机验证”的方式打分。整套环境一条命令就能在 Fly.io 或 Docker 上跑起来。正文没披露具体评测数据和成本,但思路很明确:防止模型...

推荐理由:PolyRange 把网页安全靶场做成了会自己换题的 agent 评测。每次部署由大模型新生成任务,不是死题库,防污染这点做得比较彻底。覆盖 84 个 WSTG 类、12 个 OWASP 类别,两档防御加 flag 判定,规则清楚。信息源单一,目前只有 Reddit 帖子,正文没披露实际跑分数据和 agent 通过率,所以分数先打 78,等有实测结果再往上调。

机器之心 · 公众号

人大高瓴发了一篇40页综述,专门讲怎么给大模型打分

这篇综述把“评分标准(Rubrics)”这件事拆成了五个部分来讲:定义、怎么构建、怎么用来训练、怎么用来评估、以及还没解决的难题。它想回答一个很实际的问题:在模型能自己调用工具、走流程干活的 Agent 时代,光看答案对不对已经不够了,得有一套更细的尺子来衡量“好答案”到底好在哪里。正文没披露具体的实验数据,更像是一张研究地图,帮从业者快速看清这个方向...

推荐理由:这篇综述没发布新模型或产品,但 40 页的框架对 agent 评测很有用,我会先打个折,放在 featured 档。正文没披露具体实验数据,更像文献梳理,但问题意识够强,从业者能直接拿来对照自己的评估流程。

机器之心 · 公众号

微软开源 SkillOpt:像训练神经网络一样,自动优化给 AI 智能体看的技能说明书

微软放出了一个叫 SkillOpt 的开源框架,一周就在 GitHub 上拿了 3300 多颗星。它的思路挺直接:不改模型本身的参数,而是像做文本版梯度下降一样,自动迭代优化那些写给 AI 智能体看的“技能文档”。论文里的实验覆盖了 7 个目标模型、6 个评测基准和 3 种执行环境,总共 52 种组合,结果要么最好,要么并列最好。不过正文因为访问限制没...

推荐理由:微软开源的 SkillOpt 把 agent 技能文档当成可训练的文本参数,像训神经网络一样去优化技能描述,这个思路挺新鲜。我会先打个折:论文说在 52 个组合里做到最优或并列最优,但正文没披露具体对比基线和误差范围,这点先别太激动。不过一周 3.3k star 说明 agent 工程圈确实被技能维护和评估成本折磨很久了,一个能自动优化技能文档的工具,哪怕只是省掉一部分手工调 prompt 的活,也值得关注。

5月30日星期六

新智元 · 公众号

Anthropic 内部流出一份 Claude 流畅度评分表,最高 11 分,优秀人类能拿 7.5

这份评分表把用户跟 Claude 的对话拆成 11 个可观察的行为指标来打分,满分 11 分。背后的研究用了 9830 组匿名多轮对话,发现高质量对话里 85.7% 都出现了“反复修改追问”这个动作。正文没披露具体评分细则和实验设计细节,目前只能看到评分框架,所以这个 7.5 分到底怎么算出来的还不清楚,先别太激动。

推荐理由:这篇的切入点是把 AI 和人的关系倒过来,用评分卡的形式讲 Claude 怎么分析用户行为,标题自带传播力。内容有具体的行为列表和样本量,不是空谈。我会先打个折:这不是模型发布或重大能力更新,所以放在 featured 档位刚好,不用拔到 breaking。对从业者来说,能从中看到 Anthropic 对“高质量使用”的定义,也能反推自己用 Claude 的方式在什么水平。

量子位 · 公众号

人大和至知研究院开源了 Claw Agent 的全套训练方案,连数据带模型和评测一起给了

人大和至知研究院放出了一个叫 ClawGym 的 Agent 训练框架,把数据、训练代码和模型权重都开源了。他们合成了 13500 条可执行的任务当训练数据,又做了 200 条任务的基准测试集。用这套东西训出来的 ClawGym-30B-A3B 模型,在他们自己的 ClawGym-Bench 上拿了 56.82 分,比 Qwen3-235B-A23B ...

推荐理由:这条消息对 Agent 开发者很实用。ClawGym 把数据、代码、模型检查点一起打包开源,不是又一个只有排行榜的项目。13.5K 合成任务规模不算大,但 200 个评测任务和 56.82 的得分给了明确的起点。我会先打个折:正文没披露合成任务的质量验证细节,也没说这个分数在实际业务场景里对应什么水平,所以别急着对标生产环境。但作为开源基建,它降低了复现和改造的门槛,值得关注。

机器之心 · 公众号

港中文新优化器 Pion 在“等谱流形”上更新大模型,解决 AdamW 和 Muon 训练崩溃问题

香港中文大学等团队搞了个新优化器叫 Pion,核心思路是不动权重矩阵的奇异值,只在“等谱流形”上做正交等价变换来更新参数。他们拿一个 6000 万参数、没用归一化层的类 LLaMA 模型试跑,Pion 稳定训练了 96 亿个 token,而 AdamW 和 Muon 都崩出 NaN 了。正文没披露更大规模模型或具体下游任务上的效果,所以这点先别太激动,...

推荐理由:我会先打个折:这篇是优化器数学,不是产品发布,所以分数在 78–84 之间。但它的钩子很直接——AdamW 和 Muon 会训崩,而 Pion 用“在等谱流形上更新”这个思路稳住了。正文给了 60M 模型、9.6B token 的无归一化实验,证明能避免 NaN,这对做训练的人有实际参考价值。信息量够,痛点准,所以 HKR 全过。

r/LocalLLaMA

网友实测 Gemma 4 和 Qwen 3.6 的 MTP 加速:vLLM 上推理速度提升 3.34 倍

一位老哥在 RTX PRO 6000 显卡上跑了 MTP(多 token 预测,一次猜好几个词来加速生成)的测试。他用 vLLM 跑 Gemma 4 31B 模型,开了 MTP 后速度从每秒 39.69 个 token 飙到 132.52 个,快了 3.34 倍。测试是跑 10 次、每次生成 1500 个 token 取的结果。不过帖子没提生成质量有没...

推荐理由:这是一篇第一人称的硬核速度测试,有硬件型号、模型、框架和明确的 tok/s 对比,H/K/R 三点都踩中了。我会先打个折:来源是个人博客,权威性一般,而且质量、显存这些关键指标正文没披露,所以分数压在 featured 低位是合理的。

5月29日星期五

纽约时报中文网

Anthropic 估值冲到 9000 亿美元,把 OpenAI 挤下最贵 AI 初创公司位置

Anthropic 刚拿了 650 亿美元新融资,投前估值 9000 亿美元,超过了 OpenAI 上一轮的 7300 亿。公司同时发了新旗舰模型 Claude Opus 4.8,在 Vals AI 的 vibe coding(用口语化指令写代码)基准上比自家前代高了 10%。Anthropic 说它的年化收入运转率已经突破 470 亿美元,主要靠 C...

推荐理由:Anthropic 靠 650 亿美元融资把投前估值推到 9000 亿,压过 OpenAI,这是基础模型市场格局的一次实打实变动。Opus 4.8 在 Vals AI 氛围编程基准上比前代提了 10%,正文没展开具体测试条件和误差范围,这点先别太激动,但至少说明模型在代码场景还在往上走。HKR 三项全中,NYT 信源也撑得住,放 p1 没问题。

新智元 · 公众号

DeepSeek 三款模型冲进 OpenRouter 月榜前十,总消耗超 17 万亿 Token

OpenRouter 的月度统计显示,DeepSeek 有三款模型进了前十,加起来的 Token 消耗量超过 17 万亿。其中 V4 Flash 一个模型就占了 9.13 万亿 Token,用量很猛。文章还提到华为昇腾的 MegaMoE 算子,在 DeepSeek V3.1 和 Qwen3-235B 的测试里,把预填充(Prefill)吞吐量提升了 2...

推荐理由:HKR三项都成立:17万亿tokens的钩子加上OpenRouter排名和昇腾Prefill提升的具体数字,信息量够。分数定在82,因为算力自主的叙事很强,但正文没披露测试的可复现条件,这点先别太激动。

AI HOT 精选

Adam's Law:用模型训练时见过的高频词写提示,效果更好

FaceMind 团队在 100 种语言和四类核心任务上做了实验,结论很简单:保持意思不变,把提示词或微调文本换成预训练语料里出现频率更高的说法,大模型的表现会明显提升。他们把这个规律叫 Adam's Law(文本频率定律),相当于给数据工程补上了“频率”这个维度。原理不复杂——高频表达让模型在自己最熟悉的概率空间里干活,输出质量自然更稳。不过正文没披...

推荐理由:我会先打个折:正文没披露具体用了哪些模型、数据集和效果提升的幅度,所以没法判断这个“更好”到底好多少、在什么规模的模型上成立。但选题本身很聪明,用 100 种语言和四类任务把“高频词有效”这个反直觉结论撑起来了,对天天调提示词的人来说是个值得自己复现一下的线索。

AI HOT 精选

特斯拉说 FSD 比人安全十倍,但训练它的员工自己都不敢坐

路透社扒了特斯拉的安全报告,发现“比人类安全 10 倍”这个说法站不住脚。特斯拉拿自己车气囊弹出的数据,去跟全美所有车辆(包括老车)的普通事故率比,11 位交通安全研究员看了直摇头,说这是误导性营销。更扎心的是,9 名前数据标注员和 1 名前工程师爆料,FSD 连避让校车、紧急车辆这种基础操作都还搞不定。为了给投资人看的自动驾驶出租车演示,员工得提前加...

推荐理由:这篇的核心冲突很清楚:特斯拉拿自己的 FSD 事故数据跟全美平均比,得出 10 倍安全的结论,但路透找的 11 位研究员认为这个比法不公平,因为联邦数据里包含大量老旧车型、非自动驾驶场景,统计口径不一样。我会先打个折——文章没给出特斯拉的具体计算方法和原始数据,所以没法验证 10 倍到底水不水,只能确认学界在公开质疑。对从业者来说,这提醒我们看厂商安全报告时要盯紧对比基准,别被单一倍数带着走。

5月28日星期四

量子位 · 公众号

用有限状态机给 GUI Agent 合成训练轨迹,每条成本压到 0.04 美元

这篇讲的是 AutoWebWorld 这个项目,它没有靠人工标注或大模型当裁判,而是用有限状态机(FSM)来定义网页的状态、前置条件和跳转规则,自动生成并验证 GUI Agent 的操作轨迹。最终合成了 29 个网页环境、875 个页面和 11663 条经过验证的轨迹,平均每条轨迹的成本大约 0.04 美元。正文没披露具体用了哪些模型做测试,也没给出任...

推荐理由:我会先打个折:这不是顶级大厂的发布,所以分数压在 78–84 的研究工具档位。但 H、K、R 三条都站得住。0.04 美元一条轨迹是个能让人点进去的数字;放出的环境和轨迹量不算小,而且 FSM 内置状态验证这个设计,比靠人标或 LLM 打分更可复现,对做 GUI 智能体的人有直接参考价值。

r/LocalLLaMA

一张 RTX 3060 12GB 跑通 Qwen3.6-35B-A3B,128K 上下文生成速度 37 token/秒

用户 old-mike 在一张 RTX 3060 12GB 显卡上,用 spiritbuun 的 llama.cpp 优化分支和 mudler 的 APEX 量化模型,成功跑起了 17.3GB 的 Qwen3.6-35B-A3B。在已填充 72K 上下文时,生成速度达到 37.17 token/秒;上下文塞到 129K 时,速度仍有 28.08 tok...

推荐理由:HKR 三项都踩中了。一个 Reddit 用户用消费级显卡跑通 35B 大上下文,还给出了速度和困惑度,对本地推理圈子是实打实的参考。信息来自单篇帖子,影响范围也就在本地推理场景,所以放在 featured 而不是 P1。

Latent Space

Cognition 拿了 10 亿美元,估值冲到 260 亿,预计年底年经常性收入超 10 亿

Cognition 完成了 10 亿美元的 D 轮融资,估值 260 亿美元,比 8 个月前 C 轮时的 100 亿估值涨了 1.5 倍。公司自己预计到年底年经常性收入能超过 10 亿美元,客户里包括 Exa 和 Modal 这类挑剔的企业。正文没披露具体的利润率或成本结构,所以这个收入数字先别直接等同于利润。 这期 AI 新闻还提了几个技术趋势:推...

推荐理由:Cognition 这轮融资信息量很足。我会先打个折:260 亿估值和 10 亿年收入预期都是公司自己说的,正文没披露第三方验证,但即便打个七折也够猛。8 个月估值涨 2.5 倍,说明市场对 AI 编程 agent 这条路的买单意愿很强。对从业者来说,这不是又一家模型公司融到钱,而是一个把模型塞进开发流程干活的产品拿到了大额支票,信号比纯模型融资更实际。