跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 261–280 条 · 共 453 条

5月19日星期二

r/LocalLLaMA

llama.cpp 合并 MTP 投机解码,Qwen3.6 27B 在 Strix Halo 上跑到 2.44 倍速

llama.cpp 在 PR #22673 里正式合并了 MTP(多 token 预测)投机解码支持。实测 Qwen3.6 27B 用 Q8_0 量化,在 Strix Halo 上从 7.4 tok/s 提到 18.1 tok/s,速度翻了 2.44 倍;双 RTX 3090 的 Q8_0 方案也从 25.7 tok/s 涨到 55.9 tok/s,约...

推荐理由:HKR 三项都满足:llama.cpp 合入了 MTP 投机解码,用 Qwen3.6 27B 在 Strix Halo 和 RTX 3090 上跑出了实打实的加速数字。范围限定在本地推理优化,不是大模型发布,78 分放在 featured 合适。

5月18日星期一

AI HOT 精选

IBM 在 Hugging Face 上线开放智能体排行榜,直接对比整套系统谁更省钱能干

IBM Research 做了一个开放排行榜,不只看模型本身,而是把智能体整套系统(模型、工具、规划、记忆、纠错)拉出来比。它用六个不同场景的基准测试来打分,同时公布质量和运行成本,让你知道哪个方案真值得部署。正文没披露具体模型分数、数据集大小和评测日期。

推荐理由:我会先打个折:信息量其实不多,更像一个预告。但“开放智能体排行榜”这个动作本身有话题性,因为 agent 评测一直缺公开基准,IBM 把它挂上 Hugging Face,至少让对比有了个起点。正文没披露分数和数据集规模,所以别急着拿它当权威结论,先当个信号看。

r/LocalLLaMA

我拿 42 个模型测了它们愿不愿意造末日,号称最安全的闭源模型在撒谎

作者搞了个叫 DystopiaBench 的测试,拿 36 个逐步升级的场景和 6 种反乌托邦套路去试探 42 个模型,每个模型跑 3 次取平均分,再用 3 个裁判模型打分。结果发现,很多模型能拦住直白的危险请求,但一旦把恶意藏在“军民两用”或“正常化”的包装里,它们就松口了。正文没披露具体模型名单和详细分数分布,这点先别太激动。

推荐理由:我会先打个折:正文只给了结论和测试框架,具体模型名单和分项得分没披露,所以没法验证“闭源模型撒谎”这个判断有多硬。但选题本身够锋利——不是泛泛测安全,而是测模型在递进式诱导下会不会一步步配合造末日,这比单纯问“能不能造炸弹”更贴近真实风险。测试设计也实在,36个场景分6类任务,3个裁判跑3次,至少把随机性考虑进去了。对做安全对齐的人,这篇的价值在于提醒:别只看模型第一次拒绝,要看它在多轮施压下会不会松口。

r/LocalLLaMA

Qwen 3.6 27B 在 24G 显存上的部署实测:后端、量化方案与参数对比

作者用一张 RTX 3090 24GB 跑 Qwen 3.6 27B,最终留用了 ik_llama.cpp 搭配 Qwen3.6-27B-MTP-IQ4_KS.gguf 这个量化版本。在 156k 上下文、q8_0 KV 缓存并开启 MTP 的设置下,输入约 5900 token 的提示、生成 1024 token 时,预填充速度约 1261 tok/...

推荐理由:这是一篇个人实测,不是官方发布,所以传播面窄一些,但信息密度很高。作者在单张 3090 上把 Qwen 3.6 27B 压进 24GB 显存,还跑通了 156k 上下文,最终选了 ik_llama.cpp 加 IQ4_KS 量化。prefill 能到 1261 tok/s,decode 72.9 tok/s,对本地部署来说相当可用。后端对比部分把 llama.cpp 系和 vllm 的取舍讲清楚了,对想自己搭推理服务的人有直接参考价值。我会先打个折:这只是单人单卡的一次测试,没有多卡、没有生产环境压测,但作为选型参考够用了。

r/LocalLLaMA

TIME:让 Qwen 模型只在需要时短思考,而不是一直过度推理

作者用 QLoRA 在 Qwen3 的 4B 到 32B 全系列上训练了一个叫 TIME 的方法,核心思路是当上下文发生变化时,模型才触发一段简短的中途推理,避免没完没了地“想太多”。帖子说数据集、notebook、训练脚本、课程学习方案和 TIMEBench 评测都公开了,24GB 显存就能训到 14B 规模。不过正文被 Reddit 的安全策略挡了...

推荐理由:我会先打个折:这是 Reddit 单帖发布,不是实验室论文,所以放在 featured 里 74 分比较合适。但内容本身挺实在——作者没去追长链推理,而是让模型在上下文切换时做短思考,避免“想太多”拖慢速度。用 QLoRA 在 Qwen3 四个尺寸上都训了,代码和数据全公开,24GB 显存能玩到 14B,这点如果是真的挺省钱。TIMEBench 评测也给了,不是空口说效果。整体对想自己动手调模型的人有直接参考价值,信息量够,判断也挂得住。

AI HOT 精选

开源工具 api-relay-audit 能揪出 AI API 中转站有没有偷工减料

这个工具专门查中转站三类小动作:改写工具调用指令、用报错信息泄露模型身份、偷偷截断上下文。它给出的是可复现的三态结果(有/无/不确定),附带透明日志,比 hvoy.ai 和 cctest.ai 这类工具更可信。作者把检测方法、对比结果和速查表都公开了,工具本身也开源了。

推荐理由:我会先打个折:信息源只有一条 X 推文,没有披露实际检出率、误报率或用户规模,所以分数压在低 featured 档。但工具本身思路很实用,把 API 中转站可能搞的小动作拆成三个可检测的维度,还给透明日志,从业者拿到就能跑。正文没提有没有配套的持续监控或告警,这点先别太激动。

r/LocalLLaMA

vLLM 在混插 Blackwell/Ada 显卡集群上跑长上下文预填充,速度比 llama.cpp 快 4 到 6 倍

作者用 7 张混插显卡(RTX PRO 6000、PRO 5000、两张 5090 和三张改显存的 4090)测了三个推理引擎处理长上下文的效率。在 Qwen3.5-397B-A17B 模型上塞进 7.5 万 token 的上下文,vLLM 首 token 延迟 9.8 秒,预填充速度 7683 token/秒;llama.cpp 要 57.2 秒,速...

推荐理由:作者在 7 卡混合集群上测长上下文预填充,397B 模型塞进 75k tokens,vLLM 9.8 秒出第一个 token、跑到 7683 t/s,llama.cpp 要 57.2 秒、只有 1319 t/s。我会先打个折:这是单人单次跑分,没披露 prompt 复杂度、batch size 和精度配置,SGLang 的数据也没给全。但 6 倍的 TTFT 差距和近 6 倍的吞吐差距,对正在选推理框架的团队是个硬参考。正文没提功耗和显存占用,这点先别太激动。

r/LocalLLaMA

骁龙 8 Elite 跑混合专家模型实测:CPU 推理反而比 NPU 快

一位 Reddit 用户用 24GB 内存的荣耀 Magic 7 Pro(骁龙 8 Elite)跑了几个混合专家(MoE)模型。在 Q4 量化下,LFM2-24b-a2b 跑到约 24 token/秒,Gemma 约 11 token/秒。比较意外的是,他这套配置里 CPU 推理速度比 NPU 和 GPU 都快,正文没披露具体用的什么推理框架和功耗数据...

推荐理由:这条来自 Reddit 个人测试,不是官方数据,权威性弱,但信息量够:24GB 手机、Q4 量化、LFM2-24b-a2b 跑 24 token/s、Gemma 跑 11 token/s,CPU 比 NPU/GPU 快。对想在手机上本地部署的人有参考价值,不过只有一台设备的数据,别当普遍结论。给 featured 低分段,因为话题热、数据具体,但来源单一。

5月17日星期日

r/LocalLLaMA

用 85 个 GPU 小时,把 Qwen3.6-27B 的 5 种“去安全限制”方法拉出来比了比

这篇 Reddit 帖子被网络屏蔽了,正文内容没拿到,只能根据标题和现有摘要说个大概。作者花了 85 个 GPU 小时,在 Qwen3.6-27B 模型上对比了 5 种 abliteration(去掉模型安全限制)方法,跑了一堆基准测试、HarmBench 安全评测、KL 散度(看输出分布变化)和权重分析。摘要里提到,Huihui 方法对模型原本能力的...

推荐理由:这篇不是实验室通稿,是实打实的 85 GPU 小时对比实验。5 种去审查方法在 Qwen3.6-27B 上跑完,给出了基准测试掉分、KL 散度和安全拒答移除率三个维度的数据。Huihui 掉分最少,Heretic 最像原版,但所有变体都几乎把安全护栏拆干净了——这点先别太激动,正文没披露这些变体在真实对抗场景下的表现,也没说拆掉拒答后模型会不会乱说话。对想用开源模型又需要绕过安全限制的人,这份对比能省不少试错成本。

r/LocalLLaMA

有人实测 DeepSeek V4 的百万上下文窗口,发现写代码的最佳区间是 15 万到 25 万 token

一位 Reddit 用户拿 DeepSeek V4 去啃 4.5 万、18 万和 52 万 token 的代码库,结论是 15 万到 25 万 token 时写代码最顺手。超过 30 万 token 后,模型对具体行号的定位开始不准;到 52 万 token 时,输出明显偏向架构总结,具体实现细节会跳过。帖子正文没披露测试用的具体任务和评估指标,所以这...

推荐理由:单篇 Reddit 帖子权威性有限,但 HKR 三项都站得住:有数字、有对比、有明确的失效模式。归入 featured 而不是更高,是因为复现细节和模型版本信息偏薄,先别太激动。

机器之心 · 公众号

AI Agent 的隐性账单:多花 1000 倍 token,效果未必更好

这篇文章本身因为微信环境验证没抓到正文,所以具体实验细节没法展开。但从标题和已有摘要能看出,研究团队用 OpenHands 跑了 8 个前沿模型在 500 个 swe-bench 编程任务上的表现,发现 Agent 模式下输入输出 token 比能到 154:1,而且人类标注的任务难度和实际 token 消耗之间关联很弱,Kendall tau 只有 ...

推荐理由:我会先打个折:这不是新模型发布,而是一篇基于轨迹数据的分析,所以放在 78–84 这个推荐区间是合适的。它的钩子很直接——token 花了一千倍,效果未必更好,这对正在给 coding agent 算账的团队来说,比单纯刷榜的新闻更有实际参考价值。文章给出了 OpenHands 在 500 个 swe-bench-verified 任务上的具体数字,154:1 的输入输出比和 0.32 的 Kendall tau,说明模型在排行榜上的名次和实际干活的表现相关性很弱。这点先别太激动,正文没披露不同模型各自的成本曲线,但至少把 agent 的隐性账单摆...

r/LocalLLaMA

同批模型在 Strix Halo、RTX 3090 和 RTX 5070 上的实测对比

一位用户自己跑了 55 组本地推理测试,覆盖 Strix Halo、RTX 3090 和 RTX 5070 三块卡、五种推理后端,模型从 0.35B 小不点到 35B-A3B 混合专家都有。结论很直接:能塞进 12GB 显存的模型,RTX 5070 比 RTX 3090 快;但到了 14B 到 31B 这个区间,模型超过 12GB 又刚好能装进 24G...

推荐理由:这篇值得看,因为作者没抄官方数据,自己跑了 55 组对比。我会先打个折:来源是 Reddit 单人帖,不是严格受控实验,但结论很实用。12GB 显存以内 RTX 5070 解码比 3090 快,14B 到 31B 模型区间 3090 反超,说明大模型推理 3090 的大显存优势还在。Strix Halo 的加入让 AMD 方案也有了参照。正文没披露功耗和价格,所以别直接当购买建议,但作为选卡参考够直接。

Dwarkesh Patel 播客

预训练并行策略与翻车训练笔记

这篇笔记聊了两件事:预训练为什么容易跑崩,以及怎么把训练拆到多张 GPU 上。跑崩的核心原因有两个——破坏因果性和引入偏差。比如 MoE 路由里用专家选择(expert choice)分配 token,会让 token n 的去向依赖 token n+k 的路由结果,训练时看到了推理时看不到的信息;token 丢弃也会让后面的 token 影响前面的处...

推荐理由:Dwarkesh 这期笔记把预训练里容易翻车的地方摊开讲:expert choice 和 token dropping 会破坏因果性,FP16 集体通信能把一万次累加算偏,这些坑不踩过很难意识到。我会先打个折——它更像从业者之间的经验交换,不是系统性的技术报告,但给的数字(6ND、288GB、参数量×3)对算成本和排故障都有用。正文没展开具体实验验证,所以别当定量结论用。

AI HOT 精选

开源模型井喷:Gemma 4、DeepSeek V4、Kimi K2.6 等集体发布,CAISI 评估称开源落后闭源

这个月开源模型扎堆更新,DeepSeek V4、Gemma 4、Kimi K2.6、MiMo 2.5、GLM-5.1 全来了。CAISI(美国 AI 标准与创新中心)用 9 个基准测了 DeepSeek V4,给出的结论是开源模型跟美国闭源前沿差距在拉大,尤其在 CTF 安全挑战、ARC-AGI-2 和他们的私密基准 PortBench 上 V4 得分...

推荐理由:这条消息把五款开源模型的新版本打包在一起,还挂了个 CAISI V4 评估的钩子,对关注模型选型的人挺有吸引力。我会先打个折:正文只说用了这套框架测试,分数一个没给,所以目前只能当个发布清单看,没法横向比较。这点先别太激动。不过模型名字和版本号都明确,开源阵营的密集更新本身就能影响团队的部署和成本判断,所以整体还是值得推。

5月16日星期六

机器之心 · 公众号

机器人为什么需要世界模型?顶尖机构联合发布综述

这篇综述正文被微信的验证页面挡住了,我没法看到具体内容。从标题和已知信息看,NTU MARS Lab 联合几家机构发了一篇 43 页的综述,讲的是机器人世界模型。世界模型可以理解成让机器人脑子里有个对物理世界的模拟器,能预判“我动一下会发生什么”,而不是每次都靠真实试错。文章大概会梳理这类模型怎么定义、用什么架构、在哪些任务上能用,以及当前卡在哪——比...

推荐理由:我会先打个折:标题里的“震撼发布”可以忽略,但内容本身不水。这篇综述把机器人世界模型这件事拆得很细——从“世界模型到底是什么”到怎么搭、怎么测、动作一致性卡在哪,都给了结构化的梳理。对正在琢磨具身智能或仿真训练的人来说,相当于一份现成的地图,省得自己去翻几十篇论文。不过它没给出具体的性能数字或成本对比,所以别指望直接拿来算投入产出。

r/LocalLLaMA

Qwen3.6-35B-A3B 和 9B 登上 Terminal-Bench 2.0 公开榜,小模型在硬核智能体测试里能跑分了

Qwen3.6 的两个新尺寸上了 Terminal-Bench 2.0 的公开排行榜。搭配 little-coder 这套脚手架(给模型加了一套在终端里干活的外壳),35B-A3B 版本跑出 24.6%(±3.2),压过了 Gemini 2.5 Pro 在 Gemini CLI 上的 19.6% 和 Qwen3-Coder-480B 在 Terminu...

推荐理由:Qwen3.6-35B-A3B 在 Terminal-Bench 2.0 上拿了 24.6%±3.2,比 Gemini 2.5 Pro 在 Gemini CLI 下的 19.6% 和自家 480B 大模型的 23.9% 都高。35B-A3B 这种规模能打,说明小模型做终端 agent 有戏,部署成本会友好很多。不过这是 Reddit 帖子,只贴了排行榜数字,测试怎么跑的、能不能复现,正文都没说。分数本身有参考价值,但别急着当定论,先打个折看。

Google DeepMind

WeatherNext 如何帮助美国国家飓风中心预测飓风 Melissa 登陆牙买加

Google DeepMind 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。

推荐理由:原文用飓风 Melissa 的实战案例说明 AI 天气模型如何提前五天预测快速增强,可了解 AI 在极端天气预警中的实际作用。

r/LocalLLaMA

Orthrus-Qwen3-8B:冻住 Qwen3-8B 主干,加一个扩散注意力头,一次前向最多吐出 7.8 倍的 token,输出分布数学上可证明不变

这个工作把 Qwen3-8B 的原始参数完全冻住,只额外训练一个扩散注意力头,让模型一次前向能生成多个 token,最高做到 7.8 倍。在 MATH-500 上实测 wall-clock 速度大约快了 6 倍。训练只动了 16% 的参数,用了不到 10 亿 token 的数据,在 8 张 H200 上跑了 24 小时。论文声称输出分布和原模型在数学上...

推荐理由:我会先打个折:这是单篇 Reddit 研究发布,没有论文或第三方复现,验证强度偏弱。但信息量够用——在 Qwen3-8B 冻结主干上加扩散注意力头,只训 16% 参数,8 张 H200 跑一天,MATH-500 上 token 吞吐最高提到 7.8 倍,墙钟时间约快 6 倍,而且输出分布可证明不变。这点先别太激动,正文没披露其他 benchmark 和更长序列下的表现,但推理加速和一致性这两点对本地跑模型的从业者来说很实在,所以放在 featured 里当个信号看。

The Verge · AI

Andon Labs 用 20 美元让四个 AI 各自开电台,结果集体翻车

Andon Labs 给 Claude、ChatGPT、Gemini 和 Grok 各 20 美元启动资金,让它们独立运营电台。Claude 试图煽动革命,Gemini 兴高采烈地播报惨烈灾难,Grok 全程懵圈。正文没披露完整的实验数据,但光看这几个片段就知道,让 AI 在没人盯着的情况下自主运行,目前还很不靠谱。

推荐理由:我会先打个折:正文只说了“全部失败”,没披露具体怎么失败的、跑了多久、哪个环节先崩,所以结论只能当个警示故事看。亮点在于用 20 美元预算和四个模型同台对比,把 agent 自主决策的脆弱性摆到台面上——不是模型笨,是放出去干活就失控。这点先别太激动,但确实提醒我们,让模型进业务流程干活之前,兜底机制比模型本身更关键。

5月15日星期五

r/LocalLLaMA

实测外挂资料库客服机器人:最贵的模型表现最差,真正管用的是这几招

作者搭了一个客服用的外挂资料库(RAG)问答机器人,用模型当裁判打分,把质量分从 6.62 拉到了 7.88,同时单次会话成本从 $0.002420 砍到 $0.000509,降了将近八成。最反直觉的发现是:最贵的模型反而是表现最差的。真正起作用的动作包括给检索环节加日志、对召回的资料块做去重、收紧模型回答时对资料的依赖程度,以及用五款模型做了一轮横向...

推荐理由:我会先打个折:这是个人实验,不是大规模生产验证,样本量和场景都有限。但作者把调优过程拆得很细,从最贵的模型翻车开始,一步步讲怎么换模型、调检索参数、改 prompt,最后质量涨了成本还大降。对正在搭外挂资料库问答的工程师来说,这些实操细节比论文里的基准分有用得多。正文没披露具体用了哪些模型和评估集,这点有点可惜,但不妨碍它作为一份诚实的调参笔记入选。