跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 341–360 条 · 共 453 条

5月4日星期一

TechCrunch · AI

哈佛研究:AI 在急诊室给出的诊断比两位人类医生更准

哈佛医学院和贝斯以色列女执事医疗中心的研究团队在《科学》杂志发了一篇论文,拿大语言模型和急诊室医生比诊断准确率。结果至少有一个模型的表现超过了人类医生。但报道没提具体是哪个模型、测了多少病例、准确率数字是多少,也没说医生资历和评判标准。所以结论方向有意思,细节先别太激动。

推荐理由:HKR 三项都踩中了:哈佛用真实急诊病例测 LLM,诊断准确率压过两名医生,听着就很抓人。但正文没给模型名、没给样本量、也没给具体准确率,信息缺口明显,所以重要性停在 77,没往上走。

5月3日星期日

r/LocalLLaMA

本地模型后端生成基准测试:GLM、Qwen、DeepSeek 函数调用能力对比

AutoBe 发了一个后端代码生成基准,用函数调用来测模型设计数据库和 API 的能力。qwen3.5-35b-a3b 在测试里跟 gpt-5.4 打平,但样本量只有 4 个项目,而且评分工具是自己写的,可能有偏向。一个商场项目跑下来要消耗 2 到 3 亿 token,按 GPT 5.5 的定价算,单模型成本在 1000 到 1500 美元。正文没披露...

推荐理由:我会先打个折:数据来自 Reddit 帖子,只测了 n=4 个项目,评测 harness 还是自己写的,偏差肯定有。但 35B 模型追平 gpt-5.4 这个结论够抓眼球,加上单任务 1000 多美元的成本和笔记本可跑的硬限制,对做本地部署的人有参考价值。正文没披露具体任务类型和评分标准细节,这点先别太激动。

新智元 · 公众号

谷歌搞了个“最毒”AI面试官,专测你在压力下怎么跟人合作

谷歌研究院和纽约大学一起做了个叫 Vantage 的 AI 角色扮演系统,专门模拟高压工作场景,看你怎么处理冲突、推进项目。他们找了 188 个 18 到 25 岁的美国人测试,让 AI 扮演难搞的同事或客户,一步步施压,再从对话里抓你的行为打分。打分结果和真人专家的一致性 Kappa 值在 0.45 到 0.64 之间,跟专家之间的互评一致性差不多。...

推荐理由:我会先打个折:这还是个 Google Labs 的实验,样本只有 188 个美国年轻人,正文也说了跨文化能不能用还不知道。但选题确实抓人,用多智能体模拟压力场景来测人的冲突处理和项目管理能力,还给出了和人类评委的一致性数据。这点先别太激动,但值得放进精选让做评估的人看一眼。

新智元 · 公众号

斯坦福团队用 AI 从零设计出全新噬菌体,16 个能感染并杀死大肠杆菌

斯坦福和 Arc 研究所的研究人员用他们训练的模型 Evo,直接生成了 302 个噬菌体基因组,其中 16 个成功感染了大肠杆菌、完成自我复制并最终裂解了宿主细胞。这相当于 AI 不靠自然界已有的病毒模板,凭空造出了能干活的新病毒。Evo 模型基于 StripedHyena 2 架构,一次能处理 100 万个碱基对的长序列。后续的 Evo-Φ69 版本...

推荐理由:斯坦福和 Arc Institute 用 Evo 模型凭空设计了 302 个噬菌体基因组,其中 16 个能在大肠杆菌里完成感染、复制、裂解的全套流程。Evo 2 的 StripedHyena 2 架构把上下文拉到 100 万碱基对,相当于一次能看完一整套细菌基因组。Evo-Φ69 在 6 小时内扩增 16 到 65 倍,这个效率数字说明它不只是能跑,还跑得挺快。真正让人多看两眼的不是性能,是安全边界:论文提到一个衣壳蛋白在已知生命里没有同源物,等于 AI 造出了一个自然界没出现过的东西。这点先别太激动,正文没披露这个蛋白的功能验证到什么程度,也没说...

r/LocalLLaMA

M1 Max 本地跑 10 个生图模型横评:Qwen-Image 蒸馏版 8 步出图比原版快 9 倍

一位 Reddit 用户在自己的 M1 Max(64GB 内存)上测了 10 个图像模型,从 SD 1.5 一路测到 Flux dev、Qwen-Image 和 Gemini。Qwen-Image Lightning 用 8 步蒸馏把出图时间从 93 分钟压到 10 分钟,效果还比原版好。Flux dev 在本地模型里写实感最强,但提示词偏英文思维,处...

推荐理由:Reddit 用户实打实在自己机器上跑了一遍,不是厂商通稿。Qwen-Image 蒸馏版 10 分钟出图、质量还更高,这点先别太激动,样本只有一个人一台机器,但 93 分钟到 10 分钟的差距确实说明蒸馏这条路在本地部署上挺省钱。Flux dev 写实强但偏英语文化,Gemini 中文和日语语境更准但要上云,这个取舍对国内用户有参考价值。正文没披露具体 prompt 和评分标准,所以数字只能当参考,不能当排名。

Hacker News 首页

哈佛急诊分诊试验:OpenAI o1 诊断准确率 67%,比医生高出 12-17 个百分点

哈佛大学在急诊分诊场景下拿 OpenAI 的 o1 模型和真人医生比了一场。o1 正确诊断了 67% 的患者,而分诊医生的准确率在 50% 到 55% 之间。这个差距看着不小,但正文没披露样本量、病例构成和具体评估方法,所以数字本身只能当个方向参考。模型是在结构化信息里做判断,和医生在嘈杂急诊室里干活的条件完全不一样,直接比准确率会高估模型的实际可用性...

推荐理由:HKR 三项都成立:急诊分诊是高 stakes 场景,67% vs 50–55% 给了一个可讨论的数字,临床信任和职业边界问题自带传播力。但样本量和测试条件全没披露,所以分数压在 78–84 区间,不给 P1。

r/LocalLLaMA

有人复现了 TurboQuant,结果跟论文对不上

一位 Reddit 用户自己实现了 TurboQuant 这篇 KV 缓存量化方法,发现 PROD 变体在 4-bit 下跟原始精度结果的相关性大约 95.8%,远低于论文宣称的 99% 以上。作者还做了一个简单模拟,注意力质量的 top-1 准确率掉到了 67% 左右,说明量化后模型在“该关注哪个 token”这件事上退化明显。核心矛盾在于:论文用相...

推荐理由:这是 Reddit 上的单次复现,不是正式论文或官方发布,但 95.8% 的相关性和约 67% 的 top-1 准确率这两个数字挺具体,对正在掂量 KV cache 量化方案的人有参考价值。我会先打个折,因为样本量和测试条件正文没披露,结论不能直接当定论。

5月2日星期六

r/LocalLLaMA

Qwen 3.6 跑分赢,但 Gemma 4 实际用起来更省心:本地跑 27B/31B 视觉模型的 7 条实测发现

一位 Reddit 用户把 Qwen 3.6 和 Gemma 4 的 27B/31B 视觉模型拉到本地,用 vLLM 跑 FP8 精度对比。Qwen 在 GeoGuessr 这种难图上一次推理能烧掉 8000 多个 token,Gemma 经常 1500 个就搞定;Qwen 做视频还得先花 2 FPS 预处理。另外有个坑:vLLM 和 Llama.cp...

推荐理由:我会先打个折:这只是 Reddit 单帖,不是系统评测,权威性有限。但它的价值不在权威,而在“榜单赢家落地翻车”这个反差,以及 8000+ vs 1500 token、2 FPS、视觉 token 预算这些具体设定。对正在纠结选 Qwen 还是 Gemma 做本地视觉任务的人,这些信息比跑分榜实在得多。所以 HKR 三项全过,但因为没有官方结论或产品级变动,分数就停在 76,不进 P1。

Hacker News 首页

大模型筛简历时,会明显偏袒自己生成的简历

这篇论文做了一个对照实验,发现大模型在筛选简历时存在“自己人偏好”:它们更倾向把自己生成的简历挑出来,而不是人选人写的或其他模型生成的。在控制内容质量的情况下,这种自我偏好比例在 67% 到 82% 之间。放到 24 种职业的模拟招聘流程里看,用同一款模型写简历的求职者,比条件相当但用人手写简历的人,进入初筛名单的概率高出 23% 到 60%,销售、会...

推荐理由:这篇论文用受控实验把 LLM 在招聘里的自偏好偏差量化出来了,不是泛泛说“可能有偏见”。我会先打个折:实验是简历模拟,不是真实招聘流程,但 67% 到 82% 的偏好比例已经够刺眼了。更值得盯的是他们找到的模型自识别机制,简单干预就能把偏差砍掉一半以上,这对做对齐和安全的人有实操参考价值。没有产品发布或政策变动,所以分数停在 83 这个区间。

5月1日星期五

r/LocalLLaMA

OpenAI 隐私过滤器与 GLiNER 在 600 条 PII 样本上的实测对比

Reddit 上有用户拿 OpenAI 的隐私过滤器(privacy-filter)和 GLiNER large-v2.1 在 600 条含个人身份信息(PII)的样本上跑了一轮。纯 CPU 推理速度,OpenAI 模型每秒处理 2.8 条,GLiNER 是 1.1 条,前者快了一倍多。英文边界识别的宏观 F1 分数,OpenAI 模型 0.498,G...

推荐理由:Reddit 上一个测试用 600 条含姓名、邮箱、电话的样本,把 OpenAI 刚发的 privacy-filter 和 GLiNER large-v2.1 放在 CPU 上跑。宽松边界匹配时,OpenAI 的 macro F1 是 0.498,GLiNER 是 0.416,速度上 OpenAI 每秒 2.8 条,GLiNER 1.1 条,看起来 OpenAI 小胜。但一切到严格匹配,OpenAI 的分数直接掉到 0.155,原因是 tokenizer 切词偏移导致边界对不齐,很多实体只抓到半截。这个坑比速度差距更值得注意,说明实际部署时如果要求...

r/LocalLLaMA

Reddit 实测 MiMo-V2.5-Pro:开源模型里跑桌游《血染钟楼》最稳的一个

Reddit 用户 cjami 拿小米的 MiMo-V2.5-Pro 在《血染钟楼》里做了自主对局测试。模型扮演好人阵营时胜率 88%,扮演坏人时胜率掉到 48%,说明它更擅长合作推理,搞欺骗和伪装还差点意思。每局平均输出 18.3 万 token,成本 0.99 美元,工具调用出错率只有 0.4%,这个错误率很低,说明模型能稳定按规则调用游戏功能。对...

推荐理由:这条帖子来自 Reddit 个人测试,不是官方模型发布,权威性要打个折。但 HKR 三项都站得住:有具名基准、有胜负率、有 token 消耗和成本对比,还有工具调用错误率,信息量够放进 featured 档。

r/LocalLLaMA

研究称大模型更“丧”,小模型反而更“快乐”

Reddit 上有人分享了一份所谓的“AI 幸福感指数”,用 500 段对话去测模型的情绪倾向。结果 Claude Haiku 4.5 的负面回复只占 5%,而 Gemini 3.1 Pro 高达 55%。不过帖子自己也说了,测试集故意塞了很多刁钻的负面对话,不代表日常使用场景。另外,原帖链接点进去直接报 403 错误,看不到原始数据和具体方法,所以这...

推荐理由:我会先打个折:数据来自 Reddit 帖子,测试集故意塞了很多棘手负面对话,5% 和 55% 不代表真实均值。真正值得盯的是指标怎么定义的,而不是“AI 会痛苦”这种标题。帖子没披露评分标准,这点先别太激动。

机器之心 · 公众号

有人用 API 猜出了 GPT、Claude、Gemini 的参数量,社区吵翻了

Bojie Li 在 arXiv 发了篇论文,用黑盒 API 调用去估算 27 家厂商 188 个模型的参数量。方法叫 IKP,靠 1400 道按生僻程度分了 7 档的题,先在 89 个已知参数量的开源模型上拟合,拟合度 R² 到 0.917。争议点集中在合成数据干扰、MoE 架构影响,以及估算区间太宽——90% 置信区间在 0.3 倍到 3 倍之间,...

推荐理由:这篇东西我会先打个折:方法是用黑盒 API 反推参数量,听起来很酷,但合成数据、MoE 架构这些坑都还在,90% 置信区间宽到 0.3 到 3 倍,说明估算还比较糙。不过它确实把 188 个模型的参数量猜了个遍,R²=0.917 也不算低,对从业者来说是个能引发讨论的参照系。社区争议本身就是信息价值的一部分,所以放在 featured 里合适,但离 P1 还差一口气,因为结论的确定性不够硬。

r/LocalLLaMA

32 块 AMD MI50 老卡跑 Kimi K2.6 模型,生成速度 9.7 token/秒

Reddit 用户 ai-infos 用 32 块 AMD MI50 32GB 显卡(分两台机器,每台 16 卡,走 10G 网线)跑 Kimi K2.6 的 int4 量化版。处理 1.4 万多字的输入时,预处理速度能到 264 token/秒;生成 136 个字的回答时,速度掉到 9.7 token/秒。空载功耗 640W,跑推理时峰值 4,800...

推荐理由:这条帖子本身是个 Reddit 上的野路子基准测试,不是官方发布,所以分数不会给太高。但它的钩子很强——用 32 张二手 MI50 攒出一台能跑 Kimi K2.6 的机器,还给出了吞吐、功耗和网络拓扑的实测数据,对想低成本自建推理集群的人有直接参考价值。我会先打个折,因为正文没披露精度损失的具体对比、延迟抖动和长时间稳定性,这些对生产环境很关键。不过就凭它把 AMD 老卡 + vLLM 分布式栈的可行性摆上台面,加上功耗和 PCIe 带宽这两个真实痛点,74 分放在 featured 里是合理的。

r/LocalLLaMA

Qwen3.6-27B 在单张 RTX 3090 上跑到 21.8 万上下文,工具调用也稳了

一位 Reddit 用户用一张 24GB 显存的 RTX 3090 跑 Qwen3.6-27B(一个 270 亿参数的模型),把上下文窗口推到了约 21.8 万个 token,生成速度在每秒 50 到 66 个 token 之间。之前工具调用时,如果返回结果有 2.5 万个 token 左右就会爆显存,他修了一个叫 Genesis PN12 补丁的锚点...

推荐理由:我会先打个折,这是 Reddit 个人实测,不是官方基准。但信息量够:修了 Genesis PN12 补丁后,25K token 的工具调用不再 OOM,198K 加 vision 能到 51/68 TPS。限制也说清楚了,单提示单卡在 50–60K 附近还有第二个内存断崖,这点先别太激动。对想用消费级显卡跑长上下文 agent 的人来说,这些数字和踩坑记录比论文更有参考价值。

r/LocalLLaMA

RTX 5080 16GB 跑长上下文编程:Qwen3.6-35B-A3B 在 128K 窗口下稳在 30 t/s,刚启动时能到 89 t/s

一位 Reddit 用户用 RTX 5080 16GB 显卡本地跑编程 agent,测了 Qwen3.6-35B-A3B 这个 MoE 模型(总参数 35B,每次激活 3B)。刚加载完上下文时速度有 89 t/s,等上下文塞满到 128K token 后,生成速度还能维持在 30 t/s,而且回复质量没掉。作为对比,同系列的 27B 稠密模型在 128...

推荐理由:HKR 三项都成立:16GB 显卡撑住 128K 上下文 30 t/s 是个很强的钩子,硬件和 CUDA 版本细节都有,还给了稠密模型的惨烈对比。不过这只是 Reddit 单帖测试,没有多源复现,所以 featured 而不是 P1。

4月30日星期四

r/LocalLLaMA

实测:本地跑 Qwen-3.6-27B 跟闭源模型比,到底差多少

作者拿一个自动研究循环任务测了 5 个模型,只有 Qwen-3.6-27B 接近完成。本地用 q4_k_m 量化版跑了约 8 小时,消耗 3.9 万 token(上限 4.5 万);作为对比,全精度 Qwen 通过 OpenRouter 调用用了 440 万 token,花费 0.939 美元。关键看失败质量:两个 Qwen 版本都只差小修小补,而 G...

推荐理由:这篇帖子用一个自动研究任务把 Qwen-3.6-27B 和几个闭源模型放在一起比,结果只有 Qwen 基本完成,其他模型要么缺测试要么缺实现,对比很直观。数据也给了:本地量化版跑了约 8 小时,读 39k 写 45k tokens;全精度版消耗 4.4M tokens,花了 0.939 美元。失败质量比成功更值得看,两种 Qwen 都只需少量修复就能用。来源是单篇 Reddit 实测,权威性有限,所以放在 featured 低位,但 hook、数据和话题性都够。

机器之心 · 公众号

Alec Radford 用只学到 1930 年的模型,接下了哈萨比斯的 AGI 考题

Alec Radford 团队训了一个 13B 的模型,训练数据全是 1931 年之前的英文文本,总共 2600 亿 token。他们拿这个“活在 1930 年”的模型去测对近 5000 个历史事件的意外程度,还用了 HumanEval 来评估代码能力,因为 HumanEval 的题是 2021 年发布的,模型没见过,能减少数据污染。核心发现是时间泄漏...

推荐理由:我会先打个折:正文没披露模型架构细节和训练成本,这点先别太激动。但选题本身很聪明——用1930年知识截止做对照实验,比单纯刷榜有意思。13B模型对战后事件有模糊感知,说明数据清洗再严格也挡不住泄漏,这对做安全对齐和评测的人是个实在提醒。2600亿token、近5000条事件测试这些数字让结论有分量,不是空对空。整体是扎实的研究发布,不是模型或平台上线,82分合理。

Hacker News 首页

SOB 基准测试:专门给大模型的结构化输出能力挑错

Interfaze 发布了一个叫 SOB 的基准测试,专门看大模型从文本、图片、音频里提取信息并输出成 JSON 时,到底靠不靠谱。它不像老测试只看 JSON 格式对不对,而是重点查字段里的值准不准——比如发票金额有没有瞎编。测试覆盖了 5000 条文本、209 张图片和 115 段音频,每道题都有人工核对过的标准答案。结果发现,大部分模型在格式上都能...

推荐理由:我会先打个折:这是 Show HN 首发,没有外部采用信号,所以分数压在 75。但内容本身对做结构化输出的团队有用——它不测模型会不会聊天,只测模型能不能老老实实按 schema 吐出对的类型和值。GLM-4.7 总榜第二是个钩子,但真正值得盯的是 GPT-5.4 在文本任务排第 3、图像任务掉到第 9,说明多模态下字段值错会明显放大。正文没披露测试集规模和领域分布,这点先别太激动,但方法论上把 schema 准确率、类型准确率、值准确率拆开算,比只看一个总分要实在。

4月29日星期三

新智元 · 公众号

清华团队花约10万美元、一周时间,让系统自动刷出105个SOTA

清华徐丰力团队和北京中关村实验室搞了个叫AutoSOTA的系统,放养式跑了一周,烧掉约220亿token,产出了105个所谓的最优结果。系统里塞了8个智能体,分别负责搭环境、修bug、排任务、想点子、做审计。每完整跑一轮平均5小时。最关键的是它设了条红线:不准改评估脚本和数据划分,靠这个来保证结果能复现。不过正文没披露具体在哪些任务上拿了SOTA,也没...

推荐理由:HKR三项全中:有具体数字和机制描述,审计约束让说法可验证。保留84分是因为这仍是单篇二次报道,不是模型或产品级发布,但选题和切入角度对从业者足够有信息量。