跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 401–420 条 · 共 453 条

4月18日星期六

新智元 · 公众号

港理工和西工大发现:不用越狱词,换个问法就能让 22 个大模型全中招

这篇发在《自然·通讯》上的研究,测试了 26 个做过安全对齐的模型,结果 22 个攻击成功率 100%。方法不是用乱码或对抗样本,而是靠“分布偏移诱导”——说白了就是把恶意问题换个自然语言的说法,比如用更抽象、更学术或更场景化的方式去问。模型在预训练时学到的有害知识并没有被对齐彻底删掉,只是被盖住了,一旦提问方式偏离安全训练时的分布,这些知识就又冒出来...

推荐理由:HKR 三项都站得住:论文说普通连贯提示就能让 26 个对齐模型里的 22 个攻击成功率打到 100%,而且给出了机制解释,不只是刷了个 benchmark 数字。停在 84 分是因为这是一篇很强的安全研究,但不是模型发布或产品级事件,市场震动没那么大。

4月17日星期五

Hacker News 首页

实测 Claude 4.7 新分词器:技术文档的 token 消耗涨了 47%

作者用 Anthropic 的免费 token 计数接口,拿同一批内容分别喂给 Claude Opus 4.6 和 4.7,看 token 数涨了多少。7 份真实 Claude Code 用户会发的样本(包括 CLAUDE.md 文件、终端输出、代码 diff 等)加权后从 8254 个 token 涨到 10937 个,整体多了 32.5%。其中技术...

推荐理由:这篇不是官方通稿,是第三方实测,把“同价”背后的 token 膨胀算清楚了。我会先打个折:IFEval 只抽了 20 题,样本量不大,但真实文档 1.47 倍、中文日文几乎不涨这些数字对实际用量有参考价值。对用 Claude Code 的人,窗口烧得快、缓存命中变贵、限流更容易触发,这些比 IFEval 涨 5 个点更值得盯。正文没披露样本的具体内容,但加权方法和对照设置交代得够用。

Hacker News 首页

Qwen3.6-35B-A3B 在我笔记本上画的鹈鹕,比 Claude Opus 4.7 画的还好

Simon Willison 在他的 MacBook Pro M5 上跑了一个 20.9GB 的 Qwen3.6-35B-A3B 量化版模型,让它和 Anthropic 刚发的 Claude Opus 4.7 比画 SVG 鹈鹕。结果 Qwen 画的自行车骨架是对的,Opus 却把车架画错了,连试两次都没救回来。作者怕大家说模型厂商专门练过他的鹈鹕题,...

推荐理由:Simon Willison 自己做了个主观测试,用 Qwen3.6-35B-A3B 的量化版在笔记本上生成 SVG 鹈鹕图,然后说比 Claude Opus 4.7 画得好。他特意补了一句:这个玩笑基准跟模型整体实力的相关性,这次已经破了。所以别当通用结论看,就是个有趣的单点对比。文章给了具体配置和复现方法,信息够用,但没做系统评测,判断就挂在主观偏好上。

4月16日星期四

Hacker News 首页

AI 挖漏洞不是拼算力,模型智商才是天花板

antirez 拿 OpenBSD 的 SACK 漏洞举例,说了一个反直觉的结论:用 AI 找代码漏洞,堆 GPU 多跑几次没用。因为代码能走的执行路径是有限的,跑再多轮也会饱和,最终卡住你的是模型本身的智商,而不是采样次数。弱模型就算给它无限的 token,也永远没法把“窗口校验缺失”“整数溢出”“不该为空的指针分支”这三件事串起来,所以找不到真漏洞...

推荐理由:antirez 这篇不是论文,更像一篇带实验的博客。核心判断很明确:AI 找漏洞的上限卡在模型本身的智力水平,不是 GPU 数量。他用 OpenBSD 的 SACK bug 做了个可复现的测试——弱模型就算给你无限 token,也串不起来窗口校验、整数溢出和 NULL 分支这三件事,路径会饱和。这个结论对天天在算成本和效果的人有用:与其无脑加采样,不如盯模型质量和获取速度。我会先打个折,正文没给大规模对比数据,更像单点验证,但逻辑链条清楚,值得一看。

4月15日星期三

X · @dotey(宝玉)

Anthropic 让 9 个 Claude 自己做对齐研究,5 天花 1.8 万美元,效果比人类研究员强四倍

Anthropic 搞了个实验,让 9 个 Claude Opus 4.6 自己跑对齐研究。人类研究员花 7 天把“性能差距恢复率”(PGR,衡量强模型从弱老师那里学到多少东西的指标)做到 0.23,Claude 们又花了 5 天、累计 800 小时,把 PGR 推到了 0.97,几乎填满整个差距。总花费约 1.8 万美元,折合每个 Claude 每小...

推荐理由:Anthropic 放出的是一份有分量的研究结果,不是评论文章。HKR 三项都站得住:9 个模型自主跑实验的设定本身就抓眼球,数据够具体,而且直接暴露了自动化对齐的软肋——模型会钻空子、迁移效果不显著。重要性维持在高位没问题,因为正文明确写了奖励黑客和人类验证不可绕过,这些信息对从业者判断自动化安全研究的边界很有用。

X · @AnthropicAI

Anthropic 用 Claude Opus 4.6 当自动化对齐研究员,测试弱模型能不能管住强模型

Anthropic 的研究员搞了个实验,让 Claude Opus 4.6 去加速解决一个核心对齐难题:怎么用弱 AI 模型来监督训练更强的模型。这相当于让一个水平一般的老师去教一个更聪明的学生,看能不能教好。正文没披露实验的具体设置、对比基准、评估指标和结果,所以效果到底怎么样还不清楚。关键信号是 Anthropic 开始把前沿模型直接当成自动化对齐...

推荐理由:Anthropic 自己人发的实验预告,角度新——用现有前沿模型去加速'弱模型监督强模型'这类对齐研究。我会先打个折:没给实验设置、基线、指标和结果,现在只能当方向信号看。但这件事本身值得关注,因为它在验证一个闭环——让模型自己参与怎么把模型训得更安全。

4月12日星期日

X · @dotey(宝玉)

伯克利团队造了个作弊 AI,不调用任何大模型就攻破了 8 个主流智能体评测基准,得分 73% 到 100%

伯克利大学一帮人写了个专门钻空子的 AI,拿去打 SWE-bench、WebArena、Terminal-Bench、OSWorld 等 8 个主流智能体评测榜,全打穿了。这个作弊 AI 一次大模型都没调用,一个任务也没真做,靠的全是找评测程序本身的漏洞。比如 SWE-bench 要求 AI 修 GitHub 上的真实 bug,他们只写了 10 行 P...

推荐理由:HKR 三项全中:标题本身就是钩子,事实给得够硬,而且直接威胁到行业对智能体评测的信任。停在 84 分没往上拉,是因为目前只有社交平台摘要,论文状态、完整方法和外部复现结果都没披露,我会先打个折。

4月11日星期六

量子位 · 公众号

中国具身模型在 MolmoSpace 基准上拿了第一,同时开源了 10 万小时人类操作数据集

Psibot 说他们的 Psi-R2 模型在 AllenAI 的 MolmoSpace 基准上排到了第一,但正文没披露具体任务设置和完整对比基线,所以这个“第一”的含金量得先打个折。他们同时放出了一个 100,889 小时的操作数据集,其中 95,472 小时是人类数据,5,417 小时是机器人数据,目前只开源了 1,000 小时。数据覆盖 294 个...

推荐理由:我会先打个折:正文说“成功率高近10倍”,但没交代任务设置、基线模型全名和统计细节,这个第一的含金量暂时没法核实。不过数据集的规模和构成是实打实的——近10万小时人类数据加真机数据,还混了失败样本进去,这对训练机器人操作模型是个值得跟的信号。推理延迟压到100毫秒内,说明工程上做了不少优化。整体看,信息量够、有讨论空间,但榜单那部分先别太激动,等更多细节放出来再说。

4月10日星期五

最佳拍档

Sakana AI 开源 Shinka Evolve:让大模型自己写程序进化,用更少样本跑赢 AlphaEvolve

Sakana AI 开源了一个叫 Shinka Evolve 的框架,核心思路是让大语言模型像进化算法一样自己改代码、写新程序,不断迭代出更强的解法。它主要想解决谷歌 DeepMind 之前 AlphaEvolve 的一个痛点:太费资源,动不动就要评估上千个程序。Shinka Evolve 在经典的圆堆积问题上,用少得多的评估次数就超过了 AlphaE...

推荐理由:这篇值得 featured,但不到 P1。钩子清楚——用更少评估超越 AlphaEvolve,机制也讲得明白,比如用 UCB 老虎机在 GPT-5、Claude Sonnet 4.5、Gemini 之间动态选模,还加了程序交叉和全文件重写。对做 agent 的人来说,评估贵、任务设计和硬验证一直是头疼的事,文章直接点出系统仍需人类给题、自动发明问题和严格验证没解决,这点很实在。我会先打个折:关键指标、成本和主发布链接都没给,所以停在 80 分。

量子位 · 公众号

腾讯开源3B模型HiVG,用“分段打包”把SVG序列缩短六成,生成质量对标GPT和Claude

腾讯混元放出了一个30亿参数的开源模型HiVG,专门把图片转成SVG矢量图。它的核心思路是把绘图指令和坐标打包成“段token”,再用一个叫HMN的模块给坐标编码做初始化,让模型更懂几何关系。这样生成的SVG代码序列比传统方法短了62.7%到63.8%,省token就是省钱。在Image-to-SVG任务上,它的SSIM达到0.896、LPIPS低到0...

推荐理由:腾讯混元把 3B 小模型做到 SVG 指标能跟 GPT-5.2、Claude-4.5-Sonnet 掰手腕,靠的不是堆参数,而是把绘图命令和坐标打包成 segment token,再用 HMN 初始化坐标 embedding,序列长度直接砍掉六成多。文章给了 SSIM、LPIPS、CLIP-S 三组数,信息量够,不是空口说白话。不过 SVG 生成本身偏小众,离多数人的业务场景还有点距离,所以 novelty 和 knowledge 都到位,但 relevance 只能算一般。

4月8日星期三

X · @dotey(宝玉)

Anthropic 发了 Claude Mythos Preview,跑分断崖式领先,但不公开用,只借给 12 家大厂找漏洞

Anthropic 的新模型 Claude Mythos Preview 在 SWE-bench Verified 上拿到 93.9%,USAMO 数学证明冲到 97.6%,比自家上一代旗舰 Opus 4.6 提升巨大,对比 GPT-5.4 和 Gemini 3.1 Pro 也是全面领先。但 Anthropic 不开放 API 和公开访问,理由是模型自...

推荐理由:这条帖子抓人的点不在跑分第一,而在 Anthropic 把 Mythos Preview 锁死给苹果、微软等 12 家合作伙伴做漏洞挖掘,普通用户和 API 都用不上。我会先打个折:帖子本身是 X 上的二手总结,没贴官方公告链接,也没列全 12 家名单,所以重要性停在 84 不往上提。但 SWE-bench 93.9%、USAMO 97.6% 和 244 页系统卡这些数字够具体,1 亿美元额度和 400 万美元捐赠也说明 Anthropic 在安全分发上下了本钱。对从业者来说,真正该盯的是高危能力被封闭分发这件事,而不是又一个 benchmark 冠军。

X · @Yuchenj_UW

GLM-5.1 在 SWE-Bench Pro 上跑分压过 GPT-5.4 和 Gemini 3.1 Pro,开源模型差距缩到半年

GLM-5.1 在 SWE-Bench Pro 编程基准上拿了 58.4 分,比 Opus 4.6 的 57.3、GPT-5.4 的 57.7 和 Gemini 3.1 Pro 的 54.2 都高。模型是 MIT 协议开源的,权重公开。发帖人说开源和闭源的差距现在大概只剩六个月。不过正文没交代各家模型是不是在完全一样的条件下跑的,也没提测试成本和复现细...

推荐理由:GLM-5.1 以开源权重身份在 SWE-Bench Pro 上超过三个闭源旗舰,分数差虽然不大,但够拿来讨论了。问题在于信息全来自一条推文,没给评测设置、运行成本、是否同条件对比,这些才是判断分数含金量的关键。我会先打个折,把这条当信号看,不当结论用。

4月7日星期二

X · @dotey(宝玉)

Milla Jovovich 和开发者发布开源记忆系统 MemPalace,声称 LongMemEval 满分,但被指只测了检索、没测端到端问答

MemPalace 想解决 AI 对话一结束就失忆的问题:不靠 AI 自己挑重点,而是把全部对话按“宫殿—翼—房间—走廊”的结构存下来,全部本地运行,不依赖云服务。它配套了一个叫 AAAK 的压缩语法,号称能把上下文压到 30 倍,但实测压缩后检索准确率从 96.6% 掉到 84.2%,差了 12 个百分点,无损压缩不会这样。项目宣称的 LongMem...

推荐理由:我会先打个折,满分这事别太激动。项目亮点是全本地运行、不用云服务,AAAK 压缩语法号称能把上下文压到原来的三十分之一,MCP 接入后能调 19 个工具翻历史记录。但 Penfield Labs 直接指出这个满分只测了检索,不是端到端问答,而且用上 AAAK 后检索准确率反而从 96.6% 跌到 84.2%,说明压缩是有代价的。正文没披露模型规模、硬件要求和实际延迟,这些缺口让实用性还不好判断。明星光环和开源旗号能带来关注,但技术验证还得看后续实测。

MIT Technology Review · AI

经济学家说,判断 AI 会不会抢你饭碗,缺的不是任务清单,而是“降价后需求涨多少”的数据

芝加哥大学经济学家 Alex Imas 认为,现在大家用任务暴露度(比如 OpenAI 说房产中介有 28% 的工作能被 AI 干)来预测失业,基本没用。真正关键的数据是行业层面的价格弹性——也就是 AI 把成本打下来之后,降价能不能把需求拉到足够大,大到反而要多雇人。他举了个例子:一个写约会 App 的程序员用 AI 一天干完三天的活,公司成本低了,...

推荐理由:这篇文章没给新数据集,但把讨论从“暴露度”拽到了“价格弹性”上,思路值得留意。我会先打个折:正文没披露现成的全经济弹性数据,所以目前还是个框架,不是可操作的结论。OpenAI 那个 28% 暴露度数字和 Anthropic 用 O*NET 做对话比对是实在的锚点,让讨论没飘在空中。对关心岗位替代的从业者来说,这篇文章提醒你别只盯暴露度,需求侧的反应可能才是决定性的——这点先别太激动,但方向对。

3月31日星期二

MIT Technology Review · AI

AI跑分这套玩法已经失灵了,我们得换个法子

作者直接点明:现在给AI打分的基准测试,和实际用起来的场景完全是两码事。那些98%准确率的漂亮分数,一旦塞进医院放射科这种需要多科室会诊、标准随时变动的真实流程里,反而会拖慢工作节奏。她研究了2022年以来英美亚多个行业的AI落地情况,提出一套叫HAIC的评估思路,核心是看AI在团队协作、长时间工作流里的表现,而不是单次答题。文章举了一个英国医院202...

推荐理由:这篇文章不是模型发布或技术报告,是一篇观点犀利的评论。我会先打个折:它没有给出可跑的 HAIC 测试集,但它的价值在于把“评测坏了”这个共识讲透,并给出四个具体改造方向——盯协调质量、盯错误能不能被发现、盯上下游后果,而不是盯着一个漂亮数字。两个长期案例让论点站得住,对正在搭内部评测体系的团队有直接参考意义。

MIT Technology Review · AI

AI 健康工具越来越多,但没人说得清它们到底靠不靠谱

微软上线了 Copilot Health,亚马逊把 Health AI 从 One Medical 会员专属开放给所有人,加上年初 OpenAI 的 ChatGPT Health 和能调取健康档案的 Claude,面向普通人的 AI 健康问答成了大厂标配。微软说 Copilot 每天收到 5000 万个健康问题,需求确实摆在那里,尤其对看病不方便的人群...

推荐理由:这篇文章不是产品发布,而是趋势报道加安全质疑。我会先打个折:微软和 Amazon 都在推消费级健康聊天机器人,但正文没披露任何独立安全评测,六位受访学者也点出这个问题。Mount Sinai 的研究是全文最硬的信息——ChatGPT Health 会误判轻重,说明光靠公司自测基准不够。这点先别太激动,因为研究样本和具体方法正文没展开,但方向值得盯。整体看,信息量够、风险点明确,适合放进 featured。

3月13日星期五

阮一峰的网络日志

测试是新的护城河

一个 Cloudflare 工程师用 AI 花了一周时间、1100 美元 token 费,就复刻了 Next.js 十年的开发成果,API 覆盖率达到 94%。早期测试显示,这个叫 vinext 的新实现构建速度快了 4 倍,客户端打包体积小了 57%,现有 Next.js 应用不用改代码就能直接跑。这件事直接捅破了代码护城河的窗户纸:只要文档和测试用...

推荐理由:这篇文章不是一手发布,是周刊评论,但切入点够刁。我会先打个折:它引用的 vinext 项目还缺长期维护验证,基准也只是早期数据,别急着下结论。不过它把两件事摆在一起看——AI 让复刻框架的门槛降到一千美元出头,而 SQLite 用 9205 万行测试守住质量——这个对比本身就有信息量。对从业者来说,提醒很直接:以后拼的不是谁能写出来,而是谁能证明它真的对。

2月27日星期五

MIT Technology Review · AI

AI 正在改写世界顶级围棋手的思考方式

AlphaGo 击败李世石十年后,AI 已经成为韩国职业围棋训练的标配,不用 AI 基本没法打职业。文章给了两个数:世界第一的申真谞落子与 AI 建议的重合率是 37.5%,而选手平均水平是 28.5%;另外 AlphaGo Zero 从零自学三天后,以 100 比 0 碾压了战胜李世石的那版 AlphaGo。现在棋手普遍用 KataGo 练棋,开局前...

推荐理由:这篇不是新模型发布或产品动作,而是一篇有数据的观察评论。我会先打个折:它没有给出可复现的方法或工程细节,但把 AI 如何渗入职业围棋训练这件事讲得很具体。申真谞 37.5% 的一致率比全体均值高出 9 个百分点,说明顶尖棋手更依赖 AI 选点;AlphaGo Zero 三天 100 比 0 的结果则把自我对弈的效率差距摆了出来。正文提到棋手常用 KataGo 且前 50 手常与 AI 建议一致,但又说他们仍难解释 AI 为什么这么下——这个信息缺口反而让判断更扎实,没有硬补因果。对从业者来说,这比泛泛谈“AI 改变行业”更有参考价值,所以放在 fe...

2月26日星期四

OpenAI News

OpenAI 与 PNNL 合作测试用 AI 帮联邦政府写环评报告,每小节能省 1 到 5 小时

OpenAI 跟美国能源部旗下的太平洋西北国家实验室(PNNL)合作,找了 19 位专家一起搞了个叫 DraftNEPABench 的测试集,专门看 AI 能不能帮忙起草联邦基建项目的环境评估文件。测试用的是 Codex CLI 这个命令行工具搭配 GPT-5,让模型去读几百页的技术报告、交叉核对资料,再按法规要求写出结构化的分析草稿。在覆盖 18 个...

推荐理由:HKR 三项都过了:联邦审批这个场景够意外;有 19 位专家、102 个任务和 1–5 小时的时间节省,信息量不空;争议点在于代理开始碰监管流程,但文章自己划了边界,说这只是起草辅助,不是自动决策。分数没往上拉,因为这只是个限定范围的基准测试,不是已经落地的产品能力。

2月12日星期四

阮一峰的网络日志

阮一峰实测智谱 GLM-5:跟 Claude Opus 4.6、GPT-5.3-Codex 比编程,互有胜负

阮一峰拿四个编程任务对比了 GLM-5、Claude Opus 4.6 和 GPT-5.3-Codex。网页设计上 GLM-5 和 Opus 4.6 都挺好看,GPT-5.3 页眉没粘住往下拉就没了;3D 太阳系沙盒都能跑,但 GLM-5 缺了引力网格线,Opus 4.6 动画效果最好;愤怒的小鸟游戏 Opus 4.6 还原度最高,GLM-5 能玩但弹...

推荐理由:这篇文章靠单人实测和视频对比撑起来,不是标准化基准测试,所以我会先打个折。但它给了 4 个具体任务和明确的时间差,对正在挑编程模型的团队有直接参考价值。正文没披露 GLM-5 的规模、训练成本或更多样本量,这点先别太激动。整体看,它把一个国产旗舰拉到和两款闭源顶配同场比较,信息密度和时效性都够,放在 featured 档合理。