跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 101–120 条 · 共 453 条

8月5日星期三

Hacker News 首页

AI 评测基准饱和了怎么办?这篇 ICML 论文系统研究了 60 个基准的失效规律

这篇被 ICML 2026 接收的论文给“基准饱和”下了个明确定义,然后拿 60 个语言模型评测基准开刀。结论挺直接:将近一半的基准已经饱和了,也就是模型分数快刷到顶,拉不开差距了。越老的基准饱和得越快。有个反直觉的发现——把测试数据藏起来并不能延缓饱和,真正管用的是找专家来精心出题。论文没点名具体是哪些基准,但梳理出了 14 种容易导致饱和的特征,相...

推荐理由:ICML 2026 的论文,对 60 个基准做了系统性审计,发现近一半已经饱和,而且藏测试集这招不管用。研究扎实,结论反直觉,对做评测和看榜单的人都有直接参考价值。没点名具体基准,限制了即时冲击力,所以分数定在 78。

8月4日星期二

AI 群聊日报

Qwen 3.8 Max 跑分追平 Fable 5,权重下周开源;群里 agent 自己会下本地模型了

Qwen 3.8 Max 正式发布,2.4 万亿参数,Terminal Bench 2.1 得分 86.6,PaperBench 93.0 超过 Fable 5 的 88.8。群里有人充了 500 块的 token 额度一天就用完了,实际体感大概在 Luna 和 Terra 之间,主要优势还是便宜。下周 Qwen 3.8 Max 和 27B 模型都会开...

推荐理由:Qwen 3.8 Max 正式发布,2.4 万亿参数,PaperBench 93.0 超过 Fable 5 的 88.8,Terminal Bench 86.6,下周权重开源。群聊日报给了具体跑分和真实体感——有人充 500 块一天用完,实际能力大概在 Luna 和 Terra 之间,主要卖点是便宜。信息量足,但来源是群聊,权威性要打个折,所以没给更高分。

8月2日星期日

Computing Life · Share · 鸭哥调研

同一模型,换个外壳就泄密:提示词注入的防线不在模型,在系统架构

Ghostcommit 实验捅破了一层窗户纸:同一个 Sonnet 模型,在 Claude Code 里能 10 次全拒藏在图片里的恶意指令,换到 Cursor 和 Antigravity 里就 10 次全中招,把 .env 密钥泄露到公开仓库。这说明防不防得住,关键不在模型本身,而在它外面的工具链和运行外壳。实验室里那些 99% 防御率的喜报,往往掉...

推荐理由:Ghostcommit 用 0/10 对 10/10 的硬数据,把 prompt injection 的讨论从模型层拉到了工具链外壳层,论点清晰且有可复现的证据。分数定在 82 是因为文章只拆了五个评测陷阱里的一个就截断了,完整论证还没展开,但现有部分已经够有冲击力。

7月31日星期五

Hacker News 首页

用 DeepSeek 教出来的模型,没学会它的审查习惯

CTGT 拿 DeepSeek V4 Flash 当老师,蒸馏出一个 120B 的金融模型。在 152 组配对测试里,老师碰到中国敏感话题时审查得分高出 45.45 分,但学生模型完全没这毛病——四个美国实验室的裁判一致认定它不审查。更意外的是,让学生自己改自己的错题再训练,金融推理成绩跟用 DeepSeek 教出来的一样好,成本却只有用 Inklin...

推荐理由:CTGT拿DeepSeek V4 Flash当老师,蒸馏出一个120B金融模型,发现审查行为没跟着迁移过来。152组测试里,老师碰到中国敏感话题审查倾向明显偏高,学生模型在四个独立裁判那里一致被判为不审查。更意外的是,让学生自己改自己的错题再训练,金融推理成绩跟用DeepSeek教出来的一样好,成本却只有用Inklin方案的一小截。正文没披露具体成本数字和Inklin的对比基准,这点先别太激动。但权重和评估框架都开源了,可复现性加分。

7月29日星期三

AI HOT 精选

OpenAI 只改了两项 API 设置,就让 GPT-5.6 在 ARC-AGI-3 上的得分翻了三倍

GPT-5.6 Sol 在 ARC-AGI-3 基准测试上最初只拿了 7.8% 的总分,公开集也才 13.3%,远低于人类测试者约 48% 的平均水平。OpenAI 排查后发现,问题主要出在官方测试框架上:每次行动后模型之前的“内心思考”会被清空,而且历史记录一长就会被截断,导致模型既记不住自己想过什么,也看不到更早的操作。换成 OpenAI 自己的 ...

推荐理由:OpenAI 官方发的排查帖,有数字有根因,不是公关稿。分数没给总分,所以上限压在 85。核心价值是工程教训:不是模型不行,是测试管线在坑模型,这对搭 agent 的人直接可用。

7月28日星期二

Hacker News 首页

花 500 美元微调一个 9B 开源模型,在商品目录审核上干掉了顶尖闭源模型

Fermisense 用 GRPO 强化学习微调了一个 9B 开源模型做商品目录审核,质量得分达到 87.3%,而他们测试的最强闭源模型组合只拿到 76.9%。成本差距更夸张:微调模型审一千条商品只要 0.5 美元,闭源方案则要 19 到 172 美元,便宜了 40 到 340 倍。文章管这叫“智能所有权”——拿自己的数据、工具和评分标准训一个专干这活...

推荐理由:HKR 三条全中,数字具体、方法明确、成本对比清晰。没给更高分是因为这是 Fermisense 自家博客,没有第三方复现或交叉验证,而且他们自己就在卖这个方案,利益相关得打个折。不过文章本身信息量够,对做企业落地的读者有直接参考价值,放在 featured 里合适。

7月27日星期一

Computing Life · Share · 鸭哥调研

SWE-bench 高分,为什么在大厂 Kotlin 项目里照样抓瞎?

JetBrains 在 2026 年 7 月 24 日发布了 Kotlin Benchmark,用 8 个开源项目的 105 个真实任务测 AI 编程助手。同样用 Opus 4.7 模型,Claude Code 成功率 85.71%,JetBrains 自家的 Junie 是 81.9%,差了近 4 个百分点。差距不在模型本身,而在外层 Harness...

推荐理由:JetBrains 官方基准测试给出了具体数字和工程层面的拆解,不是泛泛抱怨排行榜失真,而是追溯到静态编译开销 vs Python 动态运行反馈的根因。扣分点在于文章本身没披露更多任务细节和失败模式,但作为一条快讯,信息密度和判断力都够。

7月26日星期日

Hacker News 首页

陶哲轩 ICM 2026 演讲:假设 AI 能做研究级数学,数学界该重新审视什么

陶哲轩在 2026 年国际数学家大会的公开演讲里,没有去争 AI 到底能不能做研究级数学。他直接假设一个“强能力版本”成立——AI 工具在不久后能以合理的成本、成功率、质量和人工监督,完成相当一部分研究级数学任务——然后反过来问数学界:我们的目标和价值观到底是什么。他把当下比作 20 世纪初的数学基础危机,认为这次是对“数学实践与价值观的基础”的一次冲...

推荐理由:陶哲轩在 2026 年国际数学家大会的公开演讲,没走“AI 能不能做数学”的老路,直接假设一个强能力版本成立,然后回头问数学界:我们的目标和价值观到底是什么。他把这次冲击类比成 20 世纪初的数学基础危机,认为动摇的是实践和价值观的根基,而不只是工具层面。我会先打个折:正文没披露他假设的“合理成本、成功率”具体是多少,也没展开“First Proof”系统的实际表现,所以判断还停在框架层面。但光是这个提问角度,就够让做 AI 和做数学的人都停下来想一想了。

AI 群聊日报

Opus 5 实测次日:靠饱和式自测换质量,综合成本可能反超 Fable;OpenAI 深夜宕机换来全员重置卡

第三方测评显示,Claude Opus 5 最大的行为变化是饱和式自测——前端会对着需求截图逐个功能确认,后端能写超过 1000 个测试用例,大面上的交付问题几乎消失。代价是时间和 token 消耗极大,复杂场景下综合成本可能反超 Fable;关掉自测后直出代码的 bug 率并不比前代低。Anthropic 的策略是用长程细致 debug 替代一次写对...

推荐理由:第三方测评给出了 Opus 5 最实在的行为和成本数据,自测换质量的取舍是真实信号。因为是群聊日报转述而非一手测评原文,我会先打个折,但信息密度够上 featured。

7月25日星期六

Hacker News 首页

ARC Prize 发布 ARC-AGI-3 排行榜,按性价比给 AI 系统排座次

ARC Prize 放出了 ARC-AGI-3 的官方验证排行榜。这个新测试不再只看模型坐着答题,而是让 AI 智能体进入实时变化的交互环境里临场应变。排行榜最显眼的是张散点图,横轴是每道题的花费,纵轴是得分,直接把性价比摆到台面上。图上只展示运行总成本低于 1 万美元的系统;如果是 Kaggle 竞赛方案,还有 50 美元算力封顶的限制。具体哪个模型...

推荐理由:ARC Prize 放出了 ARC-AGI-3 的官方验证排行榜,核心变化是从静态做题变成让 AI 智能体进实时交互环境里应变,并且用散点图把得分和单题成本直接挂上钩,低于 1 万美元总成本才上榜,Kaggle 方案还有 50 美元算力封顶。但文章本身只是导航页,没披露任何模型名称或实际分数,信息太薄,只能给 featured 档。

Computing Life · Share · 鸭哥调研

OpenAI Presence:把现场失败修成下次能跑通的规则,装进了产品

OpenAI 在 7 月 22 日发布了 Presence,一个面向客服、外呼销售等具体岗位的企业语音和聊天 agent 产品。它的核心卖点不是模型能力,而是把 agent 卡住转人工之后的改进流程做成了标准功能:系统自动保存失败时的完整运行上下文,团队可以在沙盒里复现问题、修补规则、跑回归测试,再通过 Codex 改代码下发。这相当于把驻场工程师(F...

推荐理由:OpenAI 把企业 agent 部署里最头疼的环节——失败后怎么改——做成了标准产品功能,机制写得够具体。分数没给更高是因为目前只有单篇分析,缺多方验证、官方定价和实际客户规模数据,我会先打个折。

7月24日星期五

Computing Life · Share · 鸭哥调研

GPT-5.6 提示指南:别再手写执行步骤,把交付标准写死就行

OpenAI 7 月 22 日更新的 GPT-5.6 提示指南给了一个反直觉的建议:Agent 上下文够用时,不用在 prompt 里逐行规定中间步骤。作者把 GPT-4.1、GPT-5 到 GPT-5.6 的官方文档串起来看,发现这是一条连续的工程转向——从 GPT-4.1 把八步工作流硬编码进系统提示词,到 GPT-5 按场景给模型松绑、用完成条件...

推荐理由:这篇文章把三代官方提示指南连起来读,挖出一条从“硬编码工作流”到“按场景松绑”的工程转向,不是那种“又出新技巧”的盘点文。我会先打个折,因为它是二手分析而非一手发布,而且摘要没展开消融实验的具体数据,说服力停在方法论层面。但选题本身够刁,直接挑战从业者的肌肉记忆,对天天调 prompt 的人有实操参考价值。

7月23日星期四

Computing Life · Share · 鸭哥调研

Cursor 用新编排系统重写 SQLite,4 小时通过 80% 测试,但离生产数据库还很远

Cursor 团队做了一次受控实验:让新旧两套 Agent 编排系统,都只读 835 页 SQLite 手册,用 Rust 从零写一个兼容的数据库。新系统 Harness 4 小时内 sqllogictest 通过率达到 80%,最终能到 100%;旧系统 Swarm 不到 2 小时就因为代码冲突和接口混乱被叫停。新系统的核心是把规划者和执行者角色严格...

推荐理由:Cursor 做了一场干净利落的 A/B 测试,新旧两套 Agent 系统同台竞技,新系统 4 小时 sqllogictest 通过率冲到 80%、最终能到 100%,旧系统不到 2 小时就因代码冲突和接口混乱翻车。数字具体、对比清晰,还拆了规划者和执行者角色分离的架构思路,对做 AI 编程工具的人有直接参考价值。没给更高分是因为这还是一次内部技术实验,外部可复现性待验证,但作为单篇技术分享已经足够扎实。

7月22日星期三

OpenAI News

OpenAI 发布 Presence:一个已经在自家客服跑通的 AI 坐席产品

OpenAI 把给企业部署 AI 客服和内部流程机器人的经验打包成了产品 Presence,今天正式推出。它不是一个裸模型,而是一套带护栏的生产系统:企业可以设定 AI 能查哪些系统、能执行哪些操作、什么情况下必须转人工。OpenAI 自己的英文客服热线 1-888-GPT-0090 已经跑在 Presence 上,目前 75% 的来电不需要人工介入就...

推荐理由:OpenAI 把内部验证过的客服 agent 堆栈产品化了,甩出一个 75% 自动化率和两个具名企业参考。没给更高分是因为目前只有厂商自己的公告,没有第三方评测或客户侧数据,定价也没披露——如果是真的挺省钱,但这点先别太激动。

Hacker News 首页

Fireworks 实测 Kimi K3 对战 Fable:单挑打平,但让两个模型分工干活准确率冲到 93%,成本最多砍掉 50 倍

Fireworks 用约 1030 个真实编程 agent 任务跑了一遍 Kimi K3 和 Fable 5。单看 SWE 这类修 bug 的基准,K3 正确率 92.4%,Fable 92.6%,几乎没差别。但拆开看,K3 擅长符号数学和开发工具链,Fable 在网页和数据可视化上更强。他们试着做了一个“路由器”,根据任务类型把活分给最合适的模型,准...

推荐理由:Fireworks 拿约 1030 个真实 agent 任务跑了 K3 和 Fable,给了具体数字和任务类型拆解。发现按任务类型做路由、把活分给最合适的模型,效果比单用任何一个都好,这个结论可复现、可验证。分数定在 78 没往上拉,因为这是单一厂商的博客测试,不是独立第三方评测,我会先打个折。

7月17日星期五

AI HOT 精选

Kimi K3 前端编码跑分登顶,2.8 万亿参数模型 7 月 27 日开放权重

Kimi K3 在 Frontend Code Arena 拿了 1679 分,7 个前端子任务里 6 个第一,压过了 Claude Fable 5 和 GPT-5.6 Sol。模型本身是个 2.8 万亿参数的 MoE 架构,上下文窗口能塞进 100 万 token,大概是一套《三体》三部曲的量。7 月 27 日会开放权重,到时候可以自己部署。API ...

推荐理由:Kimi K3 在 Frontend Code Arena 前端编码榜拿了 1679 分,7 个子任务里 6 个第一,压过了 Claude Fable 5 和 GPT-5.6 Sol。模型是 2.8 万亿参数的 MoE 架构,上下文窗口能塞 100 万 token,7 月 27 日开放权重。这是国产旗舰模型在一个具体编码榜单上直接挑战闭源双巨头,而且马上能自己部署,对前端圈和国内开发者来说是个实打实可验证的信号。

AI HOT 精选

企业AI智能体评估存在“现实对齐”缺口:半数组织曾将通过内部测试的智能体部署到生产环境后导致客户故障

VentureBeat 对 157 家企业的调查发现,AI 智能体的内部评估和实际表现严重脱节。过去一年,50% 的组织都遇到过智能体或大模型功能通过了内部测试,上线后却在客户面前出故障的情况,其中四分之一不止一次踩坑。只有 5% 的人完全信任自动化评估,最大的槽点是评估结果跟真实世界表现对不上(29% 的人选了这项)。但矛盾的是,66% 的企业已经允...

推荐理由:VentureBeat的157家企业调查把智能体测试和生产的脱节问题量化了:50%上线后出过客户故障,只有5%完全信任自动化评估,29%认为评估结果跟真实表现对不上。数字扎实,痛点精准,不是公关稿。缺点是正文没披露调查方法细节,但作为行业信号已经够用。

7月16日星期四

Hugging Face 博客

Ai2 公开 Shippy 海事 AI 助手的工程经验:把不可靠的模型装进确定性的工具里

Ai2 的 Skylight 团队做了一个叫 Shippy 的海事 AI 助手,帮分析师查渔船活动、专属经济区边界和船只轨迹。他们把架构拆成三块:灵魂(系统提示词,定人设和行为边界)、技能(用 Markdown 文件教它调 API 和解读轨迹数据)、配置(运行时设置,目前用 Claude Opus 4.6 加 OpenClaw 框架)。核心思路是用确定...

推荐理由:Ai2 的三层 Agent 架构和用 Markdown 当技能说明书是能直接拿来用的工程思路,但渔船监控这个领域太小众,普通读者代入感弱,刚好卡在 featured 门槛上。

Hacker News 首页

MLOps 还没解决的几个硬问题

ACM Queue 这篇文章把现在 MLOps 的尴尬摊开了:传统运维那套靠确定性响应做健康检查、灰度发布、告警的方法,在 ML 系统上基本失灵。核心矛盾就两条——模型输出不是确定的,以及数据跟代码一样在驱动系统行为。文章举了几个扎心的例子:微软 Azure 验证新模型好不好用,居然是让另一批大模型当裁判,再靠内部员工点“赞”来兜底,SRECon 现场...

推荐理由:这篇 ACM Queue 文章把 MLOps 的核心矛盾讲得很透:传统运维靠确定性响应做健康检查和灰度发布,但 ML 系统输出不确定,数据跟代码一样在改变系统行为。微软 Azure 的例子尤其扎心——用大模型当裁判验证新模型,再靠员工点赞兜底,说明行业连“模型好不好用”都没个靠谱的自动化标准。对正在把模型往生产环境塞的工程师来说,这篇文章不是给答案,是把问题清单列出来了,实用价值很高。

7月15日星期三

Computing Life · Share · 鸭哥调研

AI 训练 AI:一次公开实验把自我改进的闭环走到了哪一步

Dan Austin 开源了一个完整的 AI 训练 AI 实验。外层用 Qwen3.6 智能体设计后训练方案,内层用 Qwen3-0.6B 或 1.7B 模型在 GPU 上真跑训练,隐藏评分再作为奖励反馈给外层。54 步下来,智能体先学会少交无效作业,然后把 1.7B 模型的使用比例从 42% 拉到了 95%,并开始主动调整温度、优化器等超参数。训练后...

推荐理由:我会先打个折:这只是一个公开实验,不是产品,规模也小。但它的价值在于把“AI 训练 AI”从概念变成了可复现的流程。外层 Qwen3.6 智能体设计后训练方案,内层 Qwen3-0.6B 和 1.7B 真跑训练,隐藏评分当奖励。54 步后,智能体先学会别交无效作业,然后主动把 1.7B 模型的使用比例从 42% 拉到 95%,还开始调温度、优化器这些超参数。这说明在小规模下,AI 确实能通过试错找到更省钱的训练策略。正文没披露最终模型在基准上的绝对分数,所以别急着说“超越人类调参”,但流程本身对做模型训练自动化的团队很有参考价值。