跳到正文

#评测/基准

今日 2 条

今天 · 9月30日星期三 · 2 条

AI HOT 精选 · 模型

GPT-6.1 Sol 发布 7 天后接替 GPT-6 Sol,智能指数距 GPT-6 Astra 仅 1 分

GPT-6.1 Sol 在发布 7 天后接替 GPT-6 Sol,智能指数比 GPT-6 Astra 低 1 分,价格仍为每百万输入/输出 token 2 美元/10 美元,缓存读取折扣从 90% 升至 95%。

推荐理由:通过智能指数、成本与 token 效率的横向对比,读者可判断 GPT-6.1 Sol 在价格与能力之间的取舍。

AI HOT 精选 · 模型

Claude Sonnet 5.5 (High) 以 1699 分登 Code Arena: WebDev 第 4 名

Arena 公布 Claude Sonnet 5.5 (High) 在 Code Arena: WebDev 以 1699 分排第 4,混合价格约 $8 per Mtoken,比第 2、3 名便宜 80%。相较 Sonnet 5 (High) 的 1540 分提升 159 分,Reference-Based Design、Simulations、Gaming 均从第 30 多名升至第 4。

昨天 · 9月29日星期二

Hacker News 首页

Pac-Bench:一个 prompt 让模型写吃豆人,Claude Opus 5.5 拿了 99 分

Jon Clegg 搞了个吃豆人基准测试,只给模型一句“用单个 HTML 页面写个吃豆人游戏”,然后让 Opus 5.5 自动打分。Claude Opus 5.5 通过 Claude Code 跑出了 99/100 分,生成一个 10.8 KB 的页面,花了 9 分钟,成本 1.99 美元,音效几乎还原街机。Claude Fable 5.1 拿了 96...

推荐理由:30 个模型一次性生成吃豆人的横向对比,Claude Opus 5.5 通过 Claude Code 拿到 99/100 分,成本 1.99 美元,数据扎实。扣分是因为这是个人项目,不是官方发布,权威性有限,所以卡在 78 分。

AI HOT 精选

GPT-6 Luna (Max) 在 Agent Arena 排第 23,单次任务成本 0.05 美元

Arena 用 8000 条真实智能体对话跑了一遍 GPT-6 Luna (Max),最终排名第 23,比上一代 GPT-5.6 Luna (xHigh) 前进了 6 位,净提升 1.6%。单次任务成本只要 0.05 美元,看着挺便宜,但正文没提延迟和具体任务类型,所以实际用起来快不快、擅长干什么活还不清楚。

推荐理由:GPT-6 Luna 第一次上 Agent Arena,排名和成本数字都有,看着挺香。但我会先打个折:正文没提延迟,也没说这 8000 条对话具体是什么任务,所以便宜归便宜,实际用起来体验怎么样还不好说。整体信息量够上 featured,但离爆款还差一口气。

r/LocalLLaMA

单张3090跑Qwen 27B,每秒95个token,上下文拉到26万

Reddit用户发帖说用一张RTX 3090跑Qwen 27B模型,生成了10万个token,吞吐量超过95 token/秒,上下文窗口开到262K。这个速度意味着本地跑长文本生成已经接近可用了——10万字级别的输出不用等太久。但帖子正文被Reddit屏蔽了,看不到具体用了什么量化、什么推理框架,也没法确认这是真实跑分还是某种优化后的极限测试。如果是真...

AI HOT 精选

Claude Sonnet 5.5 进 Arena 的 Agent 榜了,现在可以投票

Arena 把 Claude Sonnet 5.5 放上了 Agent Arena,开放用户投票。这个榜不是跑几个固定题,而是拿全球用户提交的上百万个长链条任务来测模型——任务里模型可以自己上网搜、读写文件、敲命令行,模拟真实干活场景。排名用因果追踪算分,看一个模型比平均水平强多少。正文没披露 Sonnet 5.5 在 Agent 任务上的具体胜率或排...

推荐理由:Claude Sonnet 5.5 上 Arena 的 Agent 榜是个直接面向用户的评测信号,三条线都踩中了。分数卡在 74 是因为文章只讲了评测方法,没给具体胜率或排名数字,等实锤数据出来再往上调。

Hacker News 首页

Anthropic 发布 Claude Sonnet 5.5:比上代快 30% 以上,单次任务成本最多降三成

Claude Sonnet 5.5 是 5.5 家族的第二款模型,定位是日常编码、修 bug 和做文档、幻灯片这类边界清晰的工作。它跑得比 Sonnet 5 快 30% 以上,虽然输入输出单价没变(每百万 token 输入 2 美元、输出 10 美元),但完成同样任务用的 token 更少,实际单次任务成本最多能降 30%。在测模型自主编程能力的 Te...

推荐理由:Anthropic 正式发了 Claude Sonnet 5.5,是 5.5 家族的第二款模型。定位很明确:日常编码、修 bug、做文档这些边界清晰的任务。最抓人的点是 Terminal-Bench 从 10.3% 飙到 70.6%,速度快 30%,单价没变但实际任务成本降了 30%。我会先打个折——这个成本降幅的测算方式正文没展开,而且 Terminal-Bench 的测试环境是否贴近真实开发流程也没说。但整体信息量够、判断直接,是同一天必须写的模型更新。没给 95 是因为它更像是 Opus 5.5 的补充,不是独立扛旗的发布。

AI HOT 精选

Claude Opus 5.5 (High) 在 Agent Arena 冲到第 2,中位成本降到 $1.31 一次任务

Claude Opus 5.5 (High) 在 Agent Arena 的净改进分是 +12.15%,排第 2,只输给 Fable 5.1 (Max)。中位价格每任务 $1.31,比上一代 Opus 5 (High) 便宜 40%,比 Opus 5 (Max) 便宜 56%——如果这个数据稳定,跑 agent 的成本确实降了一截。Steerabili...

推荐理由:Anthropic 的新模型在 Agent Arena 排第 2,同时价格砍了一截,是同一天就该写的产品信号。+12.15% 的净改进分和 $1.31 的中位成本给了硬数据,可控性提升是加分项。没打更高是因为这毕竟还是榜单成绩,正文没给真实场景的验证,我会先打个折。

AI HOT 精选

Claude Opus 5.5 (High) 在 Agent Arena 冲到第 2,成本比 Opus 5 (Max) 低 56%

Claude Opus 5.5 (High) 在 Agent Arena 榜单上拿了第 2 名,净改进分 +12.15%,只输给 Fable 5.1 (Max)。官方说它比上一代 Opus 5 (Max) 便宜 56%,但正文没给出具体价格和延迟数据,这个省钱幅度我先打个折,等实际跑量再看。

推荐理由:Opus 5.5 在 Agent Arena 拿第 2 名,加上 56% 的成本降幅,是今天 Anthropic 值得关注的更新。分数没给到 85 以上,因为正文缺定价和延迟数据,成本优势得等实测确认。

9月28日星期一

Hacker News 首页

TabPFN 零训练对战调参版 XGBoost,14 张表全赢

作者用 Grinsztajn 基准里的 14 个数据集,让 TabPFN 和 TabICL 跟调过参的 XGBoost 比了一场。这两个模型不在目标表上做梯度训练,而是把训练行当上下文,一次前向传播直接出预测,结果 14 场全胜。优势在数据量到 32000 行时依然成立。推理延迟每行 0.6 到 6 秒,表越宽越慢。另外,引用最多的那个 TabPFN ...

Computing Life · Share · 鸭哥调研

Agent 提到 PayPal 139 次,选中 0 次:软件买主不再是人,分发规则变了

Armature 跑了 5300 次沙箱测试,让 Claude Code、Codex 和 Cursor 在真实工程仓库里接入支付和邮件工具。PayPal 被提及 139 次,但一次都没被写进代码;Stripe 拿下了支付测试里 88% 的胜局。选型跟着语言环境走:同一个发邮件任务,TypeScript 仓库选 Resend,Python 选 SendG...

推荐理由:Armature 的 5300 次沙箱跑出了第一手 agent 选型数据,PayPal 0 次 vs Stripe 88% 的对比够硬,三个维度都打中了。不过测试方本身是商业公司,目前只放了 31% 的数据出来,所以分数压在 82 没往上走。

9月27日星期日

r/LocalLLaMA

Nonobench v1.2 用数织谜题测了43个模型:开源DeepSeek V4 Pro排第四,但20×20困难模式全军覆没

一个叫Nonobench的基准测试用数织(Nonogram,类似像素填图谜题)考了43个大模型。开源模型DeepSeek V4 Pro跟几个闭源模型并列第四,但新出的20×20困难模式没有一个模型能解出来。正文只给了排名和难度分级,没披露具体得分和测试样本量,所以这个第四名含金量有多高、困难模式到底多难,目前还不好判断。

9月26日星期六

Hacker News 首页

给大模型加水印会让 AI 智能体干活变慢、出错变多

Lasso Security 测了一下给大模型加水印对 AI 智能体的影响,结果不太乐观。在 BFCL V3 这个工具调用基准测试上,加水印后模型调用工具的准确率掉了 3 到 5 个百分点,响应延迟多了 11 秒,输出长度也膨胀了 20% 到 30%。文章没提具体测的是哪些模型和智能体框架,所以这些数字只能当个参考。简单说,加水印相当于给模型输出打上隐...

推荐理由:这篇文章有实打实的基准测试数据,回答了一个生产环境里绕不开的问题:加水印对智能体性能有多大影响。准确率下降、延迟增加、输出变长,三个指标都给了具体数字,对正在选型的人有参考价值。不过正文没提测试用的是哪些模型和 agent 框架,所以这些数字不能直接套到自己的系统上,我会先打个折。整体上,问题提得准,数据有但缺上下文,适合让从业者知道有这么个坑,但别急着下结论。

9月25日星期五

Hacker News 首页

NSA 今年花了几十亿美元测试前沿 AI 模型,远超此前公开的数字

两个消息源透露,NSA 在闭门简报中告诉国会议员,今年光是用纳税人的钱评估和测试先进 AI 模型就花了几十亿美元。这个数字比外界之前知道的要高得多,导致议员们估算,要建一套完整的联邦 AI 监管体系,每年可能要花掉几百亿美元。文章没提具体在测哪些模型、用的是谁的算力,也没说这笔钱怎么拆分的。特朗普目前基本顶住了加强联邦 AI 监管的压力。

推荐理由:独家披露了一份保密简报里的预算数字,信息密度够高,三条都踩中了。没给更高分是因为正文没写清楚测的是哪些模型、算力是谁提供的、钱怎么拆分的——信息缺口不小,所以这更像一个政策信号,先别急着下结论。

Computing Life · Share · 鸭哥调研

一周四份成绩单:每个数字各在测什么

阶跃星辰的 Step 5 Preview 公布了四类成绩,但自报的 Terminal-Bench 分数还没上公开排行榜,权重许可条款也没披露。独立开发者用 111 道公开难题测了 TypeSafe 的判断接口 Jev,发现它答错时平均把握 0.690,答对时 0.684,把握高低分不出对错。加州州长签了 AI 行政令,但只是让政府部门去起草修法建议,目...

9月24日星期四

Hacker News 首页

一张每日更新的模型性价比榜单,把 420 个模型的智商和价格画成一条“价值前沿线”

这个网站把 Artificial Analysis 的智力指数和混合 API 价格放在一张图里,画出一条“价值前沿线”:线上每个点都代表没有更便宜又更聪明的模型。Claude Opus 5.5 在最贵档(8 美元/百万 token)拿了 57.6 分;Meta 的 Muse Spark 1.3 在 2 到 8 美元档以 48.1 分领先;小米的 MiM...

推荐理由:一张每日更新的价格-智力散点图,用 Artificial Analysis 的数据把 420 个模型排开,画出的“价值前沿线”让性价比选择变得很直接。有硬数据、有具体模型和分数,对从业者确实有用,所以 H 和 K 都站得住。但文章本身没有抛出争议性判断或身份认同话题,R 这块就弱了,整体停在 featured 档的 72 分是合理的。

Hacker News 首页

Paper Office 发布:一套让 AI 智能体安全编辑 Word、PPT、Excel 的 Python 工具包

Paper Instruments 开源了 Paper Office,在 python-docx、python-pptx 和 OpenPyxl 的基础上加了安全校验和更完整的编辑能力。他们用 5 个模型跑了 61 项任务,Paper 工具包加上引导后通过率 92.5%,直接用上游库是 80.7%,用 Anthropic 的 Office skills ...

推荐理由:Paper Instruments 开源了一套给 agent 用的 Office 文件编辑工具包,在 python-docx、python-pptx 和 OpenPyxl 上面加了安全校验和更完整的编辑能力。他们拿 5 个模型跑了 61 项任务,Paper 工具包加上引导后通过率 92.5%,直接用上游库是 80.7%,Anthropic 的 Office skills 更低一些。这个 11.8 个百分点的差距说明封装层确实有用,不是单纯套壳。正文没披露任务具体是什么类型、失败案例集中在哪,也没说安全校验具体拦了什么,这点先别太激动。但对已经在用 ...

Hacker News 首页

开源提示注入检测器几乎抓不到藏在工具输出里的真实攻击,Regex 检出率 0%,Meta Prompt Guard 2 只有 1%

这个基准测试把 629 条来自 AgentDojo 的注入攻击藏进搜索结果、邮件正文这类工具返回内容里,然后拿 Regex 和 Meta 的 Prompt Guard 2 去测。Regex 一条都没抓到,Prompt Guard 2 只抓到 1%。攻击不是直接发给模型的,而是混在模型调用的工具输出里,所以现有检测器基本是瞎的。代码和复现步骤都公开了,但...

推荐理由:这个基准测试把 629 条 AgentDojo 的注入攻击混进搜索结果、邮件正文这类工具返回内容里,然后拿 Regex 和 Meta 的 Prompt Guard 2 去测。Regex 一条都没抓到,Prompt Guard 2 只抓到 1%。攻击不是直接发给模型的,而是藏在模型调用的工具输出里,所以现有检测器基本是瞎的。代码和复现步骤都公开了,实用价值加分。但只测了两个检测器,没有横向对比更多方案,所以分数先停在 78。

AI HOT 精选

Claude Opus 5.5 在编程智能体评测里拿了第一,但跑一次任务要花 13 美元

Artificial Analysis 把 Claude Opus 5.5 放在 Claude Code 的“最大出力”模式下跑了一遍 Coding Agent Index,得分 66,比上一代 Opus 5 的 60 分高出 6 分。三项子测试全线上涨:Terminal-Bench 4.0 正确率 63.1%,DeepSWE v1.1 正确率 68....

推荐理由:Claude Opus 5.5 在 Artificial Analysis 的 Coding Agent Index 上拿了 66 分,比 Opus 5 高出 6 分,三项子测试全线上涨,登顶没问题。但单任务成本 13.04 美元是硬数字,比上一代贵了不少。这是独立第三方用 Claude Code 的“最大出力”模式实测的结果,数据具体、来源可信,对实际用的人有直接参考意义。没给更高分是因为这只是单一基准测试,不代表整体能力。

AI HOT 精选

本周四个新模型把智能指数和成本的最优边界往外推了 11 个点

Artificial Analysis 发推说,MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna 和 GPT-6 Sol 这四个新模型,在智能指数对单次任务成本的 Pareto 前沿上新增了 11 个点位。GPT-6 Luna 占了 5 个,Claude Opus 5.5 占了 4 个,剩下两个来自 MiMo-V2.6-...

推荐理由:Artificial Analysis 的 Pareto 前沿图本身就是选模型的硬参考,这次四个新模型一口气推了 11 个点,边界外移幅度不小。GPT-6 Luna 拿 5 个点说明它在多个成本档位都有竞争力,Claude Opus 5.5 的 4 个点也没差太远,两家的对位关系值得关注。正文没披露具体智能指数数值和单次任务成本数字,但点位分布本身已经够做初步判断了。

9月23日星期三

OpenAI News

OpenAI 开源心理健康评测集 MentalHealthBench,联合 80 多位持证心理医生,测模型在真实对话里靠不靠谱

OpenAI 放出了一个叫 MentalHealthBench 的开源评测集,专门看 AI 在心理健康对话里表现怎么样。这个评测集是和 22 个国家、80 多位持证心理医生和精神科医生一起做的,覆盖了从日常情绪倾诉到紧急危机干预的各种场景,还分了成人、青少年、照顾者等不同角色。它不只看模型有没有触发安全红线,更会检查模型会不会主动追问背景、有没有尊重用...

推荐理由:OpenAI 放出了一个开源的、由 80 多位持证临床医生参与构建的心理健康评测集,覆盖场景很全,而且检查维度比常规安全测试更细,比如会看模型有没有主动追问背景、有没有尊重用户。这对做 AI 安全和产品的团队来说,是个能直接拿来用的工具。没给更高分是因为它目前还是个评测工具,不是产品落地或重大技术突破。

Latent Space

Claude Opus 5.5 发布:写作质量大幅提升,成本降了 40%,直接成了 AINews 的默认模型

Anthropic 发了 Claude Opus 5.5,这是新 5.5 系列的第一个模型。官方说它在大多数任务上能追平之前的旗舰 Fable 5.1,但运行成本比 Opus 5 低了 40%,速度也快了约 30%。这次发布很少见地把写作改进放在了显眼位置:模型会把关键信息放在最前面,也更听你的风格指令,长对话读起来没那么累。Latent Space ...

推荐理由:Anthropic 发了新旗舰系列的第一个模型,声称性能持平 Fable 5.1 但便宜 40%,还把写作体验改进摆上台面——这对 Claude 重度用户是直接可操作的升级信号。没给 90 分以上是因为目前只有官方说法和 Latent Space 的初步观察,缺独立验证,先别太激动。

Computing Life · Share · 鸭哥调研

同一个工具开关,一个模型赚了,一个崩了:编程智能体外层设计的关键决策

一项新研究把编程智能体的外层控制软件拆成了任务规划、上下文管理和动作接口三个独立开关,挨个测试。最扎眼的结果是:把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上的成功率涨了 3.6 个百分点,单任务估算成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却从...

推荐理由:这篇论文做了一个很干净的对照实验:把智能体的外层控制软件拆成任务规划、上下文管理和动作接口三个开关,单独拧动看效果。最反直觉的发现是,把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上成功率涨了 3.6 个百分点,单任务成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却直接掉了一截。这种同一开关、两个模型走向完全相反的结果,比单纯刷榜有信息量得多。正文没披露实验的统计显著性检验,这点先别太激动,但成本数字和成功率变化幅度已经足够让做工程的人重新审视自己...

AI HOT 精选

Arena 开始测 GPT-6 Sol 和 Luna 了,分数还没出,但你可以上手跑真实任务

Arena 放出了 OpenAI 两个新模型 GPT-6 Sol 和 GPT-6 Luna 的测试入口,目前还没公布评分。你可以直接去 Arena 让它们跑真实的智能体任务,然后投票,结果会进排行榜。正文没提模型规模、发布时间和定价,所以这些先别猜。

推荐理由:GPT-6 首次公开出现,两个变体在 Arena 上跑智能体任务,悬念和信号都很强。扣分是因为正文没提模型规模、发布时间和定价,目前只是一个测试入口,信息偏薄,所以分数我会先打个折。

Hacker News 首页

Unreal Agent 开源:让工具调用全异步,GPT-6 Astra 跑分成本比 Codex 低 40%

Unreal Labs 开源了一个 agent 调度器,核心思路是把工具调用改成全异步:模型发出指令后不用干等,工具在后台跑,结果回来再补进对话记录。在 Terminal-Bench、SWE-Atlas、DeepSWE 和 ALE-CLI 四个基准上,用 GPT-6 Astra xhigh 跑,成本比 Codex 最多低 40%,比 Pi 最多低 20...

AI HOT 精选

OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6 直接砍半

OpenAI 在 GPT-6 系列里加了两个更省钱的模型:Sol 和 Luna。API 价格全部对折,Sol 输入/输出每百万 token 收 2/10 美元,Luna 只要 0.10/0.50 美元。Sol 在 AutomationBench 上开足马力拿到 33.2% 的分数,但每次任务成本只有 Claude Opus 5 的 9%;在 Agent...

推荐理由:OpenAI 官方发新模型,API 价格砍半,Sol 在 agent 基准上的成本只有竞品 9%,对整个行业的成本结构冲击很大。H、K、R 全中,定价和基准数据都给了。扣 3 分是因为正文没把 Sol 和 Luna 的能力差距说透,只知道 Sol 更强但贵,Luna 更省但弱,具体弱在哪没展开。

AI HOT 精选

Claude Opus 5.5 进了 Arena 的 Agent 擂台,能联网、操作文件、跑终端,排名靠用户投票

Arena 把 Claude Opus 5.5 放上了 Agent Arena,让模型直接干长链条的活——可以自己上网搜资料、读写文件、敲命令行。排行榜不只看输赢,用的是因果追踪,看它比平均水平强多少。正文没具体说 Battle Mode 怎么打,也没给任务例子,所以实际有多能打还得等实测。

推荐理由:Opus 5.5 上 Agent Arena 是本周最值得盯的第三方评测信号。因果追踪的排行榜设计比原始胜率多一层信息,但正文没给具体任务例子,也没说 Battle Mode 规则,实际能打程度还得等社区跑完再看——这点先别太激动。

AI HOT 精选

Claude Opus 5.5 在智能评测中拿了最高分 58,还降了 20% 的价格

Claude Opus 5.5 在 Artificial Analysis 的智能指数上得了 58 分,是目前测过的最高分。它在 10 项评测里 6 项领先,比如在 Humanity's Last Exam 上正确率 61.4%,SciCode 上 66.9%,Terminal-Bench 4.0 上 59.6%,跟 GPT-6 Astra 打平。在模...

推荐理由:Anthropic 的旗舰模型在一个有分量的第三方基准上拿了第一,同时降价 20%,属于当天必写。没给 95 分是因为这毕竟只是基准测试结果,不是模型发布本身,但 6/10 项领先、跟 GPT-6 Astra 打平、价格还降了,放在 featured 档很合适。

9月22日星期二

Hacker News 首页

让 AI 代理反复优化 Rust 代码,直到跑赢顶尖开源库

Max Woolf 用了一年多时间验证一件事:给 AI 代理定一条硬规矩——每次改代码必须至少提速 5%,否则回滚——然后让它自己去迭代优化 Rust。从 Claude Opus 4.5 开始,这套玩法在 UMAP 等算法上拿到了 2 到 20 倍的加速,对比的是已经打磨多年的成熟库,而且全程没碰 unsafe 代码。文章把提示词和基准测试结果都贴出来...

推荐理由:Max Woolf 用一年时间验证了一个具体玩法:给 AI 代理下死命令,每次改 Rust 代码必须提速至少 5%,否则回滚。从 Claude Opus 4.5 开始,这套流程在 UMAP 等算法上跑出了 2 到 20 倍的加速,对比对象是已经打磨多年的成熟库,而且没动 unsafe 代码。文章把提示词和基准测试结果都公开了,属于少见的有数字、能复现的一手实验。我会先打个折——这些加速是在特定算法和场景下拿到的,不一定能泛化到所有 Rust 项目,但方法论本身值得关注。

AI HOT 精选

卡兹克实测 Grok 4.7 与小米 MiMo V2.6:后者成了“不可能三角”的答案

文章标题说卡兹克对比了 Grok 4.7 和小米 MiMo V2.6,结论是 MiMo V2.6 解决了“不可能三角”(通常指模型在成本、速度、质量上难以兼得)。但正文被微信屏蔽,只显示环境异常和验证页面,没有披露任何模型参数、测试方法或具体结果。所以这条信息目前只有结论,没有证据支撑。

Computing Life · Share · 鸭哥调研

三条 AI 编程新闻,三个数字的读法

过去几天 AI 编程圈出了三件事。ZCode 被发现在后台把整个项目连同 Git 历史打包加密,排队往云端传,快照里 .git 对象占了 86.6%,但官方说数据会立即销毁,目前没有第三方验证。HarnessTax 的评测把同一个模型 Claude Fable 5 装进不同框架跑题,官方 Claude Code 和极简框架 Pi 成功率几乎一样(97....

推荐理由:三条 AI 编程新闻绑在一起讲,每条都带一个能记住的数字。ZCode 上传 Git 历史是硬安全事件,有 ferstar 的取证报告和社区复现支撑;HarnessTax 评测暴露了框架包装对模型能力的干扰;微软的架构案例给出了一个省钱路线。HKR 全中,安全、知识和共鸣都到位。

OpenAI News

OpenAI 发第三方安全评估原则:要独立、要科学、要保密,但没说谁来评、多久出结果

OpenAI 发了一篇博客,讲他们想让第三方机构怎么评估自家模型的安全性。核心是四个评估方向:审安全论证(就是看你的安全声明有没有证据支撑)、测关键防护(比如防越狱、防滥用)、测能力边界(看模型到底能干什么危险事)、以及部署后的持续监控。原则强调评估要独立、要科学、要保密,评估周期从几周到几个月不等。但正文没披露具体找谁评、评完结果是否公开、以及如果评...

AI HOT 精选

小米 MiMo-V2.6-Pro 在 Code Arena WebDev 排到第10名左右,开源模型里排第3

小米发了两个全模态模型 MiMo-V2.6-Pro 和 Flash。Pro 版在 Code Arena 的网页开发榜上拿了 1628 分,比上一代 MiMo-V2.5-Pro 的 1475 分涨了 153 分,整体排第10名上下,在 MIT 许可的开源权重模型里大概排第3。Flash 版的跑分和参数量正文都没提。

推荐理由:小米 MiMo-V2.6-Pro 在 Code Arena WebDev 榜上排第10名上下,开源权重模型里约第3,分数比上代涨了 153 分,有具体数字支撑。Flash 版参数量和跑分正文都没提,信息有缺口,所以重要性给到 78 比较合适,先别往更高拔。

AI HOT 精选

小米 MiMo-V2.6-Pro 在开放权重模型智能指数里排到第一,得分从 26 跳到 46

小米放出了 MiMo-V2.6-Pro,在 Artificial Analysis 的智能指数上拿了 46 分,比上一代 V2.5-Pro 的 26 分涨了不少,现在是开放权重模型里最高的。不过正文没提参数量、具体架构和什么时候能公开用,这些关键信息都还缺着,所以这个分数先别太激动。

推荐理由:小米的 MiMo-V2.6-Pro 在开放权重模型智能指数上登顶,分数从 26 涨到 46,进步明显,属于国产旗舰模型的正面信号。但正文没给参数量、架构和发布时间,关键信息缺着,所以分数先打个折。

AI HOT 精选

小米 MiMo-V2.6-Pro 在开源模型智能指数上拿了第一,但关键信息还没公布

小米发了新模型 MiMo-V2.6-Pro,在 Artificial Analysis 的智能指数上拿了 46 分,是目前开源权重模型里最高的。作为对比,上一代 MiMo-V2.5-Pro 只有 26 分,这次提升幅度不小。不过正文没披露模型大小、训练数据和开源协议,这些都会直接影响实际能用在哪、怎么用,所以分数先看着,等细节出来再判断。

推荐理由:小米这个模型分数翻倍、直接登顶,确实有新闻性。但正文没披露模型大小、训练数据和开源协议,这些直接决定能不能用、怎么用,所以分数先打 78,等细节出来再调整。

AI HOT 精选

马斯克称 Grok 4.7 在智能体编码上排第三

马斯克引用 Artificial Analysis 的评测说,Grok 4.7 让 xAI 在智能体编码能力上排到第三,仅次于 Anthropic 和 OpenAI。但正文没披露具体评测指标、分数或版本对比,只有排名和对手。这个排名如果是真的,说明 Grok 在让模型自主写代码、调工具这类任务上进步明显,但缺少数据支撑,建议先观望。

9月21日星期一

AI HOT 精选

Fireworks AI 发布 FireRouter:前沿不再是单个模型,而是路由器

Fireworks AI 在 DeepSWE 编程基准上测了 18 个模型,发现按任务挑模型比死用一个强得多。单用最强的 GPT-6 Astra 能解决 74.1% 的任务,每次成本 6.52 美元;但一个“事后诸葛亮”路由器从 18 个模型里给每个任务挑最合适的,解决率能到 97.6%,成本反而降到 1.88 美元。只用开源模型也能到 90.3%,成...

推荐理由:Fireworks 用 18 个模型在 DeepSWE 上跑了一轮,拿到的结论是:按任务挑模型的路由器,在解决率和成本上都把单一最强模型比下去了。97.6% 对 74.1% 的解决率,1.88 美元对 6.52 美元的单次成本,差距很明显。开源模型组合能到 90.3%,也给了一条不绑死闭源模型的路。我会先打个折——这是他们自家发布的路由器,数据肯定挑好看的放,但逻辑本身对做模型调度和成本控制的人有参考价值。

9月20日星期日

Hacker News 首页

提示词没那么重要,不如搭一套评估流水线来管住模型

Dan McKinley 在演讲里说,整天跟大模型来回改提示词是条死胡同。他做面向消费者的 agent 时发现,哪怕用了结构化输出,模型还是会在一小部分请求里发疯,比如把标题字段塞满废话直到爆掉。他试出来的一个离谱解法是把字段名从“title”改成“heading”,暂时管用,但随时可能失效。他的核心观点是,提示词本身靠不住,得靠 pass^k 测试和...

推荐理由:Dan McKinley 拿自己搭消费者 agent 的实战经验说话,案例具体、判断尖锐。但这是个人演讲,不是正式论文,正文也没披露 pass^k 测试的通过率和规模,所以我会先打个折。

Hacker News 首页

iPhone 18 Pro 相机评测:DXOMARK 172 分,全球第二

DXOMARK 给 iPhone 18 Pro 相机打了 172 分,排全球第二。最大亮点是可调光圈(f/1.48–f/4.0),复杂场景下也能保持画面锐度。自动对焦稳定,眩光比上一代控制得好,但光圈收小时仍可能出现绿斑。主摄 48MP,超广角 48MP 120°,长焦 48MP 8 倍光学变焦。