GPT-6.1 Sol 发布 7 天后接替 GPT-6 Sol,智能指数距 GPT-6 Astra 仅 1 分
GPT-6.1 Sol 在发布 7 天后接替 GPT-6 Sol,智能指数比 GPT-6 Astra 低 1 分,价格仍为每百万输入/输出 token 2 美元/10 美元,缓存读取折扣从 90% 升至 95%。
推荐理由:通过智能指数、成本与 token 效率的横向对比,读者可判断 GPT-6.1 Sol 在价格与能力之间的取舍。
模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。
GPT-6.1 Sol 在发布 7 天后接替 GPT-6 Sol,智能指数比 GPT-6 Astra 低 1 分,价格仍为每百万输入/输出 token 2 美元/10 美元,缓存读取折扣从 90% 升至 95%。
推荐理由:通过智能指数、成本与 token 效率的横向对比,读者可判断 GPT-6.1 Sol 在价格与能力之间的取舍。
Jon Clegg 搞了个吃豆人基准测试,只给模型一句“用单个 HTML 页面写个吃豆人游戏”,然后让 Opus 5.5 自动打分。Claude Opus 5.5 通过 Claude Code 跑出了 99/100 分,生成一个 10.8 KB 的页面,花了 9 分钟,成本 1.99 美元,音效几乎还原街机。Claude Fable 5.1 拿了 96...
推荐理由:30 个模型一次性生成吃豆人的横向对比,Claude Opus 5.5 通过 Claude Code 拿到 99/100 分,成本 1.99 美元,数据扎实。扣分是因为这是个人项目,不是官方发布,权威性有限,所以卡在 78 分。
Arena 用 8000 条真实智能体对话跑了一遍 GPT-6 Luna (Max),最终排名第 23,比上一代 GPT-5.6 Luna (xHigh) 前进了 6 位,净提升 1.6%。单次任务成本只要 0.05 美元,看着挺便宜,但正文没提延迟和具体任务类型,所以实际用起来快不快、擅长干什么活还不清楚。
推荐理由:GPT-6 Luna 第一次上 Agent Arena,排名和成本数字都有,看着挺香。但我会先打个折:正文没提延迟,也没说这 8000 条对话具体是什么任务,所以便宜归便宜,实际用起来体验怎么样还不好说。整体信息量够上 featured,但离爆款还差一口气。
Arena 把 Claude Sonnet 5.5 放上了 Agent Arena,开放用户投票。这个榜不是跑几个固定题,而是拿全球用户提交的上百万个长链条任务来测模型——任务里模型可以自己上网搜、读写文件、敲命令行,模拟真实干活场景。排名用因果追踪算分,看一个模型比平均水平强多少。正文没披露 Sonnet 5.5 在 Agent 任务上的具体胜率或排...
推荐理由:Claude Sonnet 5.5 上 Arena 的 Agent 榜是个直接面向用户的评测信号,三条线都踩中了。分数卡在 74 是因为文章只讲了评测方法,没给具体胜率或排名数字,等实锤数据出来再往上调。
Claude Sonnet 5.5 是 5.5 家族的第二款模型,定位是日常编码、修 bug 和做文档、幻灯片这类边界清晰的工作。它跑得比 Sonnet 5 快 30% 以上,虽然输入输出单价没变(每百万 token 输入 2 美元、输出 10 美元),但完成同样任务用的 token 更少,实际单次任务成本最多能降 30%。在测模型自主编程能力的 Te...
推荐理由:Anthropic 正式发了 Claude Sonnet 5.5,是 5.5 家族的第二款模型。定位很明确:日常编码、修 bug、做文档这些边界清晰的任务。最抓人的点是 Terminal-Bench 从 10.3% 飙到 70.6%,速度快 30%,单价没变但实际任务成本降了 30%。我会先打个折——这个成本降幅的测算方式正文没展开,而且 Terminal-Bench 的测试环境是否贴近真实开发流程也没说。但整体信息量够、判断直接,是同一天必须写的模型更新。没给 95 是因为它更像是 Opus 5.5 的补充,不是独立扛旗的发布。
Claude Opus 5.5 (High) 在 Agent Arena 的净改进分是 +12.15%,排第 2,只输给 Fable 5.1 (Max)。中位价格每任务 $1.31,比上一代 Opus 5 (High) 便宜 40%,比 Opus 5 (Max) 便宜 56%——如果这个数据稳定,跑 agent 的成本确实降了一截。Steerabili...
推荐理由:Anthropic 的新模型在 Agent Arena 排第 2,同时价格砍了一截,是同一天就该写的产品信号。+12.15% 的净改进分和 $1.31 的中位成本给了硬数据,可控性提升是加分项。没打更高是因为这毕竟还是榜单成绩,正文没给真实场景的验证,我会先打个折。
Claude Opus 5.5 (High) 在 Agent Arena 榜单上拿了第 2 名,净改进分 +12.15%,只输给 Fable 5.1 (Max)。官方说它比上一代 Opus 5 (Max) 便宜 56%,但正文没给出具体价格和延迟数据,这个省钱幅度我先打个折,等实际跑量再看。
推荐理由:Opus 5.5 在 Agent Arena 拿第 2 名,加上 56% 的成本降幅,是今天 Anthropic 值得关注的更新。分数没给到 85 以上,因为正文缺定价和延迟数据,成本优势得等实测确认。
Armature 跑了 5300 次沙箱测试,让 Claude Code、Codex 和 Cursor 在真实工程仓库里接入支付和邮件工具。PayPal 被提及 139 次,但一次都没被写进代码;Stripe 拿下了支付测试里 88% 的胜局。选型跟着语言环境走:同一个发邮件任务,TypeScript 仓库选 Resend,Python 选 SendG...
推荐理由:Armature 的 5300 次沙箱跑出了第一手 agent 选型数据,PayPal 0 次 vs Stripe 88% 的对比够硬,三个维度都打中了。不过测试方本身是商业公司,目前只放了 31% 的数据出来,所以分数压在 82 没往上走。
Lasso Security 测了一下给大模型加水印对 AI 智能体的影响,结果不太乐观。在 BFCL V3 这个工具调用基准测试上,加水印后模型调用工具的准确率掉了 3 到 5 个百分点,响应延迟多了 11 秒,输出长度也膨胀了 20% 到 30%。文章没提具体测的是哪些模型和智能体框架,所以这些数字只能当个参考。简单说,加水印相当于给模型输出打上隐...
推荐理由:这篇文章有实打实的基准测试数据,回答了一个生产环境里绕不开的问题:加水印对智能体性能有多大影响。准确率下降、延迟增加、输出变长,三个指标都给了具体数字,对正在选型的人有参考价值。不过正文没提测试用的是哪些模型和 agent 框架,所以这些数字不能直接套到自己的系统上,我会先打个折。整体上,问题提得准,数据有但缺上下文,适合让从业者知道有这么个坑,但别急着下结论。
两个消息源透露,NSA 在闭门简报中告诉国会议员,今年光是用纳税人的钱评估和测试先进 AI 模型就花了几十亿美元。这个数字比外界之前知道的要高得多,导致议员们估算,要建一套完整的联邦 AI 监管体系,每年可能要花掉几百亿美元。文章没提具体在测哪些模型、用的是谁的算力,也没说这笔钱怎么拆分的。特朗普目前基本顶住了加强联邦 AI 监管的压力。
推荐理由:独家披露了一份保密简报里的预算数字,信息密度够高,三条都踩中了。没给更高分是因为正文没写清楚测的是哪些模型、算力是谁提供的、钱怎么拆分的——信息缺口不小,所以这更像一个政策信号,先别急着下结论。
这个网站把 Artificial Analysis 的智力指数和混合 API 价格放在一张图里,画出一条“价值前沿线”:线上每个点都代表没有更便宜又更聪明的模型。Claude Opus 5.5 在最贵档(8 美元/百万 token)拿了 57.6 分;Meta 的 Muse Spark 1.3 在 2 到 8 美元档以 48.1 分领先;小米的 MiM...
推荐理由:一张每日更新的价格-智力散点图,用 Artificial Analysis 的数据把 420 个模型排开,画出的“价值前沿线”让性价比选择变得很直接。有硬数据、有具体模型和分数,对从业者确实有用,所以 H 和 K 都站得住。但文章本身没有抛出争议性判断或身份认同话题,R 这块就弱了,整体停在 featured 档的 72 分是合理的。
Paper Instruments 开源了 Paper Office,在 python-docx、python-pptx 和 OpenPyxl 的基础上加了安全校验和更完整的编辑能力。他们用 5 个模型跑了 61 项任务,Paper 工具包加上引导后通过率 92.5%,直接用上游库是 80.7%,用 Anthropic 的 Office skills ...
推荐理由:Paper Instruments 开源了一套给 agent 用的 Office 文件编辑工具包,在 python-docx、python-pptx 和 OpenPyxl 上面加了安全校验和更完整的编辑能力。他们拿 5 个模型跑了 61 项任务,Paper 工具包加上引导后通过率 92.5%,直接用上游库是 80.7%,Anthropic 的 Office skills 更低一些。这个 11.8 个百分点的差距说明封装层确实有用,不是单纯套壳。正文没披露任务具体是什么类型、失败案例集中在哪,也没说安全校验具体拦了什么,这点先别太激动。但对已经在用 ...
这个基准测试把 629 条来自 AgentDojo 的注入攻击藏进搜索结果、邮件正文这类工具返回内容里,然后拿 Regex 和 Meta 的 Prompt Guard 2 去测。Regex 一条都没抓到,Prompt Guard 2 只抓到 1%。攻击不是直接发给模型的,而是混在模型调用的工具输出里,所以现有检测器基本是瞎的。代码和复现步骤都公开了,但...
推荐理由:这个基准测试把 629 条 AgentDojo 的注入攻击混进搜索结果、邮件正文这类工具返回内容里,然后拿 Regex 和 Meta 的 Prompt Guard 2 去测。Regex 一条都没抓到,Prompt Guard 2 只抓到 1%。攻击不是直接发给模型的,而是藏在模型调用的工具输出里,所以现有检测器基本是瞎的。代码和复现步骤都公开了,实用价值加分。但只测了两个检测器,没有横向对比更多方案,所以分数先停在 78。
Artificial Analysis 把 Claude Opus 5.5 放在 Claude Code 的“最大出力”模式下跑了一遍 Coding Agent Index,得分 66,比上一代 Opus 5 的 60 分高出 6 分。三项子测试全线上涨:Terminal-Bench 4.0 正确率 63.1%,DeepSWE v1.1 正确率 68....
推荐理由:Claude Opus 5.5 在 Artificial Analysis 的 Coding Agent Index 上拿了 66 分,比 Opus 5 高出 6 分,三项子测试全线上涨,登顶没问题。但单任务成本 13.04 美元是硬数字,比上一代贵了不少。这是独立第三方用 Claude Code 的“最大出力”模式实测的结果,数据具体、来源可信,对实际用的人有直接参考意义。没给更高分是因为这只是单一基准测试,不代表整体能力。
Artificial Analysis 发推说,MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna 和 GPT-6 Sol 这四个新模型,在智能指数对单次任务成本的 Pareto 前沿上新增了 11 个点位。GPT-6 Luna 占了 5 个,Claude Opus 5.5 占了 4 个,剩下两个来自 MiMo-V2.6-...
推荐理由:Artificial Analysis 的 Pareto 前沿图本身就是选模型的硬参考,这次四个新模型一口气推了 11 个点,边界外移幅度不小。GPT-6 Luna 拿 5 个点说明它在多个成本档位都有竞争力,Claude Opus 5.5 的 4 个点也没差太远,两家的对位关系值得关注。正文没披露具体智能指数数值和单次任务成本数字,但点位分布本身已经够做初步判断了。
OpenAI 放出了一个叫 MentalHealthBench 的开源评测集,专门看 AI 在心理健康对话里表现怎么样。这个评测集是和 22 个国家、80 多位持证心理医生和精神科医生一起做的,覆盖了从日常情绪倾诉到紧急危机干预的各种场景,还分了成人、青少年、照顾者等不同角色。它不只看模型有没有触发安全红线,更会检查模型会不会主动追问背景、有没有尊重用...
推荐理由:OpenAI 放出了一个开源的、由 80 多位持证临床医生参与构建的心理健康评测集,覆盖场景很全,而且检查维度比常规安全测试更细,比如会看模型有没有主动追问背景、有没有尊重用户。这对做 AI 安全和产品的团队来说,是个能直接拿来用的工具。没给更高分是因为它目前还是个评测工具,不是产品落地或重大技术突破。
Anthropic 发了 Claude Opus 5.5,这是新 5.5 系列的第一个模型。官方说它在大多数任务上能追平之前的旗舰 Fable 5.1,但运行成本比 Opus 5 低了 40%,速度也快了约 30%。这次发布很少见地把写作改进放在了显眼位置:模型会把关键信息放在最前面,也更听你的风格指令,长对话读起来没那么累。Latent Space ...
推荐理由:Anthropic 发了新旗舰系列的第一个模型,声称性能持平 Fable 5.1 但便宜 40%,还把写作体验改进摆上台面——这对 Claude 重度用户是直接可操作的升级信号。没给 90 分以上是因为目前只有官方说法和 Latent Space 的初步观察,缺独立验证,先别太激动。
一项新研究把编程智能体的外层控制软件拆成了任务规划、上下文管理和动作接口三个独立开关,挨个测试。最扎眼的结果是:把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上的成功率涨了 3.6 个百分点,单任务估算成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却从...
推荐理由:这篇论文做了一个很干净的对照实验:把智能体的外层控制软件拆成任务规划、上下文管理和动作接口三个开关,单独拧动看效果。最反直觉的发现是,把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上成功率涨了 3.6 个百分点,单任务成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却直接掉了一截。这种同一开关、两个模型走向完全相反的结果,比单纯刷榜有信息量得多。正文没披露实验的统计显著性检验,这点先别太激动,但成本数字和成功率变化幅度已经足够让做工程的人重新审视自己...
Arena 放出了 OpenAI 两个新模型 GPT-6 Sol 和 GPT-6 Luna 的测试入口,目前还没公布评分。你可以直接去 Arena 让它们跑真实的智能体任务,然后投票,结果会进排行榜。正文没提模型规模、发布时间和定价,所以这些先别猜。
推荐理由:GPT-6 首次公开出现,两个变体在 Arena 上跑智能体任务,悬念和信号都很强。扣分是因为正文没提模型规模、发布时间和定价,目前只是一个测试入口,信息偏薄,所以分数我会先打个折。
OpenAI 在 GPT-6 系列里加了两个更省钱的模型:Sol 和 Luna。API 价格全部对折,Sol 输入/输出每百万 token 收 2/10 美元,Luna 只要 0.10/0.50 美元。Sol 在 AutomationBench 上开足马力拿到 33.2% 的分数,但每次任务成本只有 Claude Opus 5 的 9%;在 Agent...
推荐理由:OpenAI 官方发新模型,API 价格砍半,Sol 在 agent 基准上的成本只有竞品 9%,对整个行业的成本结构冲击很大。H、K、R 全中,定价和基准数据都给了。扣 3 分是因为正文没把 Sol 和 Luna 的能力差距说透,只知道 Sol 更强但贵,Luna 更省但弱,具体弱在哪没展开。