GPT-6.1 Sol 发布 7 天后接替 GPT-6 Sol,智能指数距 GPT-6 Astra 仅 1 分
GPT-6.1 Sol 在发布 7 天后接替 GPT-6 Sol,智能指数比 GPT-6 Astra 低 1 分,价格仍为每百万输入/输出 token 2 美元/10 美元,缓存读取折扣从 90% 升至 95%。
推荐理由:通过智能指数、成本与 token 效率的横向对比,读者可判断 GPT-6.1 Sol 在价格与能力之间的取舍。
GPT-6.1 Sol 在发布 7 天后接替 GPT-6 Sol,智能指数比 GPT-6 Astra 低 1 分,价格仍为每百万输入/输出 token 2 美元/10 美元,缓存读取折扣从 90% 升至 95%。
推荐理由:通过智能指数、成本与 token 效率的横向对比,读者可判断 GPT-6.1 Sol 在价格与能力之间的取舍。
Arena 公布 Claude Sonnet 5.5 (High) 在 Code Arena: WebDev 以 1699 分排第 4,混合价格约 $8 per Mtoken,比第 2、3 名便宜 80%。相较 Sonnet 5 (High) 的 1540 分提升 159 分,Reference-Based Design、Simulations、Gaming 均从第 30 多名升至第 4。
Reddit用户发帖说用一张RTX 3090跑Qwen 27B模型,生成了10万个token,吞吐量超过95 token/秒,上下文窗口开到262K。这个速度意味着本地跑长文本生成已经接近可用了——10万字级别的输出不用等太久。但帖子正文被Reddit屏蔽了,看不到具体用了什么量化、什么推理框架,也没法确认这是真实跑分还是某种优化后的极限测试。如果是真...
Claude Sonnet 5.5 是 5.5 家族的第二款模型,定位是日常编码、修 bug 和做文档、幻灯片这类边界清晰的工作。它跑得比 Sonnet 5 快 30% 以上,虽然输入输出单价没变(每百万 token 输入 2 美元、输出 10 美元),但完成同样任务用的 token 更少,实际单次任务成本最多能降 30%。在测模型自主编程能力的 Te...
推荐理由:Anthropic 正式发了 Claude Sonnet 5.5,是 5.5 家族的第二款模型。定位很明确:日常编码、修 bug、做文档这些边界清晰的任务。最抓人的点是 Terminal-Bench 从 10.3% 飙到 70.6%,速度快 30%,单价没变但实际任务成本降了 30%。我会先打个折——这个成本降幅的测算方式正文没展开,而且 Terminal-Bench 的测试环境是否贴近真实开发流程也没说。但整体信息量够、判断直接,是同一天必须写的模型更新。没给 95 是因为它更像是 Opus 5.5 的补充,不是独立扛旗的发布。
Claude Opus 5.5 (High) 在 Agent Arena 的净改进分是 +12.15%,排第 2,只输给 Fable 5.1 (Max)。中位价格每任务 $1.31,比上一代 Opus 5 (High) 便宜 40%,比 Opus 5 (Max) 便宜 56%——如果这个数据稳定,跑 agent 的成本确实降了一截。Steerabili...
推荐理由:Anthropic 的新模型在 Agent Arena 排第 2,同时价格砍了一截,是同一天就该写的产品信号。+12.15% 的净改进分和 $1.31 的中位成本给了硬数据,可控性提升是加分项。没打更高是因为这毕竟还是榜单成绩,正文没给真实场景的验证,我会先打个折。
Paper Instruments 开源了 Paper Office,在 python-docx、python-pptx 和 OpenPyxl 的基础上加了安全校验和更完整的编辑能力。他们用 5 个模型跑了 61 项任务,Paper 工具包加上引导后通过率 92.5%,直接用上游库是 80.7%,用 Anthropic 的 Office skills ...
推荐理由:Paper Instruments 开源了一套给 agent 用的 Office 文件编辑工具包,在 python-docx、python-pptx 和 OpenPyxl 上面加了安全校验和更完整的编辑能力。他们拿 5 个模型跑了 61 项任务,Paper 工具包加上引导后通过率 92.5%,直接用上游库是 80.7%,Anthropic 的 Office skills 更低一些。这个 11.8 个百分点的差距说明封装层确实有用,不是单纯套壳。正文没披露任务具体是什么类型、失败案例集中在哪,也没说安全校验具体拦了什么,这点先别太激动。但对已经在用 ...
这个基准测试把 629 条来自 AgentDojo 的注入攻击藏进搜索结果、邮件正文这类工具返回内容里,然后拿 Regex 和 Meta 的 Prompt Guard 2 去测。Regex 一条都没抓到,Prompt Guard 2 只抓到 1%。攻击不是直接发给模型的,而是混在模型调用的工具输出里,所以现有检测器基本是瞎的。代码和复现步骤都公开了,但...
推荐理由:这个基准测试把 629 条 AgentDojo 的注入攻击混进搜索结果、邮件正文这类工具返回内容里,然后拿 Regex 和 Meta 的 Prompt Guard 2 去测。Regex 一条都没抓到,Prompt Guard 2 只抓到 1%。攻击不是直接发给模型的,而是藏在模型调用的工具输出里,所以现有检测器基本是瞎的。代码和复现步骤都公开了,实用价值加分。但只测了两个检测器,没有横向对比更多方案,所以分数先停在 78。
Artificial Analysis 把 Claude Opus 5.5 放在 Claude Code 的“最大出力”模式下跑了一遍 Coding Agent Index,得分 66,比上一代 Opus 5 的 60 分高出 6 分。三项子测试全线上涨:Terminal-Bench 4.0 正确率 63.1%,DeepSWE v1.1 正确率 68....
推荐理由:Claude Opus 5.5 在 Artificial Analysis 的 Coding Agent Index 上拿了 66 分,比 Opus 5 高出 6 分,三项子测试全线上涨,登顶没问题。但单任务成本 13.04 美元是硬数字,比上一代贵了不少。这是独立第三方用 Claude Code 的“最大出力”模式实测的结果,数据具体、来源可信,对实际用的人有直接参考意义。没给更高分是因为这只是单一基准测试,不代表整体能力。
Anthropic 发了 Claude Opus 5.5,这是新 5.5 系列的第一个模型。官方说它在大多数任务上能追平之前的旗舰 Fable 5.1,但运行成本比 Opus 5 低了 40%,速度也快了约 30%。这次发布很少见地把写作改进放在了显眼位置:模型会把关键信息放在最前面,也更听你的风格指令,长对话读起来没那么累。Latent Space ...
推荐理由:Anthropic 发了新旗舰系列的第一个模型,声称性能持平 Fable 5.1 但便宜 40%,还把写作体验改进摆上台面——这对 Claude 重度用户是直接可操作的升级信号。没给 90 分以上是因为目前只有官方说法和 Latent Space 的初步观察,缺独立验证,先别太激动。
一项新研究把编程智能体的外层控制软件拆成了任务规划、上下文管理和动作接口三个独立开关,挨个测试。最扎眼的结果是:把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上的成功率涨了 3.6 个百分点,单任务估算成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却从...
推荐理由:这篇论文做了一个很干净的对照实验:把智能体的外层控制软件拆成任务规划、上下文管理和动作接口三个开关,单独拧动看效果。最反直觉的发现是,把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上成功率涨了 3.6 个百分点,单任务成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却直接掉了一截。这种同一开关、两个模型走向完全相反的结果,比单纯刷榜有信息量得多。正文没披露实验的统计显著性检验,这点先别太激动,但成本数字和成功率变化幅度已经足够让做工程的人重新审视自己...
Arena 放出了 OpenAI 两个新模型 GPT-6 Sol 和 GPT-6 Luna 的测试入口,目前还没公布评分。你可以直接去 Arena 让它们跑真实的智能体任务,然后投票,结果会进排行榜。正文没提模型规模、发布时间和定价,所以这些先别猜。
推荐理由:GPT-6 首次公开出现,两个变体在 Arena 上跑智能体任务,悬念和信号都很强。扣分是因为正文没提模型规模、发布时间和定价,目前只是一个测试入口,信息偏薄,所以分数我会先打个折。
OpenAI 在 GPT-6 系列里加了两个更省钱的模型:Sol 和 Luna。API 价格全部对折,Sol 输入/输出每百万 token 收 2/10 美元,Luna 只要 0.10/0.50 美元。Sol 在 AutomationBench 上开足马力拿到 33.2% 的分数,但每次任务成本只有 Claude Opus 5 的 9%;在 Agent...
推荐理由:OpenAI 官方发新模型,API 价格砍半,Sol 在 agent 基准上的成本只有竞品 9%,对整个行业的成本结构冲击很大。H、K、R 全中,定价和基准数据都给了。扣 3 分是因为正文没把 Sol 和 Luna 的能力差距说透,只知道 Sol 更强但贵,Luna 更省但弱,具体弱在哪没展开。
Arena 把 Claude Opus 5.5 放上了 Agent Arena,让模型直接干长链条的活——可以自己上网搜资料、读写文件、敲命令行。排行榜不只看输赢,用的是因果追踪,看它比平均水平强多少。正文没具体说 Battle Mode 怎么打,也没给任务例子,所以实际有多能打还得等实测。
推荐理由:Opus 5.5 上 Agent Arena 是本周最值得盯的第三方评测信号。因果追踪的排行榜设计比原始胜率多一层信息,但正文没给具体任务例子,也没说 Battle Mode 规则,实际能打程度还得等社区跑完再看——这点先别太激动。
Claude Opus 5.5 在 Artificial Analysis 的智能指数上得了 58 分,是目前测过的最高分。它在 10 项评测里 6 项领先,比如在 Humanity's Last Exam 上正确率 61.4%,SciCode 上 66.9%,Terminal-Bench 4.0 上 59.6%,跟 GPT-6 Astra 打平。在模...
推荐理由:Anthropic 的旗舰模型在一个有分量的第三方基准上拿了第一,同时降价 20%,属于当天必写。没给 95 分是因为这毕竟只是基准测试结果,不是模型发布本身,但 6/10 项领先、跟 GPT-6 Astra 打平、价格还降了,放在 featured 档很合适。
文章标题说卡兹克对比了 Grok 4.7 和小米 MiMo V2.6,结论是 MiMo V2.6 解决了“不可能三角”(通常指模型在成本、速度、质量上难以兼得)。但正文被微信屏蔽,只显示环境异常和验证页面,没有披露任何模型参数、测试方法或具体结果。所以这条信息目前只有结论,没有证据支撑。
小米发了两个全模态模型 MiMo-V2.6-Pro 和 Flash。Pro 版在 Code Arena 的网页开发榜上拿了 1628 分,比上一代 MiMo-V2.5-Pro 的 1475 分涨了 153 分,整体排第10名上下,在 MIT 许可的开源权重模型里大概排第3。Flash 版的跑分和参数量正文都没提。
推荐理由:小米 MiMo-V2.6-Pro 在 Code Arena WebDev 榜上排第10名上下,开源权重模型里约第3,分数比上代涨了 153 分,有具体数字支撑。Flash 版参数量和跑分正文都没提,信息有缺口,所以重要性给到 78 比较合适,先别往更高拔。
小米放出了 MiMo-V2.6-Pro,在 Artificial Analysis 的智能指数上拿了 46 分,比上一代 V2.5-Pro 的 26 分涨了不少,现在是开放权重模型里最高的。不过正文没提参数量、具体架构和什么时候能公开用,这些关键信息都还缺着,所以这个分数先别太激动。
推荐理由:小米的 MiMo-V2.6-Pro 在开放权重模型智能指数上登顶,分数从 26 涨到 46,进步明显,属于国产旗舰模型的正面信号。但正文没给参数量、架构和发布时间,关键信息缺着,所以分数先打个折。
马斯克引用 Artificial Analysis 的评测说,Grok 4.7 让 xAI 在智能体编码能力上排到第三,仅次于 Anthropic 和 OpenAI。但正文没披露具体评测指标、分数或版本对比,只有排名和对手。这个排名如果是真的,说明 Grok 在让模型自主写代码、调工具这类任务上进步明显,但缺少数据支撑,建议先观望。
Dan McKinley 在演讲里说,整天跟大模型来回改提示词是条死胡同。他做面向消费者的 agent 时发现,哪怕用了结构化输出,模型还是会在一小部分请求里发疯,比如把标题字段塞满废话直到爆掉。他试出来的一个离谱解法是把字段名从“title”改成“heading”,暂时管用,但随时可能失效。他的核心观点是,提示词本身靠不住,得靠 pass^k 测试和...
推荐理由:Dan McKinley 拿自己搭消费者 agent 的实战经验说话,案例具体、判断尖锐。但这是个人演讲,不是正式论文,正文也没披露 pass^k 测试的通过率和规模,所以我会先打个折。
DXOMARK 给 iPhone 18 Pro 相机打了 172 分,排全球第二。最大亮点是可调光圈(f/1.48–f/4.0),复杂场景下也能保持画面锐度。自动对焦稳定,眩光比上一代控制得好,但光圈收小时仍可能出现绿斑。主摄 48MP,超广角 48MP 120°,长焦 48MP 8 倍光学变焦。
Ben Swerdlow 让 19 个模型在《星际争霸:母巢之战》里互相对打,结果没有哪个模型能玩到新手以上的水平。Codex Astra 的 xhigh 版本以 18 胜 0 负排第一,但它靠的不是运营,而是早期派一个探机去骚扰对手工人,对面模型会花几十秒思考怎么处理,直接瘫痪。Grok 4.6 表现最差,xhigh 版本在 43 分钟里只发出了 6...
推荐理由:Ben Swerdlow 搞了个《母巢之战》模型对战测试,19 个模型互打,没一个能赢新手。Codex Astra 的 xhigh 版 18 胜 0 负排第一,但赢法不是靠运营,而是早期派一个探机去骚扰农民,对面模型会花几十秒想对策,直接卡死。Grok 4.6 最拉胯,xhigh 版 43 分钟里只发出 6 个有效动作。这个测试把模型在实时环境里的反应延迟和决策瘫痪暴露得很直观,数据也扎实,胜率、APM、单局成本都有。我会先打个折,因为这只是一个人做的非正式 benchmark,样本量和环境控制有限,但信号很强,值得从业者看一眼。
Vals 拿了 a16z 的投资,想当 AI 模型评测的“中立第三方”。现在各家模型厂商都自己出分,Vals 想站出来当那个大家信得过的裁判。不过正文没披露它的评测方法、技术细节和早期客户,所以它到底怎么保证中立、怎么避免自己也变成另一个刷分工具,目前还看不出来。
Reddit 上有人发了个新测试集叫 AndroidLife,专门看 AI 智能体能不能完成一个真实用户一天里会做的各种任务。目前只放了一个结果:Qwen3.8-27b 跑下来成功率 56.7%,刚过一半。正文被 Reddit 屏蔽了,所以具体测了哪些任务、怎么算成功、有没有对比其他模型,一概没披露。这个数字本身不算惊艳,但方向有意思——以前测智能体多...
UC Berkeley 和 Arena 的研究人员把 7 个模型装进 3 种不同的编程助手外壳(Claude Code、Codex CLI 和 Pi),在 SWE-bench Lite 和 Terminal-Bench 2.0 上各跑了 30 个任务,每个组合重复 3 次。结果发现,换外壳对任务成功率影响很小(±2–5%),但成本最多能差到 5 倍。比...
推荐理由:UC Berkeley和Arena的人做了件挺实在的事:把7个模型塞进3种不同的编程助手外壳里跑分,结果发现换壳对能不能完成任务影响很小,但花的钱最多能差5倍。这个结论对天天在终端里切工具的开发者来说很实用,而且实验设计干净、数字具体,没有吹牛成分。分数定在78,因为正文摘要没展开讲成本差异具体从哪来、不同外壳的失败模式有什么不同,信息有缺口,先不打更高。
Rohan Bansal 拿 Qwen 4B 模型做实验,先让 GPT-6 Astra 当老师,用 500 条示范轨迹做监督微调,再设计了一套强化学习变体,让模型自己生成查询计划、扔到 Postgres 里实测耗时,根据快慢给奖励信号来更新权重。在 113 条多表联查的 SQL 上,最终模型生成的计划比 Postgres 默认计划延迟降低 44.7%,...
推荐理由:一个 4B 小模型,靠强化学习训出来的查询计划比 Postgres 默认计划快 81%,方法本身有实用价值。但测试只跑了 113 条多表联查 SQL,能不能泛化到其他场景还没验证,所以分数卡在 78。
Arena 把四个新模型丢进了图片转网页的评测榜单。GPT-6 Astra(Max)拿了 1733 分排第一,比第二名的 GPT-5.6 Sol(xHigh)高出 129 分。Claude Fable 5.1(Max)1710 分排第三,Muse Spark 1.3(Max)1645 分第四,GLM-5.3-Flash 1588 分第十。正文没披露具体...
推荐理由:GPT-6 Astra 首秀就登顶,领先幅度 129 分,这个信号够硬,值得上首页。但正文只给了分数和排名,没展开方法细节或模型差异,读起来像一条快讯。H 和 K 都踩中了,R 缺位,整体重要性我给 72 分,放在 featured 里刚好。
Good Start Labs 拿一款 30B 参数的模型在铁路经营游戏《1830》里训练,然后让它去做金融研究任务——查数据库、写 Excel 公式、边推理边算。结果发现,只有做成多轮终端智能体(让模型自己用工具探索环境、实时调整策略)的版本,技能才迁移得过去;单轮问答式的训练就没这个效果。这家公司去年 10 月从 Every 分拆出来,拿了 360...
推荐理由:实验设计有新意,给出了技能迁移的正面证据和一个失败对照组,对 agent 训练研究有参考价值。但公司刚分拆出来,产品路径不明,金融任务上也没给具体数字,所以我会先打个折,重要性给到 72。
Michael Noukhovitch 写了篇博客介绍他新论文里的发现:用强化学习(RL)做模型后训练时,会出现马太效应——训练越往后,模型越爱挑简单题做,难题被采样的次数越来越少,因为早期在简单题上拿到的奖励把训练方向带偏了。他提出的修正方法叫 Never Give Up(NGU),核心是给难题设一个最低采样比例,不让它们被挤掉。在 Olmo 3.1...
推荐理由:Michael Noukhovitch 把自家论文写成了博客,讲的是 RL 后训练里一个隐蔽的退化现象:模型会越来越爱做简单题,难题采样率一路下滑,因为早期简单题的奖励把训练方向带偏了。他管这个叫马太效应,提出的修正方案 NGU 就是给难题设最低采样比例,强制保留训练信号。正文没披露 NGU 在 Olmo 3.1 之外更多模型上的验证结果,这点先别太激动,但思路本身对正在跑 RL 流程的团队有直接参考价值。
OpenAI 的 Tibo 公开承认 Astra 需求前所未有,可能暂停新 Pro 订阅,群友反映谷时段也卡顿、WebSocket 频繁断连。DeepSeek V4.1 Flash 在 OpenDesign 的设计任务评测中拿到 81.2 分,达到 Astra 的 98%,但成本只有 Astra 的 1.4%。不过群友扒出 DeepSeek API 强...
两场千人级实验揭开了同一个真相。土耳其高中数学课上,用 ChatGPT 做练习的学生成绩暴涨 48%,但一关屏幕独立考试,分数反而比没用 AI 的对照组低了 17%。屏幕亮着时的漂亮卷面,只是向外部算力借来的下限,一断网就清零。米兰商学院的营销写作实验更微妙:用了 AI 的学生,作业得分在 5 分制上高出近 1 分,表达逼近专家水平。但实验同时发现,那...
推荐理由:两场千人级随机对照实验给出了硬数字,把 AI 辅助学习的幻觉拆得很清楚:练习分数虚高,闭卷考试反而倒退,学生跳过推理直接抄答案。HKR 三项都强,但文章是综述性质,不是一手研究发布,所以分数压在 85 以下。
GPT-6 Astra(Max 版本)在 Code Arena 的网页开发专项榜上跑出 1797 分,排第一。第二名 Claude Fable 5.1(Max)是 1762 分,第三名 Claude Opus 5(Max)1688 分。这条信息只来自一条推文,正文没披露测试样本量、具体任务类型和响应延迟,所以这个领先幅度先别太当真,等有更多细节再判断。
推荐理由:GPT-6 在 Code Arena 网页开发专项上首次超过 Claude,35 分的差距值得聊一聊。但消息只来自一条推文,没给测试样本量、具体任务和响应延迟,分数先打个折,等更多信息出来再调整。
François Chollet 放出了 GPT-6 Astra 在 ARC-AGI-3 上的成绩。用标准测试流程只拿到 66%,但换成持续对话模式,加上自定义的上下文压缩,分数直接逼近 100%。这个接近满分的表现不是模型自己一次答出来的,而是靠多轮对话和额外处理堆上去的,所以别把它当成模型已经具备通用推理能力。每道题的成本大约 360 美元,正文没...
推荐理由:Chollet 自己公布了 GPT-6 Astra 在 ARC-AGI-3 上的成绩:标准流程只拿 66%,换成持续对话加自定义上下文压缩才逼近满分,每道题烧掉约 360 美元。我会先打个折——这不是模型自己一次答对的,是反复对话和额外处理堆出来的,别直接当成通用推理能力。但分数反差和成本摆在那,做推理评估的人不看说不过去。
Artificial Analysis 用自家 Coding Agent Index 测了 GPT-6 Astra,得分 67,跟 Claude Opus 5 和 Fable 5 打平。成本比 Fable 5 便宜一半以上,但跟 GPT-5.6 Sol(max)比贵了约 2.5 倍。token 效率比 GPT-5.6 Sol 高出约 70%,说明同样任...
推荐理由:Artificial Analysis 的 Coding Agent Index 是独立第三方评测,GPT-6 Astra 拿了 67 分,跟 Claude Opus 5 和 Fable 5 打平。token 效率比 GPT-5.6 Sol 高出约 70%,说明同样任务消耗更少 token,但单价涨了约 2.5 倍,实际花销反而更高。比 Fable 5 便宜一半以上这点挺实在,但正文没披露具体价格数字,只能看相对比例。我会先打个折:这是第三方跑分,不是官方数据,实际业务里表现可能有出入。不过价格和效率的反差确实让选型的人得重新算账,所以给了 fea...
Artificial Analysis 的编码智能体指数把 Meta Muse Spark 1.3(max 配置,跑在 Muse Code 上)和 Claude Code + Opus 5(xhigh 配置)都标了 68 分,并列第一梯队。帖子只给了分数,没拆具体任务、延迟和成本,所以这个平手先别太当真——等详细数据出来再看值不值得切模型。
Meta 发布了 Muse Spark 1.3,这是五个月内的第四个版本,迭代速度很快。xhigh 变体在 Artificial Analysis 的智能指数上得了 61 分,主要提升在科学推理和智能体能力上。但正文没披露具体改进了什么、怎么训练的,所以这点先别太激动——分数本身不说明绝对水平,得看跟谁比、怎么测的。
Haus Research 用 310 个关于科技公司的具体问题去测 Perplexity 的两个搜索模型,然后逐个点开它给的引用链接核对。结果发现,在 1826 个带数字的句子后面附上的引用里,有 34.7% 的链接要么打不开,要么打开的页面里压根找不到那句话里的任何一个数字。如果按“只要有一个引用能对上就算过”的宽松标准,也有 14.4% 的说法找...
推荐理由:Haus Research 用 310 个科技公司问题测了 Perplexity 两个搜索模型,手动点开 1826 条带数字的引用链接核对,发现 34.7% 的链接要么失效要么页面里根本没有那个数字。方法交代得清楚,样本量也够,不是随便黑一下。我会先打个折——宽松标准下 14.4% 的说法找不到任何支撑链接,这个数字更贴近实际使用感受,但依然说明引用质量有硬伤。正文没披露测试时用的具体模型版本和日期,这点信息缺口让结论的时效性打了点折扣。
Multiverse Computing 推出了他们的第一个大模型 Quasar 438B,一个面向企业级智能体和编程的推理模型,支持英语和西班牙语。在 Artificial Analysis 的智力指数上,它拿了 43 分,是目前欧洲模型里的最高分,比 Mistral Medium 3.5 的 30 分和 NVIDIA Nemotron 3 Ultr...
推荐理由:欧洲第一个 438B 推理模型,有具体跑分和对手对比,信号够强。但来源是厂商自述,还没看到独立评测,所以分数卡在 featured 门槛上。
Anthropic 在 9 月 1 日推出了 Claude Fable 5.1 和 Mythos 5.1,主打编程和知识工作。Fable 5.1 在 Terminal-Bench 4.0 上拿到 55.8% 的分数,官方把它定位成能自己跑多步复杂任务的模型。价格方面,缓存读取费砍了 75%,降到每百万 token 0.25 美元,但 Artificia...
推荐理由:Anthropic 发了 Claude Fable/Mythos 5.1,Terminal-Bench 4.0 得分 55.8%,缓存读取价砍了 75% 到每百万 token 0.25 美元,输出 token 上限涨了 70%。能力升级加定价大调整,当天就该写。没给 95 是因为目前只有 Lat 的初步数据,实际表现和稳定性还得等更多反馈。
Allen AI 开源了一套叫 BenchMIRT 的方法,用多维项目反应理论(MIRT)来审查大模型评测基准到底在考什么。他们分析了 100 个模型在 16 个基准、超过 3.4 万道题上的表现,没给任何预设,系统自动分离出两个核心能力维度:安全性和通用推理能力。比如 BBQ 基准里一道关于祖孙俩叫 Uber 的题,表面测年龄偏见,实际上还要求模型理...
推荐理由:Allen AI 开源了一套方法,拿项目反应理论来审计评测基准,背后有 100 个模型和 3.4 万道题撑腰。分数没上 80 是因为它是个方法论工具,不是能直接上线的产品更新,但 H、K、R 三个点都踩实了,信息也够硬。
OpenAI 正在灰度测试 Astra 模型,能零样本一次生成完整前端网页,测试者直呼“前端已解决”。Anthropic 在赶 Fable 5.1,两边已经开始用同一张 SVG 图隔空比细节稳定性。另一边,Claude Code 的安全机制把危险的文件清理任务降级给更弱的 Opus 4.8,结果它正确识别了主目录不能删,下一秒还是删掉了 700GB 数...
推荐理由:Astra 对 Fable 5.1 的隔空对决是本周最好看的叙事,四个技术方向让消息有料,“前端已解决”这种说法又足够刺激。但信源是群聊日报,转述的是微信文章和推文截图,没有一手技术报告,所以我会先打个折——方向值得盯,结论别急着全信。