GPT-6.1 Sol 发布 7 天后接替 GPT-6 Sol,智能指数距 GPT-6 Astra 仅 1 分
GPT-6.1 Sol 在发布 7 天后接替 GPT-6 Sol,智能指数比 GPT-6 Astra 低 1 分,价格仍为每百万输入/输出 token 2 美元/10 美元,缓存读取折扣从 90% 升至 95%。
推荐理由:通过智能指数、成本与 token 效率的横向对比,读者可判断 GPT-6.1 Sol 在价格与能力之间的取舍。
GPT-6.1 Sol 在发布 7 天后接替 GPT-6 Sol,智能指数比 GPT-6 Astra 低 1 分,价格仍为每百万输入/输出 token 2 美元/10 美元,缓存读取折扣从 90% 升至 95%。
推荐理由:通过智能指数、成本与 token 效率的横向对比,读者可判断 GPT-6.1 Sol 在价格与能力之间的取舍。
Arena 公布 Claude Sonnet 5.5 (High) 在 Code Arena: WebDev 以 1699 分排第 4,混合价格约 $8 per Mtoken,比第 2、3 名便宜 80%。相较 Sonnet 5 (High) 的 1540 分提升 159 分,Reference-Based Design、Simulations、Gaming 均从第 30 多名升至第 4。
Arena 宣布 OpenAI 的 GPT-6.1 已上线 Agent Arena,用户投票将影响其评估,分数即将公布。Agent Arena 通过数百万个真实世界、长时程智能体任务评测模型,模型可调用网页搜索、文件系统和终端工具完成复杂工作流,排行榜采用因果追踪方法衡量模型相对平均模型的结果表现。
OpenAI 发布 GPT-6.1 Sol,升级了智能体编码和 computer use 能力,接近 Astra 性能。缓存输入定价为标准输入价格的 95% 折扣,模型面向复杂重构、深度代码库调查和跨应用长时间运行的智能体。
推荐理由:OpenAI 发布 GPT-6.1 Sol,读者可了解其在智能体编码与 computer use 上的能力升级及缓存输入定价。
OpenAI 在 DevDay 上发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra 的智能水平,标准输入输出 token 价格仅为后者的五分之一。
推荐理由:读者可了解 GPT-6.1 Sol 在智能体编码与事实准确性上的具体提升,以及 GPT-6.1 Astra 因安全顾虑被搁置的背景。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和办公任务上接近因安全问题未按计划发布的旗舰模型 GPT-6.1 Astra,成本约为后者的五分之一。
推荐理由:原文给出 Sol 与 Astra、Opus 5.5 的定价和多项基准对比,可据此判断低价替代方案的能力边界。
ElevenLabs 发布 Eleven v4 语音模型,能更准确跟随脚本中的情绪、停顿与音效标签,并在长篇制作中保持音色一致。新架构同时驱动 Turbo 版本,官方测试中约 150 毫秒开始输出语音,对比 Cartesia Sonic 3.6 的 262 毫秒和 OpenAI GPT-4o mini TTS 的 814 毫秒。
PostHog 开源了一个叫 Jeeves 的项目,核心思路是用推理(reasoning)来改进类似 Jev 的决策模型。简单说,就是让模型在做出判断前先“想一想”,而不是直接给结果。不过目前 GitHub 仓库只有一个 2026 年 9 月 29 日的提交,正文没有披露具体的模型架构、参数量或性能数据,所以效果到底怎么样、成本高不高,都还不清楚。如果...
OpenAI 发布 GPT-6.1 Sol,定位为面向编码、计算机操作和专业工作的接近 Astra 级智能。其标准 API 输入与输出 token 价格为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,读者可了解其面向编码与计算机操作的能力定位及定价变化。
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出本周发布的 Claude Opus 5.5 在讲解视频生成上表现突出,并以 88.4% 领跑 SimpleBench。
Jeff 是一组从 Qwen3.5 和 Gemma 4 微调出来的 0.8B 参数小模型,专门做零样本分类——也就是不给例子直接判断类别。亮点是作者说在家用普通显卡上就能训练,推理一次只要 30 毫秒左右,延迟很低,适合塞进实时决策流程。模型兼容 Jev 格式,GitHub 上放了代码和权重。不过正文没披露用了多大训练集、在什么基准上测过,所以实际效果...
Reddit用户发帖说用一张RTX 3090跑Qwen 27B模型,生成了10万个token,吞吐量超过95 token/秒,上下文窗口开到262K。这个速度意味着本地跑长文本生成已经接近可用了——10万字级别的输出不用等太久。但帖子正文被Reddit屏蔽了,看不到具体用了什么量化、什么推理框架,也没法确认这是真实跑分还是某种优化后的极限测试。如果是真...
Claude Sonnet 5.5 是 5.5 家族的第二款模型,定位是日常编码、修 bug 和做文档、幻灯片这类边界清晰的工作。它跑得比 Sonnet 5 快 30% 以上,虽然输入输出单价没变(每百万 token 输入 2 美元、输出 10 美元),但完成同样任务用的 token 更少,实际单次任务成本最多能降 30%。在测模型自主编程能力的 Te...
推荐理由:Anthropic 正式发了 Claude Sonnet 5.5,是 5.5 家族的第二款模型。定位很明确:日常编码、修 bug、做文档这些边界清晰的任务。最抓人的点是 Terminal-Bench 从 10.3% 飙到 70.6%,速度快 30%,单价没变但实际任务成本降了 30%。我会先打个折——这个成本降幅的测算方式正文没展开,而且 Terminal-Bench 的测试环境是否贴近真实开发流程也没说。但整体信息量够、判断直接,是同一天必须写的模型更新。没给 95 是因为它更像是 Opus 5.5 的补充,不是独立扛旗的发布。
Claude Opus 5.5 (High) 在 Agent Arena 的净改进分是 +12.15%,排第 2,只输给 Fable 5.1 (Max)。中位价格每任务 $1.31,比上一代 Opus 5 (High) 便宜 40%,比 Opus 5 (Max) 便宜 56%——如果这个数据稳定,跑 agent 的成本确实降了一截。Steerabili...
推荐理由:Anthropic 的新模型在 Agent Arena 排第 2,同时价格砍了一截,是同一天就该写的产品信号。+12.15% 的净改进分和 $1.31 的中位成本给了硬数据,可控性提升是加分项。没打更高是因为这毕竟还是榜单成绩,正文没给真实场景的验证,我会先打个折。
LaunchVideo 的做法是:你给它一个网址或一段文字描述,Opus 5.5 直接写 HTML、CSS 和动画脚本,然后一个无头 Chromium 微虚拟机逐帧渲染成 1080p 30fps 的 MP4。整个过程没有用到视频生成模型,靠的是把页面里的时钟(requestAnimationFrame、Date、CSS 动画等)替换成虚拟时钟,保证每一...
推荐理由:把 Opus 5.5 的写代码能力包装成“贴链接出视频”的工具,管线解释得清楚,例子也看得见,H 和 K 都打中了。但产品本身还轻,R 偏弱,分数刚好卡在 featured 门槛上。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次切换的动态视觉形象。
推荐理由:原文给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 语言支持,可据此判断企业级多模态交互的落地形态。
Paper Instruments 开源了 Paper Office,在 python-docx、python-pptx 和 OpenPyxl 的基础上加了安全校验和更完整的编辑能力。他们用 5 个模型跑了 61 项任务,Paper 工具包加上引导后通过率 92.5%,直接用上游库是 80.7%,用 Anthropic 的 Office skills ...
推荐理由:Paper Instruments 开源了一套给 agent 用的 Office 文件编辑工具包,在 python-docx、python-pptx 和 OpenPyxl 上面加了安全校验和更完整的编辑能力。他们拿 5 个模型跑了 61 项任务,Paper 工具包加上引导后通过率 92.5%,直接用上游库是 80.7%,Anthropic 的 Office skills 更低一些。这个 11.8 个百分点的差距说明封装层确实有用,不是单纯套壳。正文没披露任务具体是什么类型、失败案例集中在哪,也没说安全校验具体拦了什么,这点先别太激动。但对已经在用 ...
这个基准测试把 629 条来自 AgentDojo 的注入攻击藏进搜索结果、邮件正文这类工具返回内容里,然后拿 Regex 和 Meta 的 Prompt Guard 2 去测。Regex 一条都没抓到,Prompt Guard 2 只抓到 1%。攻击不是直接发给模型的,而是混在模型调用的工具输出里,所以现有检测器基本是瞎的。代码和复现步骤都公开了,但...
推荐理由:这个基准测试把 629 条 AgentDojo 的注入攻击混进搜索结果、邮件正文这类工具返回内容里,然后拿 Regex 和 Meta 的 Prompt Guard 2 去测。Regex 一条都没抓到,Prompt Guard 2 只抓到 1%。攻击不是直接发给模型的,而是藏在模型调用的工具输出里,所以现有检测器基本是瞎的。代码和复现步骤都公开了,实用价值加分。但只测了两个检测器,没有横向对比更多方案,所以分数先停在 78。
Artificial Analysis 把 Claude Opus 5.5 放在 Claude Code 的“最大出力”模式下跑了一遍 Coding Agent Index,得分 66,比上一代 Opus 5 的 60 分高出 6 分。三项子测试全线上涨:Terminal-Bench 4.0 正确率 63.1%,DeepSWE v1.1 正确率 68....
推荐理由:Claude Opus 5.5 在 Artificial Analysis 的 Coding Agent Index 上拿了 66 分,比 Opus 5 高出 6 分,三项子测试全线上涨,登顶没问题。但单任务成本 13.04 美元是硬数字,比上一代贵了不少。这是独立第三方用 Claude Code 的“最大出力”模式实测的结果,数据具体、来源可信,对实际用的人有直接参考意义。没给更高分是因为这只是单一基准测试,不代表整体能力。
Jevper 是一个轻量封装,让任何兼容 OpenAI 接口的模型输出分类概率和置信度分数,而不是直接吐文字。它复刻了 Jev 的“TypeSafe System One”接口,把生成模型当分类器用。项目没给基准测试或生产案例,但思路很直接:用概率做决策,而不是靠模型自己写答案。如果你需要模型在几个固定类别里做选择,并且想知道它有多确定,这个工具能省掉...
Anthropic 发了 Claude Opus 5.5,这是新 5.5 系列的第一个模型。官方说它在大多数任务上能追平之前的旗舰 Fable 5.1,但运行成本比 Opus 5 低了 40%,速度也快了约 30%。这次发布很少见地把写作改进放在了显眼位置:模型会把关键信息放在最前面,也更听你的风格指令,长对话读起来没那么累。Latent Space ...
推荐理由:Anthropic 发了新旗舰系列的第一个模型,声称性能持平 Fable 5.1 但便宜 40%,还把写作体验改进摆上台面——这对 Claude 重度用户是直接可操作的升级信号。没给 90 分以上是因为目前只有官方说法和 Latent Space 的初步观察,缺独立验证,先别太激动。
蚂蚁开源了 Ming-Image-0.1-Design 系列,包含两个 6B 参数模型,分别负责设计图生成和图层编辑。6B 参数属于中等规模,比动辄几十B的大模型更轻量,部署成本低。但原文页面被拦截,正文没披露模型架构、训练数据、评测指标,也没说跟现有方案比效果如何。目前能确认的是:开源、两个模型、覆盖从生成到编辑的流程。具体能不能打,得等代码和权重放...
一项新研究把编程智能体的外层控制软件拆成了任务规划、上下文管理和动作接口三个独立开关,挨个测试。最扎眼的结果是:把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上的成功率涨了 3.6 个百分点,单任务估算成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却从...
推荐理由:这篇论文做了一个很干净的对照实验:把智能体的外层控制软件拆成任务规划、上下文管理和动作接口三个开关,单独拧动看效果。最反直觉的发现是,把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上成功率涨了 3.6 个百分点,单任务成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却直接掉了一截。这种同一开关、两个模型走向完全相反的结果,比单纯刷榜有信息量得多。正文没披露实验的统计显著性检验,这点先别太激动,但成本数字和成功率变化幅度已经足够让做工程的人重新审视自己...
Arena 放出了 OpenAI 两个新模型 GPT-6 Sol 和 GPT-6 Luna 的测试入口,目前还没公布评分。你可以直接去 Arena 让它们跑真实的智能体任务,然后投票,结果会进排行榜。正文没提模型规模、发布时间和定价,所以这些先别猜。
推荐理由:GPT-6 首次公开出现,两个变体在 Arena 上跑智能体任务,悬念和信号都很强。扣分是因为正文没提模型规模、发布时间和定价,目前只是一个测试入口,信息偏薄,所以分数我会先打个折。
OpenAI 在 GPT-6 系列里加了两个更省钱的模型:Sol 和 Luna。API 价格全部对折,Sol 输入/输出每百万 token 收 2/10 美元,Luna 只要 0.10/0.50 美元。Sol 在 AutomationBench 上开足马力拿到 33.2% 的分数,但每次任务成本只有 Claude Opus 5 的 9%;在 Agent...
推荐理由:OpenAI 官方发新模型,API 价格砍半,Sol 在 agent 基准上的成本只有竞品 9%,对整个行业的成本结构冲击很大。H、K、R 全中,定价和基准数据都给了。扣 3 分是因为正文没把 Sol 和 Luna 的能力差距说透,只知道 Sol 更强但贵,Luna 更省但弱,具体弱在哪没展开。
Arena 把 Claude Opus 5.5 放上了 Agent Arena,让模型直接干长链条的活——可以自己上网搜资料、读写文件、敲命令行。排行榜不只看输赢,用的是因果追踪,看它比平均水平强多少。正文没具体说 Battle Mode 怎么打,也没给任务例子,所以实际有多能打还得等实测。
推荐理由:Opus 5.5 上 Agent Arena 是本周最值得盯的第三方评测信号。因果追踪的排行榜设计比原始胜率多一层信息,但正文没给具体任务例子,也没说 Battle Mode 规则,实际能打程度还得等社区跑完再看——这点先别太激动。
Claude Opus 5.5 在 Artificial Analysis 的智能指数上得了 58 分,是目前测过的最高分。它在 10 项评测里 6 项领先,比如在 Humanity's Last Exam 上正确率 61.4%,SciCode 上 66.9%,Terminal-Bench 4.0 上 59.6%,跟 GPT-6 Astra 打平。在模...
推荐理由:Anthropic 的旗舰模型在一个有分量的第三方基准上拿了第一,同时降价 20%,属于当天必写。没给 95 分是因为这毕竟只是基准测试结果,不是模型发布本身,但 6/10 项领先、跟 GPT-6 Astra 打平、价格还降了,放在 featured 档很合适。
文章标题说卡兹克对比了 Grok 4.7 和小米 MiMo V2.6,结论是 MiMo V2.6 解决了“不可能三角”(通常指模型在成本、速度、质量上难以兼得)。但正文被微信屏蔽,只显示环境异常和验证页面,没有披露任何模型参数、测试方法或具体结果。所以这条信息目前只有结论,没有证据支撑。
oMLX 的作者 Jun Kim 加入 Hugging Face,专职支持 MLX 社区。oMLX 是苹果 MLX 框架的扩展库,能让大模型在 Mac 上跑得更高效。正文没披露具体合作细节或后续计划。
TypeSafe AI 发布 Jev,一种被称为 System One 或决策模型的新形态模型,输入文本后不输出文本,而是返回类别、是/否、评分对应的浮点数和置信度。
小米发了两个全模态模型 MiMo-V2.6-Pro 和 Flash。Pro 版在 Code Arena 的网页开发榜上拿了 1628 分,比上一代 MiMo-V2.5-Pro 的 1475 分涨了 153 分,整体排第10名上下,在 MIT 许可的开源权重模型里大概排第3。Flash 版的跑分和参数量正文都没提。
推荐理由:小米 MiMo-V2.6-Pro 在 Code Arena WebDev 榜上排第10名上下,开源权重模型里约第3,分数比上代涨了 153 分,有具体数字支撑。Flash 版参数量和跑分正文都没提,信息有缺口,所以重要性给到 78 比较合适,先别往更高拔。
小米放出了 MiMo-V2.6-Pro,在 Artificial Analysis 的智能指数上拿了 46 分,比上一代 V2.5-Pro 的 26 分涨了不少,现在是开放权重模型里最高的。不过正文没提参数量、具体架构和什么时候能公开用,这些关键信息都还缺着,所以这个分数先别太激动。
推荐理由:小米的 MiMo-V2.6-Pro 在开放权重模型智能指数上登顶,分数从 26 涨到 46,进步明显,属于国产旗舰模型的正面信号。但正文没给参数量、架构和发布时间,关键信息缺着,所以分数先打个折。
马斯克引用 Artificial Analysis 的评测说,Grok 4.7 让 xAI 在智能体编码能力上排到第三,仅次于 Anthropic 和 OpenAI。但正文没披露具体评测指标、分数或版本对比,只有排名和对手。这个排名如果是真的,说明 Grok 在让模型自主写代码、调工具这类任务上进步明显,但缺少数据支撑,建议先观望。
Jared Palmer 开源了 Kev,一组基于 Qwen3.5 的小型决策模型,思路跟 Jev 差不多。正文没披露参数量、训练数据和跑分,社区还在观望(29 票 14 条评论)。如果真能做到小模型快速做决策,成本会很低,但验证还不够,先别太激动。
Dan McKinley 在演讲里说,整天跟大模型来回改提示词是条死胡同。他做面向消费者的 agent 时发现,哪怕用了结构化输出,模型还是会在一小部分请求里发疯,比如把标题字段塞满废话直到爆掉。他试出来的一个离谱解法是把字段名从“title”改成“heading”,暂时管用,但随时可能失效。他的核心观点是,提示词本身靠不住,得靠 pass^k 测试和...
推荐理由:Dan McKinley 拿自己搭消费者 agent 的实战经验说话,案例具体、判断尖锐。但这是个人演讲,不是正式论文,正文也没披露 pass^k 测试的通过率和规模,所以我会先打个折。
阶跃星辰发布了旗舰模型 Step 5 Preview,并计划在10月15日开源模型权重。不过原文页面被拦截,正文没披露模型参数量、性能指标或开源范围,所以目前能确认的只有发布时间和开源日期。开源权重意味着开发者可以下载模型自己跑,不用走API,这对想微调或部署私有模型的团队是个好消息。但具体效果如何、能不能打,得等开源后实测才知道。
DXOMARK 给 iPhone 18 Pro 相机打了 172 分,排全球第二。最大亮点是可调光圈(f/1.48–f/4.0),复杂场景下也能保持画面锐度。自动对焦稳定,眩光比上一代控制得好,但光圈收小时仍可能出现绿斑。主摄 48MP,超广角 48MP 120°,长焦 48MP 8 倍光学变焦。
Ben Swerdlow 让 19 个模型在《星际争霸:母巢之战》里互相对打,结果没有哪个模型能玩到新手以上的水平。Codex Astra 的 xhigh 版本以 18 胜 0 负排第一,但它靠的不是运营,而是早期派一个探机去骚扰对手工人,对面模型会花几十秒思考怎么处理,直接瘫痪。Grok 4.6 表现最差,xhigh 版本在 43 分钟里只发出了 6...
推荐理由:Ben Swerdlow 搞了个《母巢之战》模型对战测试,19 个模型互打,没一个能赢新手。Codex Astra 的 xhigh 版 18 胜 0 负排第一,但赢法不是靠运营,而是早期派一个探机去骚扰农民,对面模型会花几十秒想对策,直接卡死。Grok 4.6 最拉胯,xhigh 版 43 分钟里只发出 6 个有效动作。这个测试把模型在实时环境里的反应延迟和决策瘫痪暴露得很直观,数据也扎实,胜率、APM、单局成本都有。我会先打个折,因为这只是一个人做的非正式 benchmark,样本量和环境控制有限,但信号很强,值得从业者看一眼。
Vals 拿了 a16z 的投资,想当 AI 模型评测的“中立第三方”。现在各家模型厂商都自己出分,Vals 想站出来当那个大家信得过的裁判。不过正文没披露它的评测方法、技术细节和早期客户,所以它到底怎么保证中立、怎么避免自己也变成另一个刷分工具,目前还看不出来。
Swift 团队基于 Qwen 3.8 微调的 27B 模型在 HuggingFace 上累计下载超过10万次,目前是微调类第一、全模型第九。Reddit 原帖正文被屏蔽,没披露训练数据、评测指标或具体用例,所以不清楚它到底强在哪、适合干什么。能冲上榜首说明社区认可度不低,但缺细节,先别急着下结论。