跳到正文

AX 说 · 2026年9月22日成本战

小米开源模型登顶,但今天的主角是成本

今天 AI 圈最值得看的不在某个模型又刷榜了,是几件事同时指向同一个方向:成本。小米 MiMo-V2.6-Pro 在开源模型智能指数上拿了第一,但更值得看的是它怎么做到的——靠强化学习让模型自己教自己,省了人工标注的钱。另一边,OpenRouter 上线批量推理接口,token 费用直接打五折;NVIDIA 把 30B 模型当 3B 用,专门跑 Agent 里那些高频、重复的脏活累活。先从小米这个开源新王说起。

小米 MiMo-V2.6-Pro 登顶开源榜,靠的是让模型自己教自己

小米这次放出的 MiMo-V2.6-Pro 在 Artificial Analysis 智能指数上拿了 46 分,是目前开源模型里最高的。对比一下,上一代 MiMo-V2.5-Pro 只有 26 分,这一跳涨了 20 分。在多数 Agent 基准测试里,它能跟 Claude Opus 5 和 GPT-5.6 Sol 掰手腕,能力覆盖写代码、操控电脑界面、3D 推理和创作类任务。

但真正有意思的不是分数,是训练方法。小米说核心思路是扩展强化学习规模,让模型在训练中自我提升,不再完全依赖人工标注。如果这条路真能走通,训练成本会降不少——不用雇一堆人给模型写标准答案,模型自己跟自己下棋就行。

不过先别太激动。参数量、训练细节、开源仓库链接都还没公开,微信原文也被屏蔽了。Hugging Face CEO Clément Delangue 确认了这是开放权重模型,但“开放权重”不等于“真开源”——训练数据和代码大多没给。另外,Code Arena: WebDev 榜上它排第 10 名左右,开源权重里约第 3,说明在某些细分任务上还有差距。

这条我会先打个折:分数是真的,方向是对的,但等 repo 出来、第三方复现之后再下结论。

Grok 4.7 追平第一梯队,但代价是输出量是别人的三倍

xAI 发布了 Grok 4.7,定位是最强编码与知识工作模型。Artificial Analysis 的评测显示,它在模拟真实工作任务的 AA-Briefcase 测试中拿到 1657 分,比上一代高出 111 分,排在 Claude Opus 5 和 Claude Fable 5.1 之后。编码代理指数从 47 跳到 56,其中 Terminal-Bench 成绩翻倍到 33%,DeepSWE 从 65% 涨到 72%。

马斯克引用这个评测说 Grok 4.7 让 xAI 在智能体编码上排第三,仅次于 Anthropic 和 OpenAI。排名本身没毛病,但有个细节值得注意:Grok 4.7 完成这些任务的输出 token 量是 GPT-6 Astra 的约三倍。它靠大量输出换来了高分,不是效率更高,是更啰嗦。

定价方面,$2/百万输入 token、$6/百万输出 token,跟 Grok 4.6 同价同速,还有个速度和价格加倍的快速变体。如果你在乎的是最终结果质量,Grok 4.7 确实能打;但如果你在乎的是推理成本,它可能不是最优解。

OpenRouter 批量推理打五折,但得等它有空

OpenRouter 新上线了 Batch API,你把一堆请求打包提交,模型供应商在 24 小时内挑空闲时间处理,作为交换,每 token 费用直接砍半,部分模型甚至更低。两周测试期跑了超过 23 万个批次,中位数 7 分钟就出结果,90% 的批次在一小时内完成。

提交时间比请求数量更影响速度:太平洋时间早上 5 点到中午 12 点最慢,最差的那一成要等 2 到 4.5 小时;下午 6 点后提交,90% 能在 50 分钟内跑完。

这个模式有点像早年的夜间电价——你愿意等,就给你打折。对于不要求实时响应的任务(比如批量评估、离线标注、大规模测试),这个折扣很实在。但如果你在跑一个需要秒级响应的 Agent,还是得走实时接口。

NVIDIA 把 30B 模型当 3B 用,专干 Agent 里的脏活累活

NVIDIA 发布了 Nemotron 3.5 Lightning,一个 30B 参数的混合专家模型,但每次推理只激活大约 3B 参数。思路很清晰:Agent 流程里有很多步骤不需要深度推理——选工具、读文件、检查结果——这些活高频、重复、对延迟敏感,用大模型太贵也太慢。

Lightning 跟 Nemotron 3 Ultra 不是替代关系,Ultra 负责费脑子的规划,Lightning 负责执行层的高频调用。这个分工在工程上很实际:把贵的模型留给难的决策,便宜的模型跑重复劳动。

OpenRouter 上已经能调这个模型了,具体延迟和成本还没公开,但 3B 激活参数的量级摆在那里,不会贵到哪去。

亚马逊封杀 Meta Muse,不是安全问题,是广告生意被动了

亚马逊直接屏蔽了 Meta 新推出的个人 AI 代理 Muse,不让它帮用户在亚马逊上买东西。亚马逊的理由是 Muse 访问网站时不表明自己是机器人,还存用户账号密码,有隐私和安全风险。Meta 反驳说 Muse 根本读不到明文密码。

但真正的矛盾是生意。亚马逊去年广告收入超过 680 亿美元,靠的就是用户自己逛、自己看赞助商品。Muse 这类代理直接跳过浏览环节,用户说“帮我买最便宜的洗衣液”,代理就去比价下单,全程不看广告。这对亚马逊的广告模式是釜底抽薪。

这不是第一次平台和代理打架。之前就有比价插件被电商平台封杀的先例,但这次是 Meta 这种体量的玩家正面撞上亚马逊。后续怎么发展,取决于 Muse 会不会改技术方案(比如主动标明身份),以及监管会不会介入。

BC 省起诉 OpenAI:ChatGPT 标记了可疑活动,但没通知警方

不列颠哥伦比亚省在加州起诉 OpenAI,指控其未将 ChatGPT 标记的可疑活动在 2026 年 2 月 10 日 Tumbler Ridge 枪击案前通报警方。这起案件造成 8 人死亡(包括 5 名儿童和一名教育工作者)、27 人受伤。

起诉书没披露被标记的具体是什么活动、什么时候标记的,也没说 OpenAI 当时怎么回应。这点先别太激动——目前只有起诉方的说法,没有独立核实。如果 ChatGPT 确实标记了明确的暴力威胁而 OpenAI 没动作,那是严重的安全失职;但如果标记的是模糊内容(比如用户搜索了某些关键词),那“应该通知警方”这个义务边界就很模糊了。

这个案子值得盯着,因为它会测试一个核心问题:AI 平台在发现潜在危险时,有没有法律义务主动报警。目前没有明确答案。

今日小信号

  • Hugging Face 的 transformers 现在能直接加载 GGUF 量化模型了,底层复用了 llama.cpp 的 ggml 计算核心,优先在苹果芯片上做了优化。Mac 上跑大模型的门槛又低了一截。
  • Linear 把 PR 等待时间从 6 分多压到 5 分多,测试量翻了近四倍。靠的是换运行器、换编译器、砍类型依赖的 lint 规则和优化前置检查,不是玄学。背景是 AI 编程工具让代码产出速度暴涨,但验证环节跟不上,CI 成了卡脖子的地方。
  • 阿里云发布自研推理芯片含光 900,同时画了张 2032 年 20GW 数据中心的大饼。芯片已在内部跑业务,但没给外部客户的时间表和性能跑分。20GW 是八年目标,落地节奏和电力审批都还是变数。
  • Kimi 发布 Code Desktop 1.0,Mac 和 Windows 都能用。但正文被微信屏蔽了,没披露任何功能、定价或技术细节,只有发布消息本身。
  • Nathan Lambert 在国会作证:中国开源模型在 Hugging Face 上总下载量达 32 亿次,是美国的两倍,自 2025 年 7 月起就持续领先。但他也提醒别把“开放权重”当“真开源”,训练数据和代码大多没给。

部分信源参考自 AI HOT