跳到正文

OpenRouter

OpenRouter 模型路由平台动态:新模型上架、用量排行与开发者选型的真实市场信号。

77 条精选相关主题部署工程模型发布开源生态

最新精选

第 41–60 条 · 共 77 条

7月14日星期二

AI HOT 精选

腾讯混元把295B大模型压到单GPU能跑,发了1-bit和4-bit量化版

混元Hy3是个2950亿参数的MoE模型,现在出了1-bit和4-bit两个压缩版,用llama.cpp就能在单张显卡上跑,还支持MTP加速推理。官方说这个尺寸下它表现最好,能跟万亿参数的大模型掰手腕,适合让模型进业务流程干活。模型走Apache 2.0协议,可以商用,OpenRouter上还给了两周免费API。不过正文没披露量化后精度掉了多少,也没说...

推荐理由:腾讯混元把2950亿参数的Hy3模型压到单GPU能跑,对本地部署和做agent的人很实用。Apache 2.0协议加两周免费API,试错成本低。没给85分以上,是因为正文没披露量化后精度掉了多少,这点先别太激动。

7月7日星期二

AI HOT 精选

给模型看模糊图反而更烧钱:OpenRouter 实测图像清晰度与成本倒挂

OpenRouter 拿五款模型在 MMMU-Pro Vision 上跑了一遍,发现给推理模型喂低清图(detail: low)经常既费钱又拉胯。gpt-5.5 用低清图准确率从 79% 掉到 65.2%,但每题成本反而从 4.5 美分涨到 5.1 美分——因为模型看不清,被迫多想了 1.6 倍的推理 token,输出端多花的钱直接吞掉了省下的输入成本...

推荐理由:OpenRouter 拿五款模型在 MMMU-Pro Vision 上跑了一遍,发现给推理模型喂低清图经常既费钱又拉胯。gpt-5.5 用低清图准确率从 79% 掉到 65.2%,但每题成本反而从 4.5 美分涨到 5.1 美分——因为模型看不清,被迫多想了 1.6 倍的推理 token,输出端多花的钱直接吞掉了省下的输入成本。Gemini 2.5 Pro 也一样,低清下准确率掉 5 个百分点,成本涨 15%。文章还给了 Gemini 2.5 Flash 的对比,低清下成本确实降了,但准确率也崩了,说明非推理模型可能适用不同策略。我会先打个折:测试...

7月1日星期三

AI HOT 精选

美团开源 LongCat-2.0:1.6 万亿参数,用五万张国产卡训练,月调用量已冲到 OpenRouter 全球前三

LongCat-2.0 是个总参数 1.6 万亿、每次推理只激活约 480 亿参数的大模型,原生支持 100 万 token 上下文。它全程在五万张国产 GPU 集群上训练和跑推理,架构上用了稀疏注意力、零计算专家、ScMoE 以及把 Agent、推理、交互三组专家揉在一起的 MOPD 融合方案。代码评测 SWE-bench Pro 拿了 59.5 分...

推荐理由:美团不是一线模型厂,突然掏出万亿参数模型,而且全程国产 GPU,这个反差是最大的新闻点。代码评测分数不低,但正文没披露更多推理成本和实际部署细节,所以我会先打个折。分数没给更高,是因为美团在模型圈还没建立起持续交付的信用,真实可用性要看开源后的社区反馈。

6月30日星期二

AI HOT 精选

美团 LongCat Owl Alpha 在 OpenRouter 上蹿到最热门,1.6 万亿参数 MoE,全用国产 ASIC 训练

美团 LongCat 的 Owl Alpha 模型在 OpenRouter 上成了调用量最高的模型,用户已经烧掉 10 万亿 token。它是一个 1.6 万亿参数的混合专家模型,用 35 万亿 token 训练,全程跑在 5 万块国产 ASIC 上,没依赖英伟达 GPU。性能标称达到 Gemini 或 Opus 4.6 级别,在 Hermes Age...

推荐理由:三个高信号区同时打中:大规模国产 ASIC 训练(5 万块)、OpenRouter 用量第一(10 万亿 token 已消耗)、性能标称对齐 Gemini/Opus 4.6。1.6T MoE 参数和 35T 训练 token 都是硬数字,不是公关稿。唯一扣分点:正文没披露具体 benchmark 分数和评测细节,性能对标先打个折看。

6月25日星期四

AI HOT 精选

OpenRouter 把模型价格和跑分做成了 MCP 服务器,让编程助手能直接查实时数据

OpenRouter 发布了一个 MCP 服务器,把它的模型目录、基准测试排名、实时价格和文档都接了进去。Claude Code、Cursor 这类编程助手不用再靠过时的训练数据瞎猜,可以直接调用工具来筛选模型、发测试提示词、对比不同模型的回复和成本。服务器是远程的,首次登录会生成一把专用密钥,7 天有效,默认消费上限 10 美元。正文没提这个 MCP...

推荐理由:OpenRouter 把自家模型目录做成了一个 MCP 工具,让编程助手能直接调接口查模型、发测试提示词、对比成本和回复。对 AI 从业者来说,这省掉了手动查价、翻基准排名的重复劳动,10 美元默认上限和 7 天密钥过期也给了基本的安全兜底。但这事说到底是个工作流改进,不是新模型或新能力,所以我会先打个折——实用但不炸裂。

6月18日星期四

Hacker News 首页

OpenRouter 让 11 个大模型打了 30 场吃鸡赛,Grok 4.1 Fast 赢了 43%,成本只有 Claude 的 1/27

OpenRouter 的 Jacky Liang 把 11 个模型扔进一个 2D 吃鸡游戏里打了 30 局。Grok 4.1 Fast 赢了 13 局,每赢一局成本 0.97 美元;Claude Sonnet 4.6 赢了 5 局,每赢一局要 26.78 美元,差了 27 倍。GPT 5.4 杀了 38 个人头,全场最高,但只赢了 2 局——杀得多不等...

推荐理由:OpenRouter 官方博客,作者 Jacky Liang 自己跑了 30 局并公开了完整数据和回放。Grok 4.1 Fast 的成本优势很扎眼,Claude Sonnet 4.6 贵但表现稳定,GPT 5.4 人头最多却赢不了——三个发现都有具体数字支撑,可复现、可验证。对正在选模型搭 agent 的人来说,这种实战对比比跑分表有用。

6月16日星期二

AI HOT 精选

OpenRouter 推出 Subagent 工具:让贵模型把杂活外包给便宜模型干

OpenRouter 上线了一个服务端工具 Subagent。把它加到 tools 数组里,你的主力模型(比如 Claude Opus 4.8)就能在生成过程中把总结、提取数据、套模板、转格式这类机械活扔给更便宜的小模型(比如 GLM 5.2)去跑。Claude Opus 4.8 每百万输入 token 要 5 美元,GLM 5.2 只要 1.4 美元...

推荐理由:OpenRouter 把子任务委托做成了服务端工具,不是简单包一层 API。Opus 4.8 和 GLM 5.2 的价格对比让省钱效果很直观。要扣分的地方:正文没给延迟数据,也没说子代理跑崩了怎么兜底。我会先打个折,等有实际延迟和容错方案再看。

AI HOT 精选

管住 AI 智能体,最直接的办法是管好你的 API 密钥

OpenRouter 这篇博客说,现在大部分 AI 智能体(能自己干活、做决策的模型)的治理方案都停留在写框架、定流程上,根本拦不住一个智能体因为重试循环一晚上烧掉 200 美元。文章引用了德勤的数据,只有五分之一的公司对自主智能体有成熟的治理;IBM 的报告也提到,出过 AI 安全事故的组织里,97% 都缺访问控制。作者的观点很直接:API 路由层是...

推荐理由:OpenRouter 这篇没停留在写治理原则,而是从 API 路由层下手,用德勤和 IBM 的数据把问题钉在访问控制上。缺点是厂商博客自带产品推广,正文没展开具体实现细节,但观点本身比纯框架讨论更接地气。

6月12日星期五

AI HOT 精选

OpenRouter 用多模型“合议”跑分,成绩压过 GPT-5.5 和 Claude Opus 4.8

OpenRouter 推出了一个叫 Fusion 的功能,做法是把同一个问题同时扔给好几个模型,再让一个裁判模型把它们的回答综合成一份最终结果。他们在 100 个深度研究任务上测了一下,Fable 5 和 GPT-5.5 合议后正确率 69.0%,比 Fable 5 单跑的 65.3% 要高。更划算的是,用 Gemini 3 Flash、Kimi K2...

推荐理由:OpenRouter 的 Fusion 功能让多个模型合议输出,用便宜模型组队去挑战单跑的旗舰模型,这个思路本身就值得一看。文章给了 DRACO 基准上的对比数据,Fable 5 加 GPT-5.5 合议正确率 69.0%,比单跑高 3.7 个百分点,而且用 Gemini 3 Flash 这类低成本模型也能摸到类似效果,对预算敏感的人是个信号。不过这是平台功能发布,不是模型能力突破,所以重要性打到 78 分。我会先打个折:正文没披露裁判模型的具体选择和合议延迟,实际落地成本还要自己测。

6月10日星期三

AI HOT 精选

OpenRouter 的 Advisor 工具页面 404 了,正文没披露任何细节

OpenRouter 原本要介绍一个叫 Advisor 的工具,让 GPT-4o Mini 这类便宜模型在生成过程中可以随时去问 Claude Fable 等更强模型。但博客页面直接返回 404,文章不存在。定价、延迟、路由策略这些关键信息全都没公开,目前只能看到标题和摘要里的概念,没法判断实际效果和成本。

推荐理由:我会先打个折:OpenRouter 这篇博客直接 404,正文没披露定价、延迟、路由策略和实际效果,目前只有标题和摘要里的概念。概念本身有意思——让便宜模型在生成中途去问强模型,相当于给低成本模型配了个随时可叫的顾问,不是简单的 fallback 或静态路由。这点先别太激动,因为没数据验证到底省不省钱、延迟高不高、强模型被调用的频率和策略全都不清楚。对正在搭模型路由栈的团队来说,这个方向确实踩中了成本与质量的平衡点,但信息缺口太大,只能当产品信号看。

6月4日星期四

AI HOT 精选

OpenRouter 让 11 款大模型打了一局 30 轮吃鸡,Grok 赢麻了,Claude 在交朋友

OpenRouter 花了 482 美元推理费,把 11 个模型扔进一个 2D 大逃杀游戏里打了 30 局。Grok 4.1 Fast 赢了 13 局,每赢一局成本只要 0.97 美元;而 Claude Sonnet 4.6 赢了 5 局,每局成本 26.78 美元,贵了 27 倍。最会杀敌的是 GPT 5.4,干掉了 38 个对手,但只赢了 2 局,...

推荐理由:OpenRouter 自己搞的测试,不是模型官方发布或标准基准,我会先打个折。但实验条件写得清楚,482 美元、30 轮实时决策,Claude 和 Grok 在速度和成功率上领跑,这个结论对正在挑决策模型的人有用。正文没披露具体延迟数字和成功率差异有多大,这点先别太激动。

6月2日星期二

AI HOT 精选

开放模型吃掉七成用量,OpenRouter 上开源阵营的领头羊一直在换

OpenRouter 的统计显示,从 2025 年到现在,开源权重模型拿走了平台上 69.1% 的 token 用量,闭源模型只占 30.9%。每次有新模型扎堆发布,用量就会跳上一个新台阶。领跑的模型换得很快:DeepSeek 早期领先,随后被 MiniMax 和 Kimi 接棒,接着 MiMo、Qwen、阿里开源系列、腾讯混元 Hy3 和 DeepS...

推荐理由:我会先打个折:OpenRouter 的数据只反映开发者调用偏好,不代表企业实际部署比例,这点先别太激动。但 69.1% 这个数字确实说明开放模型在开发者圈子里已经成了默认选项,闭源模型反而像备胎。文章没披露样本量和统计口径,所以没法判断这个份额波动是真实迁移还是噪音。整体是一篇有数据支撑的行业观察,不是公关稿,值得从业者扫一眼。

5月31日星期日

r/LocalLLaMA

我花 6400 美元搭了一台本地大模型服务器,一年下来比用 API 便宜了 700 多

作者晒了一台自组的本地大模型服务器,总花费 6406.45 美元,核心配置是 4 张 AMD MI100 显卡,主要跑 Qwen3.6 27B 模型。这台机器每天处理约 2040 万个输入 token 和 132 万个输出 token。他拿 OpenRouter 的 API 价格算了一笔账:第一年本地总成本(含电费)是 2992.72 美元,而调用同等...

推荐理由:这是一篇个人实测帖,不是厂商通稿。作者把账单摊开算:硬件折旧、电费、OpenRouter 比价,结论是首年能省 700 多美元。我会先打个折——这个结论绑定了他的特定负载(日处理 2000 多万 token)和二手 MI100 价格,换个人未必复现。但文章的价值不在普适性,而在把“自建推理服务器到底划不划算”这笔账算得清楚、可复现,对正在纠结买卡还是调 API 的人有参考意义。信息密度和话题性都够,放在 featured 低位合理。

5月30日星期六

AI HOT 精选

OpenRouter 加了个服务器端工具,让模型直接生成文件补丁

OpenRouter 在 Responses API 里上线了 apply_patch 工具,模型可以生成 V4A 格式的 diff 来创建、修改或删除文件。服务器端会先校验 diff 语法,不用客户端自己折腾。正文没披露这个校验具体能拦住哪些错误,也没说支持哪些模型。

推荐理由:HKR 三项都过了:OpenRouter 这次更新给 coding agent 搭了条跨模型的补丁通道,用 V4A diff 加服务端校验,实用性很强。但它属于基础设施层面的改进,不是模型能力本身的突破,所以分数压在 72–77 这个区间。

5月29日星期五

新智元 · 公众号

DeepSeek 三款模型冲进 OpenRouter 月榜前十,总消耗超 17 万亿 Token

OpenRouter 的月度统计显示,DeepSeek 有三款模型进了前十,加起来的 Token 消耗量超过 17 万亿。其中 V4 Flash 一个模型就占了 9.13 万亿 Token,用量很猛。文章还提到华为昇腾的 MegaMoE 算子,在 DeepSeek V3.1 和 Qwen3-235B 的测试里,把预填充(Prefill)吞吐量提升了 2...

推荐理由:HKR三项都成立:17万亿tokens的钩子加上OpenRouter排名和昇腾Prefill提升的具体数字,信息量够。分数定在82,因为算力自主的叙事很强,但正文没披露测试的可复现条件,这点先别太激动。

5月28日星期四

AI HOT 精选

OpenRouter 拿到 1.13 亿美元 B 轮融资,要把自己做成多模型调用的总闸口

OpenRouter 宣布完成 1.13 亿美元 B 轮融资,由 Alphabet 旗下的独立成长基金 CapitalG 领投,NVIDIA、ServiceNow、MongoDB、Snowflake、Databricks 的风投部门以及 a16z、Menlo Ventures 等跟投。这笔钱主要用来继续铺基础设施、加强企业级功能,以及把智能路由做得更细...

推荐理由:OpenRouter 是做模型路由网关的,帮开发者统一调用各种大模型 API,省得每家都对接一遍。这次 1.13 亿美元 B 轮由 CapitalG 领投,NVentures 和 ServiceNow Ventures 也跟了,说明资本在押注“模型中间层”这个位置。不过正文没披露估值、营收和实际调用量,所以这笔钱到底算贵还是便宜,现在没法判断。我会先打个折,把它放在 featured 里偏低的位置,等后续有业务数据再调整。

AI HOT 精选

xAI 把最快的编程模型 Grok Build 0.1 放上 API 公测了

xAI 发布了专门干编程活的模型 grok-build-0.1,现在通过 API 公测。这个模型主要用来做网页开发、修 bug 这类需要模型自己调用工具、跑流程的任务,跟 Grok Build 命令行工具背后是同一个模型。速度标称每秒 100 个 token 以上,价格是输入每百万 token 1 美元、输出每百万 token 2 美元。除了写代码,官...

推荐理由:我会先打个折:这是 0.1 公测版,正文没披露基准测试成绩、上下文窗口大小和具体任务成功率,所以别急着把它当成成熟产品。但亮点很实在——速度标到 100+ tokens/秒,定价也直接亮出来,输入 $1/M、输出 $2/M,对想试编码智能体的团队来说,成本门槛不高。xAI 明显在抢 Cursor/Claude 的开发者心智,这点从定位就能看出来。综合看,信息量够、有价格锚点,但缺验证数据,给 78 分、featured 不 p1 是合理的。

5月27日星期三

新智元 · 公众号

OpenRouter 月吞 100 万亿 Token,刚拿了 1.13 亿美元 B 轮融资

OpenRouter 做的是 AI 模型的“中转站”,用一个 API 就能调用 400 多个模型。现在每周处理 25 万亿 Token,一个月差不多 100 万亿。这轮融资由 CapitalG 领投,估值到了 13 亿美元。正文没披露具体盈利和成本结构,所以“赚爆了”这个说法先打个折,但流量规模确实大。

推荐理由:这条融资消息我会先打个折,毕竟不是技术突破,但100万亿月token这个量级确实把“模型路由”这门生意做实了。正文没披露利润率或抽成比例,所以别急着说它暴利,但400多个模型接入、每周25万亿token的吞吐量,说明开发者已经在用脚投票。对从业者来说,这比某个新模型跑分更有参考价值——它告诉你钱和流量正往基础设施层聚。

Latent Space

AI 推理基础设施又出百亿美金独角兽:Fireworks 估值 150 亿,Baseten 估值 110 亿,OpenRouter 融了 1.13 亿

这周 AI 圈的钱主要涌向了推理层。Fireworks 正在谈一轮估值 150 亿美元的融资,7 个月内估值涨了 3.75 倍;Baseten 也在以 110 亿美元估值募资,3 个月翻 2.2 倍。这两家都还没正式官宣,数字先别太当真。已经落定的是 OpenRouter 的 1.13 亿美元 C 轮融资,他们 6 个月内周调用量从 5 万亿 toke...

推荐理由:这条消息把三家推理服务商的估值摆在一起看,Fireworks 和 Baseten 还在谈,OpenRouter 已经拿钱且用量涨得很快。我会先打个折,估值数字本身是谈判口径,不代表最终成交价,但能看出资本在往推理层集中砸钱。对从业者来说,这直接关系到未来用谁的 API、成本怎么走,以及这些平台会不会变成新的流量入口。正文没披露具体营收或利润率,所以别急着喊泡沫,但估值确实不低。

TechCrunch · AI

OpenRouter 一年内估值翻倍到 13 亿美元,拿了 CapitalG 领投的 1.13 亿 B 轮

OpenRouter 刚完成 1.13 亿美元 B 轮融资,估值从一年前的水平直接翻到 13 亿。领投方是 CapitalG。他们主要做模型路由,帮开发者一次接多个大模型,不用每家单独签合同。正文里最硬的数据是半年内用量涨了 5 倍,说明同时调用多个模型的玩法确实在铺开。但收入、定价和客户结构都没披露,所以这 5 倍增长到底对应多少营收,先别太激动。

推荐理由:HKR 三项全中,但这是一条融资新闻,不是模型或能力发布。13 亿估值和 5 倍用量增长让它有资格排在 72–77 分段的头条位置。正文没披露收入或利润数据,所以估值翻倍的含金量我会先打个折——光看用量涨 5 倍,不知道是白嫖用户多了还是付费客户真在掏钱。