跳到正文

OpenRouter

OpenRouter 模型路由平台动态:新模型上架、用量排行与开发者选型的真实市场信号。

77 条精选相关主题部署工程模型发布开源生态

最新精选

第 61–77 条 · 共 77 条

5月26日星期二

AI HOT 精选

OpenRouter 拿到 1.13 亿美元 B 轮,周 token 处理量半年翻了五倍

OpenRouter 宣布完成 1.13 亿美元 B 轮融资,由 CapitalG 领投。公司同时给出一个业务数据:过去 6 个月,平台每周处理的 token 量从 5 万亿涨到 25 万亿,翻了五倍。这个数字说明接入 OpenRouter 做模型调用的生产流量在快速变大。正文没披露估值、具体估值逻辑和资金用途,也没提盈利情况。

推荐理由:HKR三项全中:OpenRouter是很多开发者实际在用的模型路由层,1.13亿美元加上25万亿周token量给出了实打实的规模数据。没给更高分是因为这本质上是融资加增长数字,不是新模型或新能力发布,对技术方向的冲击有限。

5月19日星期二

AI HOT 精选

OpenRouter 让模型能自己上网搜资料了,不用人告诉它什么时候搜、搜什么

OpenRouter 平台上的工具调用模型现在可以自主决定要不要联网搜索、搜什么关键词、搜几次,还会自动抓取网页内容。平台新接入了 @p0 作为搜索供应商。正文没披露搜索次数上限和成本控制细节,实际用起来会不会搜过头还得看后续反馈。

推荐理由:OpenRouter 现在让能调工具的模型自己决定要不要上网搜、搜什么关键词、搜几次,还顺带抓取网页内容,搜索提供商是 @p0。这事有意思的点在于搜索不再是用户先下指令,而是模型在推理过程中主动触发,等于把信息获取的决策权交了出去。不过目前只有一条推文,没给定价、调用上限、失败处理或实际效果对比,所以我会先打个折——想法不错,但落地细节还看不清。

5月17日星期日

AI HOT 精选

AntLingAGI 开源万亿级推理模型 Ring-2.6-1T,专为智能体工作流设计,5 月底前在 OpenRouter 打二五折

AntLingAGI 把 Ring-2.6-1T 开源了,同时上线了 OpenRouter 平台。这个模型参数量达到万亿级别,不是单纯回答问题,而是冲着让模型进业务流程干活去的:规划步骤、调用工具、维持长上下文、跑完复杂任务。训练用了 Async RL 和 IcePop 两种方法,正文没展开解释具体怎么做的。5 月底前在 OpenRouter 调用有 ...

推荐理由:我会先打个折——正文没给基准测试、许可证和上下文窗口,所以分数不动。但 HKR 三项都站得住:标题有钩子,信息有增量,对智能体开发者有实际参考价值。75% 折扣和 OpenRouter 上线是实打实的动作,Async RL 和 IcePop 训练方法也给了技术线索,只是缺验证数据,这点先别太激动。

5月15日星期五

r/LocalLLaMA

实测外挂资料库客服机器人:最贵的模型表现最差,真正管用的是这几招

作者搭了一个客服用的外挂资料库(RAG)问答机器人,用模型当裁判打分,把质量分从 6.62 拉到了 7.88,同时单次会话成本从 $0.002420 砍到 $0.000509,降了将近八成。最反直觉的发现是:最贵的模型反而是表现最差的。真正起作用的动作包括给检索环节加日志、对召回的资料块做去重、收紧模型回答时对资料的依赖程度,以及用五款模型做了一轮横向...

推荐理由:我会先打个折:这是个人实验,不是大规模生产验证,样本量和场景都有限。但作者把调优过程拆得很细,从最贵的模型翻车开始,一步步讲怎么换模型、调检索参数、改 prompt,最后质量涨了成本还大降。对正在搭外挂资料库问答的工程师来说,这些实操细节比论文里的基准分有用得多。正文没披露具体用了哪些模型和评估集,这点有点可惜,但不妨碍它作为一份诚实的调参笔记入选。

5月12日星期二

r/LocalLLaMA

Reddit 网友实测 288 次模型调用,把本地模型输出 JSON 时的各种翻车方式全整理了一遍,还写了个修复库

Reddit 用户 kexxty 用 OpenRouter 跑了 288 次结构化输出测试,覆盖 Llama 3、Mistral、Command R、DeepSeek、Qwen 等模型,发现本地模型和纯 API 模型在 JSON 上出的错其实差不多。他把这些失败归类后,写了一个叫 outputguard 的 Python 修复库,用 MIT 协议开源。...

推荐理由:HKR 三项都成立:288 次调用不是随便跑跑,outputguard 库和 15 步修复链给了可复用的实操细节。信息源是单篇 Reddit 帖子,没有第三方验证或论文背书,所以放在 72-77 的 featured 档位,不往上走。

5月11日星期一

AI HOT 精选

OpenRouter 用真实市场需求给模型排座次,DeepSeek V4 Pro 排第一

OpenRouter 搞了个叫 Pareto Code 的排名方法,不看跑分,直接看用户在实际调用中怎么选模型,找出性价比最优的那条线。目前排第一的是 DeepSeek V4 Pro,后面跟着 GPT 5.4 Mini 和 Gemini 3.1 Pro。不过正文没披露具体怎么算分、样本量多大,所以这个排名到底多稳,我会先打个折。

推荐理由:我会先打个折:OpenRouter 只发了一篇帖子,没公布样本量、统计时间窗口和具体定价依据,所以这个排名不能当严谨评测用。但它的价值在于思路——用市场实际调用数据来反映模型性价比,比跑分更贴近真实使用场景。DeepSeek V4 Pro 排第一这点先别太激动,得看后续有没有更透明的数据支撑。整体上,这条信息对正在选模型的开发者有参考意义,但信息缺口明显,够 featured 但上不了更高分。

AI HOT 精选

AntLingAGI 放出万亿参数模型 Ring-2.6-1T,5 月 15 日前在 OpenRouter 免费用

Ring-2.6-1T 是一个万亿参数模型,主打可调“思考强度”——你可以手动控制它多想一会儿还是少想一会儿,在回答质量、token 消耗和响应速度之间自己取舍。模型专门为智能体场景做了优化,支持多步执行和工具调用,适合高频工作流。官方说它能处理数学逻辑和科研类任务,但正文没给出具体跑分或对比数据。目前通过 OpenRouter 免费开放,截止到 5 ...

推荐理由:这条发布信息量偏薄,正文没给基准测试、定价、架构或训练细节,所以重要性我打了个折,没给更高。但万亿参数这个量级本身就有话题性,加上 OpenRouter 上的限时免费,对想快速试用的开发者很友好。可调思考强度和工具调用这两点,说明它在往智能体落地靠,不是单纯刷榜的模型。整体判断是:值得关注的一次模型发布,但别急着当里程碑,等实测数据出来再说。

5月7日星期四

AI HOT 精选

万亿参数指令模型 Ling-2.6-1T 上线 OpenRouter,主打“快思考”和降本 75%

inclusionAI 把 Ling-2.6-1T 放到了 OpenRouter 上,这是一个万亿参数的指令模型,专门给现实世界的智能体任务用。它走“快速思考”路线,在 AIME26 和 SWE-bench Verified 这两个测试上成绩顶尖,同时宣称推理成本比同类低了大约 75%。官方列出的适用场景包括高级编程、复杂推理和大规模智能体工作流。正文...

推荐理由:我会先打个折:正文没披露具体价格、上下文窗口长度,也没给完整榜单分数,所以“顶尖表现”和“成本降低 75%”目前只能当声明看。但一个万亿参数指令模型敢上 OpenRouter 开放调用,本身信号就很强——说明 inclusionAI 对推理成本和稳定性有一定底气。真正值得盯的是后续会不会放出详细定价和完整评测,如果成本真能压到同类模型的四分之一,对做 agent 和代码任务的团队会是实打实的省钱。

AI HOT 精选

OpenRouter 推出统一网络搜索与抓取工具,换模型不用重写工具代码

OpenRouter 发布了两个服务端工具:`openrouter:web_search` 和 `openrouter:web_fetch`。模型在对话中需要查资料时,可以直接调用它们,由 OpenRouter 在后台执行搜索或抓取网页,再把结果喂回模型。最大的好处是换模型不用改工具定义——不管底层跑的是 GPT-5.5、Claude 还是 Kimi,...

推荐理由:我会先打个折:正文没披露具体接了哪些搜索引擎和抓取引擎,也没提价格和调用限额,所以实际能用成什么样还得等上线看。但这件事的看点不在引擎本身,而在跨模型工具接口的一致性——让 GPT、Claude 等模型用同一套搜索和抓取指令干活,对搭 agent 工作流的人来说省了不少适配成本。这点先别太激动,但如果后续把引擎选择和限额透明化,实用性会更高。

r/LocalLLaMA

Reddit 网友扒了 922 条 agent 任务记录,发现 DeepSeek v4 省钱的关键不在标价,在缓存命中率

一位 Reddit 用户分析了 922 条 agent 任务的实际调用记录,对比了 DeepSeek v4 Flash 和 Opus 4.7 的花费。两个模型每个任务都要吃掉大约 96 万 token,但 DeepSeek 单任务成本只要 0.01 美元,Opus 4.7 却要 1.52 美元。差距不在输入输出的标价,而在缓存:DeepSeek 的缓存...

推荐理由:这篇不是比谁模型强,是比谁缓存用得聪明。Reddit用户跑了922条智能体任务轨迹,发现DeepSeek v4 Flash单任务成本0.01美元,Opus 4.7要1.52美元,差了152倍。两边平均token消耗都接近96万,但DeepSeek缓存命中率97%,Opus只有87%;更关键的是缓存读写价格比,DeepSeek是0.02,对方是0.08。也就是说,标价看着便宜不算真便宜,能把重复计算省下来才是省钱的地方。正文没披露任务类型和采样方式,这点先别太激动,但缓存机制这个观察本身值得盯。

4月30日星期四

r/LocalLLaMA

实测:本地跑 Qwen-3.6-27B 跟闭源模型比,到底差多少

作者拿一个自动研究循环任务测了 5 个模型,只有 Qwen-3.6-27B 接近完成。本地用 q4_k_m 量化版跑了约 8 小时,消耗 3.9 万 token(上限 4.5 万);作为对比,全精度 Qwen 通过 OpenRouter 调用用了 440 万 token,花费 0.939 美元。关键看失败质量:两个 Qwen 版本都只差小修小补,而 G...

推荐理由:这篇帖子用一个自动研究任务把 Qwen-3.6-27B 和几个闭源模型放在一起比,结果只有 Qwen 基本完成,其他模型要么缺测试要么缺实现,对比很直观。数据也给了:本地量化版跑了约 8 小时,读 39k 写 45k tokens;全精度版消耗 4.4M tokens,花了 0.939 美元。失败质量比成功更值得看,两种 Qwen 都只需少量修复就能用。来源是单篇 Reddit 实测,权威性有限,所以放在 featured 低位,但 hook、数据和话题性都够。

4月29日星期三

NVIDIA 博客

英伟达发布 Nemotron 3 Nano Omni:一个模型同时看懂图文、听懂语音,做 AI 代理时吞吐量号称是同类 9 倍

英伟达在 2026 年 4 月 28 日开源了 Nemotron 3 Nano Omni,一个能同时处理文字、图片、音频、视频、文档、图表和屏幕界面的多模态模型。它用了 30B-A3B 的混合专家架构(MoE),实际激活的参数量是 3B,配合 Conv3D 和 EVS 技术来处理音视频,上下文窗口拉到 256K。官方说在保持交互延迟不变的前提下,跑 A...

推荐理由:NVIDIA 这次把视觉、语音、文字塞进一个 30B-A3B 的混合专家模型里,还开放了权重和训练技术。我会先打个折:9 倍效率提升是跟谁比、测什么任务,正文没细说,这点先别太激动。但 256K 上下文、Conv3D 和 EVS 这些配置,加上直接上 Hugging Face 和 OpenRouter,对想用开源方案搭多模态 agent 的团队确实省事。单信源,信息够用但不算独家,所以放在 featured 里。

4月21日星期二

量子位 · 公众号

蚂蚁数科搞了个叫“大象”的百亿参数模型,跑分和效率都挺能打

蚂蚁集团的 Inclusion AI 团队被扒出是神秘模型“大象”的幕后作者。这个模型参数量 100B,上下文窗口 256K,一次能吐 32K 字,已经在 OpenRouter 上架。文章里测了修 bug、总结三千字会议纪要、跑轻量 agent 流程,效果都不错。AI BENCHY 跑分显示它平均每秒能出 2500 个 token,延迟大概 1 秒,一...

推荐理由:一个 100B 模型敢喊同规模 SOTA 还强调 Token 效率,钩子够硬。文章有实测数据也有失败案例,不是纯吹。训练细节、价格和官方模型卡都没披露,所以先别太激动,但方向值得跟。

4月20日星期一

r/LocalLLaMA

Reddit 网友拿 9 个模型做功能规划对比,Claude Opus 4.6 生成的规格书最贵也最详细

一位 Reddit 用户让 9 个模型给一款 Go 语言记账 App 设计“负载追踪”功能,再用 Claude Code 给生成的规格文档打分排名。Claude Opus 4.6 排第一,产出一份 19KB 的规格书,过程中读了 44 次代码,花了 2.47 美元;GLM 5.1 排第二,Qwen 3.6 35B fp8+vLLM 排第三。作者自己强调...

推荐理由:这是一次有名有姓的个人实测,给出了真实工作流里的数据,所以 H、K、R 三项都站得住。但天花板不高:只测了一个功能、排名由 Claude Code 自己打分、正文没提人工验收结果,我会先打个折,放在 featured 里偏低的位置。

4月19日星期日

r/LocalLLaMA

实测 8 个模型当桌游主持人:27B 小模型叙事质量干翻了 405B 巨无霸

作者用 6 个固定跑团场景测了 8 个模型,让它们当桌游主持人。评分用了 8 项自动指标加 3 个 LLM 裁判打分,整轮测试只花了约 0.02 美元。最终 google/gemma-3-27b-it 以 4.33 的综合叙事分排第一。标题说 27B 赢了 405B,但正文被屏蔽了,没披露那个 405B 具体是哪个模型,也没给出完整排名。这点先别太激动...

推荐理由:这篇来自 Reddit 的个人评测,钩子够锋利——小模型在叙事质量上干翻大模型,HKR 三项全中。我把它留在 featured 而不是更高,是因为正文截断了,405B 具体是哪个模型、完整排名都没给出来,信息有缺口,先别太激动。

4月16日星期四

Hacker News 首页

Darkbloom:用闲置 Mac 跑加密推理,号称比 OpenRouter 便宜七成

Eigen Labs 搞了个叫 Darkbloom 的去中心化推理网络,把一亿多台苹果芯片 Mac 的闲置算力攒起来卖。它提供兼容 OpenAI 的 API,主打端到端加密和硬件验证,说操作节点的人看不到你的数据。价格表上列出的 token 费用比 OpenRouter 低 50%,不是标题里的 70%,这点先打个折。正文没披露独立安全审计的具体范围,...

推荐理由:HKR 三条全中:闲置 Mac 组网做推理的玩法有新鲜感,文章也把规模、接口、加密和价格都摆出来了。我先打个折,维持在 80 分——这还只是团队自己发的预览,审计范围、网络稳定性、攻击面边界都没经过第三方验证,论文出来之前别太激动。

4月3日星期五

X · @op7418(歸藏)

阿里发了 Qwen 3.6 Plus,上下文拉到 100 万 token,Agent 和编程能力提升明显

阿里在百炼上线了 Qwen 3.6 Plus,主打 Agent 任务和编程能力,相比 3.5 版有明显提升。图像和文档理解也加强了,数学图像识别、真实世界问答和 OCR 表现都不错。这次默认支持 100 万 token 上下文,最长输出接近 99.1 万 token,输入 6.4 万 token,比之前 256K 的版本开发体验好很多。价格是输入每百万...

推荐理由:阿里放出 Qwen 3.6 Plus,是国内模型一次实打实的更新。HKR 三项都站得住,核心是 100 万上下文和 2/12 元定价这个组合拳,对实际干活的人诱惑很大。但正文没给具体测评分数、对比基线和测试条件,所以先不打最高级,等看到跑分再说。