跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 61–80 条 · 共 88 条

4月20日星期一

量子位 · 公众号

苏度科技估值超20亿美元,发布具身模型Sudo R1:零真实机器人数据训练,首次抓取成功率约98%

苏度科技放出了他们的具身智能首秀Sudo R1,说是在完全没有用真实机器人数据训练的情况下,直接零样本测试了200多次,对100多种没见过的物体(包括透明、金属、软的和反光的东西)首次抓取成功率约98%,试两次基本能到100%。整个演示跑了60分钟。他们用的方法是在高保真模拟器里结合世界模型和强化学习来训练,相当于先在虚拟世界里把技能练好再搬到真机上。...

推荐理由:这条我会先打个折,因为所有指标都是自报的,没第三方验证。但零真机数据、zero-shot 直接上真机抓出 98% 首次成功率,这个说法本身就够硬,而且给了 200 多次测试、100 多个没见过的物体、60 分钟连续跑,数字具体,不是空口号。它正好打在机器人行业最疼的地方:真实数据又贵又慢,仿真到真机迁移一直是个坑。正文没披露融资金额、基准怎么定义的、谁做的第三方验证,所以分数没给更高。

4月16日星期四

36 氪 · 直链

Anthropic 下周要把能找安全漏洞的 Mythos 模型拿给英国银行试用

Anthropic 计划下周通过“玻璃翼计划”,让部分英国金融机构提前用上它的 Mythos 模型。公司说这个模型很擅长识别甚至利用网络安全漏洞,所以这次不是公开发布,而是定向开放给银行。正文没披露模型的具体参数、收费方式和已有客户数量,目前能看到的信号就是一次受控的行业试用。

推荐理由:这条消息的钩子很硬——一个能找漏洞甚至可能利用漏洞的模型,先给银行看,不是全面上线,而是通过“玻璃翼计划”分阶段、只对特定机构开放。正文没披露参数、定价和具体覆盖多少家银行,所以实际影响有多大还不好说。我会先打个折:这更像一次受控分发,不是产品发布。但放在金融监管和模型安全治理的交叉点上,值得从业者盯紧后续。

Google DeepMind

Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 中开放预览。

推荐理由:原文给出新语音模型的音频标签控制方式、Elo 分数与多平台开放入口,可据此判断语音生成的可控性变化。

4月13日星期一

Google DeepMind

Google DeepMind 发布 Gemini Robotics-ER 1.6 机器人推理模型

Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力。

推荐理由:原文给出新模型在空间推理、多视角与仪表读数上的能力变化和开放入口,可据此判断机器人高层推理的进展。

4月9日星期四

量子位 · 公众号

腾讯推出MoT架构,2B参数的具身模型在22项评测里拿了16项第一

腾讯混元与Robotics X联合发布了HY-Embodied-0.5,核心是一个叫MoT-2B的模型。它总参数量4B,实际干活时只激活2B,在22项具身智能评测中拿了16项第一。训练数据量不小:用了超过1亿条具身数据、600B以上的预训练token、3000多万条中期训练样本,还引入了视觉隐空间token、双向注意力、RFT、强化学习和在线蒸馏。这模...

推荐理由:我会先打个折:这还是一次模型发布,不是那种当天就改变行业格局的大事,所以分数没拉到 85 以上。但它的钩子够强——腾讯说 MoT 比 MoE 更适合具身,而且一个激活参数只有 2B 的模型在 22 项评测里赢了 16 项,数字和训练细节也给得实在。对做端侧机器人的从业者来说,这套专门为具身重做的架构和训练链路比通用模型微调有意思得多,所以 H、K、R 都站得住。

X · @op7418(歸藏)

小扎挖的团队交卷了:Meta 发 Muse Spark,多模态推理但暂不开源

Meta 把之前挖来的团队做的第一个模型 Muse Spark 放出来了。它原生支持多模态推理,能看图、用工具、展示视觉思维链,还能让多个 Agent 并行干活。有个叫“沉思”的模式,就是协调多个 Agent 一起推理。在 Artificial Analysis 上的跑分比 Gemini 3.1 Pro、GPT-5.4 和 Claude Opus 4....

推荐理由:大厂新模型发布,加上“挖角团队首秀”的故事线,HKR 三项全中。分数卡在 featured 门槛附近,因为文章只给了能力声明和相对排名,参数规模、定价、铺开时间和访问范围都没披露,我会先打个折。

4月3日星期五

Google DeepMind

Google DeepMind 发布 Gemma 4 开源模型家族

Google DeepMind 发布 Gemma 4,称其为迄今最智能的开源模型,面向高级推理与智能体工作流,采用 Apache 2.0 许可。该系列包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,31B 在 Arena AI 文本榜位列全球开源模型第 3,26B 位列第 6。

推荐理由:Gemma 4 以 Apache 2.0 开源并覆盖端侧到工作站四种尺寸,可据此判断开源模型的部署与微调选择。

3月24日星期二

Mistral AI

Mistral AI 发布 4B 参数语音合成模型 Voxtral TTS

Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与零样本跨语言音色适配能力。

推荐理由:原文给出 4B 参数、9 种语言、70ms 延迟与定价,读者可据此判断企业语音智能体的成本与选型空间。

3月17日星期二

Mistral AI

Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

Mistral AI 发布 Mistral Small 4,这是首个把 Magistral 推理、Pixtral 多模态和 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。

推荐理由:Mistral Small 4 把推理、多模态与编码智能体合并进单一开源模型,可据此判断统一模型对部署成本的影响。

2月10日星期二

36 氪 · 直链

阿里千问发布 Qwen-Image-2.0,一个图像生成基础模型,已开放 API 邀测

千问推出了新一代图像生成基础模型 Qwen-Image-2.0。现在可以在阿里云百炼上申请 API 测试,也能在 Qwen Chat 上免费试用。不过正文没披露模型参数量、具体定价、评测跑分和正式公开时间,所以实际效果和成本还不好判断。

推荐理由:千问发了个新的图像生成基础模型,百炼 API 邀测和 Qwen Chat 免费体验都开了,HKR 三项全中:有实际可用的产品信号、有明确的接入路径、对国内模型用户有直接参考价值。没给到 78 分以上是因为正文缺了模型大小、价格这些关键信息,我会先打个折。

2月6日星期五

TechCrunch · AI

OpenAI 和 Anthropic 在同一天抢着发布能自己干活的编程模型,前后只差几分钟

OpenAI 推出了 GPT-5.3 Codex,一个专门给自家编程工具 Codex 用的新模型。按 OpenAI 的说法,这个模型让 Codex 从“能写代码、审代码”升级到“几乎能替开发者在电脑上干所有事”,甚至能在几天内从零做出功能复杂的游戏和应用。速度比上一代 GPT-5.2 快了 25%,而且 OpenAI 说这是第一个“自己参与造自己”的模...

推荐理由:这条消息的看点全在时间差——OpenAI 在 Anthropic 发布后几分钟就甩出自己的代理式编码模型,说明两边在让模型进开发流程这件事上咬得很紧。但正文能用的信息太少:没模型名、没跑分、没价格、没上下文窗口、也没说谁能用,只提了一嘴跟 Codex 有关。所以我会先打个折,重要性给到 75、放在 featured 低位,因为话题热度够,但证据太薄,暂时没法判断性能或性价比。

2月5日星期四

Mistral AI

Mistral 发布 Voxtral Transcribe 2 语音转写模型家族

Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。

推荐理由:原文给出两款语音转写模型的延迟、价格与开源许可,可据此判断实时语音应用的选型空间。

1月6日星期二

NVIDIA 博客

NVIDIA 一口气开源了一堆模型、数据和工具,覆盖智能体、机器人、自动驾驶和生物医药

NVIDIA 在 2026 年 1 月 5 日放出了一批新的开源模型和数据集。语言模型方面,有 Nemotron 系列的新成员,专门做语音、外挂资料库(RAG)和安全对齐;还有一个叫 Alpamayo 1 的模型,正文没具体说它擅长什么。物理 AI 这边,Cosmos 系列更新了 Reason 2、Transfer 2.5 和 Predict 2.5 ...

推荐理由:NVIDIA 这次不是发一篇通稿,而是把 Nemotron、Cosmos、GR00T、Clara 几条线的模型、数据集和工具一起开源了。我会先打个折:所有信息都来自厂商自己,没有第三方验证,实际可用性还得看后续社区反馈。但光看披露的数字——10 万亿 token 文本、50 万条机器人轨迹、100TB 车载数据、45.5 万个蛋白结构——规模确实够大,而且覆盖了代理、物理 AI、自动驾驶和生命科学几个热门方向。具体到模型,Nemotron Speech 做语音、Cosmos Reason 2 做推理、GR00T N1.6 做人形机器人、Alpama...

2025年12月17日星期三

Mistral AI

Mistral 发布 OCR 3,表单与手写识别升级并接入 Document AI Playground

Mistral 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率,并称准确率超过企业文档处理方案和 AI 原生 OCR 方案。

推荐理由:Mistral OCR 3 在表单、手写和复杂表格上的升级与每千页 2 美元的定价,可供评估文档解析方案时参考。

2025年12月9日星期二

Mistral AI

Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

Mistral AI 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

推荐理由:原文给出 Devstral 2 的 SWE-bench 成绩、开源许可与部署门槛,可据此判断开源编码模型的落地成本。

2025年12月3日星期三

Mistral AI

Mistral 发布 Mistral 3 系列模型,含 675B 参数 Mistral Large 3

Mistral AI 发布 Mistral 3 系列,包括 14B、8B、3B 三个稠密模型和采用稀疏 MoE 架构的 Mistral Large 3,后者为 41B 激活、675B 总参数,全部以 Apache 2.0 许可开源。

推荐理由:Mistral 3 一次性放出从 3B 到 675B 的 Apache 2.0 模型家族,读者可据此判断开源权重在端侧与前沿能力上的最新位置。

2025年8月7日星期四

OpenAI News

OpenAI 发布 GPT-5:一个模型自动判断该快答还是慢想,全员可用

OpenAI 在 8 月 7 日上线了 GPT-5,所有 ChatGPT 用户都能用。这次最大的变化是把快速回答和深度推理合进了一个系统:内置一个路由器,根据问题类型、复杂度和用户意图实时决定用哪个模型。Plus 用户额度更高,Pro 用户能解锁 GPT-5 pro,那个版本推理链条更长,答案更细。官方说 GPT-5 在编程、写作、健康咨询上比前代强,...

推荐理由:OpenAI 发新旗舰模型本身就是顶格事件。这次不是单纯升级,而是把推理能力内置进系统,用路由器统一调度,所有 ChatGPT 用户都能用,Plus 和 Pro 再拉开配额。HKR 三项全中,缺价格、上下文窗口和 API 细节不影响 p1 判定。

2025年8月5日星期二

OpenAI News

OpenAI 发布最强开源推理模型,但没说具体叫什么、有多大、怎么用

OpenAI 在 8 月 5 号宣布放出了他们自称“能力最强的开源权重推理模型”,主打让开发者、政府和非营利组织能在自己的服务器上跑,不用把数据交给第三方。这波操作主要是为了配合他们的“OpenAI for Countries”计划,拉拢盟友国家用美国主导的 AI 基础设施,同时给有数据本地化要求的机构一个选择。但整篇公告没提模型名字、参数量、性能跑分...

推荐理由:OpenAI 放出开放权重推理模型的消息,HKR 三项都踩中了:路线转向够意外,本地部署的交付事实够具体,话题也正好是行业争论的焦点。但正文没给模型名、参数量、许可证和跑分,信息缺口太大,所以重要性停在 86 分,没往上拉。真正该盯的是后续交付细节,不是“开放”这两个字本身。

OpenAI News

OpenAI 开源了两个新模型 gpt-oss-120b 和 gpt-oss-20b,用 Apache 2.0 协议,主打低成本部署和强推理能力

OpenAI 发了两个开源模型,大的叫 gpt-oss-120b,小的叫 gpt-oss-20b,都用了 Apache 2.0 协议,可以商用。这两个模型是 OpenAI 自 GPT-2 之后第一次开源的语言模型。它们用了混合专家架构,120B 版本总参数 1170 亿,但每次只激活 51 亿参数,一张 80GB 显存的显卡就能跑;20B 版本总参数 ...

推荐理由:当天就写。OpenAI 走 Apache 2.0 开源权重路线是策略转向,不是常规更新。H 落在动作意外性上,K 落在部署规格够具体,R 落在成本和开源闭源之争。没给 95+ 是因为正文截断,完整评测分数没披露,这点先别太激动。

2025年7月15日星期二

Mistral AI

Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源

Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备内置问答与摘要、多语言识别和语音函数调用能力,并保留 Mistral Small 3.1 的文本能力。

推荐理由:Mistral 开源两款语音理解模型,给出 32k 上下文、函数调用等能力与低于同类 API 一半的定价,便于评估语音方案选型。