跳到正文

#模型发布

今日 5 条

5月20日星期三

AI HOT 精选

Stability AI 发布 Stability Audio 3.0,能生成超过 6 分钟的专业歌曲

Stability AI 发了四个新音频模型,最小的两个(4.59 亿参数)能在手机或电脑本地跑,生成两分钟以内的声音和音乐。中型(14 亿参数)和大型(27 亿参数)模型能把完整歌曲拉到 6 分 20 秒,比上一代翻了一倍多。小号和中号模型已经开源,大号模型只走 API 和付费托管,年收入超 100 万美元的公司必须买商业授权。训练数据来自华纳和环球...

推荐理由:我会先打个折:标题里的“专业级”正文没给出任何评判标准或盲测结果,这点先别太激动。能生成超过6分钟的音乐确实比多数短片段模型进了一步,4款规格也说明在考虑不同算力场景。但全文没披露训练数据是否含版权素材、生成内容的商用条款,也没给任何客观音质指标,所以只能算一次产品更新,离行业震动还差几口气。

AI HOT 精选

Kling AI 上线原生 4K 视频生成,不再靠后期放大,直接出真 4K

Kling AI 在 4 月 23 日放出一个原生 4K 视频生成模型,不是先做低分辨率再放大,而是从生成阶段就按 4K 来跑。官方说好莱坞团队和 Wonder Studios 已经在用,制片人反馈这是他们工作流里第一个原生 4K 基础模型,Wonder Studios 特别提到原生生成能避免传统放大带来的角色变形,画面一致性更好。不过正文没披露价格、...

推荐理由:我会先打个折:这是厂商自己发的消息,不是第三方评测。能一键出原生4K确实少见,也报了合作方名字,所以给了featured。但没给任何可比的硬指标——生成一段4K要多久、花多少钱、最长能出多少秒,这些全没说。这点先别太激动,等实测出来再看。

AI HOT 精选

Google AI Edge Gallery 更新:手机端模型能调外部工具、设提醒、记住聊天了

Google 给 AI Edge Gallery 这个手机端模型体验应用加了三个新能力。一是安卓版开始实验性支持 MCP(模型上下文协议),你可以给手机上的 Gemma 4 模型配一个外部工具服务器地址,比如连上 Google Workspace 查日历邮件,或者接 Google Maps 问路、接网页抓取工具读链接内容。模型在本地决定调哪个工具,请求...

推荐理由:Google 在安卓 AI Edge Gallery 里塞了实验性 MCP 支持,Gemma 4 能直接调 Workspace、Maps 这些外部工具,还补了通知和会话记忆。我会先打个折——正文没披露延迟、耗电和实际可用工具数量,目前更像开发者尝鲜版。但方向很明确:让手机端模型从聊天框跳出来,进到系统里干活。这点先别太激动,等看实际跑起来的稳定性。

AI HOT 精选

Google 发了 Gemini 3.5,说模型不光能想还能动手干活

Google AI 开发者账号宣布了 Gemini 3.5 模型家族,强调它把推理和执行能力合在一起,目标是让模型直接进业务流程干活。但正文没披露参数量、跑分、价格、上下文窗口和具体上线时间,也没说跟上一代比到底强在哪。这点先别太激动,等有实测数据再看。

推荐理由:H 和 R 都站得住:官方发新模型家族,关注度够高,也会刺激大家去比参数、比价格。但 K 确实不行,整篇公告除了名字什么都没给,没法做技术判断,所以总分拉不到 85 以上。

Hacker News 首页

Gemini 3.5 发布,主打“能干活”的模型

Google 在 I/O 大会上推出了 Gemini 3.5 系列模型,核心卖点是让模型不仅能回答问题,还能直接执行操作。博客正文没披露参数量、上下文窗口和具体定价,只强调了“前沿智能+行动”这个方向。Hacker News 上讨论热度很高,有 196 个赞和 179 条评论,但大家基本都在猜实际能力和成本。我会先打个折——没看到跑分和实测数据之前,这...

推荐理由:我会先打个折:这条消息只有型号名和文档链接,正文没披露参数、价格或上下文窗口,所以没法判断它到底强了多少或者省了多少钱。HN 上 196 分、179 条评论说明大家确实在盯着 Gemini 的更新节奏,但热度主要来自对谷歌模型竞争力和成本的关心,而不是因为看到了硬指标。这点先别太激动,等官方把价格和基准测试放出来再看。

5月19日星期二

AI HOT 精选

Cursor 发布 Composer 2.5,底层和 Kimi K2.5 同源,号称效率提升 10 倍

Cursor 把 Composer 模型升级到了 2.5,说它在处理长任务、理解复杂指令上比之前强了不少,同等能力下效率能高出 10 倍。这次升级主要靠三件事:训练规模更大、强化学习环境搞得更复杂,还加了一套文本反馈机制,让模型能根据文字反馈自己调整。底层架构跟 Moonshot 的 Kimi K2.5 是同一套。另外 Cursor 正跟 SpaceX...

推荐理由:Cursor 发了 Composer 2.5,说同等能力下效率能提 10 倍,还提到用了更大的训练规模、更复杂的强化学习环境和文本反馈来调模型。我会先打个折:10 倍这个数目前只有厂商自己说,正文没给基准测试、没给价格、也没法复现验证,所以别太激动。但如果是真的,对用 Cursor 写代码的人来说确实挺省钱省时间。这条消息来自单一社交来源,信息量够让从业者关注,但缺硬数据支撑,所以分数定在 82,放在 featured 里提醒大家留意后续实测。

5月18日星期一

Google DeepMind

Google DeepMind 发布 Gemini Omni Flash 视频生成模型

Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑。

推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。

5月17日星期日

r/LocalLLaMA

MiroThinker-1.7 开源版深度研究 agent 发布,基于 Qwen3 MoE,mini 版总参数量 30B 但推理时只激活 3B

MiroMindAI 把他们的深度研究 agent MiroThinker-1.7 放出来了,权重直接挂在 HuggingFace 上。mini 版挺有意思:总参数量 30B,但用了 MoE(混合专家)架构,实际干活时只激活 3B 参数,所以对本地消费级硬件比较友好。上下文管理这块,他们用了滑动窗口 K=5 加 episode 重启的策略,相当于每轮对...

推荐理由:这条消息来自 Reddit 帖子,实验室也不是一线大厂,所以重要性我打个折,但信息量够上 featured。开源权重加上 MoE 的 30B/3B 配置,对想自己跑 deep research 的人是个实在的钩子;滑窗和 episode 重启的上下文管理方案也给了可复现的细节。正文没披露具体 tok/s 数据,这点先别太激动,但话题本身会引发本地部署的性能讨论,值得放出来。

5月16日星期六

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash

Google DeepMind 发布 Gemini 3.5 模型家族,首款 Gemini 3.5 Flash 当日上线 Gemini 应用、Google Search AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise。

推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断它在长任务工作流中的定位。

5月15日星期五

AI HOT 精选

IBM 开源多语言嵌入模型 R2:不到 1 亿参数,32K 上下文,检索跑分在同级里最高

IBM 在 Hugging Face 上发了两个新的多语言嵌入模型,都走 Apache 2.0 协议。小号 9700 万参数,在 MTEB 多语言检索上拿了 60.3 分,正文说这是目前所有开源同尺寸模型里最高的。大号 3.11 亿参数,得分 65.2,在 5 亿参数以下的开放模型里排第二。两个模型都基于 ModernBERT,支持 200 多种语言(...

推荐理由:HKR 三项都过:一个不到 1 亿参数、支持 32K 上下文的多语言嵌入模型,给 RAG 开发者提供了一个轻量开源选项。影响面不如前沿模型发布那么大,放在 featured 档刚好。

5月12日星期二

AI HOT 精选

Mira 的新公司 Thinking Machines 发了个原生多模态交互模型,前台 200 毫秒一响应,后台跑长线推理

这个模型把音频、视频、文字直接吃进去,不用再靠 agent 把一堆独立模型串起来。前台交互模型每 200 毫秒处理一次输入,保持对话的实时感,用户可以随时打断;后台推理模型负责长程规划和调工具。正文没披露具体参数量、训练数据和成本,也没给评测对比,所以实际效果和泛化能力还得看后续公开信息。

推荐理由:我会先打个折:正文没披露定价、开放范围和具体 benchmark,所以只能按现有信息给到 87。亮点在于 Thinking Machines 没有只发模型权重,而是给了一套前台 200 毫秒交互节点加后台推理的分层设计,原生多模态输入不是后期缝合的。这对正在折腾实时多模态 agent 的团队来说,至少提供了一个可参考的架构思路,但没看到代码或论文之前,不宜再往上拉。

5月11日星期一

AI HOT 精选

AntLingAGI 放出万亿参数模型 Ring-2.6-1T,5 月 15 日前在 OpenRouter 免费用

Ring-2.6-1T 是一个万亿参数模型,主打可调“思考强度”——你可以手动控制它多想一会儿还是少想一会儿,在回答质量、token 消耗和响应速度之间自己取舍。模型专门为智能体场景做了优化,支持多步执行和工具调用,适合高频工作流。官方说它能处理数学逻辑和科研类任务,但正文没给出具体跑分或对比数据。目前通过 OpenRouter 免费开放,截止到 5 ...

推荐理由:这条发布信息量偏薄,正文没给基准测试、定价、架构或训练细节,所以重要性我打了个折,没给更高。但万亿参数这个量级本身就有话题性,加上 OpenRouter 上的限时免费,对想快速试用的开发者很友好。可调思考强度和工具调用这两点,说明它在往智能体落地靠,不是单纯刷榜的模型。整体判断是:值得关注的一次模型发布,但别急着当里程碑,等实测数据出来再说。

5月9日星期六

AI HOT 精选

百度发了 ERNIE 5.1,参数量砍到原来的三分之一,训练费压到同规模模型的 6%

ERNIE 5.1 把总参数量压到原规模的大约三分之一,激活参数压到大约一半,预训练成本只花到同规模模型的 6% 左右。百度说性能没崩,Agent 能力超过 DeepSeek-V4-Pro,世界知识和创意写作接近头部闭源模型和 Gemini 3.1 Pro,推理仅次于 Gemini 3.1 Pro,深度搜索排全球第四。技术手段提了两个:弹性预训练用来提...

推荐理由:百度把 ERNIE 5.1 的参数和成本压到这个程度,我会先打个折——正文没披露具体参数量和基准测试细节,6% 的成本对比对象也没说清楚,这点先别太激动。但即便有水分,三分之一参数、一半激活、6% 预训练成本这三个数字摆出来,对正在头疼推理成本的团队来说就是强信号。加上已经上线 ERNIE 平台和 AI Studio,不是画饼,值得写。

AI HOT 精选

百度发 ERNIE 5.1,预训练成本压到对标模型的 6%

百度在 ERNIE 5.0 的基础上做了 5.1,主要提升搜索、推理、知识问答、创意写作和智能体能力。最抓眼球的数字是预训练成本只有对标模型的 6%,但正文没披露对标的是谁、怎么算出来的,也没给具体金额或技术细节。我会先打个折——成本低到这个程度,要么是用了 5.0 的底子省了大笔算力,要么是统计口径有讲究。另外,模型在哪些基准上测了、效果提升多少,帖...

推荐理由:百度发了ERNIE 5.1,最抓人的一句话是“预训练成本约为对标模型的6%”。这个数字让一条模型更新变成了成本效率的故事,从业者会立刻想知道对标模型是谁、成本口径怎么算的,正文没展开说,所以冲击力有,但信息缺口也大。搜索、推理、问答、写作和智能体能力都提了升级,但没给具体评测或对比数据,技术细节偏薄。我会先打个折:话题性够强,靠成本数字和国产旗舰身份撑到了p1,但缺细节让它进不了90分以上的档位。

5月7日星期四

OpenAI News

OpenAI 在 API 里上线了三款实时语音模型,能边听边推理、翻译和转写

OpenAI 这次发了三个新模型:GPT‑Realtime‑2 是带 GPT‑5 级推理能力的语音模型,能处理更复杂的请求,说话中间可以插话、改主意,它还能边想边回一句“我查一下”,同时调用多个工具;GPT‑Realtime‑Translate 做实时翻译,支持 70 多种输入语言转 13 种输出语言,语速跟得上说话人;GPT‑Realtime‑Whi...

推荐理由:OpenAI 官方放出了语音 API 更新,方向明确但信息不全。能推理、翻译、转写,听着挺全,可没给价格、没给延迟、没给上下文限制,我会先打个折。如果是真的省钱又低延迟,那对语音应用开发者是直接利好;现在只能说方向对了,落地还得等更多参数。

5月5日星期二

r/LocalLLaMA

Heretic 1.3 发布:模型可复现、内置跑分、显存占用更低

Heretic 1.3 这个版本主要干了三件事。第一,它现在能把跑模型时的环境——PyTorch 版本、GPU 型号、驱动、加速库这些——都打包记录下来,别人照着做就能复现结果,不用再猜“为啥我跑出来不一样”。第二,它内置了一套跑分系统,直接用 lm-evaluation-harness 测 MMLU、EQ-Bench、GSM8K 和 HellaSwa...

推荐理由:我会先打个折:正文没给出 VRAM 具体降了多少,这点先别太激动。但 Heretic 这次更新确实踩到了两个实在需求——一是让模型运行环境可复现,把 PyTorch、GPU、驱动版本都记下来,方便排查问题;二是内置了 lm-evaluation-harness 基准测试,不用再自己搭评测流程。项目有 2 万星、1300 万次下载,社区验证度够高。缺憾是 VRAM 优化只提了方向没给数字,所以重要性停在 72 分,放在 featured 里合适。

4月29日星期三

r/LocalLLaMA

Mistral 发布 1280 亿参数模型,支持图文输入和函数调用,高收入公司商用需额外授权

Mistral AI 在 Hugging Face 上放出了 Mistral Medium 3.5,一个 1280 亿参数的稠密模型,上下文窗口拉到 25.6 万 token。它能吃文本和图片,支持函数调用和 JSON 格式输出,推理强度可以按请求设成“无”或“高”。许可证用的是修改版 MIT,但对高收入公司留了例外条款——正文没披露具体收入门槛是多少...

推荐理由:这条发布信息量够硬,HKR 三项都踩实了,所以重要性给到 84。但正文没放任何跑分、定价和可复现的测试结果,我会先打个折——没有这些,光看参数和功能列表,实际效果和成本还不好判断。

4月25日星期六

MIT Technology Review · AI

DeepSeek V4 发布预览版:两个型号、百万 token 上下文,开源模型里跑分最强

DeepSeek 放出了 V4 的预览版,分 V4-Pro 和 V4-Flash 两个型号。Pro 版输入每百万 token 1.74 美元、输出 3.48 美元,Flash 版只要 0.14 和 0.28 美元,两个都支持一次性处理 100 万 token 的上下文,相当于能把《魔戒》三部曲加《霍比特人》全塞进去。跑分上,V4-Pro 在编程、数学、...

推荐理由:我会先打个折:这只是预览版,不是完整发布,所以冲击力比 GPT 或 Claude 大版本换代要弱一档。但它是当天消息,而且信息量够——两个型号的定价、100 万 token 上下文、开源权重对代理编码栈的成本压力,这些对从业者来说都是能直接算账的东西。标题里说的三个理由,正文其实主要落在长上下文注意力的效率提升和开源带来的成本下压上,具体技术细节没展开,但方向是明确的。

彭博科技

DeepSeek 发新模型了,但正文被 Bloomberg 的反爬墙挡住了,具体叫啥、多大、跑分多少全没看到

Bloomberg 这条视频标题说 DeepSeek 在去年震动硅谷的开源发布一周年之际,又推了一款新旗舰模型。但点进去页面直接弹 403 机器人验证,正文一个字都没加载出来。所以模型名字、参数量、定价、基准测试成绩、开源还是闭源,这些关键信息目前全是空白。唯一能确定的是发布时间点卡在周年附近,至于模型本身强不强、省不省钱,得等官方自己放料或者别人扒出...

推荐理由:这条消息的钩子在于“一周年”这个时间点,去年 DeepSeek 把硅谷震了一下,现在再发新模型,大家自然会盯着看。但我会先打个折:正文啥硬信息都没给,模型叫啥、多大、多贵、跑分多少、开不开源全是空白,所以知识缺口很大,不能当实锤来推。关联性上,DeepSeek 的定价和开源策略一直是行业敏感点,新旗舰出来肯定会重新拉高中美对比的热度,这点值得标记。整体判断就挂在时间钩子和信息缺口上,不补设定。

4月24日星期五

彭博科技

DeepSeek 发布新一代旗舰模型预览版,距上次出圈正好一年

DeepSeek 放出了新旗舰模型的预览版本,官方说法是“迄今最强的开源平台”。目前只确认了开源定位和预览状态,正文没披露参数量、上下文长度、跑分成绩和正式发布时间。我会先打个折——能看到的硬信息还太少,先别太激动。

推荐理由:DeepSeek 在去年炸场之后又推新旗舰预览,开源这张牌继续打,话题度够高,所以给到 featured。但文章实质信息很少——没参数、没上下文窗口、没基准成绩、没时间表,只能确认“预览版”和“开源”两点,知识增量弱,重要性就压在 75 这个低位。我会先打个折:标题唬人,内容还撑不起更高的分数。

X · @dotey(宝玉)

DeepSeek 发了 V4 预览版并开源,百万上下文直接标配,不再分版本加价

DeepSeek 放出了 V4 系列模型的预览版,代码也同步开源。这次最实在的变化是,百万 token 的上下文窗口成了所有官方服务的默认配置,Pro 和 Flash 两个型号都一样,没有高价门槛。V4-Pro 是旗舰,推理能力追平了顶尖闭源模型,世界知识得分仅次于 Gemini-Pro-3.1;V4-Flash 是轻量经济版,推理接近 Pro,但知识...

推荐理由:DeepSeek 是国内头部的模型厂商,这次 V4 预览版把百万上下文做成全服务标配并开源,属于实质性发布。HKR 三项都满足:正文有机制解释和迁移截止日期,而且这种定价策略的调整让它值得当天就作为 P1 处理。

4月23日星期四

彭博科技

腾讯发布新基础模型,这是它从 OpenAI 挖来核心研究员后的首次大考

腾讯宣布了一次重大的基础模型升级,但正文没披露模型名称、参数量、跑分成绩和具体发布时间。这是它从 OpenAI 挖来一位顶尖研究员后,第一次把新模型拿出来亮相,所以外界很关注这次升级到底成色如何。

推荐理由:Bloomberg 的信源有分量,而且把腾讯这次模型发布直接说成是对 OpenAI 挖角成果的首次检验,所以 H 和 R 都站得住。K 过不了,因为全文除了“发了”之外,模型名、规模、基准成绩、上线时间一概没给,属于有钩子没肉。

4月21日星期二

Latent Space

月之暗面发布 Kimi K2.6 开源模型,在长任务执行上对标 Claude Opus 4.6

月之暗面推出了 Kimi K2.6,一个总参数 1 万亿的混合专家模型,每次推理激活 320 亿参数,支持 25.6 万 token 的上下文窗口。它主打的是长时间、多步骤的智能体任务,官方宣称能连续跑 12 小时以上、调用超 4000 次工具、并行管理 300 个子智能体。在 SWE-Bench Pro 编程基准上得分 58.6,HLE 带工具得分 ...

推荐理由:我会先打个折:SWE-Bench Pro 58.6 这个数正文没给对比基线,不知道和 Opus 4.6 的差距到底多大,这点先别太激动。但 Kimi K2.6 真正值得盯的不是基座跑分,而是它把 agent 执行时长拉到 12 小时、能并行跑 300 个子代理,这在开源模型里算往前拱了一步。国内大模型旗舰发布本身就自带信号,加上抢在 DeepSeek v4 前出牌,对关注开源模型进展的人有信息差价值,所以给到 P1。

4月20日星期一

量子位 · 公众号

苏度科技估值超20亿美元,发布具身模型Sudo R1:零真实机器人数据训练,首次抓取成功率约98%

苏度科技放出了他们的具身智能首秀Sudo R1,说是在完全没有用真实机器人数据训练的情况下,直接零样本测试了200多次,对100多种没见过的物体(包括透明、金属、软的和反光的东西)首次抓取成功率约98%,试两次基本能到100%。整个演示跑了60分钟。他们用的方法是在高保真模拟器里结合世界模型和强化学习来训练,相当于先在虚拟世界里把技能练好再搬到真机上。...

推荐理由:这条我会先打个折,因为所有指标都是自报的,没第三方验证。但零真机数据、zero-shot 直接上真机抓出 98% 首次成功率,这个说法本身就够硬,而且给了 200 多次测试、100 多个没见过的物体、60 分钟连续跑,数字具体,不是空口号。它正好打在机器人行业最疼的地方:真实数据又贵又慢,仿真到真机迁移一直是个坑。正文没披露融资金额、基准怎么定义的、谁做的第三方验证,所以分数没给更高。

4月16日星期四

36 氪 · 直链

Anthropic 下周要把能找安全漏洞的 Mythos 模型拿给英国银行试用

Anthropic 计划下周通过“玻璃翼计划”,让部分英国金融机构提前用上它的 Mythos 模型。公司说这个模型很擅长识别甚至利用网络安全漏洞,所以这次不是公开发布,而是定向开放给银行。正文没披露模型的具体参数、收费方式和已有客户数量,目前能看到的信号就是一次受控的行业试用。

推荐理由:这条消息的钩子很硬——一个能找漏洞甚至可能利用漏洞的模型,先给银行看,不是全面上线,而是通过“玻璃翼计划”分阶段、只对特定机构开放。正文没披露参数、定价和具体覆盖多少家银行,所以实际影响有多大还不好说。我会先打个折:这更像一次受控分发,不是产品发布。但放在金融监管和模型安全治理的交叉点上,值得从业者盯紧后续。

Google DeepMind

Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 中开放预览。

推荐理由:原文给出新语音模型的音频标签控制方式、Elo 分数与多平台开放入口,可据此判断语音生成的可控性变化。

4月13日星期一

Google DeepMind

Google DeepMind 发布 Gemini Robotics-ER 1.6 机器人推理模型

Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力。

推荐理由:原文给出新模型在空间推理、多视角与仪表读数上的能力变化和开放入口,可据此判断机器人高层推理的进展。

4月9日星期四

量子位 · 公众号

腾讯推出MoT架构,2B参数的具身模型在22项评测里拿了16项第一

腾讯混元与Robotics X联合发布了HY-Embodied-0.5,核心是一个叫MoT-2B的模型。它总参数量4B,实际干活时只激活2B,在22项具身智能评测中拿了16项第一。训练数据量不小:用了超过1亿条具身数据、600B以上的预训练token、3000多万条中期训练样本,还引入了视觉隐空间token、双向注意力、RFT、强化学习和在线蒸馏。这模...

推荐理由:我会先打个折:这还是一次模型发布,不是那种当天就改变行业格局的大事,所以分数没拉到 85 以上。但它的钩子够强——腾讯说 MoT 比 MoE 更适合具身,而且一个激活参数只有 2B 的模型在 22 项评测里赢了 16 项,数字和训练细节也给得实在。对做端侧机器人的从业者来说,这套专门为具身重做的架构和训练链路比通用模型微调有意思得多,所以 H、K、R 都站得住。

X · @op7418(歸藏)

小扎挖的团队交卷了:Meta 发 Muse Spark,多模态推理但暂不开源

Meta 把之前挖来的团队做的第一个模型 Muse Spark 放出来了。它原生支持多模态推理,能看图、用工具、展示视觉思维链,还能让多个 Agent 并行干活。有个叫“沉思”的模式,就是协调多个 Agent 一起推理。在 Artificial Analysis 上的跑分比 Gemini 3.1 Pro、GPT-5.4 和 Claude Opus 4....

推荐理由:大厂新模型发布,加上“挖角团队首秀”的故事线,HKR 三项全中。分数卡在 featured 门槛附近,因为文章只给了能力声明和相对排名,参数规模、定价、铺开时间和访问范围都没披露,我会先打个折。

4月3日星期五

Google DeepMind

Google DeepMind 发布 Gemma 4 开源模型家族

Google DeepMind 发布 Gemma 4,称其为迄今最智能的开源模型,面向高级推理与智能体工作流,采用 Apache 2.0 许可。该系列包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,31B 在 Arena AI 文本榜位列全球开源模型第 3,26B 位列第 6。

推荐理由:Gemma 4 以 Apache 2.0 开源并覆盖端侧到工作站四种尺寸,可据此判断开源模型的部署与微调选择。

3月24日星期二

Mistral AI

Mistral AI 发布 4B 参数语音合成模型 Voxtral TTS

Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与零样本跨语言音色适配能力。

推荐理由:原文给出 4B 参数、9 种语言、70ms 延迟与定价,读者可据此判断企业语音智能体的成本与选型空间。

3月17日星期二

Mistral AI

Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

Mistral AI 发布 Mistral Small 4,这是首个把 Magistral 推理、Pixtral 多模态和 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。

推荐理由:Mistral Small 4 把推理、多模态与编码智能体合并进单一开源模型,可据此判断统一模型对部署成本的影响。

2月10日星期二

36 氪 · 直链

阿里千问发布 Qwen-Image-2.0,一个图像生成基础模型,已开放 API 邀测

千问推出了新一代图像生成基础模型 Qwen-Image-2.0。现在可以在阿里云百炼上申请 API 测试,也能在 Qwen Chat 上免费试用。不过正文没披露模型参数量、具体定价、评测跑分和正式公开时间,所以实际效果和成本还不好判断。

推荐理由:千问发了个新的图像生成基础模型,百炼 API 邀测和 Qwen Chat 免费体验都开了,HKR 三项全中:有实际可用的产品信号、有明确的接入路径、对国内模型用户有直接参考价值。没给到 78 分以上是因为正文缺了模型大小、价格这些关键信息,我会先打个折。

2月6日星期五

TechCrunch · AI

OpenAI 和 Anthropic 在同一天抢着发布能自己干活的编程模型,前后只差几分钟

OpenAI 推出了 GPT-5.3 Codex,一个专门给自家编程工具 Codex 用的新模型。按 OpenAI 的说法,这个模型让 Codex 从“能写代码、审代码”升级到“几乎能替开发者在电脑上干所有事”,甚至能在几天内从零做出功能复杂的游戏和应用。速度比上一代 GPT-5.2 快了 25%,而且 OpenAI 说这是第一个“自己参与造自己”的模...

推荐理由:这条消息的看点全在时间差——OpenAI 在 Anthropic 发布后几分钟就甩出自己的代理式编码模型,说明两边在让模型进开发流程这件事上咬得很紧。但正文能用的信息太少:没模型名、没跑分、没价格、没上下文窗口、也没说谁能用,只提了一嘴跟 Codex 有关。所以我会先打个折,重要性给到 75、放在 featured 低位,因为话题热度够,但证据太薄,暂时没法判断性能或性价比。

2月5日星期四

Mistral AI

Mistral 发布 Voxtral Transcribe 2 语音转写模型家族

Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。

推荐理由:原文给出两款语音转写模型的延迟、价格与开源许可,可据此判断实时语音应用的选型空间。

1月6日星期二

NVIDIA 博客

NVIDIA 一口气开源了一堆模型、数据和工具,覆盖智能体、机器人、自动驾驶和生物医药

NVIDIA 在 2026 年 1 月 5 日放出了一批新的开源模型和数据集。语言模型方面,有 Nemotron 系列的新成员,专门做语音、外挂资料库(RAG)和安全对齐;还有一个叫 Alpamayo 1 的模型,正文没具体说它擅长什么。物理 AI 这边,Cosmos 系列更新了 Reason 2、Transfer 2.5 和 Predict 2.5 ...

推荐理由:NVIDIA 这次不是发一篇通稿,而是把 Nemotron、Cosmos、GR00T、Clara 几条线的模型、数据集和工具一起开源了。我会先打个折:所有信息都来自厂商自己,没有第三方验证,实际可用性还得看后续社区反馈。但光看披露的数字——10 万亿 token 文本、50 万条机器人轨迹、100TB 车载数据、45.5 万个蛋白结构——规模确实够大,而且覆盖了代理、物理 AI、自动驾驶和生命科学几个热门方向。具体到模型,Nemotron Speech 做语音、Cosmos Reason 2 做推理、GR00T N1.6 做人形机器人、Alpama...

2025年12月17日星期三

Mistral AI

Mistral 发布 OCR 3,表单与手写识别升级并接入 Document AI Playground

Mistral 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率,并称准确率超过企业文档处理方案和 AI 原生 OCR 方案。

推荐理由:Mistral OCR 3 在表单、手写和复杂表格上的升级与每千页 2 美元的定价,可供评估文档解析方案时参考。

2025年12月9日星期二

Mistral AI

Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

Mistral AI 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

推荐理由:原文给出 Devstral 2 的 SWE-bench 成绩、开源许可与部署门槛,可据此判断开源编码模型的落地成本。

2025年12月3日星期三

Mistral AI

Mistral 发布 Mistral 3 系列模型,含 675B 参数 Mistral Large 3

Mistral AI 发布 Mistral 3 系列,包括 14B、8B、3B 三个稠密模型和采用稀疏 MoE 架构的 Mistral Large 3,后者为 41B 激活、675B 总参数,全部以 Apache 2.0 许可开源。

推荐理由:Mistral 3 一次性放出从 3B 到 675B 的 Apache 2.0 模型家族,读者可据此判断开源权重在端侧与前沿能力上的最新位置。