跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 21–40 条 · 共 88 条

6月3日星期三

AI 群聊日报

微软发布自研推理模型MAI-Thinking-1,35B参数在编程和数学上追平Opus 4.6

微软首个正式对外发布的自研推理模型MAI-Thinking-1,用了35B活跃参数、总参数约1T的稀疏MoE架构。SWE-Bench Pro编程测试跟Claude Opus 4.6打平,AIME 2025数学测试拿到97%,盲测里人类偏好优于Sonnet 4.6。训练全程没用任何第三方模型蒸馏,预训练数据也排除了AI生成内容。不过群友对微软年底拿第一的...

推荐理由:这条消息的钩子很清晰:微软的 MAI-Thinking-1 在代码基准上追平了 Opus 4.6,而且给出了具体的参数规模和数学测试得分。我会先打个折——来源是群聊日报,不是官方公告,正文没披露模型是否开源、API 定价和完整评测设置,所以权威性偏弱。但 H/K/R 三个维度都踩中了:有竞争对标、有硬数字、有平台格局的冲击力。综合来看,值得作为 featured 推给从业者看一眼,但别急着把它当正式发布。

AI HOT 精选

Qwen3.7 发布,重点强化推理和让模型进业务流程干活的能力

Qwen 发了 Qwen3.7,由通义大模型 BU 多模态交互负责人 Steven Hoi 介绍。官方说法是推理能力有重大突破,工具调用、写代码和长链条的 agent 任务都做了升级。正文没披露模型参数量、定价、跑分成绩和开源/闭源条件,我会先打个折——等看到具体数字和实测再判断突破有多大。

推荐理由:HKR-H 和 HKR-R 通过,因为 Qwen3.7 是阿里云旗舰模型更新,从业者会关注。HKR-K 不通过:正文只说了能力方向,没给参数量、价格、跑分或接入方式,信息缺口太大,没法判断实际提升。

AI HOT 精选

微软发布自研推理模型 MAI-Thinking-1,中等规模,没从第三方模型蒸馏

微软在 Build 2026 上掏出了自己的第一款高级推理模型 MAI-Thinking-1。官方说这是个中等尺寸的模型,在一些软件工程基准上能跟一线模型打平。训练数据完全自建,没走知识蒸馏的捷径——也就是没拿别家大模型当老师来教它。这是微软在模型自研上的一次表态,之前它主要靠 OpenAI,最近两家刚重新谈了合作,关系没那么紧了。

推荐理由:微软在 Build 2026 发了 MAI-Thinking-1,说是中等规模推理模型,在软件工程基准上能打平领先模型。我会先打个折——正文没披露具体分数、访问方式和定价,所以没法判断它到底多强、多便宜。这点先别太激动。但这是微软第一个自研高级推理模型,信号很明显:它在试着减少对 OpenAI 的依赖,同时往开发者工具链里塞自己的货。

6月2日星期二

AI HOT 精选

阶跃星辰放出 Step 3.7 Flash,开放权重,主打帮智能体写代码

阶跃星辰发了个新模型 Step 3.7 Flash,把权重开放了,你可以直接下载用。它的定位是给智能体编程场景用,强调工具调用可靠,还能处理多模态输入。同一天 MiniMax 也开源了 M3,两家模型都已经能在 Kilo 平台上跑。正文没披露具体的跑分、参数量或硬件门槛,所以实际快不快、省不省资源还得自己测。

推荐理由:这条消息的钩子在于“开放权重”和“智能体编程”两个点,不是常规发个新版本。我会先打个折:正文没给模型尺寸、跑分、许可证和定价,所以只能算有信息增量但缺关键验证。对开发者来说,能直接下载权重、能调工具、能看懂多模态输入,这几个能力放在一起确实有吸引力,尤其现在大家都在抢智能体编程这条赛道。Kilo 上线也让想试的人有个现成入口。不过没披露性能对比和实际成本,这点先别太激动,等后续数据出来再看值不值得切过去。

6月1日星期一

量子位 · 公众号

招商局狮子山实验室开源 LiOS 架构,把云端大模型延迟压到 30 毫秒,还送了个叠衣服数据集

招商局狮子山人工智能实验室放出了一个叫 LiOS 的边云架构,专门解决机器人怎么用上云端大模型的问题。他们跨机器测下来,从本地摄像头到云端 GPU 显存,单向延迟大约 30 毫秒,这个数字对很多实时控制场景已经够用了。架构里低延迟视频传输模块直接开源,还附带了一个 LeFold 叠衣服数据集。不过正文因为微信环境异常没加载出来,具体用了什么模型、在哪些...

推荐理由:我会先打个折:招商局狮子山实验室不是头部平台,也没看到多源交叉验证,所以影响力止步中等。但这条消息确实给了干货——30ms相机到云端显存的延迟数字,说明端云协同在物理世界干活有戏,不是纯画饼。开源图传模块和叠衣数据集也算实在,同行能直接拿来测。正文没披露具体模型规模、功耗和复杂场景下的抖动,这点先别太激动。

AI HOT 精选

英伟达开源 Cosmos 3:一个能看懂物理世界、还能生成动作的 32B 模型

英伟达把 Cosmos 3 称为第一个完全开放的物理 AI 全能模型,意思是它不只能识别图像,还内置了视觉推理、生成 3D 世界状态和直接输出动作的能力。这次放出两个尺寸:Super 版 320 亿参数,Nano 版 80 亿参数。正文没提训练数据规模、具体跑分和推理成本,所以实际能用多好、跑起来贵不贵还得等实测。

推荐理由:我会先打个折:正文是单篇发布稿,没给基准测试、没提许可证细节,也没说训练数据规模和实际部署条件,所以分数卡在 78–84 区间。亮点在于 NVIDIA 第一次把视觉推理、世界生成和动作生成打包成一个开放物理 AI 模型,并给出两个具体尺寸,这对机器人圈子的信号意义不小。但缺少验证信息,这点先别太激动。

AI HOT 精选

MiniMax 开源 M3 模型:一个模型搞定编程、100 万 token 上下文和原生多模态

MiniMax 把 M3 模型开源了,权重公开可下载。它把三个能力塞进了一个模型里:编程水平摸到了 GPT-5.5 和 Gemini 3.1 Pro 的边(SWE-Bench Pro 得分 59.0%),能处理 100 万 token 的超长上下文,还原生支持图片和视频输入。长上下文不卡顿的关键是他们自研的 MSA 稀疏注意力机制——在 100 万 t...

推荐理由:MiniMax M3开源了一个把文本、图像、音频塞进同一个模型的一体方案,上下文窗口拉到100万token。最实在的点是MSA注意力机制,每token计算成本降到前代的1/20,长文本推理能省不少钱。编码和Agent跑分看着不错,但正文没给出具体对比对象和测试细节,这点先别太激动。整体是一次有诚意的开源发布,信息量够,但验证还缺一环,所以放在featured而不是P1。

5月31日星期日

新智元 · 公众号

复旦系团队发布时空一体世界动作模型 STI-WM,称能同时吃进 RGB、点云和本体感知数据做百秒级任务规划

这篇文章来自微信公众号,但页面被环境验证挡住了,正文内容完全看不到。标题和摘要里提到的“复旦铁三角”和“最优物理 AI 路径”都是原文的说法,具体技术细节、实验数据和模型架构都没法核实。已知信息是:一个叫 STI-WM 的模型,主打时空一体的世界动作建模,用在机器人上,支持 RGB 图像、点云和机器人自身状态感知三种输入,能做上百秒的任务规划。另外还提...

推荐理由:这篇东西我会先打个折——全是公司自己说的,没给公开 benchmark 也没说模型能不能复现。但信息量确实不小:STI-WM 把视觉、点云和机器人自身状态揉进一个模型里,号称一次能规划上百秒的动作,这比现在多数 demo 里几秒的规划长得多。半年融了 5 轮、Pre-A 轮 3 个亿,还拉了 NVIDIA 站台,资本侧的信号比技术侧更实。对做机器人落地的人,这条至少能看出一条技术路线和资源密度,所以放在 featured 门槛上。

量子位 · 公众号

复旦系团队发布机器人世界动作模型 STI-WM,把时空信息揉在一起做长任务

沐神智能搞了个叫 STI-WM 的模型,专门给机器人用的。它把 RGB 画面、深度点云和机器人自身状态(比如关节角度)同时喂进去,首创了时空一体的架构,不再是先看空间再看时间的两段式处理。官方说它能支撑上百秒的长任务推演,中间出错了还能闭环重新规划。不过正文没给出具体的基准测试分数,也没提部署成本,所以实际效果和性价比还得等更多数据。

推荐理由:我会先打个折:正文没披露权重是否开源、有没有标准 benchmark 对比、百秒推演在什么场景下验证的,这些关键信息都缺。但 STI-WM 把 RGB、深度点云和本体输入揉进一个时空一体架构,直接做百秒级推演,这个思路对做机器人世界模型的人有参考价值。眸深智能又是复旦系团队,英伟达也出现在标签里,产业和学术两边都有点关联。综合来看,信息够新、够具体,但验证强度不明,所以放在 featured 门槛附近,不往上拔。

5月30日星期六

AI HOT 精选

OpenAI 放出一个实时翻译语音模型,70 多种语言输入,13 种语言输出

OpenAI 发了 gpt-realtime-translate,一个专门做语音翻译的模型。你对着它说 70 多种语言里的任意一种,它能直接用 13 种目标语言把语音播出来。OpenAI 说大模型虽然强,但特定任务还是得上专用模型。目前这个功能已经在智能眼镜上跑起来了,不过正文没披露延迟、准确率和具体硬件细节。

推荐理由:我会先打个折:正文没提延迟、定价和 API 开放时间,所以实际能不能用、贵不贵还不知道。但 OpenAI 把实时翻译塞进智能眼镜,70多种语言进、13种语言出,这个组合本身是个挺实在的进展,值得从业者看一眼。

5月29日星期五

AI HOT 精选

Google 发布两款图像模型 Nano Banana Pro 和 Nano Banana 2,已接入 Gemini API 可用

Google AI 开发者账号官宣了两个图像模型:Nano Banana Pro(代号 gemini-3-pro-image)和 Nano Banana 2(代号 gemini-3.1-flash-image),现在就能通过 Gemini API 调用,直接上生产环境。帖子贴了一些社区示例展示效果,但正文没披露定价、跑分、并发限制这些关键信息,想评估成...

推荐理由:Google 这次一口气发了两个图像模型,Nano Banana Pro 和 Nano Banana 2,都走 Gemini API,直接面向生产环境。标题和摘要只给了名字和可用性,没提性能对比、价格、安全机制,所以没法判断实际强不强。我会先打个折,不往 p1 放,但作为产品动态值得让关注图像生成和多模态的人知道。

The Verge · AI

Claude Opus 4.8 发布,主打“老实”:不确定时会直说,瞎编的概率降到前代的四分之一

Anthropic 周四放出 Claude Opus 4.8,这次没吹性能天花板,而是强调模型更“诚实”。公司说早期测试者发现它更愿意主动标注自己没把握的地方,而不是硬编一个听起来合理的答案。内部评测给了一个具体数字:Opus 4.8 做出无据论断的概率大约是前代模型的四分之一。不过正文没披露这个评测的具体基准和对比对象,我会先打个折——四倍改善听起来...

推荐理由:我会先打个折:正文只说了“评估中少约 4 倍无依据声明”,但没披露具体用了哪些基准测试、测试规模多大、在什么任务上测的,也没提价格和上下文窗口有没有变。所以这个“4 倍”只能当个方向性信号看,别直接当成绝对指标。不过对从业者来说,模型肯承认自己不确定而不是硬编,本身就是个值得关注的转向,尤其在需要高可靠性的工作流里。整体信息量够上头条,但细节缺口明显,分数给在 85–94 这个区间是合理的。

5月28日星期四

AI HOT 精选

Mistral 推出物理 AI 模型,用一张 GPU 几秒钟预测完整物理场

Mistral 整合了 Emmi AI 团队,发布了一个面向工业工程的物理 AI 基础模型。它能根据几何结构、边界条件或测量数据,在单张 GPU 上用几秒钟预测出完整的物理场(比如温度、应力分布)。正文没披露具体架构、参数量、训练数据规模和实测误差范围,也没给出跟传统数值仿真在精度和速度上的量化对比,所以实际工程可用性还得看后续验证。

推荐理由:Mistral 这次没发新聊天模型,而是直接拿下一个物理 AI 团队,做工业仿真。我会先打个折:正文没披露具体模型名、基准测试、定价和开放方式,所以没法判断它比现有求解器到底准不准、省多少。但方向本身值得关注——如果单 GPU 秒级出完整物理场是真的,对西门子能源这类重工业客户来说,仿真迭代速度会快很多,成本也可能降一截。这点先别太激动,等他们放出可复现的结果再说。

5月25日星期一

r/LocalLLaMA

NuExtract3 发布:一个 4B 开源视觉模型,能把图片和文字转成 Markdown、做 OCR 和按模板抽信息,自己电脑就能跑

Numind 放出了 NuExtract3,一个基于 Qwen3.5-4B 的开源视觉语言模型,用 Apache-2.0 协议。它主要干三件事:把图片或文字转成 Markdown 格式、从图片里直接识别文字(OCR)、以及按你给的 JSON 模板把非结构化内容抽成结构化数据。模型只有 4B 参数,对硬件要求不高,官方说最低 4GB 显存就能在本地部署。...

推荐理由:NuExtract3 把一个 4B 大小的开源视觉模型打包成了文档抽取工具,支持 OCR、转 Markdown 和按你给的 JSON 模板把内容抽出来。最吸引人的是它最低只要 4GB 显存就能在自己机器上跑,这对在意数据不出本地的团队来说省了不少事。模型基于 Qwen3.5-4B,用 Apache-2.0 协议,没有授权上的坑。不过正文没给出具体的抽取准确率或延迟数据,实际效果得自己测一下才知道。

5月22日星期五

AI HOT 精选

智谱发布 GLM-5.1 高速版,API 输出冲到每秒 400 个 token

智谱在 5 月 22 日给部分企业客户开放了 GLM-5.1-highspeed 接口,输出速度标称 400 tokens/s,说是目前大模型厂商里最快的。过去跑得快的模型通常能力会打折,这次智谱声称把旗舰模型的能力和低延迟同时塞进了生产环境。提速主要靠 GLM 团队和 TileRT 团队在三个层面做的系统优化:推理引擎重写了核心路径来提升单卡吞吐;调...

推荐理由:智谱扔出一个 400 tokens/s 的 API 速度数字,说是全球纪录,我会先打个折——正文没披露测试条件、并发数、上下文长度和定价,这些缺口让“纪录”暂时只能当个参考。但 GLM 和 TileRT 联手做系统级优化这件事本身有信息量,说明国产模型在推理加速上开始卷工程落地,不只是卷榜单。对从业者来说,速度快意味着同样任务花钱少、等得短,这点先别太激动,等看到实际压测和价格再判断值不值得切。

5月21日星期四

r/LocalLLaMA

腾讯发布 Hy-MT2 翻译模型,覆盖 33 种语言,最小 1.8B 版压缩后仅 440MB

腾讯放出了 Hy-MT2 系列翻译模型,有 1.8B、7B 和 30B-A3B 三个尺寸,支持 33 种语言互译。1.8B 小模型用上 AngelSlim 1.25-bit 量化后,存储占用压到 440MB,推理速度还快了 1.5 倍,适合本地跑。不过 Reddit 原帖被屏蔽了,正文没披露具体翻译质量评测和更多技术细节,这点先别太激动。

推荐理由:我会先打个折:Reddit 信源比较散,所以分数没再往上拉。但 440MB 这个数字太直观了,比单纯列三个模型尺寸更有传播力,从业者一眼就能算出部署成本。正文没披露量化后的翻译质量损失,这点先别太激动,但“小模型干翻译”这个方向本身值得关注。

r/LocalLLaMA

Cohere 联合创始人亲自回应:Command A+ 是他们第一个 MoE 开源模型,主打在 1-2 张 GPU 上跑得动

Cohere 的 Nick Frosst 在 Reddit 上发帖,正式推出了 Command A+。这是他们第一个混合专家(MoE)模型,用 Apache 2.0 协议开源。帖子里说,这个模型最大的卖点是效率,做了很极限的量化工作,在 1 到 2 张消费级 GPU 上就能跑得很流畅,对个人开发者和小团队比较友好。不过他也直说,模型的顶尖性能还有待打磨...

推荐理由:我会先打个折:正文没披露参数量、基准测试成绩和上下文窗口,这些关键指标全缺,所以重要性只能给到 74。亮点是 Cohere 终于把 Command-A 这条线捡起来,换成 MoE 架构还给了 Apache 2.0,量化后能在 1 或 2 张 GPU 上跑,对想自己部署的人是个实在消息。但信源只有 Reddit 讨论,没有官方技术报告或实测数据,这点先别太激动。

5月20日星期三

AI HOT 精选

Stability AI 发布 Stability Audio 3.0,能生成超过 6 分钟的专业歌曲

Stability AI 发了四个新音频模型,最小的两个(4.59 亿参数)能在手机或电脑本地跑,生成两分钟以内的声音和音乐。中型(14 亿参数)和大型(27 亿参数)模型能把完整歌曲拉到 6 分 20 秒,比上一代翻了一倍多。小号和中号模型已经开源,大号模型只走 API 和付费托管,年收入超 100 万美元的公司必须买商业授权。训练数据来自华纳和环球...

推荐理由:我会先打个折:标题里的“专业级”正文没给出任何评判标准或盲测结果,这点先别太激动。能生成超过6分钟的音乐确实比多数短片段模型进了一步,4款规格也说明在考虑不同算力场景。但全文没披露训练数据是否含版权素材、生成内容的商用条款,也没给任何客观音质指标,所以只能算一次产品更新,离行业震动还差几口气。

AI HOT 精选

Kling AI 上线原生 4K 视频生成,不再靠后期放大,直接出真 4K

Kling AI 在 4 月 23 日放出一个原生 4K 视频生成模型,不是先做低分辨率再放大,而是从生成阶段就按 4K 来跑。官方说好莱坞团队和 Wonder Studios 已经在用,制片人反馈这是他们工作流里第一个原生 4K 基础模型,Wonder Studios 特别提到原生生成能避免传统放大带来的角色变形,画面一致性更好。不过正文没披露价格、...

推荐理由:我会先打个折:这是厂商自己发的消息,不是第三方评测。能一键出原生4K确实少见,也报了合作方名字,所以给了featured。但没给任何可比的硬指标——生成一段4K要多久、花多少钱、最长能出多少秒,这些全没说。这点先别太激动,等实测出来再看。

AI HOT 精选

Google AI Edge Gallery 更新:手机端模型能调外部工具、设提醒、记住聊天了

Google 给 AI Edge Gallery 这个手机端模型体验应用加了三个新能力。一是安卓版开始实验性支持 MCP(模型上下文协议),你可以给手机上的 Gemma 4 模型配一个外部工具服务器地址,比如连上 Google Workspace 查日历邮件,或者接 Google Maps 问路、接网页抓取工具读链接内容。模型在本地决定调哪个工具,请求...

推荐理由:Google 在安卓 AI Edge Gallery 里塞了实验性 MCP 支持,Gemma 4 能直接调 Workspace、Maps 这些外部工具,还补了通知和会话记忆。我会先打个折——正文没披露延迟、耗电和实际可用工具数量,目前更像开发者尝鲜版。但方向很明确:让手机端模型从聊天框跳出来,进到系统里干活。这点先别太激动,等看实际跑起来的稳定性。