跳到正文

小米 MiMo

小米的 AI 动态:MiMo 系列模型的发布与开源、端侧与汽车场景的 AI 落地追踪。

34 条精选相关主题千问 Qwen端侧 AI开源生态

最新精选

第 21–34 条 · 共 34 条

5月29日星期五

AI HOT 精选

小米开源 ControlFoley:给视频配音效,可以按你写的提示词或给的参考音频来

小米大模型应用团队放出了一个叫 ControlFoley 的视频音效生成模型,权重和代码都开源了。它主要解决一个问题:以前模型只能看画面自动猜配什么声音,创作者没法干预。ControlFoley 支持三种用法——用文字描述想要的音效、用文字强行覆盖画面里原有的声音、或者上传一段参考音频让它模仿音色和风格,同时还能保证声音和画面动作对得上。团队自己训了一...

推荐理由:ControlFoley 把视频拟音做成可控生成,还直接开源了全套,对创作者和开发者都挺友好。它不是那种刷榜的基础模型发布,但胜在任务明确、工具属性强,放在 featured 门槛附近是合理的。

5月27日星期三

AI HOT 精选

小米 MiMo 2.5 Pro 永久降价,最高砍掉 99%,跟 DeepSeek V4 Pro 一个价

小米把 MiMo-V2.5 系列的 API 价格永久打下来了,最高降了 99%,现在和 DeepSeek V4 Pro 定价持平。花同样的钱,能用的 token 数多了 5 到 8 倍,计费方式也变简单了。老用户之前买的套餐额度会全部重置补满。降价的原因是他们在推理环节做了全栈优化,省下来的成本直接让出来了,具体技术细节后面会发博客。另外 MiMo-V...

推荐理由:HKR 三项都成立:99% 的降幅和直接点名 DeepSeek 同价,话题性够强;降价幅度和生效时间都是硬信息;API 成本压力是从业者每天在算的账。不过这只是调价公告,没有新模型或新能力,所以重要性停在 76 分,不往上拉了。

5月24日星期日

机器之心 · 公众号

ICML 2026 中了一篇让视觉模型学会“多条思路并行思考”的论文,但正文被验证页挡住了

这篇被 ICML 2026 接收的论文叫 Visual Para-Thinker,给视觉语言模型加了一套并行思考框架。核心是用 Pa-Attention 和 LPRoPE 把视觉推理拆成四条独立路径,让模型同时从不同角度理解图像,再综合出答案。训练数据是 16.3 万组问答对,规模不算大,所以泛化能力得打个问号。不过目前文章页面被微信环境异常验证挡住了...

推荐理由:这篇 ICML 2026 论文给视觉语言模型装了一个并行思考框架,叫 Visual Para-Thinker。核心是把视觉推理拆成 4 条路径同时跑,用 Pa-Attention 和 LPRoPE 做隔离,防止路径间串味。训练数据是 16.3 万对问答,规模不算大,但够验证想法。我会先打个折:这是单篇研究,没有多团队复现或产品落地,所以重要性停在 79。对做多模态推理加速和内部机制拆解的人,这篇值得看,但别当成熟方案直接用。

5月14日星期四

AI HOT 精选

小米 MiMo V2.5 Pro 在 DesignArena 设计竞技场拿到第三,前端编码追平 Claude Sonnet 4.6

MiMo V2.5 Pro 的 Thinking 版本在 DesignArena 总榜上比上一代 MiMo-V2.5 爬了 8 个名次,直接冲到第三。前端编码任务的表现已经和 Claude Sonnet 4.6 打平。正文没披露具体评分和测试样本量,所以这个“追平”是在什么条件下达成的还不清楚,先别太激动。

推荐理由:H、K、R 三条都踩中了,但信息全来自官方一条推文,没公开测试方法、没开放试用、也没提价格,所以先别太激动。这更像一次产品更新和榜单占位,不是那种当天必须追的硬核发布。

5月13日星期三

r/LocalLLaMA

小米把 1 万亿参数的 MiMo-V2.5-Pro 开源了,但自己跑真的划算吗?

小米放出了 MiMo-V2.5-Pro,参数总量 1.02 万亿,但每次推理只激活 420 亿参数,上下文窗口能塞进 100 万个 token,用 MIT 许可证。作者拿它跑了 125 次 Claude Code 任务,走 API 总共花了 70.12 美元,处理了约 3.87 亿个 token,缓存命中率高达 96.3%。这个命中率说明大部分请求其实...

推荐理由:我会先打个折:正文没披露 MiMo-V2.5-Pro 的评测跑分,所以性能好坏只能靠参数规模猜。但这条信息本身够直接——小米把一个 1.02 万亿参数、42B 激活的模型开源,另一边作者用 Claude Code 跑了 125 次会话,3.87 亿 token 花了 70.12 美元,缓存命中率 96.3%。这两组数字摆在一起,自建成本和 API 开销的对比就出来了。对做工程的人,这种一手成本数据比技术报告更有参考价值。

5月8日星期五

AI HOT 精选

AI 终端智能化分级国标发布,手机、电脑、眼镜等 7 类产品有了 L1 到 L4 的官方划分

工信部等部门联合发布了《人工智能终端智能化分级》国家标准,把终端设备的 AI 能力分成 L1 响应级、L2 工具级、L3 辅助级和 L4 协同级四个等级,等级越高设备越“聪明”。标准覆盖手机、电脑、电视、眼镜、汽车座舱、音箱、耳机七类产品,起草单位包括小米、荣耀、华为、OPPO 等。L4 协同级的具体要求正文没披露,说后续再补。另外,具体的测试指标和判...

推荐理由:这条国标先把 AI 终端的智能化程度分成了 L1 响应级、L2 工具级、L3 辅助级、L4 协同级,首批覆盖手机、电脑、眼镜、电视、耳机等 7 个品类,框架是“2+N”。对从业者来说,分级标签本身是个对齐口径,但真正要盯的是测试方法——正文没给出具体指标,L4 的细则也说要后续修订。所以现在能参考的是等级定义和覆盖范围,能不能落地、怎么验证,还得等下一版。

5月5日星期二

r/LocalLLaMA

DeepSeek V4 Pro 在 FoodTruck Bench 上追平 GPT-5.2,晚了十周但成本只要十七分之一

Reddit 上有人发帖说,DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的智能体评测里排到第四,中位数得分跟 GPT-5.2 只差 3%,但跑一轮任务的成本大概是后者的十七分之一。这个评测跑了 30 天,模型要用 34 种工具、带持久记忆、每天还得做反思,比较贴近真实业务流程。帖子还提到小米的 MiMo v2.5 Pro ...

推荐理由:这篇是一个 Reddit 用户自己搭的 benchmark 结果,不是官方发布,所以我会先打个折。但内容本身挺有意思:DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的 30 天 agent 测试里排第 4,跟 GPT-5.2 的中位数只差 3%,API 成本却低了大约 17 倍。测试用了 34 个工具、持久记忆和每日反思,不是简单的一问一答。小米 MiMo v2.5 Pro 也进了前 6,5 次全存活,中位 ROI 1019%,单次跑完只要 $2.41。正文没披露样本量和方差,所以“匹配 GPT-5.2”这个结论先别太激...

5月1日星期五

r/LocalLLaMA

Reddit 实测 MiMo-V2.5-Pro:开源模型里跑桌游《血染钟楼》最稳的一个

Reddit 用户 cjami 拿小米的 MiMo-V2.5-Pro 在《血染钟楼》里做了自主对局测试。模型扮演好人阵营时胜率 88%,扮演坏人时胜率掉到 48%,说明它更擅长合作推理,搞欺骗和伪装还差点意思。每局平均输出 18.3 万 token,成本 0.99 美元,工具调用出错率只有 0.4%,这个错误率很低,说明模型能稳定按规则调用游戏功能。对...

推荐理由:这条帖子来自 Reddit 个人测试,不是官方模型发布,权威性要打个折。但 HKR 三项都站得住:有具名基准、有胜负率、有 token 消耗和成本对比,还有工具调用错误率,信息量够放进 featured 档。

4月28日星期二

量子位 · 公众号

小米开源 MiMo-V2.5 系列模型,Pro 版 4 小时无人工干预搭出一个 macOS 桌面

小米把 MiMo-V2.5 系列的权重放出来了,包含 Pro Agent、多模态基座、TTS 和 ASR 几个模型。MiMo-V2.5-Pro 在 4.3 小时内连续调用了 672 次工具,在 SysY 基准上拿了满分 233 分,全程没让人接手,直接跑通了一个带 54 个应用的类 macOS 桌面。对从业者来说,值得关注的是它支持 100 万 tok...

推荐理由:HKR 三项全中:小米把 MiMo-V2.5 系列权重直接放出来,Agent 和代码任务的数字够具体,4 小时无接管跑出完整桌面是个强钩子。作为国产旗舰模型开源,属于当天必须写的那类消息。

Hacker News 首页

小米开源 MiMo-V2.5-Pro,写代码的跑分紧挨着 Claude Opus 4.6

小米把 MiMo-V2.5-Pro 的模型权重放出来了。标题说它的编程能力在跑分上和 Claude Opus 4.6 差不多,文章举了个例子:北大计算机系的编译器大作业,学生通常要花几周,这个模型 4.3 小时跑完,233 个隐藏测试全过。V2.5-Pro 相比之前的 Flash 版,主要提升了长任务连贯性、能处理超过一千步的复杂任务,以及让模型进业务...

推荐理由:HKR 三项都通过,因为小米发编程/Agent 权重本身是实打实的动作,从业者会想看一眼。但信息缺口很大:没参数、没许可、没具体分数,只有标题说表现突出,所以我会先打个折,重要性停在 74 分 featured 门槛附近。

X · @op7418(歸藏)

小米把 MiMo-V2.5 系列模型全开源了,MIT 协议,随便商用和魔改

小米这次放出的 MiMo-V2.5 系列模型用了 MIT 开源协议,你可以直接拿来商用、做二次训练和微调,不用再额外申请授权。正文没披露模型参数量和跑分成绩,这点先别太激动。同时他们还搞了个 Orbit 100T Token 计划,分两块:一块是给 AI builder 的激励,申请通过最高能拿到 16 亿 Credits,价值 659 元;另一块是给...

推荐理由:这条消息对 AI builder 有实际价值:MIT 协议意味着可以放心商用和微调,Orbit 计划给的 Credits 额度不小,659 元的标价也算低。但我会先打个折——正文完全没提模型参数量、性能跑分,连基础尺寸都不知道,没法判断模型本身强不强。这点先别太激动,等评测出来再看。整体属于有料但缺关键验证,放在 featured 合适。

4月8日星期三

量子位 · 公众号

小米放出两个语音生成框架,想让普通人也能当“声音导演”

小米大模型应用团队公开了 Any2Speech 和 Midasheng-audio-generate 两个框架。Any2Speech 一次推理能生成最长约 10 分钟的语音,Midasheng 则能根据一段文字描述直接合成包含人声、音乐和环境音的混合音频。技术方案里提到了 GST 标注、双路径规划加维度丢弃、Flow Matching 以及五字段结构化...

推荐理由:小米放出两套语音框架,核心看点是可控长音频和场景统一建模,一句提示词出混合音频、单次推理能跑10分钟,这两个点确实抓人。技术细节也给了,不是纯画饼。但我会先打个折:基准跑分没给,训练数据多大不知道,开不开源、能不能商用也没说,这些信息缺口让实际价值不好判断。整体有亮点但缺关键验证,放在 featured 低段比较合适。

4月6日星期一

X · @dotey(宝玉)

小米罗福莉:Agent 时代算力跟不上 Token 烧法,出路不是降价而是省 Token

小米 MiMo 团队负责人罗福莉指出,现在 Agent 干活时反复带着超过 10 万 Token 的长上下文去调工具,请求次数是 Claude Code 自身框架的好几倍,真实 API 成本可能冲到订阅价的几十倍,全球算力根本扛不住。她认为短期阵痛反而是好事,第三方框架被 API 付费逼着去改进上下文管理、提高缓存命中率、砍掉无效消耗。同时她呼吁大模型...

推荐理由:小米 MiMo 负责人罗福莉这次发言没绕弯子,直接拿 OpenClaw 和 Claude Code 的请求次数做对比,把 Agent 多轮工具调用带来的 Token 消耗和成本膨胀讲得很清楚。10 万 Token 上下文反复携带、请求量高出数倍、API 计费后成本翻几十倍,这些数字让“算力跟不上”的判断有了抓手。正文没给具体定价方案,也没公开测试环境,所以结论先打个折,但方向对做推理优化和框架选型的人有参考价值。

2月26日星期四

纽约时报中文网

美国在 AI 上“输”给中国的不是模型,是工厂

这篇文章的核心判断是:中国把 AI 用进了工厂车间,美国还在把 AI 当实验室项目。中国已建成 3 万多家智能工厂,2024 年全球新装的工业机器人超过一半进了中国工厂。极氪宁波工厂用了 800 多台机器人,小米北京工厂每 76 秒就能产一辆车,美的荆州工厂用 AI 把产线响应时间从几小时压到几秒。这些 AI 不是写诗画画,而是做视觉质检、生产调度和预...

推荐理由:这篇不是讲模型,是讲工厂里机器人、调度和质检的落地差距。我会先打个折:正文没披露3万多家智能工厂的具体认定标准,也没说美国18%这个数字的样本来源,所以数据力度要留个心眼。但极氪800多台机器人、小米76秒节拍这些车间数字是实的,对比美国三分之二试点推不向量产,差距感很直观。对看产线落地的人,这篇比模型跑分更有参考价值。