跳到正文

小米 MiMo

小米的 AI 动态:MiMo 系列模型的发布与开源、端侧与汽车场景的 AI 落地追踪。

34 条精选相关主题千问 Qwen端侧 AI开源生态

最新精选

第 1–20 条 · 共 34 条

9月24日星期四

AI HOT 精选

本周四个新模型把智能指数和成本的最优边界往外推了 11 个点

Artificial Analysis 发推说,MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna 和 GPT-6 Sol 这四个新模型,在智能指数对单次任务成本的 Pareto 前沿上新增了 11 个点位。GPT-6 Luna 占了 5 个,Claude Opus 5.5 占了 4 个,剩下两个来自 MiMo-V2.6-...

推荐理由:Artificial Analysis 的 Pareto 前沿图本身就是选模型的硬参考,这次四个新模型一口气推了 11 个点,边界外移幅度不小。GPT-6 Luna 拿 5 个点说明它在多个成本档位都有竞争力,Claude Opus 5.5 的 4 个点也没差太远,两家的对位关系值得关注。正文没披露具体智能指数数值和单次任务成本数字,但点位分布本身已经够做初步判断了。

9月23日星期三

AI HOT 精选

小米开源 MiMo-V2.6 Pro 和 Flash 两个全模态模型,Pro 在多数 Agent 基准上追平 Claude Opus 5 和 GPT-5....

小米把 MiMo-V2.6 Pro 和 Flash 两个全模态模型开源了。Pro 在 Artificial Analysis Intelligence Index 上拿了 46 分,是目前开源模型里最高的,在多数 Agent 基准测试里表现跟 Claude Opus 5 和 GPT-5.6 Sol 差不多。训练用的是规模化强化学习,但正文没披露参数量、...

推荐理由:小米把 MiMo-V2.6 Pro 和 Flash 开源了,Pro 在 Agent 基准上表现跟 Claude Opus 5、GPT-5.6 Sol 差不多,Intelligence Index 拿了 46 分,是目前开源最高。我会先打个折:正文没写参数量、训练数据和成本,没法判断实际落地性价比。但国产旗舰模型开源本身信号够强,对开发者和开源生态都有直接价值,按政策给满权重。

9月22日星期二

Latent Space

小米 MiMo-V2.6-Pro 登顶开源模型榜,训练只花了 300 万美元

小米发了 MiMo-V2.6 系列,Pro 版在 Artificial Analysis 的智能指数上拿了 46 分,排开源模型第一。训练成本 300 万美元,按每次任务 0.13 美元算,性价比踩在了前沿线上。Flash 版主打效率,UltraSpeed 版输出速度拉到了 20 倍。技术报告讲了他们怎么在三个方向上堆强化学习的算力:一是用全异步架构把...

推荐理由:小米的 MiMo-V2.6-Pro 在 Artificial Analysis 开源模型榜上拿了第一,训练只花了 300 万美元,单次任务成本 0.13 美元,性价比踩在了前沿线上。Flash 版和 UltraSpeed 版分别补了效率和速度的位,技术报告还讲了全异步强化学习架构怎么堆算力。正文没提具体评测细节和实际业务场景验证,分数先按现有信息给。

Hacker News 首页

小米 MiMo-V2.6-Pro 在 AA 智能指数排第一,但话多费钱

Artificial Analysis 把小米这个开源模型排到了 114 个模型里的第 1 名,智能指数 46 分。它总参数 1 万亿,每次推理激活 420 亿,能处理文字、图片、语音和视频。输出速度很快,每秒 125 个 token,但评测期间总共生成了 1.4 亿个 token,属于话比较多的那一档。价格上,输入每百万 token 0.43 美元,...

推荐理由:Artificial Analysis 把小米 MiMo-v2.6-Pro 排到 114 个模型里的智能指数第一,46 分。模型总参数 1 万亿,激活 420 亿,能处理文字、图片、语音和视频,输出速度 125 tok/s,输入价格 $0.43/M。评测期间总生成 1.4 亿 token,属于输出偏长的那类,实际成本会比只看单价高一些。这是第一个在主流独立评测里拿第一的中国开源模型,对国内团队选模型有直接参考价值。正文没披露具体推理任务和评测集细节,所以这个第一的含金量我会先打个折,但整体信号很强。

AI HOT 精选

小米 MiMo-V2.6-Pro 在 Code Arena WebDev 排到第10名左右,开源模型里排第3

小米发了两个全模态模型 MiMo-V2.6-Pro 和 Flash。Pro 版在 Code Arena 的网页开发榜上拿了 1628 分,比上一代 MiMo-V2.5-Pro 的 1475 分涨了 153 分,整体排第10名上下,在 MIT 许可的开源权重模型里大概排第3。Flash 版的跑分和参数量正文都没提。

推荐理由:小米 MiMo-V2.6-Pro 在 Code Arena WebDev 榜上排第10名上下,开源权重模型里约第3,分数比上代涨了 153 分,有具体数字支撑。Flash 版参数量和跑分正文都没提,信息有缺口,所以重要性给到 78 比较合适,先别往更高拔。

AI HOT 精选

小米 MiMo-V2.6-Pro 在开放权重模型智能指数里排到第一,得分从 26 跳到 46

小米放出了 MiMo-V2.6-Pro,在 Artificial Analysis 的智能指数上拿了 46 分,比上一代 V2.5-Pro 的 26 分涨了不少,现在是开放权重模型里最高的。不过正文没提参数量、具体架构和什么时候能公开用,这些关键信息都还缺着,所以这个分数先别太激动。

推荐理由:小米的 MiMo-V2.6-Pro 在开放权重模型智能指数上登顶,分数从 26 涨到 46,进步明显,属于国产旗舰模型的正面信号。但正文没给参数量、架构和发布时间,关键信息缺着,所以分数先打个折。

AI HOT 精选

小米发了两个全模态开源模型 MiMo-V2.6 Pro 和 Flash,Pro 版在智能体评测里跟 Claude Opus 5、GPT-5.6 Sol 打...

小米这次放出的 MiMo-V2.6 Pro 和 Flash 都走全模态路线,靠大规模强化学习训出来的。Pro 版在多数智能体基准测试里能对标 Claude Opus 5 和 GPT-5.6 Sol,在 Artificial Analysis 智能指数上拿了 46 分,是目前开源模型里最高的。能力覆盖写代码、操控电脑界面、3D 推理和创作类任务。正文没披...

推荐理由:小米发了 MiMo-V2.6 Pro 和 Flash 两个全模态开源模型,Pro 版在智能体基准测试里直接对标 Claude Opus 5 和 GPT-5.6 Sol,Artificial Analysis 智能指数 46 分是开源最高。我会先打个折,正文没披露训练数据、参数量和具体推理成本,但光是这个分数和开源定位,就足够让做智能体的人关注了。

AI HOT 精选

小米 MiMo-V2.6-Pro 在开源模型智能指数上拿了第一,但关键信息还没公布

小米发了新模型 MiMo-V2.6-Pro,在 Artificial Analysis 的智能指数上拿了 46 分,是目前开源权重模型里最高的。作为对比,上一代 MiMo-V2.5-Pro 只有 26 分,这次提升幅度不小。不过正文没披露模型大小、训练数据和开源协议,这些都会直接影响实际能用在哪、怎么用,所以分数先看着,等细节出来再判断。

推荐理由:小米这个模型分数翻倍、直接登顶,确实有新闻性。但正文没披露模型大小、训练数据和开源协议,这些直接决定能不能用、怎么用,所以分数先打 78,等细节出来再调整。

9月11日星期五

Sinocism · 比尔·毕晓普

Anthropic 指控 DeepSeek、小米、月之暗面用 Claude 输出来蒸馏模型

Anthropic 在 9 月的威胁情报报告里点名了三家中国公司:DeepSeek、小米和月之暗面。报告说,这几家把自家模型跟用户的对话记录喂给 Claude,再用 Claude 生成的回答当训练数据,去“蒸馏”Claude 的能力——也就是用大模型的输出教小模型模仿回答风格。这些对话里还夹带了个人用户、大型跨国公司和政府相关方的敏感信息。Anthro...

推荐理由:Anthropic 的官方威胁情报报告点名三家中国大模型公司,指控它们用带敏感信息的用户对话去蒸馏 Claude,这本身就是一个行业级安全事件,热度、知识和传播三个维度都打满了。稍微扣一点分,是因为目前我们只看到 Sinocism 的二手转述,还没拿到 Anthropic 报告原文,细节可能有出入,但整体判断不变。

7月16日星期四

Hacker News 首页

Sentinel:一个先读代码再动手的开源 QA 智能体

SimbaStack 在 MIT 协议下开源了 Sentinel,一个会先通读代码库、自己梳理业务流程,再做端到端测试的 QA 智能体。他们拿自家酒店管理系统做实验,只给了代码仓库和管理员账号,没给任何测试计划。Sentinel 读完代码后判断这是个精品酒店系统,自动梳理出九条关键业务流,包括完整的预订生命周期、团队预订和夜审。它把最重要的两条流程各跑...

推荐理由:一个开源 QA agent 的新玩家,拿真实的酒店管理系统做了端到端实验,不是玩具 demo。分数没上 80,因为目前只有一篇博客,还没有第三方复现或横向对比。

6月16日星期二

AI HOT 精选

小米发布 MiMo Claw 正式版,用 MiMo-V2.5-Pro 模型跑云端 Agent,还接入了 WPS 办公

小米把 MiMo Claw 做成了一个不用本地部署的云端 Agent 产品,正式版搭载了 MiMo-V2.5-Pro 模型。这个模型原生适配了 OpenClaw 框架和 MCP 协议,官方说在 Agent 工作流测试里推理吞吐量提升了约 3 倍。它现在直接打通了金山办公的 WPS,可以在线生成、预览和编辑 Word、Excel、PPT、PDF 文档。在...

推荐理由:小米 MiMo Claw 正式版带着 MiMo-V2.5-Pro 上线,原生支持 OpenClaw 和 MCP,还直接接入了 WPS 办公套件。产品形态有新鲜感,3 倍吞吐量提升是个具体说法,但全是厂商自报数据,没有独立测试背书,所以分数没给到 85 以上。

AI HOT 精选

小米发布 MiMo Claw 正式版,用自家旗舰模型做云端助手,还接入了金山办公

小米把 MiMo-V2.5-Pro 旗舰模型塞进了一个云端轻量 Claw 产品里,叫 MiMo Claw。它原生支持 MCP 工具调用协议,一次对话能连续调用上千次工具,上下文窗口有一百万 token。靠着 MTP 三层解码架构,跑 OpenClaw 标准 agent 工作流时吞吐量大概提升到原来的 3 倍。在 ClawEval 测试里任务达标率(Pa...

推荐理由:我会先打个折:正文没披露定价和真实延迟数据,ClawEval 的达标率也只贴了一半,所以实际性价比和稳定性还不好判断。但小米这次把旗舰模型、金山办公和 MCP 工具调用打包成一个云端轻量产品,信息密度够高,值得从业者关注。

6月15日星期一

Product Hunt · AI

小米开源 MiMo Code:用独立子代理做长任务记忆,不等上下文爆满就先写检查点

小米在 GitHub 上开源了 MiMo Code,一个基于 OpenCode 的终端编程代理。它专门解决长任务里上下文窗口不够用的问题:不是让主代理自己记东西,而是另起一个“写手”子代理,在上下文还远没塞满的时候就定期写结构化检查点。等窗口快满了,系统用这些检查点和项目记忆重建工作上下文,而不是靠越来越不靠谱的摘要。后台进程还会从历史会话里提取可复用...

推荐理由:小米在 GitHub 开源了 MiMo Code,用“写手”子代理加结构化检查点来解决长任务上下文耗尽的问题,机制讲得清楚,对日常被上下文限制搞烦了的开发者有吸引力。分数没给更高,因为目前只有 Product Hunt 页面,正文没披露跑分或社区反馈,实际效果还得等上手验证。

6月14日星期日

r/LocalLLaMA

小米上线 MiMo V2.5,用 DFlash 和 Persistent Kernel 把推理速度拉到每秒 1000–3000 token

小米的 MiMo V2.5 模型已经对外服务,官方宣称推理速度达到每秒 1000 到 3000 个 token,靠的是 DFlash(一种加速注意力计算的机制)和 Persistent Kernel(让 GPU 核心持续干活不空转)。DFlash 的模型权重已经放出来了,开源代码也说很快会发。不过 Reddit 原帖正文被安全策略拦了,只剩标题,所以实...

推荐理由:MiMo V2.5 宣称的 1000-3000 tps 和两个具名加速机制(DFlash、Persistent Kernel)信息量够硬,权重已出、代码承诺开源,对本地部署的人直接有用。分数没给更高是因为 Reddit 正文被拦了,只剩标题,很多细节没法核实,这点先别太激动。

6月11日星期四

AI HOT 精选

小米开源 MiMo Code V0.1,一个终端里的 AI 编程助手,模型暂时免费

小米在 MIT 协议下开源了 MiMo Code V0.1,一个跑在终端里的 AI 编程助手,自带一个目前免费的多模态模型 MiMo V2.5。这个模型支持一次性处理 100 万 token 的上下文,并声称通过自动积累知识和无损压缩实现了“无限上下文”。工作流上,它有一个 Compose 模式,能把需求从规格说明、计划、构建到报告串起来执行;Agen...

推荐理由:小米把 MiMo Code V0.1 用 MIT 协议开源,自带一个目前免费的 MiMo V2.5 多模态模型,支持 100 万 token 上下文,还宣称通过自动积累知识和无损压缩实现了“无限上下文”——这点先别太激动,正文没给出具体技术验证和长程测试数据。工作流上有个 Compose 模式,能把需求从规格说明、计划、构建到报告串起来跑,相当于让模型进了一条自动化的开发流水线。这是国内大厂第一次直接对标 Claude Code 和 Cursor 的开源动作,对开发者社区有吸引力,但实际效果和模型后续收费策略都还没说清楚。

AI HOT 精选

小米开源终端编程助手 MiMo Code,MIT 协议,内置模型限时免费

小米把终端 AI 编程助手 MiMo Code 开源了,MIT 协议,随便用。内置的 MiMo-V2.5 多模态模型目前免费,性能自称对标 Claude Sonnet 4.6,但正文没写免费到什么时候,也没提参数量。它也支持接 DeepSeek、Kimi、GLM 这些外部模型。两个值得看的设计:一个是持久记忆系统,靠独立子 agent 自动存项目记忆、...

推荐理由:小米这次开源 MiMo Code,MIT 协议加免费模型,对开发者吸引力不小。我会先打个折:模型性能对标 Sonnet 4.6 的说法正文没给评测细节,参数量也没披露,免费能用到什么时候也不清楚,这些缺口让判断得收着点。真正值得看的是那个持久记忆子 agent,自动存项目记忆而不是简单翻聊天记录,工程思路比多数终端助手走得远。另外它支持接 DeepSeek、Kimi 这些外部模型,灵活性也加分。整体来说,开源动作本身比模型宣称更有信息量。

6月9日星期二

AI HOT 精选

小米 MiMo 1T 模型跑出每秒超 1000 token,靠混合量化和并行解码把速度提了 10 倍

小米 MiMo 和 TileRT 给 1T 参数旗舰模型加了个 UltraSpeed 模式,输出速度首次超过 1000 tokens/s。模型这边用了 FP4 混合量化,只量化 MoE 的 Expert 部分,搭配 DFlash 的块级 masked 并行推测解码,coding 场景下平均一次能接受 6.30 个 token,相当于猜对的命中率不低。系...

推荐理由:我会先打个折:正文没提硬件配置、batch size、并发数,也没说测试用的 prompt 长度和具体环境,所以这个 1000 tokens/s 的绝对值先别太激动。但亮点是技术组合说得清楚——FP4 只量化 MoE 的 Expert 部分,不是全模型瞎压,搭配 DFlash 的块级 masked 并行推测解码,coding 场景下一次能猜对 6.30 个 token,命中率不低,说明这套方案在代码生成这种结构化输出上确实有效。小米给旗舰模型开 UltraSpeed 模式,还定了三倍 Pro 版的价格,摆明了是要在推理速度和 API 商业化上抢个身...

6月8日星期一

r/LocalLLaMA

小米声称在标准8卡服务器上把1万亿参数模型跑到了每秒1000多个token

小米的MiMo团队发布了MiMo-V2.5-Pro UltraSpeed,说他们在单台8卡的标准服务器上,把一个1万亿参数的混合专家模型(MoE)跑出了每秒超过1000个token的输出速度。这个速度如果属实,确实挺夸张,因为它没用Cerebras那种整块晶圆做的定制芯片,也没用Groq那种靠大量片上内存堆出来的硬件,就是普通GPU服务器。不过帖子正文...

推荐理由:小米说他们在标准8卡服务器上把一个1万亿参数的MoE模型跑出了每秒1000+ token的输出速度,没用Cerebras那种整晶圆芯片,也没用Groq那种靠大量片上内存堆硬件的方案。这个速度如果是真的,确实挺省钱,但正文没披露GPU型号、批次大小、量化精度这些决定性能的关键参数,也没给可复现的测试环境,所以我会先打个折,等更多细节出来再判断。

Hacker News 首页

小米发布 MiMo-V2.5-Pro-UltraSpeed,万亿参数模型跑到每秒 1000 个 token

小米和 TileRT 合作,把一个 1 万亿参数的大模型在 8 张普通 GPU 上跑到了每秒生成 1000 多个 token。他们用了两招:一是只对 MoE 专家模块做 FP4 量化,把模型体积和显存带宽压力打下来,同时保住推理质量;二是用了一种叫 DFlash 的投机解码方法,一次能猜对更长的 token 串,减少反复验证的等待时间。目前这个速度只在...

推荐理由:小米把一个1万亿参数的MoE模型塞进8张普通GPU,靠FP4量化只压缩专家模块,再配上能一次猜对更长token串的DFlash投机解码,把生成速度拉到每秒1000多个token。这个速度如果是真的挺省钱,但正文没交代测试用的什么卡、上下文多长、精度损失多少,我会先打个折。

AI HOT 精选

小米 MiMo 在单台 8 卡服务器上把万亿参数模型跑到每秒 1000+ token

小米和 TileRT_AI 放出了一个叫 MiMo-V2.5-Pro-UltraSpeed 的版本,用一台普通的 8 卡 GPU 节点就跑起了 1 万亿参数的 MoE 模型,输出速度超过每秒 1000 个 token。这个速度不是靠 Cerebras 或 Groq 那种专用硬件堆出来的,对常规部署来说挺省钱。他们开了限时免费聊天可以上手试,API 价格...

推荐理由:小米这个版本最吸引人的点是用普通 8 卡 GPU 节点把 1T MoE 模型跑到每秒上千 token,没靠 Cerebras 那种专用硬件,部署成本听起来低了不少。我会先打个折:正文没披露具体任务类型、精度损失、首 token 延迟和实际 API 定价,所以这个速度是在什么条件下测的还不清楚。限时免费聊天可以上手试,但长期性价比得等更多数据。这点先别太激动,不过如果属实,对常规推理部署确实挺省钱。