跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 321–340 条 · 共 585 条

6月3日星期三

AI HOT 精选

DeepSeek 被曝启动首轮融资,想拿 500 亿,腾讯、宁德时代都掏钱了

路透社援引知情人士消息,DeepSeek 正在谈第一轮外部融资,目标金额约 500 亿元人民币。钱到手后,公司估值大概在 3500 亿到 4000 亿之间。创始人梁文峰自己会跟投 200 亿,腾讯计划出 100 亿,宁德时代出 50 亿,这两家是最大的外部金主。另外,国家人工智能产业投资基金、网易、京东也在谈,最终投资方可能不到十家。宁德时代投这笔钱,...

推荐理由:消息本身是传闻,正文没披露融资用途和交割时间,所以先打个折给 88。500 亿首轮、3500 到 4000 亿投后估值,加上梁文峰、腾讯、宁德时代分别出 200 亿、100 亿、50 亿,这些数字说明资本在往头部模型集中,算力军备竞赛还在加码。但没确认之前,别太激动。

r/LocalLLaMA

微软在 Build 2026 发了两个端侧模型 Aion 1.0:一个管推理和调工具,一个管总结改写

微软在 Build 2026 大会上发了两个能在设备本地跑的模型,都叫 Aion 1.0。一个是 Aion 1.0 Plan,140 亿参数,专门做推理和调用工具,上下文窗口 3.2 万 token,会直接预装在配置够的 Windows 设备里。另一个是 Aion 1.0 Instruct,定位是总结、改写、理解意图、无障碍功能,会集成进 Edge 浏...

推荐理由:微软在 Build 2026 发了 Aion 1.0 Instruct 和 Plan 两个端侧模型,其中 Plan 是 14B 参数、32K 上下文的规划模型,会直接跟着 Windows 推给符合条件的设备。我会先打个折:文章没提许可证、跑分、具体硬件门槛,所以实际落地效果还得观望。但 Windows 内置这件事本身,分发优势和生态卡位就很明显,对做端侧 AI 和 agent 的人来说值得盯一下。

Computing Life · Share · 鸭哥调研

MAI-Thinking-1:让模型持续思考几千步不崩,比让它开始思考难得多

微软 MAI-Thinking-1 的技术报告没在吹模型多会解题,而是在讲怎么让强化学习训练别崩。他们给 GRPO 算法打了三个补丁:一个像恒温器一样动态调节模型的“自信度”,防止它变得死板或乱猜;一个像断路器,在梯度爆炸时直接截断,保住整批训练数据;还有一套自蒸馏抢救流程,训练万一崩了,能把之前学会的推理能力搬到新模型上继续跑。这三个机制合起来,让模...

推荐理由:标题把卖点从“会思考”转到“持续思考”,一下就把训练崩溃这个真问题拎出来了。三种机制的名字虽然有点包装感,但至少给了具体抓手:恒温器控波动、断路器防崩、自蒸馏保风格。正文没披露具体实验数据和复现条件,所以“几千步不崩”这个数字先打个折看。整体对做推理模型训练的人有参考价值,但离落地验证还差一口气。

AI HOT 精选

微软放出 MAI-Thinking-1,35B 活跃参数的 MoE 模型,没靠蒸馏自己从头训

微软发了 MAI-Thinking-1,一个混合专家(MoE)模型,总参数 1 万亿但每次只激活 350 亿,跑起来相对省算力。它用 30T token 从零预训练,没拿第三方模型做蒸馏,这点比较硬气。微软管自己的迭代优化流程叫“爬山机器”,听着像在反复试错往上拱。成绩单上,AIME 2025 拿了 97.0%,LiveCodeBench v6 拿了 ...

推荐理由:微软发了 MAI-Thinking-1,一个 MoE 架构的推理模型,活跃参数 35B,总参数 1T,用 30T tokens 从零开始预训练。我会先打个折:正文没给任何跑分、开放方式或定价,所以没法判断实际水平。光看参数规模,35B 活跃部分在推理时成本不会太高,但 1T 总参数意味着训练和存储都不便宜。这点先别太激动,等有 benchmark 和访问方式再说。

Hacker News 首页

微软发布 MAI-Thinking-1,一个主打复杂推理的中等成本模型

微软一口气发了七款 MAI 系列模型,这篇公告只重点介绍了 MAI-Thinking-1。官方说它擅长解决复杂问题,在 SWE-Bench Pro(一个测代码修改能力的榜单)上拿了高分,价格定在“中等权重”档位。但正文没披露参数量、具体跑分、定价细节和上线时间,所以实际性价比和落地表现还得等更多信息。

推荐理由:HKR 三条都踩中了:微软给模型起名 Thinking,又放出 7 个 MAI 模型,正好打在它和 OpenAI 若即若离的关系上,话题性够。但正文只说了发布,没参数、没评测、没时间表,信息密度很低,所以分数卡在 76 这个 featured 门槛上,没往上拉。

AI HOT 精选

微软发布自研推理模型 MAI-Thinking-1,中等规模,没从第三方模型蒸馏

微软在 Build 2026 上掏出了自己的第一款高级推理模型 MAI-Thinking-1。官方说这是个中等尺寸的模型,在一些软件工程基准上能跟一线模型打平。训练数据完全自建,没走知识蒸馏的捷径——也就是没拿别家大模型当老师来教它。这是微软在模型自研上的一次表态,之前它主要靠 OpenAI,最近两家刚重新谈了合作,关系没那么紧了。

推荐理由:微软在 Build 2026 发了 MAI-Thinking-1,说是中等规模推理模型,在软件工程基准上能打平领先模型。我会先打个折——正文没披露具体分数、访问方式和定价,所以没法判断它到底多强、多便宜。这点先别太激动。但这是微软第一个自研高级推理模型,信号很明显:它在试着减少对 OpenAI 的依赖,同时往开发者工具链里塞自己的货。

AI HOT 精选

Google DeepMind 放出 Co-Scientist:让多个 Gemini 智能体组队,自己辩论、自己迭代科学假设

Google DeepMind 发了个叫 Co-Scientist 的系统,核心是用多个 Gemini 智能体搭成一个科研小组:有的负责生成假设,有的负责挑刺辩论,再让假设在内部迭代进化。官方说法是能帮科学家在复杂问题上找新思路。不过正文没披露具体用的是哪一版 Gemini、有没有跑过基准测试、开放方式是什么、什么时候能用上,这些关键信息目前都还是空白。

推荐理由:我会先打个折:正文没披露模型版本、评测结果和开放时间,所以目前只能当一次研究发布来看,别太激动。但 Gemini 被架成多智能体科研系统这个动作本身,说明 DeepMind 在认真推“AI 做科学假设”这件事,不是单次推理,而是让多个 agent 互辩、演进想法,思路比单纯刷榜有意思。对从业者来说,这更像一个方向信号,离能用的产品还有距离。

6月2日星期二

r/LocalLLaMA

我把多智能体调度器里的 Claude 换成本地 Qwen3.6-27B,跑了两个星期

作者用一张 RTX 3090 跑 Qwen3.6-27B,在 47 个多步骤编程工作流里顶替 Claude 试了两周。计划生成的结构合规率大约 95%,但工具调用格式错误率有 12% 左右,而且上下文一超过约 12k token,实际表现就开始明显下滑。正文没披露具体任务难度和对比基准,所以 95% 这个数只能当个参考,别直接当成“接近 Claude”...

推荐理由:这篇值得看,因为它是真人两周实测,不是跑分。作者用一张消费级显卡把 Qwen3.6-27B 塞进多智能体编排里,替换 Claude,给出了能用的上限和会翻车的点。95% schema 合规听着不错,但 12% 工具调用格式错误意味着每八九次就有一次格式炸了,生产环境还得加校验层。长上下文到 12k tokens 就吃力,复杂任务得拆。正文没披露延迟数据和总 token 消耗,这点先别急着算成本账。整体是份诚实的工程笔记,不是公关稿。

机器之心 · 公众号

图灵奖得主 Sutton 新论文:AI 的下一步,得学会在行动中理解世界

这篇文章的正文被微信环境验证挡住了,实际内容没抓到。从标题和摘要看,Banafsheh Rafiee 和 Richard S. Sutton 提了一个叫“生成认知”的框架,给 AI 立了四根柱子:经验、感知与行动不可分、自主性、具身性。说白了就是主张智能不能光靠看数据,得在跟环境互动的过程中长出来。但具体怎么实现、有没有实验,正文没披露,这点先别太激动。

推荐理由:这篇是 Sutton 和 Rafiee 的新论文解读,核心是提出“生成认知”框架,主张智能体得靠经验、感知和行动绑在一起、自己定目标、还得有身体去试错。我会先打个折:正文没披露实验、代码或可复现的测试,目前还停在概念层。但 Sutton 的名气和四个支柱的提法,让它有资格进 featured,属于研究评论向的必读。

AI HOT 精选

阶跃星辰发了 Step 3.7 Flash,一个 196B 参数的 MoE 模型,主打推理省钱

这个模型用了多矩阵分解注意力,把 KV-cache 的占用压到 DeepSeek 同类模型的 22% 左右,显存压力小很多。另外还把注意力和前馈网络解耦,方便在硬件上跑得更顺。模型走 Apache 2.0 协议,已经在 Fireworks AI 上可用,官方说能用来搭智能体应用。不过正文没给出具体跑分和延迟数据,实际效果还得看第三方实测。

推荐理由:HKR 三项都站得住:Step 3.7 Flash 有 196B MoE 和约 22% KV-cache 成本的具体数字,不是纯宣传稿。不过它还没到一线旗舰模型的体量,所以给 78 分放在 featured 里。

6月1日星期一

AI HOT 精选

NVIDIA 开源 Cosmos 3:一个模型搞定物理世界的看、想、动

NVIDIA 在 GTC Taipei 把 Cosmos 3 完全开源了,模型权重、代码和数据集都放了出来。它被叫做首个物理 AI 全能模型,意思是能直接看懂真实世界、预测接下来会发生什么,并给出机器人该做的动作。这次发了两个尺寸:Super 版 320 亿参数,Nano 版 80 亿参数。正文没提具体跑分和硬件门槛,实际部署成本还得自己测。

推荐理由:HKR 三项都成立:钩子是 NVIDIA 开源物理 AI 模型,知识增量是 32B/8B 双版本加全套开放物料,受众是机器人、仿真方向的从业者。正文信息很薄,没给基准测试、没提许可证细节,所以分数压在 78–84 区间,不往上拔。

r/LocalLLaMA

网友在双 DGX Spark 上跑 DeepSeek V4 Flash:预填充 1680 token/s,解码 39.8 token/s

一位 Reddit 用户用两台华硕 GX10(DGX Spark)组了个小集群,通过 vLLM 加载 DeepSeek-V4-Flash 模型。在 256K 上下文窗口、开启多 token 预测(MTP=2)的设置下,测得预填充速度 1680 token/s,解码速度 39.8 token/s。部署用了张量并行(TP=2),两台机器通过 RoCE 网络...

推荐理由:这不是行业大新闻,但胜在是第一手实测,配置细节都给了:TP=2、RoCE 网络、fp8 KV 缓存、256K 上下文,还估出了约 1M tokens 的安全 KV 上限。对想对比自己机器性能的人来说,这些数字比官方宣传实在。HKR 三项都踩中,放在低 featured 位置刚好。

AI HOT 精选

英伟达开源 Cosmos 3:一个能看懂物理世界、还能生成动作的 32B 模型

英伟达把 Cosmos 3 称为第一个完全开放的物理 AI 全能模型,意思是它不只能识别图像,还内置了视觉推理、生成 3D 世界状态和直接输出动作的能力。这次放出两个尺寸:Super 版 320 亿参数,Nano 版 80 亿参数。正文没提训练数据规模、具体跑分和推理成本,所以实际能用多好、跑起来贵不贵还得等实测。

推荐理由:我会先打个折:正文是单篇发布稿,没给基准测试、没提许可证细节,也没说训练数据规模和实际部署条件,所以分数卡在 78–84 区间。亮点在于 NVIDIA 第一次把视觉推理、世界生成和动作生成打包成一个开放物理 AI 模型,并给出两个具体尺寸,这对机器人圈子的信号意义不小。但缺少验证信息,这点先别太激动。

r/LocalLLaMA

我在一张 RTX 3060 上给冻结的 1.4B Mamba 主干挂了 8 个推理专家臂,这是拆解报告

作者用一张 12GB 显存的 RTX 3060 训练了一个叫 Mamba-Titan-1.4B-Reasoning 的模型。做法是把一个 1.4B 参数的 Mamba-1 主干完全冻结,只在第 24、25 层外挂了 8 个可训练的专家臂,组成一个总参数量 2.54B 的混合专家模型,每次推理只激活其中 2 个专家。数学题准确率大概做到 50%。正文没披...

推荐理由:这是一篇 Reddit 个人实验帖,不是论文,也没有独立复现,所以我会先打个折。但它的价值在于把一次失败解剖写得清楚:在单张 RTX 3060 上,冻结 Mamba 主干、外挂 8 路 MoE 做推理,最后数学准确率卡在 50% 左右。正文没披露训练时长和具体数据集,这点信息有缺口。对想用消费级显卡折腾推理模型的从业者来说,这篇能省掉一次踩坑,属于低门槛、有参考意义的 featured 内容。

5月31日星期日

r/LocalLLaMA

用 44 小时 RTX 5090 给 Gemma 4 E2B 做了 13 个“去限制”变体,有害指令成功率从 32% 飙到 82% 以上

这篇帖子来自 Reddit 的 r/LocalLLaMA,作者 Abliterlitics 用 44 小时的 RTX 5090 算力,对 Gemma 4 E2B 模型做了 13 种不同强度的“去限制”(abliteration)处理。简单说,就是通过修改模型内部参数,削弱它对敏感问题的拒绝回答倾向。结果很直接:原版模型在 HarmBench 有害指令测...

推荐理由:我会先打个折:这只是一次个人发起的去审查实验,不是官方发布,结论别直接当生产依据。但文章把 13 个变体的基准分、GPU 开销和有害指令通过率都列清楚了,读起来像朋友在群里甩了一份跑分记录。对想了解 Gemma 4 安全边界、或者自己动手做 abliration 的人,这份数据比泛泛的讨论有用得多。

量子位 · 公众号

复旦系团队发布机器人世界动作模型 STI-WM,把时空信息揉在一起做长任务

沐神智能搞了个叫 STI-WM 的模型,专门给机器人用的。它把 RGB 画面、深度点云和机器人自身状态(比如关节角度)同时喂进去,首创了时空一体的架构,不再是先看空间再看时间的两段式处理。官方说它能支撑上百秒的长任务推演,中间出错了还能闭环重新规划。不过正文没给出具体的基准测试分数,也没提部署成本,所以实际效果和性价比还得等更多数据。

推荐理由:我会先打个折:正文没披露权重是否开源、有没有标准 benchmark 对比、百秒推演在什么场景下验证的,这些关键信息都缺。但 STI-WM 把 RGB、深度点云和本体输入揉进一个时空一体架构,直接做百秒级推演,这个思路对做机器人世界模型的人有参考价值。眸深智能又是复旦系团队,英伟达也出现在标签里,产业和学术两边都有点关联。综合来看,信息够新、够具体,但验证强度不明,所以放在 featured 门槛附近,不往上拔。

5月30日星期六

新智元 · 公众号

Opus 4.8 算了一夜,把 1170 亿人的投胎概率做成了模拟器

这篇文章的正文被微信环境异常页挡住了,实际内容没抓到。从标题和已有英文摘要看,沃顿商学院教授 Ethan Mollick 用 Claude Opus 4.8 生成了一个叫“历史之幕”的网站,把人类历史上约 1170 亿次出生做成加权随机模拟,跑了 4000 轮蒙特卡洛来估算你投胎到不同地区和时代的概率。但具体怎么算的、模型代码怎么写的、有没有幻觉或偏差...

推荐理由:HKR 三项都成立:Mollick 的投胎模拟器是个有梗的钩子,不是常规的“模型又变强了”;1170亿人口和4000轮模拟给了可验证的数字;对开发者来说,这种一夜搭出复杂原型的效率比跑分更有说服力。这不是 Anthropic 官方发布,所以留在 featured 低位没问题。

量子位 · 公众号

帮 Gemini 拿下 IMO 金牌的建模负责人,差点去当了职业钢琴家

这篇文章讲的是 Yi Tay,他在 Gemini Deep Think 拿到 IMO 金牌级成绩时担任建模联合负责人。他 2023 年参与创立了 Reka AI,639 天后又回到了 Google DeepMind。文章还提到他 2012 年就考过了 Trinity 古典钢琴副学士文凭,差点走上职业演奏的路。不过正文因为微信环境验证拦截,具体技术细节和...

推荐理由:这是一篇人物特写,不是 Gemini 能力发布稿。核心价值在于 Yi Tay 在 IMO 金牌成果里的具体角色、他创办 Reka 又回归的经历,以及 639 天这个精确时间跨度。文章没展开技术细节,所以重要性停在人物和行业信号层面,76 分放在 featured 档是合适的。

5月29日星期五

新智元 · 公众号

Claude Opus 4.8 实测:高级工程师基准冲到 63 分,但高强度任务掉到 42 分,Max 用户几小时就撞速率墙

这篇来自新智元的实测文章目前页面被微信环境验证挡住了,正文内容没抓到。从标题和摘要信息看,Claude Opus 4.8 在 Extra-High 级别的高级工程师基准测试里拿了 63 分,比上一代 Opus 4.7 高出 30 分,这个涨幅挺夸张。但切换到 High 强度任务时分数掉到 42 分,说明模型在持续高压场景下稳定性还有问题。另外,每月 2...

推荐理由:Anthropic/Claude 相关度天然高,加上有实测跑分和配额吐槽,HKR 三项都站得住。钩子是强但贵且 High 档拉胯,K 有基准分和额度细节,R 直接戳中 Agent 场景下的成本焦虑。来源是媒体评测而非官方公告,所以定在 P1 低位。

机器之心 · 公众号

TogetherAI 搞了个真 2-bit 的 KV 缓存压缩方案 OSCAR,长上下文推理能跑更快

TogetherAI 和合作方发布了 OSCAR,一个把 KV 缓存压到平均每个值只占 2.28 比特的压缩系统,已经接进了 SGLang 推理框架。在 10 万 token 的长上下文场景里,解码速度最高能到原来的 3 倍;在固定显存预算下,整个任务吞吐量最高能到 7 倍。正文没披露具体模型和测试硬件,也没说精度损失有多大,这点先别太激动。

推荐理由:我会先打个折:这是推理优化层的专项工作,不是模型发布,受众偏工程。但 100k 上下文 decode 约 3 倍加速、吞吐约 7 倍这两个数够硬,对跑长上下文推理的团队有直接参考价值。正文没披露精度损失的具体对比,这点先别太激动。整体值得放进 featured,让做推理部署的人看到。