跳到正文

#推理

今日 0 条

6月10日星期三

r/LocalLLaMA

用约3美元API调用微调Qwen2.5-7B,在特定任务上达到Claude Haiku 96%的表现

一位Reddit用户用1040组偏好样本(DV-DPO,一种让模型学会回答风格的方法)微调了Qwen2.5-7B,成本按Claude Haiku的API价格算大约3美元,没花钱请人标注。在特定领域任务上,这个微调模型的综合得分达到了Claude Haiku的96%。部署在4-bit量化的T4机器上,生成一次回答的延迟是11秒。不过正文没披露具体是什么任...

推荐理由:这条信息本身是个Reddit帖子,任务范围和评测细节正文没展开,所以分数先打个折停在74。但3美元、零标注、96% Haiku这几个数字组合在一起,对想省钱又不想雇人标数据的团队来说,是个值得看一眼的信号。

6月8日星期一

AI HOT 精选

五个模型经济体里,价格崩盘消失了:控制与涌现

这篇博客因为 Hugging Face 返回了 429 错误(请求太频繁),正文内容没抓到。从标题和摘要看,实验用 OpenAI、NVIDIA、OpenBMB 的模型和一个自己微调的 5 亿参数模型来驱动市场里的交易代理。他们试了三种干预手段都没能重现价格崩盘,最后是靠结算时强行改写价格才把崩盘做出来。我会先打个折:具体怎么干预、崩盘长什么样、数据量多...

推荐理由:我会先打个折:正文因为 Hugging Face 限流没抓到,具体干预怎么设计、崩盘长什么样、数据量多大都只能靠标题和摘要猜。但就现有信息看,五个模型经济体里崩盘凭空消失、只能靠结算作弊做出来,这个发现对代理可靠性和模拟真实性都是实打实的质疑。信息缺口明显,但角度够刁,值得推给从业者看一眼。

机器之心 · 公众号

openJiuwen 搞了个叫 MANGO 的多智能体流网络,让一群模型自己学会怎么组队干活

openJiuwen 提出了 MANGO,一个多智能体流网络框架。它把强化学习、文本梯度(用自然语言反馈来调模型)和 Skip-k 机制(跳过不靠谱的中间步骤)揉在一起,让一群模型自己学会怎么组队、怎么分工。用 GPT-4o-mini 跑分,在 MATH500 数学题上比 MaAS 准确率高了 12.8 个百分点,在 DROP 阅读理解上比 AFlow...

推荐理由:我会先打个折:这还是个研究框架,不是大模型或平台级发布,所以别当重磅炸弹看。但 HKR 里 K 最扎实,机制和数字都给出来了,MATH500 上 +12.8% 的差距不算小。H 和 R 靠“流网络”这个角度撑住,对搞多智能体协作的人有参考价值。正文没提开源代码链接,这点先别太激动。

机器之心 · 公众号

阿里 RTPurboV2:用几百步训练把注意力计算砍掉九成,原生 Transformer 又硬气了一回

阿里 RTP 团队发了 RTPurboV2,思路很直接:把模型里 85% 的注意力头换成滑动窗口注意力(SWA),剩下 15% 负责长距离检索的头用低秩投影、聚类和动态 top-p 压缩。适配训练只要大概 600 步、约 100 万条标注 token,Prefill 阶段推理加速最高到 9.36 倍。不过正文因为环境验证失败没抓到具体实验细节和模型规模...

推荐理由:阿里 RTP 团队这篇 RTPurboV2 思路很直白:把模型里大部分注意力头换成便宜的滑动窗口,只留一小撮头用低秩投影和聚类做长距离检索,训练成本压到 600 步、100 万条 token,Prefill 加速最高能到 9.36 倍。这个数字我会先打个折,因为正文自己说环境验证失败没抓到实验细节和模型规模,所以加速比在什么尺寸、什么长度下测的还不清楚。但思路本身对做长上下文部署的人有参考价值,属于工程信号强但缺完整验证的那种。

6月7日星期日

AI HOT 精选

Harness-1:一个用强化学习练出来的200亿参数检索子智能体,能记住搜索状态

UIUC 和 Chroma 发布了一个叫 Harness-1 的检索子智能体,参数量 200 亿,基于 gpt-oss-20b 训练。它被放在一个“有状态搜索框架”里用强化学习训练,简单说就是模型在搜索时能记住上一步干了什么,再决定下一步怎么查,而不是每次都从头瞎找。在 8 个基准测试上,它的平均整理召回率是 0.730,比目前最好的开源子智能体高出 ...

推荐理由:HKR三项都站得住:Harness-1把强化学习和有状态搜索结合,机制讲得明白,基准测试结果也给了具体数字。分数定在78-84区间,因为它是个子智能体的研究发布,不是大厂主力模型,但开源圈确实需要这种能打的检索方案。

机器之心 · 公众号

ICML 2026 中稿的 FusionRoute:让多个模型在生成每个词时自己选最合适的专家,还能自我纠错

这篇 ICML 2026 的论文提出了一种叫 FusionRoute 的多模型协作方法。它不直接合并模型,而是冻结住几个专家模型不动,只训练一个轻量的路由器。这个路由器会在生成文本的每一个 token(词或子词)时,实时挑选一个最合适的专家模型来输出,同时把路由器的判断分数和专家模型的输出分数揉在一起,让最终选择更准。论文在 GSM8K、MATH-50...

推荐理由:这篇 ICML 2026 的 FusionRoute 论文,核心是让几个冻住的专家模型在生成每个 token 时都能被一个轻量路由器实时挑选,还加了自我修正来纠错。思路确实有意思,但文章没给出具体的性能提升数字、代码链接和实际部署成本,所以我会先打个折,放在 featured 里偏低的档位。

机器之心 · 公众号

AI 真能学会心算?隐式思维链首次得到理论证明,Stuart Russell 参与

UC Berkeley 和普林斯顿的研究者给“隐式思维链”找了理论依据。他们提出 Log-ICoT 方法,用 k 奇偶校验任务做实验:当 k=16 时,训练阶段从传统方法的 15 步砍到 4 步。论文证明,在简化假设下,一个 L 层的 Transformer 可以通过 log₂k 个课程阶段把推理步骤内化到模型里,不用再像显式思维链那样一步步往外蹦字。...

推荐理由:这篇论文给“隐式思维链”找了理论依据,不是光靠实验撞大运。我会先打个折:目前只在k奇偶校验这种玩具任务上验证,正文没披露真实NLP任务上的表现,所以实际能省多少算力还不好说。但亮点在于,他们用log₂k个课程阶段就让Transformer把推理步骤内化进模型,k=16时训练步数从15砍到4,这个压缩比挺直观。Stuart Russell参与也增加了可信度。对做推理优化的人,这是个值得跟的理论方向,只是别急着往生产里搬。

量子位 · 公众号

快手可灵提出 VLM-as-Teacher:生成视频时让视觉模型当老师,在线微调 LoRA 来遵守文字规则

这篇文章的正文被微信环境异常页挡住了,看不到具体技术细节。从标题和现有摘要看,快手可灵和城大合作了一个叫 VLM-as-Teacher 的方法。思路是在测试阶段用视觉语言模型(VLM)给视频生成模型(VGM)的 LoRA 模块打分反馈,边生成边优化,让模型学会按文字规则推理。他们搞了个 VBVR-Bench 基准,分数从 0.666 提到了 0.781...

推荐理由:正文被微信环境异常页挡住了,看不到技术细节,这点先打个折。但从标题和摘要看,快手可灵和城大搞的 VLM-as-Teacher,思路是在测试阶段让视觉语言模型给视频生成模型的 LoRA 打分,边跑边调,让模型学会按文字规则推理。VBVR-Bench 上分数从 0.666 提到 0.781,说明规则遵循能力有明显提升。方法本身有巧思,不是换模型架构,而是在推理时加一层在线优化,对可控视频生成是个实用方向。信息缺口在于没看到具体实现和消融实验,等正文能看了再补判断。

6月6日星期六

机器之心 · 公众号

普林斯顿用 DeepSeek V4 做数学证明,成本只要别人的五百分之一

普林斯顿的研究员搞了一套叫 Goedel-Architect 的智能体系统,专门让模型在 Lean 这种形式化证明语言里自动做数学题。他们拿 DeepSeek-V4-Flash 跑 PutnamBench 数学竞赛题,672 道题里正确率到了 75.6%,API 调用费总共才花了 294 美元。对比之前 Hilbert 系统用别的模型达到 70.0% ...

推荐理由:普林斯顿团队搞了个叫Goedel-Architect的智能体系统,让DeepSeek-V4-Flash在形式化证明语言Lean里自动做数学题。PutnamBench 672道题正确率75.6%,API调用费总共294美元,对比之前Hilbert系统用别的模型达到70.0%却花了约17万美元,成本差了近500倍。这个对比很直观,数字也扎实,但正文没详细拆解294美元是怎么算出来的,也没说Hilbert那17万是不是包含了大量试错和人工调参。所以“500倍”这个说法可以先打个折看,不过即使有水分,成本优势依然明显。整体还是偏学术研究,离工程落地有距离,...

AI HOT 精选

谷歌给企业级 Gemini 搭了个“多代理协作”的外挂资料库框架,查事实类问题准确率最高提升 34%

谷歌研究院和谷歌云一起搞了个叫“跨语料库检索”的框架,用在 Gemini 企业智能体平台上,本质是让多个 AI 代理分工合作:一个负责理解问题并拆解计划,一个负责改写查询词,一个负责把问题路由到最合适的数据库,还有一个反复去搜、去验证。这套流程比传统 RAG(给模型外挂资料库直接查)在事实类数据集上准确率最多高出 34%。文章没细说测试用的具体数据集规...

推荐理由:谷歌把 RAG 拆成多个代理分工干活,在事实类数据集上准确率最多高出 34%,这个数字挺抓人。不过文章没披露测试用的具体数据集规模和难度,所以这个 34% 的含金量得打个折看。另外,框架绑在 Gemini 企业平台上,有给自家云服务带货的味道,所以分数没给到纯研究框架那档。

6月5日星期五

机器之心 · 公众号

CMU 新论文让大模型在上下文窗口满了之后“睡觉”,用离线循环前向传播更新记忆权重,再清掉缓存

CMU 和马里兰大学的研究者给大模型加了一个“睡眠”机制。具体做法是:当模型处理长文本、上下文窗口(L-token)塞满时,不直接丢掉旧的 KV 缓存,而是先跑 N 轮离线的循环前向传播,把当前信息压缩更新到 SSM(状态空间模型)的快速权重里,然后再清空缓存。论文在 GSM-Infinite 任务上拿 Jet-Nemotron 2B 模型试了试,设 ...

推荐理由:HKR 三项都过:钩子强,知识点有可复现的机制和 Jet-Nemotron 2B 的实测数字,也踩中了中美算力效率竞赛的神经。但它仍是一篇早期论文,不是产品发布或行业级事件,所以刚好卡在 featured 门槛上。

Hacker News 首页

当 AI 开始自己造自己:Anthropic 谈递归式自我改进的进展

Anthropic 发了一篇文章,讲他们内部怎么让 Claude 越来越多地参与 AI 开发。核心概念是“递归式自我改进”——让 AI 系统能完全自主地设计和开发自己的下一代。他们说自己还没到那一步,但趋势在加速。文章给了几个内部数据:到 2026 年 5 月,Anthropic 合并的代码里超过 80% 是 Claude 写的;工程师现在平均每个季度...

推荐理由:H 和 R 都过了:标题钩子强,话题本身也切中前沿模型的安全焦虑。K 没过是因为这只是一封公开信和政策呼吁,不是已生效的法律,正文也没披露具体机制或模型细节,信息密度撑不起更高评级,放在 featured 合理。

6月4日星期四

量子位 · 公众号

Together AI 把 2-bit KV Cache 压缩真的跑在了线上服务里

Together AI 和悉尼大学、UIUC 搞了个叫 OSCAR 的 2-bit KV Cache 压缩方案,每个 KV 元素实际只占约 2.28 bit,在 Qwen3-4B-Thinking 上跑分 71.86,比 TurboQuant 高出 40.1 分。简单说就是把模型推理时占显存的大头——键值缓存——压到极低精度,还尽量不丢性能。正文没披露...

推荐理由:HKR 三项都站得住:OSCAR 把 2-bit KV Cache 从纸面推到线上,还给了实打实的分数和对比。不过话题本身还是底层推理优化,放 featured 比放头条更合适,做推理基建的人会点进去看。

6月3日星期三

NVIDIA 博客

NVIDIA 在 CVPR 发了三篇物理 AI 论文:抓取、自动驾驶和游戏里练出来的智能体

这三篇论文都进了 CVPR。GraspGen-X 用 20 亿次模拟抓取训练,让机械手能处理没见过的物体,但正文没披露真实世界的抓取成功率。LCDrive 把自动驾驶的推理 token 砍了大约一半,靠的是让模型直接输出轨迹而不是先写文字再转成动作,延迟更低,不过没提极端场景下的安全性验证。NitroGen 在 1000 多个游戏里跑了 4 万小时的交...

推荐理由:NVIDIA 在 CVPR 放出的三篇论文,每篇都带着实打实的数字:GraspGen-X 用 20 亿次模拟抓取训练机械手,LCDrive 把自动驾驶模型的推理 token 砍掉一半,NitroGen 在 1000 多款游戏里攒了 4 万小时交互数据来训游戏 agent。我会先打个折——这是厂商研究打包发布,不是新模型或产品上线,所以重要性停在 78 分。但信息密度够高,对做机器人、自动驾驶和游戏 agent 的人有直接参考价值,尤其是用合成数据替代真实采集、降低推理延迟这两条思路,正文没披露具体硬件环境和延迟数字,这点先别太激动。

机器之心 · 公众号

蚂蚁灵波在 RSS 2026 提出首个自回归因果世界模型,用 50 条演示数据就能让机器人学会通用操控

蚂蚁灵波和港科大搞了个叫 LingBot-VA 的模型,把“预测画面接下来怎么变”和“判断该做什么动作”合到一个自回归框架里。论文说,每个任务只用 50 条真实世界的演示数据微调,在 RoboTwin 2.0 的简单和困难设定下,成功率分别到了 92.0% 和 91.1%。不过原文因为微信环境异常没抓到,具体实验细节和泛化边界暂时看不到,这个成功率数字...

推荐理由:标题的“50条数据”是个强钩子,对数据成本敏感的从业者吸引力很大。文章把自回归因果世界模型的机制讲得比较清楚,就是让模型先预测画面变化再决定动作,不是黑箱。但全文只有一篇论文发布,没看到开源代码、实物测试视频或跟主流基线(比如扩散策略)的量化对比,验证强度不够。所以重要性给78,属于值得关注但别急着全信的研究发布。

Computing Life · Share · 鸭哥调研

MAI-Thinking-1:让模型持续思考几千步不崩,比让它开始思考难得多

微软 MAI-Thinking-1 的技术报告没在吹模型多会解题,而是在讲怎么让强化学习训练别崩。他们给 GRPO 算法打了三个补丁:一个像恒温器一样动态调节模型的“自信度”,防止它变得死板或乱猜;一个像断路器,在梯度爆炸时直接截断,保住整批训练数据;还有一套自蒸馏抢救流程,训练万一崩了,能把之前学会的推理能力搬到新模型上继续跑。这三个机制合起来,让模...

推荐理由:标题把卖点从“会思考”转到“持续思考”,一下就把训练崩溃这个真问题拎出来了。三种机制的名字虽然有点包装感,但至少给了具体抓手:恒温器控波动、断路器防崩、自蒸馏保风格。正文没披露具体实验数据和复现条件,所以“几千步不崩”这个数字先打个折看。整体对做推理模型训练的人有参考价值,但离落地验证还差一口气。

AI HOT 精选

微软放出 MAI-Thinking-1,35B 活跃参数的 MoE 模型,没靠蒸馏自己从头训

微软发了 MAI-Thinking-1,一个混合专家(MoE)模型,总参数 1 万亿但每次只激活 350 亿,跑起来相对省算力。它用 30T token 从零预训练,没拿第三方模型做蒸馏,这点比较硬气。微软管自己的迭代优化流程叫“爬山机器”,听着像在反复试错往上拱。成绩单上,AIME 2025 拿了 97.0%,LiveCodeBench v6 拿了 ...

推荐理由:微软发了 MAI-Thinking-1,一个 MoE 架构的推理模型,活跃参数 35B,总参数 1T,用 30T tokens 从零开始预训练。我会先打个折:正文没给任何跑分、开放方式或定价,所以没法判断实际水平。光看参数规模,35B 活跃部分在推理时成本不会太高,但 1T 总参数意味着训练和存储都不便宜。这点先别太激动,等有 benchmark 和访问方式再说。

6月2日星期二

机器之心 · 公众号

图灵奖得主 Sutton 新论文:AI 的下一步,得学会在行动中理解世界

这篇文章的正文被微信环境验证挡住了,实际内容没抓到。从标题和摘要看,Banafsheh Rafiee 和 Richard S. Sutton 提了一个叫“生成认知”的框架,给 AI 立了四根柱子:经验、感知与行动不可分、自主性、具身性。说白了就是主张智能不能光靠看数据,得在跟环境互动的过程中长出来。但具体怎么实现、有没有实验,正文没披露,这点先别太激动。

推荐理由:这篇是 Sutton 和 Rafiee 的新论文解读,核心是提出“生成认知”框架,主张智能体得靠经验、感知和行动绑在一起、自己定目标、还得有身体去试错。我会先打个折:正文没披露实验、代码或可复现的测试,目前还停在概念层。但 Sutton 的名气和四个支柱的提法,让它有资格进 featured,属于研究评论向的必读。

6月1日星期一

r/LocalLLaMA

我在一张 RTX 3060 上给冻结的 1.4B Mamba 主干挂了 8 个推理专家臂,这是拆解报告

作者用一张 12GB 显存的 RTX 3060 训练了一个叫 Mamba-Titan-1.4B-Reasoning 的模型。做法是把一个 1.4B 参数的 Mamba-1 主干完全冻结,只在第 24、25 层外挂了 8 个可训练的专家臂,组成一个总参数量 2.54B 的混合专家模型,每次推理只激活其中 2 个专家。数学题准确率大概做到 50%。正文没披...

推荐理由:这是一篇 Reddit 个人实验帖,不是论文,也没有独立复现,所以我会先打个折。但它的价值在于把一次失败解剖写得清楚:在单张 RTX 3060 上,冻结 Mamba 主干、外挂 8 路 MoE 做推理,最后数学准确率卡在 50% 左右。正文没披露训练时长和具体数据集,这点信息有缺口。对想用消费级显卡折腾推理模型的从业者来说,这篇能省掉一次踩坑,属于低门槛、有参考意义的 featured 内容。

5月29日星期五

机器之心 · 公众号

TogetherAI 搞了个真 2-bit 的 KV 缓存压缩方案 OSCAR,长上下文推理能跑更快

TogetherAI 和合作方发布了 OSCAR,一个把 KV 缓存压到平均每个值只占 2.28 比特的压缩系统,已经接进了 SGLang 推理框架。在 10 万 token 的长上下文场景里,解码速度最高能到原来的 3 倍;在固定显存预算下,整个任务吞吐量最高能到 7 倍。正文没披露具体模型和测试硬件,也没说精度损失有多大,这点先别太激动。

推荐理由:我会先打个折:这是推理优化层的专项工作,不是模型发布,受众偏工程。但 100k 上下文 decode 约 3 倍加速、吞吐约 7 倍这两个数够硬,对跑长上下文推理的团队有直接参考价值。正文没披露精度损失的具体对比,这点先别太激动。整体值得放进 featured,让做推理部署的人看到。

机器之心 · 公众号

Meta 烧了 1830 亿 token,把 26 本数学教材翻译成了机器可验证的 Lean 代码库

Meta 放出了一个叫 ATLAS 的数学形式化库,用 Lean 4 语言把 26 本数学教材里的定义和证明搬了进去。整个工程消耗了 1830.57 亿个 token,生成了约 63 万行代码,包含 46203 条声明。其中 42837 个证明已经跑通,证明通过率 92.7%。说白了就是让 AI 把教科书上的数学推理,转成机器能严格检查的代码,以后训练...

推荐理由:HKR三项都站得住:token量、Lean库规模和已验证证明数都是硬数字。没给P1是因为这还是个偏专的研究开源发布,不是通用模型或产品级发布。

机器之心 · 公众号

马嘉祺让大模型翻车,背后是低频词退化问题,有人一年前洗澡时就发现了

文章页面被微信环境验证挡住了,正文内容没拿到。从现有标题和英文摘要看,讲的是 FaceMind 团队把大模型在“马嘉祺”这类低频词上翻车的现象,和两篇论文串了起来:一篇是 EMNLP 2025 的 SLoW,另一篇是刚被 ACL 2026 接收为 Oral 的 Adam's Law。摘要里还提到一个具体数字——用高频词改写的方法,把 DeepSeek-...

推荐理由:这篇文章把马嘉祺让大模型翻车这个意外事件,和低频 token 退化这个技术问题绑在一起讲,切入点很巧。它不光讲现象,还给出了两篇顶会论文的机制解释,以及 DeepSeek-V3 上 8 个百分点的准确率提升,对做模型评测和提示工程的人有直接参考价值。不是大模型发布那种重磅消息,但属于扎实的研究信号,值得放进精选。

5月28日星期四

机器之心 · 公众号

Mila 和 DeepMind 搞了个大一统的缩放定律公式 UNSL,想把参数量、数据量、训练步数这些变量塞进同一个框架里

正文因为微信环境异常被屏蔽了,具体技术细节看不到。从标题和已有英文摘要看,这篇论文提出了一种叫 UNSL(统一神经缩放定律)的多变量公式,不再只看模型参数或数据量单一维度,而是同时建模参数量、token 数、训练步数,还考虑了训练瓶颈、过拟合以及超参数调不好的负面影响。在论文自己汇报的实验里,UNSL 在 60.87% 的视觉任务和 88.89% 的语...

推荐理由:这篇不是又一个刷榜的 scaling law,而是把之前各自为政的变量(参数量、token 数、步数、瓶颈、过拟合、超参数反作用)捏到了一起。我会先打个折:视觉任务 60.87% 的最佳外推率说明还有不少场景没覆盖到,但语言任务 88.89% 确实亮眼。正文没披露具体实验用了多少算力、验证集规模多大,这点先别太激动。如果是真的,训练前就能更准地估出该堆参数还是堆数据,省钱。

5月27日星期三

r/LocalLLaMA

8 个开源模型在 MMO 里挂了 10 天机,放出了 9.3 万条事件日志

Firespawn Studios 在《Null Epoch》第 0 赛季里放了 25 个 AI 智能体,分别跑在 8 个开源模型上,连续运行了 10 天。他们公开了大约 9.3 万条记录的事件数据集,其中约 70% 的动作都附带了模型当时的推理或决策理由。不过,Reddit 原帖的正文内容被网络屏蔽了,目前看不到具体的实验结论和模型表现对比,只能从标...

推荐理由:Firespawn Studios 把 8 个开权重模型丢进 MMO 里当 agent 跑了整整 10 天,攒了 9.3 万条事件数据,这事本身比跑分有意思——因为不是测单次问答,是看模型能不能在持续变化的环境里记住东西、做出连贯决策。我会先打个折:信息来自 Reddit,不是正式论文,实验细节和失败案例正文没展开,所以别当严谨研究来读。但 25 个 agent、8 个模型、10 天的规模,加上数据公开,对想测 agent 长期稳定性和记忆的人是个现成的素材包。

量子位 · 公众号

卡内基梅隆和马里兰大学让大模型“睡觉”:上下文快满时暂停、压缩记忆再继续推理

这篇论文给大模型设计了一个类似人类睡眠的机制。当模型处理长文本、上下文窗口快塞满时,它会主动停下来,不再接收新 token,而是利用离线时间对已积累的上下文做多轮递归前向计算,把信息压缩成“快速权重”。之后清空 KV 缓存,相当于整理完记忆再醒来继续干活。测试在细胞自动机、多跳图谱检索和 GSM-Infinite 推理任务上跑过,但正文没披露具体的性能...

推荐理由:我会先打个折,因为正文没给出压缩后的基准测试提升、代码或实际部署证据,所以分数停在 76。但“睡觉”这个说法确实把枯燥的上下文压缩讲得让人想点进去看。核心操作是模型在上下文快满时主动暂停,用多轮离线方式把旧信息压紧,然后清掉 KV 缓存腾地方,思路清楚。如果后续有实测数据,比如长文本任务不掉点、显存省了多少,分数还能往上走。这点先别太激动,等看到具体数字再说。

机器之心 · 公众号

三星公开 Meki、M2RL 和 LiveClawBench 三项研究,从端侧记忆架构做到物理 AI 评测

三星这次放出了三个项目:Meki 是一种给端侧模型用的记忆架构,让手机或 IoT 设备上的小模型能记住上下文、省着用算力;M2RL 是多领域强化学习框架,想让一个模型在不同任务里都能自己学会干活;LiveClawBench 则是专门测物理 AI 的基准,看模型能不能在真实世界里抓取、操作物体。文章还提到三星已经采购了数万张 GPU 来搭 AI 基础设施...

推荐理由:这是一组三星研究院的技术打包发布,不是旗舰模型或产品上线,但胜在信息具体、方向明确。我会先打个折:正文没披露数万张 GPU 的具体型号和部署时间线,也没说 Meki 在端侧实测的延迟和功耗,所以不能当量产信号看。不过,三星把 Memory 架构、多领域 RL 和灵巧手评测一起端出来,等于公开了自己在 Physical AI 上的三条腿走路策略,对关注端侧和机器人方向的从业者来说,比单篇论文更有参考价值。

AI HOT 精选

Anthropic 工程师称 Claude Mythos 用“巧妙简洁的证明”解开了 OpenAI 此前攻克的 Erdős 数学猜想

Anthropic 工程师 Sholto Douglas 在 X 上说,Claude Mythos 用一个“巧妙简洁的证明”解决了 Erdős 单位距离猜想,而 OpenAI 前不久刚把这个问题当作 AI 数学推理的里程碑。团队的做法是把问题丢给多个独立的 Claude Code 实例,让它们各自找解题路径,再汇总分发,Mythos 经常走出和 Ope...

推荐理由:HKR 三项都成立:标题自带反差,信息点具体,又牵动前沿推理模型的竞争格局。但正文没披露证明内容、验证方式、Mythos 是否已发布,所以只能放 featured,不能上 P1——我会先打个折,等看到证明再说。

5月26日星期二

量子位 · 公众号

浙大和阿里给生图模型加了个“先想再画”的模块,画数独、烧蜡烛这类精细活终于不翻车了

这篇论文提出了一个叫 Unified Thinker 的独立规划模块,专门解决生图模型一遇到需要精确空间推理的任务就乱来的问题。它不像以前那样让模型边想边画,而是把“思考”和“执行”拆开:先让模型生成结构化的推理步骤,再把这些步骤翻译成具体的视觉指令去生图。训练用了 4 万条叫 HieraReason-40K 的样本,分两阶段做强化学习,让模型学会在动...

推荐理由:这篇论文解决的是一个很实际的问题:多模态模型经常在需要一步步操作的视觉任务里翻车,比如画数独格子画错、烧蜡烛的步骤搞反。浙大和阿里的做法是给模型加一个独立的规划模块,用 4 万条专门构造的样本训练它先想清楚再下笔,再通过两阶段强化学习把思考过程转成可执行的视觉指令。正文没披露这个规划模块的具体参数量和推理延迟,所以实际部署成本还不好判断。但思路本身挺直接,如果规划模块够轻量,对提升视觉 agent 的可靠性会有帮助。

机器之心 · 公众号

ACL 2026 论文:Spatial-Agent 让大模型不只是调地图 API,而是生成可执行的地理分析流程

这篇 ACL 2026 主会论文提出了 Spatial-Agent,核心思路是在用户用自然语言提问和调用地图工具之间,插入一张“地理流程关系图”(GeoFlow Graph),让大模型先规划出可执行的地理分析步骤,再一步步调用 API。在 MapEval-API 评测集上,搭配 GPT-4o-mini 的 Spatial-Agent 准确率达到 45....

推荐理由:ACL 主会论文,机制和数字都拿得出手,H 和 K 能过。但 GIS 工作流这件事本身圈子小,缺了成本、安全或平台竞争这些能出圈的点,R 就够不着,放在 featured 刚好。

5月25日星期一

r/LocalLLaMA

RTPurbo:用几百步训练把全注意力模型转成稀疏推理,长上下文预填充快 9.36 倍

这篇论文提出 RTPurbo,能把原本用全注意力的模型改成稀疏注意力来跑推理,而且只需要几百步训练。做法是只给“检索头”保留完整的 KV 缓存,其他头用一个 16 维的 token 索引器来近似,相当于大幅压缩了要存要算的内容。在 100 万 token 的长上下文场景下,预填充阶段最高快了 9.36 倍,解码阶段快了约 2.01 倍。正文没披露具体用...

推荐理由:我会先打个折:目前只有 Reddit 讨论,正文没披露模型规模、具体任务和代码,验证强度偏弱。但“几百步把全注意力转稀疏”这个思路本身挺省钱的,数字也够具体,对做长上下文推理优化的人值得看一眼。信息缺口明显,所以分数没往上拉。

5月24日星期日

机器之心 · 公众号

ICML 2026 中了一篇让视觉模型学会“多条思路并行思考”的论文,但正文被验证页挡住了

这篇被 ICML 2026 接收的论文叫 Visual Para-Thinker,给视觉语言模型加了一套并行思考框架。核心是用 Pa-Attention 和 LPRoPE 把视觉推理拆成四条独立路径,让模型同时从不同角度理解图像,再综合出答案。训练数据是 16.3 万组问答对,规模不算大,所以泛化能力得打个问号。不过目前文章页面被微信环境异常验证挡住了...

推荐理由:这篇 ICML 2026 论文给视觉语言模型装了一个并行思考框架,叫 Visual Para-Thinker。核心是把视觉推理拆成 4 条路径同时跑,用 Pa-Attention 和 LPRoPE 做隔离,防止路径间串味。训练数据是 16.3 万对问答,规模不算大,但够验证想法。我会先打个折:这是单篇研究,没有多团队复现或产品落地,所以重要性停在 79。对做多模态推理加速和内部机制拆解的人,这篇值得看,但别当成熟方案直接用。

5月23日星期六

机器之心 · 公众号

Bengio 团队新论文:用多条并行思路链做递归推理,效果比单条串行推理好

这篇论文提出了 GRAM,一个会生成多条内部推理轨迹、再从中挑出最优解的递归模型。在极难数独测试上,GRAM 用 16 步递归、同时跑 20 条并行思路,准确率达到 97.0%;作为对比,传统串行递归模型 TRM 要跑到 320 步才做到 90.5%。简单说,就是让模型多想几条路再选,比闷头一条路走到黑更靠谱,而且推理步数还少得多。不过正文没披露具体的...

推荐理由:Bengio 团队这篇新论文拿数独极端难度当试金石,用 GRAM 把递归推理的上限拉高了一截。核心卖点是并行轨迹比长串行更有效:16 步递归配上 20 条并行采样,准确率 97.0%,而对比的串行方法要跑 320 步才到 90.5%。我会先打个折——这只是在单一任务上的结果,泛化到其他推理场景还没验证,正文也没披露并行采样的实际计算开销和延迟。但思路本身对做推理加速的人有参考价值,尤其是想用多条短路径替代一条长路径的时候。

5月22日星期五

机器之心 · 公众号

Meta 华人团队发布 ATLAS:用一个词让视觉模型学会可泛化的推理

Meta AI 和港中文的研究者搞了个叫 ATLAS 的方法,核心是在视觉语言模型里塞一个“功能词”(Functional Token),让模型能同时走两条路:一条是显式的、一步步调用工具去操作图像(Agentic 推理),另一条是隐式的、在内部潜空间里直接算(Latent 推理)。他们配套搞了个 ATLAS-178K 数据集,分两阶段训练——先做监督...

推荐理由:我会先打个折:这是 Meta AI 和港中文联合发的研究,不是产品发布或旗舰模型,所以重要性给到 78 分比较合适。一个 Functional Token 搞定视觉推理这个 hook 确实抓人,正文也给了数据集和训练方法的细节,对做多模态和 agent 的团队有参考价值。但正文没披露实际部署成本或大规模验证结果,这点先别太激动。

Computing Life · Share · 鸭哥调研

OpenAI 的通用推理模型推翻了一个 80 年没人撼动的数学猜想

GPT-5 否证了 Erdős 在 1946 年提出的平面单位距离猜想。这个猜想说平面上 n 个点最多只能有约 n 对距离为 1 的点,80 年里数学家都信这个。模型没走证明路线,而是直接构造反例,用上了代数数论里跟几何八竿子打不着的工具,把单位距离对的数量推到了 n 的 1.014 次方。Fields 奖得主 Tim Gowers 审完证明说,如果是...

推荐理由:我会先打个折,因为正文没给论文、没给证明过程、也没说复现条件,信息缺口不小。但一个没专门练过数学的通用模型,推翻了一个 80 年没人动得了的 Erdős 猜想,还有 Fields 奖得主背书说能投顶刊——这个事实本身分量很重,属于当天就该推的消息。HKR 三项全中,重要性给 90 是合理的,再高就需要更多证据了。

5月21日星期四

r/LocalLLaMA

HRM 1B:一个用极低成本训练的小模型,性能号称能打 2B-7B 的开源选手

Sapientinc 开源了一个叫 HRM-Text 1B Base 的小模型,连训练代码也一起放出来了。论文里的说法是,它的性能可以和 2B 到 7B 的开源模型掰手腕,但训练用的数据量只有别人的百分之一到九百分之一,算力消耗更是只有别人的 1/96 到 1/432。具体来说,用 16 块 H100 GPU 训练了大概 46 小时,总花费约 1,47...

推荐理由:HKR 三项都站得住:HRM-Text 1B 有具体的低成本训练数字和公开代码。卡在 80 分是因为消息源是 Reddit,效率提升的说法还没有独立评测背书,我会先打个折。

Latent Space

OpenAI 用通用推理模型花不到 1000 美元,推翻了一个 80 年前的数学猜想

OpenAI 公布了一个内部通用推理模型(外界猜是 GPT 5.6)的成果:它找到了平面单位距离问题的新构造族,推翻了 1946 年 Erdős 提出的一个猜想。这个模型不是专门为数学训练的,就是普通的语言模型,但推理过程生成了约 125 页的总结。有外部观察者推测,这次运行只用了不到 32 小时,成本不到 1000 美元。数学家 Timothy Go...

推荐理由:HKR 三项都成立:一个内部推理模型声称驳倒了 1946 年的 Erdős 问题,输出约 125 页,这是很强的能力信号。不过成本和运行时间目前还是外部推测,正文没披露 OpenAI 自己的官方数字,所以分数没给到 95。

AI HOT 精选

OpenAI 模型自己解了一道 80 年没搞定的平面几何题,用的还是数学家觉得走不通的路

OpenAI 的一个模型独立解决了 1946 年埃尔德什提出的“平面单位距离问题”。这道题近 80 年来大家一直觉得最优解长得像方格子,但模型搬出了代数数论里比较冷门的 Golod-Shafarevich 理论,找到了一整族效率更高的新构造,把老结论推翻了。这是 AI 头一回自己搞定一个数学核心开放问题,关键就在于它提出并完整执行了一条人类因为直觉上觉...

推荐理由:我会先打个折:目前只有一段摘要,没给模型名、没论文链接、没复现细节,也没第三方验证,所以别急着当定论。好消息是它把问题说得很具体——1946 年平面单位距离问题,还用 Golod-Shafarevich 理论给了一族更高效率的构造,说明不是随便蒙对的。对做推理方向的团队来说,这至少是个强信号,但正文没披露用了多少算力、有没有人工提示工程介入,这点先别太激动。

TechCrunch · AI

OpenAI 说这次真解决了一个 80 年的数学难题

OpenAI 声称他们的新推理模型推翻了一个自 1946 年悬而未决的几何猜想。七个月前他们刚因为类似宣称翻过车——当时说 GPT-5 解决了 10 个未解难题,结果被扒出只是找到了文献里已有的答案,前副总裁 Kevin Weil 只好删帖。这次不一样的地方在于,上次揭穿他们的数学家这回站到了 OpenAI 这边。不过正文没披露模型名字、证明细节和验证...

推荐理由:HKR 三项全中:OpenAI 加一个 80 年历史的几何猜想,是个可验证的硬核推理声明。但正文没给模型名、没给证明细节、也没说怎么验证的,所以先别太激动,暂时到不了 P1。

5月20日星期三

OpenAI News

OpenAI 一个没公开名字的模型推翻了一道 80 年的离散几何猜想

OpenAI 发了一篇博文,说他们内部一个通用推理模型自己解决了一道叫“平面单位距离问题”的数学难题,推翻了大家信了几十年的主流猜想。这道题是 Erdős 在 1946 年提出的,简单说就是平面上放 n 个点,最多能有多少对点距离刚好是 1。之前学界普遍认为正方形网格那种摆法已经接近最优了,但这个模型给出了一族新构造,把单位距离对的数量往上提了一个多项...

推荐理由:我会先打个折:正文没披露模型名称、证明机制和可复现条件,所以没法给更高分。但 OpenAI 模型推翻 80 年几何猜想这件事本身够新、够具体,也够有争议性,HKR 三项全中,85 分放在 P1 合理。

5月19日星期二

r/LocalLLaMA

Sapient 发布 HRM-Text 1B:40B token 预训练,成本约 1000 美元,数学和阅读理解分数超过 Llama3.2 3B

Sapient Intelligence 开源了一个 10 亿参数的小模型 HRM-Text 1B,用 16 张 GPU 跑了 1.9 天,喂了 400 亿个 token,总花费大概 1000 美元。他们自己测的榜单显示,这个 1B 模型在 MATH 数学题上拿了 56.2 分,在 DROP 阅读理解上拿了 82.2 分,两项都压过了 Meta 的 L...

推荐理由:我会先打个折:独立评测还没做完,MATH 56.2 和 DROP 82.2 都是自报分数,别急着全信。但 1000 美元预训练一个 1B 模型这件事本身就有信息量——它说明小团队也能用很少的算力做出能打的模型,对预算有限的开发者是个实在信号。正文没披露数据配比和消融实验,所以没法判断这 40B tokens 的质量到底多高。分数先按 78 给,等第三方跑完基准再考虑往上调。