跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 401–420 条 · 共 585 条

5月15日星期五

AI HOT 精选

Anthropic 的 Mythos AI 五天挖出两个 macOS 内核漏洞,还串成一条提权攻击链

《华尔街日报》说,Anthropic 的安全研究工具 Mythos 在五天内帮研究人员找到两个之前没人发现的 macOS 内核漏洞,并把它们串成一个完整的提权攻击链,绕过了苹果的内存完整性保护。这意味着攻击者能碰到系统本该锁死的区域。报道指出,现在 macOS 的防御思路已经不是不让漏洞被发现,而是尽量抬高漏洞利用的门槛。Mythos 能帮上忙的地方在...

推荐理由:Anthropic 的 Mythos AI 五天挖出两个未知 macOS 内核漏洞还串成提权链,这事本身信号很强。我会先打个折:目前只有社交平台帖子,没看到论文或复现条件,漏洞具体怎么挖的、模型在哪个环节起了作用,正文都没披露。所以分数压在 81,不往上拉。对从业者来说,这条消息值得看,但别急着把它当成 AI 做漏洞挖掘的成熟证据。

r/LocalLLaMA

让 7B 小模型从自己的错误里学习,HumanEval 正确率从 15% 涨到 68%,跑一次训练只要 3.5 美元

作者拿 Qwen 2.5 7B 基础模型做实验,先让它自己写代码、自己跑测试,把跑不过的代码和报错信息收集起来,再让它根据报错改出正确版本,这样就自动生成了“错误-修正”配对数据。用这批数据微调后,7B 模型在 HumanEval 上的通过题数从 25 题(约 15%)提升到 112 题(约 68%),数学能力也超过了 GPT-3.5。14B 版本只用...

推荐理由:我会先打个折:标题说 80% 但正文是 112/164,约 68%,这点先别太激动。不过 hook 确实抓人——让模型自己写题、自己答、再自己改错,用这些修正对去微调,HumanEval 直接翻几倍。14B 版本只用了 100 对样本、一张 H100 跑一个半小时花 3.50 美元,成本低到可以复现。正文没披露数学 benchmark 的具体名称和完整分数,验证偏弱,但作为单人实验,信息量和可操作性都够。保留 78 分,因为它是单篇 Reddit 帖子,且 80% 的说法和实际数字有出入。

TechCrunch · AI

Richard Socher 拿了 6.5 亿美元要做能自己研究、自己迭代的 AI,还说这次会出产品

Richard Socher 的新公司融了 6.5 亿美元,目标是搞一个能无限自我研究和改进的 AI 系统。他特别强调这次不是纯研究,会实际交付产品。不过正文没披露具体靠什么技术实现、什么时候上线、产品长什么样,这些关键信息都还空着,所以这个承诺先打个折看。

推荐理由:我会先打个折:标题很炸,但正文其实没讲清楚 AI 怎么“自己造自己”。Socher 的新公司拿了 6.5 亿美元,目标是让 AI 能持续自我研究和改进,这点听起来挺省钱——如果真能跑通,训练迭代的人力成本会降一大截。不过正文没披露任何技术机制、时间表,也没说会交付什么产品,所以现在只能当个方向性信号看。TechCrunch 的信源和 Socher 本人的名气撑住了这条消息的份量,但别急着激动,等具体方案出来再判断。

r/LocalLLaMA

MOOSE-Star:用 7B 小模型和 10 万篇论文做科学假设发现,ICML 2026 接收

MiroMind 放出了 MOOSE-Star 系列,包含三个 7B 模型和一个叫 TOMATO-Star 的数据集,里面有 108,717 篇 NCBI 论文。其中 MS-IR-7B 在“灵感检索”任务上准确率到了 54.37%,底子是 DeepSeek-R1-Distill-Qwen-7B,fp16 跑起来大概占 14GB 显存,支持 llama....

推荐理由:我会先打个折:正文没披露 54.37% 这个准确率是在什么基准上测的、对比了哪些方法,所以这个数字先别太激动。但整套东西的钩子很实在——用 7B 小模型加 10.8 万篇 NCBI 论文搭一个科学假设发现的流程,fp16 才 14GB,本地就能跑。对想做科研 RAG 或让模型进文献分析流程的团队来说,这是个现成的起点,数据集和模型权重都公开了。

r/LocalLLaMA

inclusionAI 在 Hugging Face 上放出了 Ring-2.6-1T,一个 1 万亿参数、支持多档推理强度的模型

Ring-2.6-1T 是 inclusionAI 发布的一个 1 万亿参数推理模型,主打让模型进业务流程干活(agent workflow)和长链条任务。它提供 high 和 xhigh 两档推理强度,训练时用了异步强化学习加 IcePop 算法来稳住训练过程。不过 Reddit 原帖被网络屏蔽,正文没披露更多技术细节、实际跑分或硬件需求,这点先别太激动。

推荐理由:我会先打个折:正文没给任何跑分、没提许可证、也没说推理到底要多少卡,所以只能算个信号,不能当结论。1T 参数加上两档推理强度,说明 inclusionAI 在试着让大模型按需出力——开低档省资源,开高档拼质量。Async RL 和 IcePop 这两个训练名是新的,但没解释具体怎么训、省了多少成本,这点先别太激动。整体看,消息本身有料,但缺验证,暂时放在 featured 的下沿比较合适。

5月14日星期四

AI HOT 精选

李沐团队发布 SenseNova U1 技术报告,开源 MoE 模型权重

商汤联合创始人李沐带的团队把 SenseNova U1 的技术报告和模型权重放出来了,用的是混合专家(MoE)架构。报告讲了模型怎么搭、怎么训,但正文没提参数量多大、开源协议是什么、跑分结果怎么样。团队说这么干是为了让研究更透明、别人能复现。我会先打个折——没给规模数据和基准测试,实际能用在哪、省不省钱都还不好判断。

推荐理由:这条消息有李沐团队背书,又放出 MoE 权重,对做模型部署和微调的人是个实在信号。我会先打个折:正文没披露参数量、许可证和评测结果,所以没法判断实际性能和商用门槛。这点先别太激动,等后续补上关键信息再重新评估。

AI HOT 精选

小米 MiMo V2.5 Pro 在 DesignArena 设计竞技场拿到第三,前端编码追平 Claude Sonnet 4.6

MiMo V2.5 Pro 的 Thinking 版本在 DesignArena 总榜上比上一代 MiMo-V2.5 爬了 8 个名次,直接冲到第三。前端编码任务的表现已经和 Claude Sonnet 4.6 打平。正文没披露具体评分和测试样本量,所以这个“追平”是在什么条件下达成的还不清楚,先别太激动。

推荐理由:H、K、R 三条都踩中了,但信息全来自官方一条推文,没公开测试方法、没开放试用、也没提价格,所以先别太激动。这更像一次产品更新和榜单占位,不是那种当天必须追的硬核发布。

新智元 · 公众号

田渊栋带队八人创业,估值 46.5 亿美元,要做能自己进化、自己搞研究的 AI

田渊栋和另外七位 AI 研究员一起创立了 Recursive Superintelligence,团队目前 25 人,拿了 6.5 亿美元融资,估值冲到 46.5 亿美元。他们想干的事是把模型评估、数据筛选、训练、后训练甚至研究方向选择这些环节全交给 AI 自己跑,让整个研发流程自动化。正文因为需要验证没加载出来,具体技术路线和验证结果还不清楚,所以这...

推荐理由:一家 25 人的公司,拿了 6.5 亿美元,估值冲到 46.5 亿美元,要做的事是让 AI 自己搞定评估、挑数据、训练、后训练甚至选研究课题——说白了就是让研究员自己卷自己。田渊栋带队,八人创始团,这个阵容和融资规模都不是常规操作。我会先打个折:正文没披露具体技术方案和验证结果,所以现在只能当一个大额押注来看,别急着激动。

机器之心 · 公众号

阿里达摩院用信息瓶颈做自奖励,让模型做数学题时多试几条不同的路

阿里达摩院发了篇 ACL 2026 论文,提出 I²B-LPO,解决强化学习微调时模型解题思路越来越像的问题。做法是在模型生成答案时,碰到它犹豫不决的节点就分叉出多条路径,再用一个基于信息瓶颈的自奖励机制筛掉重复的、留下真正不一样的解法。论文在 Qwen2.5-7B 和 Qwen3-14B 上跑数学题,准确率最多提了 5.3%,答案的语义多样性提了 7...

推荐理由:我会先打个折:这还是一篇训练方法论文,不是新模型或产品发布,所以重要性给 78 合理。亮点在于它把 RLVR 的探索问题讲得很具体——不是泛泛说“多样性不足”,而是用高熵节点定位、分支采样、自奖励这套组合拳给出可操作的解法。数字也实在,准确率和多样性双涨,没有只挑好看的说。正文没披露训练成本和延迟数据,这点先别太激动。整体适合推荐给做推理微调的人看,不是那种看完就忘的刷榜文章。

r/LocalLLaMA

商汤发布 SenseNova-U1-A3B-MoT,一个模型搞定看图、推理和生成

商汤在 Hugging Face 上放出了 SenseNova-U1-A3B-MoT 模型,同时提供了 A3B MoT、8B MoT 和 0.4B LoRA 权重链接。按官方说法,这套模型用 NEO-unify 架构把多模态理解、推理和生成统一到一个模型家族里。不过 Reddit 原帖被网络屏蔽了,正文没披露具体性能数据、训练细节和实际跑分,想试的话得...

推荐理由:SenseNova 在 Hugging Face 扔了一套多模态模型权重,A3B MoT、8B MoT 加一个 0.4B LoRA,主打 NEO-unify 架构,说能把看图、推理和生成塞进一个模型。我会先打个折:正文没给任何 benchmark 分数,也没写清楚开源协议,所以性能好坏和商用限制现在全是问号。亮点是 LoRA 权重只有 0.4B,对想用消费级显卡跑多模态任务的人挺友好,这点先别太激动,等实测出来再看。整体属于有料但缺关键信息的发布,给个 featured 低段位合理。

5月13日星期三

r/LocalLLaMA

阿里达摩院放出 Ovis2.6-80B-A3B:总参数 800 亿,推理时只激活约 30 亿的多模态 MoE 模型

Ovis2.6 把语言模型底座换成了混合专家架构,总参数量堆到 800 亿,但推理时只叫醒大概 30 亿个参数,跑起来比较省算力。上下文窗口拉到 64K token,能处理的图片分辨率最高到 2880×2880,适合啃长文档、高信息密度的图表和扫描件。这次加了一个“边想边看图”的能力,推理过程中模型可以主动裁剪、旋转图片区域,在思维链里反复检查视觉细节...

推荐理由:我会先打个折:正文没给任何跑分、授权条款和实测结果,所以别急着下结论。亮点是 80B 总参数里只激活约 3B,推理成本可能压得很低,同时支持 64K 上下文和 2880×2880 大图输入,适合拿来做文档理解、高分辨率视觉问答这类吃上下文和细节的任务。MoE 结构意味着你可以用消费级硬件试试,但实际吞吐和显存占用还得自己测。这点先别太激动,等补上基准测试和开源协议再说。

AI HOT 精选

Google 用 ADK 搭了一个能跑几周不丢上下文、会自己暂停和恢复的 AI 助手

Google 开发者博客发了一篇教程,用自家的 Agent Development Kit(ADK)搭了一个“新员工入职协调助手”。这个助手能跑好几周:发完欢迎邮件就自己暂停,等员工签完文件再继续,中间还能把装电脑的活派给另一个专门的小助手,最后发一份定制的第一天日程。文章没给具体性能数据,但重点讲了三个让 demo 变生产可用的架构思路:用结构化的持...

推荐理由:Google Developers 这篇教程没发新模型或新平台,但把长时运行智能体的持久化机制讲得很实在:状态机管流程、会话存储保上下文、Webhook 接外部系统。我会先打个折,因为只是工程实践分享,不是重大发布,但对正在落地 agent 的团队来说,这种能跑几天不丢状态的方案比很多 demo 更有用。

5月12日星期二

AI HOT 精选

在 Claude Code 里装 OpenAI 官方 Codex 插件,让两个模型搭伙干活

作者在 Claude Code 的插件市场里加了 OpenAI 的官方库,把 Codex 插件装好、重载、配完就能用。这么做的思路来自 HeavySkill 论文的“重思考”方法:让多个模型各自独立推理,再找一个模型当主持人把思路揉到一起,提高最终回答质量。作者现在搭的 Skill 就是 Claude Code 负责推理,Codex 当主持人。正文没提...

推荐理由:HKR 三项都成立:跨模型插件调用有新闻性,安装路径可操作,对 AI 开发工作流有实际影响。但这是一篇教程型分享,不是模型或平台发布,所以只给 featured 低档。

新智元 · 公众号

OpenAI 发布 GPT-Realtime-2,一个号称 GPT-5 级推理能力的实时音频模型

OpenAI 推出了 GPT-Realtime-2,官方把它叫做“GPT-5 级推理音频模型”。同时发布的还有 Realtime-Translate 和 Realtime-Whisper 两个配套工具。新模型支持 128K 上下文窗口,提供五档推理强度可选,API 定价是每百万输入 token 32 美元、输出 token 64 美元。不过,这篇文章因...

推荐理由:OpenAI 同一天发的产品更新,实时音频推理是个硬功能,不是概念稿。128K 上下文和 5 档推理强度让开发者能按场景调成本与效果,32/64 美元的定价也给了算账依据。我会先打个折:正文没提延迟数据和实际录音样本,这点先别太激动。但语音 agent 的落地成本一直是瓶颈,这篇信息密度够,值得推给做实时交互的从业者。

量子位 · 公众号

上海 AI 实验室发现:有监督微调能跨领域泛化,但得满足三个条件

上海 AI 实验室、上海交大和中科大的团队拿 Qwen3-14B-Base 做长思维链的监督微调实验,发现模型在训练 8 轮后,跨领域的表现会先跌后涨,最终超过原始水平。他们总结出泛化要成立的三个条件:一是得把模型训得足够深,不能浅尝辄止;二是训练数据的质量和结构要过关;三是基座模型本身的能力得够强。正文没披露具体用了什么数据集,也没给出跨领域任务的具...

推荐理由:这篇论文的卖点很清晰:SFT 不是不能泛化,但得满足优化、数据结构和基模型能力三个条件。我会先打个折,因为目前只是 Reddit 上的一个帖子,没有看到论文全文或代码,没法验证他们说的 8 个 epoch 先降后升是不是稳定复现。不过这个发现对做开源微调的人确实有用,尤其是用 Qwen3-14B 这类模型时,怎么配长思维链数据、训多久,这篇至少给了一个可参考的曲线。HKR 三项都过得比较轻松,但因为没有独立复现和完整 benchmark,分数就停在 76,不往上拉了。

5月11日星期一

AI HOT 精选

菲尔兹奖得主实测 ChatGPT 5.5 Pro:17 分钟独立解决数学难题,成果够写博士论文

剑桥数学家、菲尔兹奖得主 Timothy Gowers 用 ChatGPT 5.5 Pro 做了个实验,只给简单提示,没做任何数学指导。AI 在 17 分钟内独立解决了一个加法数论公开问题,给出的构造在理论上是最优的。Gowers 判断这个成果完全够格写进博士论文。随后 AI 又在一个更难的 k 重求和集问题上,把已知上界从指数级改进到亚指数级,审阅者...

推荐理由:H、K、R 三项全中:有实名数学家、有 17 分钟出成果的具体说法、有对博士培养的警告。但正文没披露具体题目、提示词和验证路径,所以先别太激动,分数打 84 是合理的。

AI HOT 精选

AntLingAGI 放出万亿参数模型 Ring-2.6-1T,5 月 15 日前在 OpenRouter 免费用

Ring-2.6-1T 是一个万亿参数模型,主打可调“思考强度”——你可以手动控制它多想一会儿还是少想一会儿,在回答质量、token 消耗和响应速度之间自己取舍。模型专门为智能体场景做了优化,支持多步执行和工具调用,适合高频工作流。官方说它能处理数学逻辑和科研类任务,但正文没给出具体跑分或对比数据。目前通过 OpenRouter 免费开放,截止到 5 ...

推荐理由:这条发布信息量偏薄,正文没给基准测试、定价、架构或训练细节,所以重要性我打了个折,没给更高。但万亿参数这个量级本身就有话题性,加上 OpenRouter 上的限时免费,对想快速试用的开发者很友好。可调思考强度和工具调用这两点,说明它在往智能体落地靠,不是单纯刷榜的模型。整体判断是:值得关注的一次模型发布,但别急着当里程碑,等实测数据出来再说。

AI HOT 精选

腾讯混元放出 Hy3 预览版,主打复杂智能体任务,不是刷榜模型

腾讯混元开放了 Hy3 预览版的早期体验,官方说这是目前混元系列里最强的模型。它不冲着跑分去,而是强调在真实场景里能把事办成。模型用了 256K 上下文窗口,一次能塞进很长的材料;架构是混合专家(MoE),还加了快慢思考机制,碰到复杂问题会自动切换深度推理模式。底层把预训练和强化学习管线重做了一遍,目标是在大规模部署时把成本压下来。具体效果和实测数据正...

推荐理由:腾讯混元 Hy3 预览版放出了 256K 上下文和快慢思维混合专家架构,定位是处理复杂智能体任务。我会先打个折——正文没披露评测分数、定价和开放范围,所以没法判断实际能力和性价比。架构上快慢思维混合专家听起来像在推理效率和深度之间做平衡,如果是真的挺省钱,但没看到具体实现细节。256K 上下文对长链条智能体任务有用,但也要看实际召回和推理稳定性。这点先别太激动,等更多技术细节和实测出来再说。

新智元 · 公众号

Anthropic 估值可能冲到近万亿美元,Jack Clark 预测 2028 年底前 AI 有超一半概率能自己造出更强的自己

这篇文章本身因为微信环境验证问题,正文内容没抓到,只能看到标题和外部信息。标题里提到 Anthropic 在考虑接近 1 万亿美元的估值,年化收入五个月内涨到 450 亿美元,IPO 规模可能超过 SpaceX。Jack Clark 判断,到 2028 年底,AI 系统能自主迭代出更强版本的概率超过 50%,Kalshi 预测市场上这个 IPO 在 1...

推荐理由:我会先打个折,因为来源是二手媒体,IPO和ARR数字都没看到官方确认。但文章把几个高关注点串在了一起:估值、收入增速、自主迭代的时间预测。对从业者来说,这些数字即使有水分,也反映了市场对头部AI公司定价的疯狂程度,以及内部对技术奇点临近的判断。信息量够,争议性也够,值得推。

机器之心 · 公众号

ICML 2026 论文:PRISM 框架让扩散语言模型做推理时扩展不再烧算力

这篇 ICML 2026 的论文给扩散语言模型(dLLM)提出了一套叫 PRISM 的推理时扩展方法。它把搜索过程拆成三层:先让模型并行生成多条推理路径,再对每条路径局部“回退重写”不靠谱的步骤,最后用模型自己当裁判打分筛选。在数学题集 GSM8K 上,LLaDA-8B-Instruct 的准确率从 67.58% 拉到了 85.30%。最直接的好处是省...

推荐理由:这篇 ICML 论文给扩散语言模型做 test-time scaling,核心卖点是不靠堆算力硬拉分。PRISM 在 LLaDA-8B-Instruct 上把 GSM8K 正确率从 67.58% 提到 85.30%,靠的是三层搜索、局部 remasking 和自验证,把复杂度从 O(NT) 压到接近 O(N+KT)。我会先打个折:这只是单模型单数据集的实验,正文没披露在其他 benchmark 或更大模型上的表现,泛化性还不好说。但思路本身对做推理优化的人有参考价值,尤其适合预算有限又想压榨小模型推理能力的场景。