跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 281–300 条 · 共 585 条

6月10日星期三

AI HOT 精选

Anthropic 发布 Claude Fable 5,在高风险领域会自动降级到旧模型

Claude Fable 5 是 Anthropic 目前最强的模型,在编程、知识问答、科研和视觉测试里几乎全面领先,任务越复杂优势越大。但它在网络安全、生物化学和模型蒸馏这些敏感领域做了限制:一旦触及,会自动切回能力更保守的 Opus 4.8,平均每 20 次对话触发一次。另外,Anthropic 把完全版 Mythos 5 开放给了少数可信的网络安...

推荐理由:Anthropic 发新模型,重要性本来就在 85–94 这个区间。HKR 三项全过:安全降级这个钩子够特别,降级对象和触发频率都写清楚了,而且 Claude 用户群对“能力强但可能被安全机制打断”这事很敏感。唯一扣分点是来源只有 X,信息不够硬,所以没给到最高档。

AI HOT 精选

上手 Claude Fable:Anthropic 的新模型让 AI 自己干活儿了

Ethan Mollick 提前试用了 Anthropic 的 Mythos 级模型 Claude 5 Fable。他的结论是,这模型比他用过的所有公开模型都强出一大截,而且人和 AI 的关系可能要变了。Fable 能自己连续跑十几个小时,执行好几页纸的指令。Mollick 让它从零做一个等时线地图,模型自己派了一堆子 AI 去查了 2200 多个航班...

推荐理由:Ethan Mollick 提前摸了 Claude Fable,说它比所有公开模型都强一截,能自己连续跑十几个小时、执行好几页纸的指令,甚至自己派子 AI 去查 2200 多个航班做地图。听着像模型能当项目经理使了,但正文没披露参数量、跑分、成本和什么时候能用,这点先别太激动。H 和 R 分高是因为新模型名加推理/代码定位确实抓眼球,K 分低是因为除了一个用例,关键信息全是缺口。Anthropic 光环有加成,但缺价格和基准测试,所以没到必写级别。

AI HOT 精选

Claude Fable 5 和 Mythos 5 发布:编程最强、能打游戏,但安全限制会误拦 5% 的对话

Anthropic 发了两个新模型:Claude Fable 5 和 Claude Mythos 5。Fable 5 是面向普通用户的安全版,Mythos 5 是给网络安全防御方用的无限制版,目前只通过美国政府合作项目开放。Fable 5 在软件工程、知识工作和视觉任务上都是新标杆——Stripe 测试时,它一天干完了原本一个团队两个月的代码迁移活;在...

推荐理由:Anthropic 一次发了两个模型,Fable 5 是普通用户能用的安全版,Mythos 5 是给网络安全防御方用的无限制版,目前只走美国政府合作渠道。Fable 5 在软件工程、知识工作和视觉任务上都刷了新纪录——Stripe 拿它做代码迁移,一天干完原本一个团队两个月的活。药物设计速度也快了 10 倍,这个数字挺夸张,但正文没披露具体测试条件和对比基线,先打个折看。定价方面,Fable 5 每百万 token 输入 10 美元、输出 50 美元,比前代贵了不少,得算算性价比。整体看,这是一次 Claude 主线模型的实质性更新,有定价、有基准...

Hacker News 首页

Claude Fable 5 与 Mythos 5 系统卡:一个模型,两套安全锁

Anthropic 发了份 319 页的系统卡,讲的是同一个新模型拆成了两个版本:Fable 5 给大众用,但加了安全锁,不让它在生物、网安这类高危领域干活;Mythos 5 则把相关限制解开了,只开放给 Project Glasswing 等少数受信合作伙伴。先说能力,Mythos 5 是他们训过最强的模型,在漏洞开发这类网安测试里把 Opus 4....

推荐理由:Anthropic 在同一天发了 Claude 5 的两个版本和配套系统卡,Mythos 5 自称最强、但只给受信伙伴用,Fable 5 则在高危领域加了限制。这种能力分级和透明披露的做法,对关注模型安全与能力边界的从业者来说是个重要信号。放在 85–94 这个区间没问题,因为信息够新、够具体,而且直接关系到 Claude 用户和开发者的实际使用。

6月9日星期二

AI HOT 精选

Anthropic 发了个 Swift 包,三行代码就能在苹果 App 里调用 Claude

Anthropic 给苹果开发者送了个新工具:一个 Swift 包,让 Claude 直接接入苹果的 Foundation Models 框架。开发者写三行代码就能调用,返回的是 Swift 原生类型,不用自己解析 JSON。支持多步推理、代码生成、联网搜索和数据分析,跑在 iOS 27、macOS 27 这些新系统上。说白了,就是苹果在自己的 AI ...

推荐理由:HKR 三项都成立:Anthropic 确实发了一个让 Claude 接入苹果 Foundation Models 框架的 Swift 包,但这是开发者工具层面的集成,不是新模型发布,所以放在 featured 档里偏高的 82 分。正文没提这个包是否开源、有没有延迟或成本数据,我会先打个折,别把它当成 Claude 在苹果端全面铺开的信号。

AI HOT 精选

OpenAI 秘密提交 IPO 申请,跟 Anthropic 抢资本跑道;Altman 说 2028 年 3 月前 AI 会扛起大部分研究工作

OpenAI 已经向 SEC 秘密交了 S-1 表格,正式启动上市审查。秘密提交的好处是收入、亏损、客户名单这些敏感数字暂时不用公开。Anthropic 上周也走了同样的流程,两家从拼模型直接升级成拼融资,抢的是下一代 AI 基础设施的钱。Sam Altman 在博客里放了个时间点:到 2028 年 3 月,OpenAI 大部分研究工作会由 AI 自己...

推荐理由:两家最受关注的 AI 公司几乎同时启动上市流程,从拼模型直接升级成拼融资,这个节点本身就值得从业者关注。Altman 给出的 2028 年研究自动化时间表是个很具体的判断,不管最后能不能兑现,都会影响行业对人才和资金配置的预期。信息源只有一条 X 上的帖子,没看到 S-1 原文或更多财务细节,所以先打 90 分,等正式招股书出来再往上调。

AI HOT 精选

Sam Altman 说 OpenAI 计划到 2028 年让 AI 自己搞大部分研究

Sam Altman 在一篇博客里列出了三个目标:先造出能自动做研究的 AI 研究员,再用它去加速科学和产品开发,最后给每个人配一个个人 AGI,帮你处理工作、学习、写代码、做生意、健康文书和日常决策。时间节点定在 2028 年 3 月,但正文没披露具体怎么验证这些目标是否达成,也没说成本、安全措施或失败预案。

推荐理由:HKR三项都踩中了:OpenAI给AGI研究路线图贴了个2028年3月的标签,还列了三个目标。我会先打个折,因为原文只是一篇博客摘要,不是正式产品发布或带技术细节的长文,所以没给P1。正文没披露怎么验证目标是否达成,也没提成本、安全措施或失败预案,这点先别太激动。

AI HOT 精选

NotebookLM 升级:对话里能直接干活,推理更强,但新格式和价格都没说

Google 给 AI Ultra 订阅用户推了个 NotebookLM 大更新。现在你在对话里就能让它执行多步骤任务,不用自己来回倒腾,相当于把 agent 塞进了聊天窗口。推理能力也升了级,处理复杂研究问题会更顺。官方说新增了一批输出格式,但正文没列具体是哪些,也没提价格会不会变、什么时候推给普通用户。我会先打个折:功能听着实用,但信息缺口不小,别...

推荐理由:HKR 三项都踩中:Google 确认 NotebookLM 给 AI Ultra 用户加了 in-chat agent、高级推理和多输出格式。但正文没列出具体格式、没提价格变动、也没说普通用户什么时候能用,信息缺口不小,所以停在中等权重的产品更新档位。

6月8日星期一

AI HOT 精选

微软AI负责人说超级智能快来了,但不会抢你饭碗

Mustafa Suleyman 在播客里聊了几个事。他判断超级智能不会造成大规模失业,但没给出具体论证。微软去年10月跟 OpenAI 签了新合同,一边继续合作,一边拿到了独立研发超级智能的许可,已经建了团队、在训前沿模型,本周 Build 大会还发了7个全模态模型。他点名批评 Anthropic 把 Claude 说成有意识,认为现在消费者对 AI...

推荐理由:Mustafa Suleyman 在播客里抛了个大判断——超级智能不会造成大规模失业,但正文没给出具体论证,这点先别太激动。信息量主要靠两个事实撑着:一是微软去年10月跟OpenAI签的新合同,既续了合作又拿到了独立研发超级智能的许可,团队和前沿模型训练都已经在跑了;二是本周Build大会发了7个全模态模型。他还点名批评Anthropic把Claude说成有意识,认为现在消费者对AI的理解还太浅。整体是CEO访谈,不是产品发布,所以分数卡在78-84这个区间。

AI HOT 精选

五个模型经济体里,价格崩盘消失了:控制与涌现

这篇博客因为 Hugging Face 返回了 429 错误(请求太频繁),正文内容没抓到。从标题和摘要看,实验用 OpenAI、NVIDIA、OpenBMB 的模型和一个自己微调的 5 亿参数模型来驱动市场里的交易代理。他们试了三种干预手段都没能重现价格崩盘,最后是靠结算时强行改写价格才把崩盘做出来。我会先打个折:具体怎么干预、崩盘长什么样、数据量多...

推荐理由:我会先打个折:正文因为 Hugging Face 限流没抓到,具体干预怎么设计、崩盘长什么样、数据量多大都只能靠标题和摘要猜。但就现有信息看,五个模型经济体里崩盘凭空消失、只能靠结算作弊做出来,这个发现对代理可靠性和模拟真实性都是实打实的质疑。信息缺口明显,但角度够刁,值得推给从业者看一眼。

机器之心 · 公众号

openJiuwen 搞了个叫 MANGO 的多智能体流网络,让一群模型自己学会怎么组队干活

openJiuwen 提出了 MANGO,一个多智能体流网络框架。它把强化学习、文本梯度(用自然语言反馈来调模型)和 Skip-k 机制(跳过不靠谱的中间步骤)揉在一起,让一群模型自己学会怎么组队、怎么分工。用 GPT-4o-mini 跑分,在 MATH500 数学题上比 MaAS 准确率高了 12.8 个百分点,在 DROP 阅读理解上比 AFlow...

推荐理由:我会先打个折:这还是个研究框架,不是大模型或平台级发布,所以别当重磅炸弹看。但 HKR 里 K 最扎实,机制和数字都给出来了,MATH500 上 +12.8% 的差距不算小。H 和 R 靠“流网络”这个角度撑住,对搞多智能体协作的人有参考价值。正文没提开源代码链接,这点先别太激动。

机器之心 · 公众号

阿里 RTPurboV2:用几百步训练把注意力计算砍掉九成,原生 Transformer 又硬气了一回

阿里 RTP 团队发了 RTPurboV2,思路很直接:把模型里 85% 的注意力头换成滑动窗口注意力(SWA),剩下 15% 负责长距离检索的头用低秩投影、聚类和动态 top-p 压缩。适配训练只要大概 600 步、约 100 万条标注 token,Prefill 阶段推理加速最高到 9.36 倍。不过正文因为环境验证失败没抓到具体实验细节和模型规模...

推荐理由:阿里 RTP 团队这篇 RTPurboV2 思路很直白:把模型里大部分注意力头换成便宜的滑动窗口,只留一小撮头用低秩投影和聚类做长距离检索,训练成本压到 600 步、100 万条 token,Prefill 加速最高能到 9.36 倍。这个数字我会先打个折,因为正文自己说环境验证失败没抓到实验细节和模型规模,所以加速比在什么尺寸、什么长度下测的还不清楚。但思路本身对做长上下文部署的人有参考价值,属于工程信号强但缺完整验证的那种。

AI HOT 精选

OpenAI 公布第三阶段计划:2028 年让 AI 接手大部分研究,并给每人配一个个人 AGI

Sam Altman 和 Jakub Pachocki 在 6 月 8 日发文,把 OpenAI 的路线图摊开了讲。公司内部判断,到 2028 年 3 月,AI 系统可能承担他们研究工作里“相当大一部分”,所以第一个目标是造一个能自动做 AI 研究的系统,帮研究员更快地测试想法、找错和迭代。第二个目标是加速经济增长,同时把收益分出去。第三个目标最直接:...

推荐理由:Sam Altman 和 Jakub Pachocki 这次没画大饼,而是给了个带时间点的内部判断:到 2028 年 3 月,AI 可能接手 OpenAI 研究工作的相当一部分。我会先打个折,这种预测本身就有自我实现的成分,但把它写进公开路线图,说明内部对研究自动化的信心已经很高了。文章把目标拆成三个:造自动做研究的系统、加速经济并把收益分出去、以及最直接的安全对齐。信息量够,时间点具体,对从业者来说既是信号也是压力,值得马上写。

6月7日星期日

AI HOT 精选

Harness-1:一个用强化学习练出来的200亿参数检索子智能体,能记住搜索状态

UIUC 和 Chroma 发布了一个叫 Harness-1 的检索子智能体,参数量 200 亿,基于 gpt-oss-20b 训练。它被放在一个“有状态搜索框架”里用强化学习训练,简单说就是模型在搜索时能记住上一步干了什么,再决定下一步怎么查,而不是每次都从头瞎找。在 8 个基准测试上,它的平均整理召回率是 0.730,比目前最好的开源子智能体高出 ...

推荐理由:HKR三项都站得住:Harness-1把强化学习和有状态搜索结合,机制讲得明白,基准测试结果也给了具体数字。分数定在78-84区间,因为它是个子智能体的研究发布,不是大厂主力模型,但开源圈确实需要这种能打的检索方案。

机器之心 · 公众号

ICML 2026 中稿的 FusionRoute:让多个模型在生成每个词时自己选最合适的专家,还能自我纠错

这篇 ICML 2026 的论文提出了一种叫 FusionRoute 的多模型协作方法。它不直接合并模型,而是冻结住几个专家模型不动,只训练一个轻量的路由器。这个路由器会在生成文本的每一个 token(词或子词)时,实时挑选一个最合适的专家模型来输出,同时把路由器的判断分数和专家模型的输出分数揉在一起,让最终选择更准。论文在 GSM8K、MATH-50...

推荐理由:这篇 ICML 2026 的 FusionRoute 论文,核心是让几个冻住的专家模型在生成每个 token 时都能被一个轻量路由器实时挑选,还加了自我修正来纠错。思路确实有意思,但文章没给出具体的性能提升数字、代码链接和实际部署成本,所以我会先打个折,放在 featured 里偏低的档位。

机器之心 · 公众号

AI 真能学会心算?隐式思维链首次得到理论证明,Stuart Russell 参与

UC Berkeley 和普林斯顿的研究者给“隐式思维链”找了理论依据。他们提出 Log-ICoT 方法,用 k 奇偶校验任务做实验:当 k=16 时,训练阶段从传统方法的 15 步砍到 4 步。论文证明,在简化假设下,一个 L 层的 Transformer 可以通过 log₂k 个课程阶段把推理步骤内化到模型里,不用再像显式思维链那样一步步往外蹦字。...

推荐理由:这篇论文给“隐式思维链”找了理论依据,不是光靠实验撞大运。我会先打个折:目前只在k奇偶校验这种玩具任务上验证,正文没披露真实NLP任务上的表现,所以实际能省多少算力还不好说。但亮点在于,他们用log₂k个课程阶段就让Transformer把推理步骤内化进模型,k=16时训练步数从15砍到4,这个压缩比挺直观。Stuart Russell参与也增加了可信度。对做推理优化的人,这是个值得跟的理论方向,只是别急着往生产里搬。

量子位 · 公众号

快手可灵提出 VLM-as-Teacher:生成视频时让视觉模型当老师,在线微调 LoRA 来遵守文字规则

这篇文章的正文被微信环境异常页挡住了,看不到具体技术细节。从标题和现有摘要看,快手可灵和城大合作了一个叫 VLM-as-Teacher 的方法。思路是在测试阶段用视觉语言模型(VLM)给视频生成模型(VGM)的 LoRA 模块打分反馈,边生成边优化,让模型学会按文字规则推理。他们搞了个 VBVR-Bench 基准,分数从 0.666 提到了 0.781...

推荐理由:正文被微信环境异常页挡住了,看不到技术细节,这点先打个折。但从标题和摘要看,快手可灵和城大搞的 VLM-as-Teacher,思路是在测试阶段让视觉语言模型给视频生成模型的 LoRA 打分,边跑边调,让模型学会按文字规则推理。VBVR-Bench 上分数从 0.666 提到 0.781,说明规则遵循能力有明显提升。方法本身有巧思,不是换模型架构,而是在推理时加一层在线优化,对可控视频生成是个实用方向。信息缺口在于没看到具体实现和消融实验,等正文能看了再补判断。

6月6日星期六

机器之心 · 公众号

普林斯顿用 DeepSeek V4 做数学证明,成本只要别人的五百分之一

普林斯顿的研究员搞了一套叫 Goedel-Architect 的智能体系统,专门让模型在 Lean 这种形式化证明语言里自动做数学题。他们拿 DeepSeek-V4-Flash 跑 PutnamBench 数学竞赛题,672 道题里正确率到了 75.6%,API 调用费总共才花了 294 美元。对比之前 Hilbert 系统用别的模型达到 70.0% ...

推荐理由:普林斯顿团队搞了个叫Goedel-Architect的智能体系统,让DeepSeek-V4-Flash在形式化证明语言Lean里自动做数学题。PutnamBench 672道题正确率75.6%,API调用费总共294美元,对比之前Hilbert系统用别的模型达到70.0%却花了约17万美元,成本差了近500倍。这个对比很直观,数字也扎实,但正文没详细拆解294美元是怎么算出来的,也没说Hilbert那17万是不是包含了大量试错和人工调参。所以“500倍”这个说法可以先打个折看,不过即使有水分,成本优势依然明显。整体还是偏学术研究,离工程落地有距离,...

AI HOT 精选

谷歌给企业级 Gemini 搭了个“多代理协作”的外挂资料库框架,查事实类问题准确率最高提升 34%

谷歌研究院和谷歌云一起搞了个叫“跨语料库检索”的框架,用在 Gemini 企业智能体平台上,本质是让多个 AI 代理分工合作:一个负责理解问题并拆解计划,一个负责改写查询词,一个负责把问题路由到最合适的数据库,还有一个反复去搜、去验证。这套流程比传统 RAG(给模型外挂资料库直接查)在事实类数据集上准确率最多高出 34%。文章没细说测试用的具体数据集规...

推荐理由:谷歌把 RAG 拆成多个代理分工干活,在事实类数据集上准确率最多高出 34%,这个数字挺抓人。不过文章没披露测试用的具体数据集规模和难度,所以这个 34% 的含金量得打个折看。另外,框架绑在 Gemini 企业平台上,有给自家云服务带货的味道,所以分数没给到纯研究框架那档。

r/LocalLLaMA

在笔记本 RTX 4060 8GB 上跑 Qwen3.6-35B-A3B 的实测:一个参数改动让速度从 11 跳到 43 tok/s,投机解码再提 26%

一位 Reddit 用户在自己的笔记本(RTX 4060 8GB 显存)上跑了 Qwen3.6-35B-A3B 这个混合专家模型。他试下来发现,加上 --no-mmap 这个启动参数后,生成速度直接从大约 11 tok/s 飙到 43 tok/s,翻了近四倍。另外他还用了一个叫投机解码的技巧,拿更小的 Qwen3.5-0.8B 当“草稿模型”先快速出初...

推荐理由:HKR 三项都站得住:笔记本跑 35B 模型是个很直观的 hook,速度提升的数字是硬干货,而且本地部署圈对这类省钱省显存的技巧天然有共鸣。信息来源是 Reddit 单帖,不是正式评测,所以分数没往上拉。