跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 521–540 条 · 共 585 条

4月16日星期四

最佳拍档

Demis Hassabis 罕见袒露心声:AGI 应在实验室多沉淀十年,后 AGI 时代五十年内或成真

DeepMind CEO Demis Hassabis 在这场访谈里没怎么画饼,反而直说现在的 AI 发展节奏被商业和地缘政治推得太快,不是他理想的路子。他个人的想法是,把 AGI 相关技术在实验室里像欧洲核子研究中心那样再打磨十到二十年,每一步都彻底搞懂再往前走。他举了 AlphaFold 的例子,当初团队本打算按传统方式搭服务器让科学家排队提交任务...

推荐理由:这篇是访谈的二次整理,不是模型发布或政策文件,所以分数没拉满。但 Demis 的时间线判断、实验室沉淀主张、300 万用户和近 20 条药物管线的数据,以及他点名 2 到 4 年内的两类风险,信息密度够高,对从业者判断行业节奏和安全优先级有参考价值。

4月15日星期三

X · @AnthropicAI

Anthropic 用 Claude Opus 4.6 当自动化对齐研究员,测试弱模型能不能管住强模型

Anthropic 的研究员搞了个实验,让 Claude Opus 4.6 去加速解决一个核心对齐难题:怎么用弱 AI 模型来监督训练更强的模型。这相当于让一个水平一般的老师去教一个更聪明的学生,看能不能教好。正文没披露实验的具体设置、对比基准、评估指标和结果,所以效果到底怎么样还不清楚。关键信号是 Anthropic 开始把前沿模型直接当成自动化对齐...

推荐理由:Anthropic 自己人发的实验预告,角度新——用现有前沿模型去加速'弱模型监督强模型'这类对齐研究。我会先打个折:没给实验设置、基线、指标和结果,现在只能当方向信号看。但这件事本身值得关注,因为它在验证一个闭环——让模型自己参与怎么把模型训得更安全。

4月12日星期日

最佳拍档

DeepMind 用在线学习加主动探索,把 RLHF 的数据效率提升了 10 倍

Google DeepMind 团队在 Gemma 9B 上做了一组实验,证明 RLHF 数据效率低不是算法本身不行,而是用法错了。他们对比了四种算法:离线 RLHF 需要约 20 万条偏好标注才能达到 55% 左右的胜率;而他们提出的在线 RLHF 加上信息导向探索,不到 2 万条标注就做到了同样的水平,数据效率提升超过 10 倍。信息导向探索的核心...

推荐理由:我会先打个折:反馈是用 Gemini 1.5 Pro 模拟的,不是真人标的,1000倍增益也只是在不超过100万条标注区间外推出来的。但方法论值得看——在线 RLHF 加信息导向探索,让模型自己挑该问什么,把标注预算花在刀刃上。这点先别太激动,但如果是真的挺省钱。

4月11日星期六

量子位 · 公众号

刘壮陈丹琦团队开源Vero:一个通用视觉推理强化学习框架,没用到任何思考数据就刷新了SOTA

普林斯顿刘壮和陈丹琦团队开源了Vero,一个用强化学习训练视觉推理模型的通用框架。它从59个数据集里筛出60万条样本,按六类任务分别给奖励,单阶段RL训练后,在30个基准里有23个超过了Qwen3-VL-8B-Thinking。最值得看的是它没用到任何私有的思考数据,纯靠任务路由奖励机制让模型学会推理。不过正文没披露训练成本和基座模型的具体配置,这点先...

推荐理由:我会先打个折:正文没披露训练成本和基座模型配置,复现条件还不清楚。但“零思考数据”这个说法本身就有冲击力,加上23/30的基准成绩和明确的方法细节,对从业者来说是个值得关注的开源信号。所以给featured、82分,不往上拉是因为关键复现信息还缺着。

4月10日星期五

X · @claudeai

Claude 平台上线“顾问策略”:用 Opus 当军师,Sonnet 或 Haiku 当执行者

Claude 平台把 Opus 模型设为“顾问”,让更便宜的 Sonnet 或 Haiku 去执行具体任务。官方说法是,这样能让 agent 的智能水平接近 Opus,但成本低很多。正文没给出具体价格对比、跑分数据或上线时间,所以实际省多少、效果打多少折,还得等实测再看。

推荐理由:Anthropic 给 Claude Platform 加了个 advisor 模式,让 Opus 出主意、Sonnet 或 Haiku 干活,说这样能让 agent 接近 Opus 的水平还更省钱。我会先打个折——正文没给价格、没给基准分数、也没说什么时候上线,所以省多少、强多少现在全是问号。但思路本身对做 agent 的人很有用,值得放出来让大家盯着后续。

4月9日星期四

X · @op7418(歸藏)

小扎挖的团队交卷了:Meta 发 Muse Spark,多模态推理但暂不开源

Meta 把之前挖来的团队做的第一个模型 Muse Spark 放出来了。它原生支持多模态推理,能看图、用工具、展示视觉思维链,还能让多个 Agent 并行干活。有个叫“沉思”的模式,就是协调多个 Agent 一起推理。在 Artificial Analysis 上的跑分比 Gemini 3.1 Pro、GPT-5.4 和 Claude Opus 4....

推荐理由:大厂新模型发布,加上“挖角团队首秀”的故事线,HKR 三项全中。分数卡在 featured 门槛附近,因为文章只给了能力声明和相对排名,参数规模、定价、铺开时间和访问范围都没披露,我会先打个折。

4月4日星期六

Latent Space

Marc Andreessen 反思浏览器之死、Pi/OpenClaw 架构,以及为什么“这次不一样”

Marc Andreessen 在播客里聊了 76 分钟,核心观点是这波 AI 跟 2016 年那波不一样,因为现在有了推理、写代码、让模型进业务流程干活(agent)和模型自己改进自己的能力。他提了一个很具体的架构思路:Pi 和 OpenClaw 把大模型、命令行、文件系统、markdown 和定时任务串在一起,让 agent 的状态直接存成文件,这...

推荐理由:这是一篇观点驱动的评论,不是市场事件。我会先打个折:正文没给浏览器消亡的时间表或产品路线,所以别当预言看。真正有料的地方是他把 agent 的文件状态和可移植性类比 Unix,而不是再念一遍 scaling law 的经。HKR-H 来自标题的钩子效应,HKR-K 来自 Pi+OpenClaw 这套可复现的机制,HKR-R 来自界面与分发这个敏感话题;缺路线图、缺指标、缺发布细节,所以放在 featured 的低位。

3月31日星期二

MIT Technology Review · AI

AI 健康工具越来越多,但没人说得清它们到底靠不靠谱

微软上线了 Copilot Health,亚马逊把 Health AI 从 One Medical 会员专属开放给所有人,加上年初 OpenAI 的 ChatGPT Health 和能调取健康档案的 Claude,面向普通人的 AI 健康问答成了大厂标配。微软说 Copilot 每天收到 5000 万个健康问题,需求确实摆在那里,尤其对看病不方便的人群...

推荐理由:这篇文章不是产品发布,而是趋势报道加安全质疑。我会先打个折:微软和 Amazon 都在推消费级健康聊天机器人,但正文没披露任何独立安全评测,六位受访学者也点出这个问题。Mount Sinai 的研究是全文最硬的信息——ChatGPT Health 会误判轻重,说明光靠公司自测基准不够。这点先别太激动,因为研究样本和具体方法正文没展开,但方向值得盯。整体看,信息量够、风险点明确,适合放进 featured。

3月20日星期五

MIT Technology Review · AI

OpenAI 要造一个全自动 AI 研究员,先别急着喊“科学家要失业”

OpenAI 把“造一个全自动 AI 研究员”定成了接下来几年的北极星目标。首席科学家 Jakub Pachocki 跟 MIT Technology Review 聊了分两步走的计划:今年 9 月先搞一个“AI 研究实习生”,能独立啃一小批特定研究问题;2028 年再上完整的多智能体自动化系统。但正文没披露这个系统要怎么评估产出靠不靠谱、打算烧多少算...

推荐理由:HKR-H 落在“全自动研究员”这个具体到能让人立刻理解野心的钩子上,HKR-K 靠两个可验证的时间节点撑住信息量,HKR-R 则抓住了研究岗位替代和实验室军备竞赛这两条从业者最关心的线。没给 must-write 是因为正文没披露评测标准、算力预算和研究范围,目前只能算一个强路线信号,离可验证产出还有距离。

MIT Technology Review · AI

OpenAI 把全自动 AI 研究员定为未来几年的北极星,计划 9 月先上线一个能独立解决少量问题的实习研究员

OpenAI 首席科学家 Jakub Pachocki 说,公司正把所有资源押注在一个叫“全自动 AI 研究员”的目标上。这个系统不是单一模型,而是一套让多个 AI 智能体协作干活(multi-agent)的流程,能自己跑去啃又大又复杂的问题,比如数学猜想、生物化学实验设计,甚至商业和政策难题。他们给了个时间表:今年 9 月先做出一个“AI 研究实习生...

推荐理由:这篇是战略路线图报道,不是已发布产品,所以没给 p1。亮点在于 OpenAI 首次把“全自动研究员”拆成实习生版和多 Agent 版两步走,时间节点清楚,但正文没写成本、算力需求和怎么评判好坏,这些才是落地关键。我会先打个折,等看到能跑多久、任务拆得怎么样再调整判断。

3月17日星期二

Mistral AI

Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

Mistral AI 发布 Mistral Small 4,这是首个把 Magistral 推理、Pixtral 多模态和 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。

推荐理由:Mistral Small 4 把推理、多模态与编码智能体合并进单一开源模型,可据此判断统一模型对部署成本的影响。

3月13日星期五

MIT Technology Review · AI

五角大楼官员透露如何用 AI 聊天机器人排打击优先级,同时点名 Claude 会“污染”国防供应链

美国国防部一位官员说,军方可以把目标清单喂给一个在保密环境里跑的生成式 AI 系统,让它分析并排出先打哪个。人负责最后检查和拍板。OpenAI 的 ChatGPT 和 xAI 的 Grok 都可能被塞进这种高风险决策流程里。另一边,五角大楼 CTO 公开说 Claude 模型内置了某种“政策偏好”,会污染国防供应链,但正文没披露具体是哪个模型版本、什么...

推荐理由:我会先打个折:正文没披露具体模型、部署时间和可审计的约束机制,所以只能停在低 featured 档。但这条消息把生成式 AI 塞进高风险决策链的事实摆出来了,而且五角大楼 CTO 对 Claude 的排斥理由本身就是一个安全对齐话题的活案例。对想看 AI 怎么被实际用于军事、以及模型价值观怎么影响采购的人来说,这两点都值得盯。

3月12日星期四

NVIDIA 博客

英伟达开源 Nemotron 3 Super:120B 模型只激活 12B 参数,跑 agent 任务吞吐量翻五倍

英伟达发了 Nemotron 3 Super,一个总参数量 120B、但每次推理只激活 12B 参数的混合专家模型。它用了混合 MoE、隐式 MoE 和一次预测多个 token 的技术,上下文窗口拉到 100 万 token。官方说在跑 agent 这类多步骤任务时,吞吐量比之前方案高 5 倍;如果搭配 Blackwell 的 NVFP4 精度,推理速...

推荐理由:这是一条扎实的模型发布消息,H、K、R 三点都踩中了。H 靠 5 倍吞吐这个具体承诺抓眼球;K 把参数量、激活量、上下文长度、训练规模和硬件对比都列清楚了,信息密度高;R 在于开放权重和配方,不是只给个模型让你猜。没给更高分是因为关键性能数据都来自 NVIDIA 自家博客,还没看到第三方验证,这点先别太激动。

3月10日星期二

OpenAI News

ChatGPT 上线数学和科学互动图解,覆盖 70 多个核心概念

OpenAI 给 ChatGPT 加了一个学习功能:问勾股定理、理想气体方程这类问题时,它会直接弹出一个可拖拽的图表模块。你可以手动调参数、改公式,图表会跟着实时变,把抽象公式变成能上手试的东西。首批覆盖 70 多个数学和科学概念,所有付费和免费用户都能用。官方说每周有 1.4 亿人用 ChatGPT 学数学和科学,但正文没披露这个互动功能背后的模型、...

推荐理由:我会先打个折:这是个中等体量的产品更新,不是模型能力突破。钩子在于把抽象概念变成能动手玩的画面,对教学场景有直接吸引力。1.4 亿周活和 70+ 概念是实打实的数字,说明铺量已经很大。但正文完全没提模型怎么支撑这些交互、有没有做过学习效果验证,这点先别太激动。整体判断是产品化动作值得关注,技术深度和效果证据还缺位。

3月5日星期四

OpenAI News

OpenAI 发现推理模型很难按指令控制自己的思考过程,但这反而是个安全上的好消息

OpenAI 发了篇论文,核心结论是:现在最强的推理模型,都没法很好地控制自己的“思考草稿”(思维链)。他们搞了个叫 CoT-Control 的测试,用 13000 多个任务去要求模型在思考时遵守特定规则,比如全程用小写字母、避开某个关键词。结果所有被测模型的遵守率最高只有 15.4%,最低的甚至只有 0.1%。模型经常在草稿里自己都意识到“坏了,我刚...

推荐理由:OpenAI 用一篇文章标题说推理模型很难控制自己的 chain of thought,而且把这当成一件好事。这个说法挺反常识的——通常我们会觉得模型思考过程不可控是个安全隐患,但他们反过来认为这有利于安全。目前只有标题,正文没放出来,所以看不到具体实验、数字或者机制解释。我会先打个折:判断只能基于标题本身,别急着下结论说他们找到了什么新方法。对做推理模型安全和可解释性的人来说,这个观点值得追一下原文,但信息缺口还很大。

OpenAI News

OpenAI 发布 GPT-5.4 Thinking 系统卡,首次给通用推理模型加了高级网络安全防护

OpenAI 在 2026 年 3 月 5 日公开了 GPT-5.4 Thinking 的系统卡。这是 GPT-5 系列最新的推理模型,也是第一个把“高级网络安全能力”的防护措施做进通用模型里的产品。它的安全方案跟之前的 GPT-5 系列差不多,但这次把给 GPT-5.3 Codex(代码模型)用的那套网络安全防护搬到了 ChatGPT 和 API 里...

推荐理由:这篇系统卡信息量不大,没给具体分数、缓解细节和部署条件,我会先打个折。但它真正值得盯的是风险门槛的变化——OpenAI 把“高能力网络安全”缓解从专用模型扩到了通用推理模型,这是一个信号。标题里的“首个”不是公关话术,而是安全策略在升级。正文没披露评测数据,所以别指望从这里看到性能对比,重点看安全边界怎么划。

OpenAI News

OpenAI 把 ChatGPT 塞进 Excel 了,还接上了 Moody's、Factiva 等金融数据源

OpenAI 在 2026 年 3 月 5 日发布了 ChatGPT for Excel 的测试版,相当于在 Excel 里直接装了一个 GPT-5.4 助手。你可以用大白话让它帮你搭财务模型、跑情景分析、查公式错误,它改表之前会先问你,改完还能告诉你改了哪个格子、为什么。OpenAI 自己跑了一遍投行工作流测试,GPT-5 的正确率是 43.7%,换...

推荐理由:OpenAI 把 ChatGPT 塞进 Excel 测试版,不只是加个聊天框,而是让模型能直接在单元格里建模、追溯改动,还接入了 Moody's、道琼斯 Factiva、MSCI 等金融数据源。内部投行场景的基准分从 43.7% 跳到 87.3%,幅度很大,但这是内部测试,实际表现得等用户上手再看。企业版和教育版默认关闭,说明对合规和隐私留了后路。FactSet 标注“即将上线”,数据生态还在铺。整体看,这是 OpenAI 在抢专业工作流入口的一次重注,比单纯发个模型更有战略意味。

3月3日星期二

OpenAI News

GPT-5.3 Instant 发布:少说废话、少拒绝,日常对话更干脆

OpenAI 在 2026 年 3 月 3 日更新了 ChatGPT 里用得最多的模型,叫 GPT-5.3 Instant。这次改动主要冲着日常对话体验去的:模型不再动不动就拒绝回答,也不会在回答前先啰嗦一堆免责声明。文章给了一个具体对比——问远程射箭弹道计算,旧版 GPT-5.2 Instant 直接拒绝,说这能提高武器效能所以不能帮;新版 GPT-...

推荐理由:OpenAI 更新了 ChatGPT 最常用的日常模型,这篇帖子靠一个具体的 5.2 vs 5.3 行为对比把安全边界的变化讲清楚了,所以 HKR 三项都站得住。我会先打个折:正文没给系统卡、基准分、API 价格,信息缺口明显,所以重要性停在 84 不进 85。

2月27日星期五

MIT Technology Review · AI

AI 正在改写世界顶级围棋手的思考方式

AlphaGo 击败李世石十年后,AI 已经成为韩国职业围棋训练的标配,不用 AI 基本没法打职业。文章给了两个数:世界第一的申真谞落子与 AI 建议的重合率是 37.5%,而选手平均水平是 28.5%;另外 AlphaGo Zero 从零自学三天后,以 100 比 0 碾压了战胜李世石的那版 AlphaGo。现在棋手普遍用 KataGo 练棋,开局前...

推荐理由:这篇不是新模型发布或产品动作,而是一篇有数据的观察评论。我会先打个折:它没有给出可复现的方法或工程细节,但把 AI 如何渗入职业围棋训练这件事讲得很具体。申真谞 37.5% 的一致率比全体均值高出 9 个百分点,说明顶尖棋手更依赖 AI 选点;AlphaGo Zero 三天 100 比 0 的结果则把自我对弈的效率差距摆了出来。正文提到棋手常用 KataGo 且前 50 手常与 AI 建议一致,但又说他们仍难解释 AI 为什么这么下——这个信息缺口反而让判断更扎实,没有硬补因果。对从业者来说,这比泛泛谈“AI 改变行业”更有参考价值,所以放在 fe...

2月26日星期四

OpenAI News

OpenAI 与 PNNL 合作测试用 AI 帮联邦政府写环评报告,每小节能省 1 到 5 小时

OpenAI 跟美国能源部旗下的太平洋西北国家实验室(PNNL)合作,找了 19 位专家一起搞了个叫 DraftNEPABench 的测试集,专门看 AI 能不能帮忙起草联邦基建项目的环境评估文件。测试用的是 Codex CLI 这个命令行工具搭配 GPT-5,让模型去读几百页的技术报告、交叉核对资料,再按法规要求写出结构化的分析草稿。在覆盖 18 个...

推荐理由:HKR 三项都过了:联邦审批这个场景够意外;有 19 位专家、102 个任务和 1–5 小时的时间节省,信息量不空;争议点在于代理开始碰监管流程,但文章自己划了边界,说这只是起草辅助,不是自动决策。分数没往上拉,因为这只是个限定范围的基准测试,不是已经落地的产品能力。