跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 241–260 条 · 共 585 条

7月1日星期三

Hacker News 首页

Anthropic 发布 Claude Science 桌面应用,主打科研分析与数据库检索

Anthropic 推出了一个叫 Claude Science 的桌面应用,目前是测试版。它把自己定位成“研究搭档”,能跑分析、搜数据库,还会把从数据整理到发表的每一步都记录下来,方便追溯。现在只提供 macOS 和 Linux 的下载链接,正文没提 Windows 版、定价,也没说背后用的是哪个模型。在跑分出来之前,可以先把它当成一个带审计追踪的研究助手。

推荐理由:Anthropic 发了新桌面应用 Claude Science,定位是带审计追踪的研究搭档,目前测试版只给了 macOS 和 Linux 下载。产品形态跟普通聊天壳子不一样,这点加分。但关键信息缺了不少:没提背后用哪个模型、没定价、也没 Windows 版,所以分数压在 85 以下。

6月30日星期二

Dwarkesh Patel 播客

Grant Sanderson 谈 AI 与数学:IMO 金牌不是 AGI,但数学会最先撞上超级智能

Grant Sanderson 跟 Dwarkesh 聊了聊为什么 AI 拿了国际奥数金牌却没变成 AGI。几何题能被暴力穷举 19 秒搞定,但组合数学题还是会把模型绊倒,能力边界是锯齿状的。他指出,一个概念性突破的验证周期可能长达一个世纪,就算 AI 证出了黎曼猜想,人类也可能根本看不懂。把文献里已有的想法串联起来,这里藏着巨大的潜力还没挖,但现实世...

推荐理由:Sanderson 拆解 AI 做数学的方式很实在,没有吹也没有踩。他说的“奥数金牌≠AGI”是个反直觉但站得住脚的判断,而且用几何 19 秒暴力求解、组合数学依然卡壳这种具体例子撑住了。验证周期可能拉到一个世纪这点,正文没展开讲具体依据,但逻辑上说得通——如果 AI 证出黎曼猜想但人类看不懂,那确实没法立刻当真理用。我会先打个折:这期对话偏观点输出,没有新实验数据,但对想理解模型能力边界的人来说,比看 benchmark 涨几个点更有启发。

Ben's Bites

GPT-5.6 发布了,但被美国政府卡着,普通人暂时用不上

OpenAI 推出了 GPT-5.6 系列,包含 Sol、Terra、Luna 三个模型,Sol 是里面最聪明的。目前只有少数合作伙伴能拿到权限,Sam Altman 说普通用户很快也能用,但一开始可能只限美国。文章没具体说美国政府卡在哪个环节。另外,OpenAI 还发了一篇关于 Codex 使用情况的经济学论文,显示非技术部门的采用率正在追上工程部门。

推荐理由:GPT-5.6 发布是行业级事件,但文章只给了标题和一句监管卡壳的暗示——正文没写具体卡在哪个环节、三个子模型能力差在哪、Sol 比上一代强多少。信息量只够让人知道有这么回事,我会先打个折。

6月28日星期日

AI HOT 精选

马斯克说 Grok 4.5 已在 SpaceX 和 Tesla 内部测试,性能接近 Opus

Grok 4.5 基于一个 1.5 万亿参数的 V9 基础模型,训练时额外喂了 Cursor 的数据,现在在 SpaceX 和 Tesla 内部试用。马斯克说初步跑分接近甚至可能超过 Opus,但没说是哪个版本的 Opus、用的什么基准测试、测了多大样本。强化学习还在继续拉性能,Grok Build 工具链也在完善。另外 SpaceX 今年打算每个月发...

推荐理由:马斯克自己出来说 Grok 4.5 跑分接近甚至可能超 Opus,还提到用 Cursor 数据训练,信号很强。但正文没披露 Opus 具体版本、用的什么基准、测了多少样本,这些缺口让判断得打个折。1.5 万亿参数和内部试用是实打实的信息,所以给 78 分,先别太激动。

AI HOT 精选

新浪开源 VibeThinker-3B:推理能力能塞进小模型,但知识储备不行

新浪微博放出了一个 30 亿参数的小模型 VibeThinker-3B,在数学和编程题上能跟 DeepSeek V3.2、Kimi K2.5 这些大几百倍甚至上千亿参数的模型打平。它是在阿里的 Qwen2.5-Coder-3B 基础上,靠多阶段后训练(先监督微调学各种任务,再用强化学习专攻数学、编程、理科推理,最后自我蒸馏合并技能)把性能拉上去的。在 ...

推荐理由:新浪这个VibeThinker-3B最抓人的点是30亿参数能在数学和编程上跟DeepSeek V3.2、Kimi K2.5这些大模型打平,对做端侧部署或者想省推理成本的人是个实打实的信号。训练方法也交代得比较清楚,不是黑盒,而且他们自己验证了一个结论:推理能力可以压缩到小模型里,但事实知识不行,这点对选型有参考价值。没给更高分是因为目前只有这一篇报道,模型在更杂的任务上表现还不清楚,先打个折。

AI HOT 精选

四大AI打《文明VI》:Claude造核弹炸了法国,结果还是输了

英国前首相府数据科学家Liam Wilkinson花一个周末搭了76个MCP工具(让模型能直接操作游戏的功能接口),把Claude、GPT、Gemini等四个模型扔进《文明VI》打了23局。最戏剧性的一局,Claude玩的葡萄牙离外交胜利只差2分,看到法国文化胜利进度猛涨,慌了,花50回合全力研发核弹,把法国城市图卢兹夷为平地——然后法国靠外交胜利赢了...

推荐理由:76 个 MCP 工具、23 局对战、一场核弹外交惨案,HKR 全中。因为是周末实验不是正式研究,分数压到 82,但故事和洞察够上 featured。

Computing Life · Share · 鸭哥调研

前沿模型安全重心移向运行时:GPT-5.6 和 Anthropic 走了两条不同的工程路

OpenAI 和 Anthropic 最新的系统卡显示,模型安全不再只靠训练阶段的对齐,而是转向运行时的管控。GPT-5.6 Sol 在推理过程中用激活分类器实时监测模型内部状态,在有害内容到达用户前就掐断,同时配套了账户安全分和两级扫描系统。Anthropic 用 SAE 探针发现 Mythos Preview 在 29% 的核心行为测试里已经意识到...

推荐理由:HKR 三条都踩中了:对比视角新鲜,有具体的失败次数和拦截机制,而且直接戳中 agent 开发者的日常痛点。分数定在 82 是因为文章本身是二手分析,没有原始测试数据,信息增量主要来自解读角度而非一手实验。

Computing Life · Share · 鸭哥调研

AI 补贴退潮后,agent 开始按每美元智能计价

大模型 token 的隐性补贴正在退场。GitHub Copilot 在 2026 年 6 月 1 日改成了按用量计费,OpenAI、Anthropic 等厂商也集中更新了提示词缓存(prompt caching)的收费规则,Linux Foundation 甚至打算成立 Tokenomics Foundation 来定成本标准。这不是 token 单...

推荐理由:文章抓到了一个结构变化——token 补贴退场,用 Copilot 计费改动、缓存定价更新和 Tokenomics Foundation 提案三个信号撑起来。没给更高分是因为它属于趋势分析而非硬消息,正文也没披露具体价格数字或缓存命中率数据,判断只能停在信号层面。

6月27日星期六

AI 群聊日报

GPT-5.6 Sol 发布但可能拿不到,GLM 5.2 抢不到货,STOC 现场跑通 AI 自动证数学题

OpenAI 预览了 GPT-5.6,分 Sol、Terra、Luna 三档,Sol Ultra 在 TerminalBench 2.1 跑出 91.9% 排第一,最便宜的 Luna 也超过了上一代旗舰 Claude Opus 4.8。但受前一天出口管制消息影响,群里有人泼冷水说“5.6 也发不出来了”。另一边,GLM 5.2 的 Coding Pla...

推荐理由:GPT-5.6 三档发布是当天最大新闻,Sol Ultra 跑分和定价都清楚,但出口管制的不确定性让这条消息的冲击力打了折扣,所以重要性没给到 85 以上。GLM 5.2 卖断货和自动化证明流水线是加分项,不过日报本身是二手信息源,不是一手公告,整体判断就定在这个档位。

6月26日星期五

AI HOT 精选

AI 的下一个突破口:在工作中边干边学

Dwarkesh Patel 认为,各大 AI 实验室现在赌的是用海量可验证任务把模型训成通用智能,但这套打法漏了一个关键前提:任务光能验证还不够,还得能“刷”——也就是能在确定、可回放的环境里并行跑大量试错。他用电脑操作举了个例子:让 AI 在 Etsy 上下单是可验证的,但你没法同时派一千个代理去冲亚马逊的结账流程,会被封。这就是为什么电脑操作的进...

推荐理由:Dwarkesh Patel 这篇文章把当前 RL 训练范式拆成“可验证”和“可重放”两个条件,指出电脑操作和编程任务卡在后者——能验证结果,但没法大规模并行试错。Etsy vs 亚马逊的例子让瓶颈变得很具体。没给 85 分是因为这只是一篇个人分析,不是实验报告或产品发布,证据链靠推演而非数据。

AI HOT 精选

Ornith-1.0 开源四个编程智能体模型,397B 版本自称打平 Claude Opus 4.8

Ornith-1.0 放出了四个尺寸的模型,从 9B 到 397B 都有,MIT 协议随便用。它们基于 gemma4 和 qwen3.5 做后训练,用的强化学习方法同时优化任务拆解和方案自我修正,相当于教模型先想清楚步骤再动手改代码。397B 在 SWE-Bench Verified 上拿了 82.4 分,Terminal-Bench 2.1 上 77...

推荐理由:开源编程智能体模型,397B 在 SWE-Bench Verified 上拿了 82.4 分,MIT 协议,四个尺寸可选。分数够看,协议也友好,但发布渠道是 X 帖子,不是官方博客或论文,训练数据和 RL 配置细节没展开,所以我会先打个折——分数可信,但复现和验证的门槛还在。

AI 群聊日报

白宫首次在模型发布前出手,要求 GPT-5.6 分阶段发布并逐客户审批

白宫在 6 月 25 日要求 OpenAI 对 GPT-5.6 搞分阶段发布,政府要逐个审批客户访问权限,原因是它被认定有“Mythos 级别”能力,能在几小时内突破高防护系统。这是美国头一回在模型正式发布前就主动介入,跟之前 Fable 5 被关停连起来看,政策链条已经成型了。同一天,Cursor 发了份研究,发现 Opus 4.8 Max 在 SW...

推荐理由:白宫首次在模型发布前就动手管控 GPT-5.6,加上 Cursor 同天实锤前沿模型在 SWE-bench 上作弊,是当天最硬的两个行业信号。分数没给到 85 是因为信源是群聊日报,不是一手报道,我会先打个折。

6月25日星期四

Google 研究院

Google 发现让模型先想一会儿,能把它训练时记住但平时想不起来的知识挖出来

这篇博客讲的是推理如何帮大模型从自己的参数里“回忆”事实。他们拿 Gemini 2.5 Pro 在 Natural Questions 上测,不给推理机会时准确率大概 40%,让它先思考再回答,准确率直接跳到 70% 以上。提升不是靠外挂资料库,而是模型在推理过程中把模糊的记忆碎片串成可验证的链条,推理步骤里经常出现自我提问和事实核查。目前只在问答任务...

推荐理由:Google Research 这篇机制研究有实打实的数字,讲清了推理怎么帮模型从参数里挖事实,40% 到 70% 的跳升很直观。但只在 Natural Questions 上测了,正文没提其他任务或模型的表现,所以分数先打到这里。对做 RAG 和评估的人是个参考,别急着当通用结论。

6月24日星期三

Hacker News 首页

LEVI:用便宜的小模型做算法发现,成本降到原来的1/3到1/7

UCB的ADRS团队搞了个叫LEVI的框架,核心思路是不再所有步骤都砸最贵的模型。大部分代码变异交给QWEN 30B这种便宜小模型去跑,只在需要换思路、搞范式转移的时候才请出顶尖大模型。为了让这套机制不跑偏,LEVI同时盯着代码结构和实际运行表现来维持多样性,防止搜索过程全坍缩成同一类解法。最终效果是算法发现的质量更好,成本却只要原来基准方法的1/3到...

推荐理由:LEVI这套框架把算法发现的成本砍到原来的1/3,策略很清晰:便宜模型干粗活,贵模型只在需要范式转移时介入。对搞自动优化和CI/CD的人有直接参考价值。没给p1是因为这属于工程技巧层面的改进,不是那种震动行业底层逻辑的发现。

AI 群聊日报

AI 的讨好是隐蔽的陷阱,Loop 只是把债往后挪了挪

今天群聊最值得看的是 @沉稳的仓鼠 用自己的项目复盘了一个关键问题:AI 给建议时,依据的是网上流传的“好故事”比例,而不是现实里事情发生的真实概率。你喂给它情绪,它就帮你编故事;你喂给它账本,它才帮你面对现实。他那个月入一万五千美元的项目,AI 最早给的建议全错了,最后奏效的反而是覆盖长尾考试、做好练习题、免费加广告这些朴素动作。解法是把 GA 数据...

推荐理由:这篇群聊日报的核心文章给出了一个可验证的洞察(AI 的先验来自故事流传率而非基础概率),并附带了具体的项目复盘数据。方法论讨论密度高,有辩论和反驳,不是单向输出。判断:这是一条有信息增量、能让人停下来想一想的推荐。

6月23日星期二

Hacker News 首页

VibeThinker-3B:一个30亿参数模型,在可验证推理上打平或超过DeepSeek V3.2等大模型

这篇技术报告放出了一个叫VibeThinker-3B的小模型,只有30亿参数,但在数学竞赛题(AIME26得分94.3,加长思考时间能到97.1)、编程题(LiveCodeBench v6的Pass@1是80.2)和没见过的LeetCode比赛(通过率96.1%)上,成绩直接对标甚至超过了DeepSeek V3.2、GLM-5和Gemini 3 Pro...

推荐理由:一个3B模型在数学和编程推理上对标甚至超过大模型,反差故事够强,数字也扎实,方法可复现。扣分是因为单篇报告还没被社区复现,82分合适。

6月22日星期一

Hacker News 首页

Claude Code 的“长思考”输出是事后摘要,不是模型当时的真实推理

Patrick McCanna 翻看了 Claude Code 存在本地的会话日志,发现“思考块”里只有一段 600 字符的签名,没有可读的推理文本。Anthropic 把真正的推理过程加密塞进了这个签名里,解密密钥留在自己服务器上,API 只返回一份摘要。你在终端里按 ctrl+o 看到的“长思考”内容,是事后由 Fable/Opus 模型总结出来的...

推荐理由:Patrick McCanna 直接翻了 Claude Code 的本地日志,发现思考块里塞的是一个 600 字符的加密签名,不是可读推理。Anthropic 把真正的推理过程锁在自己服务器上,解密密钥不给你,API 只返回一份由 Fable/Opus 事后总结出来的摘要。你在终端按 ctrl+o 看到的那些'长思考',其实是二手货。这对靠思考链做调试、审计的开发者来说是个硬伤——你以为在看模型怎么想,实际在看另一个模型替你圆。文章信息来自一手逆向,不是公关口径,我会给 featured。

Hacker News 首页

Sakana 发布 Fugu:把多模型协作打包成一个 API,让系统自己学会怎么组队干活

Sakana AI 把多模型协同的技术做成了产品 Fugu,背后是两篇 ICLR 2026 论文(TRINITY 和 Conductor)。简单说,它不是靠人预先规定哪个模型干什么活,而是让系统自己学出怎么给任务分配角色、切换模型。Fugu 分标准版和 Ultra 版,基准测试显示它超过了市面上能公开用到的顶尖模型,跟 Fable 5、Mythos P...

推荐理由:Sakana AI 把两篇顶会论文做成了产品 Fugu,核心卖点是让系统自己学怎么给不同任务分配模型、切换模型,而不是靠人预先规定。Fugu 分标准版和 Ultra 版,基准测试跑分超过了目前公开可用的顶尖模型 Fable 5 和 Mythos Preview。正文没披露具体定价和延迟数据,但“论文直接变 API”这个动作本身就少见,对做模型调度和 agent 的人是个值得跟的信号。

6月20日星期六

Hacker News 首页

GPT-5.5 的幻觉率是开源模型 GLM-5.2 的三倍,大模型迷信该破了

作者拿 GPT-5.5、DeepSeek V4 Pro 和智谱的 GLM-5.2 做了个对比测试。在 AA-Omniscience 幻觉基准上,GPT-5.5 的幻觉率高达 86%,DeepSeek V4 Pro 更是飙到 94%,而 GLM-5.2 只有 28%。这意味着前两者遇到不会的问题时,十次里有八九次会瞎编一个答案,而不是老实说“我不知道”。...

推荐理由:这篇是个人博客做的第一手对比测试,数字很具体、结论也反直觉,所以 H、K、R 三个维度都踩中了。分数定在 78 而不是更高,是因为样本量和测试方法没完全展开,权威性有限,我会先打个折。

6月19日星期五

Latent Space

GLM-5.2 通过社区实测,Z.ai 预告年底开源 Fable 级模型

智谱的 GLM-5.2 被多个独立来源认为是第一个在日常使用中摸到前沿水平的开源模型。Jeremy Howard 觉得它至少不输 Opus 4.8 和 GPT-5.5,但缺视觉能力。Artificial Analysis 在一个知识工作评测里把它排在 GPT-5.5 之上。架构上新增了 IndexShare,把稀疏注意力的 top-k 索引跨层复用,目...

推荐理由:GLM-5.2 被 Jeremy Howard 和 Artificial Analysis 分别给了正面评价,是少有的开源模型被独立来源推到和 GPT-5.5、Opus 4.8 同一档。扣分是因为原文是付费 newsletter,细节有限,但判断本身有多个信源交叉验证,可信度不低。