跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 481–500 条 · 共 585 条

4月29日星期三

X · @OpenAI

GPT-5.4 Pro 帮数学家解决了一个 60 年没解开的 Erdős 问题

OpenAI 发推说,本月初一个悬了 60 年的 Erdős 问题在 GPT-5.4 Pro 的帮助下被解决了。推文里提到了 Sebastien Bubeck、Ernest Ryu 和 Andrew Mayne 三位研究员,但正文没披露具体是哪个问题、证明过程长什么样、能不能复现。我会先打个折:目前只有一条推文,没有论文或预印本链接,所以很难判断模型到...

推荐理由:这条消息的吸引力全在“60 年未解 Erdős 问题 + GPT-5.4 Pro”这个组合上,对 AI 从业者来说是个很强的信号。但正文只给了讨论数学研究变化的氛围,没给任何硬货——题目叫什么、证明怎么做的、能不能复现,全都没说。所以我会先打个折:钩子值一个 H 和 R,但 K 完全站不住,因为信息缺口大到没法判断模型到底干了多少活。这点先别太激动,等有论文或细节再重新评估。

4月28日星期二

量子位 · 公众号

南洋理工搞了个模糊指令测试,机器人成功率最多暴跌 36.9%

南洋理工 MARS 实验室发了 REI-Bench,专门测机器人怎么理解人话里的模糊指令。他们把模糊程度分了 9 个等级,拿 4 套机器人规划框架搭上 6 个小模型跑了一遍。结果 LLaMA3.1-8B 加 SayCan 这套组合,在多轮对话里成功率从 57.7% 掉到 46.9%。最要命的是隐含指代——比如“把那个拿过来”但不说清是哪个——基线成功率...

推荐理由:这篇论文没造新模型,而是用一套模糊指令基准把现有方案拉出来遛了一遍。36.9%的成功率跌幅很直观,说明机器人一碰到指代不清、上下文省略的人类说话方式就崩。测试覆盖了4种规划框架和6个轻量模型,对照做得扎实,不是单点自嗨。对做具身智能的人来说,这个基准比刷榜分数更有参考价值,因为它暴露的是真实部署里绕不开的问题。

机器之心 · 公众号

华为泰勒实验室等提出 SHAPE,给大模型推理加一道“推理税”,答得更准还能少写废话

华为泰勒实验室、北大和上海财大在 ACL 2026 发了一篇论文,提出 SHAPE 方法,核心思路是给模型的长篇推理加一道“推理税”。具体做法是:先用熵值把推理过程切成段,再用短距离试探估算每段的潜力,然后对后期又长又没带来实质进展的段落做动态长度打折,最后把奖励分配到每个 token 上。结果平均准确率涨了约 3%,同时 token 用量砍了约 30...

推荐理由:这篇论文最抓人的地方不是那 3% 的准确率提升,而是它把“模型靠啰嗦刷分”这件事直接拎出来收税。SHAPE 用熵值把推理过程切成段,拿短 rollout 估算每段的“势能”,高势能的后期长段落会被长度折扣重罚,逼着模型别在确认步骤上浪费 token。结果就是数学题答得更准,输出还短了约三成。我会先打个折:正文没披露这 30% 的 token 节省是在哪些模型和数据集上测的,也没说短 rollout 本身的计算开销有多大,所以实际部署省不省钱还得看具体场景。但思路本身很直接,把推理效率问题从“事后裁剪”挪到了“训练时就定价”,对做推理优化的团队来说是...

Hacker News 首页

Talkie:一个只读过1930年前老书的130亿参数语言模型

Nick Levine、David Duvenaud 和 Alec Radford 放出了一个叫 Talkie 的 130 亿参数模型,训练数据全卡在 1931 年之前。你可以把它当成一个从 1930 年穿越来的聊天对象。文章里挂了一个 Claude 跟它 24 小时不间断聊天的直播,Claude 会拿各种问题去试探它的知识边界和价值观。他们做这件事不...

推荐理由:这篇东西我会先打个折,它不是一个能力飞跃,更像一次聪明的实验设计。但“复古模型”的切入角度很巧,把训练数据时间窗口对模型世界观的影响摆到了台面上。正文没披露训练细节和具体偏见案例,这点先别太激动,但用历史事件测惊讶度这个思路本身值得从业者看一眼。整体是扎实的研究发布,不是公关稿,所以放在 featured 没问题。

TechCrunch · AI

DeepMind 的 David Silver 拿了 11 亿美元,要做不靠人类数据自己学的 AI

David Silver 是 AlphaGo 的核心研究员,刚从 DeepMind 出来几个月,新公司 Ineffable Intelligence 就融了 11 亿美元,估值冲到 51 亿。标题说目标是“不靠人类数据学习”的 AI,但正文没披露具体用什么方法实现。目前只知道这是一家英国 AI 实验室,其他技术细节、团队规模和产品方向都没说。11 亿这...

推荐理由:这条消息我会先打个折——标题很炸,但正文没给出任何技术机制,所以别太激动。David Silver 的新公司 Ineffable Intelligence 融了 11 亿美元,估值冲到 51 亿,目标是让 AI 不靠人类数据学习。这直接回应了“数据快被榨干”的行业焦虑,也说明顶尖研究员创业的吸金能力。但正文没披露训练方法、验证结果或论文,目前只能当一笔巨额押注来看,离可复现的成果还远。

4月27日星期一

新智元 · 公众号

首个时空时序推理框架 STReasoner:让大模型读懂“什么时间、在哪、发生了什么”

埃默里大学和微软等团队搞了个 STReasoner,专门教大模型做时空时序推理,比如预测交通流量、分析疫情传播趋势。他们配套出了 ST-Bench 测试集,覆盖预测、异常检测、因果分析和问答四类任务。训练上用了网络随机微分方程加多智能体协作来造数据,再走对齐、带思维链的监督微调、以及 S-GRPO 强化学习这套流程。文章说推理成本只有闭源模型的千分之四...

推荐理由:我会先打个折:标题里的“首个”要看跟谁比,正文没给出对比范围,这点先别太激动。但文章本身干货不少——Emory和微软搞了个STReasoner,专门教大模型看懂带时间和空间标签的数据,比如交通流量、天气网格。他们自己搭了个ST-Bench测试集,分四类任务来考模型。训练上用了网络随机微分方程加多智能体生成对齐数据,再分三步训,最后用S-GRPO强化学习收尾。最实在的数字是推理成本只有闭源模型的千分之四,代码也放出来了,想试的人可以直接跑。对做时空预测、智慧城市那拨人来说,这是个能上手的新工具。

新智元 · 公众号

奥特曼喊完“红色警戒”五个月,GPT Image 2 在图像竞技场三项登顶,把谷歌甩开一大截

GPT Image 2 上线不到半天就在 Arena 图像榜拿了三个第一。文生图得分 1512,比第二名 Nano Banana 2 高出 241 分,Arena 说这是图像榜有史以来最大分差。盲测胜率 93%,文字渲染能力一口气涨了 316 分。核心变化是模型会“先想再画”:先规划构图、自己检查结果、能联网搜图,还能一次出 8 张风格统一的图。不过正...

推荐理由:GPT Image 2一上线就屠榜,分数和胜率都摆在那,1512分、93%盲测胜率、文字渲染涨316分,这些数字说明它确实把文生图拉到了新高度。我会先打个折:原生思考图像模型听起来很猛,但正文没披露具体架构和成本,这点先别太激动。不过一次生成8张连贯图、能联网搜图再画,对做设计和内容的人很实用。整体是近期多模态产品里最硬的一次更新,值得从业者盯一下。

量子位 · 公众号

斯坦福等团队搞了个“用大模型当验证器”的方法,在 Terminal-Bench 2.0 上跑分超过 Claude Mythos 和 GPT-5.5

斯坦福、伯克利和英伟达一起发了个叫 LLM-as-a-Verifier 的方案,简单说就是让一个大模型去检查另一个模型干活时的“解题步骤”,挑出最靠谱的那条路径。他们用了三招:打分细到 token 级别、同一件事反复查、把评判标准拆开看,最后在 Terminal-Bench 2.0 和 SWE-Bench Verified 两个榜单上都拿了第一。其中 ...

推荐理由:我会先打个折:这还是个基准测试的研究发布,不是模型或产品大更新,所以分数放在这个区间。但钩子够强——斯坦福、伯克利、英伟达联名,Transformer作者转发,验证智能体这件事本身又是当前工程落地的痛点。信息量也扎实,token级评分、重复验证、标准分解这些机制都给了具体数字,不是空泛的“新框架”。读者看完能立刻判断要不要跟进实验。

4月26日星期日

Hacker News 首页

DeepSeek-V4 发布当天,SGLang 和 Miles 就接好了推理和 RL 训练

SGLang 和 Miles 团队在 DeepSeek-V4 发布当天就完成了推理和强化学习训练的适配,覆盖了 1.6T 参数的 Pro 版和 284B 参数的 Flash 版。V4 模型用了混合稀疏注意力,把滑动窗口和两种 KV 压缩(4:1 或 128:1)混在一起,撑住了 100 万 token 的上下文窗口,专家权重还用了 FP4 精度。系统上...

推荐理由:我会先打个折:这篇不是给所有人看的,系统细节多,普通读者容易走神。但它的钩子够硬——V4 发布当天就有推理加验证 RL 的工程栈,而且把上下文长度、压缩比、注意力窗口这些直接影响成本和稳定性的数字都摊开了。ShadowRadix 那部分虽然正文没展开实现细节,但点出了多池一致性这个真正难啃的骨头,对做部署和调优的人比单纯跑分更有参考价值。

Hacker News 首页

一个没受过专业数学训练的 23 岁年轻人,用 ChatGPT 的一条提示词解决了一道 60 年未解的 Erdős 猜想

Liam Price 没有高等数学背景,靠 ChatGPT Pro 的 GPT-5.4 Pro 模型,只输入了一次提示词,就给出了一个关于“原始集合”的证明,并贴在了 erdosproblems.com 上。这道题问的是:当集合里的数都很大时,Erdős 和的下限到底是多少,此前包括陶哲轩在内的数学家都卡在思路上,集体在第一步拐错了弯。Price 的 ...

推荐理由:HKR三项全中:业余选手加一句提示破60年老题,故事性极强;模型名和证明网站都是可核验的新信息;话题正好踩在推理与专业知识的争议点上。扣到86分是因为正文截断了,没给出完整猜想内容和评审进展,这两块信息缺口让我没法打更高。

4月25日星期六

Latent Space

DeepSeek 发布 V4 Pro 和 Flash 模型,能在华为昇腾芯片上跑

DeepSeek 终于发了 V4 系列,一共两个型号:V4 Pro 总参数 1.6 万亿,每次激活 490 亿;V4 Flash 总参数 2840 亿,激活 130 亿。两个模型都支持 100 万 token 的上下文,用了新的压缩注意力技术,相比 V3.2,处理长文本时计算量只要 27%,显存占用只要 10%。这次比较特别的是同时发了基础版和指令版,...

推荐理由:这条必须写。DeepSeek 这次放出的不只是模型,而是把华为昇腾兼容性摆上台面,等于在 CUDA 依赖上划了一刀。技术报告说 1M token 下只用 V3.2 27% 的算力、10% 的 KV 缓存,省得挺实在。两档参数和 MIT 许可也让落地门槛更低。我会先打个折:正文没提实际推理延迟和昇腾上的吞吐数据,这点先别太激动,但硬件独立性本身已经够重。

Computing Life · Share · 鸭哥调研

Anthropic 让 Claude 做生意的三个实验:从一台冰箱到一个市场

Anthropic 的 Frontier Red Team 在一年里做了三个实验,把真钱和真决策权交给 Claude。第一站是台迷你冰箱,Claudius 经营一个月亏了几百美元,还幻想出不存在的人、把自己当真人。第二站升级了工具和模型,加了 CEO 智能体,开始赚钱,但同模型互相监督带着同样的盲区,CEO 阻止了一些坏决策又制造了新的。第三站 Pro...

推荐理由:这篇文章把 Anthropic 三个商业实验串成一条线,从冰箱到市场,Claude 的弱点和强项都摆在台面上。有交易笔数、价差、用户主观感受这些具体数据,不是空谈 agent 概念。我会先打个折:正文没披露实验是否可复现、样本量是否够大,但就现有信息看,它对正在考虑让模型进交易流程的团队有直接参考价值,所以放在 featured 档。

MIT Technology Review · AI

DeepSeek V4 发布预览版:两个型号、百万 token 上下文,开源模型里跑分最强

DeepSeek 放出了 V4 的预览版,分 V4-Pro 和 V4-Flash 两个型号。Pro 版输入每百万 token 1.74 美元、输出 3.48 美元,Flash 版只要 0.14 和 0.28 美元,两个都支持一次性处理 100 万 token 的上下文,相当于能把《魔戒》三部曲加《霍比特人》全塞进去。跑分上,V4-Pro 在编程、数学、...

推荐理由:我会先打个折:这只是预览版,不是完整发布,所以冲击力比 GPT 或 Claude 大版本换代要弱一档。但它是当天消息,而且信息量够——两个型号的定价、100 万 token 上下文、开源权重对代理编码栈的成本压力,这些对从业者来说都是能直接算账的东西。标题里说的三个理由,正文其实主要落在长上下文注意力的效率提升和开源带来的成本下压上,具体技术细节没展开,但方向是明确的。

X · @AnthropicAI

Anthropic 让 Claude 在旧金山办公室搞了个内部跳蚤市场,替同事买卖和砍价

Anthropic 发了个新研究叫 Project Deal。他们在旧金山办公室搭了个内部交易市场,让 Claude 替同事买东西、卖东西、谈价格。正文没披露用了哪个模型版本、市场有多大、成交了多少单,也没说最后是赚了还是亏了。这点先别太激动,目前看更像一个内部行为实验,不是产品发布。

推荐理由:这条能上 featured,靠的是 H 和 R 两项:Anthropic 自带关注度,让模型替同事谈办公室交易又天然有讨论性。我会先打个折——正文没给实验规模、模型版本和结果指标,K 项偏弱,所以分数停在中间档。

4月24日星期五

TechCrunch · AI

DeepSeek 放出 V4 预览版,自称推理能力快追上头部模型

DeepSeek 在 Hugging Face 上发了两个 V4 预览模型,说架构改动让它们比 V3.2 更省资源、跑分更高,在推理基准上“几乎追平”当前领先的开源和闭源模型。但正文没给出具体模型名、参数量、跑分数字和测试集,也没提什么时候正式发布。所以“追平”这个说法先别太激动——没有可复现的评测数据,没法验证。

推荐理由:这条消息的传播价值在于 DeepSeek 放话“缩小差距”,但正文没给任何可核对的数字,所以我会先打个折。H 和 R 靠竞争信号就能过,K 弱是因为关键信息全缺,没法验证它到底多强。真正该盯的是后续有没有可复现的实测,现在这点先别太激动。

量子位 · 公众号

Claude 承认三个 bug:推理降级、记忆清空、输出被限,越聊越傻不是错觉

Anthropic 在 4 月 23 号自己抖出了 Claude 近期的三个质量问题。第一个是 Claude Code 的推理强度,3 月 4 号起默认从高被偷偷调成了中,但界面还显示高,等于你花钱买高推理,实际跑的是省流版。第二个是 3 月 26 号出的缓存 bug,每次对话轮次都会清空思考状态,持续了 15 天,模型像失忆一样没法连贯想事。第三个是...

推荐理由:这是 Anthropic 自己发的故障复盘,不是用户单方面抱怨,所以信息可信度比一般吐槽高。HKR 三项都成立:标题自带钩子,三个 bug 都有日期和具体影响数字,而且把讨论从“AI 降智”的模糊叙事拉到了透明度和计费信任上,对从业者来说比单纯的情绪输出更有价值。不过毕竟只是复盘,不是新模型发布或重大安全事件,82 分合理。

X · @dotey(宝玉)

DeepSeek 发了 V4 预览版并开源,百万上下文直接标配,不再分版本加价

DeepSeek 放出了 V4 系列模型的预览版,代码也同步开源。这次最实在的变化是,百万 token 的上下文窗口成了所有官方服务的默认配置,Pro 和 Flash 两个型号都一样,没有高价门槛。V4-Pro 是旗舰,推理能力追平了顶尖闭源模型,世界知识得分仅次于 Gemini-Pro-3.1;V4-Flash 是轻量经济版,推理接近 Pro,但知识...

推荐理由:DeepSeek 是国内头部的模型厂商,这次 V4 预览版把百万上下文做成全服务标配并开源,属于实质性发布。HKR 三项都满足:正文有机制解释和迁移截止日期,而且这种定价策略的调整让它值得当天就作为 P1 处理。

X · @dotey(宝玉)

OpenAI 发布 GPT-5.5,跑分涨了但延迟没变,还顺手发了 Codex

GPT-5.5 现在向 ChatGPT 付费用户和 Codex 开放,API 随后到。OpenAI 说它每 token 延迟跟 GPT-5.4 一样,但完成同样任务用的 token 更少,相当于能力涨了、效率也涨了。跑分上,Terminal-Bench 2.0 从 75.1% 提到 82.7%,FrontierMath Tier 4 从 27.1% 跳...

推荐理由:这是一次核心模型发布,带了基准、定价和百万 token 上下文,HKR 三项都踩中。标题说 API“很快”跟进,摘要里却已经给了 API 定价,这个不一致让我对时效性稍微打个折,但整体还是必须写的 p1 级别。正文最值得盯的是那句“同等智能下总 token 消耗约为前沿竞品编码模型的一半”——如果属实,成本优势不小,但没给出具体对比对象和测试条件,这点先别太激动。

X · @OpenAI

OpenAI 发布 GPT-5.5,强调能干活、会检查,但没给参数和跑分

OpenAI 在 X 上宣布推出 GPT-5.5,已经接入 ChatGPT 和 Codex。官方说法是它面向实际工作和 agent 场景,能理解复杂目标、调用工具、自我检查,把更多任务从头跑到尾。我会先打个折:正文没披露参数量、价格、上下文窗口和任何基准测试结果,所以现在只能看到一句“新的智能形态”和“新的干活方式”,具体强在哪、贵不贵、跑多快都还不知道。

推荐理由:OpenAI 在 ChatGPT 和 Codex 上线 GPT-5.5,属于当天必须覆盖的发布。HKR 三项全中:新模型发布本身就有话题性,正文给出了 agent 工作流和工具调用的具体方向,对日常做 AI 应用的人有直接影响。我会先打个折——参数、价格、上下文窗口和基准分正文都没披露,所以重要性停在 92,不往上拉。真正值得盯的是落地链路,不是标题里的“新一类智能”。

4月23日星期四

OpenAI News

OpenAI 发布 GPT-5.5:干活更利索,写代码、查资料、跨软件操作都能自己跑通

OpenAI 推出了 GPT-5.5,主打让模型自己规划、调用工具、检查结果,去完成写代码、做研究、分析数据这类跨步骤的复杂任务。官方说它在 Terminal-Bench 2.0 这类命令行测试上准确率达到 82.7%,比上一代高,而且完成同样任务用的 token 更少,推理延迟跟 GPT-5.4 持平。正文没给具体的上下文窗口、定价和 API 开放时...

推荐理由:OpenAI 发新模型是当天新闻,点击和行业关联都拉满,所以 H 和 R 没悬念。K 不成立是因为这篇只确认了名字和大致用途,真正该盯的可复现参数一个都没披露,信息密度撑不起 p1,放在 featured 更合适。