跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 501–520 条 · 共 585 条

4月23日星期四

X · @dotey(宝玉)

微软把 Copilot 智能体模式设为 Word、Excel、PPT 默认体验,个人和家庭版也能用

微软把 Copilot 的智能体模式(Agent Mode)设成了 Word、Excel、PowerPoint 的默认打开方式,Microsoft 365 Copilot 和 Premium 订阅用户现在就能用,个人和家庭版也一样。Satya Nadella 亲自发推,拿 Excel 举例说,电子表格的价值在于信息的空间关系,给智能体这样一张画布,一条...

推荐理由:这条消息够硬:微软把 Copilot 的 Agent Mode 设成 Office 三件套的默认体验,不是小范围测试,而是所有订阅用户即刻生效,个人版和家庭版都包括。我会先打个折,这不是新模型发布,但产品更新力度很大。内测数据有零有整,Excel 参与度涨 67%、点赞率涨 65%,Word 参与度涨 52%,PowerPoint 新用户留存涨 36%,说明默认开启确实拉动了使用。更值得盯的是文档内多步执行成了默认交互,用户能预览、保留或回退改动,这点降低了试错成本。正文没披露具体技术实现细节,但分发范围和默认策略本身已经够有话题性。

4月22日星期三

r/LocalLLaMA

ServiceNow 放出一个 15B 模型,一个权重包能切出 8 种速度档位,最快解码吞吐量翻 10 倍

ServiceNow 在 Hugging Face 上发了 SuperApriel-15B-Instruct,一个 15B 参数的指令模型。它最特别的地方是用了“超级网络”设计:48 层解码器里,每层都塞了 4 种不同的注意力机制(全注意力、滑动窗口、Gated DeltaNet、Kimi Delta Attention),运行时可以像换挡一样选不同组...

推荐理由:一个 15B 模型靠单一检查点覆盖 8 档推理速度,吞吐跨度超过 10 倍,对实际部署的吸引力很强,H 和 K 都站得住。R 来自它把成本-延迟-质量的权衡做成可调开关,而不是让你换模型。不过这只是推理优化方向的发布,不是前沿实验室的旗舰更新,影响范围偏窄,所以 76 分、featured 合理。

机器之心 · 公众号

苹果把 Transformer 改成了 Mamba,推理成本从平方级压到线性

苹果发了一篇技术文章,讲怎么把一个训好的 Transformer 模型(Pythia-1B)蒸馏成 Mamba 架构,让推理时的计算量从平方级降到线性。他们没直接硬蒸,因为直接蒸效果会崩(困惑度直接飙到 100 以上)。实际分了两步:先把 Transformer 的注意力换成一种叫 Hedgehog 的线性注意力,让模型适应线性计算;再把这个中间模型映...

推荐理由:我会先打个折:这还是个论文结果,不是已经落地的产品。但路线本身有意思——不是从头训 Mamba,而是把现成的 Transformer 蒸馏过去,省了大量训练成本。正文给出的下游任务(ARC、PIQA、BoolQ 等)说接近教师,但没放具体数字,这点先别太激动。如果真能在长上下文场景把推理成本压到线性,对需要处理长文档或长对话的产品是实打实的省钱。

4月21日星期二

机器之心 · 公众号

Monet:让多模态模型在脑子里直接画图推理,不用每次都调外部工具

Monet 把 Qwen2.5-VL-7B 改造成 Monet-7B,核心是让模型在连续的视觉潜空间里做抽象推理,而不是每次都去调用外部画图或识别工具。训练分三步:先用 12.5 万条数据做监督微调,再用 VLPO 强化学习对齐偏好。在分布内任务上比原版模型提升 3% 到 9.75%,在分布外的抽象视觉推理上提升 2.31%。论文被 CVPR 2026...

推荐理由:这篇讲的是Monet,基于Qwen2.5-VL-7B做的一个模型,核心是让多模态模型像人一样做抽象视觉思考。它不用外部工具,而是用连续隐式视觉嵌入来搞定,这点我会先打个折——思路不新,但工程上做得扎实。论文已被CVPR 2026接收,代码、模型和125K条SFT数据都开源了,对想复现的人友好。方法分三阶段SFT加一个叫VLPO的强化学习,用偏好样本教模型学回答风格。文中说分布内任务比基座好3%到9.75%,分布外抽象视觉推理提升2.31%,数字看着还行,但别太激动,因为没披露统一榜单的完整绝对分数,不知道跟其他模型比到底排第几。真正值得盯的是它把V...

OpenAI News

OpenAI 发了 ChatGPT Images 2.0,主打文字渲染、多语言和视觉推理

OpenAI 在 4 月 21 日官宣了 ChatGPT Images 2.0,说新模型在三个地方有提升:画面里的文字更准、多语言排版更稳、能根据复杂指令做视觉推理。官方放了一堆样图,从海报、漫画到杂志内页都有,看着确实比上一代强。但正文没披露模型架构、出图分辨率、价格、延迟和具体上线时间,也没给对比数据。文字渲染和多语言到底稳不稳,还得等实际用起来再...

推荐理由:OpenAI 自己发的图像模型更新,版本号直接叫 2.0,文字渲染又是老痛点,所以热度和落地价值都够。但我会先打个折:正文只给了三项改进的标题级信息,分辨率、价格、延迟、架构和可用范围全都没披露,现在只能当个预告看。真正该盯的是文字可读性和多语一致性有没有实测提升,这点先别太激动。

4月20日星期一

r/LocalLLaMA

Reddit 网友拿 9 个模型做功能规划对比,Claude Opus 4.6 生成的规格书最贵也最详细

一位 Reddit 用户让 9 个模型给一款 Go 语言记账 App 设计“负载追踪”功能,再用 Claude Code 给生成的规格文档打分排名。Claude Opus 4.6 排第一,产出一份 19KB 的规格书,过程中读了 44 次代码,花了 2.47 美元;GLM 5.1 排第二,Qwen 3.6 35B fp8+vLLM 排第三。作者自己强调...

推荐理由:这是一次有名有姓的个人实测,给出了真实工作流里的数据,所以 H、K、R 三项都站得住。但天花板不高:只测了一个功能、排名由 Claude Code 自己打分、正文没提人工验收结果,我会先打个折,放在 featured 里偏低的位置。

4月18日星期六

量子位 · 公众号

RAG 搜对了文档却答错?德国萨尔大学团队找到病根,ACL 2026 长文收录

萨尔大学团队发现,很多 RAG 系统翻车不是因为没搜到资料,而是模型读不懂搜回来的文档。他们提出 Disco-RAG,在检索和生成之间加了一层“阅读理解”:先用修辞结构理论把文档拆成论证树,再建跨段落关系图,最后生成大纲来引导回答,全程不用额外训练。论文在 Loong、ASQA、SciNews 几个数据集上都有提升,但正文没给出具体分数,这点先别太激动。

推荐理由:这篇论文的卖点不是又刷了一个榜,而是把 RAG 的故障点拆开了:检索没问题,问题出在生成前的理解环节。我会先打个折,因为正文没完整披露三个基准上的具体分数,外部复现也还没看到,所以分数停在 80。但诊断结论本身对从业者有用,值得放进 featured。

机器之心 · 公众号

算力不够用了,OpenAI 把宝押在了两件事上

Greg Brockman 透露,因为算力吃紧,OpenAI 砍掉了 Sora 的部分资源,把重心缩到两个方向:一个是个人助手,另一个是能替用户啃硬骨头的 AI 工人。目前算力没法同时撑起这两件事。正文没披露具体的算力预算、时间表和模型参数,所以“下一代基座模型 Spud”到底多强、什么时候出来,都还是未知数。

推荐理由:我会先打个折:正文没披露千亿算力投入的具体金额、时间表和技术参数,所以别当硬数据看。但这条信息值得关注的点在于,它把 OpenAI 的产品排序逻辑讲清楚了——不是退守 B2B,而是被算力预算强行重排。Sora 资源收缩、优先保推理模型和统一 AI layer,这些信号对做应用层的人比单纯吹参数更有参考价值。如果是真的,说明接下来 OpenAI 的开放节奏会更保守,想蹭他们基座能力的团队得重新算账。

新智元 · 公众号

Claude Opus 4.7 上线两天口碑翻车:跑分登顶,推理测试却暴跌

Anthropic 新模型 Claude Opus 4.7 上线不到 48 小时就吵翻了。在 Artificial Analysis 综合评分上它拿了 57 分并列第一,但换到 NYT Connections Extended 这个推理测试,准确率直接从上一代 4.6 的 94.7% 掉到 41.0%。另外,新模型换了一套分词器,同一段文本消耗的 to...

推荐理由:这条信息的价值不在“口碑崩了”的标题,而在于它把四个具体变化摆了出来:基准跑分领先、推理任务大幅退步、token 消耗变高、API 参数不兼容。对从业者来说,这比单纯报一个模型发布更有参考意义,因为它提示了升级可能带来的隐性成本。不过文章本身是发布 48 小时后的二次分析,不是 Anthropic 官方首发,所以重要性给到 83、放在 featured 层级是合理的。

FT · 科技

成立仅几个月的 Recursive 拿了 5 亿美元,号称要做“会自学的 AI”

一家叫 Recursive 的初创公司融了 5 亿美元,标题里说它在搞“自学的 AI”。但文章正文被付费墙挡住了,除了公司成立时间很短和这笔 5 亿的融资额,投资人是谁、估值多少、具体用什么技术路线实现“自学”,正文都没披露。这几个缺失的信息比“自学”这个标签本身更关键,所以这笔融资的含金量得先打个折。

推荐理由:标题把“自我教学 AI”当卖点,但正文是空的,投资方、估值、模型到底怎么个自我教学法全没写。我会先打个折,别被方向词带跑,真正该盯的是谁投的、凭什么给这个估值,这两项目前都是缺口。

4月17日星期五

Latent Space

Anthropic 发布 Claude Opus 4.7:每个推理档位都压过 4.6 一头,还新增了 xhigh 模式

Anthropic 推出了新旗舰模型 Claude Opus 4.7,价格没变,还是每百万输入/输出 token 收 5 美元和 25 美元。最直观的变化是性能档位全面上移:4.7 的低档(low)比 4.6 中档强,中档比 4.6 高档强,高档则超过了 4.6 的 max 档。此外还新增了一个叫 xhigh 的推理强度,Claude Code 现在默...

推荐理由:Anthropic 旗舰模型更新,给了一堆可验证的数字和变化点,不是空对空吹牛。HKR 三项全过:钩子清楚、信息量足、对 Claude 用户群高度相关。重要性给 90 没毛病,属于那种“先别激动但值得马上看”的更新。

X · @OpenAI

OpenAI 发布 GPT-Rosalind,一个专攻生物、制药和转化医学的推理模型

OpenAI 在 X 上丢了个新模型 GPT-Rosalind,定位是给生物学、药物发现和转化医学研究用的前沿推理模型。帖子只说了应用方向,没提模型规模、跑分、能不能用、多少钱、什么时候上线。我会先打个折——目前只有一句话官宣,具体能力、训练数据和验证结果都没披露,别急着当生产力工具。

推荐理由:我会先打个折:这就是个命名预告,没有模型卡、没有跑分、没有开放方式,所以别急着当产品发布看。但 OpenAI 把新模型直接挂上 Rosalind 这个名字、明说用在生物学和药物发现上,说明他们想把推理能力往严肃科研场景推,而不是又出一个通用聊天模型。对做 AI+科学的人,这个方向比参数更重要;对想复现或评估的人,现在信息缺口太大,只能等后续披露。

X · @dotey(宝玉)

Claude Opus 4.7 思考 token 消耗更大,Anthropic 给付费用户永久提了速率上限

Opus 4.7 比上一代更费思考 token,Anthropic 直接给所有付费订阅用户永久上调了速率限制来对冲。正文没披露具体提了多少、定价规则有没有变、什么时候全面生效。如果你还没看到额度变化,先确认自己切到了 Opus 4.7,并且 Claude Code 已升到最新版。

推荐理由:这条更新对付费用户是实打实的操作变化,三个维度都踩中了:反差感强、事实明确、直接触动用户的钱包和工作流。正文没披露具体提了多少、怎么计费、什么时候生效,所以信息有缺口,但核心事实足够清楚,放在 featured 合适。

X · @dotey(宝玉)

Anthropic 发布 Claude Opus 4.7 在 Claude Code 里的使用指南,默认努力等级调到 xhigh

Anthropic 给了一套 Opus 4.7 搭配 Claude Code 的用法建议。核心变化是默认努力等级从 high 提到了 xhigh,官方说这个档位适合大部分写代码、设计 API、迁移和审查的活儿。模型现在会自己判断什么时候该多想、什么时候该快答,不用人手动调思考量。但这也带来一个行为变化:它默认不太爱频繁调工具和生成子智能体,如果你需要它...

推荐理由:这不是模型发布,是 Anthropic 官方给 Claude Code 配 Opus 4.7 的用法说明,但改的是日常使用习惯:默认 Effort 拉到 xhigh,模型会自适应思考,工具和 SubAgent 调用反而变少了,除非你在提示里明确要求。我会先打个折——范围比大产品发布窄,但对天天用 Claude Code 写代码、做审查和迁移的人来说,这几条能立刻省时间、省 token。HKR 三项都踩中了,所以给 featured。

4月16日星期四

X · @op7418(歸藏)

Claude Code 现在能用 Claude Opus 4.7 了,默认推理强度是 X-HIGH

Claude Code 接入了 Claude Opus 4.7,默认推理强度设为 X-HIGH。如果你觉得这个强度不够用,得自己手动切到 Max。正文没提价格、速率限制和具体上线时间。

推荐理由:这是一次有料的 Claude 产品更新,三个信号都踩中了:新模型进 Claude Code,还带了一个具体的操作细节——X-HIGH 默认、Max 要手动开。我没给更高分,因为价格、速率限制和正式发布时间正文都没提,这些缺口会让实际影响打个折。

Hacker News 首页

Claude Opus 4.7 系统卡:能力没摸到自家天花板,但仍是目前公开发的最强模型

Anthropic 发了份 232 页的系统卡,把 Claude Opus 4.7 的安全评估摊开来讲。先说结论:这模型比上一代 Opus 4.6 强,但打不过他们只给少数人用的 Claude Mythos Preview,所以按 Anthropic 自己的标准,它没把能力边界往前推,灾难性风险还是低。网络攻防水平跟 4.6 差不多,英国 AI 安全研...

推荐理由:这不是一篇花哨的发布稿,但 Anthropic 这份 232 页的系统卡干货不少。我会先打个折:正文没放基准分数,也没给新的网络防护细节,所以很多判断只能靠他们自己的说法。能确认的是 Opus 4.7 比 4.6 强,但还没碰到自动化 AI 研发那条线,灾难性风险也标着低——这点先别太激动,毕竟没看到具体验证数据。对关注 Claude 公开版能力上限的人来说,这份卡值得扫一眼。

X · @claudeai

Claude 发布 Opus 4.7,称是其最强 Opus 模型,主打长任务更稳、指令跟得更准、回复前会自己检查一遍

Anthropic 在 X 上发了条推文,说 Opus 4.7 是他们目前最能打的 Opus 模型。推文提了三个点:跑长任务时更严谨,不会半路掉链子;对指令的理解和执行更精准;输出结果前会先自我验证一轮,相当于自己先审一遍再交差。意思是你可以把最难搞的活丢给它,少盯几眼。不过正文没给任何跑分、上下文窗口多大、怎么收费、哪些人能用到,这些关键信息全都没提...

推荐理由:这是一次有分量的模型发布,HKR 三项都站得住:新 Opus 本身就有话题性,三条改进可以实测验证,Claude 重度用户会立刻上手对比。分数没给更高,是因为正文没放基准分数、上下文长度、价格和上线范围,这些关键信息缺了,实际能省多少成本、延迟高不高都还说不准。

r/LocalLLaMA

Qwen 放出 Qwen3.6-35B-A3B,35B 总参数只激活 3B,开源可商用

Qwen 发了个新模型,叫 Qwen3.6-35B-A3B,用的是稀疏 MoE 架构,总参数量 35B,但每次推理只激活其中 3B 参数,跑起来会比较省资源。采用 Apache 2.0 协议,可以商用。官方说法是它在写代码、处理多模态任务上表现不错,还支持“思考”和“不思考”两种模式,能直接塞进业务流程里干活。不过这篇帖子没给出具体的跑分、上下文窗口长...

推荐理由:这条帖子是个发布通告,信息量有限但钩子够硬。35B 总量、3B 激活的稀疏 MoE 听着省算力,但正文没放基准和上下文窗口,我会先打个折。Apache 2.0 开源是实锤,对想自己部署的人有吸引力;agentic coding 和多模态推理的说法先别太激动,等实测数据出来再看。

Hacker News 首页

AI 挖漏洞不是拼算力,模型智商才是天花板

antirez 拿 OpenBSD 的 SACK 漏洞举例,说了一个反直觉的结论:用 AI 找代码漏洞,堆 GPU 多跑几次没用。因为代码能走的执行路径是有限的,跑再多轮也会饱和,最终卡住你的是模型本身的智商,而不是采样次数。弱模型就算给它无限的 token,也永远没法把“窗口校验缺失”“整数溢出”“不该为空的指针分支”这三件事串起来,所以找不到真漏洞...

推荐理由:antirez 这篇不是论文,更像一篇带实验的博客。核心判断很明确:AI 找漏洞的上限卡在模型本身的智力水平,不是 GPU 数量。他用 OpenBSD 的 SACK bug 做了个可复现的测试——弱模型就算给你无限 token,也串不起来窗口校验、整数溢出和 NULL 分支这三件事,路径会饱和。这个结论对天天在算成本和效果的人有用:与其无脑加采样,不如盯模型质量和获取速度。我会先打个折,正文没给大规模对比数据,更像单点验证,但逻辑链条清楚,值得一看。

OpenAI News

OpenAI 发布 GPT-Rosalind:一个专为生物医药研究做的推理模型

OpenAI 在 2026 年 4 月 16 日推出了 GPT-Rosalind,一个专门面向生物学、药物发现和转化医学的前沿推理模型。它现在以研究预览版的形式在 ChatGPT、Codex 和 API 里对通过审核的客户开放。模型的核心卖点是能处理多步骤的科研流程,比如读文献、理解基因序列、设计实验和做数据分析,并且能调用超过 50 种科学工具和数据...

推荐理由:我会先打个折:正文没披露模型参数、价格和具体基准分数,所以别急着把它当成熟产品看。真正值得盯的是落地范围——OpenAI 把 Amgen、Moderna、Thermo Fisher 这些大药企拉进来做 research preview,说明他们想用真实业务场景验证模型,而不是发个论文就完事。Codex 里那个免费的生命科学插件能连 50 多个工具和数据源,对做生物信息学的人可能挺实用,但没给性能数据,这点先别太激动。整体看,这是 OpenAI 往垂直行业扎的一步,但信息缺口不小,暂时只能给 featured。