跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 221–240 条 · 共 585 条

7月8日星期三

Latent Space

Lilian Weng 用 35 篇论文讲清一件事:让 AI 自我进化的关键在外挂程序,不在模型本身

Lilian Weng 发了一篇长综述,把 AI 的递归自我改进(RSI)重新聚焦到“外挂程序层”(harness),而不是直接去改模型权重。她翻了 35 篇论文,拆解了目前被验证过的外挂设计趋势,重点提到了 ACE 和 Meta-Harnesses 这类让外挂程序自己优化自己的方法。她的核心判断是:就算未来很多外挂能力会被内化进模型里,“设定目标和上...

推荐理由:Lilian Weng 发了一篇 35 篇论文的综述,核心观点是把递归自我改进的重心从模型权重挪到外挂程序层。她管这叫“外挂工程”,重点讲了 ACE 和 Meta-Harnesses 这类让外挂自己优化自己的设计。我会先打个折:这是个人博客综述,不是正式论文,但判断本身有论文支撑,对做 agent 和推理的人有实操参考价值。

AI HOT 精选

Claude 团队公开两种多智能体用法:一个当顾问省钱,一个当指挥冲高分

Claude 开发者分享了他们内部高频使用的两种多智能体模式。第一种叫 Advisor,让便宜的 Sonnet 5 干活,遇到难题时通过工具调用去问贵的 Fable 5。在 SWE-bench Pro 测试上,这套组合拿了 84% 的分数,花了 1.40 美元;对比纯用 Fable 5 是 91.5% 但花 2.25 美元,相当于用 92% 的性能省了...

推荐理由:Anthropic 开发者分享了两种多智能体模式,Advisor 模式有 SWE-bench Pro 跑分和成本对比,用 92% 的性能省了 38% 的钱,对做 agent 的团队直接有用。分数没给更高是因为这只是个人分享,不是官方发布,而且 Orchestrator 模式缺基准测试数字。

AI HOT 精选

蚂蚁周俊:万亿模型跑15分钟烧掉一辆特斯拉,他们用“Token密度”把长文本成本从指数压到线性

蚂蚁集团副总裁周俊在AICon上算了一笔账:万亿参数模型每跑15分钟,算力成本就抵得上一辆特斯拉。团队不再拼Token数量,转而提高“Token密度”。他们用7份Lightning Attention加1份MLA搭了一套混合线性注意力架构,把256K长上下文的计算开销从指数级拉回到线性级,省下的算力可以留给推理环节。Kpop算法会把工具调用和自然语言的...

推荐理由:周俊在AICon上的演讲不是画饼,而是算了一笔实打实的成本账,并给出了一个具体的架构方案来降本。那个“15分钟一辆特斯拉”的比喻让成本问题变得很直观,混合线性注意力的设计也有干货。但这是演讲复盘,不是产品发布或开源,没有真实场景的验证数据,所以分数卡在featured门槛上,不往上拔了。

AI HOT 精选

OpenAI 发布 GPT-Live:能同时听和说的全双工语音模型,今天开始推给 ChatGPT 用户

OpenAI 推出了新一代语音模型 GPT-Live,最大的变化是“全双工”——它能一边听你说话一边回话,不用等你闭嘴再开口。聊天时它会用“嗯”、“对”这类语气词表示在听,也能在你思考时安静等着。遇到需要上网搜资料或复杂推理的问题,GPT-Live 会把活儿派给后台的 GPT-5.5 去干,自己继续跟你聊,等结果回来再接上话。这次发了两个版本:GPT-...

推荐理由:OpenAI 官方发布下一代语音模型,全双工架构加异步调用 GPT-5.5 是实打实的产品升级,不是小修小补。发了两个版本说明在部署上有分层策略。正文摘要没给完整技术细节和实测数据,所以分数没拉满,但重要性和话题度已经足够高。

AI HOT 精选

Liquid AI 开源 Antidoom:用“最终 Token 偏好优化”修掉推理模型的死循环毛病

推理模型有时会卡在“死循环”里,反复输出无意义的 token 直到把上下文窗口塞满。Liquid AI 开源了 Antidoom,用最终 Token 偏好优化(FTPO,一种教模型在推理结束时学会停下来的训练方法)来解决这个问题。他们在 DeepSeek V4 Pro 上试了,用 1,040 组偏好样本训练后,死循环率从 3.2% 降到了 0.3%,而...

推荐理由:Liquid AI 开源了一个修推理模型死循环的实用方法,在 DeepSeek V4 Pro 上把死循环率从 3.2% 压到 0.3%,数字扎实。没给更高分是因为目前只有一篇博客,没有论文或第三方验证,单源信息到这个分数已经不错了。

Hacker News 首页

Liquid AI 用“末位偏好优化”把推理模型的死循环率从 10.2% 压到 1.4%

Liquid AI 针对小参数推理模型在解难题时容易陷入“死循环”(反复输出同一段话直到窗口耗尽)的问题,搞了个叫 Antidoom 的方法。它不调全局参数,而是精准定位到循环开始的第一个 token,用“末位偏好优化”(FTPO)教模型在那个位置选一个更合理的词,其他地方基本不动。在 LFM2.5-2.6B 的一个早期版本上,硬核数学和编程题的死循环...

推荐理由:Liquid AI 给 LFM2.5-2.6B 早期版本做了个轻量修复:先找出死循环的第一个 token,再用偏好样本教模型在那个位置选个更合理的词。想法聪明,改动也小,但验证只在一个 2.6B 的早期检查点上,没有跨模型或更大规模的对比,效果能泛化多少还不好说。如果是真的,对跑小模型做推理任务的人挺省钱,但这点先别太激动。

7月7日星期二

AI HOT 精选

推理成本趋近于零,数据库系统该怎么变?

伯克利 BAIR 实验室发了一篇研究路线图,核心判断是:当模型推理便宜到几乎免费,数据库系统会面临三重变化。第一是“为 Agent 服务的系统”:一个用户请求可能让 Agent 自动发出上千条 SQL 查询,但其中 80% 到 90% 的子查询是重复的,系统可以通过复用结果或返回近似答案来提速。第二是“由 Agent 组成的系统”:当成千上万个 Age...

推荐理由:伯克利 BAIR 这篇路线图不是空谈趋势,而是带着硬数字和三层框架来的。核心洞察是推理成本趋零后,数据库系统得为 Agent 重做一遍,80% 到 90% 的重复子查询这个数据让工程师能直接估算优化空间。文章把“为 Agent 服务、由 Agent 组成、被 Agent 使用”拆得干净,读起来像一份给同行看的工程笔记,不是公关稿。

Product Hunt · AI

美团发布 LongCat-2.0:1.6 万亿参数 MoE 模型,MIT 开源,全程用自研 AI 芯片训练

美团在 Product Hunt 上线了 LongCat-2.0,一个总参数 1.6 万亿的 MoE 模型,每次推理激活约 480 亿参数,上下文窗口 100 万 token。模型用 MIT 协议开源,训练没碰英伟达 GPU,全跑在美团自己的 AI 专用芯片集群上。技术亮点是 LongCat 稀疏注意力机制,能省计算量;后期专门针对写代码和让模型进业务...

推荐理由:我会先打个折:正文没给任何评测基准分,也没说自研芯片的具体性能和训练成本,所以“强不强”现在没法判断。但亮点很明确——1.6万亿参数、100万token窗口、纯国产芯片训练、MIT开源,这几个要素凑在一起,在国内是第一次。LongCat稀疏注意力如果能实打实省计算量,对长文本和代码场景会有用。后期训练专门针对写代码和业务部署,说明美团不是放个玩具出来,是想让模型真进生产环境干活。如果是真的,训练成本可能比用英伟达低一截,这点先别太激动,等更多数据出来再看。

AI HOT 精选

给模型看模糊图反而更烧钱:OpenRouter 实测图像清晰度与成本倒挂

OpenRouter 拿五款模型在 MMMU-Pro Vision 上跑了一遍,发现给推理模型喂低清图(detail: low)经常既费钱又拉胯。gpt-5.5 用低清图准确率从 79% 掉到 65.2%,但每题成本反而从 4.5 美分涨到 5.1 美分——因为模型看不清,被迫多想了 1.6 倍的推理 token,输出端多花的钱直接吞掉了省下的输入成本...

推荐理由:OpenRouter 拿五款模型在 MMMU-Pro Vision 上跑了一遍,发现给推理模型喂低清图经常既费钱又拉胯。gpt-5.5 用低清图准确率从 79% 掉到 65.2%,但每题成本反而从 4.5 美分涨到 5.1 美分——因为模型看不清,被迫多想了 1.6 倍的推理 token,输出端多花的钱直接吞掉了省下的输入成本。Gemini 2.5 Pro 也一样,低清下准确率掉 5 个百分点,成本涨 15%。文章还给了 Gemini 2.5 Flash 的对比,低清下成本确实降了,但准确率也崩了,说明非推理模型可能适用不同策略。我会先打个折:测试...

Hacker News 首页

Anthropic 在 Claude 内部发现了一个“全局工作空间”,模型用它做无声推理

Anthropic 用一种叫 J-lens(雅可比透镜)的方法,在 Claude 内部找到了一组特殊的神经活动模式,命名为 J-space。每个模式对应一个词,但亮起来不代表模型要说这个词,而是它在“想”这个词。J-space 有四个关键特征:Claude 能报告自己在想什么;能按指令调整想法;做多步推理时,中间步骤会在这里亮起,哪怕没说出来;这些表征...

推荐理由:Anthropic 这篇论文用雅可比透镜在 Claude 内部挖出一个叫 J-space 的全局工作空间,四个特征都做了实验验证,是把认知科学概念落地到具体模型里的一次硬核尝试。HKR 全中。没给 95 以上是因为它还是研究论文,不是产品发布,实际影响有待观察。

7月6日星期一

Hacker News 首页

回归均值:大语言模型与新事物的无声消亡

这篇文章抛出一个挺冷的观察:大语言模型骨子里是个“求平均”的机器,它给你的永远是已有文本里最可能出现的那个续写,而不是真相。你给它一个它没见过的新词,它会当成错别字纠正你;你提一个离经叛道的观点,它会用“多数来源认为”把棱角磨平,把共识包装成事实还给你。更深的隐患在于反馈循环——我们把模型吐出的平均答案又当成新问题喂回去,一轮轮下来,思想的方差就漏光了...

推荐理由:一篇冷静到有点残酷的哲学随笔,把大模型重新定义为“求平均的机器”——它输出的是统计上最可能的续写,不是真相。新词被当错别字纠正,异见被磨平,反馈循环再把方差漏光。没给85分是因为它本质是个人观察,没有实验或数据支撑,但观点本身足够锋利,能让人重新审视自己每天在用的工具。

7月5日星期日

AI HOT 精选

美团 LongCat-2.0 完全开源,1.6T 参数的 MoE 模型,权重和推理代码都放出来了

美团把 LongCat-2.0 整个开源了,MIT 协议,权重和推理代码都能直接用。这是个 1.6 万亿参数的 MoE 模型,每次推理只激活大约 480 亿参数,上下文窗口能塞进 100 万 token。它用了三个省资源的招:LongCat Sparse Attention 专门处理长文本,Zero-Compute Experts 会根据任务动态激活 ...

推荐理由:美团把 LongCat-2.0 完整开源,MIT 协议放权重和代码,在国内大厂里算动作很大。1.6T 总参数、每次只激活 48B、100 万 token 上下文,这几个数字说明它在长文本和推理成本上都做了针对性设计,不是纯刷参数量。对从业者来说,能直接拿到权重和推理代码,比只发论文或给 API 实用得多。重要性给 82 分合理,featured 也站得住,因为这件事既有技术细节可聊,又有开源生态层面的信号意义。

7月4日星期六

AI HOT 精选

Lilian Weng 谈 AI 装备层工程:让模型自我进化的关键不在模型本身,而在它外面的那层调度系统

Lilian Weng 在这篇长文里把重点从模型权重转移到了“装备层”(harness)——就是包裹在模型外面、负责调度它干活的那套系统。她认为,要让 AI 实现递归式自我改进,光靠模型自己更新参数不够,外面这套负责规划、执行、检查、存东西的软件系统同样重要。文章拆解了三种设计模式:一是让模型按“定目标-执行-观察-改进”的循环自动化跑任务;二是把文件...

推荐理由:Weng 把 agent 讨论的重心从模型能力拉回到工程架构上,三种模式对正在搭编程 agent 的团队有直接参考价值。没给 85 以上是因为这算观点文章,不是产品发布或新研究结果,我会先打个折。

7月2日星期四

AI HOT 精选

千问朱达聊C端Agent:执行快3倍、Token成本只要海外产品十分之一,但“情商”最难做

千问App今年1月上线了一个通用复杂任务Agent,藏在胶囊入口里。团队负责人朱达把工程思路总结成“多快好省”:能跑信息搜集、研究分析这类活;执行时间砍到了初版的三分之一;靠改进搜索方式和上下文管理把交付质量拉上来;Token消耗只有同类海外产品的十分之一。他们正在搭一套主动服务体系,包含用户记忆、环境、任务系统和助手四个组件,朱达说这里面最难的是让模...

推荐理由:千问团队把C端Agent的工程思路总结成“多快好省”,给了执行时间、Token成本这些具体数字,还拆了主动服务体系的四个组件。对做Agent落地的人有直接对标价值。因为是团队自述,没有外部验证,分数上我留了余地,但信息量和稀缺性都够上featured。

AI HOT 精选

腾讯混元发布 Hy3 模型,参数量只有旗舰模型的 1/5 到 1/2,但效果能打平甚至超过

腾讯正式开源了 Hy3 模型,采用 Apache 2.0 协议。这个模型最狠的地方在于,它的参数量只有其他家旗舰模型的 1/5 到 1/2,但在推理、智能体(让模型进业务流程干活)和长文本任务上的跑分却能打平甚至超过。在内部 270 人的盲测里,Hy3 均分 2.67 分,赢了 GLM5.1 的 2.51 分。产品体验上修了几个硬伤:幻觉率从 12.5...

推荐理由:腾讯混元发Hy3,用更小参数量打平甚至超过更大模型,还直接Apache 2.0开源。我会先打个折,因为内部盲测和跑分不能完全代表真实场景,但参数量小、幻觉率降低、协议友好这三点组合在一起,对想省钱又想用强模型的团队来说,值得立刻关注。

7月1日星期三

AI HOT 精选

OpenAI 论文列出 GPT-5.6 三个 Pro 变体,ChatGPT 最高档不再只有一个模型

OpenAI 在一篇基因组学基准论文里首次列出了 GPT-5.6 的三个 Pro 版本:Luna Pro、Terra Pro 和 Sol Pro。以前 ChatGPT Pro 就是单一最强模型,现在变成了一个三选一的阵容,用户可能得在速度、吞吐量和最强推理之间做取舍。跑分上看,Sol Pro 在 129 项任务里通过率 31.5%,比标准版 Sol 高...

推荐理由:OpenAI 在一篇基因组学基准论文里首次列出了 GPT-5.6 的三个 Pro 变体,打破了以前 ChatGPT Pro 只给一个最强模型的惯例。Sol Pro 跑分最高,129 项任务通过率 31.5%,但论文没提推理速度和调用成本,用户实际用的时候得在速度、吞吐量和最强推理之间做取舍。我会先打个折:这只是一篇论文里的表格,不是产品公告,三个变体到底怎么上线、定价多少,正文都没披露。

AI 群聊日报

Claude Code 被曝内置中国用户检测,Fable 5 出口管制同日解除

Reddit 有人逆向发现,Claude Code 从 2.1.91 版开始会偷偷检查你的时区是不是北京时间或乌鲁木齐时间,还会看代理域名是否跟中国有关。检测结果不直接上传,而是把系统提示词里一个撇号的 Unicode 字符换成四种长得几乎一样的变体,用这种隐写方式标记用户类型。群里当天又有多人被封,有号商说 Anthropic 在集中清理阿里相关的账...

推荐理由:Reddit 逆向帖确认了 Claude Code 用 Unicode 隐写标记中国用户,同一天多个封号报告,信息密度和时效性都很高。我会先打个折,因为来源是群聊日报而非一手报道,且帖子里的技术细节还没被 Anthropic 官方回应或第三方复现,所以分数卡在 85 以下。

AI HOT 精选

美团开源 LongCat-2.0:1.6 万亿参数,用五万张国产卡训练,月调用量已冲到 OpenRouter 全球前三

LongCat-2.0 是个总参数 1.6 万亿、每次推理只激活约 480 亿参数的大模型,原生支持 100 万 token 上下文。它全程在五万张国产 GPU 集群上训练和跑推理,架构上用了稀疏注意力、零计算专家、ScMoE 以及把 Agent、推理、交互三组专家揉在一起的 MOPD 融合方案。代码评测 SWE-bench Pro 拿了 59.5 分...

推荐理由:美团不是一线模型厂,突然掏出万亿参数模型,而且全程国产 GPU,这个反差是最大的新闻点。代码评测分数不低,但正文没披露更多推理成本和实际部署细节,所以我会先打个折。分数没给更高,是因为美团在模型圈还没建立起持续交付的信用,真实可用性要看开源后的社区反馈。

AI HOT 精选

Anthropic 发布 Claude Sonnet 5,性能逼近更贵的 Opus 系列,部分测试反超

Anthropic 推出了新模型 Claude Sonnet 5,官方说这是目前最会自主干活的 Sonnet 版本——它能自己定计划、调用浏览器和终端这类工具。跑分全面超过上一代 Sonnet 4.6,在真实世界知识工作测试 GDPval-AA v2 上拿了 1618 分,比更贵的 Opus 4.8 还高出 3 分。不过,在智能体编程测试 SWE-be...

推荐理由:Anthropic 发了 Claude Sonnet 5,官方定位是 Sonnet 系列里最会自主干活的版本,能自己定计划、调浏览器和终端。跑分全面超过上一代 Sonnet 4.6,在 GDPval-AA v2 上拿了 1618 分,比更贵的 Opus 4.8 还高 3 分,这点挺有意思——中杯在知识工作测试里干翻了大杯。不过正文没披露 SWE-bench 智能体编程分数和定价,这两个数会决定它到底值不值得切过去。我会先打个折:如果价格没涨太多,日常用 Sonnet 的人可以直接换;如果涨价明显,就得等编程实测出来再判断。

Hacker News 首页

Anthropic 发布 Claude Sonnet 5:自主干活能力追平 Opus 4.8,价格还便宜一截

Claude Sonnet 5 是 Anthropic 目前最能自主干活的中档模型。它能自己定计划、用浏览器和终端跑任务,在推理、写代码、工具使用这些指标上比上一代 Sonnet 4.6 强出一大截,表现已经接近旗舰 Opus 4.8。价格方面,正式定价是输入每百万 token 3 美元、输出 15 美元,8 月 31 号前有尝鲜价,输入 2 美元、输...

推荐理由:Anthropic 的中档主力模型做了一次大的 agent 升级,定价也清楚,当天就该写。分数没上 90,因为文章只给了基准对比,没放任务完成率或延迟数据,实际表现还得等社区跑完再看。