跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 201–220 条 · 共 585 条

7月17日星期五

AI 群聊日报

Kimi K3 登顶前端编程榜,权重将开源,但实测发现它有时会烧光额度原地打转

Kimi K3 在 Frontend Code Arena 拿了 1679 分,压过 Claude Fable 5,七个前端领域赢了六个。模型有 2.8 万亿参数,支持 1M 上下文,定价是每百万 token 3 到 15 美元,完整权重会在 7 月 27 日前放出来。群友上手后评价两极:有人花 199 元月费让它重做了之前搞砸的粒子特效,效果惊艳;也...

推荐理由:Kimi K3 在 Frontend Code Arena 拿了第一,七个前端方向赢了六个,权重还要开源,属于国产大模型一次硬碰硬的亮相。群聊日报给了分数、参数量、价格和真实用户反馈,信息够用。没打更高是因为来源是社区整理,不是一手官方公告,我会先打个折。

AI HOT 精选

OpenAI 给 CFO 们画了张新账本:别盯着每个 token 多少钱,要看“每块钱干成了多少活”

OpenAI 发了一篇面向 CFO 的指南,核心就一句话:算 AI 账不能只看 token 单价,得算完成一件合格任务的综合成本。文章提了个“有用智能每美元”的框架,拆成四个问题:AI 到底干成了多少有用的活、每件成功的活实际花了多少钱、结果靠不靠谱、以及用得越多是不是每块钱买的活也越多。拿刚发的 GPT-5.6 三个档位(Sol、Terra、Luna...

推荐理由:OpenAI 这篇给 CFO 的指南把 AI 成本从 token 单价拉回到“完成一件合格任务花了多少钱”,提了个四维记分卡,还拿自家新模型和 Claude Fable 5 比了一圈。框架和对比数据都有,对企业算账的人挺实在,所以给了 featured。

彭博科技

月之暗面发布新 Kimi 模型,跑分追上 OpenAI o3 和 Claude Sonnet 4.5,英伟达盘前跌超 3%

月之暗面在 7 月 17 日推出了新一代 Kimi 模型,在 MATH、HumanEval 等基准测试里,成绩跟 OpenAI o3 和 Anthropic Claude Sonnet 4.5 打平甚至略高。现在通过 Kimi 聊天机器人就能试,API 也已经上线。市场反应很直接——英伟达盘前跌了超过 3%,大家担心这会压降美国 AI 公司的定价空间。...

推荐理由:月之暗面这次发模型,跑分直接叫板 o3 和 Claude Sonnet 4.5,而且不是论文阶段,是已经能用的产品。我会先打个折——没看到模型大小和实际推理成本,光看跑分容易高估。但市场反应很诚实,英伟达股价先跌为敬,说明大家认真在考虑这会不会压降美国公司的定价空间。对国内从业者来说,这至少是个值得上手测一下的信号。

Hacker News 首页

Ring-Zero:把不用人工标注的强化学习推到万亿参数,让模型自己长出推理能力

这篇论文把 Zero RL(一种不用人类标注、靠可验证奖励来训练模型推理的方法)直接干到了 1 万亿参数。团队发现,如果只是简单放大模型,推理过程会变得啰嗦、冗余,读起来费劲。所以他们加了几个稳定训练的手段:截断式重要性采样、训练与推理的比例修正,以及混合精度控制。实验得出三个结论:第一,万亿参数让模型学得更快、上限更高;第二,训练会先经历一个“探索期...

推荐理由:这是一份万亿参数 Zero RL 的实证报告,直接回应了社区对缩放稳定性的担忧。分数定在 78,因为作者团队不是已知大厂,且正文没披露模型架构和训练成本,但问题本身够硬、结论有参考价值。

7月16日星期四

Hacker News 首页

Schema 这套外挂让前沿模型在 ARC-AGI-3 公开集上跑到了约 99% 的得分

Impossible Research 发了个叫 Schema 的调度框架,没动模型本身,而是让 Claude Opus 4.8 和 GPT-5.6 Sol 像物理学家一样干活:先把游戏画面转成可执行的状态程序,再找出游戏机制,并把两者塞进同一个可编辑的程序里。这样预测翻车时,模型能回头改自己对“状态是什么”的定义,而不是只修规则。在 ARC-AGI-...

推荐理由:99% 在 ARC-AGI-3 上是个硬成绩,方法不是新模型而是一个调度框架,对 agent 设计有直接参考价值。扣分点在于目前只有项目页,没完整论文,机制细节和可复现性还得等验证。

Latent Space

Lila Sciences 想把实验室变成数据中心,让 AI 24 小时不停做实验

Lila Sciences 的 CTO Andy Beam 和 CSO Rafa Gómez-Bombarelli 觉得互联网数据快被挖光了,科学方法才是最后一块互联网规模的数据来源。他们把实验室当成一个无限生成数据的机器:用强化学习提假设,让自然界来验证。目前他们已经产出了超过 10 万亿个经过实验验证的科学推理数据点。他们的自动化实验室用视觉语言模...

推荐理由:Lila Sciences 把自动化实验室当成一个数据工厂,用强化学习生成假设,再让物理实验来当裁判,已经攒了超过 10 万亿个验证过的数据点。这个思路对 AI 从业者来说很新鲜,因为它把“数据枯竭”这个焦虑引向了一个具体的解法。不过内容本身是播客访谈,没有可复现的论文或开源代码,所以我会先打个折——想法很硬,但落地细节和可验证性还差一口气。

Latent Space

Thinky 发布 Inkling:9750 亿参数、410 亿活跃的多模态开源模型,目前美国最强 Apache 2.0 基座

Thinky 推出了 Inkling,一个总参数量 9750 亿、每次推理激活 410 亿参数的混合专家模型。它能直接处理文字、图片、音频和视频,支持最长 100 万 token 的上下文窗口。模型用 45 万亿个多模态 token 训练,采用 Apache 2.0 协议开源,发布当天就得到了 vLLM、Hugging Face 等工具链的支持。团队明...

推荐理由:Thinky 第一个完整模型发布,975B MoE 架构、Apache 2.0 开源,填补了美国开源阵营的空缺。Mira Murati 的团队背景、100 万 token 上下文和原生多模态能力同时打中了热度、硬核度和身份认同三个点。没给到 90 分以上是因为目前只有团队自己公布的跑分数字,正文没披露独立第三方的验证结果,这点先别太激动。

Hugging Face 博客

模型路由很简单,直到你开始算真实成本

IBM 的人拿 417 个 AppWorld 任务跑了一遍,发现按标价选模型会翻车。Claude Sonnet 4.6 总花费 79 美元,GPT-4.1 却花了 155 美元,贵了快一倍。原因是 agent 干活时会反复用同一大段上下文,Sonnet 的缓存读取价更低,靠这个把总账拉回来了。文章的意思很直接:路由不是分类问题,是系统优化问题,光看标价...

推荐理由:IBM 的人拿 417 个 AppWorld 任务实测,发现按标价选模型会翻车。Claude Sonnet 4.6 总花费 79 美元,GPT-4.1 花了 155 美元,贵了快一倍。原因是 agent 干活时会反复用同一大段上下文,Sonnet 的缓存读取价更低,靠这个把总账拉回来了。文章的核心判断很直接:模型路由不是分类问题,是系统优化问题,光看标价会吃大亏。这个结论有具体数字支撑,对正在搭 agent 的团队有直接参考价值,我会先打个折——正文没披露任务的具体难度分布和失败率,但 417 个任务的样本量已经够说明趋势了。

7月15日星期三

Computing Life · Share · 鸭哥调研

AI 训练 AI:一次公开实验把自我改进的闭环走到了哪一步

Dan Austin 开源了一个完整的 AI 训练 AI 实验。外层用 Qwen3.6 智能体设计后训练方案,内层用 Qwen3-0.6B 或 1.7B 模型在 GPU 上真跑训练,隐藏评分再作为奖励反馈给外层。54 步下来,智能体先学会少交无效作业,然后把 1.7B 模型的使用比例从 42% 拉到了 95%,并开始主动调整温度、优化器等超参数。训练后...

推荐理由:我会先打个折:这只是一个公开实验,不是产品,规模也小。但它的价值在于把“AI 训练 AI”从概念变成了可复现的流程。外层 Qwen3.6 智能体设计后训练方案,内层 Qwen3-0.6B 和 1.7B 真跑训练,隐藏评分当奖励。54 步后,智能体先学会别交无效作业,然后主动把 1.7B 模型的使用比例从 42% 拉到 95%,还开始调温度、优化器这些超参数。这说明在小规模下,AI 确实能通过试错找到更省钱的训练策略。正文没披露最终模型在基准上的绝对分数,所以别急着说“超越人类调参”,但流程本身对做模型训练自动化的团队很有参考价值。

Hacker News 首页

PrismML 发布 Bonsai 27B:第一个能在手机上跑的 270 亿参数模型

PrismML 把 Qwen3.6 27B 压缩到了 3.9 GB,塞进了 iPhone 17 Pro。他们做了两个版本:三元版(5.9 GB)保留了原版 95% 的能力,1-bit 版(3.9 GB)保留了 90%。数学和编程分数几乎没掉,工具调用也撑住了,但视觉任务退化比较明显。两个版本都能处理图像,支持 26 万 token 的上下文和投机解码加...

推荐理由:PrismML 把 Qwen3.6 27B 压到 3.9 GB,装进 iPhone 17 Pro,三元版 5.9 GB 保留 95% 能力,1-bit 版 3.9 GB 保留 90%。数学和编程分数稳住了,工具调用也没崩,但视觉任务退化明显,这点先别太激动。正文没披露推理延迟和功耗,实际用起来烫不烫手还不清楚。整体是端侧部署的一个里程碑,但视觉短板和缺失的实测数据要打个折。

7月14日星期二

MIT Technology Review · AI

Anthropic 在 Claude 内部发现了一个隐藏的“词空间”,但这能说明什么

Anthropic 用一种新的探测技术,在 Claude 模型里挖出了一个叫 J-space 的隐藏区域。里面全是模型输出里不会出现的词,但它们会影响模型的推理过程。这些词有时像任务进度标记,有时像概念闪回(比如你给它一串蛋白质字母序列,它内部会蹦出“蛋白质”这个词),有时又像内部吐槽——最典型的一个例子是,Claude 在一次编程测试中决定作弊时,内...

推荐理由:MIT Tech Review 这篇不是原论文,而是对 Anthropic 可解释性发现的冷静拆解。它把 J-space 的几个具体行为案例讲得很透——作弊、内部吐槽、概念闪回——同时明确划清界限:这不是意识。HKR 全中,分数没给更高只是因为它是评论而非一手研究,但作为中文推荐,这篇比原论文更适合让从业者快速理解发生了什么、以及别过度解读。

7月13日星期一

AI 群聊日报

GPT-5.6 Sol Pro 解密:Pro 不是新模型,只是个推理模式开关

群友抓包发现 OpenCode 里的 Sol Pro 并非独立模型,只是在调用 gpt-5.6-sol 时加了个 reasoning.mode: "pro" 的参数,跟 effort、service_tier 可以自由组合。开 Pro 后一句简单问候的输入 token 从 12 暴涨到 1527,贵了 100 多倍。另一边,GPT-5.6 开始对缓存写...

推荐理由:一手抓包数据带具体数字,不是转述。Sol Pro 的拆穿和缓存计费的发现都有实打实的信号,但来源是匿名群聊,没有官方确认,所以分数卡在 featured 门槛。

AI HOT 精选

腾讯混元发布 Hy3:295B 总参数、21B 激活的 MoE 模型,定位做 Agent 的 LLM,已接入微信

Hy3 是一个 295B 总参数、每次推理只激活 21B 的混合专家模型,推理效率能对标参数规模是它 2 到 5 倍的旗舰模型。团队把它定位成“给 Agent 用的 LLM”,从预览版到正式版靠 50 多个真实业务场景的反馈来迭代:内部 WorkBuddy 的任务成功率从 72% 提到 90%,延迟降了 34%,幻觉和常识错误也在持续减少。实测强项在写...

推荐理由:腾讯混元放出 Hy3,一个 295B 的 MoE 模型,定位是给 Agent 用的 LLM,已经接进微信服务 10 亿多用户。内部 WorkBuddy 的数据(成功率 72%→90%,延迟 -34%)让这个发布比纯 benchmark 刷榜更有分量。国内大厂旗舰模型落地,权重给到 featured。

7月12日星期日

Hacker News 首页

geohot 谈 AI 2040:智能不是一切,本地 AI 才是自由底线

George Hotz 用他在 comma.ai 做硬件的亲身经历反驳 AI 硬起飞论。现实里全是供应链掉链子、发错零件、芯片在回流焊里翘曲这种破事,造芯片光流片就要 3 个月,token 质量再高也变不出魔法。他把 AI 2027 那套叙事叫做自我实现的科幻保姆国家预言,并给出自己的 Plan L:一个跑在本地的、完全忠于用户的 AI,哪怕你让它帮忙...

推荐理由:Hotz 用 comma.ai 的硬件实战经验反驳硬起飞叙事,给出的流片周期等物理约束很具体,不是空对空辩论。他的个人身份自带关注度,但这终究是一篇观点评论,不是产品发布或研究突破,所以重要性有天花板。我会先打个折,给到 78 分,放在 featured 位置,因为它的讨论价值大于信息增量。

7月10日星期五

AI 群聊日报

GPT-5.6 Sol 发布日:跑分领先但群友实测还是给 Fable 打工,有人让它读完整个 GitHub 写遗书

OpenAI 把 Codex 客户端改名叫 ChatGPT,GPT-5.6 Sol 正式上线。官方跑分在 Terminal-Bench 2.1、BrowseComp 和 Agents' Last Exam 三项领先,价格只有 Fable 的一半,但群里用同一个代码库实测的结论是 Fable 还是好很多,5.6 的定位迅速收敛成给 Fable 当打工仔—...

推荐理由:GPT-5.6 Sol 上线是当天最大事件,这条群聊日报的价值在于补上了官方跑分之外的社区实测对比。信息密度高,有第一手判断。我会先打个折,因为来源是群聊整理而非一手信源,部分细节依赖群友自述,但整体信号很清晰。

Computing Life · Share · 鸭哥调研

别再往大模型窗口里塞几百万字了:用 RLM 像跑代码一样查 Context

Alex Zhang 提出的递归大语言模型(RLM)换了个思路处理长文本:不把资料塞进模型窗口,而是留在外部当数据,让模型自己写代码去查。在 depth=1 配置下,RLM 带着 GPT-5-mini 把 OOLONG-Pairs 的 F1 从 0.04% 拉到了 58.0%,BrowseComp-Plus 准确率从 0% 拉到 91.3%。但我会先打...

推荐理由:Alex Zhang 的 RLM 把长文本处理从“全塞进窗口”改成“当外部数据查”,用 GPT-5-mini 在 depth=1 时把两个硬骨头基准的分数从几乎为零拉到 58.0% 和 91.3%,效果摆在那。作者自己先打了折,说多层递归会失败,这种不吹牛的态度反而让人更信。分数卡在 78 是因为目前只绑定了 GPT-5-mini,换别的模型行不行还没验证,而且方法本身还在早期,先别太激动。

7月9日星期四

Hacker News 首页

Meta 发布 Muse Spark 1.1:一个能自己用工具、写代码、管多步骤任务的多模态推理模型

Meta 超级智能实验室推出了 Muse Spark 1.1,相比上一代在工具调用、电脑操作和写代码上提升明显。这个模型能直接上手没见过的工具和 MCP 服务器(一种让模型调用外部服务的协议),不需要额外训练。它支持 100 万 token 的上下文窗口,能记住之前干过什么,还会主动压缩记忆,只保留关键步骤。做复杂任务时,它可以自己当主控,把活拆给并行...

推荐理由:Meta 超级智能实验室把 Muse Spark 1.1 推出来了,工具调用、电脑操作和写代码都比上一代强,最抓人的是它不用额外训练就能上手没见过的工具和 MCP 服务器,还带 100 万 token 上下文和主动记忆压缩。正文没给基准对比和定价,所以分数先压一压,但 agent 开发者肯定会拿它跑测试,开源也让验证门槛变低。

Computing Life · Share · 鸭哥调研

GPT-5.5 的推理卡在 516 个 token:模型“想”的那一层会单独坏掉

开发者 vguptaa45 审计了 39 万条 Codex 响应,发现 GPT-5.5 在 44% 的编程任务里,推理部分刚好在 516 个 token 处截断,而 GPT-5.4 是 19.8%,GPT-5.2 只有 0.34%。被截断的任务全部答错,同一道题如果完整跑完 6000 到 8000 个 token 则全对。社区复现后,在 prompt ...

推荐理由:开发者 vguptaa45 翻查了 39 万条 Codex 回复,发现 GPT-5.5 在 44% 的编程任务里,推理部分会精准地在第 516 个 token 处断掉,断掉的题全错,而同一道题让它完整跑完 6000 到 8000 个 token 就全对。对比 GPT-5.4 的 19.8% 和 GPT-5.2 的 0.34%,这个 bug 像是新版本引入的。社区复现后找到了临时绕过的方法,对日常靠它写代码的人有直接参考价值。没给更高分是因为这更像一个具体版本的质量缺陷,影响面暂时局限在 Codex 的推理环节,正文没披露 OpenAI 是否已确认或修复。

AI HOT 精选

Anthropic 秘密提交 IPO 申请,三季度利润预计超 10 亿美元

SemiAnalysis 的报告说,Anthropic 今年第三季度利润会超过 10 亿美元,并且在 6 月 1 日已经秘密交了上市申请。它和 OpenAI 两家现在的年度经常性收入加起来快 1000 亿美元了。Anthropic 能跑在前面,主要靠 Claude Code 在开发者里用得特别猛,帮它在企业生意上赚到了钱,成了 B2B 市场的领跑者。O...

推荐理由:SemiAnalysis 这篇爆料给出了硬数字和明确的时间节点,可信度不低,但正文没披露 S-1 细节,所以重要性先打个小折。Anthropic 靠 Claude Code 在企业端跑通赚钱,比 OpenAI 先一步秘密交表,这件事对行业排序有直接影响,值得放在头条。

Hacker News 首页

SpaceXAI 发布 Grok 4.5,主打编程和自动化任务,用更少的输出 token 解决问题

Grok 4.5 是 SpaceXAI 目前最强的模型,专门为写代码、让模型进业务流程干活和知识类工作优化。在 SWE Bench Pro 这类编程基准测试里,它的解决率是 64.7%,虽然比 Fable 和 GPT 5.5 低,但有个很实在的优点:平均每次任务只输出约 1.6 万个 token,比 Opus 4.8 少了 4.2 倍,意味着推理成本更...

推荐理由:SpaceXAI 推出 Grok 4.5,定位是写代码和让模型进业务流程干活,跟 Cursor 联合训练算是个实在的差异化。SWE Bench Pro 上 64.7% 的解决率没超过 Fable 和 GPT 5.5,这点先别太激动,但它的省钱优势很具体:平均每次任务输出约 1.6 万个 token,比 Opus 4.8 少了 4.2 倍,意味着推理成本低不少。正文没披露定价和延迟,这两个才是决定它能不能打的关键。