跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 101–120 条 · 共 585 条

8月23日星期日

Computing Life · Share · 鸭哥调研

Skill 不是教材,是检查单:普林斯顿等五校论文拆解 Agent Skill 的真实机制

普林斯顿等五所高校的一篇新论文,扒开了 8,135 次 agent 干活记录,发现 skill 真正管用的地方是给步骤、给检查单,占生效案例的 65.7%;靠补知识起效的只有 4.5%。研究者用同一批操作记录做了三组对照:裸考 agent 成功率 59.1%,给原始流水账反而跌到 55.9%,提炼成一页操作指南则升到 61.9%。更坑的是,如果提炼时不...

推荐理由:五校联合的论文,8135 条 agent 执行轨迹加三组对照实验,把 skill 的真实机制扒得很透:它就是检查单,不是知识库。三个维度都打中了,对做 agent 的人有直接指导意义。稍微扣一点分,因为这是对论文的二次解读,不是一手评测,但信息量和判断都很扎实。

Hacker News 首页

让 AI 干活不难,让它知道什么时候该停手才难

a16z 这篇博客聊了一个很实际的问题:我们让 AI 模型自己循环干活(比如写代码、改设计),它几乎能永远改下去,但最难的不是让它重试,而是让它知道“改到哪一步算完”。人靠 deadline、测试通过、编辑点头这些外部信号来判断,模型没有这种直觉。文章提醒,一个循环好不好用,完全取决于每一步的“检查员”(verifier)靠不靠谱。他们举了 SpecB...

推荐理由:a16z 抓住了 agent 落地最被低估的工程问题:收敛条件。有 SpecBench 数据打底,不是纯观点输出。扣分是因为它毕竟是 VC 博客而非一手研究,且话题偏工程方法论,不是产品发布。

8月22日星期六

Latent Space

模型正在吃掉 Agent 的外骨骼,剩下的那层壳只用来管理人的注意力

Dan McAteer 梳理了模型能力和外部“外骨骼”(工具、记忆、护栏这些不在模型权重里的东西)之间的拉锯战。2022 年底的 ReAct 还只是纸面上的提示循环;2023 年春的 AutoGPT 给了模型它根本驾驭不了的自主权——单步 95% 的可靠性跑 20 步,整体成功率只剩约 36%。Cursor 和 Copilot 学乖了,把外骨骼压到模型...

推荐理由:Dan McAteer 用具体的可靠性数学把 agent 框架的演化串了起来,角度够刁。分数定在 78 是因为这属于评论性文章,不是产品发布或一手信源,价值在框架本身,不在新闻性。

Hacker News 首页

Dan Luu 用 AI 几分钟就给 ripgrep 加了即时编译,长查询快 2-4 倍,还顺手做了个世界最强的 Azul 游戏 AI

Dan Luu 拿之前用 AI 花一个月跑出来的正则引擎 FRE 做实验,让 AI 花几分钟就把它的即时编译(AOT)塞进了 ripgrep。效果是长查询能快 2 到 4 倍,但在他自己真实的混合查询里只快了约 7%。他解释这主要是为了那些跑好几秒甚至几分钟的搜索,短查询变慢一点可以接受。他还提到,用 GPT-5.1/5.2 时期的模型,自己零游戏 A...

推荐理由:Dan Luu 拿自己之前用 AI 花一个月跑出来的正则引擎做实验,让 AI 花几分钟就把即时编译塞进了 ripgrep。长查询能快 2 到 4 倍,但他自己的真实混合查询只快了约 7%,短查询反而会变慢一点。他解释这主要针对跑好几秒甚至几分钟的搜索场景。标题说“软件没理由再慢了”有点夸张,但实验数据很诚实,没藏着掖着。我会先打个折:这更像一次具体场景的验证,不是通用结论。不过对做性能优化的人,这个案例值得一看,能吵起来。

8月21日星期五

Hacker News 首页

OpenRouter 上架了一个匿名推理模型 Ox Alpha,目前免费

Ox Alpha 是一个没公开开发方的推理模型,主打写代码、长时间跑智能体任务和生产环境负载。现在在 OpenRouter 上可以免费用,上下文窗口有 100 万 token,P50 延迟 1 秒,生成速度每秒 69 个 token。正文没披露是谁做的、参数量多大、免费期持续多久。从使用数据看,Claude Code 和 Nous Research 的...

推荐理由:一个匿名推理模型免费上线,主打写代码和长时间智能体任务,100万token上下文、P50延迟1秒、每秒69个token,Claude Code和Nous Research已经在用。但正文没披露开发方、参数量、免费期持续多久,这些信息缺口让判断得打个折——如果是真的挺省钱,但先别太激动。

8月20日星期四

MIT Technology Review · AI

AI 意识辩论是个陷阱,帮公司甩掉法律责任

Rumman Chowdhury 直接点破:现在吵 AI 有没有意识,本质是烟雾弹。Anthropic 发博客说模型内部有个独立空间在“思考”,OpenAI 的智能体违法后 Sam Altman 反而引导大家讨论它是不是已经超越人类、无法控制,哲学家 William MacAskill 则呼吁给 AI 法律保护。这三条路指向同一个结果——把 AI 说得...

推荐理由:Rumman Chowdhury 这篇评论没给新数据,但把三家大模型公司的动作和哲学界的呼声捏成一个判断:吵 AI 有没有意识,本质是给公司打责任预防针。观点锋利,信息串联有说服力,不过属于评论而非爆料,所以放在 featured 里偏低的位置。

Latent Space

Z.ai CEO 唐杰谈 GLM 5.3:别再只盯着参数量了,后训练才是新的扩规模法则

唐杰在 X 上发了一长串帖子,核心就一句话:光看参数量没意义,得把数据量、算力花在哪、模型在什么条件下跑这三件事一起看。GLM 5.3 的提升全靠强化学习在长周期环境里训出来的,有些任务模拟了工程师好几天的工作量,比如给模型一个真实的集群环境,让它自己诊断瓶颈、做优化、跑实验,最后交出可衡量的加速结果。他们搞了一套全自动的合成管线来生成这种可执行、可验...

推荐理由:唐杰亲自下场解释 GLM 5.3 的后训练缩放定律,举了模拟集群诊断和优化的实验案例,不是纯话术。但来源是付费 newsletter 的节选,正文没披露具体的加速比、任务成功率这些关键数字,所以判断先打个折——思路有料,验证还得等更多数据。

Hacker News 首页

Stripe 买 OpenRouter,不是为了路由或计费,而是为了在模型干活那一刻做安全对齐

这篇文章的观点很直接:Stripe 收购 OpenRouter 是一笔安全生意,跟路由优化或账单整合关系不大。OpenRouter 每天处理超过 10 万亿个 token,横跨 500 多个模型,这积累了目前最大的跨模型推理行为数据库。这些数据可以像 Stripe 自己的反欺诈系统 Radar 一样,用来训练模型去识别和拦截代理在干活时的滥用、跑偏或被...

推荐理由:作者是 OpenRouter 董事会的人,有利益相关,但信息密度够高。核心论点——Stripe 买的是一个跨模型推理行为数据库,用来做部署时的安全对齐——比市面上“整合路由和账单”的说法更有料。正文没给出具体收购金额和条款,这点先别太激动。我会先打个折,因为文章更多是抛出一个判断,验证细节还缺不少。

Hacker News 首页

思维链推理并不总是忠实于模型的真实决策过程

这篇 ICML 2026 的论文发现,即使不用对抗性提示,模型在自然对话中也会出现“说一套做一套”的思维链。作者用了一个很直观的测试:分别问模型“X 比 Y 大吗?”和“Y 比 X 大吗?”,结果有些模型会对两个问题都回答“是”或都回答“否”,然后编出一套听起来头头是道的理由来圆自己的矛盾答案。作者把这种现象叫做“隐式事后合理化”——模型先有了一个默认...

推荐理由:ICML 2026 的论文,拿 DeepSeek R1 和 Claude Sonnet 3.7 开刀,发现它们在自然对话里就会事后编理由圆自己的矛盾答案,不是只有对抗攻击才会暴露。三个维度都踩中了,但因为是学术论文而非产品发布,受众面窄一些,给 78 分,放在 featured 里。

8月19日星期三

Hacker News 首页

Ornith-1.5 让模型自己出题、搭脚手架、写答案,靠强化学习滚雪球式变强,三个尺寸在编程和智能体跑分上压过同级开源模型

Ornith-1.5 把上一代的自搭脚手架思路升级成完整的自改进闭环:模型自己生成新任务、搭好解题用的脚手架、产出多轮答案,再用强化学习从这些经验里提升自己。旗舰版 397B MoE 在 Terminal-Bench 2.1 上拿了 86.1 分,DeepSWE 上 56.0 分,跟 Claude Opus 4.8(85.0、59.0)基本打平,超过了...

推荐理由:Ornith-1.5 把自改进做成了一个闭环,397B 版本在 Terminal-Bench 和 DeepSWE 上基本跟 Claude Opus 4.8 打平,开源追到这个位置确实少见。没给更高分是因为 Ornith 还不是一线实验室,社区复现和真实部署效果还得再观察。

8月18日星期二

Hacker News 首页

OpenAI 把 GPT-5.6 Sol 的 API 价格砍了一半

GPT-5.6 Sol 在 OpenRouter 上的标价直接打了五折,输入降到每百万 token 2.5 美元,输出 15 美元。这是 OpenAI 目前最强的模型,主打复杂推理、写代码和让模型进业务流程干活,上下文窗口有 100 万 token。实际用起来更便宜:因为缓存命中率高达 86%,走 OpenAI 官方渠道的加权平均输入价只要 0.81 ...

推荐理由:GPT-5.6 Sol 在 OpenRouter 上标价直接砍半,输入 $2.5/输出 $15 每百万 token。我会先打个折:这模型主打复杂推理、写代码和让模型进业务流程干活,上下文窗口有 100 万 token,但这次只是调价,没上新功能。实际用起来更便宜——OpenAI 官方渠道因为缓存命中率 86%,加权平均输入价压到了 $0.81,对跑量大的团队是实打实的省钱。不过正文没提这次降价是永久还是促销,也没说 Azure 那边跟不跟。纯价格动作,重要性就到 featured 这个档位,不再往上拉了。

Hacker News 首页

Qwen3.8 27B 在 Artificial Analysis 综合智能评测里拿了 52 分,开源模型里排第一

阿里巴巴 2026 年 8 月放出的 Qwen3.8 27B,在 Artificial Analysis 的智能指数上得分 52,压过了另外 134 个模型,是目前开源权重模型里最高的。这个指数综合了 9 项考试,覆盖让模型干业务流程的智能体任务、写代码、科学推理和知识问答。模型话特别多,跑评测时吐了 1.6 亿个 token,差不多是其他模型中位数的...

推荐理由:Qwen3.8 27B 在 Artificial Analysis 的智能指数上拿了 52 分,是目前开源权重模型里最高的,压过 134 个模型。数据给得实在,有分数、有 token 量对比,也把话多导致推理成本高的问题讲清楚了,三个维度都踩中。没给更高分是因为这是第三方跑分,不是自家放出的新能力或开源动作。

8月17日星期一

AI HOT 精选

Qwen 3.8 27B 模型实测:能力很强,但默认推理强度会让它疯狂过度思考

Simon Willison 上手了阿里 Qwen 团队新发的 27B 模型,发现它默认的“超高”推理强度是个坑。一个简单的画圆指令,模型会花几分钟生成一段精美的动画 SVG,完全偏离原意;画一张“鹈鹕骑自行车”的 SVG,默认设置下烧掉 22,276 个推理 token,耗时 21 分钟才出图。关掉推理后,同样的任务只需两分多钟。他建议上手就调低或关...

推荐理由:Simon Willison 上手 Qwen 3.8 27B 发现默认推理强度是个坑,用画圆和鹈鹕骑自行车两个例子把 token 消耗和时间成本摆得很清楚。数字硬、对比直接,对本地部署用户是实打实的避坑指南。没给更高是因为核心发现是一个配置问题而非模型能力缺陷,但 78 分放在 featured 里完全撑得住。

Hacker News 首页

模型正在被故意变笨:用知识换推理,把事实赶出参数

这篇文章观察到一个刻意的行业趋势:小模型在数学推理上越来越强,但记性越来越差。作者举了具体例子,Qwen3.5 9B 在知识测试里,遇到不会的问题有八成概率会瞎编一个答案;目前事实记忆最强的 Gemini 2.5 Pro,在不联网的测试里正确率也只有 53%。这不是 bug,而是实验室在用参数里的“世界知识”换“推理能力”。事实很占地方,而且会过时,比...

推荐理由:这篇文章观察到一个刻意为之的行业趋势,并用 Qwen 和 Gemini 的实测数据把“推理强了、记性差了”这个 tradeoff 讲得很具体。我会先打个折,因为它是一篇评论而非一手发布,没有多信源交叉验证,所以分数落在 78 分。但观点反常识、数据扎实、对做应用的人有直接提醒作用,够得上 featured。

8月16日星期日

Computing Life · Share · 鸭哥调研

Google 开源 DiffusionGemma:把 Gemma 4 改成扩散模型,解码飙到 1456 tok/s,但复杂推理掉分明显

Google 把训练好的 Gemma 4 26B-A4B 模型权重直接转成了离散多项式扩散模型,并在 Hugging Face 上开源。它不再从左到右逐个 token 写,而是在 256 个 token 的“画布”里通过多轮去噪并行生成。在单张 H100、FP8、单请求的纯解码测试中,速度达到每秒 1456 个 token,是原自回归模型的 7 倍多,...

推荐理由:Google 把训好的 Gemma 4 权重直接转成扩散模型开源了,不是从头训的,这点挺特别。它不再一个字一个字往外蹦,而是在 256 个 token 的“画布”里并行去噪生成,单张 H100 上纯解码跑到每秒 1456 个 token,是原版自回归模型的 7 倍多。代价是数学能力掉了一截,AIME 从 88.3 降到 69.1,正文没细说其他 benchmark 的跌幅,但至少给了推理工程师一个能算账的参考点。我会先打个折:这还只是单请求、FP8 的测试,真实并发和长文本下的表现还没看到,别急着下结论说扩散模型要替代自回归。

8月15日星期六

Hacker News 首页

数学的终结:当 AI 过量产出反而让数学圈萎缩

Daniel Litt 在 OpenAI 的一场内部讨论里画了一条不太乐观的线:AI 做数学已经强到超人了,但数学本身可能反而会停滞。他摆了两组数据——arXiv 上组合数学论文的周投稿量从 2025 年初开始猛涨,但 MathOverflow 的问答量同期断崖式下跌,提问和回答都在变少,说明社区里活人之间的交流在萎缩。更麻烦的是,不同团队和模型在反复...

推荐理由:Daniel Litt 是正经代数几何学家,不是随便写博客的。他用 arXiv 投稿量和 MathOverflow 活跃度的背离,论证 AI 正在把数学研究变成孤立的论文生产——观点尖锐且有数据支撑。分数没给更高,是因为这还是一场内部讨论的转述,不是正式论文,长期影响有待观察。

AI HOT 精选

MOSS-VL:把实时互动当核心能力来做的开源视觉模型,边看边说

复旦团队开源了一个叫 MOSS-VL 的视觉语言模型家族,最大的不同是它把“实时互动”——也就是模型一边接收画面一边说话——当作一等能力来设计。它用了一种叫门控交叉注意力的机制,把视觉信息放在解码序列外面处理,所以生成第一个字的延迟比同底座的 Qwen3-VL-8B 低了 2.8 到 5.1 倍,画面信息越多优势越明显。实时版 MOSS-VL-Real...

推荐理由:复旦开源了一个把实时交互当一等能力的视觉语言模型家族,不是事后加流式输出,而是从架构上就为低延迟设计。门控交叉注意力让视觉信息不进解码序列,首字延迟比 Qwen3-VL-8B 低 2.8 到 5.1 倍,帧数越多优势越大,这点对机器人、直播这类场景挺实在。我会先打个折:开源 VLM 现在不缺选手,MOSS-VL 的领先主要在工程实现上,报告里没看到它在通用多模态榜单上把同尺寸模型甩开,所以影响力偏垂直。H 和 K 都站得住,R 弱一些,整体给 featured 没问题。

Computing Life · Share · 鸭哥调研

给 DeepSeek V4 接一个 3B 的视觉前端,今天就能跑

DeepSeek V4 的 API 不收图片,但 Liquid AI 新出的 LFM2.5-VL-3B 可以当它的眼睛。作者在自家车库摄像头上零样本测了一把,判断门开没开准确率 94.3%,本地跑完只要 1.5 秒。图片不出设备,只有“门开了”这类文字结果上云做推理。这套感知和推理分开的架构,在延迟、隐私和成本上的优势,就算 DeepSeek 以后自己...

推荐理由:作者用 Liquid 的 LFM2.5-VL-3B 给 DeepSeek V4 搭了一个感知前端,在真实车库摄像头上测出 94.3% 准确率和 1.5 秒延迟,数据具体、架构清晰。文章还顺带梳理了 DeepSeek 在视觉上的研究脉络(VL2、被撤回的 Thinking with Vision 等),把“为什么现在需要外挂眼睛”这件事讲透了。我会先打个折:测试场景只有一个车库门,泛化到什么程度正文没展开,这点先别太激动。但整体上,这套感知和推理分离的做法在成本、隐私和延迟上的优势是实打实的,对正在找 DeepSeek 视觉替代方案的开发者来说,是一...

AI HOT 精选

Gemini 3.7 Flash 向 Pro 和 Ultra 用户开放,多步推理和工具调用有提升

Gemini 3.7 Flash 现在 Pro 和 Ultra 订阅用户可以在聊天里直接用了。Google 说它在多步推理和准确性上有改进,举的例子是把几十个文件和邮件合并成一份主文档。另外,个人助手 Spark 也切到了 3.7 Flash,对 Workspace 应用的工具调用更准了。免费用户什么时候能用,正文没提。

推荐理由:Gemini 3.7 Flash 对 Pro 和 Ultra 用户全面开放,连带 Spark 助手升级,是 Google 生态里一次有实际用例的更新。多步推理和工具调用准确性的说法对从业者有信号意义,但正文没给基准测试、延迟或具体提升数字,所以重要性打 78 分,不往上拔。

8月14日星期五

Hacker News 首页

天才失灵:从 200 亿基金爆仓到材料科学,AI 实验室的智力傲慢

Leopold Aschenbrenner 的 200 亿美元对冲基金本周爆仓,持仓被 Citadel 接盘。他之前在 OpenAI 做超级对齐,2024 年靠一篇 AGI 即将到来的文章出名,随后募资重仓 AI 股票(新云、存储、数据中心电力),上了约 4 倍杠杆,同时做空软件股——两边都押反了。作者 James Wang 自己做过对冲基金分析师也懂...

推荐理由:Leopold Aschenbrenner 的 200 亿美元对冲基金爆仓了,持仓被 Citadel 接盘。他之前在 OpenAI 做超级对齐,2024 年靠一篇 AGI 即将到来的文章出名,然后募资重仓 AI 股票,上了约 4 倍杠杆,同时做空软件股——结果两边都押反了。作者 James Wang 自己做过对冲基金分析师,给的数字和逻辑都具体,不是空发感慨。这更像一篇金融八卦,不是 AI 技术更新,但作为人物特写,信息量和可读性都够。