跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 261–280 条 · 共 585 条

6月19日星期五

AI HOT 精选

DeepSeek研究员开源AutoResearch:AI自己跑完285B模型强化学习全流程

DeepSeek研究员Deli Chen放出了一个叫AutoResearch的实验协议,让AI智能体在285B参数的模型上独立跑完了一整套强化学习研究闭环——自己设计实验、写代码、提交GPU任务、修bug、写总结,全程没人插手。系统用了GRPO这个工具。不过正文没披露具体做了什么任务、训练了多久、成功率多少,这些关键信息都缺着,所以先别太激动,等有人复...

推荐理由:DeepSeek 研究员放出了一个实验协议,让智能体在 285B 模型上独立跑完强化学习研究闭环,设定很强。但正文没披露具体任务、训练时长、成功率这些关键指标,信息缺口太大,所以分数先打个折,等有人复现再说。

AI HOT 精选

Steve Yegge:Fable 被美国政府短暂关闭,意味着最聪明的 AI 模型以后会像核武器一样被锁起来

Steve Yegge 认为,Fable 模型被美国政府短暂关停是一个分水岭,说明模型智能已经危险到需要管控了。他预测,最多再过两三代模型,最前沿的 AI 就会像核武器一样被政府严格管制,绝大多数财富 500 强公司都拿不到访问权限。开源模型虽然能追到 Fable 这个级别,但受限于算力壁垒和供应链封锁,很难再往上突破。对大多数人来说,AI 能力曲线会...

推荐理由:Steve Yegge 把 Fable 被短暂关停这件事当成一个分水岭来聊,核心论点是 AI 能力曲线很快会被政府管制压平。判断很锋利,预测也具体,但本质是评论分析,不是一手报道,缺可核实的新事实,所以分数上我会打个折。

6月18日星期四

OpenAI News

OpenAI 用 o3 模型重查 376 个儿童疑难病例,帮医生揪出 18 个新诊断

波士顿儿童医院、哈佛和 OpenAI 拿 o3 的“深度研究”模式,把 376 个之前没查明白的儿童罕见病病例重新翻了一遍。模型不是直接看病,而是根据基因数据和临床症状,提出有文献证据支持的候选病因。医生团队审核后,再走 CLIA 认证实验室的流程做验证,最终确认了 18 个新诊断,相当于在专家已经看过的基础上又多找出 4.8% 的病因。研究发在 NE...

推荐理由:NEJM AI 发的正经研究,不是公关稿。o3 深度研究模式把 376 个之前没查明白的儿童罕见病病例重新翻了一遍,最终确认 18 个新诊断,有具体数字和 CLIA 验证管线。我会先打个折,不给 85+,因为这是单中心单次研究,没披露假阳性率和验证成本,换家医院能不能复现还不知道。78 分给在它展示了 AI 在真实疑难病例里能帮上忙,而不是又画了个饼。

Hacker News 首页

OpenRouter 让 11 个大模型打了 30 场吃鸡赛,Grok 4.1 Fast 赢了 43%,成本只有 Claude 的 1/27

OpenRouter 的 Jacky Liang 把 11 个模型扔进一个 2D 吃鸡游戏里打了 30 局。Grok 4.1 Fast 赢了 13 局,每赢一局成本 0.97 美元;Claude Sonnet 4.6 赢了 5 局,每赢一局要 26.78 美元,差了 27 倍。GPT 5.4 杀了 38 个人头,全场最高,但只赢了 2 局——杀得多不等...

推荐理由:OpenRouter 官方博客,作者 Jacky Liang 自己跑了 30 局并公开了完整数据和回放。Grok 4.1 Fast 的成本优势很扎眼,Claude Sonnet 4.6 贵但表现稳定,GPT 5.4 人头最多却赢不了——三个发现都有具体数字支撑,可复现、可验证。对正在选模型搭 agent 的人来说,这种实战对比比跑分表有用。

6月17日星期三

Hacker News 首页

GLM-5.2 登顶开源模型排行榜,在智能体任务上打平 GPT-5.5

Z.ai 的 GLM-5.2 在 Artificial Analysis 的 Intelligence Index v4.1 上拿了 51 分,超过 MiniMax-M3 和 DeepSeek V4 Pro(都是 44 分),成了目前最强的开源权重模型。模型体量没变,还是 744B 总参数、40B 活跃参数,但科学推理和智能体任务进步明显:HLE 涨了...

推荐理由:GLM-5.2 在 Artificial Analysis 的 Intelligence Index 上拿了 51 分,超过 MiniMax-M3 和 DeepSeek V4 Pro,成了最强开源权重模型。参数没变,分数涨了 11 分,科学推理和智能体任务有实打实的提升。但这是单一评测机构的单榜成绩,没有其他来源交叉验证,所以重要性给到 82 分,先打个折。

AI 群聊日报

群友实测:Fable 5 活了三天就被收走,但用过的人都说它是“上帝下凡”

Anthropic 的 Fable 5 模型上线大约 72 小时就被撤下,正文没披露具体原因。群友实测下来,它在复杂推理、编程和写作上明显强过 Opus 4.8 和 GPT-5.5:有人卡了两个月的难题它两分钟解决,MindStudio 测出多步编程自纠率 81%,Vellum 直接说这是“代差级跃升”。但它也有短板——代码评审精度不如 Opus 4....

推荐理由:Anthropic 的 Fable 5 短暂露面后被撤,群友实测数据扎实(81% 自纠率、代差级跃升评价),在钩子、干货和情绪共鸣三个维度都踩中了。扣分点在于信源是群聊整理而非官方发布,且下架原因正文没披露,所以重要性没给到顶。

Hacker News 首页

GLM-5.2(max)在综合智能榜排第一,但价格是同类开源模型的 3 倍

Z AI 在 2026 年 6 月放出了 GLM-5.2(max),一个总参数量 7530 亿、每次推理激活 400 亿参数的开源模型,用 MIT 协议。它在 Artificial Analysis 的智能指数上拿了 51 分,在 92 个模型里排第一,远超平均的 24 分。速度也不错,每秒能吐 112 个 token。但价格就贵了:输入每百万 tok...

推荐理由:GLM-5.2在Artificial Analysis的智能指数上拿了第一,速度和价格数据也摆出来了,MIT开源。分数没给更高是因为这只是一个评测平台的排名,不是模型正式发布,而且正文没拆开说这个51分具体由哪些任务构成,参考价值要打个折。

Latent Space

Z.ai 开源 GLM-5.2:744B 参数,前端编程跑分压过 Claude Opus 4.8

Z.ai 周末扔了个 MIT 许可的 GLM-5.2,744B 参数的 MoE 模型,主攻编程和长流程任务。第三方评测显示,它在 Code Arena 前端榜上把 Claude Opus 所有版本都超了,总榜也只比 Opus 4.8 差一点。模型支持 100 万 token 上下文,有 high 和 max 两档推理模式,API 价格和 5.1 一样,...

推荐理由:GLM-5.2 在 Code Arena 前端榜上压过了 Claude Opus 所有版本,总榜也只比 Opus 4.8 差一点。744B 的 MoE 加 MIT 许可,对前端和 agent 开发者来说是个实打实的新选项。没给到 85 分以上,是因为目前只有第三方评测和官方说法,正文没披露技术报告或自家复现结果,这点先别太激动。

Computing Life · Share · 鸭哥调研

推理模型四年史:你以为的石破天惊,其实早有暗线

推理模型不是2024年突然蹦出来的。让模型写解题步骤的思维链、用自己生成的正确推理训练自己的STaR、给中间步骤打分的过程奖励模型,这些技术从2022年起就陆续成熟了。o1真正改变的是产品化:把推理变成一种可以计费、可以调度的资源,在API里引入reasoning tokens和可调节的思考强度参数,相当于给scaling law开了第二个轴。Deep...

推荐理由:这是一篇有信息量的长文综述,用具体论文和时间线追溯推理模型的技术源头,核心判断是o1的分水岭在于把推理产品化成可计费算力,而非发明了推理本身。HKR三项都踩中,但属于梳理整合型内容而非独家爆料,放在78分、featured层级合理。

AI HOT 精选

Sumi:从头训练的 7B 开源均匀扩散语言模型

Sumi 是第一个从零开始、用 1.5 万亿 token 预训练出来的 7B 参数均匀扩散语言模型。均匀扩散的意思是,模型在生成文本时每一步都可以修改任意位置的词,不像传统模型只能从左往右写,理论上更灵活。团队把模型权重、训练检查点和完整配方全公开了,包括用了哪些公开数据集、怎么混合的。在知识、推理和代码评测上,Sumi 跟同等训练量的自回归模型打得有...

推荐理由:Sumi是第一个从零预训练出来的7B均匀扩散语言模型,用了1.5万亿token,生成时能在任意位置改词,不像自回归模型只能从左往右写。团队把权重、训练检查点和完整配方都公开了,在知识、推理和代码评测上跟同等训练量的自回归模型打得有来有回。这点先别太激动——正文没披露推理速度和实际部署成本,扩散模型在落地时往往比自回归慢不少。不过敢在主流路线之外砸资源从头训一个7B模型,还把家底全亮出来,本身就值得关注。

6月16日星期二

AI HOT 精选

蚂蚁百灵开源三款新模型,用混合注意力架构把推理速度拉到 340 tokens/s

蚂蚁百灵发了 Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T 的技术报告,代码和权重都公开了。三款模型用了同一种 Hybrid Linear Attention 架构,把 Lightning Attention 和 MLA 按 7:1 的比例拼在一起,主要为了在长文本上跑得快、省资源。Ling-2.6-flash 在 ...

推荐理由:蚂蚁百灵这次开源了三款模型,核心卖点是把 Lightning Attention 和 MLA 按 7:1 的比例揉成一个 Hybrid Linear Attention,主要为了在长文本上省资源、跑得快。报告给了具体参数和效率数据,代码权重都公开,信息扎实,所以给了 featured。没打更高是因为蚂蚁的模型在社区关注度上还比不上那几个顶流实验室,实际业务里的表现也得再观察,我会先打个折。

6月15日星期一

AI HOT 精选

MiniMax 开源 M3 模型,428B 总参数里只激活 23B,长文本推理更省钱

MiniMax 把 M3 模型权重放出来了,总参数 428B,每次推理只激活 23B,同时发了 MSA 稀疏注意力论文,专门降长上下文推理成本。M3 是第一个从预训练阶段就用图文交错数据练出来的开源模型。发布两周后,它在 Artificial Analysis 综合智能指数和 GDPval-AA 上拿了开源第一,Code Arena WebDev 进了...

推荐理由:MiniMax 把 428B 的 M3 模型权重和 MSA 稀疏注意力论文一起放出来,主打长上下文推理省钱,两周内拿了两个开源第一。我会先打个折,因为这是官方公告,没有第三方基准或具体的 MSA 成本数字,但架构稀缺性和开源排名已经够上 featured。

AI HOT 精选

Kimi K2.7 Code 出了个高速版,写代码输出快 5-6 倍,但 API 价格翻倍

Kimi 给 K2.7 Code 模型加了个高速通道,模型本身没变,但输出速度拉到常规编程约 180 Token/s、短上下文能冲到 260 Token/s,是普通版的 5-6 倍。代价是 API 调用价格翻倍,Kimi Code Plan 用户消耗按 3 倍算。用的时候必须开思考模式,关掉会报错或退回 K2.6。跟上一代 K2.6 比,K2.7 Co...

推荐理由:Kimi K2.7 Code 高速版是个推理加速通道,模型本身没换,靠堆资源把输出拉到 5-6 倍速,价格也翻倍。对用 Kimi 写代码的人是个实用更新,但算不上行业级事件。H 和 K 都踩中了,R 没到,分数维持 featured 没问题。

6月13日星期六

AI 群聊日报

美国出口管制突袭 Fable 5,Anthropic 两小时内全球断供;智谱 GLM-5.2 趁乱全量开源

美国商务部把 Fable 5 和 Mythos 5 列入了出口管制,禁止向境外和美国境内的外籍人士提供服务,连 Anthropic 自己的外籍员工都用不了。Anthropic 在收到指令后两小时内就关停了这两个模型,但声明里说政府引用的越狱漏洞其实在 GPT-5.5 等公开模型里也广泛存在,单凭这个就禁掉面向数亿人的模型不合理。群友分析指出,这次管制的...

推荐理由:美国商务部对Fable 5和Mythos 5实施出口管制,两小时内切断访问,行业震动。Anthropic的反驳提供了关键事实对冲:漏洞并非独家,禁令依据存疑。群聊讨论和GLM-5.2借势全量上线构成多源信号。扣分在于正文没披露管制具体条款和后续法律动作,但事件本身冲击力足够。

AI HOT 精选

Anthropic 关停 Claude Fable 5,Opus 4.8 和 GPT-5.5 仍是推荐组合

Anthropic 按美国政府指令,对所有用户停用了 Claude Fable 5。现在新会话默认切到 Opus 4.8,之前用 Fable 5 的会话会直接报错。DAIR.AI 的 Elvis Saravia 让大家别慌,他说 Fable 5 对多数任务本来就不值——成本高,性能还被砍过。他现在的建议还是规划用 Opus 4.8,执行用 GPT-5....

推荐理由:Anthropic 的主力模型被政府指令直接下架,是政策直接撞上产品的罕见事件。Elvis 给了具体的替代方案和成本判断,对 Claude 用户有实际帮助。分数没给更高是因为信源是个人推文,没有 Anthropic 官方声明或指令原文,信息缺口明显。

6月12日星期五

AI HOT 精选

Kimi 开源了 K2.7-Code 代码模型,内部跑分比上一代高 11% 到 31.5%,推理还省了 30% 的 token

Kimi 把最新的代码模型 K2.7-Code 开源了。跟上一代 K2.6 比,它在自家三个测试集上分数都涨了:Kimi Code Bench v2 涨了 21.8%,Program Bench 涨了 11%,MLS Bench Lite 涨了 31.5%。推理时吐出的 token 量少了 30%,相当于同样的活儿更省算力。长代码任务里,模型更听指令、...

推荐理由:Kimi 开源 K2.7-Code,自家三个基准分数都涨了两位数,推理 token 量还砍了 30%,成本信号很实在。但没给参数量,也没跑外部通用基准,所以分数先打个折,定在 82。国内大模型公司开源代码模型这件事本身就有竞争意义,值得关注。

AI HOT 精选

Hugging Face 开源了 Open-R1,要完整复现 DeepSeek-R1 的推理能力

Hugging Face 在 GitHub 上发布了 Open-R1 仓库,目标是完全复现 DeepSeek-R1 这个推理模型。目前仓库已经拿到 2.61 万颗星和 2.4k 次复刻,但正文只放了项目首页的导航和元数据,没有公开具体的实现计划、训练数据、复现进度或跑分结果。我会先打个折,把它看作一个公开的复现框架和协作入口,等有技术报告出来再判断还原...

推荐理由:Hugging Face 发起了 DeepSeek-R1 的完整开源复现,仓库星数冲到 2.61 万,社区关注度很高。但正文只搭了个项目框架,没披露具体怎么实现、用什么数据、复现到哪一步了,也没有任何跑分。我先打个折,把它看作一个公开的复现入口和协作框架,等有技术报告或训练细节出来再判断到底还原了多少。

6月11日星期四

机器之心 · 公众号

ACL 2026 Oral:大模型在短语语义推理上还是“如鲠在喉”

这篇ACL 2026 Oral论文给前沿大模型做了一次短语层面的“体检”,结论有点反直觉:模型能聊但未必真懂。研究把语义理解拆成抽取、分类、释义三步来测,发现没有一个模型能全优。GPT-5在习语分类上能到85.4%,但同一批短语的抽取就掉到78.7%,释义相似度更是只有22.5%。DeepSeek-R1的分类准确率在选项从4个变16个时,直接从81.7...

推荐理由:ACL 2026 Oral 论文,用短语层面的三项任务给 GPT-5 和 DeepSeek-R1 做体检,结论反直觉:模型聊天流畅但短语理解拉胯。数字具体,能直接拿来当参考。没给更高分是因为这是单篇学术论文,没有跨源验证,纯基准测试的落地影响有限。

机器之心 · 公众号

谷歌开源 26B 文本扩散 MoE 模型 DiffusionGemma,推理时只激活 3.8B 参数,一次生成 256 个 token

谷歌发了一个实验性的开源模型 DiffusionGemma,用的是 Apache 2.0 协议。它不走自回归模型逐 token 生成的路线,而是一次性起草 256 个 token 的文本块,把解码瓶颈从内存带宽转向了计算本身。在单张 H100 上能跑到每秒 1000+ token,比自回归模型快最多 4 倍。模型总规模 26B,但推理时只激活 3.8B...

推荐理由:谷歌开源了一个 26B 的文本扩散模型,跳过自回归解码,推理只激活 3.8B 参数,单张 H100 跑到每秒 1000+ token。Apache 2.0 协议,有具体的速度对比和机制说明,对做推理优化的人有直接参考价值。不是公关稿,数字和做法都给了,值得放进精选。

6月10日星期三

r/LocalLLaMA

用约3美元API调用微调Qwen2.5-7B,在特定任务上达到Claude Haiku 96%的表现

一位Reddit用户用1040组偏好样本(DV-DPO,一种让模型学会回答风格的方法)微调了Qwen2.5-7B,成本按Claude Haiku的API价格算大约3美元,没花钱请人标注。在特定领域任务上,这个微调模型的综合得分达到了Claude Haiku的96%。部署在4-bit量化的T4机器上,生成一次回答的延迟是11秒。不过正文没披露具体是什么任...

推荐理由:这条信息本身是个Reddit帖子,任务范围和评测细节正文没展开,所以分数先打个折停在74。但3美元、零标注、96% Haiku这几个数字组合在一起,对想省钱又不想雇人标数据的团队来说,是个值得看一眼的信号。