跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 361–380 条 · 共 585 条

5月22日星期五

彭博科技

DeepSeek 创始人把目标定为通用人工智能,同时一笔 100 亿美元的融资在推进

彭博这条快讯只给了标题,正文被付费墙挡住了。标题说 DeepSeek 创始人公开把 AGI(通用人工智能)设为目标,并且公司正在推进一轮 100 亿美元的融资。但创始人具体怎么说的、钱从哪来、谁领投、估值多少、钱打算怎么花,这些关键信息正文都没披露。100 亿这个数字放在 AI 创业公司里非常夸张,如果是真的,说明资本市场对 DeepSeek 的预期已...

推荐理由:标题信息量不小,但正文基本是空壳,没给出创始人原话、融资细节或任何时间线。我会先打个折:这条消息的传播价值在于 DeepSeek 把 AGI 目标和巨额融资同时抛出来,信号很强,但事实支撑很弱。Bloomberg 的稿子只给了标题级事实,投资人是谁、钱怎么花、估值多少全没写,所以重要性停在 86 分是合理的,不能再往上拉。

机器之心 · 公众号

Meta 华人团队发布 ATLAS:用一个词让视觉模型学会可泛化的推理

Meta AI 和港中文的研究者搞了个叫 ATLAS 的方法,核心是在视觉语言模型里塞一个“功能词”(Functional Token),让模型能同时走两条路:一条是显式的、一步步调用工具去操作图像(Agentic 推理),另一条是隐式的、在内部潜空间里直接算(Latent 推理)。他们配套搞了个 ATLAS-178K 数据集,分两阶段训练——先做监督...

推荐理由:我会先打个折:这是 Meta AI 和港中文联合发的研究,不是产品发布或旗舰模型,所以重要性给到 78 分比较合适。一个 Functional Token 搞定视觉推理这个 hook 确实抓人,正文也给了数据集和训练方法的细节,对做多模态和 agent 的团队有参考价值。但正文没披露实际部署成本或大规模验证结果,这点先别太激动。

Computing Life · Share · 鸭哥调研

OpenAI 的通用推理模型推翻了一个 80 年没人撼动的数学猜想

GPT-5 否证了 Erdős 在 1946 年提出的平面单位距离猜想。这个猜想说平面上 n 个点最多只能有约 n 对距离为 1 的点,80 年里数学家都信这个。模型没走证明路线,而是直接构造反例,用上了代数数论里跟几何八竿子打不着的工具,把单位距离对的数量推到了 n 的 1.014 次方。Fields 奖得主 Tim Gowers 审完证明说,如果是...

推荐理由:我会先打个折,因为正文没给论文、没给证明过程、也没说复现条件,信息缺口不小。但一个没专门练过数学的通用模型,推翻了一个 80 年没人动得了的 Erdős 猜想,还有 Fields 奖得主背书说能投顶刊——这个事实本身分量很重,属于当天就该推的消息。HKR 三项全中,重要性给 90 是合理的,再高就需要更多证据了。

NVIDIA 博客

NVIDIA 在 COMPUTEX 2026 拿了四个奖,Vera Rubin NVL72 号称推理能效比上代高 10 倍

NVIDIA 在 COMPUTEX 2026 上靠 Vera Rubin NVL72、Jetson Thor 和 Alpamayo 拿了四个 Best Choice 奖。Vera Rubin NVL72 把 36 颗 Vera CPU 和 72 颗 Rubin GPU 连在一起,NVIDIA 说它每瓦推理性能是上代的 10 倍,每个 token 的成本...

推荐理由:我会先打个折:这是 NVIDIA 自己活动博客发的,不是第三方实测,10 倍能效得看什么负载、跟谁比。但 Vera Rubin NVL72 的规格和能效数字本身够硬,对算力成本和采购节奏有直接参考价值,所以给 featured。正文没披露具体基准测试条件和上市时间,这点先别太激动。

5月21日星期四

r/LocalLLaMA

HRM 1B:一个用极低成本训练的小模型,性能号称能打 2B-7B 的开源选手

Sapientinc 开源了一个叫 HRM-Text 1B Base 的小模型,连训练代码也一起放出来了。论文里的说法是,它的性能可以和 2B 到 7B 的开源模型掰手腕,但训练用的数据量只有别人的百分之一到九百分之一,算力消耗更是只有别人的 1/96 到 1/432。具体来说,用 16 块 H100 GPU 训练了大概 46 小时,总花费约 1,47...

推荐理由:HKR 三项都站得住:HRM-Text 1B 有具体的低成本训练数字和公开代码。卡在 80 分是因为消息源是 Reddit,效率提升的说法还没有独立评测背书,我会先打个折。

Latent Space

OpenAI 用通用推理模型花不到 1000 美元,推翻了一个 80 年前的数学猜想

OpenAI 公布了一个内部通用推理模型(外界猜是 GPT 5.6)的成果:它找到了平面单位距离问题的新构造族,推翻了 1946 年 Erdős 提出的一个猜想。这个模型不是专门为数学训练的,就是普通的语言模型,但推理过程生成了约 125 页的总结。有外部观察者推测,这次运行只用了不到 32 小时,成本不到 1000 美元。数学家 Timothy Go...

推荐理由:HKR 三项都成立:一个内部推理模型声称驳倒了 1946 年的 Erdős 问题,输出约 125 页,这是很强的能力信号。不过成本和运行时间目前还是外部推测,正文没披露 OpenAI 自己的官方数字,所以分数没给到 95。

AI HOT 精选

OpenAI 模型自己解了一道 80 年没搞定的平面几何题,用的还是数学家觉得走不通的路

OpenAI 的一个模型独立解决了 1946 年埃尔德什提出的“平面单位距离问题”。这道题近 80 年来大家一直觉得最优解长得像方格子,但模型搬出了代数数论里比较冷门的 Golod-Shafarevich 理论,找到了一整族效率更高的新构造,把老结论推翻了。这是 AI 头一回自己搞定一个数学核心开放问题,关键就在于它提出并完整执行了一条人类因为直觉上觉...

推荐理由:我会先打个折:目前只有一段摘要,没给模型名、没论文链接、没复现细节,也没第三方验证,所以别急着当定论。好消息是它把问题说得很具体——1946 年平面单位距离问题,还用 Golod-Shafarevich 理论给了一族更高效率的构造,说明不是随便蒙对的。对做推理方向的团队来说,这至少是个强信号,但正文没披露用了多少算力、有没有人工提示工程介入,这点先别太激动。

TechCrunch · AI

OpenAI 说这次真解决了一个 80 年的数学难题

OpenAI 声称他们的新推理模型推翻了一个自 1946 年悬而未决的几何猜想。七个月前他们刚因为类似宣称翻过车——当时说 GPT-5 解决了 10 个未解难题,结果被扒出只是找到了文献里已有的答案,前副总裁 Kevin Weil 只好删帖。这次不一样的地方在于,上次揭穿他们的数学家这回站到了 OpenAI 这边。不过正文没披露模型名字、证明细节和验证...

推荐理由:HKR 三项全中:OpenAI 加一个 80 年历史的几何猜想,是个可验证的硬核推理声明。但正文没给模型名、没给证明细节、也没说怎么验证的,所以先别太激动,暂时到不了 P1。

5月20日星期三

AI 群聊日报

Karpathy 加入 Anthropic 预训练团队,Google I/O 发布 Gemini 3.5 Flash 并给 Vertex AI 改名

今天最炸裂的消息是 Karpathy 宣布加入 Anthropic 预训练团队。群友分析,他先后拒绝回 Tesla 和加入导师的 world model 项目,唯独选了这里,说明大语言模型可能真要有新突破了。另一件大事是 Anthropic 收购 Stainless 后直接关停其托管服务,切断了 OpenAI 的 SDK 同步管道,群友把这叫“基础设施...

推荐理由:这是群聊日报的二手消息汇总,没有给出原始链接、具体任命细节或产品参数。Karpathy 去 Anthropic 这事我会先打个折,等官方确认再激动。Gemini 3.5 Flash 和 100 美元订阅档位正文没披露性能数据和权益清单,只能当个风向标看。整体信息量够上推荐,但可信度和细节都偏弱,所以放在 featured 的低分段。

OpenAI News

OpenAI 一个没公开名字的模型推翻了一道 80 年的离散几何猜想

OpenAI 发了一篇博文,说他们内部一个通用推理模型自己解决了一道叫“平面单位距离问题”的数学难题,推翻了大家信了几十年的主流猜想。这道题是 Erdős 在 1946 年提出的,简单说就是平面上放 n 个点,最多能有多少对点距离刚好是 1。之前学界普遍认为正方形网格那种摆法已经接近最优了,但这个模型给出了一族新构造,把单位距离对的数量往上提了一个多项...

推荐理由:我会先打个折:正文没披露模型名称、证明机制和可复现条件,所以没法给更高分。但 OpenAI 模型推翻 80 年几何猜想这件事本身够新、够具体,也够有争议性,HKR 三项全中,85 分放在 P1 合理。

AI HOT 精选

谷歌把 AI 概览和 AI 模式揉进一个搜索框,现在能传图、传文件、传视频问问题

谷歌上线了一个基于 Gemini 3.5 的新搜索框,把之前的 AI Overviews 和 AI Mode 合并成一个入口。你可以打字、传图片、丢文件或发视频,搜索会跨这些格式一起理解你的问题。支持多轮对话,回答会结合上下文更贴近你。桌面和手机端全球同步上线,正文没披露具体延迟和成本数据。

推荐理由:谷歌搜索这次更新,等于把 AI 对话直接嵌进了搜索框,支持文字、图片、文件、视频混着问,还能多轮追问。底层是 Gemini 3.5,把之前的 AI Overviews 和新的 AI Mode 整合在一起,桌面和移动端都上了。对做搜索、做内容、做 AI 产品的人来说,这意味着谷歌的流量分发逻辑在变,跟 Perplexity 那种 AI 搜索的竞争也更直接。不过原文信息偏薄,没写具体交互细节、覆盖地区有没有限制、实际回答质量怎么样,所以重要性我给 86,先别往 90 以上冲。

AI HOT 精选

Gemini Omni 发布:能理解物理世界的视频生成模型,面向付费用户开放

Gemini Omni 不只是生成画面,它会判断场景里接下来该发生什么——比如物体掉落、碰撞这类物理规律,同时结合历史、科学和文化知识来构建内容。视频生成功能今天起向全球 Google AI Plus、Pro 和 Ultra 订阅用户开放,可以在 Gemini 应用、Google Flow 和 YouTube Shorts 里用。正文没披露推理的具体技...

推荐理由:我会先打个折:正文只给了发布和接入渠道,没放任何物理推理的测试案例、视频生成的质量对比或具体定价,所以信息密度其实偏薄。但“物理推理+视频生成”这个标签本身够硬,加上直接打通 YouTube Shorts,对关注多模态生成和平台竞争的从业者来说是个明确的信号。基于现有信息,放在 85–94 这个区间偏低的位置是合理的,等有实测数据再往上调。

AI HOT 精选

Google 发了 Gemini 3.5,说模型不光能想还能动手干活

Google AI 开发者账号宣布了 Gemini 3.5 模型家族,强调它把推理和执行能力合在一起,目标是让模型直接进业务流程干活。但正文没披露参数量、跑分、价格、上下文窗口和具体上线时间,也没说跟上一代比到底强在哪。这点先别太激动,等有实测数据再看。

推荐理由:H 和 R 都站得住:官方发新模型家族,关注度够高,也会刺激大家去比参数、比价格。但 K 确实不行,整篇公告除了名字什么都没给,没法做技术判断,所以总分拉不到 85 以上。

The Verge · AI

Google 搜索迎来最大改版,搜索框会主动帮你把问题问得更细

Google 在 I/O 2026 上展示了重新设计的搜索框,底层用 Gemini 3.5 Flash 驱动,把顶部的 AI 摘要和聊天式搜索体验打通了。产品 VP Robby Stein 说,以后你用自然语言提问,基本都能稳定触发 AI 摘要。新搜索框能自动扩展开来承接长问题,还会用 AI 补全你的提问。不过正文没披露具体什么时候推全量,这点先别太激动。

推荐理由:我会先打个折:正文没写上线时间,也没给灰度范围,所以重要性停在 86 分。但这件事本身够硬——Google 把搜索框从关键词匹配改成 Gemini 3.5 Flash 驱动的对话入口,AI Overviews 和 AI Mode 不再各自为战,而是同一个模型在背后调度。对做搜索优化、内容分发和 AI 产品的人来说,这意味着流量路径可能被重新画一遍。这点先别太激动,毕竟没上线日期,但值得现在就盯着。

AI HOT 精选

Gemini 3.5 Flash 发布,主打快速高效跑任务

Google 推出了 Gemini 3.5 Flash,官方说法是它在快速、高效完成任务上目前最强。定位是处理日常任务和多步骤创意项目,强调能应对现实世界的复杂情况。不过正文没披露价格、上下文窗口大小、跑分成绩和 API 可用条件,这些关键信息得等后续公布。

推荐理由:H 和 R 都过,因为这是 Google 新发的 Flash 模型,天然跟推理成本和延迟绑在一起。K 没过:正文没给价格、上下文窗口、基准分数,也没说 API 什么时候能用、有什么条件,所以分数只能压在 78–84 这个区间。我会先打个折,等具体数字出来再重新判断。

5月19日星期二

TechCrunch · AI

Andrej Karpathy 加入 Anthropic,负责 Claude 的预训练

Karpathy 这周已经入职,在 Nick Joseph 的团队做预训练——就是那种烧钱烧算力的大规模训练,用来给 Claude 打知识基础和核心能力。他之前在 OpenAI 是联合创始人,也管过特斯拉的 AI。目前公告没提他的具体职位、汇报线和合同细节,只说了他会在 X 上发帖表示看好接下来几年大模型前沿的研发。

推荐理由:HKR 三项全中:Karpathy 的 OpenAI 身份、Anthropic 预训练岗位、Claude 级别的大规模训练工作,让这条消息成了当天的人才战争故事。不过正文没披露职级、汇报线和加入时间,这些信息缺口我先标出来,别把这条当成全面的人事变动分析。

AI HOT 精选

Andrej Karpathy 加入 Anthropic,没回 OpenAI

Andrej Karpathy 在 X 上宣布自己加入了 Anthropic,要重新做前沿大模型研究。他之前是 OpenAI 早期核心成员,也主导过特斯拉 Autopilot,2024 年彻底离开 OpenAI 后去做了 AI 教育创业项目 Eureka Labs。这次选 Anthropic 而不是老东家,对 OpenAI 来说算是一次明显的人才流失。...

推荐理由:Karpathy 加入 Anthropic 是前沿实验室一次高信号的人事变动。正文只确认了他入职,没写团队、职级和研究方向,信息缺口明显,所以分数卡在 85 这一档的低位。我会先打个折:别脑补他具体在做什么,但光凭他选 Anthropic 而不是回 OpenAI,就够圈内讨论一阵了。

r/LocalLLaMA

Sapient 发布 HRM-Text 1B:40B token 预训练,成本约 1000 美元,数学和阅读理解分数超过 Llama3.2 3B

Sapient Intelligence 开源了一个 10 亿参数的小模型 HRM-Text 1B,用 16 张 GPU 跑了 1.9 天,喂了 400 亿个 token,总花费大概 1000 美元。他们自己测的榜单显示,这个 1B 模型在 MATH 数学题上拿了 56.2 分,在 DROP 阅读理解上拿了 82.2 分,两项都压过了 Meta 的 L...

推荐理由:我会先打个折:独立评测还没做完,MATH 56.2 和 DROP 82.2 都是自报分数,别急着全信。但 1000 美元预训练一个 1B 模型这件事本身就有信息量——它说明小团队也能用很少的算力做出能打的模型,对预算有限的开发者是个实在信号。正文没披露数据配比和消融实验,所以没法判断这 40B tokens 的质量到底多高。分数先按 78 给,等第三方跑完基准再考虑往上调。

AI 群聊日报

AI21裁员六成停卖模型,GPT-5.4被假共识带偏后准确率从100%暴跌到23%

AI21 Labs裁员60%并停止独立销售模型,文章判断纯卖模型访问权限这条路已经走不通了——token价格两年跌了100倍,过去16个月里有六家独立模型公司以几乎相同的方式被大厂吸收。Meta内部文件也曝出要裁10%约8000人,同时强征7000人转AI岗。滑铁卢大学一篇论文测出GPT-5.4在注入虚假同伴共识后,准确率从100%掉到23%,模型内部...

推荐理由:我会先打个折:来源是群聊日报,不是官方公告或论文,所以细节可能不全。但两条信息都直接给数字——AI21 砍掉六成人、不再卖模型,说明这家实验室在收缩;GPT-5.4 被注入虚假同伴共识后准确率从全对掉到只剩两成多,暴露了模型在群体压力下的脆弱。这两件事放在一起,既有行业动态又有安全风险,对从业者来说值得扫一眼。

量子位 · 公众号

京东和中科院信工所连发三篇论文,提出让大模型“自己教自己”的强化学习路线

这篇推文本身因为环境异常没加载出正文,我只能根据标题和外部信息给你还原一下。京东和中科院信工所联合发了三篇论文,核心思路叫 Self-Taught RLVR,也就是让模型在强化学习里自己生成训练信号、自己教自己,省掉人工标注或外部奖励模型。其中一篇叫 RLSD 的工作,在 Qwen3-VL-8B-Instruct 上只训了 200 步,就在 8 个基准...

推荐理由:我会先打个折:这不是哪个大厂发了新模型,而是京东和中科院信工所连着放了三篇论文,把 Self-Taught RLVR 这条路线从不同角度拆了一遍。亮点在 RLSD,它让模型自己生成推理步骤、自己打分、自己迭代,200 步就超过 GRPO 跑 400 步,等于训练量砍半还能赢,对算力吃紧的团队是个好消息。不过正文没披露复现需要多少卡、数据怎么配,这点先别太激动。整体属于有干货、有对比、但热度还没起来的阶段,放 featured 低位合适。