跳到正文

#推理

今日 1 条

5月31日星期日

量子位 · 公众号

复旦系团队发布机器人世界动作模型 STI-WM,把时空信息揉在一起做长任务

沐神智能搞了个叫 STI-WM 的模型,专门给机器人用的。它把 RGB 画面、深度点云和机器人自身状态(比如关节角度)同时喂进去,首创了时空一体的架构,不再是先看空间再看时间的两段式处理。官方说它能支撑上百秒的长任务推演,中间出错了还能闭环重新规划。不过正文没给出具体的基准测试分数,也没提部署成本,所以实际效果和性价比还得等更多数据。

推荐理由:我会先打个折:正文没披露权重是否开源、有没有标准 benchmark 对比、百秒推演在什么场景下验证的,这些关键信息都缺。但 STI-WM 把 RGB、深度点云和本体输入揉进一个时空一体架构,直接做百秒级推演,这个思路对做机器人世界模型的人有参考价值。眸深智能又是复旦系团队,英伟达也出现在标签里,产业和学术两边都有点关联。综合来看,信息够新、够具体,但验证强度不明,所以放在 featured 门槛附近,不往上拔。

5月30日星期六

新智元 · 公众号

Opus 4.8 算了一夜,把 1170 亿人的投胎概率做成了模拟器

这篇文章的正文被微信环境异常页挡住了,实际内容没抓到。从标题和已有英文摘要看,沃顿商学院教授 Ethan Mollick 用 Claude Opus 4.8 生成了一个叫“历史之幕”的网站,把人类历史上约 1170 亿次出生做成加权随机模拟,跑了 4000 轮蒙特卡洛来估算你投胎到不同地区和时代的概率。但具体怎么算的、模型代码怎么写的、有没有幻觉或偏差...

推荐理由:HKR 三项都成立:Mollick 的投胎模拟器是个有梗的钩子,不是常规的“模型又变强了”;1170亿人口和4000轮模拟给了可验证的数字;对开发者来说,这种一夜搭出复杂原型的效率比跑分更有说服力。这不是 Anthropic 官方发布,所以留在 featured 低位没问题。

量子位 · 公众号

帮 Gemini 拿下 IMO 金牌的建模负责人,差点去当了职业钢琴家

这篇文章讲的是 Yi Tay,他在 Gemini Deep Think 拿到 IMO 金牌级成绩时担任建模联合负责人。他 2023 年参与创立了 Reka AI,639 天后又回到了 Google DeepMind。文章还提到他 2012 年就考过了 Trinity 古典钢琴副学士文凭,差点走上职业演奏的路。不过正文因为微信环境验证拦截,具体技术细节和...

推荐理由:这是一篇人物特写,不是 Gemini 能力发布稿。核心价值在于 Yi Tay 在 IMO 金牌成果里的具体角色、他创办 Reka 又回归的经历,以及 639 天这个精确时间跨度。文章没展开技术细节,所以重要性停在人物和行业信号层面,76 分放在 featured 档是合适的。

5月29日星期五

新智元 · 公众号

Claude Opus 4.8 实测:高级工程师基准冲到 63 分,但高强度任务掉到 42 分,Max 用户几小时就撞速率墙

这篇来自新智元的实测文章目前页面被微信环境验证挡住了,正文内容没抓到。从标题和摘要信息看,Claude Opus 4.8 在 Extra-High 级别的高级工程师基准测试里拿了 63 分,比上一代 Opus 4.7 高出 30 分,这个涨幅挺夸张。但切换到 High 强度任务时分数掉到 42 分,说明模型在持续高压场景下稳定性还有问题。另外,每月 2...

推荐理由:Anthropic/Claude 相关度天然高,加上有实测跑分和配额吐槽,HKR 三项都站得住。钩子是强但贵且 High 档拉胯,K 有基准分和额度细节,R 直接戳中 Agent 场景下的成本焦虑。来源是媒体评测而非官方公告,所以定在 P1 低位。

机器之心 · 公众号

TogetherAI 搞了个真 2-bit 的 KV 缓存压缩方案 OSCAR,长上下文推理能跑更快

TogetherAI 和合作方发布了 OSCAR,一个把 KV 缓存压到平均每个值只占 2.28 比特的压缩系统,已经接进了 SGLang 推理框架。在 10 万 token 的长上下文场景里,解码速度最高能到原来的 3 倍;在固定显存预算下,整个任务吞吐量最高能到 7 倍。正文没披露具体模型和测试硬件,也没说精度损失有多大,这点先别太激动。

推荐理由:我会先打个折:这是推理优化层的专项工作,不是模型发布,受众偏工程。但 100k 上下文 decode 约 3 倍加速、吞吐约 7 倍这两个数够硬,对跑长上下文推理的团队有直接参考价值。正文没披露精度损失的具体对比,这点先别太激动。整体值得放进 featured,让做推理部署的人看到。

机器之心 · 公众号

Meta 烧了 1830 亿 token,把 26 本数学教材翻译成了机器可验证的 Lean 代码库

Meta 放出了一个叫 ATLAS 的数学形式化库,用 Lean 4 语言把 26 本数学教材里的定义和证明搬了进去。整个工程消耗了 1830.57 亿个 token,生成了约 63 万行代码,包含 46203 条声明。其中 42837 个证明已经跑通,证明通过率 92.7%。说白了就是让 AI 把教科书上的数学推理,转成机器能严格检查的代码,以后训练...

推荐理由:HKR三项都站得住:token量、Lean库规模和已验证证明数都是硬数字。没给P1是因为这还是个偏专的研究开源发布,不是通用模型或产品级发布。

机器之心 · 公众号

马嘉祺让大模型翻车,背后是低频词退化问题,有人一年前洗澡时就发现了

文章页面被微信环境验证挡住了,正文内容没拿到。从现有标题和英文摘要看,讲的是 FaceMind 团队把大模型在“马嘉祺”这类低频词上翻车的现象,和两篇论文串了起来:一篇是 EMNLP 2025 的 SLoW,另一篇是刚被 ACL 2026 接收为 Oral 的 Adam's Law。摘要里还提到一个具体数字——用高频词改写的方法,把 DeepSeek-...

推荐理由:这篇文章把马嘉祺让大模型翻车这个意外事件,和低频 token 退化这个技术问题绑在一起讲,切入点很巧。它不光讲现象,还给出了两篇顶会论文的机制解释,以及 DeepSeek-V3 上 8 个百分点的准确率提升,对做模型评测和提示工程的人有直接参考价值。不是大模型发布那种重磅消息,但属于扎实的研究信号,值得放进精选。

AI HOT 精选

技能提炼:让大模型写操作手册,小模型照着干活

作者 Tomasz Tunguz 分享了他用“技能提炼”让本地小模型跑个人工作流的做法。他会让 Opus 4.7、GPT-5.1 或 Gemini 3 Pro 这类顶尖模型,把处理邮件、管投资 pipeline、发博客等任务写成标准化的 SKILL.md 步骤文件,然后由本地运行的 Qwen 35B 或 Gemma 26B 一步步执行。这套系统基于 P...

推荐理由:这个技能提炼模式把大模型当教练、本地模型当执行者,思路清楚,对控制成本有实际意义。我会先打个折,因为文章没披露任何量化结果——不知道本地模型执行时会不会翻车,也不知道到底省了多少钱。这点先别太激动,等有数据再说。

The Verge · AI

Claude Opus 4.8 发布,主打“老实”:不确定时会直说,瞎编的概率降到前代的四分之一

Anthropic 周四放出 Claude Opus 4.8,这次没吹性能天花板,而是强调模型更“诚实”。公司说早期测试者发现它更愿意主动标注自己没把握的地方,而不是硬编一个听起来合理的答案。内部评测给了一个具体数字:Opus 4.8 做出无据论断的概率大约是前代模型的四分之一。不过正文没披露这个评测的具体基准和对比对象,我会先打个折——四倍改善听起来...

推荐理由:我会先打个折:正文只说了“评估中少约 4 倍无依据声明”,但没披露具体用了哪些基准测试、测试规模多大、在什么任务上测的,也没提价格和上下文窗口有没有变。所以这个“4 倍”只能当个方向性信号看,别直接当成绝对指标。不过对从业者来说,模型肯承认自己不确定而不是硬编,本身就是个值得关注的转向,尤其在需要高可靠性的工作流里。整体信息量够上头条,但细节缺口明显,分数给在 85–94 这个区间是合理的。

5月28日星期四

AI HOT 精选

Mistral 在 AI Now 峰会上公布工业 AI 路线图,Vibe 升级,并在巴黎郊区建推理数据中心

Mistral 在自家峰会上主要说了三件事。第一,他们和空客、宝马、ASML 合作搞工业 AI,让模型进到设计、制造这类业务流程里干活,但具体怎么落地、效果如何正文没细讲。第二,Vibe 这个能处理长周期任务的 AI 助手迎来升级,具体能力变化也没展开。第三,他们要在巴黎南边的 Les Ulis 建一个 10 兆瓦的推理数据中心,计划 2026 年第三...

推荐理由:我会先打个折:这次没发新模型能力,也没给定价细节,所以重要性卡在 featured 门槛上。但 Mistral 把数据中心规格(10 MW)和时间表(2026 Q3)都摊出来了,还绑定了空客、宝马、ASML 这些实打实的工业客户,比纯概念发布实在。正文没披露推理成本的具体数字,这点先别太激动。整体看,对做工业 AI 和关注欧洲算力布局的人值得扫一眼。

机器之心 · 公众号

Mila 和 DeepMind 搞了个大一统的缩放定律公式 UNSL,想把参数量、数据量、训练步数这些变量塞进同一个框架里

正文因为微信环境异常被屏蔽了,具体技术细节看不到。从标题和已有英文摘要看,这篇论文提出了一种叫 UNSL(统一神经缩放定律)的多变量公式,不再只看模型参数或数据量单一维度,而是同时建模参数量、token 数、训练步数,还考虑了训练瓶颈、过拟合以及超参数调不好的负面影响。在论文自己汇报的实验里,UNSL 在 60.87% 的视觉任务和 88.89% 的语...

推荐理由:这篇不是又一个刷榜的 scaling law,而是把之前各自为政的变量(参数量、token 数、步数、瓶颈、过拟合、超参数反作用)捏到了一起。我会先打个折:视觉任务 60.87% 的最佳外推率说明还有不少场景没覆盖到,但语言任务 88.89% 确实亮眼。正文没披露具体实验用了多少算力、验证集规模多大,这点先别太激动。如果是真的,训练前就能更准地估出该堆参数还是堆数据,省钱。

AI HOT 精选

Google 搜索产品 VP 聊 AI 原生搜索:新模式怎么跑、成本多高、出版商怎么办

Robby Stein 在 Google I/O 上谈了搜索正在从列链接转向直接给答案的 AI 原生模式。AI Mode 会把复杂问题拆成多轮搜索去查,背后跑在 Google 自己的 TPU 上,推理成本不低,但正文没给具体数字。搜索量没降反升,这点他提了但没展开数据。关于答案里引用哪些信息源和链接,有一套选择逻辑,但没细说权重。出版商最关心的流量问题...

推荐理由:这是一篇访谈摘要,不是产品发布,所以我会先打个折。HKR 三个维度都踩中了,但正文没披露具体价格、流量数字或成本数据,判断只能停在“高质量访谈”这个区间。文章把 Google 转向 AI 原生搜索的几个矛盾摆得很清楚:想用多轮对话和 AI Mode 留住用户,又得面对 TPU 成本高和出版商怕被截流的现实。信息够硬,但缺量化验证,所以分数给到 74 是合理的。

5月27日星期三

r/LocalLLaMA

8 个开源模型在 MMO 里挂了 10 天机,放出了 9.3 万条事件日志

Firespawn Studios 在《Null Epoch》第 0 赛季里放了 25 个 AI 智能体,分别跑在 8 个开源模型上,连续运行了 10 天。他们公开了大约 9.3 万条记录的事件数据集,其中约 70% 的动作都附带了模型当时的推理或决策理由。不过,Reddit 原帖的正文内容被网络屏蔽了,目前看不到具体的实验结论和模型表现对比,只能从标...

推荐理由:Firespawn Studios 把 8 个开权重模型丢进 MMO 里当 agent 跑了整整 10 天,攒了 9.3 万条事件数据,这事本身比跑分有意思——因为不是测单次问答,是看模型能不能在持续变化的环境里记住东西、做出连贯决策。我会先打个折:信息来自 Reddit,不是正式论文,实验细节和失败案例正文没展开,所以别当严谨研究来读。但 25 个 agent、8 个模型、10 天的规模,加上数据公开,对想测 agent 长期稳定性和记忆的人是个现成的素材包。

量子位 · 公众号

卡内基梅隆和马里兰大学让大模型“睡觉”:上下文快满时暂停、压缩记忆再继续推理

这篇论文给大模型设计了一个类似人类睡眠的机制。当模型处理长文本、上下文窗口快塞满时,它会主动停下来,不再接收新 token,而是利用离线时间对已积累的上下文做多轮递归前向计算,把信息压缩成“快速权重”。之后清空 KV 缓存,相当于整理完记忆再醒来继续干活。测试在细胞自动机、多跳图谱检索和 GSM-Infinite 推理任务上跑过,但正文没披露具体的性能...

推荐理由:我会先打个折,因为正文没给出压缩后的基准测试提升、代码或实际部署证据,所以分数停在 76。但“睡觉”这个说法确实把枯燥的上下文压缩讲得让人想点进去看。核心操作是模型在上下文快满时主动暂停,用多轮离线方式把旧信息压紧,然后清掉 KV 缓存腾地方,思路清楚。如果后续有实测数据,比如长文本任务不掉点、显存省了多少,分数还能往上走。这点先别太激动,等看到具体数字再说。

机器之心 · 公众号

三星公开 Meki、M2RL 和 LiveClawBench 三项研究,从端侧记忆架构做到物理 AI 评测

三星这次放出了三个项目:Meki 是一种给端侧模型用的记忆架构,让手机或 IoT 设备上的小模型能记住上下文、省着用算力;M2RL 是多领域强化学习框架,想让一个模型在不同任务里都能自己学会干活;LiveClawBench 则是专门测物理 AI 的基准,看模型能不能在真实世界里抓取、操作物体。文章还提到三星已经采购了数万张 GPU 来搭 AI 基础设施...

推荐理由:这是一组三星研究院的技术打包发布,不是旗舰模型或产品上线,但胜在信息具体、方向明确。我会先打个折:正文没披露数万张 GPU 的具体型号和部署时间线,也没说 Meki 在端侧实测的延迟和功耗,所以不能当量产信号看。不过,三星把 Memory 架构、多领域 RL 和灵巧手评测一起端出来,等于公开了自己在 Physical AI 上的三条腿走路策略,对关注端侧和机器人方向的从业者来说,比单篇论文更有参考价值。

AI HOT 精选

Anthropic 工程师称 Claude Mythos 用“巧妙简洁的证明”解开了 OpenAI 此前攻克的 Erdős 数学猜想

Anthropic 工程师 Sholto Douglas 在 X 上说,Claude Mythos 用一个“巧妙简洁的证明”解决了 Erdős 单位距离猜想,而 OpenAI 前不久刚把这个问题当作 AI 数学推理的里程碑。团队的做法是把问题丢给多个独立的 Claude Code 实例,让它们各自找解题路径,再汇总分发,Mythos 经常走出和 Ope...

推荐理由:HKR 三项都成立:标题自带反差,信息点具体,又牵动前沿推理模型的竞争格局。但正文没披露证明内容、验证方式、Mythos 是否已发布,所以只能放 featured,不能上 P1——我会先打个折,等看到证明再说。

5月26日星期二

Import AI

直面未来,或从当下撤退:一份 AI 进展的眩晕感与一个奇点故事

这是 Jack Clark 在牛津大学讲座的文字版,外加一篇他写的科幻小说。讲座的核心是一张让他感到眩晕的图——Epoch 能力指数,它用 40 多个基准测试画出了 AI 能力的陡峭爬升曲线。Clark 认为,AI 不是普通技术,它更像一片在加速生长的森林,而我们现在看到的通过律师资格考试、拿下国际数学奥赛金牌、发现软件新漏洞,都只是这片森林里的几棵树...

推荐理由:Jack Clark 这篇不是技术报告,更像一篇行业随笔。他拿 ECI 的 40 多项基准当引子,核心抛出一个具体判断:两年内可能出现能开发后继系统的 AI。这个说法把模糊的“奇点”变成了一个有明确时限的猜想,所以我会给高重要性。正文没给出两年预测的严格推导过程,更像基于趋势的直觉,这点先别太激动,但它确实把 AGI 时间线、安全和就业这些老话题拧成了一根引线,值得从业者读一读并自己判断。

量子位 · 公众号

浙大和阿里给生图模型加了个“先想再画”的模块,画数独、烧蜡烛这类精细活终于不翻车了

这篇论文提出了一个叫 Unified Thinker 的独立规划模块,专门解决生图模型一遇到需要精确空间推理的任务就乱来的问题。它不像以前那样让模型边想边画,而是把“思考”和“执行”拆开:先让模型生成结构化的推理步骤,再把这些步骤翻译成具体的视觉指令去生图。训练用了 4 万条叫 HieraReason-40K 的样本,分两阶段做强化学习,让模型学会在动...

推荐理由:这篇论文解决的是一个很实际的问题:多模态模型经常在需要一步步操作的视觉任务里翻车,比如画数独格子画错、烧蜡烛的步骤搞反。浙大和阿里的做法是给模型加一个独立的规划模块,用 4 万条专门构造的样本训练它先想清楚再下笔,再通过两阶段强化学习把思考过程转成可执行的视觉指令。正文没披露这个规划模块的具体参数量和推理延迟,所以实际部署成本还不好判断。但思路本身挺直接,如果规划模块够轻量,对提升视觉 agent 的可靠性会有帮助。

机器之心 · 公众号

ACL 2026 论文:Spatial-Agent 让大模型不只是调地图 API,而是生成可执行的地理分析流程

这篇 ACL 2026 主会论文提出了 Spatial-Agent,核心思路是在用户用自然语言提问和调用地图工具之间,插入一张“地理流程关系图”(GeoFlow Graph),让大模型先规划出可执行的地理分析步骤,再一步步调用 API。在 MapEval-API 评测集上,搭配 GPT-4o-mini 的 Spatial-Agent 准确率达到 45....

推荐理由:ACL 主会论文,机制和数字都拿得出手,H 和 K 能过。但 GIS 工作流这件事本身圈子小,缺了成本、安全或平台竞争这些能出圈的点,R 就够不着,放在 featured 刚好。

新智元 · 公众号

OpenAI 总裁回忆:奥特曼被罢免当天我就辞职了,起初觉得夺回公司只有一成胜算

Greg Brockman 在采访里复盘了 OpenAI 那场 72 小时宫斗。2023 年 11 月 17 号,董事会突然撤掉 Sam Altman 的 CEO 职位,同时把 Brockman 踢出董事会。他当天就辞职了,说当时估算把公司拿回来的概率只有 10%。正文因为微信页面需要验证,没能抓到更多细节,比如董事会具体用什么理由动手、员工联名信怎么...

推荐理由:这篇是 Brockman 对 2023 年 11 月那场宫斗的亲身复盘,不是第三方转述。他给出了辞职时间点和 10% 概率这两个新细节,对理解当时董事会决策的混乱程度有帮助。不过事件本身已经过去一段时间,信息增量集中在个人视角而非技术或产品层面,所以重要性停在 76 分这个区间是合理的。

5月25日星期一

r/LocalLLaMA

RTPurbo:用几百步训练把全注意力模型转成稀疏推理,长上下文预填充快 9.36 倍

这篇论文提出 RTPurbo,能把原本用全注意力的模型改成稀疏注意力来跑推理,而且只需要几百步训练。做法是只给“检索头”保留完整的 KV 缓存,其他头用一个 16 维的 token 索引器来近似,相当于大幅压缩了要存要算的内容。在 100 万 token 的长上下文场景下,预填充阶段最高快了 9.36 倍,解码阶段快了约 2.01 倍。正文没披露具体用...

推荐理由:我会先打个折:目前只有 Reddit 讨论,正文没披露模型规模、具体任务和代码,验证强度偏弱。但“几百步把全注意力转稀疏”这个思路本身挺省钱的,数字也够具体,对做长上下文推理优化的人值得看一眼。信息缺口明显,所以分数没往上拉。

r/LocalLLaMA

小模型做智能体流程不流行,不是能力不行,是商业账算不过来

这篇帖子直接点破:小模型搭的智能体方案没成为主流,跟技术能不能跑通关系不大,核心是商业风险和验证成本。作者举了两个例子——Gemma 4 31B 在 tau2-bench 上能跑到 86.4% 的准确率,DeepSeek V4-Flash 的输出 token 价格差不多是 Claude Opus 4.6 的 89 分之一,单看指标和成本都挺能打。但问题...

推荐理由:这篇文章的切入点挺刁钻——小模型 agent 栈没普及,不是性能不行,是验证层掉链子。它拿 Gemma 4 31B 在 tau2-bench 上 86.4% 的成绩和 DeepSeek 低到离谱的输出成本说事,数字本身有说服力。但更值得盯的是那个 7-9B 模型做验证时,一半到三分之二的正确答案推理链其实有缺陷,这个发现直接动摇了用小模型兜底的信心。来源是 Reddit,权威性要打个折,所以分数没给到顶,但话题本身对做 agent 落地的人很解渴。

5月24日星期日

机器之心 · 公众号

ICML 2026 中了一篇让视觉模型学会“多条思路并行思考”的论文,但正文被验证页挡住了

这篇被 ICML 2026 接收的论文叫 Visual Para-Thinker,给视觉语言模型加了一套并行思考框架。核心是用 Pa-Attention 和 LPRoPE 把视觉推理拆成四条独立路径,让模型同时从不同角度理解图像,再综合出答案。训练数据是 16.3 万组问答对,规模不算大,所以泛化能力得打个问号。不过目前文章页面被微信环境异常验证挡住了...

推荐理由:这篇 ICML 2026 论文给视觉语言模型装了一个并行思考框架,叫 Visual Para-Thinker。核心是把视觉推理拆成 4 条路径同时跑,用 Pa-Attention 和 LPRoPE 做隔离,防止路径间串味。训练数据是 16.3 万对问答,规模不算大,但够验证想法。我会先打个折:这是单篇研究,没有多团队复现或产品落地,所以重要性停在 79。对做多模态推理加速和内部机制拆解的人,这篇值得看,但别当成熟方案直接用。

5月23日星期六

机器之心 · 公众号

Bengio 团队新论文:用多条并行思路链做递归推理,效果比单条串行推理好

这篇论文提出了 GRAM,一个会生成多条内部推理轨迹、再从中挑出最优解的递归模型。在极难数独测试上,GRAM 用 16 步递归、同时跑 20 条并行思路,准确率达到 97.0%;作为对比,传统串行递归模型 TRM 要跑到 320 步才做到 90.5%。简单说,就是让模型多想几条路再选,比闷头一条路走到黑更靠谱,而且推理步数还少得多。不过正文没披露具体的...

推荐理由:Bengio 团队这篇新论文拿数独极端难度当试金石,用 GRAM 把递归推理的上限拉高了一截。核心卖点是并行轨迹比长串行更有效:16 步递归配上 20 条并行采样,准确率 97.0%,而对比的串行方法要跑 320 步才到 90.5%。我会先打个折——这只是在单一任务上的结果,泛化到其他推理场景还没验证,正文也没披露并行采样的实际计算开销和延迟。但思路本身对做推理加速的人有参考价值,尤其是想用多条短路径替代一条长路径的时候。

5月22日星期五

MIT Technology Review · AI

Google I/O 暴露了 AI 做科研的两条路:专用工具还在用,但资源正流向通用智能体

Google I/O 上,DeepMind 的 Hassabis 一边用“我们正站在奇点的山脚下”这种大词,一边展示的是 WeatherNext 提前预警飓风救了人命。这正好点出了 AI 做科研的两条路线:一条是像 WeatherNext、AlphaFold 这种专为解决某个科学问题训练的专用工具;另一条是让通用大模型像智能体一样自己搞研究。现在资源明...

推荐理由:我会先打个折:这篇是 MIT Technology Review 的评论,不是一手技术报告,所以细节有限。但它的判断站得住——Google 把科学 AI 的牌子从 AlphaFold 那套单独炫技,换成 Gemini for Science 这个统一入口,还塞进了 AI Co-Scientist 和 AlphaEvolve 两个组件,并且开放申请。对做 AI 应用的人来说,这比发一篇论文实在,因为能摸到产品了。不过别太激动,正文没披露这套东西的算力成本、实际科研产出对比,也没说普通团队用不用得起,所以目前更像一个方向牌,不是落地手册。

彭博科技

DeepSeek 创始人把目标定为通用人工智能,同时一笔 100 亿美元的融资在推进

彭博这条快讯只给了标题,正文被付费墙挡住了。标题说 DeepSeek 创始人公开把 AGI(通用人工智能)设为目标,并且公司正在推进一轮 100 亿美元的融资。但创始人具体怎么说的、钱从哪来、谁领投、估值多少、钱打算怎么花,这些关键信息正文都没披露。100 亿这个数字放在 AI 创业公司里非常夸张,如果是真的,说明资本市场对 DeepSeek 的预期已...

推荐理由:标题信息量不小,但正文基本是空壳,没给出创始人原话、融资细节或任何时间线。我会先打个折:这条消息的传播价值在于 DeepSeek 把 AGI 目标和巨额融资同时抛出来,信号很强,但事实支撑很弱。Bloomberg 的稿子只给了标题级事实,投资人是谁、钱怎么花、估值多少全没写,所以重要性停在 86 分是合理的,不能再往上拉。

机器之心 · 公众号

Meta 华人团队发布 ATLAS:用一个词让视觉模型学会可泛化的推理

Meta AI 和港中文的研究者搞了个叫 ATLAS 的方法,核心是在视觉语言模型里塞一个“功能词”(Functional Token),让模型能同时走两条路:一条是显式的、一步步调用工具去操作图像(Agentic 推理),另一条是隐式的、在内部潜空间里直接算(Latent 推理)。他们配套搞了个 ATLAS-178K 数据集,分两阶段训练——先做监督...

推荐理由:我会先打个折:这是 Meta AI 和港中文联合发的研究,不是产品发布或旗舰模型,所以重要性给到 78 分比较合适。一个 Functional Token 搞定视觉推理这个 hook 确实抓人,正文也给了数据集和训练方法的细节,对做多模态和 agent 的团队有参考价值。但正文没披露实际部署成本或大规模验证结果,这点先别太激动。

Computing Life · Share · 鸭哥调研

OpenAI 的通用推理模型推翻了一个 80 年没人撼动的数学猜想

GPT-5 否证了 Erdős 在 1946 年提出的平面单位距离猜想。这个猜想说平面上 n 个点最多只能有约 n 对距离为 1 的点,80 年里数学家都信这个。模型没走证明路线,而是直接构造反例,用上了代数数论里跟几何八竿子打不着的工具,把单位距离对的数量推到了 n 的 1.014 次方。Fields 奖得主 Tim Gowers 审完证明说,如果是...

推荐理由:我会先打个折,因为正文没给论文、没给证明过程、也没说复现条件,信息缺口不小。但一个没专门练过数学的通用模型,推翻了一个 80 年没人动得了的 Erdős 猜想,还有 Fields 奖得主背书说能投顶刊——这个事实本身分量很重,属于当天就该推的消息。HKR 三项全中,重要性给 90 是合理的,再高就需要更多证据了。

NVIDIA 博客

NVIDIA 在 COMPUTEX 2026 拿了四个奖,Vera Rubin NVL72 号称推理能效比上代高 10 倍

NVIDIA 在 COMPUTEX 2026 上靠 Vera Rubin NVL72、Jetson Thor 和 Alpamayo 拿了四个 Best Choice 奖。Vera Rubin NVL72 把 36 颗 Vera CPU 和 72 颗 Rubin GPU 连在一起,NVIDIA 说它每瓦推理性能是上代的 10 倍,每个 token 的成本...

推荐理由:我会先打个折:这是 NVIDIA 自己活动博客发的,不是第三方实测,10 倍能效得看什么负载、跟谁比。但 Vera Rubin NVL72 的规格和能效数字本身够硬,对算力成本和采购节奏有直接参考价值,所以给 featured。正文没披露具体基准测试条件和上市时间,这点先别太激动。

5月21日星期四

r/LocalLLaMA

HRM 1B:一个用极低成本训练的小模型,性能号称能打 2B-7B 的开源选手

Sapientinc 开源了一个叫 HRM-Text 1B Base 的小模型,连训练代码也一起放出来了。论文里的说法是,它的性能可以和 2B 到 7B 的开源模型掰手腕,但训练用的数据量只有别人的百分之一到九百分之一,算力消耗更是只有别人的 1/96 到 1/432。具体来说,用 16 块 H100 GPU 训练了大概 46 小时,总花费约 1,47...

推荐理由:HKR 三项都站得住:HRM-Text 1B 有具体的低成本训练数字和公开代码。卡在 80 分是因为消息源是 Reddit,效率提升的说法还没有独立评测背书,我会先打个折。

Latent Space

OpenAI 用通用推理模型花不到 1000 美元,推翻了一个 80 年前的数学猜想

OpenAI 公布了一个内部通用推理模型(外界猜是 GPT 5.6)的成果:它找到了平面单位距离问题的新构造族,推翻了 1946 年 Erdős 提出的一个猜想。这个模型不是专门为数学训练的,就是普通的语言模型,但推理过程生成了约 125 页的总结。有外部观察者推测,这次运行只用了不到 32 小时,成本不到 1000 美元。数学家 Timothy Go...

推荐理由:HKR 三项都成立:一个内部推理模型声称驳倒了 1946 年的 Erdős 问题,输出约 125 页,这是很强的能力信号。不过成本和运行时间目前还是外部推测,正文没披露 OpenAI 自己的官方数字,所以分数没给到 95。

AI HOT 精选

OpenAI 模型自己解了一道 80 年没搞定的平面几何题,用的还是数学家觉得走不通的路

OpenAI 的一个模型独立解决了 1946 年埃尔德什提出的“平面单位距离问题”。这道题近 80 年来大家一直觉得最优解长得像方格子,但模型搬出了代数数论里比较冷门的 Golod-Shafarevich 理论,找到了一整族效率更高的新构造,把老结论推翻了。这是 AI 头一回自己搞定一个数学核心开放问题,关键就在于它提出并完整执行了一条人类因为直觉上觉...

推荐理由:我会先打个折:目前只有一段摘要,没给模型名、没论文链接、没复现细节,也没第三方验证,所以别急着当定论。好消息是它把问题说得很具体——1946 年平面单位距离问题,还用 Golod-Shafarevich 理论给了一族更高效率的构造,说明不是随便蒙对的。对做推理方向的团队来说,这至少是个强信号,但正文没披露用了多少算力、有没有人工提示工程介入,这点先别太激动。

TechCrunch · AI

OpenAI 说这次真解决了一个 80 年的数学难题

OpenAI 声称他们的新推理模型推翻了一个自 1946 年悬而未决的几何猜想。七个月前他们刚因为类似宣称翻过车——当时说 GPT-5 解决了 10 个未解难题,结果被扒出只是找到了文献里已有的答案,前副总裁 Kevin Weil 只好删帖。这次不一样的地方在于,上次揭穿他们的数学家这回站到了 OpenAI 这边。不过正文没披露模型名字、证明细节和验证...

推荐理由:HKR 三项全中:OpenAI 加一个 80 年历史的几何猜想,是个可验证的硬核推理声明。但正文没给模型名、没给证明细节、也没说怎么验证的,所以先别太激动,暂时到不了 P1。

5月20日星期三

AI 群聊日报

Karpathy 加入 Anthropic 预训练团队,Google I/O 发布 Gemini 3.5 Flash 并给 Vertex AI 改名

今天最炸裂的消息是 Karpathy 宣布加入 Anthropic 预训练团队。群友分析,他先后拒绝回 Tesla 和加入导师的 world model 项目,唯独选了这里,说明大语言模型可能真要有新突破了。另一件大事是 Anthropic 收购 Stainless 后直接关停其托管服务,切断了 OpenAI 的 SDK 同步管道,群友把这叫“基础设施...

推荐理由:这是群聊日报的二手消息汇总,没有给出原始链接、具体任命细节或产品参数。Karpathy 去 Anthropic 这事我会先打个折,等官方确认再激动。Gemini 3.5 Flash 和 100 美元订阅档位正文没披露性能数据和权益清单,只能当个风向标看。整体信息量够上推荐,但可信度和细节都偏弱,所以放在 featured 的低分段。

OpenAI News

OpenAI 一个没公开名字的模型推翻了一道 80 年的离散几何猜想

OpenAI 发了一篇博文,说他们内部一个通用推理模型自己解决了一道叫“平面单位距离问题”的数学难题,推翻了大家信了几十年的主流猜想。这道题是 Erdős 在 1946 年提出的,简单说就是平面上放 n 个点,最多能有多少对点距离刚好是 1。之前学界普遍认为正方形网格那种摆法已经接近最优了,但这个模型给出了一族新构造,把单位距离对的数量往上提了一个多项...

推荐理由:我会先打个折:正文没披露模型名称、证明机制和可复现条件,所以没法给更高分。但 OpenAI 模型推翻 80 年几何猜想这件事本身够新、够具体,也够有争议性,HKR 三项全中,85 分放在 P1 合理。

AI HOT 精选

谷歌把 AI 概览和 AI 模式揉进一个搜索框,现在能传图、传文件、传视频问问题

谷歌上线了一个基于 Gemini 3.5 的新搜索框,把之前的 AI Overviews 和 AI Mode 合并成一个入口。你可以打字、传图片、丢文件或发视频,搜索会跨这些格式一起理解你的问题。支持多轮对话,回答会结合上下文更贴近你。桌面和手机端全球同步上线,正文没披露具体延迟和成本数据。

推荐理由:谷歌搜索这次更新,等于把 AI 对话直接嵌进了搜索框,支持文字、图片、文件、视频混着问,还能多轮追问。底层是 Gemini 3.5,把之前的 AI Overviews 和新的 AI Mode 整合在一起,桌面和移动端都上了。对做搜索、做内容、做 AI 产品的人来说,这意味着谷歌的流量分发逻辑在变,跟 Perplexity 那种 AI 搜索的竞争也更直接。不过原文信息偏薄,没写具体交互细节、覆盖地区有没有限制、实际回答质量怎么样,所以重要性我给 86,先别往 90 以上冲。

AI HOT 精选

Gemini Omni 发布:能理解物理世界的视频生成模型,面向付费用户开放

Gemini Omni 不只是生成画面,它会判断场景里接下来该发生什么——比如物体掉落、碰撞这类物理规律,同时结合历史、科学和文化知识来构建内容。视频生成功能今天起向全球 Google AI Plus、Pro 和 Ultra 订阅用户开放,可以在 Gemini 应用、Google Flow 和 YouTube Shorts 里用。正文没披露推理的具体技...

推荐理由:我会先打个折:正文只给了发布和接入渠道,没放任何物理推理的测试案例、视频生成的质量对比或具体定价,所以信息密度其实偏薄。但“物理推理+视频生成”这个标签本身够硬,加上直接打通 YouTube Shorts,对关注多模态生成和平台竞争的从业者来说是个明确的信号。基于现有信息,放在 85–94 这个区间偏低的位置是合理的,等有实测数据再往上调。

AI HOT 精选

Google 发了 Gemini 3.5,说模型不光能想还能动手干活

Google AI 开发者账号宣布了 Gemini 3.5 模型家族,强调它把推理和执行能力合在一起,目标是让模型直接进业务流程干活。但正文没披露参数量、跑分、价格、上下文窗口和具体上线时间,也没说跟上一代比到底强在哪。这点先别太激动,等有实测数据再看。

推荐理由:H 和 R 都站得住:官方发新模型家族,关注度够高,也会刺激大家去比参数、比价格。但 K 确实不行,整篇公告除了名字什么都没给,没法做技术判断,所以总分拉不到 85 以上。

The Verge · AI

Google 搜索迎来最大改版,搜索框会主动帮你把问题问得更细

Google 在 I/O 2026 上展示了重新设计的搜索框,底层用 Gemini 3.5 Flash 驱动,把顶部的 AI 摘要和聊天式搜索体验打通了。产品 VP Robby Stein 说,以后你用自然语言提问,基本都能稳定触发 AI 摘要。新搜索框能自动扩展开来承接长问题,还会用 AI 补全你的提问。不过正文没披露具体什么时候推全量,这点先别太激动。

推荐理由:我会先打个折:正文没写上线时间,也没给灰度范围,所以重要性停在 86 分。但这件事本身够硬——Google 把搜索框从关键词匹配改成 Gemini 3.5 Flash 驱动的对话入口,AI Overviews 和 AI Mode 不再各自为战,而是同一个模型在背后调度。对做搜索优化、内容分发和 AI 产品的人来说,这意味着流量路径可能被重新画一遍。这点先别太激动,毕竟没上线日期,但值得现在就盯着。

AI HOT 精选

Gemini 3.5 Flash 发布,主打快速高效跑任务

Google 推出了 Gemini 3.5 Flash,官方说法是它在快速、高效完成任务上目前最强。定位是处理日常任务和多步骤创意项目,强调能应对现实世界的复杂情况。不过正文没披露价格、上下文窗口大小、跑分成绩和 API 可用条件,这些关键信息得等后续公布。

推荐理由:H 和 R 都过,因为这是 Google 新发的 Flash 模型,天然跟推理成本和延迟绑在一起。K 没过:正文没给价格、上下文窗口、基准分数,也没说 API 什么时候能用、有什么条件,所以分数只能压在 78–84 这个区间。我会先打个折,等具体数字出来再重新判断。