跳到正文

#推理

今日 1 条

5月11日星期一

AI HOT 精选

菲尔兹奖得主实测 ChatGPT 5.5 Pro:17 分钟独立解决数学难题,成果够写博士论文

剑桥数学家、菲尔兹奖得主 Timothy Gowers 用 ChatGPT 5.5 Pro 做了个实验,只给简单提示,没做任何数学指导。AI 在 17 分钟内独立解决了一个加法数论公开问题,给出的构造在理论上是最优的。Gowers 判断这个成果完全够格写进博士论文。随后 AI 又在一个更难的 k 重求和集问题上,把已知上界从指数级改进到亚指数级,审阅者...

推荐理由:H、K、R 三项全中:有实名数学家、有 17 分钟出成果的具体说法、有对博士培养的警告。但正文没披露具体题目、提示词和验证路径,所以先别太激动,分数打 84 是合理的。

AI HOT 精选

AntLingAGI 放出万亿参数模型 Ring-2.6-1T,5 月 15 日前在 OpenRouter 免费用

Ring-2.6-1T 是一个万亿参数模型,主打可调“思考强度”——你可以手动控制它多想一会儿还是少想一会儿,在回答质量、token 消耗和响应速度之间自己取舍。模型专门为智能体场景做了优化,支持多步执行和工具调用,适合高频工作流。官方说它能处理数学逻辑和科研类任务,但正文没给出具体跑分或对比数据。目前通过 OpenRouter 免费开放,截止到 5 ...

推荐理由:这条发布信息量偏薄,正文没给基准测试、定价、架构或训练细节,所以重要性我打了个折,没给更高。但万亿参数这个量级本身就有话题性,加上 OpenRouter 上的限时免费,对想快速试用的开发者很友好。可调思考强度和工具调用这两点,说明它在往智能体落地靠,不是单纯刷榜的模型。整体判断是:值得关注的一次模型发布,但别急着当里程碑,等实测数据出来再说。

AI HOT 精选

腾讯混元放出 Hy3 预览版,主打复杂智能体任务,不是刷榜模型

腾讯混元开放了 Hy3 预览版的早期体验,官方说这是目前混元系列里最强的模型。它不冲着跑分去,而是强调在真实场景里能把事办成。模型用了 256K 上下文窗口,一次能塞进很长的材料;架构是混合专家(MoE),还加了快慢思考机制,碰到复杂问题会自动切换深度推理模式。底层把预训练和强化学习管线重做了一遍,目标是在大规模部署时把成本压下来。具体效果和实测数据正...

推荐理由:腾讯混元 Hy3 预览版放出了 256K 上下文和快慢思维混合专家架构,定位是处理复杂智能体任务。我会先打个折——正文没披露评测分数、定价和开放范围,所以没法判断实际能力和性价比。架构上快慢思维混合专家听起来像在推理效率和深度之间做平衡,如果是真的挺省钱,但没看到具体实现细节。256K 上下文对长链条智能体任务有用,但也要看实际召回和推理稳定性。这点先别太激动,等更多技术细节和实测出来再说。

新智元 · 公众号

Anthropic 估值可能冲到近万亿美元,Jack Clark 预测 2028 年底前 AI 有超一半概率能自己造出更强的自己

这篇文章本身因为微信环境验证问题,正文内容没抓到,只能看到标题和外部信息。标题里提到 Anthropic 在考虑接近 1 万亿美元的估值,年化收入五个月内涨到 450 亿美元,IPO 规模可能超过 SpaceX。Jack Clark 判断,到 2028 年底,AI 系统能自主迭代出更强版本的概率超过 50%,Kalshi 预测市场上这个 IPO 在 1...

推荐理由:我会先打个折,因为来源是二手媒体,IPO和ARR数字都没看到官方确认。但文章把几个高关注点串在了一起:估值、收入增速、自主迭代的时间预测。对从业者来说,这些数字即使有水分,也反映了市场对头部AI公司定价的疯狂程度,以及内部对技术奇点临近的判断。信息量够,争议性也够,值得推。

机器之心 · 公众号

ICML 2026 论文:PRISM 框架让扩散语言模型做推理时扩展不再烧算力

这篇 ICML 2026 的论文给扩散语言模型(dLLM)提出了一套叫 PRISM 的推理时扩展方法。它把搜索过程拆成三层:先让模型并行生成多条推理路径,再对每条路径局部“回退重写”不靠谱的步骤,最后用模型自己当裁判打分筛选。在数学题集 GSM8K 上,LLaDA-8B-Instruct 的准确率从 67.58% 拉到了 85.30%。最直接的好处是省...

推荐理由:这篇 ICML 论文给扩散语言模型做 test-time scaling,核心卖点是不靠堆算力硬拉分。PRISM 在 LLaDA-8B-Instruct 上把 GSM8K 正确率从 67.58% 提到 85.30%,靠的是三层搜索、局部 remasking 和自验证,把复杂度从 O(NT) 压到接近 O(N+KT)。我会先打个折:这只是单模型单数据集的实验,正文没披露在其他 benchmark 或更大模型上的表现,泛化性还不好说。但思路本身对做推理优化的人有参考价值,尤其适合预算有限又想压榨小模型推理能力的场景。

量子位 · 公众号

菲尔兹奖得主实测 ChatGPT 5.5 Pro,17 分钟跑出论文级数学结果

陶哲轩的同事、菲尔兹奖得主 Timothy Gowers 拿 ChatGPT 5.5 Pro 试了一道加法数论里的难题,模型在 17 分 05 秒内给出了一个最优的二次上界构造,相当于直接产出了一篇小论文的核心证明。之后他又让模型把整个过程写成 LaTeX 预印本,总共花了 47 分钟。Gowers 把结果发在了自己博客上,因为 arXiv 目前拒收 ...

推荐理由:三条都过:Gowers 的第一人称实测、17 分 5 秒和 47 分钟预印本都是可讨论的硬信息。不是模型发布,但有名有姓的实验和数学推理冲击让它必须写。

AI HOT 精选

本地 35B 模型扛下作者一半日常工作,响应速度是云端 Claude Opus 4.5 的两倍

作者用五周时间测了约 1400 个日常工作请求,发现本地跑的 Qwen 3.6 35B 这类模型能搞定其中一半,平均响应 2.8 秒,比云端 Claude Opus 4.5 的 5.8 秒快了 2.1 倍。像邮件草拟、日程安排、摘要和行政杂活这些任务,本地模型完全够用;市场调研和工程类任务则是对半开,简单查数据、修脚本可以本地跑,复杂的多源分析和架构决...

推荐理由:Tom Tunguz 拿本地35B模型做了五周实验,跑了约1400项日常工作任务,成功处理约一半,平均响应2.8秒,比Claude Opus 4.5快2.1倍。这个结果对从业者来说很实在:不是模型发布,也不是平台级更新,但给出了本地模型在延迟和成本上替代云端模型的一个具体参照点。我会先打个折——正文没披露任务类型分布和失败案例的具体原因,所以50%成功率不能直接当通用结论用。但速度对比和实验规模足够让关注推理成本和隐私的人认真看一眼。

AI HOT 精选

《科学》研究:OpenAI 一年前的 o1 模型急诊诊断正确率 67%,超过医生的 50-55%

我会先打个折:这项研究用的是 OpenAI 一年前发布的 o1 模型,按现在标准已经算旧版了。测试数据来自真实急诊室,信息混乱、不完整,模型给出的正确或接近正确的诊断率达到 67%,而参与对比的医生是 50-55%。差距在早期分诊阶段最明显,那时能拿到的信息最少。研究还提到 o1 在处理结构化病例时临床推理几乎不出错。不过正文没披露样本量有多大、医生是...

推荐理由:我会先打个折:这只是一项诊断研究,没覆盖住院数据和影像诊断,别急着说 AI 能独立看急诊。但《科学》背书加上 o1 在真实急诊病例上比医生高出十几个百分点,确实值得从业者看一眼。它说明在特定文本诊断任务上,旧模型已经能摸到甚至超过人类平均水平,后续怎么落地、怎么担责才是真难题。

AI HOT 精选

MachinaCheck:用本地大模型把 CNC 图纸审核从半小时压到 30 秒

MachinaCheck 是一个跑在 AMD MI300X 上的多智能体系统,专门分析 STEP 格式的 CNC 零件图,判断能不能做、需要什么刀具。它用 Qwen 2.5 7B 模型在本地推理,靠 192GB 显存把客户设计数据留在厂里,不往外传。核心流程是先用纯代码解析几何特征,再让多个模型分工做工序分类、刀具匹配、可行性判断和报告生成。团队说,以...

推荐理由:这是个AMD黑客松项目,不是大厂产品发布,但“30秒出CNC报价”的钩子够直接,技术条件也写得明白,所以给到featured。正文没披露实际准确率和误判案例,这点先别太激动。

5月10日星期日

机器之心 · 公众号

图灵奖得主 Sutton 搬出 1967 年的老公式,想让强化学习在流式训练里不再跑偏

Richard Sutton 团队给流式强化学习(就是来一条数据学一次、不存回放池的那种)开了个新方子,叫“意图更新”。核心思路很直白:先定好这次更新想让模型输出变多少,再反推学习率该设多大,用的还是 1967 年 Kalman 滤波里的一个公式。在 MuJoCo 机器人控制任务上,他们用纯流式、batch size 为 1 的训练方式,让 Inten...

推荐理由:我会先打个折:这篇是研究发布,不是产品级大新闻,所以分数不会冲太高。但 Sutton 的署名加上 Intentional Updates 在极端在线条件下的实验结果,确实给流式 RL 提供了一个很省算力的新思路。1/140 的 FLOPs 对比很直观,batch=1、无回放这些条件也贴近真实部署,对 RL 圈子来说信息量够硬。整体判断是强研究信号,但市场影响力有限,放在 78–84 这个区间合理。

机器之心 · 公众号

谷歌 Ted Xiao 把近十年机器人学习分成三个时代,从 RT-1 到 RT-2 再到规模化

这篇文章的正文被微信环境异常拦截了,实际内容无法读取。从标题和已有英文摘要看,Ted Xiao 的复盘主要讲谷歌机器人团队怎么从 RT-1 用 8.7 万条遥操作轨迹训练,走到 RT-2 把 50 亿到 550 亿参数的视觉语言模型改造成视觉-语言-动作策略。具体三个时代怎么划分、每个阶段踩了什么坑、规模化后效果到底提升多少,正文没披露,没法展开。

推荐理由:我会先打个折:这不是新发布,是一篇回顾性梳理,所以分数没往 80 以上走。但作者身份和内部数字让它值得上推荐位。Ted Xiao 把谷歌机器人学习拆成三个阶段,从遥操作采数据到把大模型当机器人脑子用,脉络清楚。RT-1 的 8.7 万条轨迹说明早期靠人工遥控攒数据的笨功夫,RT-2 用 5B 到 55B 的 VLM 改策略,点出了现在大家纠结的核心——模型大了能不能直接控硬件。正文没披露 RT-2 在真实场景的失败率或延迟数据,这点先别太激动。整体适合给做具身智能的人当路线图看。

新智元 · 公众号

大模型预测太短视?Next-ToBE 让模型多看几步,ICLR 2026 新方法在 36 项测试里赢了 35 次

华东师大和复旦的研究者发现,现在大模型训练时只盯着“下一个词”来猜,容易让模型变得自信但目光短浅。他们提出 Next-ToBE,训练时给模型一个“软目标”,让它同时参考未来几个词的信息,但推理时不用改,还是正常的逐词生成。在 Qwen2.5-Math-1.5B、Qwen2.5-Math-7B 和 Llama3.1-8B-Instruct 上跑了 36 ...

推荐理由:这篇论文的卖点很清晰:不碰模型结构,只把训练时“猜下一个词”的目标换成“看未来一小段窗口的软目标”,就在36组实验里赢了35组。我会先打个折——正文没披露用了多大的模型、什么规模的数据,也没给复现细节或生产环境的验证,所以目前只能当学术信号看。如果是真的,这种改目标不改架构的思路确实省钱,但别急着把它当成下一个训练范式。

r/LocalLLaMA

NVIDIA 发布 Star Elastic:一个模型文件能直接切出 30B、23B、12B 三种推理模型

NVIDIA 放出了一个叫 Star Elastic 的模型,一个检查点文件里包含了 30B、23B 和 12B 三个尺寸的推理模型,不用额外训练就能直接“切片”取用。具体玩法是让 23B 的子模型负责思考过程,30B 的模型负责给出最终答案。在 AIME-2025、GPQA、LiveCodeBench v5 和 MMLU-Pro 这几个测试集上,这种...

推荐理由:我会先打个折:这还是个研究发布,不是大规模验证过的产品,影响力肯定比不上一个全新旗舰模型。但它的机制很具体——一个检查点通过“零样本切片”就能变出不同大小的推理模型,而且 23B 负责思考、30B 负责回答这种分工方式,在 AIME-2025 上确实跑出了 16% 的准确率提升和 1.9 倍延迟降低。对正在折腾推理部署的人来说,这种“一份权重、多种用法、精度可选”的思路,直接打中了成本和延迟的痛点,所以放在 featured 里是合适的。

Computing Life · Share · 鸭哥调研

Anthropic 的 Computer Use 是怎么训练出来的——从一项专利读它的数据管线

Anthropic 一项专利披露了 Computer Use 的训练数据管线,核心不是录屏,而是把原始操作变成带推理链的数据。管线分三步:截获用户操作时允许附加思考标注,用多模态模型把点击坐标翻译成语义意图,再用更强的模型做合成扩展,一条真实轨迹变出几十条带推理变体的样本。学术数据集能训出跑 benchmark 的原型,但覆盖软件少、轨迹偏干净、缺少长...

推荐理由:这篇不是官方发布,是从专利里扒出来的分析,所以我会先打个折。但它把 Computer Use 的数据管线讲得很实在:先截屏记录人的操作,再用 transformer 推断操作背后的意图,最后让强模型把意图扩展成更多样的训练样本。对正在搭 agent 的团队来说,这套思路能直接参考,尤其是怎么把少量人工操作放大成训练数据。正文没披露具体模型规模和成功率数字,这点先别太激动。

r/LocalLLaMA

BeeLlama.cpp:用 DFlash 和 TurboQuant 让 Qwen 3.6 27B 在单张 3090 上跑 20 万上下文,速度翻倍

Anbeeld 发了一个 llama.cpp 的分支 BeeLlama.cpp,主要加了 DFlash(一种省显存的注意力机制)和 TurboQuant(更快的量化方案),还支持推理和视觉任务。标题里说在单张 RTX 3090 或 4090 上跑 Qwen 3.6 27B 的 Q5 量化版,能塞进 20 万 token 的上下文,速度比原版快 2 到 ...

推荐理由:我会先打个折:这些数字来自 Reddit 标题和摘要,没有独立复现,135 tps 的峰值在什么输入长度、什么 batch 下跑的也没说清楚。但就算打个七折,单张 3090 把 27B 模型塞进 200k 上下文还能跑到可用的速度,对个人开发者和小团队确实省钱。BeeLlama.cpp 看起来是在 llama.cpp 上做了 DFlash 和 TurboQuant 的工程优化,正文没披露具体技术细节和稳定性测试,这点先别太激动。整体算一次值得关注的本地推理更新,所以放在低位的 featured。

5月9日星期六

AI HOT 精选

百度发了 ERNIE 5.1,参数量砍到原来的三分之一,训练费压到同规模模型的 6%

ERNIE 5.1 把总参数量压到原规模的大约三分之一,激活参数压到大约一半,预训练成本只花到同规模模型的 6% 左右。百度说性能没崩,Agent 能力超过 DeepSeek-V4-Pro,世界知识和创意写作接近头部闭源模型和 Gemini 3.1 Pro,推理仅次于 Gemini 3.1 Pro,深度搜索排全球第四。技术手段提了两个:弹性预训练用来提...

推荐理由:百度把 ERNIE 5.1 的参数和成本压到这个程度,我会先打个折——正文没披露具体参数量和基准测试细节,6% 的成本对比对象也没说清楚,这点先别太激动。但即便有水分,三分之一参数、一半激活、6% 预训练成本这三个数字摆出来,对正在头疼推理成本的团队来说就是强信号。加上已经上线 ERNIE 平台和 AI Studio,不是画饼,值得写。

AI HOT 精选

百度发 ERNIE 5.1,预训练成本压到对标模型的 6%

百度在 ERNIE 5.0 的基础上做了 5.1,主要提升搜索、推理、知识问答、创意写作和智能体能力。最抓眼球的数字是预训练成本只有对标模型的 6%,但正文没披露对标的是谁、怎么算出来的,也没给具体金额或技术细节。我会先打个折——成本低到这个程度,要么是用了 5.0 的底子省了大笔算力,要么是统计口径有讲究。另外,模型在哪些基准上测了、效果提升多少,帖...

推荐理由:百度发了ERNIE 5.1,最抓人的一句话是“预训练成本约为对标模型的6%”。这个数字让一条模型更新变成了成本效率的故事,从业者会立刻想知道对标模型是谁、成本口径怎么算的,正文没展开说,所以冲击力有,但信息缺口也大。搜索、推理、问答、写作和智能体能力都提了升级,但没给具体评测或对比数据,技术细节偏薄。我会先打个折:话题性够强,靠成本数字和国产旗舰身份撑到了p1,但缺细节让它进不了90分以上的档位。

量子位 · 公众号

谷歌搞了个“AI 联合数学家”,用多智能体协作刷了最难数学基准的新纪录

谷歌 DeepMind 发布了一个叫 AI Co-Mathematician 的系统,它不是单个模型,而是一套异步协作的智能体工作区,专门用来做数学研究。在 FrontierMath 这个目前最难的数学基准测试里,它解开了 48 道 Tier 4 级私密题中的 23 道,正确率 48%。对比之下,GPT-5.5 Pro 的正确率是 39.6%。测试条件...

推荐理由:我会先打个折:正文没披露模型架构、训练数据和具体成本,所以没法判断这 48% 的含金量到底多实。但故事本身很抓人——牛津教授用这个系统解开了一个群论悬案,同时 FrontierMath Tier 4 这种非公开难题集上的成绩比 GPT-5.5 Pro 高了 8 个多点,说明在极难数学推理上确实往前走了一步。对做推理和 agent 的人来说,这是个值得盯的信号,但别急着把它当成通用数学家的雏形。

机器之心 · 公众号

DeepSeek 被曝正在谈一笔 500 亿人民币的融资,梁文锋自己掏四成,估值可能到 3500 亿

这条消息来自机器之心,但原文页面被微信判定环境异常,需要验证才能看,所以正文内容没拿到。标题和摘要里提到的关键数字是:融资额约 500 亿人民币(折合约 73 亿美元),估值约 3500 亿人民币(折合约 515 亿美元)。梁文锋个人计划出资 40%,腾讯和 600 亿规模的国家 AI 基金也在谈。这些数字如果属实,说明 DeepSeek 这轮融资规模...

推荐理由:这条DeepSeek融资传闻数字大、出资比例明确、资方有名有姓,HKR三项都站得住。但正文也说了还在谈,没有官方确认,所以分数和级别不动,保持84分和featured,不升p1。

机器之心 · 公众号

OpenAI 研究员翁家翌提出“启发式学习”:不调模型参数,靠改代码和记忆来训练 AI

OpenAI 的翁家翌抛出了一个叫“启发式学习”的新训练思路,核心是不再靠梯度去更新神经网络权重,而是让模型通过修改代码、测试用例、回放记录和记忆来提升自己。他拿 Atari 游戏做验证,提到 codex gpt-5.4 在打砖块(Breakout)上拿了满分 864 分,并在 Atari 57 个游戏里生成了 342 条搜索轨迹。不过文章正文因为微信...

推荐理由:OpenAI 研究员翁家翌提了个叫 Heuristic Learning 的思路,不是官方产品发布,更像研究评论和开源信号。亮点是 codex gpt-5.4 在 Breakout 拿了 864 满分,Atari 57 上只靠 342 条搜索轨迹就让模型自己改代码、测试和记忆。我会先打个折:正文没披露这套方法在更复杂任务上的泛化表现,也没说计算开销多大,所以“下一个训练范式”这个判断先别太激动。但如果是真的,意味着不用梯度也能让模型在具体环境里持续变强,对做 agent 自进化的团队是个值得盯的参考。

5月8日星期五

AI HOT 精选

机器人终局:一份物理 AGI 路线图,用大语言模型的成功逻辑来推演

演讲者把机器人做成人形通用智能拆成六块:视频世界模型当第二预训练范式,世界行动模型(WAM)负责把感知转成动作,数据收集策略对标特斯拉 FSD 的物理数据飞轮,EgoScale 和灵巧性缩放定律试图量化训练规模与手部操作能力的关系,物理强化学习用来跑通最后一公里,DreamDojo 则是一个端到端的神经物理引擎。整体思路是照搬大语言模型的成功路径,但正...

推荐理由:我会先打个折:这是演讲者个人的路线图,不是论文或产品发布,所以别当官方公告看。但它的好处是把物理 AGI 拆成了 6 个能聊的模块,并且用 LLM 的发展阶段来类比,让做机器人的人能快速对齐讨论框架。正文没给出每个模块的具体验证结果或数据,所以这条路线图更多是观点而非实证。对从业者来说,值得扫一眼,但暂时不用太激动。

机器之心 · 公众号

SGLang 团队拿了 1 亿美元种子轮,成立新公司 RadixArk,要做开放的 AI 基础设施

SGLang 的团队新成立了一家公司叫 RadixArk,5 月 5 号宣布完成 1 亿美元种子轮融资,投后估值 4 亿美元。SGLang 是一个开源的模型推理框架,目前在 GitHub 上有超过 2.7 万颗星,部署的 GPU 超过 40 万张。不过,这篇微信文章因为环境异常被屏蔽了,正文内容没拿到,所以具体的产品方向、团队背景和这笔钱怎么花,暂时都...

推荐理由:这条消息的看点在于钱和团队背景。1 亿美元种子轮在 AI infra 领域不多见,而且 SGLang 本身有 2.7 万星和 40 万张 GPU 的部署量,不是凭空画饼。不过正文对 RadixArk 具体要做什么产品、跟现有 SGLang 项目怎么分工,讲得比较模糊,更像融资公告加路线图预告。我会先打个折,把它放在 featured 里但不到更高档,因为目前还缺产品细节和客户验证。

AI HOT 精选

自适应并行推理:让模型自己决定什么时候分头干活

BAIR 这篇博客梳理了并行推理的最新进展,核心观点是:与其让外部规则替模型决定怎么拆分任务、开几个线程,不如让模型自己判断。文章介绍了 ThreadWeaver 和 Multiverse 两种方法,它们能让模型在解题时动态决定是否并行、开多少并行分支、以及如何汇总结果。相比传统的多数投票、树搜索或固定并行结构,这种自适应方式更省算力,也更贴合问题本身...

推荐理由:BAIR 的出身让这篇有基本可信度,HKR 三项都过关。文章把动态控制并行线程的机制讲清楚了,但我会先打个折:没给任何量化结果,也没说怎么复现,所以分数卡在 74 不动。这点先别太激动,等他们把延迟降幅和基准跑出来再说。

Latent Space

OpenAI 发了三个实时语音模型:GPT-Realtime-2、翻译版和 Whisper 版,上下文从 32K 扩到 128K

OpenAI 在 Realtime API 里上线了 GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper。GPT-Realtime-2 是主打的语音对话模型,OpenAI 说它用上了 GPT-5 级别的推理能力,上下文窗口从之前的 32K 直接拉到 128K,一次最多能输出 32K ...

推荐理由:我会先打个折:这不是新基础模型,是 API 层面的更新,所以分数没往 90 以上拉。但 128K 上下文和 96.6% 的音频基准分确实够硬,对实时语音应用来说是个实打实的升级。正文没提延迟和具体定价,这点先别太激动,等上线跑过再看。

新智元 · 公众号

用 token 级价值函数控制回答长度,3B 模型在长度控制上跑赢 GPT-5.4 和 Claude

加州大学圣塔芭芭拉分校和苹果的研究人员搞了个叫 LenVM 的方法,把“还剩多少 token 要生成”建模成一个 token 级别的价值函数,相当于给模型装了个实时字数进度条。他们拿 Qwen2.5-3B 搭配一个 1.5B 的 LenVM 去测 LIFEBench 的长度控制任务,得分 62.6,而 GPT-5.4 只有 37.4,Claude-Op...

推荐理由:我会先打个折:正文没披露 GPT-5.4 的具体版本和测试条件,这点先别太激动。但 LenVM 的思路很实用——把“还要写多长”变成一个 token 级的值函数,让 Qwen2.5-3B 搭配一个 1.5B 的小模型就能在长度控制上大幅领先大模型。LIFEBench 长度得分 62.6 比 GPT-5.4 的 37.4 高出不少,说明在特定任务上小模型加对方法可以很省钱。对做推理优化和想摆脱闭源模型绑定的团队来说,这是个值得跟的信号。

量子位 · 公众号

哈工大华为搞了个免训练加速框架,让扩散大模型推理快4.48倍还不掉精度

哈工大深圳、华为和深圳河套学院提出一个叫 Dynamic-dLLM 的框架,不用重新训练就能给扩散大语言模型加速。在 LLaDA-8B-Instruct 上跑 GSM8k 数学题,吞吐量从每秒 8.32 个 token 提到 37.29 个 token,快了 4.48 倍,而且精度几乎没降。正文没披露具体用了什么技术手段,也没说在其他任务上表现怎么样,...

推荐理由:HKR 三项都成立:4.48 倍提速是个好钩子,GSM8k 的 TPS 数据让说法有实感。这是推理优化研究,不是主流模型发布,放在 78–84 这个区间合适。

量子位 · 公众号

OpenAI 把 GPT-5 级推理塞进语音模型,同传翻译成本打到地板价

OpenAI 发了三个实时语音模型:GPT-Realtime-2 能边听边推理,上下文窗口 128K;GPT-Realtime-Translate 支持 70 多种语言输入、13 种语言输出,做流式同传;GPT-Realtime-Whisper 实时转写每分钟只要 0.017 美元。正文没披露具体推理跑分和翻译延迟数据,实际效果还得等上手测。

推荐理由:OpenAI 一口气发了三个实时语音 API,覆盖推理、翻译和转写,HKR 全中。128K 上下文意味着能处理很长的对话,70 多种语言输入和每分钟 0.017 美元的转写价格,对做同传和语音 agent 的团队来说,成本和能力边界都清楚了,值得当天就写。

量子位 · 公众号

美国研究员 36 小时跑遍中国 AI 圈:字节让所有实验室紧张,DeepSeek 被所有人夸

Ai2 研究员 Nathan Lambert 在 36 小时内密集拜访了智谱、月之暗面、清华、美团、小米和零一万物。他观察到中国 AI 实验室普遍紧盯字节跳动的动向,同时对 DeepSeek 的技术实力和开源做法表示尊重。学生深度参与核心工作、开源习惯以及技术栈的自主掌控,是中美 AI 生态的几个明显差异。

推荐理由:这篇不是模型发布或大厂合作,属于一手见闻加行业判断,信息密度高但偏观察性质。我会先打个折,放在featured而不是p1。正文没给出具体数据验证,但研究员身份和走访名单让可信度不低,值得从业者花几分钟读。

r/LocalLLaMA

单张 4090 跑出 11.67%:TOPAS 递归架构在 ARC-AGI-2 上的本地测试结果

Doug_Bitterbot 用一张 RTX 4090 训练了大约 14 天,让 TOPAS 模型在 ARC-AGI-2 抽象推理测试上拿到了 11.67% 的分数。这个模型只有 1 亿参数,本地跑分最高到过 36%,但它的递归测试时训练(TTT)机制在 Kaggle 的题目上出了问题,将近一半的谜题直接输出空结果。作者觉得调一下阈值、再训 3 到 5...

推荐理由:Doug_Bitterbot 在 Reddit 上发了个帖子,说他的 TOPAS 架构在 ARC-AGI-2 公榜拿了 11.67%,跑在一张 RTX 4090 上,训练大概花了 14 天。模型参数约 100M,本地 checkpoint 能到 36%,但 Kaggle 提交时因为递归 TTT 超时,近一半题目输出空数组,分数被拉低。作者自己预期调一下阈值能到 20%,还说 3-5 周后再训完。这事有意思的地方在于,它只用输入图片来决定怎么压缩视觉 Token,多轮 VQA 里能砍掉 90% 的 Token,正文说精度不掉。不过目前只有一篇帖子,K...

5月7日星期四

AI HOT 精选

万亿参数指令模型 Ling-2.6-1T 上线 OpenRouter,主打“快思考”和降本 75%

inclusionAI 把 Ling-2.6-1T 放到了 OpenRouter 上,这是一个万亿参数的指令模型,专门给现实世界的智能体任务用。它走“快速思考”路线,在 AIME26 和 SWE-bench Verified 这两个测试上成绩顶尖,同时宣称推理成本比同类低了大约 75%。官方列出的适用场景包括高级编程、复杂推理和大规模智能体工作流。正文...

推荐理由:我会先打个折:正文没披露具体价格、上下文窗口长度,也没给完整榜单分数,所以“顶尖表现”和“成本降低 75%”目前只能当声明看。但一个万亿参数指令模型敢上 OpenRouter 开放调用,本身信号就很强——说明 inclusionAI 对推理成本和稳定性有一定底气。真正值得盯的是后续会不会放出详细定价和完整评测,如果成本真能压到同类模型的四分之一,对做 agent 和代码任务的团队会是实打实的省钱。

r/LocalLLaMA

Qwen 发布 WebWorld 系列模型,用 100 多万条真实网页操作轨迹训练,让模型学会在浏览器里干活

Qwen 在 Qwen3 基础上微调出了 WebWorld 32B、14B、8B 三个尺寸的模型,专门用来训练和评测能在网页上执行任务的智能体。训练数据包含超过 100 万条真实网页操作轨迹,模拟环境支持 30 步以上的连续操作,并且能同时看懂无障碍树、HTML、XML、Markdown 和自然语言描述这五种页面状态。用这套数据生成的合成轨迹再去训智能...

推荐理由:我会先打个折:正文没披露合成轨迹的具体生成方式,也没说这 100 万条数据覆盖了哪些网站类型,所以别急着当通用方案。但亮点很实在——用合成轨迹训练小模型做网页操作,在 MiniWob++ 和 WebArena 上都拿到了 10% 左右的提升,说明这条路走得通。对正在折腾 Web agent 的人来说,数据和评测结果比模型本身更有用。

OpenAI News

OpenAI 在 API 里上线了三款实时语音模型,能边听边推理、翻译和转写

OpenAI 这次发了三个新模型:GPT‑Realtime‑2 是带 GPT‑5 级推理能力的语音模型,能处理更复杂的请求,说话中间可以插话、改主意,它还能边想边回一句“我查一下”,同时调用多个工具;GPT‑Realtime‑Translate 做实时翻译,支持 70 多种输入语言转 13 种输出语言,语速跟得上说话人;GPT‑Realtime‑Whi...

推荐理由:OpenAI 官方放出了语音 API 更新,方向明确但信息不全。能推理、翻译、转写,听着挺全,可没给价格、没给延迟、没给上下文限制,我会先打个折。如果是真的省钱又低延迟,那对语音应用开发者是直接利好;现在只能说方向对了,落地还得等更多参数。

TechCrunch · AI

DeepSeek 首次对外融资,估值可能冲到 450 亿美元

DeepSeek 正在谈第一笔外部投资,几周内估值就从 200 亿涨到了 450 亿美元。这家中国 AI 实验室 2025 年初靠一个训练成本远低于 OpenAI、Anthropic 等美国模型的大语言模型出圈,之后在推理和编程能力上一直咬住第一梯队,模型权重也开放下载。创始人梁文锋原本没打算融资,但对手开始挖人,他才决定引入资金好给员工发股份。领投方...

推荐理由:DeepSeek 第一次对外融资,目标估值 450 亿美元,我会先打个折——正文没给金额、没列投资方、也没提条款,所以这个数目前更像一个信号而不是定论。真正值得盯的是:如果首轮真按这个价成交,中国 AI 实验室的估值天花板就被重新画了一条线。这点先别太激动,等更多细节出来再说。

5月6日星期三

r/LocalLLaMA

单张 RTX 5090 跑通 Qwen3.6 27B:NVFP4 量化加 MTP 投机解码,200k 上下文实测 73.6 tok/s

一位 Reddit 用户在单张 32GB 显存的 RTX 5090 上,用 vLLM 跑通了 Qwen3.6 27B 的 NVFP4 量化版,并验证了 200k 上下文长度。配置上用了 fp8_e4m3 的 KV 缓存、FlashInfer 和 3 个投机 token 的 MTP。10 次 200k 上下文跑分平均生成速度 73.6 tok/s,首 t...

推荐理由:我会先打个折:来源是 Reddit 用户自测,不是官方报告,但配置和日志都贴出来了,可复现性不低。真正值得盯的是显存边界——KV 缓存占了 8.3GiB,整卡吃到约 30478MiB,几乎榨干 32GB。这说明 NVFP4 量化确实把 27B 模型压进了消费级显卡,而且 200k 上下文不是摆设,十次都跑稳了。不过 TTFT 70 秒意味着首 token 要等一分多钟,实际用起来体验会打折扣。这点先别太激动,等更多卡型验证。

新智元 · 公众号

GPT-5.5 Instant 成了 ChatGPT 的免费默认模型

OpenAI 把 GPT-5.5 Instant 设成了 ChatGPT 的默认模型,所有用户都能免费用。AIME 2025 的得分从 65.4% 涨到 81.2%,回答长度缩短了 30.2%,在高风险提示上的幻觉率比 GPT-5.3 Instant 低了 52.5%。Plus 和 Pro 的网页用户会先拿到聊天、文件和 Gmail 的个性化功能;AP...

推荐理由:我会先打个折:OpenAI 把 GPT-5.5 Instant 免费推给所有人,这件事本身就值得写。文章给了三个硬数字——AIME 2025 准确率涨了 15.8 个百分点、回复字数砍掉近三分之一、高风险幻觉少了一半多,说明新模型在推理和可靠性上都有明显提升,而且输出更省 token。对从业者来说,默认模型一换,日常使用成本和体验都会变,Plus/Pro 还加了聊天记录和 Gmail 个性化,这些改动直接踩在工作流上。正文没披露免费版的速度和并发限制,这点先别太激动,但整体信息量够,属于必须覆盖的更新。

Computing Life · Share · 鸭哥调研

AI 时代,复核不等于独立判断

别人拿 AI 输出来压你,你一眼就能看出他没动脑子。但轮到自己用 AI 写分析、回邮件时,那条线就模糊了:你读一遍觉得通顺,就发出去了,这到底算独立判断,还是只做了个熟悉度检测?沃顿的 Shaw 和 Nave 用实验把这事量化了。一千三百多人做认知反射测试,AI 给错误答案时,仍有八成的人照单全收。更要命的是,用了 AI 的人对自己答案的信心反而高出 ...

推荐理由:我会先打个折:正文只给了 Shaw 和 Nave 两个实验线索,没放任何数字,所以知识深度有限。但它的钩子很准——复核不等于独立判断,检查容易滑成“看着眼熟就放行”,高验证复杂度的任务得先自己建个参考点再交叉比对。这点先别太激动,因为实验证据没亮出来,不过对天天跟 AI 输出打交道的从业者来说,这个提醒够直接、够有用。

Latent Space

GPT-5 用 11 分钟复现了物理学家的硬核论文,OpenAI 开始正经搞科研了

理论物理学家 Alex Lupsasca 聊了他怎么用 GPT-5 做研究。他先让模型做了道课本里的热身题,然后 GPT-5 只花了 11 分钟就复现了他一篇获奖级别的论文,这篇论文的发表日期在模型训练数据截止之后。后来,他加入 OpenAI 的科学团队,用 GPT-5.2 去算一个以前被认为不可能手算的胶子振幅公式,模型真给出了非零结果,团队花了三周...

推荐理由:Alex Lupsasca 在访谈里说,他们拿教材给 GPT-5 预热后,模型 11 分钟就复现了他论文里的结果;ChatGPT 又在一天内产出 110 页引力子计算,团队花了三周才验证完。我会先打个折:这是单人访谈,没有第三方复现,而且理论物理这个领域太窄,换到其他任务能不能跑通还不清楚。正文没披露验证过程中改了多少轮 prompt,也没说那 110 页里有多少是废话。所以先给 84 分,放在 featured 里,等有更硬的基准测试出来再调。

The Verge · AI

OpenAI 说 ChatGPT 默认模型 GPT-5.5 Instant 的幻觉问题少了一大截

ChatGPT 把免费用户和 Plus 用户的默认模型换成了 GPT-5.5 Instant。OpenAI 内部测试显示,在容易出高风险幻觉的提示上,它比上一代 GPT-5.3 Instant 的瞎编次数少了 52.5%;在被标记为“难聊”的对话里,不准确的说法也降了 37.3%。不过正文没披露测试集到底有多大,也没说这些“高风险提示”具体怎么定义的,...

推荐理由:OpenAI 把 ChatGPT 默认模型换了,还主动报了两个幻觉下降的数字,热点、新知、关联度都够。不过正文没给评测集规模和复现方法,我会先打个折——数字好看,但暂时没法独立验证。默认模型换人本身就是当天该推的料,所以还是给了 p1。

TechCrunch · AI

OpenAI 把 ChatGPT 默认模型换成了 GPT-5.5 Instant,说在法律、医学、金融这些领域更少胡说八道

OpenAI 发了 GPT-5.5 Instant,直接替掉了之前的 GPT-5.3 Instant,成了 ChatGPT 的默认模型。公司说新模型在法律、医学和金融这些容易出错的领域减少了幻觉(也就是瞎编答案),同时保持了上一代的低延迟。但正文没披露任何跑分、具体降低了多少幻觉率、覆盖哪些用户、以及价格有没有变。

推荐理由:我会先打个折:OpenAI 把新模型直接设为默认,动作不小,但正文只给了定性描述,没披露幻觉降低的具体幅度、评测方法、覆盖地区或价格。对从业者来说,知道默认模型变了是刚需,但能不能立刻用上、省不省钱、稳不稳定,这些关键信息都还缺着。所以重要性给到 88,属于必须知道但还不能全信的那一档。

5月5日星期二

r/LocalLLaMA

Hugging Face 发了个交互式指南,横向对比不同框架下的强化学习训练环境

Hugging Face 的后训练团队花了一个月,用 verifiers、OpenEnv、Nemo-Gym、OpenRewards 等几套框架分别搭了强化学习环境,然后实际训模型来看哪种方案在扩展时更顺手。他们把这个过程做成了交互式指南,方便你点进去对比。不过正文没给出具体的基准分数、模型规模或训练成本,所以没法判断哪套方案效果更好或更省钱,目前更像一...

推荐理由:我会先打个折:正文没给具体基准分数、模型规模和训练成本,所以没法判断哪个框架真的更省钱或更稳。但 Hugging Face 花一个月亲自下场踩坑,把不同 RL 环境框架的差异和扩展轴摆出来,对正在搭训练流程的团队有实操参考价值。这点先别太激动,等他们把量化结果补上才算完整。