跳到正文

研究与技术报告

厂商和机构的官方研究文章与技术报告:架构创新、训练方法、能力测量与安全研究的解读。本站不收纯学术论文。

最新精选

第 21–40 条 · 共 262 条

6月5日星期五

机器之心 · 公众号

CMU 新论文让大模型在上下文窗口满了之后“睡觉”,用离线循环前向传播更新记忆权重,再清掉缓存

CMU 和马里兰大学的研究者给大模型加了一个“睡眠”机制。具体做法是:当模型处理长文本、上下文窗口(L-token)塞满时,不直接丢掉旧的 KV 缓存,而是先跑 N 轮离线的循环前向传播,把当前信息压缩更新到 SSM(状态空间模型)的快速权重里,然后再清空缓存。论文在 GSM-Infinite 任务上拿 Jet-Nemotron 2B 模型试了试,设 ...

推荐理由:HKR 三项都过:钩子强,知识点有可复现的机制和 Jet-Nemotron 2B 的实测数字,也踩中了中美算力效率竞赛的神经。但它仍是一篇早期论文,不是产品发布或行业级事件,所以刚好卡在 featured 门槛上。

Hacker News 首页

Transformer 真的需要 Q、K、V 三套投影吗?这篇论文系统测了三种共享方案

这篇 ICML 2026 的论文直接动手试了三种省参数的方案:让 Key 和 Value 共用一套投影(Q-K=V)、让 Query 和 Key 共用(Q=K-V),以及三者全共用(Q=K=V)。后两种会让注意力图变成对称的,作者用 2D 位置编码来打破对称性。实验覆盖了合成任务、图像分类和语言模型,最大跑到 12 亿参数、100 亿 token 的训...

推荐理由:这篇 ICML 2026 论文没搞理论推导,直接动手试了三种省投影的方案:Key 和 Value 共用一套(Q-K=V)、Query 和 Key 共用(Q=K-V),以及三者全共用(Q=K=V)。后两种会让注意力图变成对称的,作者用 2D 位置编码来打破对称性。实验从合成任务一路做到 12 亿参数的语言模型,最大跑了 100 亿 token。结果挺实在:Q-K=V 方案在语言模型上几乎不掉点,但 KV 缓存直接砍半,推理成本能省不少。不过这是架构研究,不是落地产品,而且论文里没提法案文本和执行时间表——那部分只是公开信呼吁,还没变成法律。所以放在 ...

Hacker News 首页

当 AI 开始自己造自己:Anthropic 谈递归式自我改进的进展

Anthropic 发了一篇文章,讲他们内部怎么让 Claude 越来越多地参与 AI 开发。核心概念是“递归式自我改进”——让 AI 系统能完全自主地设计和开发自己的下一代。他们说自己还没到那一步,但趋势在加速。文章给了几个内部数据:到 2026 年 5 月,Anthropic 合并的代码里超过 80% 是 Claude 写的;工程师现在平均每个季度...

推荐理由:H 和 R 都过了:标题钩子强,话题本身也切中前沿模型的安全焦虑。K 没过是因为这只是一封公开信和政策呼吁,不是已生效的法律,正文也没披露具体机制或模型细节,信息密度撑不起更高评级,放在 featured 合理。

6月4日星期四

量子位 · 公众号

Together AI 把 2-bit KV Cache 压缩真的跑在了线上服务里

Together AI 和悉尼大学、UIUC 搞了个叫 OSCAR 的 2-bit KV Cache 压缩方案,每个 KV 元素实际只占约 2.28 bit,在 Qwen3-4B-Thinking 上跑分 71.86,比 TurboQuant 高出 40.1 分。简单说就是把模型推理时占显存的大头——键值缓存——压到极低精度,还尽量不丢性能。正文没披露...

推荐理由:HKR 三项都站得住:OSCAR 把 2-bit KV Cache 从纸面推到线上,还给了实打实的分数和对比。不过话题本身还是底层推理优化,放 featured 比放头条更合适,做推理基建的人会点进去看。

量子位 · 公众号

CVPR 2026 上,小鹏给英伟达、特斯拉和 Waymo 讲了一遍自己的物理 AI 技术栈

小鹏在 CVPR 2026 上公开了他们的世界模型技术栈,包含 X-World、X-Foresight 和 X-Cache 三个部分。X-Cache 能砍掉约 70% 的重复计算,相当于让模型推理时少做无用功。第二代 VLA 模型用了超过 4 万亿个 token 训练,这个量级说明训练数据投入很大。车端推理延迟压到了 80 毫秒,对实时驾驶决策来说这个...

推荐理由:我会先打个折,这毕竟是小鹏在顶会上的技术展示,不是独立验证过的第三方评测,所以分数没给到 85 以上。但选题确实抓人:CVPR 舞台上让北美自动驾驶三巨头听一家中国公司讲物理 AI,本身就制造了对比。信息量也够,X-Cache 的七成重复计算缩减、4 万亿 token 的训练规模、80 毫秒的车端延迟,都是能直接拿来讨论的指标。正文没披露 X-Cache 具体在什么场景下测出这个节省比例,也没说 80 毫秒是平均还是 P99,这点先别太激动。整体看,对做自动驾驶和端侧模型的人有参考价值,也踩中了中美技术竞争的神经,所以放在 featured 位置。

6月3日星期三

NVIDIA 博客

NVIDIA 在 CVPR 发了三篇物理 AI 论文:抓取、自动驾驶和游戏里练出来的智能体

这三篇论文都进了 CVPR。GraspGen-X 用 20 亿次模拟抓取训练,让机械手能处理没见过的物体,但正文没披露真实世界的抓取成功率。LCDrive 把自动驾驶的推理 token 砍了大约一半,靠的是让模型直接输出轨迹而不是先写文字再转成动作,延迟更低,不过没提极端场景下的安全性验证。NitroGen 在 1000 多个游戏里跑了 4 万小时的交...

推荐理由:NVIDIA 在 CVPR 放出的三篇论文,每篇都带着实打实的数字:GraspGen-X 用 20 亿次模拟抓取训练机械手,LCDrive 把自动驾驶模型的推理 token 砍掉一半,NitroGen 在 1000 多款游戏里攒了 4 万小时交互数据来训游戏 agent。我会先打个折——这是厂商研究打包发布,不是新模型或产品上线,所以重要性停在 78 分。但信息密度够高,对做机器人、自动驾驶和游戏 agent 的人有直接参考价值,尤其是用合成数据替代真实采集、降低推理延迟这两条思路,正文没披露具体硬件环境和延迟数字,这点先别太激动。

机器之心 · 公众号

大模型 SFT 的算力浪费有救了:同质化数据训练几百步就该停,新方法能提前揪出过拟合

这篇文章正文被微信环境验证挡住了,看不到具体内容。从标题和已有的英文摘要看,Junpeng Zhang 他们发现,用高度同质化的数据做 SFT 时,有效训练窗口其实很短,大概几百到一千步左右。他们搞了一个基于交互信号的预警方法,能在 loss 差距还没拉大之前就检测到过拟合,据称能省下 30% 到 50% 的训练算力。不过具体怎么检测、实验怎么设计的,...

推荐理由:这篇论文没画大饼,直接给了一个可操作的结论:同质化数据做 SFT,有效训练步数很短,几百到一千步就差不多了。他们还提出一种交互机理预警,能比传统看 loss 更早发现过拟合,实测能省下 30% 到 50% 的算力。对天天在调参、担心过拟合又心疼显卡钱的人来说,这个发现挺实用。不过正文没披露实验用的模型规模和具体数据配比,实际省下来的算力在不同场景下会打多少折扣,还得自己试。

机器之心 · 公众号

蚂蚁灵波在 RSS 2026 提出首个自回归因果世界模型,用 50 条演示数据就能让机器人学会通用操控

蚂蚁灵波和港科大搞了个叫 LingBot-VA 的模型,把“预测画面接下来怎么变”和“判断该做什么动作”合到一个自回归框架里。论文说,每个任务只用 50 条真实世界的演示数据微调,在 RoboTwin 2.0 的简单和困难设定下,成功率分别到了 92.0% 和 91.1%。不过原文因为微信环境异常没抓到,具体实验细节和泛化边界暂时看不到,这个成功率数字...

推荐理由:标题的“50条数据”是个强钩子,对数据成本敏感的从业者吸引力很大。文章把自回归因果世界模型的机制讲得比较清楚,就是让模型先预测画面变化再决定动作,不是黑箱。但全文只有一篇论文发布,没看到开源代码、实物测试视频或跟主流基线(比如扩散策略)的量化对比,验证强度不够。所以重要性给78,属于值得关注但别急着全信的研究发布。

量子位 · 公众号

大晓机器人和南洋理工搞了个统一物理3D生成框架,刚体、软体、带关节的物体都能一次搞定

这个框架叫PhysX-Omni,目标是让生成的3D模型直接能进物理仿真跑起来,不用再手动修。它把刚体、软体和关节体三类物体的生成统一到一个流程里,省掉了以前要分开处理的麻烦。配套的PhysXVerse数据集有8700个资产,覆盖2900个类别,规模不小。评测基准PhysX-Bench从几何、尺寸、材质、可交互性、运动学和文字描述六个维度打分,但正文没披...

推荐理由:统一物理 3D 生成这个钩子很清晰,数据集和评测基准的规模也给了实锤,对做机器人仿真的团队确实有用。不过正文没提开源、没提落地案例,也没说生成质量跟现有方案比到底好多少,所以分数先不打满,78 分合理。

Computing Life · Share · 鸭哥调研

MAI-Thinking-1:让模型持续思考几千步不崩,比让它开始思考难得多

微软 MAI-Thinking-1 的技术报告没在吹模型多会解题,而是在讲怎么让强化学习训练别崩。他们给 GRPO 算法打了三个补丁:一个像恒温器一样动态调节模型的“自信度”,防止它变得死板或乱猜;一个像断路器,在梯度爆炸时直接截断,保住整批训练数据;还有一套自蒸馏抢救流程,训练万一崩了,能把之前学会的推理能力搬到新模型上继续跑。这三个机制合起来,让模...

推荐理由:标题把卖点从“会思考”转到“持续思考”,一下就把训练崩溃这个真问题拎出来了。三种机制的名字虽然有点包装感,但至少给了具体抓手:恒温器控波动、断路器防崩、自蒸馏保风格。正文没披露具体实验数据和复现条件,所以“几千步不崩”这个数字先打个折看。整体对做推理模型训练的人有参考价值,但离落地验证还差一口气。

Computing Life · Share · 鸭哥调研

vibe coding 之后:AI 编程的工业化

MAI 从 487 万个开源 PR 里筛出 26.5 万道可训练题目,又为它们建了一套三层判分体系。AI 编程这两年真正的变化不是模型变聪明了,而是训练基础设施被工业化了:出题从手工活变成了流水线,批改也从“单测全绿就行”升级到能检查工具使用效率和前端视觉质量。

推荐理由:这篇文章没发模型、没给跑分,但把“vibe coding”之后该看什么讲清楚了:训练数据怎么筛、判分怎么搭、工程成本怎么控。487 万 PR 筛到 26.5 万题,这个压缩比本身就说明他们在做苦活,不是随便抓一把数据就训。三层判分体系正文没展开细节,但至少表明他们知道代码题不能只靠单次通过率来评。我会先打个折:没看到开源计划、也没看到实际训练出来的模型效果,所以目前更像一套训练基础设施的思路,离可复现的结论还差一步。对正在考虑自训代码 agent 的团队来说,这篇值得看,但别急着当标杆。

AI HOT 精选

微软放出 MAI-Thinking-1,35B 活跃参数的 MoE 模型,没靠蒸馏自己从头训

微软发了 MAI-Thinking-1,一个混合专家(MoE)模型,总参数 1 万亿但每次只激活 350 亿,跑起来相对省算力。它用 30T token 从零预训练,没拿第三方模型做蒸馏,这点比较硬气。微软管自己的迭代优化流程叫“爬山机器”,听着像在反复试错往上拱。成绩单上,AIME 2025 拿了 97.0%,LiveCodeBench v6 拿了 ...

推荐理由:微软发了 MAI-Thinking-1,一个 MoE 架构的推理模型,活跃参数 35B,总参数 1T,用 30T tokens 从零开始预训练。我会先打个折:正文没给任何跑分、开放方式或定价,所以没法判断实际水平。光看参数规模,35B 活跃部分在推理时成本不会太高,但 1T 总参数意味着训练和存储都不便宜。这点先别太激动,等有 benchmark 和访问方式再说。

6月2日星期二

机器之心 · 公众号

DataMaster:让模型自己搜数据、洗数据、拼数据,MLE-Bench Lite 奖牌率从 35.91% 拉到 68.18%

这篇论文提出了 DataMaster,一个让大模型自己当数据工程师的流程。它不碰模型结构和训练算法,只做三件事:自动搜索外部数据、清洗脏数据、把多个数据集拼成一张表。在 MLE-Bench Lite 这个机器学习竞赛基准上,DataMaster 把奖牌率从 35.91% 提到了 68.18%,几乎翻倍。正文没披露具体用了哪些模型、单次任务耗时和额外算力...

推荐理由:DataMaster 做的事很直接:模型和训练代码都不动,只让系统自己去搜、洗、拼数据,结果 MLE-Bench Lite 奖牌率从 35.91% 拉到 68.18%,接近翻倍。我会先打个折——这还只是单篇研究,没有生产环境验证,benchmark 本身也不是完整 MLE-Bench,所以别急着当银弹。但“数据工程自动化”这个方向确实戳中很多团队的日常痛点,加上数字够具体,给 78 分 featured 合理。

机器之心 · 公众号

图灵奖得主 Sutton 新论文:AI 的下一步,得学会在行动中理解世界

这篇文章的正文被微信环境验证挡住了,实际内容没抓到。从标题和摘要看,Banafsheh Rafiee 和 Richard S. Sutton 提了一个叫“生成认知”的框架,给 AI 立了四根柱子:经验、感知与行动不可分、自主性、具身性。说白了就是主张智能不能光靠看数据,得在跟环境互动的过程中长出来。但具体怎么实现、有没有实验,正文没披露,这点先别太激动。

推荐理由:这篇是 Sutton 和 Rafiee 的新论文解读,核心是提出“生成认知”框架,主张智能体得靠经验、感知和行动绑在一起、自己定目标、还得有身体去试错。我会先打个折:正文没披露实验、代码或可复现的测试,目前还停在概念层。但 Sutton 的名气和四个支柱的提法,让它有资格进 featured,属于研究评论向的必读。

FT · 科技

头部 AI 实验室开始正经研究机器有没有“意识”

Google DeepMind、Anthropic 和 Meta 都在研究 AI 能不能产生意识,以及这对人意味着什么。但正文被付费墙挡了,没披露具体用什么方法、有没有时间表、怎么才算“有意识”的评判标准。

推荐理由:我会先打个折:标题很抓人,但正文几乎没给干货。三家大厂在研究 AI 会不会产生意识,这确实是个能吵起来的话题,安全和对齐方向的人都会关注。可文章没披露他们怎么定义“意识”、用什么实验验证、有没有阶段性结论,连时间表都没有。所以这条只能当个信号看,别太激动。基于信息缺口,重要性停在 72,放在 featured 里提醒大家有这么个动向就够了。

6月1日星期一

AI HOT 精选

JetBrains 发布 Mellum2:一个 12B 参数的混合专家模型,每次推理只激活 2.5B 参数

JetBrains 在 Hugging Face 上开源了 Mellum2,一个从零开始训练的混合专家模型。它总共有 120 亿参数,但每次计算只激活其中的 25 亿,这让它跑起来比同尺寸模型快了一倍多,适合对延迟和吞吐量要求高的场景。模型专门处理文本和代码,不做多模态,主要用在路由分发、外挂资料库检索、摘要和子智能体这些需要频繁调用模型但不必上大模型...

推荐理由:HKR 三项都过,但正文只给了 12B 和 MoE 这两个信息,没放跑分、没提许可证、没写上下文窗口,也没说怎么跟自家 IDE 集成。先按中等量级的模型发布处理,放在 featured 里偏低的档位。

Import AI

AI 监管比想象中难;蛋白质折叠模型也找到了规模定律;有人给 AI 灭绝风险估了个价

这期 Import AI 聊了几件事。美国 AI 经济的真实增速可能被严重低估了:名义 GDP 在 2025 年约 2500 亿美元,但算上质量提升,实际年增速接近 2600%。之所以在常规统计里看不出来,是因为 AI 推理价格跌得和性能涨得几乎一样快,而且数据中心建设规模还没大到能明显拉动 GDP。作者提醒,AI 跟过去的半导体、互联网不一样,它可能...

推荐理由:这篇是 Import AI 的周报汇总,不是一手突发新闻,所以我会先打个折。但它的选题角度很刁钻,把“AI 灭绝风险”当成一个可以算账的经济问题来聊,比单纯喊安全口号有意思。里面给的美国 AI GDP 数字和质量调整增速,能让读者对行业体量有个具体感知。监督那部分也点出了当前对齐工作的实际困难,不是空谈。整体信息密度够,对关注 AI 政策与安全的从业者有参考价值。

r/LocalLLaMA

我在一张 RTX 3060 上给冻结的 1.4B Mamba 主干挂了 8 个推理专家臂,这是拆解报告

作者用一张 12GB 显存的 RTX 3060 训练了一个叫 Mamba-Titan-1.4B-Reasoning 的模型。做法是把一个 1.4B 参数的 Mamba-1 主干完全冻结,只在第 24、25 层外挂了 8 个可训练的专家臂,组成一个总参数量 2.54B 的混合专家模型,每次推理只激活其中 2 个专家。数学题准确率大概做到 50%。正文没披...

推荐理由:这是一篇 Reddit 个人实验帖,不是论文,也没有独立复现,所以我会先打个折。但它的价值在于把一次失败解剖写得清楚:在单张 RTX 3060 上,冻结 Mamba 主干、外挂 8 路 MoE 做推理,最后数学准确率卡在 50% 左右。正文没披露训练时长和具体数据集,这点信息有缺口。对想用消费级显卡折腾推理模型的从业者来说,这篇能省掉一次踩坑,属于低门槛、有参考意义的 featured 内容。

5月31日星期日

机器之心 · 公众号

人大高瓴发了一篇40页综述,专门讲怎么给大模型打分

这篇综述把“评分标准(Rubrics)”这件事拆成了五个部分来讲:定义、怎么构建、怎么用来训练、怎么用来评估、以及还没解决的难题。它想回答一个很实际的问题:在模型能自己调用工具、走流程干活的 Agent 时代,光看答案对不对已经不够了,得有一套更细的尺子来衡量“好答案”到底好在哪里。正文没披露具体的实验数据,更像是一张研究地图,帮从业者快速看清这个方向...

推荐理由:这篇综述没发布新模型或产品,但 40 页的框架对 agent 评测很有用,我会先打个折,放在 featured 档。正文没披露具体实验数据,更像文献梳理,但问题意识够强,从业者能直接拿来对照自己的评估流程。

量子位 · 公众号

复旦和通义搞了个 ToolCUA,专门教 Agent 在屏幕上选对工具

现在给 Agent 塞一堆工具,它经常不知道该点哪个。复旦和通义实验室提出了一套叫 ToolCUA 的训练方法,核心是用约 4000 个合成工具和 18 万步的“屏幕操作+工具调用”交叉轨迹来训练模型。他们训出来的 ToolCUA-8B 在 OSWorld-MCP 基准上跑到了 46.85% 的准确率。不过正文因为微信环境验证没抓到,具体训练细节和对比...

推荐理由:这篇文章抓了一个实际工程里的矛盾:工具越多,Agent 越不会选。我会先打个折,46.85% 的准确率不算高,但考虑到是 4k 工具的环境,这个数字说明问题确实难。18 万步合成轨迹是亮点,意味着训练数据不用全人工标,成本上友好一些。正文没披露推理延迟和实际部署的资源消耗,这点先别太激动。整体是一篇有痛点的研究发布,不是大模型或产品级发布,所以放在 featured 里合适。