跳到正文

#部署/工程

今日 0 条

9月24日星期四

Google DeepMind

Google DeepMind 为 Private AI Compute 引入安全服务端记忆

Google DeepMind 公布 Private AI Compute 的新技术能力,将私密的服务端持久记忆引入该平台,使 AI 助手能跨设备保留上下文。数据密封在加密存储中,解锁密钥仅保存在用户设备上,模型访问时通过端到端加密通道进入云端安全隔区,在隔离内存中临时解密并即时重新加密。

推荐理由:原文说明云端持久记忆如何用安全隔区与设备端密钥实现隐私保护,可了解云端 AI 记忆的隐私架构思路。

6月10日星期三

r/LocalLLaMA

ICML 论文提出可预测幻觉的“回答-弃权”闸门,并开源 ntkMirror 免训练实现

这篇 ICML 2026 论文给证据型问答任务设计了一个 ISR=1 的闸门:模型在不确定时直接闭嘴不答,而不是硬编。他们同时放出了 ntkMirror,一个免训练的开源实现,能在本地模型上跑。做法是让模型对同一问题看多份不同排序的证据,如果几次回答不一致就弃权。在留出的审计集上,幻觉率压到了 0.0%–0.7%,代价是大约 24% 的问题被主动弃权。...

推荐理由:这篇 ICML 论文和配套的 ntkMirror 实现,核心思路不复杂:让模型对同一问题看几份顺序不同的证据,回答不一致就闭嘴不答。在审计集上幻觉率确实压得很低,但约四分之一的问题被弃权,这个代价得看场景能不能接受。论文限定在证据型问答,别急着往开放域对话上套。开源免训练能本地跑是个加分项,但正文没披露不同模型尺寸下的延迟和资源消耗,实际部署前最好自己测一下。

6月8日星期一

机器之心 · 公众号

openJiuwen 搞了个叫 MANGO 的多智能体流网络,让一群模型自己学会怎么组队干活

openJiuwen 提出了 MANGO,一个多智能体流网络框架。它把强化学习、文本梯度(用自然语言反馈来调模型)和 Skip-k 机制(跳过不靠谱的中间步骤)揉在一起,让一群模型自己学会怎么组队、怎么分工。用 GPT-4o-mini 跑分,在 MATH500 数学题上比 MaAS 准确率高了 12.8 个百分点,在 DROP 阅读理解上比 AFlow...

推荐理由:我会先打个折:这还是个研究框架,不是大模型或平台级发布,所以别当重磅炸弹看。但 HKR 里 K 最扎实,机制和数字都给出来了,MATH500 上 +12.8% 的差距不算小。H 和 R 靠“流网络”这个角度撑住,对搞多智能体协作的人有参考价值。正文没提开源代码链接,这点先别太激动。

机器之心 · 公众号

阿里 RTPurboV2:用几百步训练把注意力计算砍掉九成,原生 Transformer 又硬气了一回

阿里 RTP 团队发了 RTPurboV2,思路很直接:把模型里 85% 的注意力头换成滑动窗口注意力(SWA),剩下 15% 负责长距离检索的头用低秩投影、聚类和动态 top-p 压缩。适配训练只要大概 600 步、约 100 万条标注 token,Prefill 阶段推理加速最高到 9.36 倍。不过正文因为环境验证失败没抓到具体实验细节和模型规模...

推荐理由:阿里 RTP 团队这篇 RTPurboV2 思路很直白:把模型里大部分注意力头换成便宜的滑动窗口,只留一小撮头用低秩投影和聚类做长距离检索,训练成本压到 600 步、100 万条 token,Prefill 加速最高能到 9.36 倍。这个数字我会先打个折,因为正文自己说环境验证失败没抓到实验细节和模型规模,所以加速比在什么尺寸、什么长度下测的还不清楚。但思路本身对做长上下文部署的人有参考价值,属于工程信号强但缺完整验证的那种。

6月6日星期六

r/LocalLLaMA

Domino:把推测解码里的因果建模和自回归起草拆开,Qwen3 吞吐最高提 5.8 倍

这篇论文提出 Domino,把推测解码(让一个小模型先快速起草、大模型再校验)里的两个步骤拆得更干净:因果建模和自回归起草不再绑在一起跑。在 Qwen3 上测出了最高 5.8 倍的吞吐提升。不过 Reddit 帖子本身被屏蔽了,正文没披露具体用了什么硬件、基线怎么设的、数据集和接受率这些关键细节,所以这个 5.8 倍是在什么条件下跑出来的还不清楚,先打...

推荐理由:这篇的核心卖点是 5.8 倍吞吐提升,但 Reddit 帖子被屏蔽了,正文没写用什么硬件、基线怎么设、数据集和接受率这些关键信息,所以这个数字是在什么条件下跑出来的还不清楚,先打个折。不过思路本身有意思:把起草和校验拆干净,代码和模型也开源了,对搞推理优化的人值得看一眼。

AI HOT 精选

用Qwen2.5-3B搭了个五人森林经济体,小模型能跑流程但算账不太行

一个开发者拿Qwen2.5-3B(30亿参数的开源小模型)做了个多智能体模拟:五个角色在森林里各自生产、交易、囤货,跑了15轮。模型在100%的调用里都能输出格式正确的JSON,这点挺稳,但一到经济决策就露怯——它分不清该囤柴还是该卖蜜。作者靠两招补救:一是给环境加限制,比如食物会坏、冬天缺燃料,逼着模型做取舍;二是优化提示词,直接写明“别买自己生产的...

推荐理由:HKR全过。标题本身就抓人——3B小模型跑经济模拟,不是那种千篇一律的benchmark刷分。正文给了实打实的交易数据和基尼系数变化,不是空谈“涌现行为”。对做agent模拟的工程师来说,模型100%输出合法JSON这点很实用,但经济决策拉胯的坑和两条补救措施(环境约束、提示词优化)才是真正能省时间的干货。这只是一份个人工程报告,不是产品发布或框架开源,所以保持在featured门槛上,不往上拔。

6月5日星期五

机器之心 · 公众号

CMU 新论文让大模型在上下文窗口满了之后“睡觉”,用离线循环前向传播更新记忆权重,再清掉缓存

CMU 和马里兰大学的研究者给大模型加了一个“睡眠”机制。具体做法是:当模型处理长文本、上下文窗口(L-token)塞满时,不直接丢掉旧的 KV 缓存,而是先跑 N 轮离线的循环前向传播,把当前信息压缩更新到 SSM(状态空间模型)的快速权重里,然后再清空缓存。论文在 GSM-Infinite 任务上拿 Jet-Nemotron 2B 模型试了试,设 ...

推荐理由:HKR 三项都过:钩子强,知识点有可复现的机制和 Jet-Nemotron 2B 的实测数字,也踩中了中美算力效率竞赛的神经。但它仍是一篇早期论文,不是产品发布或行业级事件,所以刚好卡在 featured 门槛上。

Hacker News 首页

Transformer 真的需要 Q、K、V 三套投影吗?这篇论文系统测了三种共享方案

这篇 ICML 2026 的论文直接动手试了三种省参数的方案:让 Key 和 Value 共用一套投影(Q-K=V)、让 Query 和 Key 共用(Q=K-V),以及三者全共用(Q=K=V)。后两种会让注意力图变成对称的,作者用 2D 位置编码来打破对称性。实验覆盖了合成任务、图像分类和语言模型,最大跑到 12 亿参数、100 亿 token 的训...

推荐理由:这篇 ICML 2026 论文没搞理论推导,直接动手试了三种省投影的方案:Key 和 Value 共用一套(Q-K=V)、Query 和 Key 共用(Q=K-V),以及三者全共用(Q=K=V)。后两种会让注意力图变成对称的,作者用 2D 位置编码来打破对称性。实验从合成任务一路做到 12 亿参数的语言模型,最大跑了 100 亿 token。结果挺实在:Q-K=V 方案在语言模型上几乎不掉点,但 KV 缓存直接砍半,推理成本能省不少。不过这是架构研究,不是落地产品,而且论文里没提法案文本和执行时间表——那部分只是公开信呼吁,还没变成法律。所以放在 ...

6月4日星期四

量子位 · 公众号

Together AI 把 2-bit KV Cache 压缩真的跑在了线上服务里

Together AI 和悉尼大学、UIUC 搞了个叫 OSCAR 的 2-bit KV Cache 压缩方案,每个 KV 元素实际只占约 2.28 bit,在 Qwen3-4B-Thinking 上跑分 71.86,比 TurboQuant 高出 40.1 分。简单说就是把模型推理时占显存的大头——键值缓存——压到极低精度,还尽量不丢性能。正文没披露...

推荐理由:HKR 三项都站得住:OSCAR 把 2-bit KV Cache 从纸面推到线上,还给了实打实的分数和对比。不过话题本身还是底层推理优化,放 featured 比放头条更合适,做推理基建的人会点进去看。

量子位 · 公众号

CVPR 2026 上,小鹏给英伟达、特斯拉和 Waymo 讲了一遍自己的物理 AI 技术栈

小鹏在 CVPR 2026 上公开了他们的世界模型技术栈,包含 X-World、X-Foresight 和 X-Cache 三个部分。X-Cache 能砍掉约 70% 的重复计算,相当于让模型推理时少做无用功。第二代 VLA 模型用了超过 4 万亿个 token 训练,这个量级说明训练数据投入很大。车端推理延迟压到了 80 毫秒,对实时驾驶决策来说这个...

推荐理由:我会先打个折,这毕竟是小鹏在顶会上的技术展示,不是独立验证过的第三方评测,所以分数没给到 85 以上。但选题确实抓人:CVPR 舞台上让北美自动驾驶三巨头听一家中国公司讲物理 AI,本身就制造了对比。信息量也够,X-Cache 的七成重复计算缩减、4 万亿 token 的训练规模、80 毫秒的车端延迟,都是能直接拿来讨论的指标。正文没披露 X-Cache 具体在什么场景下测出这个节省比例,也没说 80 毫秒是平均还是 P99,这点先别太激动。整体看,对做自动驾驶和端侧模型的人有参考价值,也踩中了中美技术竞争的神经,所以放在 featured 位置。

5月30日星期六

机器之心 · 公众号

苹果搞了个叫 PICO 的图像压缩方案,画质不变,文件能小到三分之一

苹果发了篇论文介绍 PICO,一个用 AI 做图像压缩的编解码器。在主观画质差不多的情况下,它比 AV1、VVC 和 JPEG AI 省 57% 到 70% 的码率,也就是说文件体积能压到原来的三分之一甚至更少。在 iPhone 17 Pro Max 上跑,压一张 1200 万像素的照片要 230 毫秒,解压要 150 毫秒。正文没具体讲模型结构和训练...

推荐理由:HKR 三项都成立:PICO 有明确的 57%–70% 码率节省和 230 毫秒端侧编码数据,不是纯概念。但正文没提产品化时间,目前还是研究发布,所以分数放在 78–84 这个区间。

5月29日星期五

机器之心 · 公众号

TogetherAI 搞了个真 2-bit 的 KV 缓存压缩方案 OSCAR,长上下文推理能跑更快

TogetherAI 和合作方发布了 OSCAR,一个把 KV 缓存压到平均每个值只占 2.28 比特的压缩系统,已经接进了 SGLang 推理框架。在 10 万 token 的长上下文场景里,解码速度最高能到原来的 3 倍;在固定显存预算下,整个任务吞吐量最高能到 7 倍。正文没披露具体模型和测试硬件,也没说精度损失有多大,这点先别太激动。

推荐理由:我会先打个折:这是推理优化层的专项工作,不是模型发布,受众偏工程。但 100k 上下文 decode 约 3 倍加速、吞吐约 7 倍这两个数够硬,对跑长上下文推理的团队有直接参考价值。正文没披露精度损失的具体对比,这点先别太激动。整体值得放进 featured,让做推理部署的人看到。

机器之心 · 公众号

马嘉祺让大模型翻车,背后是低频词退化问题,有人一年前洗澡时就发现了

文章页面被微信环境验证挡住了,正文内容没拿到。从现有标题和英文摘要看,讲的是 FaceMind 团队把大模型在“马嘉祺”这类低频词上翻车的现象,和两篇论文串了起来:一篇是 EMNLP 2025 的 SLoW,另一篇是刚被 ACL 2026 接收为 Oral 的 Adam's Law。摘要里还提到一个具体数字——用高频词改写的方法,把 DeepSeek-...

推荐理由:这篇文章把马嘉祺让大模型翻车这个意外事件,和低频 token 退化这个技术问题绑在一起讲,切入点很巧。它不光讲现象,还给出了两篇顶会论文的机制解释,以及 DeepSeek-V3 上 8 个百分点的准确率提升,对做模型评测和提示工程的人有直接参考价值。不是大模型发布那种重磅消息,但属于扎实的研究信号,值得放进精选。

5月28日星期四

机器之心 · 公众号

Mila 和 DeepMind 搞了个大一统的缩放定律公式 UNSL,想把参数量、数据量、训练步数这些变量塞进同一个框架里

正文因为微信环境异常被屏蔽了,具体技术细节看不到。从标题和已有英文摘要看,这篇论文提出了一种叫 UNSL(统一神经缩放定律)的多变量公式,不再只看模型参数或数据量单一维度,而是同时建模参数量、token 数、训练步数,还考虑了训练瓶颈、过拟合以及超参数调不好的负面影响。在论文自己汇报的实验里,UNSL 在 60.87% 的视觉任务和 88.89% 的语...

推荐理由:这篇不是又一个刷榜的 scaling law,而是把之前各自为政的变量(参数量、token 数、步数、瓶颈、过拟合、超参数反作用)捏到了一起。我会先打个折:视觉任务 60.87% 的最佳外推率说明还有不少场景没覆盖到,但语言任务 88.89% 确实亮眼。正文没披露具体实验用了多少算力、验证集规模多大,这点先别太激动。如果是真的,训练前就能更准地估出该堆参数还是堆数据,省钱。

5月27日星期三

量子位 · 公众号

卡内基梅隆和马里兰大学让大模型“睡觉”:上下文快满时暂停、压缩记忆再继续推理

这篇论文给大模型设计了一个类似人类睡眠的机制。当模型处理长文本、上下文窗口快塞满时,它会主动停下来,不再接收新 token,而是利用离线时间对已积累的上下文做多轮递归前向计算,把信息压缩成“快速权重”。之后清空 KV 缓存,相当于整理完记忆再醒来继续干活。测试在细胞自动机、多跳图谱检索和 GSM-Infinite 推理任务上跑过,但正文没披露具体的性能...

推荐理由:我会先打个折,因为正文没给出压缩后的基准测试提升、代码或实际部署证据,所以分数停在 76。但“睡觉”这个说法确实把枯燥的上下文压缩讲得让人想点进去看。核心操作是模型在上下文快满时主动暂停,用多轮离线方式把旧信息压紧,然后清掉 KV 缓存腾地方,思路清楚。如果后续有实测数据,比如长文本任务不掉点、显存省了多少,分数还能往上走。这点先别太激动,等看到具体数字再说。

机器之心 · 公众号

AMD 论文发现 FP4 训练不稳,锅不在随机性不够

AMD 和宾州州立大学用 MI355X 原生 FP4 硬件预训练了 Llama 3.1-8B,端到端速度比 FP8 基线快了 9-10%。但论文指出,Wgrad(权重梯度)量化是拖后腿的环节,导致每个 token 的计算开销额外增加 26-27%,而且用确定性 Hadamard 方法也稳不住。正文没披露最终模型的验证集效果对比,这点先别太激动。

推荐理由:我会先打个折:这是一篇偏训练基础设施的研究,不是通用大模型发布,所以分数不会给到顶。但它的钩子很锋利——直接挑战“FP4 不稳定是因为随机性不足”这个流行说法,并且给出了在 AMD 最新硬件上跑 Llama 3.1-8B 的实测数据。速度提升 9-10% 是实打实的,但 Wgrad 带来的 26-27% 额外开销也说明这条路还没完全走通,这点先别太激动。对关心训练成本和硬件选型的从业者来说,这篇值得一看。

5月26日星期二

阿里技术 · 公众号

南大和阿里发现 DiT 里的残差流拖慢收敛,改用跨层路由后训练快了近 9 倍

南京大学 LAMDA 组和阿里智能引擎团队提出了一种叫 DAR 的方法,把 DiT 模型里固定的残差累积,换成了按时间步动态选择路径的跨层路由。在 ImageNet 256×256 上拿 SiT-XL/2 试,FID 从 9.67 降到了 7.56,而且只用原来大约九分之一的训练步数就达到了同等收敛质量。不过原文因为微信环境验证拦截,具体怎么实现路由、...

推荐理由:我会先打个折:这还是一个针对DiT架构的训练方法改进,不是新模型或产品发布,所以分数没往78以上走。但它的亮点很实在——把残差流这个大家默认的组件揪出来说是收敛瓶颈,然后用一个时间感知的路由去替代固定累加,效果是FID更好、收敛快近9倍。对正在烧钱训视觉模型的人,这个省钱省时间的信号够强,featured没问题。

5月25日星期一

r/LocalLLaMA

RTPurbo:用几百步训练把全注意力模型转成稀疏推理,长上下文预填充快 9.36 倍

这篇论文提出 RTPurbo,能把原本用全注意力的模型改成稀疏注意力来跑推理,而且只需要几百步训练。做法是只给“检索头”保留完整的 KV 缓存,其他头用一个 16 维的 token 索引器来近似,相当于大幅压缩了要存要算的内容。在 100 万 token 的长上下文场景下,预填充阶段最高快了 9.36 倍,解码阶段快了约 2.01 倍。正文没披露具体用...

推荐理由:我会先打个折:目前只有 Reddit 讨论,正文没披露模型规模、具体任务和代码,验证强度偏弱。但“几百步把全注意力转稀疏”这个思路本身挺省钱的,数字也够具体,对做长上下文推理优化的人值得看一眼。信息缺口明显,所以分数没往上拉。

5月24日星期日

r/LocalLLaMA

OpenBMB 在华为昇腾 NPU 上把大模型从头训成 1.58-bit,8B 模型性能保住全精度 97%

OpenBMB 放出了 BitCPM-CANN,一个在华为昇腾 NPU 上原生跑通的 1.58-bit(三值)大模型训练方案。他们用和 MiniCPM4 一样的架构与数据,从零训了 0.5B、1B、3B、8B 四个尺寸。1B 到 8B 的模型在 11 个测试集上平均保住了全精度模型 95.7% 到 97.2% 的性能,3B 版本在 BBH 上打平,3B...

推荐理由:我会先打个折:目前只有 Reddit 帖子作为来源,没有吞吐量、显存占用或复现细节,所以先放在 featured 的底线。但这条信息本身挺实在——OpenBMB 在昇腾 NPU 上从零训练了四个 1.58-bit 的模型,不是推理时量化,而是训练阶段就压到极低比特。1B 到 8B 的性能保留率都在 95% 以上,说明这条路在国产硬件上走得通。对需要控制训练成本、又绑在昇腾生态里的团队来说,这是个值得跟的信号。

5月23日星期六

机器之心 · 公众号

FlashAR 用 0.05% 的训练数据,把自回归图像模型的生成速度提了 22.9 倍

浙大和阿德莱德大学搞了个 FlashAR,专门给预训练好的自回归图像模型加速。拿 Emu3.5-Image-34B 试了一下,生成一张 512×512 的图,原来要 130.10 秒,现在只要 5.68 秒,快了 22.9 倍。而且只用了原始训练数据量的 0.05% 做微调,GenEval 分数从 80.48 变成 80.29,画质基本没掉。正文没披露...

推荐理由:FlashAR 用极少量数据给预训练好的自回归图像模型做加速,速度提升 22.9 倍,质量几乎没掉,对在意推理延迟和成本的团队是个好消息。论文给了具体数字和 GenEval 对比,信息量够,但正文没披露这 0.05% 数据具体怎么选、不同分辨率下是否同样有效,这点先别太激动。整体是扎实的推理优化工作,不是顶级实验室的模型发布,放 featured 合适。

机器之心 · 公众号

Bengio 团队新论文:用多条并行思路链做递归推理,效果比单条串行推理好

这篇论文提出了 GRAM,一个会生成多条内部推理轨迹、再从中挑出最优解的递归模型。在极难数独测试上,GRAM 用 16 步递归、同时跑 20 条并行思路,准确率达到 97.0%;作为对比,传统串行递归模型 TRM 要跑到 320 步才做到 90.5%。简单说,就是让模型多想几条路再选,比闷头一条路走到黑更靠谱,而且推理步数还少得多。不过正文没披露具体的...

推荐理由:Bengio 团队这篇新论文拿数独极端难度当试金石,用 GRAM 把递归推理的上限拉高了一截。核心卖点是并行轨迹比长串行更有效:16 步递归配上 20 条并行采样,准确率 97.0%,而对比的串行方法要跑 320 步才到 90.5%。我会先打个折——这只是在单一任务上的结果,泛化到其他推理场景还没验证,正文也没披露并行采样的实际计算开销和延迟。但思路本身对做推理加速的人有参考价值,尤其是想用多条短路径替代一条长路径的时候。

5月22日星期五

AI HOT 精选

首个在华为昇腾910B上全栈训练的1.58比特开源模型BitCPM-CANN发布

ModelBest、清华和OpenBMB搞了个BitCPM-CANN,从0.5B到8B都有,全程用华为昇腾910B NPU训练,没走英伟达路线。1.58比特三元量化意味着每个权重只取三种值,内存比BF16省了约6倍,能塞进手机、电脑和车载设备里跑。基准测试成绩保住了全精度模型的95-97%,这点挺实在。我会先打个折:正文没披露具体推理延迟和功耗数据,也...

推荐理由:HKR三项都站得住:昇腾910B全栈训练1.58比特开源模型这个角度够新,数据也扎实。没给P1是因为目前只有发布事实,缺少独立复现或实际落地效果的佐证,所以先放在featured。

r/LocalLLaMA

这篇论文主张:输入处理用低精度加速,输出生成用高精度保质量

论文 arXiv 2605.20315 提出一个混合精度策略:在预填充阶段用 W4A4 量化,理论上能把输入处理速度提升 4 倍;但解码阶段仍用原始高精度,因为激活值的量化误差会扰动采样出的 token,并在自回归生成中逐步累积,导致输出质量下降。正文没披露具体实验模型和数据集,也没给出实际延迟或吞吐数据,所以这 4 倍目前只是理论估算,实际能省多少还...

推荐理由:这篇论文的卖点是“前段省、后段稳”:预填充用 W4A4 量化,理论上能换来 4 倍加速,解码时再切回高精度,防止误差递归累积把回答搞崩。思路本身挺直接,但正文只给了理论增益,没披露实测吞吐、困惑度变化和具体硬件环境,所以实际能省多少、质量掉多少还不清楚。我会先打个折,等看到实测数据再判断值不值得跟。

5月21日星期四

Latent Space

OpenAI 用通用推理模型花不到 1000 美元,推翻了一个 80 年前的数学猜想

OpenAI 公布了一个内部通用推理模型(外界猜是 GPT 5.6)的成果:它找到了平面单位距离问题的新构造族,推翻了 1946 年 Erdős 提出的一个猜想。这个模型不是专门为数学训练的,就是普通的语言模型,但推理过程生成了约 125 页的总结。有外部观察者推测,这次运行只用了不到 32 小时,成本不到 1000 美元。数学家 Timothy Go...

推荐理由:HKR 三项都成立:一个内部推理模型声称驳倒了 1946 年的 Erdős 问题,输出约 125 页,这是很强的能力信号。不过成本和运行时间目前还是外部推测,正文没披露 OpenAI 自己的官方数字,所以分数没给到 95。

机器之心 · 公众号

VAST 和清华搞了个新方法,让 3D 生成把算力花在刀刃上,高斯点数量砍半画质还能打

这篇论文正文被微信环境验证挡住了,看不到具体技术细节。从标题和已知信息看,他们提出了一种叫 DeG 的 3D 生成方法,核心思路是让模型自己学会在物体细节丰富的地方多放高斯点、在平坦区域少放点,而不是均匀撒点。这样能用不到一半的高斯点数量,达到跟 TRELLIS 差不多的画面质量。相当于用更少的算力跑出同级别的 3D 模型,对做实时渲染或者要在手机上跑...

推荐理由:我会先打个折:正文只说了“部分场景”达到 TRELLIS 相近画质,没给全量对比,所以别直接当成全面超越。但 DeG 这套密度控制方法确实把“算力花在刀刃上”落到了具体机制里——用渲染损失梯度去学哪里该多放高斯球、哪里该省,比均匀撒点聪明。SIGGRAPH 论文本身有一定技术门槛,不过对做 3D 生成的人,这个效率提升方向值得跟。

5月20日星期三

r/LocalLLaMA

英伟达放出 Nemotron-Labs-Diffusion 模型,用扩散解码把 8B 模型跑到 850 tok/s

英伟达发了 Nemotron-Labs-Diffusion 系列,包含 3B、8B 和 14B 三个稠密模型。这组模型同时支持传统的自回归解码和新的扩散并行解码,还带了一种叫 self-speculation 的加速技巧。最抓眼球的是 8B 版本在 GB200 上单并发能跑到每秒 850 个 token,作为对比,同样条件下自回归解码是 253 tok...

推荐理由:NVIDIA 这次没走自回归老路,拿扩散模型做了三个稠密 LLM,最小的 3B,最大的 14B。我会先打个折:目前只有 Reddit 帖子当信源,没有论文或技术报告,所以 850 tok/s 这个数先别太激动,正文没披露具体测试条件和 batch size。但方向本身有意思——扩散并行解码加上 self-speculation,理论上可以一次出多个 token,不用像自回归那样一个字一个字往外蹦,推理延迟能压下去。8B 模型在 GB200 上跑出这个速度,如果属实,对本地跑模型、做实时对话的人挺省钱。信息缺口也明显:没提训练数据、没提多语言能力、没...

5月19日星期二

机器之心 · 公众号

Sebastian Raschka 梳理了 Gemma 4 到 DeepSeek V4 的架构变化,重点在省显存和长上下文

这篇文章是机器之心翻译的 Sebastian Raschka 博客,盘点了几款新模型的架构改动,核心都在想办法降低长上下文的显存开销。Gemma 4 的 E2B 方案在 128K 上下文、bfloat16 精度下,KV 缓存能省大约 2.7GB,这个数字挺实在的。另外还提到了 Laguna XS.2 和 ZAYA1-8B,但正文因为微信环境验证拦截,具...

推荐理由:这是一篇编译的架构趋势梳理,不是一手发布,但信息密度不错。我会先打个折,不往 breaking 级别推。HKR 三档都站得住:标题有明确的模型名钩子,正文有可引用的 KV Cache 节省数字,话题本身也直接关系到推理成本和部署预算。整体放在 featured 中段比较合适,既不过度拔高,也不低估它对从业者的参考价值。

5月18日星期一

Import AI

AI界的震网病毒、有缺陷的Muon优化器,以及“正向对齐”

SentinelOne拆解了一个叫fast16.sys的老病毒,它专门篡改高精度计算软件在内存里的结果,可能被用来破坏核武器开发等工程模拟,在震网病毒出现前五年就已存在。Tilde Research发现流行的Muon优化器有个致命缺陷:训练初期会导致MLP层里超过四分之一的神经元永久“死亡”,再也救不回来。他们提出的替代方案Aurora优化器,在11亿...

推荐理由:HKR 三项全中:标题钩子够怪,fast16 和 Aurora 的实测数字也摆出来了,安全与优化器的利害关系讲得清楚。没给更高分是因为这期属于多话题的 newsletter 汇总,不是单一重大发布或行业事件。

机器之心 · 公众号

华为 GTS 在 ICML 2026 发了一篇用推理熵值动态挑训练样本的方法,Amazon 和 Google 的作者也跟进了类似思路

这篇论文提出了一种叫 EDCO 的动态课程微调方法,核心是用模型推理时的“熵值”来判断样本难度,自动挑出当前模型最该学的数据,而不是靠人手动分阶段。他们搞了个前缀熵值估算,把每一条样本的评分时间从 2.24 秒压到了 0.37 秒,省了不少算力。文章本身因为微信环境异常没抓到正文,具体实验数据、在什么任务上验证的、以及 Amazon/Google 团队...

推荐理由:我会先打个折:这还是个训练方法论文,不是模型或产品发布,所以分数没给更高。但它的钩子很足——华为提出 EDCO,用推理熵动态挑样本,Amazon 和 Google 的人光速跟进,说明这个方向在圈内被盯上了。核心卖点是前缀熵估计,把单样本耗时从 2.24 秒砍到 0.37 秒,省了八成多时间,对做微调的人来说是实打实的成本优化。正文没披露这个方法在大规模多任务上的泛化验证,这点先别太激动,但思路本身对数据筛选和训练成本敏感的场景很有启发。

5月16日星期六

r/LocalLLaMA

Orthrus-Qwen3-8B:冻住 Qwen3-8B 主干,加一个扩散注意力头,一次前向最多吐出 7.8 倍的 token,输出分布数学上可证明不变

这个工作把 Qwen3-8B 的原始参数完全冻住,只额外训练一个扩散注意力头,让模型一次前向能生成多个 token,最高做到 7.8 倍。在 MATH-500 上实测 wall-clock 速度大约快了 6 倍。训练只动了 16% 的参数,用了不到 10 亿 token 的数据,在 8 张 H200 上跑了 24 小时。论文声称输出分布和原模型在数学上...

推荐理由:我会先打个折:这是单篇 Reddit 研究发布,没有论文或第三方复现,验证强度偏弱。但信息量够用——在 Qwen3-8B 冻结主干上加扩散注意力头,只训 16% 参数,8 张 H200 跑一天,MATH-500 上 token 吞吐最高提到 7.8 倍,墙钟时间约快 6 倍,而且输出分布可证明不变。这点先别太激动,正文没披露其他 benchmark 和更长序列下的表现,但推理加速和一致性这两点对本地跑模型的从业者来说很实在,所以放在 featured 里当个信号看。

5月13日星期三

量子位 · 公众号

字节提出 GRN,让生图模型像人一样边画边改,不再死磕扩散和自回归

字节跳动的技术团队搞了个叫 GRN(生成式精炼网络)的新架构,想给视觉生成找第三条路,不跟扩散模型和自回归模型硬卷。它的核心思路是让模型先生成一张粗糙的图,再反复精修,就像画师先铺大色块再慢慢抠细节。为了解决反复修图容易把图修糊、错误越攒越多的问题,他们用了三项技术:HBQ(分层二元量化)把图片压成更紧凑的离散编码,减少信息损耗;全局精炼让模型每次修改...

推荐理由:字节这篇 GRN 想走扩散和自回归之外的第三条路,核心卖点是让模型像人画画一样边生成边修改。我会先打个折:130M 参数不算大,gFID 从 3.56 涨到 3.79,画质有小幅下降,但推理步数从 50 步压到平均 24 步,省了将近一半,这个取舍在轻量场景里可能划算。技术上有三个动作:HBQ 解决量化带来的画质损失,全局精炼缓解一步步画下去误差越攒越多的问题,复杂度采样让简单区域少画几步、复杂区域多画几步,不再固定步数。正文没披露在更大模型或更高分辨率上的表现,也没给实际推理延迟的毫秒数,所以现在只能说在小模型上验证了思路。对做图像生成落地、想降...

5月12日星期二

AI HOT 精选

OpenAI 办了一场“参数高尔夫”比赛,1000 多人用 AI 助手卷模型压缩,我们看到了什么

OpenAI 搞了个叫 Parameter Golf 的机器学习挑战赛,规则很硬:模型加代码总大小不能超过 16MB,训练时间只有 10 分钟(用 8 张 H100),看谁能在固定数据集上把测试损失压到最低。超过 1000 人提交了 2000 多次结果。我会先打个折,正文没披露最终冠军的具体分数,但重点讲了技术路数。最卷的方向是训练优化,有人把前人的好...

推荐理由:OpenAI 的 Parameter Golf 复盘靠一场实打实的比赛、1000多名参与者和2000多份提交撑住了 HKR 三项。它属于研究/基准信号,不是模型或产品发布,所以 78 分放在 featured 里偏低的那一档是合理的。我会先打个折:目前只有一篇 Reddit 帖子,没有独立复现,也没看到论文或代码放出来。

r/LocalLLaMA

把 prompt 缓存用到强化学习训练里:长提示短回复场景下,Qwen3.5-4B 训练速度提升 7.5 倍

作者提出在强化学习训练时复用 prompt 缓存,专门针对那种提示很长、模型回复很短的任务。在 Qwen3.5-4B 上跑 16k token 提示、64 token 回复的例子,训练速度直接快了 7.5 倍。另一个 G=8 的例子更直观:1000 token 提示加 100 token 回复,原本要处理 8800 个 token,用这方法后实际只需处...

推荐理由:这是一篇 Reddit 帖子,作者把推理时常用的 prompt caching 思路搬到了 RL 训练里,在长提示短回答的场景下效果明显:Qwen3.5-4B 跑 16k 提示、64 输出 token 的任务,训练速度提了 7.5 倍。核心逻辑是 RL 训练时同一组 prompt 会被反复采样,把重复的 token 缓存起来不重复算,G=8 时实际要处理的 token 数从 8800 掉到 1800。这个数字说明去重效果确实好,但前提是 prompt 够长、回答够短,场景比较挑。正文没给代码或论文链接,也没有独立复现验证,所以分数先打个折,定在 78。

5月11日星期一

机器之心 · 公众号

ICML 2026 论文:PRISM 框架让扩散语言模型做推理时扩展不再烧算力

这篇 ICML 2026 的论文给扩散语言模型(dLLM)提出了一套叫 PRISM 的推理时扩展方法。它把搜索过程拆成三层:先让模型并行生成多条推理路径,再对每条路径局部“回退重写”不靠谱的步骤,最后用模型自己当裁判打分筛选。在数学题集 GSM8K 上,LLaDA-8B-Instruct 的准确率从 67.58% 拉到了 85.30%。最直接的好处是省...

推荐理由:这篇 ICML 论文给扩散语言模型做 test-time scaling,核心卖点是不靠堆算力硬拉分。PRISM 在 LLaDA-8B-Instruct 上把 GSM8K 正确率从 67.58% 提到 85.30%,靠的是三层搜索、局部 remasking 和自验证,把复杂度从 O(NT) 压到接近 O(N+KT)。我会先打个折:这只是单模型单数据集的实验,正文没披露在其他 benchmark 或更大模型上的表现,泛化性还不好说。但思路本身对做推理优化的人有参考价值,尤其适合预算有限又想压榨小模型推理能力的场景。

5月10日星期日

r/LocalLLaMA

NVIDIA 发布 Star Elastic:一个模型文件能直接切出 30B、23B、12B 三种推理模型

NVIDIA 放出了一个叫 Star Elastic 的模型,一个检查点文件里包含了 30B、23B 和 12B 三个尺寸的推理模型,不用额外训练就能直接“切片”取用。具体玩法是让 23B 的子模型负责思考过程,30B 的模型负责给出最终答案。在 AIME-2025、GPQA、LiveCodeBench v5 和 MMLU-Pro 这几个测试集上,这种...

推荐理由:我会先打个折:这还是个研究发布,不是大规模验证过的产品,影响力肯定比不上一个全新旗舰模型。但它的机制很具体——一个检查点通过“零样本切片”就能变出不同大小的推理模型,而且 23B 负责思考、30B 负责回答这种分工方式,在 AIME-2025 上确实跑出了 16% 的准确率提升和 1.9 倍延迟降低。对正在折腾推理部署的人来说,这种“一份权重、多种用法、精度可选”的思路,直接打中了成本和延迟的痛点,所以放在 featured 里是合适的。

5月9日星期六

AI HOT 精选

EMO:让专家模型自己长出模块,用八分之一专家就能干活

AllenAI 放出了一个叫 EMO 的混合专家模型(MoE),总参数量 140 亿,每次推理只激活 10 亿参数。它最大的不同是训练时没按人类划好的学科(比如数学、代码)去分专家,而是让模型自己从 1 万亿 token 的数据里长出模块。结果是,跑特定任务时你只用挑出 12.5% 的专家,性能就接近全模型水平;而同样架构、同样数据训出来的普通 MoE...

推荐理由:AllenAI 和 Hugging Face 放出的 EMO,是个 14B 总参数、1B 活跃参数的 MoE 模型,用 1 万亿 token 训练。亮点是跑任务时只激活 12.5% 的专家,推理成本压得很低。不过正文没披露具体 benchmark 成绩和路由策略细节,这点先别太激动。它更像一个研究发布,不是前沿模型发布,所以给 featured 低档。

5月8日星期五

新智元 · 公众号

用 token 级价值函数控制回答长度,3B 模型在长度控制上跑赢 GPT-5.4 和 Claude

加州大学圣塔芭芭拉分校和苹果的研究人员搞了个叫 LenVM 的方法,把“还剩多少 token 要生成”建模成一个 token 级别的价值函数,相当于给模型装了个实时字数进度条。他们拿 Qwen2.5-3B 搭配一个 1.5B 的 LenVM 去测 LIFEBench 的长度控制任务,得分 62.6,而 GPT-5.4 只有 37.4,Claude-Op...

推荐理由:我会先打个折:正文没披露 GPT-5.4 的具体版本和测试条件,这点先别太激动。但 LenVM 的思路很实用——把“还要写多长”变成一个 token 级的值函数,让 Qwen2.5-3B 搭配一个 1.5B 的小模型就能在长度控制上大幅领先大模型。LIFEBench 长度得分 62.6 比 GPT-5.4 的 37.4 高出不少,说明在特定任务上小模型加对方法可以很省钱。对做推理优化和想摆脱闭源模型绑定的团队来说,这是个值得跟的信号。

量子位 · 公众号

哈工大华为搞了个免训练加速框架,让扩散大模型推理快4.48倍还不掉精度

哈工大深圳、华为和深圳河套学院提出一个叫 Dynamic-dLLM 的框架,不用重新训练就能给扩散大语言模型加速。在 LLaDA-8B-Instruct 上跑 GSM8k 数学题,吞吐量从每秒 8.32 个 token 提到 37.29 个 token,快了 4.48 倍,而且精度几乎没降。正文没披露具体用了什么技术手段,也没说在其他任务上表现怎么样,...

推荐理由:HKR 三项都成立:4.48 倍提速是个好钩子,GSM8k 的 TPS 数据让说法有实感。这是推理优化研究,不是主流模型发布,放在 78–84 这个区间合适。

AI HOT 精选

冻结模型里藏着可读的行为信号,Cygnus 靠适配器把 Qwen-32B 的 ARC 得分从 82% 拉到近 95%

Proprioceptive AI 搞了个叫 Cygnus 的技术,给已经冻结的大模型外挂一个自感知适配器,不重新训练就能读出模型内部残留的行为信号。做法是把隐藏状态投影到一个用 gl(4,R) 李代数定义的数学空间里,从中分离出他们称为“暗模式”的精度信号。拿 Qwen-32B 试了一下,只用一张 RTX 3090,ARC-Challenge 准确率...

推荐理由:HKR 三项都成立:12.77 个点的提升数字扎实,李代数投影的做法够新,压缩 90% 视觉 Token 对实际部署很省钱。但来源是 X 上的帖子,正文没给出完整评测集和对照实验,复现性存疑,所以只给低 featured。真正值得盯的是后续有没有第三方复现,如果复现成立,这个“冻结模型+适配器”的省钱路线对多模态推理会是实打实的利好。

5月7日星期四

量子位 · 公众号

浙大与阿里提出 MetaCompress:只看图片就能学会压缩 Token,多轮视觉问答压缩率 90% 且精度不掉

这篇 CVPR 2026 论文介绍了一个叫 MetaCompress 的框架,专门解决多轮视觉问答里图片 Token 太多、推理太贵的问题。它的做法是让模型只看输入图片,自己生成一张“压缩映射图”,直接决定哪些视觉 Token 该留、哪些该扔,不需要额外训练一个压缩网络。文章给出的核心数据是:能砍掉 90% 的视觉 Token,同时保持回答精度不降。还...

推荐理由:我会先打个折:正文说精度不掉,但没给出具体数值和基准对比,这点先别太激动。不过思路确实干净——不用文本引导,只靠图像自身信息决定哪些视觉 Token 可以扔,压缩率做到 90%,对多轮 VQA 这种反复调图的场景很实用。浙大和阿里联合出品,挂了 CVPR 2026,研究信号够强,不是产品通稿。开源了的话,做多模态推理优化的团队可以直接拉下来测延迟和显存变化。