Google DeepMind 发布 AlphaGenome Atlas,预测人类基因组全部单碱基变异
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍。
推荐理由:原文给出覆盖 90 亿单核苷酸变异的预测数据集与 AVI 评分,读者可据此了解基因组变异解读的新工具形态。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍。
推荐理由:原文给出覆盖 90 亿单核苷酸变异的预测数据集与 AVI 评分,读者可据此了解基因组变异解读的新工具形态。
一位Reddit用户用1040组偏好样本(DV-DPO,一种让模型学会回答风格的方法)微调了Qwen2.5-7B,成本按Claude Haiku的API价格算大约3美元,没花钱请人标注。在特定领域任务上,这个微调模型的综合得分达到了Claude Haiku的96%。部署在4-bit量化的T4机器上,生成一次回答的延迟是11秒。不过正文没披露具体是什么任...
推荐理由:这条信息本身是个Reddit帖子,任务范围和评测细节正文没展开,所以分数先打个折停在74。但3美元、零标注、96% Haiku这几个数字组合在一起,对想省钱又不想雇人标数据的团队来说,是个值得看一眼的信号。
OpenBMB 把 VoxCPM2 的技术报告和模型都放出来了,Apache 2.0 协议。这是个 20 亿参数的语音生成模型,用超过 200 万小时的多语言语音数据训练,能说 30 种语言和 9 种中文方言。它主要干三件事:按自然语言指令设计语音、可控地克隆声音,以及高保真地延续一段语音。技术方案上,它把语音拆成两步走——先用 16kHz 做语义编码...
推荐理由:HKR 三项都踩中了:200 万小时训练数据和 9 种方言是实打实的钩子,参数和协议信息也够新,对国内语音开发者有直接参考意义。分数定在 78 是因为技术报告正文没给出具体的评测基准和对比数字,实际效果和落地表现还不清楚,这点先别太激动。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,相当于八周内取得约 1.2 至 1.7 年的常规学习进度。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与交互数据,可了解 AI 辅助教学在真实课堂中的效果边界。
这篇文章的正文被微信环境异常页挡住了,看不到具体技术细节。从标题和现有摘要看,快手可灵和城大合作了一个叫 VLM-as-Teacher 的方法。思路是在测试阶段用视觉语言模型(VLM)给视频生成模型(VGM)的 LoRA 模块打分反馈,边生成边优化,让模型学会按文字规则推理。他们搞了个 VBVR-Bench 基准,分数从 0.666 提到了 0.781...
推荐理由:正文被微信环境异常页挡住了,看不到技术细节,这点先打个折。但从标题和摘要看,快手可灵和城大搞的 VLM-as-Teacher,思路是在测试阶段让视觉语言模型给视频生成模型的 LoRA 打分,边跑边调,让模型学会按文字规则推理。VBVR-Bench 上分数从 0.666 提到 0.781,说明规则遵循能力有明显提升。方法本身有巧思,不是换模型架构,而是在推理时加一层在线优化,对可控视频生成是个实用方向。信息缺口在于没看到具体实现和消融实验,等正文能看了再补判断。
这个项目用四家不同实验室的小模型(OpenAI 的 gpt-oss-20b、OpenBMB 的 MiniCPM3-4B、NVIDIA 的 Nemotron-Mini-4B 和一个自己微调的 0.5B Qwen)分别扮演市场里的不同角色,玩家则充当幕后金主,可以放贷、散布真假内幕消息、做空和贿赂。模型之间的差异本身就是卖点,让市场博弈更像真的吵架而不是念...
推荐理由:我会先打个折:这只是个实验项目,不是产品。但它的切入点很巧——用小模型之间的差异来制造博弈感,而不是硬靠 prompt 演。技术细节也够实在,vLLM 版本冲突、0.5B 模型的表现数据都摆出来了,做 agent 的人能直接参考。正文没披露微调那 0.5B Qwen 的具体数据配方,这点先别太激动。整体值得一看,放在低 featured 合理。
这篇文章正文被微信环境验证挡住了,看不到具体内容。从标题和已有的英文摘要看,Junpeng Zhang 他们发现,用高度同质化的数据做 SFT 时,有效训练窗口其实很短,大概几百到一千步左右。他们搞了一个基于交互信号的预警方法,能在 loss 差距还没拉大之前就检测到过拟合,据称能省下 30% 到 50% 的训练算力。不过具体怎么检测、实验怎么设计的,...
推荐理由:这篇论文没画大饼,直接给了一个可操作的结论:同质化数据做 SFT,有效训练步数很短,几百到一千步就差不多了。他们还提出一种交互机理预警,能比传统看 loss 更早发现过拟合,实测能省下 30% 到 50% 的算力。对天天在调参、担心过拟合又心疼显卡钱的人来说,这个发现挺实用。不过正文没披露实验用的模型规模和具体数据配比,实际省下来的算力在不同场景下会打多少折扣,还得自己试。
作者用一张 12GB 显存的 RTX 3060 训练了一个叫 Mamba-Titan-1.4B-Reasoning 的模型。做法是把一个 1.4B 参数的 Mamba-1 主干完全冻结,只在第 24、25 层外挂了 8 个可训练的专家臂,组成一个总参数量 2.54B 的混合专家模型,每次推理只激活其中 2 个专家。数学题准确率大概做到 50%。正文没披...
推荐理由:这是一篇 Reddit 个人实验帖,不是论文,也没有独立复现,所以我会先打个折。但它的价值在于把一次失败解剖写得清楚:在单张 RTX 3060 上,冻结 Mamba 主干、外挂 8 路 MoE 做推理,最后数学准确率卡在 50% 左右。正文没披露训练时长和具体数据集,这点信息有缺口。对想用消费级显卡折腾推理模型的从业者来说,这篇能省掉一次踩坑,属于低门槛、有参考意义的 featured 内容。
现在给 Agent 塞一堆工具,它经常不知道该点哪个。复旦和通义实验室提出了一套叫 ToolCUA 的训练方法,核心是用约 4000 个合成工具和 18 万步的“屏幕操作+工具调用”交叉轨迹来训练模型。他们训出来的 ToolCUA-8B 在 OSWorld-MCP 基准上跑到了 46.85% 的准确率。不过正文因为微信环境验证没抓到,具体训练细节和对比...
推荐理由:这篇文章抓了一个实际工程里的矛盾:工具越多,Agent 越不会选。我会先打个折,46.85% 的准确率不算高,但考虑到是 4k 工具的环境,这个数字说明问题确实难。18 万步合成轨迹是亮点,意味着训练数据不用全人工标,成本上友好一些。正文没披露推理延迟和实际部署的资源消耗,这点先别太激动。整体是一篇有痛点的研究发布,不是大模型或产品级发布,所以放在 featured 里合适。
香港中文大学等团队搞了个新优化器叫 Pion,核心思路是不动权重矩阵的奇异值,只在“等谱流形”上做正交等价变换来更新参数。他们拿一个 6000 万参数、没用归一化层的类 LLaMA 模型试跑,Pion 稳定训练了 96 亿个 token,而 AdamW 和 Muon 都崩出 NaN 了。正文没披露更大规模模型或具体下游任务上的效果,所以这点先别太激动,...
推荐理由:我会先打个折:这篇是优化器数学,不是产品发布,所以分数在 78–84 之间。但它的钩子很直接——AdamW 和 Muon 会训崩,而 Pion 用“在等谱流形上更新”这个思路稳住了。正文给了 60M 模型、9.6B token 的无归一化实验,证明能避免 NaN,这对做训练的人有实际参考价值。信息量够,痛点准,所以 HKR 全过。
FaceMind 团队在 100 种语言和四类核心任务上做了实验,结论很简单:保持意思不变,把提示词或微调文本换成预训练语料里出现频率更高的说法,大模型的表现会明显提升。他们把这个规律叫 Adam's Law(文本频率定律),相当于给数据工程补上了“频率”这个维度。原理不复杂——高频表达让模型在自己最熟悉的概率空间里干活,输出质量自然更稳。不过正文没披...
推荐理由:我会先打个折:正文没披露具体用了哪些模型、数据集和效果提升的幅度,所以没法判断这个“更好”到底好多少、在什么规模的模型上成立。但选题本身很聪明,用 100 种语言和四类任务把“高频词有效”这个反直觉结论撑起来了,对天天调提示词的人来说是个值得自己复现一下的线索。
文章页面被微信环境验证挡住了,正文内容没拿到。从现有标题和英文摘要看,讲的是 FaceMind 团队把大模型在“马嘉祺”这类低频词上翻车的现象,和两篇论文串了起来:一篇是 EMNLP 2025 的 SLoW,另一篇是刚被 ACL 2026 接收为 Oral 的 Adam's Law。摘要里还提到一个具体数字——用高频词改写的方法,把 DeepSeek-...
推荐理由:这篇文章把马嘉祺让大模型翻车这个意外事件,和低频 token 退化这个技术问题绑在一起讲,切入点很巧。它不光讲现象,还给出了两篇顶会论文的机制解释,以及 DeepSeek-V3 上 8 个百分点的准确率提升,对做模型评测和提示工程的人有直接参考价值。不是大模型发布那种重磅消息,但属于扎实的研究信号,值得放进精选。
英伟达搞了个叫 Polar 的开源框架,专门解决一个实际问题:怎么在不重写 Codex、Claude Code 这些现成代码工具的前提下,用强化学习(GRPO,一种让模型在多步任务里根据奖励信号自己学会更优操作的训练方法)去训练它们。Polar 的做法很取巧,它不碰工具本身的执行逻辑,而是在模型和工具之间的 API 接口上做文章,把对话记录、采样结果这...
推荐理由:英伟达开源 Polar,用 GRPO 训练小模型 Qwen3.5-4B,Codex 在 SWE-Bench Verified 上从 3.8% 冲到 26.4%,这个提升幅度在代码 agent 圈子里很能打。技术细节和基准分都给得清楚,属于扎实的研究开源项,不是大模型或产品发布,所以放在 featured 档、82 分合理。
AMD 和宾州州立大学用 MI355X 原生 FP4 硬件预训练了 Llama 3.1-8B,端到端速度比 FP8 基线快了 9-10%。但论文指出,Wgrad(权重梯度)量化是拖后腿的环节,导致每个 token 的计算开销额外增加 26-27%,而且用确定性 Hadamard 方法也稳不住。正文没披露最终模型的验证集效果对比,这点先别太激动。
推荐理由:我会先打个折:这是一篇偏训练基础设施的研究,不是通用大模型发布,所以分数不会给到顶。但它的钩子很锋利——直接挑战“FP4 不稳定是因为随机性不足”这个流行说法,并且给出了在 AMD 最新硬件上跑 Llama 3.1-8B 的实测数据。速度提升 9-10% 是实打实的,但 Wgrad 带来的 26-27% 额外开销也说明这条路还没完全走通,这点先别太激动。对关心训练成本和硬件选型的从业者来说,这篇值得一看。
OpenBMB 放出了 BitCPM-CANN,一个在华为昇腾 NPU 上原生跑通的 1.58-bit(三值)大模型训练方案。他们用和 MiniCPM4 一样的架构与数据,从零训了 0.5B、1B、3B、8B 四个尺寸。1B 到 8B 的模型在 11 个测试集上平均保住了全精度模型 95.7% 到 97.2% 的性能,3B 版本在 BBH 上打平,3B...
推荐理由:我会先打个折:目前只有 Reddit 帖子作为来源,没有吞吐量、显存占用或复现细节,所以先放在 featured 的底线。但这条信息本身挺实在——OpenBMB 在昇腾 NPU 上从零训练了四个 1.58-bit 的模型,不是推理时量化,而是训练阶段就压到极低比特。1B 到 8B 的性能保留率都在 95% 以上,说明这条路在国产硬件上走得通。对需要控制训练成本、又绑在昇腾生态里的团队来说,这是个值得跟的信号。
中科大团队在顶会上发了两篇工作,专门解决多模态大模型“学新忘旧”的问题。一篇是 MMEVOKE,搞了一个包含 159 个子类、9422 个样本的评测集,用来检验模型在持续学习中会不会把之前的知识覆盖掉。另一篇是 KORE,提出用知识树扩充样本,再通过零空间约束微调来减少遗忘。正文没披露具体性能数字和训练成本,但思路很明确:让模型像人一样,学了新东西还能...
推荐理由:HKR-K 和 HKR-R 都站得住:文章给出了数据集规模和具体的微调机制。不过这只是论文阶段的知识注入方案,没有生产环境的验证或完整的复现细节,所以先打个折,放在低 featured 档。
Sapientinc 开源了一个叫 HRM-Text 1B Base 的小模型,连训练代码也一起放出来了。论文里的说法是,它的性能可以和 2B 到 7B 的开源模型掰手腕,但训练用的数据量只有别人的百分之一到九百分之一,算力消耗更是只有别人的 1/96 到 1/432。具体来说,用 16 块 H100 GPU 训练了大概 46 小时,总花费约 1,47...
推荐理由:HKR 三项都站得住:HRM-Text 1B 有具体的低成本训练数字和公开代码。卡在 80 分是因为消息源是 Reddit,效率提升的说法还没有独立评测背书,我会先打个折。
这篇推文本身因为环境异常没加载出正文,我只能根据标题和外部信息给你还原一下。京东和中科院信工所联合发了三篇论文,核心思路叫 Self-Taught RLVR,也就是让模型在强化学习里自己生成训练信号、自己教自己,省掉人工标注或外部奖励模型。其中一篇叫 RLSD 的工作,在 Qwen3-VL-8B-Instruct 上只训了 200 步,就在 8 个基准...
推荐理由:我会先打个折:这不是哪个大厂发了新模型,而是京东和中科院信工所连着放了三篇论文,把 Self-Taught RLVR 这条路线从不同角度拆了一遍。亮点在 RLSD,它让模型自己生成推理步骤、自己打分、自己迭代,200 步就超过 GRPO 跑 400 步,等于训练量砍半还能赢,对算力吃紧的团队是个好消息。不过正文没披露复现需要多少卡、数据怎么配,这点先别太激动。整体属于有干货、有对比、但热度还没起来的阶段,放 featured 低位合适。
Google DeepMind 的 Co-Scientist 正被用于加速细胞衰老研究,它扫描数万篇论文后提出 20 多个可测试的新遗传因子,其中数个经实验室验证能驱动细胞进入更年轻状态并改善整体功能。它还能将原本需长达六个月的筛选数据分析缩短至几天。
这篇论文提出了一种叫 EDCO 的动态课程微调方法,核心是用模型推理时的“熵值”来判断样本难度,自动挑出当前模型最该学的数据,而不是靠人手动分阶段。他们搞了个前缀熵值估算,把每一条样本的评分时间从 2.24 秒压到了 0.37 秒,省了不少算力。文章本身因为微信环境异常没抓到正文,具体实验数据、在什么任务上验证的、以及 Amazon/Google 团队...
推荐理由:我会先打个折:这还是个训练方法论文,不是模型或产品发布,所以分数没给更高。但它的钩子很足——华为提出 EDCO,用推理熵动态挑样本,Amazon 和 Google 的人光速跟进,说明这个方向在圈内被盯上了。核心卖点是前缀熵估计,把单样本耗时从 2.24 秒砍到 0.37 秒,省了八成多时间,对做微调的人来说是实打实的成本优化。正文没披露这个方法在大规模多任务上的泛化验证,这点先别太激动,但思路本身对数据筛选和训练成本敏感的场景很有启发。
作者用 QLoRA 在 Qwen3 的 4B 到 32B 全系列上训练了一个叫 TIME 的方法,核心思路是当上下文发生变化时,模型才触发一段简短的中途推理,避免没完没了地“想太多”。帖子说数据集、notebook、训练脚本、课程学习方案和 TIMEBench 评测都公开了,24GB 显存就能训到 14B 规模。不过正文被 Reddit 的安全策略挡了...
推荐理由:我会先打个折:这是 Reddit 单帖发布,不是实验室论文,所以放在 featured 里 74 分比较合适。但内容本身挺实在——作者没去追长链推理,而是让模型在上下文切换时做短思考,避免“想太多”拖慢速度。用 QLoRA 在 Qwen3 四个尺寸上都训了,代码和数据全公开,24GB 显存能玩到 14B,这点如果是真的挺省钱。TIMEBench 评测也给了,不是空口说效果。整体对想自己动手调模型的人有直接参考价值,信息量够,判断也挂得住。
新加坡国立大学搞了个叫 TGO(阈值引导优化)的方法,被 ICML 2026 收了。它最大的好处是不需要提前构造“这张比那张好”的偏好对,直接拿一个标量分数(比如美学分、图文匹配度)就能做对齐。做法是先让模型生成一批图,算出分数的分布,定一个阈值:高于阈值的当正样本往上拉,低于的当负样本往下压。论文在 Stable Diffusion v1.5、FLU...
推荐理由:这篇 ICML 2026 的论文提了个叫 TGO 的方法,核心是把标量反馈(比如一个打分)直接转成模型的正负更新方向,不用像传统 RLHF 那样先构造偏好对。我会先打个折:正文没披露具体节省了多少标注成本或计算量,但思路本身挺直接——用分数分布的阈值来决定哪些样本该学、哪些该躲。实验覆盖了四个主流视觉生成模型,从 SD v1.5 到 FLUX 都有,说明不是单点特调。这点先别太激动,因为论文偏研究向,离工程落地还有距离,但对正在头疼对齐数据采集的团队来说,值得看一眼。
剑桥大学 Clare Bryant 教授利用 Google Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关。Co-Scientist 生成并排序假设,优先锁定一个她此前未关注的蛋白,并逐步将假设细化到具体氨基酸。Bryant 团队正构建含氨基酸突变的细胞系验证,原本需两到三年的工作预计六个月完成。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合衰老生物学中零散的研究发现,将其转化为可验证的假设。在整合应激反应(ISR)研究中,该工具帮助团队生成了一条关于代谢如何调控 ISR 的新假设,并协助优化实验设计。相关实验已产生新发现,团队计划发表这些结果。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝生物学与药理学证据,锁定值得关注的机制并筛选出候选组合疗法。针对 resmetirom 仅对少数合格患者有效的问题,Co-Scientist 提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,该假说随后经实验验证,有望推动靶向双重疗法。
MIT 的 Ritu Raman 与波士顿儿童医院的 Ryan Flynn 借助 Google DeepMind 的 Co-Scientist,将各自不同的研究工具结合用于 ALS 研究。
斯坦福大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的候选药。
作者拿 Qwen 2.5 7B 基础模型做实验,先让它自己写代码、自己跑测试,把跑不过的代码和报错信息收集起来,再让它根据报错改出正确版本,这样就自动生成了“错误-修正”配对数据。用这批数据微调后,7B 模型在 HumanEval 上的通过题数从 25 题(约 15%)提升到 112 题(约 68%),数学能力也超过了 GPT-3.5。14B 版本只用...
推荐理由:我会先打个折:标题说 80% 但正文是 112/164,约 68%,这点先别太激动。不过 hook 确实抓人——让模型自己写题、自己答、再自己改错,用这些修正对去微调,HumanEval 直接翻几倍。14B 版本只用了 100 对样本、一张 H100 跑一个半小时花 3.50 美元,成本低到可以复现。正文没披露数学 benchmark 的具体名称和完整分数,验证偏弱,但作为单人实验,信息量和可操作性都够。保留 78 分,因为它是单篇 Reddit 帖子,且 80% 的说法和实际数字有出入。
MiroMind 放出了 MOOSE-Star 系列,包含三个 7B 模型和一个叫 TOMATO-Star 的数据集,里面有 108,717 篇 NCBI 论文。其中 MS-IR-7B 在“灵感检索”任务上准确率到了 54.37%,底子是 DeepSeek-R1-Distill-Qwen-7B,fp16 跑起来大概占 14GB 显存,支持 llama....
推荐理由:我会先打个折:正文没披露 54.37% 这个准确率是在什么基准上测的、对比了哪些方法,所以这个数字先别太激动。但整套东西的钩子很实在——用 7B 小模型加 10.8 万篇 NCBI 论文搭一个科学假设发现的流程,fp16 才 14GB,本地就能跑。对想做科研 RAG 或让模型进文献分析流程的团队来说,这是个现成的起点,数据集和模型权重都公开了。
这篇微信文章标题说灵初智能(PsiBot)用了10万小时的人类操作数据来训练机器人策略,还提到一个叫W0的世界模型只在训练时做迁移,实际部署只跑R2。但页面被环境异常验证拦住了,正文内容完全看不到,没法确认具体怎么采集数据、在什么任务上验证、效果到底怎么样。
推荐理由:这篇讲的是灵初智能用10万小时人类操作数据训机器人策略,W0世界模型负责训练时的迁移,部署时只跑R2,省算力。我会先打个折:10万小时这个数字挺唬人,但正文没披露数据怎么采集、覆盖哪些任务、成功率多少,也没给论文或开源链接,所以只能当公司说法看。对从业者来说,W0训练期迁移、R2部署这个架构思路有参考价值,但缺验证就不好判断实际效果。整体像产品发布稿,不是可复现的研究,所以放在featured但分数没往上拉。
阿里达摩院发了篇 ACL 2026 论文,提出 I²B-LPO,解决强化学习微调时模型解题思路越来越像的问题。做法是在模型生成答案时,碰到它犹豫不决的节点就分叉出多条路径,再用一个基于信息瓶颈的自奖励机制筛掉重复的、留下真正不一样的解法。论文在 Qwen2.5-7B 和 Qwen3-14B 上跑数学题,准确率最多提了 5.3%,答案的语义多样性提了 7...
推荐理由:我会先打个折:这还是一篇训练方法论文,不是新模型或产品发布,所以重要性给 78 合理。亮点在于它把 RLVR 的探索问题讲得很具体——不是泛泛说“多样性不足”,而是用高熵节点定位、分支采样、自奖励这套组合拳给出可操作的解法。数字也实在,准确率和多样性双涨,没有只挑好看的说。正文没披露训练成本和延迟数据,这点先别太激动。整体适合推荐给做推理微调的人看,不是那种看完就忘的刷榜文章。
报告把训练一个原生多模态模型的全流程拆成了六步,从统一建模、无损接视觉信号,到用自回归加像素空间流匹配一起训,再到强化学习后训练和蒸馏,每一步都给了实操细节。开源版本 SenseNova-U1-A3B-MoT 用了混合专家架构,只激活 30 亿参数,主打跑得快、成本低。模型权重、代码和演示都放出来了,不过报告里没给具体 benchmark 对比,实际效...
推荐理由:我会先打个折:这是厂商自己发的技术报告,正文没给基准分数、开源协议和复现细节,所以别当第三方评测看。亮点在于把训练全流程讲清楚了——从数据配比、六阶段课程到 RL 后训练和蒸馏,每一步都给了操作说明。A3B-MoT 用 MoE 把激活参数压到 30 亿,推理时确实省钱,但报告没披露总参数量、专家数这些关键数字,也没说开源权重什么时候放出来。这点先别太激动,等代码和权重落地再判断。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。
推荐理由:原文披露了多智能体系统的三阶段协作机制与多个实验室的落地案例,可了解 AI 参与科学假设生成的具体路径。
上海 AI 实验室、上海交大和中科大的团队拿 Qwen3-14B-Base 做长思维链的监督微调实验,发现模型在训练 8 轮后,跨领域的表现会先跌后涨,最终超过原始水平。他们总结出泛化要成立的三个条件:一是得把模型训得足够深,不能浅尝辄止;二是训练数据的质量和结构要过关;三是基座模型本身的能力得够强。正文没披露具体用了什么数据集,也没给出跨领域任务的具...
推荐理由:这篇论文的卖点很清晰:SFT 不是不能泛化,但得满足优化、数据结构和基模型能力三个条件。我会先打个折,因为目前只是 Reddit 上的一个帖子,没有看到论文全文或代码,没法验证他们说的 8 个 epoch 先降后升是不是稳定复现。不过这个发现对做开源微调的人确实有用,尤其是用 Qwen3-14B 这类模型时,怎么配长思维链数据、训多久,这篇至少给了一个可参考的曲线。HKR 三项都过得比较轻松,但因为没有独立复现和完整 benchmark,分数就停在 76,不往上拉了。
作者提出在强化学习训练时复用 prompt 缓存,专门针对那种提示很长、模型回复很短的任务。在 Qwen3.5-4B 上跑 16k token 提示、64 token 回复的例子,训练速度直接快了 7.5 倍。另一个 G=8 的例子更直观:1000 token 提示加 100 token 回复,原本要处理 8800 个 token,用这方法后实际只需处...
推荐理由:这是一篇 Reddit 帖子,作者把推理时常用的 prompt caching 思路搬到了 RL 训练里,在长提示短回答的场景下效果明显:Qwen3.5-4B 跑 16k 提示、64 输出 token 的任务,训练速度提了 7.5 倍。核心逻辑是 RL 训练时同一组 prompt 会被反复采样,把重复的 token 缓存起来不重复算,G=8 时实际要处理的 token 数从 8800 掉到 1800。这个数字说明去重效果确实好,但前提是 prompt 够长、回答够短,场景比较挑。正文没给代码或论文链接,也没有独立复现验证,所以分数先打个折,定在 78。
Richard Sutton 团队给流式强化学习(就是来一条数据学一次、不存回放池的那种)开了个新方子,叫“意图更新”。核心思路很直白:先定好这次更新想让模型输出变多少,再反推学习率该设多大,用的还是 1967 年 Kalman 滤波里的一个公式。在 MuJoCo 机器人控制任务上,他们用纯流式、batch size 为 1 的训练方式,让 Inten...
推荐理由:我会先打个折:这篇是研究发布,不是产品级大新闻,所以分数不会冲太高。但 Sutton 的署名加上 Intentional Updates 在极端在线条件下的实验结果,确实给流式 RL 提供了一个很省算力的新思路。1/140 的 FLOPs 对比很直观,batch=1、无回放这些条件也贴近真实部署,对 RL 圈子来说信息量够硬。整体判断是强研究信号,但市场影响力有限,放在 78–84 这个区间合理。
华东师大和复旦的研究者发现,现在大模型训练时只盯着“下一个词”来猜,容易让模型变得自信但目光短浅。他们提出 Next-ToBE,训练时给模型一个“软目标”,让它同时参考未来几个词的信息,但推理时不用改,还是正常的逐词生成。在 Qwen2.5-Math-1.5B、Qwen2.5-Math-7B 和 Llama3.1-8B-Instruct 上跑了 36 ...
推荐理由:这篇论文的卖点很清晰:不碰模型结构,只把训练时“猜下一个词”的目标换成“看未来一小段窗口的软目标”,就在36组实验里赢了35组。我会先打个折——正文没披露用了多大的模型、什么规模的数据,也没给复现细节或生产环境的验证,所以目前只能当学术信号看。如果是真的,这种改目标不改架构的思路确实省钱,但别急着把它当成下一个训练范式。
Anthropic 提出在预训练和对齐微调之间加一个叫 MSM 的训练阶段。他们在 Qwen2.5-32B 和 Qwen3-32B 上做了测试,模型乱说话的比例分别从 68% 和 54% 降到了 5% 和 7%。核心点是 MSM 是补强对齐微调,而不是替代它。
推荐理由:我会先打个折:这不是新模型发布,而是训练方法研究,所以 82 分刚好。Anthropic 用 Qwen 做实验,把 MSM 放在预训练后、对齐微调前,相当于在模型学完通用知识之后、正式教它守规矩之前,先塞一批规范文档让它读。Qwen2.5-32B 的失准率从 68% 掉到 5%,Qwen3-32B 从 54% 掉到 7%,数字说明效果明显。真正值得盯的是 MSM 和 AFT 互补,不是替代关系——这点先别太激动,正文没披露更多消融实验细节。整体是扎实的安全研究,对做对齐的从业者有参考价值。
这篇文章梳理了 2024 到 2026 年,让大模型学会推理的强化学习算法是怎么一步步改的。起点是 PPO,它需要同时跑一个策略模型和一个价值模型,训练成本高。后来的 GRPO、RLOO 这些变体,核心思路是砍掉价值模型,靠同一道题生成多个答案互相比较来算优势,省了显存和算力。再往后,DAPO、CISPO、MaxRL 等新方法在 GRPO 的基础上修修...
推荐理由:这篇不是新模型发布,而是一篇技术梳理,把2024到2026年推理RL算法的关键机制差异讲得很透。我会先打个折:它没有新实验数据,纯靠已有论文做对比,但胜在把PPO到MaxRL的取舍逻辑串起来了,对正在选RL路线的团队有实际参考价值。
罗剑岚团队和智元机器人搞了个新训练框架 LWD,已经在 16 台 Agibot G1 真机上跑过验证。LWD Online 在 8 个任务上平均成功率 0.95,长流程任务也能到 0.91。它的核心思路是把失败轨迹当训练数据用——他们攒了 652.5 小时的机器人操作数据,里面失败样本占了 34.8%,然后用离线转在线的强化学习方式让模型从这些翻车经验...
推荐理由:HKR三项都站得住:真机规模、任务数和成功率给了硬数字,失败轨迹占比这个数据点对同行有参考价值。不过具身智能的受众比基础模型窄,所以重要性定在78,不上头条。