跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 61–80 条 · 共 124 条

5月19日星期二

AI HOT 精选

NVIDIA 用 LoRA/DoRA 微调 Cosmos Predict 2.5,让它能生成机器人第一视角视频

NVIDIA 发了一篇技术博客,教你怎么用 LoRA 和 DoRA 这两种轻量微调方法,去训练他们自家的 Cosmos Predict 2.5 视频模型。目标是让模型能根据文字指令,生成机器人看到的画面,比如机械臂在桌上抓东西。博客把训练数据准备、代码怎么改、训练命令都贴出来了,但没提用了多少数据、训练花了多少钱、也没给任何评测分数,所以效果到底怎么样...

推荐理由:我会先打个折:正文没给数据量、没给评测分数,所以没法判断效果到底多好。但这条信息本身挺实在——NVIDIA 把 Cosmos Predict 2.5 拿出来,用 LoRA 和 DoRA 两种轻量微调方法,教模型按文字指令生成机器人第一视角视频。LoRA 是只动一小部分参数来省钱省算力,DoRA 在 LoRA 基础上把权重拆成方向和大小分开调,理论上更稳。对做具身智能的人来说,这等于多了一条低成本造训练视频的路子,不用全量微调大模型也能试。不过正文没写用了多少条视频、什么机器人平台、生成质量怎么衡量,这些缺口让实用性打折扣。整体看,技术路线清楚、痛点...

5月18日星期一

机器之心 · 公众号

华为 GTS 在 ICML 2026 发了一篇用推理熵值动态挑训练样本的方法,Amazon 和 Google 的作者也跟进了类似思路

这篇论文提出了一种叫 EDCO 的动态课程微调方法,核心是用模型推理时的“熵值”来判断样本难度,自动挑出当前模型最该学的数据,而不是靠人手动分阶段。他们搞了个前缀熵值估算,把每一条样本的评分时间从 2.24 秒压到了 0.37 秒,省了不少算力。文章本身因为微信环境异常没抓到正文,具体实验数据、在什么任务上验证的、以及 Amazon/Google 团队...

推荐理由:我会先打个折:这还是个训练方法论文,不是模型或产品发布,所以分数没给更高。但它的钩子很足——华为提出 EDCO,用推理熵动态挑样本,Amazon 和 Google 的人光速跟进,说明这个方向在圈内被盯上了。核心卖点是前缀熵估计,把单样本耗时从 2.24 秒砍到 0.37 秒,省了八成多时间,对做微调的人来说是实打实的成本优化。正文没披露这个方法在大规模多任务上的泛化验证,这点先别太激动,但思路本身对数据筛选和训练成本敏感的场景很有启发。

r/LocalLLaMA

TIME:让 Qwen 模型只在需要时短思考,而不是一直过度推理

作者用 QLoRA 在 Qwen3 的 4B 到 32B 全系列上训练了一个叫 TIME 的方法,核心思路是当上下文发生变化时,模型才触发一段简短的中途推理,避免没完没了地“想太多”。帖子说数据集、notebook、训练脚本、课程学习方案和 TIMEBench 评测都公开了,24GB 显存就能训到 14B 规模。不过正文被 Reddit 的安全策略挡了...

推荐理由:我会先打个折:这是 Reddit 单帖发布,不是实验室论文,所以放在 featured 里 74 分比较合适。但内容本身挺实在——作者没去追长链推理,而是让模型在上下文切换时做短思考,避免“想太多”拖慢速度。用 QLoRA 在 Qwen3 四个尺寸上都训了,代码和数据全公开,24GB 显存能玩到 14B,这点如果是真的挺省钱。TIMEBench 评测也给了,不是空口说效果。整体对想自己动手调模型的人有直接参考价值,信息量够,判断也挂得住。

AI HOT 精选

Cursor 发布 Composer 2.5,用文字反馈教模型改掉坏习惯,合成数据规模翻了 25 倍

Cursor 把代码助手 Composer 升级到了 2.5 版,底层还是基于月之暗面的 Kimi K2.5 开源模型。这次主要做了三件事:一是用“文字反馈强化学习”,在模型犯错的地方直接插一句提示(比如“提醒:可用工具有这些”),让模型在那个点上学会纠正,而不是靠最后的总分去猜哪里做错了;二是把合成训练数据的量提到了上一代的 25 倍,并且动态生成更...

推荐理由:HKR 三项都踩中了:Cursor 本身就是编程助手的核心入口,文章又给了 Moonshot 基座、25 倍合成数据、文本反馈 RL 和分片 Muon 这些实打实的训练细节。我会先打个折——正文没给基准测试、没提价格,也没说用户端能力边界,所以分数卡在 78–84 这个区间是合理的。

5月17日星期日

Google DeepMind

Google DeepMind 推出 Gemini for Science 科学工具集

Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。

推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究原型打包成可申请的科学工具,读者可据此判断智能体科研的落地形态。

量子位 · 公众号

TGO:不用人工挑好坏样本,靠一个分数就能把生图模型调得更听话

新加坡国立大学搞了个叫 TGO(阈值引导优化)的方法,被 ICML 2026 收了。它最大的好处是不需要提前构造“这张比那张好”的偏好对,直接拿一个标量分数(比如美学分、图文匹配度)就能做对齐。做法是先让模型生成一批图,算出分数的分布,定一个阈值:高于阈值的当正样本往上拉,低于的当负样本往下压。论文在 Stable Diffusion v1.5、FLU...

推荐理由:这篇 ICML 2026 的论文提了个叫 TGO 的方法,核心是把标量反馈(比如一个打分)直接转成模型的正负更新方向,不用像传统 RLHF 那样先构造偏好对。我会先打个折:正文没披露具体节省了多少标注成本或计算量,但思路本身挺直接——用分数分布的阈值来决定哪些样本该学、哪些该躲。实验覆盖了四个主流视觉生成模型,从 SD v1.5 到 FLUX 都有,说明不是单点特调。这点先别太激动,因为论文偏研究向,离工程落地还有距离,但对正在头疼对齐数据采集的团队来说,值得看一眼。

Dwarkesh Patel 播客

预训练并行策略与翻车训练笔记

这篇笔记聊了两件事:预训练为什么容易跑崩,以及怎么把训练拆到多张 GPU 上。跑崩的核心原因有两个——破坏因果性和引入偏差。比如 MoE 路由里用专家选择(expert choice)分配 token,会让 token n 的去向依赖 token n+k 的路由结果,训练时看到了推理时看不到的信息;token 丢弃也会让后面的 token 影响前面的处...

推荐理由:Dwarkesh 这期笔记把预训练里容易翻车的地方摊开讲:expert choice 和 token dropping 会破坏因果性,FP16 集体通信能把一万次累加算偏,这些坑不踩过很难意识到。我会先打个折——它更像从业者之间的经验交换,不是系统性的技术报告,但给的数字(6ND、288GB、参数量×3)对算成本和排故障都有用。正文没展开具体实验验证,所以别当定量结论用。

5月15日星期五

r/LocalLLaMA

用强化学习让 Qwen3.5 自己攻自己,再把失败案例喂回去加固防线

作者搭了一套全自动的红队演练循环:先训练一个攻击模型,用强化学习(GRPO)对着 Qwen3.5 不断尝试越狱,成功诱导出有害回答就给奖励。第一轮攻击很快塌缩成同一种“写小说”套路,翻来覆去就一招。后来他们把攻击按底层策略聚类,奖励除以该策略的使用次数,逼攻击模型去挖新花样,这才炸出 7 类不同的越狱手法,其中虚构创作类占比最高,达 34%。接着用这些...

推荐理由:我会先打个折:这是 Reddit 个人帖,没挂论文也没开源代码,数字只能当参考。但故事本身挺有意思——作者没靠人工写攻击样本,而是用强化学习让 Qwen3.5 自己琢磨怎么越狱,再把翻车案例拿来加固模型,形成一个自动红队闭环。防御率从 64% 跳到 92% 看着漂亮,不过良性准确率从 92% 跌到 88%,说明模型变保守了,正常问题也开始拒答。攻击器挖出 7 类策略,正文没展开细节,不知道覆盖面和实际危害有多大。整体像一份个人实验笔记,有启发但缺验证,先别太激动。

r/LocalLLaMA

让 7B 小模型从自己的错误里学习,HumanEval 正确率从 15% 涨到 68%,跑一次训练只要 3.5 美元

作者拿 Qwen 2.5 7B 基础模型做实验,先让它自己写代码、自己跑测试,把跑不过的代码和报错信息收集起来,再让它根据报错改出正确版本,这样就自动生成了“错误-修正”配对数据。用这批数据微调后,7B 模型在 HumanEval 上的通过题数从 25 题(约 15%)提升到 112 题(约 68%),数学能力也超过了 GPT-3.5。14B 版本只用...

推荐理由:我会先打个折:标题说 80% 但正文是 112/164,约 68%,这点先别太激动。不过 hook 确实抓人——让模型自己写题、自己答、再自己改错,用这些修正对去微调,HumanEval 直接翻几倍。14B 版本只用了 100 对样本、一张 H100 跑一个半小时花 3.50 美元,成本低到可以复现。正文没披露数学 benchmark 的具体名称和完整分数,验证偏弱,但作为单人实验,信息量和可操作性都够。保留 78 分,因为它是单篇 Reddit 帖子,且 80% 的说法和实际数字有出入。

r/LocalLLaMA

MOOSE-Star:用 7B 小模型和 10 万篇论文做科学假设发现,ICML 2026 接收

MiroMind 放出了 MOOSE-Star 系列,包含三个 7B 模型和一个叫 TOMATO-Star 的数据集,里面有 108,717 篇 NCBI 论文。其中 MS-IR-7B 在“灵感检索”任务上准确率到了 54.37%,底子是 DeepSeek-R1-Distill-Qwen-7B,fp16 跑起来大概占 14GB 显存,支持 llama....

推荐理由:我会先打个折:正文没披露 54.37% 这个准确率是在什么基准上测的、对比了哪些方法,所以这个数字先别太激动。但整套东西的钩子很实在——用 7B 小模型加 10.8 万篇 NCBI 论文搭一个科学假设发现的流程,fp16 才 14GB,本地就能跑。对想做科研 RAG 或让模型进文献分析流程的团队来说,这是个现成的起点,数据集和模型权重都公开了。

5月14日星期四

r/LocalLLaMA

有人把 HuggingFace 的 AI 研究员搬到了本地,用 llama.cpp 跑通了一条自动微调流水线

HuggingFace 之前开源了一个叫 ml-intern 的自动化 AI 研究员,现在社区有人把它接上了 llama.cpp 和 ollama,让整个流程能在本地跑。帖子说用 Qwen3.6-35B-A3B 这个模型就能当大脑,指挥 CPU/GPU 沙箱和 HuggingFace Hub 上的任务,从头到尾完成一次 SFT(有监督微调)。正文没披露...

推荐理由:我会先打个折:这是 Reddit 出来的开源工具更新,不是大模型发布。但本地沙箱加 Hub 作业编排能跑通完整微调,对想在自己机器上做自动化实验的人挺实用。正文没披露具体延迟和资源占用,这点先别太激动。

新智元 · 公众号

田渊栋带队八人创业,估值 46.5 亿美元,要做能自己进化、自己搞研究的 AI

田渊栋和另外七位 AI 研究员一起创立了 Recursive Superintelligence,团队目前 25 人,拿了 6.5 亿美元融资,估值冲到 46.5 亿美元。他们想干的事是把模型评估、数据筛选、训练、后训练甚至研究方向选择这些环节全交给 AI 自己跑,让整个研发流程自动化。正文因为需要验证没加载出来,具体技术路线和验证结果还不清楚,所以这...

推荐理由:一家 25 人的公司,拿了 6.5 亿美元,估值冲到 46.5 亿美元,要做的事是让 AI 自己搞定评估、挑数据、训练、后训练甚至选研究课题——说白了就是让研究员自己卷自己。田渊栋带队,八人创始团,这个阵容和融资规模都不是常规操作。我会先打个折:正文没披露具体技术方案和验证结果,所以现在只能当一个大额押注来看,别急着激动。

机器之心 · 公众号

灵初智能用10万小时人类操作数据训练机器人,但文章正文被验证页挡住了

这篇微信文章标题说灵初智能(PsiBot)用了10万小时的人类操作数据来训练机器人策略,还提到一个叫W0的世界模型只在训练时做迁移,实际部署只跑R2。但页面被环境异常验证拦住了,正文内容完全看不到,没法确认具体怎么采集数据、在什么任务上验证、效果到底怎么样。

推荐理由:这篇讲的是灵初智能用10万小时人类操作数据训机器人策略,W0世界模型负责训练时的迁移,部署时只跑R2,省算力。我会先打个折:10万小时这个数字挺唬人,但正文没披露数据怎么采集、覆盖哪些任务、成功率多少,也没给论文或开源链接,所以只能当公司说法看。对从业者来说,W0训练期迁移、R2部署这个架构思路有参考价值,但缺验证就不好判断实际效果。整体像产品发布稿,不是可复现的研究,所以放在featured但分数没往上拉。

机器之心 · 公众号

阿里达摩院用信息瓶颈做自奖励,让模型做数学题时多试几条不同的路

阿里达摩院发了篇 ACL 2026 论文,提出 I²B-LPO,解决强化学习微调时模型解题思路越来越像的问题。做法是在模型生成答案时,碰到它犹豫不决的节点就分叉出多条路径,再用一个基于信息瓶颈的自奖励机制筛掉重复的、留下真正不一样的解法。论文在 Qwen2.5-7B 和 Qwen3-14B 上跑数学题,准确率最多提了 5.3%,答案的语义多样性提了 7...

推荐理由:我会先打个折:这还是一篇训练方法论文,不是新模型或产品发布,所以重要性给 78 合理。亮点在于它把 RLVR 的探索问题讲得很具体——不是泛泛说“多样性不足”,而是用高熵节点定位、分支采样、自奖励这套组合拳给出可操作的解法。数字也实在,准确率和多样性双涨,没有只挑好看的说。正文没披露训练成本和延迟数据,这点先别太激动。整体适合推荐给做推理微调的人看,不是那种看完就忘的刷榜文章。

5月13日星期三

AI HOT 精选

商汤发 SenseNova-U1 技术报告,开源一个激活参数仅 30 亿的多模态模型

报告把训练一个原生多模态模型的全流程拆成了六步,从统一建模、无损接视觉信号,到用自回归加像素空间流匹配一起训,再到强化学习后训练和蒸馏,每一步都给了实操细节。开源版本 SenseNova-U1-A3B-MoT 用了混合专家架构,只激活 30 亿参数,主打跑得快、成本低。模型权重、代码和演示都放出来了,不过报告里没给具体 benchmark 对比,实际效...

推荐理由:我会先打个折:这是厂商自己发的技术报告,正文没给基准分数、开源协议和复现细节,所以别当第三方评测看。亮点在于把训练全流程讲清楚了——从数据配比、六阶段课程到 RL 后训练和蒸馏,每一步都给了操作说明。A3B-MoT 用 MoE 把激活参数压到 30 亿,推理时确实省钱,但报告没披露总参数量、专家数这些关键数字,也没说开源权重什么时候放出来。这点先别太激动,等代码和权重落地再判断。

新智元 · 公众号

清华系开源 MiniCPM-V 4.6:1.3B 多模态模型,一张 4090 就能全量微调

面壁智能、清华和 OpenBMB 放出了 MiniCPM-V 4.6,一个 13 亿参数的多模态模型。它最大的卖点是能在一张 RTX 4090 显卡上完成全量微调,不用再靠低秩适配这类折中方案。模型提供了两种视觉 token 压缩模式:4 倍压缩追求精度,16 倍压缩追求速度,让开发者自己按场景选。正文没披露具体的训练数据量和详细评测基准,这点先别太激...

推荐理由:HKR 三项都成立:一条具体的开源多模态模型发布,给了参数量、硬件条件和 token 压缩方案,把本地微调成本压到一张消费级显卡。不是前沿大厂的旗舰发布,但实用性强,82 分合理。

5月12日星期二

AI HOT 精选

开放模型生态如何滚起雪球

作者 Nathan Lambert 从中国 AI 圈几乎全员开源的现状出发,聊了聊开放模型生态真正的省钱逻辑。核心判断是:造前沿模型的大头成本不在最终训练,而在研发试错,这部分算力开销可能占到 80%。中国各家实验室通过详细技术报告和刻意分享,相当于帮同行排了雷,避免重复烧钱做实验,形成了一种靠信息共享降低未来研发成本的复合增长。文章也指出,开源 AI...

推荐理由:这篇文章不是产品发布,而是一篇评论,核心观点是开源模型生态正在自我强化。我会先打个折:正文没披露下载量的绝对基数,200% 的环比增长到底是从 1 万涨到 3 万还是从 100 万涨到 300 万,差别很大,这点先别太激动。但它把开源模型的扩散、微调、再发布串成一个复合增长飞轮,这个框架比单纯报数字更有价值。对做模型选型和成本估算的从业者来说,这个趋势意味着国产开源模型的可用性在快速爬坡,值得关注。

Google DeepMind

Google DeepMind 发布 Co-Scientist 多智能体科研系统

Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。

推荐理由:原文披露了多智能体系统的三阶段协作机制与多个实验室的落地案例,可了解 AI 参与科学假设生成的具体路径。

量子位 · 公众号

上海 AI 实验室发现:有监督微调能跨领域泛化,但得满足三个条件

上海 AI 实验室、上海交大和中科大的团队拿 Qwen3-14B-Base 做长思维链的监督微调实验,发现模型在训练 8 轮后,跨领域的表现会先跌后涨,最终超过原始水平。他们总结出泛化要成立的三个条件:一是得把模型训得足够深,不能浅尝辄止;二是训练数据的质量和结构要过关;三是基座模型本身的能力得够强。正文没披露具体用了什么数据集,也没给出跨领域任务的具...

推荐理由:这篇论文的卖点很清晰:SFT 不是不能泛化,但得满足优化、数据结构和基模型能力三个条件。我会先打个折,因为目前只是 Reddit 上的一个帖子,没有看到论文全文或代码,没法验证他们说的 8 个 epoch 先降后升是不是稳定复现。不过这个发现对做开源微调的人确实有用,尤其是用 Qwen3-14B 这类模型时,怎么配长思维链数据、训多久,这篇至少给了一个可参考的曲线。HKR 三项都过得比较轻松,但因为没有独立复现和完整 benchmark,分数就停在 76,不往上拉了。

r/LocalLLaMA

把 prompt 缓存用到强化学习训练里:长提示短回复场景下,Qwen3.5-4B 训练速度提升 7.5 倍

作者提出在强化学习训练时复用 prompt 缓存,专门针对那种提示很长、模型回复很短的任务。在 Qwen3.5-4B 上跑 16k token 提示、64 token 回复的例子,训练速度直接快了 7.5 倍。另一个 G=8 的例子更直观:1000 token 提示加 100 token 回复,原本要处理 8800 个 token,用这方法后实际只需处...

推荐理由:这是一篇 Reddit 帖子,作者把推理时常用的 prompt caching 思路搬到了 RL 训练里,在长提示短回答的场景下效果明显:Qwen3.5-4B 跑 16k 提示、64 输出 token 的任务,训练速度提了 7.5 倍。核心逻辑是 RL 训练时同一组 prompt 会被反复采样,把重复的 token 缓存起来不重复算,G=8 时实际要处理的 token 数从 8800 掉到 1800。这个数字说明去重效果确实好,但前提是 prompt 够长、回答够短,场景比较挑。正文没给代码或论文链接,也没有独立复现验证,所以分数先打个折,定在 78。