跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 41–60 条 · 共 124 条

5月28日星期四

量子位 · 公众号

DeepSeek V4 用上华为昇腾芯片做训练,国产算力生态开始跑通闭环

这篇文章本身因为微信环境验证失败,正文内容没抓到,只能根据标题和摘要信息来聊。标题里提到的“芯模协同”,指的是 DeepSeek V4 在训练时直接跟华为昇腾芯片做适配优化,不是先拿英伟达跑完再移植。摘要里说 CANN(华为的 AI 计算框架)一口气开源了 65 个代码仓库,并且支持 70 多个主流模型“开箱即用”,不用等适配。另外 AIGCode 在...

推荐理由:这条主要讲的是国产算力生态的进展,不是 DeepSeek V4 本身发了什么新能力。但里面给的仓库数、适配模型数、MFU 这些数字比较具体,比一般的合作通稿有信息量。我会先打个折,因为正文没披露 V4 在昇腾上的完整训练规模或成本对比,MFU 也只给了 AIGCode 一个点,验证还不够全。不过对关心国产替代进度的人来说,这几个数字已经够拿来判断方向了,所以放在 featured 里。

机器之心 · 公众号

国产预训练具身大模型 Wall-OSS-0.5 开源,宣称跳过微调也能直接干活

X Square Robot 开源了一个叫 Wall-OSS-0.5 的视觉-语言-动作模型,主打“预训练完就能用”。他们放出了 40 万步的预训练 checkpoint,在 17 个真实机器人零样本任务里,有 4 个成功率超过 80%。这次开源的东西挺全:权重、代码、训练配方、消融实验,还有一个叫 DMuon 的优化器实现。不过正文因为环境验证没抓到...

推荐理由:我会先打个折:X Square Robot 不是顶级基础模型实验室,所以重要性停在 79。但这条消息本身挺实在——Wall-OSS-0.5 直接开源了一个 400k 步的预训练 checkpoint,在 17 个真机零样本任务里跑了分,有 4 项超过 80 分。这意味着你不用非得花大量算力和时间做后训练,拿过来就能在部分任务上跑出不错的效果。当然,正文没披露这 4 项具体是什么任务、难度如何,也没说剩下 13 项的表现分布,所以“后训练不再是必选项”这个结论得看场景,别太激动。整体来说,对做具身智能又缺资源的团队是个值得看一眼的发布。

AI HOT 精选

英伟达开源 Polar 框架,不改代码就能让 Codex 跑分涨近 6 倍

英伟达搞了个叫 Polar 的开源框架,专门解决一个实际问题:怎么在不重写 Codex、Claude Code 这些现成代码工具的前提下,用强化学习(GRPO,一种让模型在多步任务里根据奖励信号自己学会更优操作的训练方法)去训练它们。Polar 的做法很取巧,它不碰工具本身的执行逻辑,而是在模型和工具之间的 API 接口上做文章,把对话记录、采样结果这...

推荐理由:英伟达开源 Polar,用 GRPO 训练小模型 Qwen3.5-4B,Codex 在 SWE-Bench Verified 上从 3.8% 冲到 26.4%,这个提升幅度在代码 agent 圈子里很能打。技术细节和基准分都给得清楚,属于扎实的研究开源项,不是大模型或产品发布,所以放在 featured 档、82 分合理。

r/LocalLLaMA

有人整理了一份1030亿token的Usenet语料,覆盖1980到2013年,全是真人发言、没有AI污染

一个叫OwnerByDane的用户放出了一套从Usenet新闻组扒下来的语料,总规模1031亿token,包含4.08亿条帖子,横跨18347个新闻组,时间从1980年一直拉到2013年。这套数据最大的卖点是“前互联网时代、纯人类产出、零AI生成内容”,对想避开模型训练数据被AI输出污染的开发者来说,算是个稀缺资源。目前可以免费下载每个新闻组层级500...

推荐理由:我会先打个折:这事目前只在 Reddit 上发酵,完整语料要授权才拿得到,也没有第三方验证或跑过 benchmark,所以分数没给更高。但它的卖点很硬——103B token 的纯人类对话,时间跨度 33 年,对做微调、研究语言演变或者想避开合成数据的人都有吸引力。样本已经挂在 Hugging Face 上,作者还拿它微调了 Gemma 模型,至少说明能用。这点先别太激动,但如果授权条款不苛刻,这个语料库的价值不小。

5月27日星期三

机器之心 · 公众号

AMD 论文发现 FP4 训练不稳,锅不在随机性不够

AMD 和宾州州立大学用 MI355X 原生 FP4 硬件预训练了 Llama 3.1-8B,端到端速度比 FP8 基线快了 9-10%。但论文指出,Wgrad(权重梯度)量化是拖后腿的环节,导致每个 token 的计算开销额外增加 26-27%,而且用确定性 Hadamard 方法也稳不住。正文没披露最终模型的验证集效果对比,这点先别太激动。

推荐理由:我会先打个折:这是一篇偏训练基础设施的研究,不是通用大模型发布,所以分数不会给到顶。但它的钩子很锋利——直接挑战“FP4 不稳定是因为随机性不足”这个流行说法,并且给出了在 AMD 最新硬件上跑 Llama 3.1-8B 的实测数据。速度提升 9-10% 是实打实的,但 Wgrad 带来的 26-27% 额外开销也说明这条路还没完全走通,这点先别太激动。对关心训练成本和硬件选型的从业者来说,这篇值得一看。

AI HOT 精选

面壁智能开源 ForgeTrain,一个完全由 AI 写出来的模型训练框架,零人类代码

面壁智能、清华和 OpenBMB 开源了 ForgeTrain,一个完全由 AI 编写、没有人类代码介入的大模型训练框架。他们用这套框架在华为昇腾芯片上预训练了 MiniCPM5-1B,这个模型在 AA 榜单的 2B 参数以下级别里排到了第一。同时开源的还有制造 ForgeTrain 的 Agent Harness 工具链。正文没披露训练成本、耗时和具...

推荐理由:我会先打个折:这不是一个顶配模型发布,而是一个工具链层面的开源动作,所以给 80 分、放 featured 比较合适。故事的核心是“AI 造 AI”——面壁智能说 ForgeTrain 是全球第一个零人类代码介入的生产级训练框架,并且已经在华为昇腾上跑通了 MiniCPM5-1B 的预训练。对从业者来说,这比单纯刷榜有意思,因为它直接关系到训练流程能不能自动化、能不能省人力。不过正文没披露这套 AI 写的代码质量到底怎么样、训练出来的模型跟人手写的框架比有没有性能差距,这点先别太激动。整体看,H、K、R 三条都踩中了,是个扎实的工具链新闻。

AI HOT 精选

TRL 新增增量权重同步:只传模型变化的部分,每步传输量从 1.2GB 降到 20-35MB

异步强化学习训练有个很现实的问题:每一步训练器都得把整个模型发给推理引擎。一个 7B 模型用 bf16 格式就要传 14GB,换成万亿参数模型更是要传 TB 级别的数据。Hugging Face 团队发现,在两次优化步骤之间,大约 99% 的 bf16 权重其实完全没变,真正变动的部分很小。他们合入了 TRL 的一个 PR,做法是把变动的权重打包成稀疏...

推荐理由:Hugging Face 在 TRL 里合了一个增量权重同步的 PR,用稀疏 safetensors 只传变化的部分,Qwen3-0.6B 单步载荷从 1.2GB 降到 20–35MB。对经常做分布式微调的人来说,这个压缩比很实在,能省带宽、省时间。正文没提更大规模模型或跨节点同步的实测数据,所以“万亿参数”目前更像一个能力上限的表述,实际效果还得看后续验证。整体是训练基础设施层面的改进,对从业者有用,但还没到必须全员关注的程度。

5月26日星期二

AI HOT 精选

商汤把 SenseNova-U1 的训练代码全开源了,一个框架同时训生图、修图、交错生成和理解

OpenSenseNova 在 GitHub 上放出了 SenseNova-U1 的完整训练代码,用 Apache-2.0 协议。代码覆盖了 8B 稠密模型和 A3B MoE(混合专家)架构,在一个统一框架里支持四种多模态任务:文生图、图片编辑、图文交错生成,以及文本与视觉理解。工程上为大规模训练做了准备,支持混合并行、流式可恢复的数据管线、用环境变量...

推荐理由:这条消息的卖点是“完整训练代码开源”,不是常见的只放权重。8B 密集和 A3B MoE 两种模型规格都给了,Apache-2.0 协议也干净。不过正文没披露训练用了多少数据、多少算力,也没有任何评测结果,所以实际效果和训练成本现在没法判断。我会先打个折:代码开源本身值得关注,但别急着对标闭源模型,等社区跑出结果再说。

机器之心 · 公众号

xAI 解散但 Grok 没停,马斯克预告新模型

马斯克说,1.5 万亿参数的 Grok V9-Medium 已经训完了,过几天开始做强化学习,计划两到三周后发布。Grok Build 现在支持同时跑 8 个子代理,上下文窗口拉到 25.6 万 token,还加了计划模式、竞技场模式、MCP 和 ACP。不过正文因为微信环境验证失败,具体技术细节和评测数据都没披露,这些功能实际效果怎么样还得等实测。

推荐理由:这条消息的钩子在于 xAI 解散的传闻和 Grok 上新同时出现,戏剧性够。马斯克亲自预告 1.5T 参数的 Grok V9-Medium,还给了两到三周的发布窗口,对盯着模型竞赛的人是个明确的信号。Grok Build 那边放出的 8 个子智能体、256K 上下文、Plan Mode 和 Arena Mode,说明他们在把智能体往实际业务流程里塞,不是只发个 API 就完事。我会先打个折:模型刚训完还没进强化学习,没跑分没对比,性能完全未知,这点先别太激动。但整体信息密度和时效性都够,放在 featured 里合理,给 82 分。

r/LocalLLaMA

一位律师用 12 块 V100 显卡搭本地集群跑法律文书起草,Qwen3.5-122B 模型跑到约 50 token/秒

Reddit 上一位律师分享了自己用 12 块 32GB 显存的 SXM V100 显卡搭建本地 AI 集群的进展,专门用来起草法律文书。核心模型是 Qwen3.5-122B-A10B,在 4 块 V100 上推理速度大约 50 token/秒。这套流程里还加了一个“验证器”,会在最终文件使用前自动拦截没有真实来源的引用、日期和 Bates 编号(案件...

推荐理由:这是一篇来自Reddit的第一手实验记录,不是厂商通稿。律师自己攒16块V100跑Qwen 122B做法律文书,速度约50 tok/s,还加了引用和日期验证器来拦截幻觉,信息量扎实。我会先打个折:来源是个人帖子,权威性有限,所以放在featured低段而不是p1。但HKR三项全中——故事性强、有可复现数字、切中本地部署和合规痛点,对想自己动手的团队是个不错的参照。

5月25日星期一

r/LocalLLaMA

《金融时报》报道了去安全护栏工具 Heretic,称其 10 分钟内就能解除 Meta Llama 3.3 的限制

Reddit 用户分享了一篇《金融时报》的文章,主角是一个叫 Heretic 的工具。这个工具专门用来移除开源模型(比如 Meta 的 Llama 3.3)内置的安全护栏,让模型能回答原本被禁止的敏感问题。文章提到,Heretic 的创建者 Philipp Emanuel Weidmann 说,用这个工具不到 10 分钟就能搞定一个模型。目前他们已经生...

推荐理由:Financial Times 用 Heretic 这个工具演示了一把,10 分钟就把 Meta Llama 3.3 的安全限制给卸了。文章说这个工具已经生成了 3500 多个“去审查”模型,总下载量冲到 1300 万次,说明滥用门槛低得吓人。我会先打个折:目前看到的只是 Reddit 上的摘要,不是 FT 的完整报道,也没有可复现的测试记录,所以事实部分先信这么多。但即便只是摘要,这几个数字也足够让做模型安全的人心里一紧了。

5月24日星期日

r/LocalLLaMA

OpenBMB 在华为昇腾 NPU 上把大模型从头训成 1.58-bit,8B 模型性能保住全精度 97%

OpenBMB 放出了 BitCPM-CANN,一个在华为昇腾 NPU 上原生跑通的 1.58-bit(三值)大模型训练方案。他们用和 MiniCPM4 一样的架构与数据,从零训了 0.5B、1B、3B、8B 四个尺寸。1B 到 8B 的模型在 11 个测试集上平均保住了全精度模型 95.7% 到 97.2% 的性能,3B 版本在 BBH 上打平,3B...

推荐理由:我会先打个折:目前只有 Reddit 帖子作为来源,没有吞吐量、显存占用或复现细节,所以先放在 featured 的底线。但这条信息本身挺实在——OpenBMB 在昇腾 NPU 上从零训练了四个 1.58-bit 的模型,不是推理时量化,而是训练阶段就压到极低比特。1B 到 8B 的性能保留率都在 95% 以上,说明这条路在国产硬件上走得通。对需要控制训练成本、又绑在昇腾生态里的团队来说,这是个值得跟的信号。

机器之心 · 公众号

Meta 裁员后留下的员工被塞进新坑:技术经理回去写代码,AI 工程师转岗做数据标注

这篇文章讲的是 Meta 裁员后没走的人日子也不好过。公司开始把一些工程经理重新赶回一线写代码(IC 岗),同时把部分做基础设施和 AI 的工程师调去搞数据标注。文章提到一个关键数字:经理和下属的比例从以前的 1:8 直接拉到了 1:50,说明管理层被大幅压缩。另外还爆了个料,说 Meta 持有数据标注公司 Scale AI 49% 的股份,但正文没展...

推荐理由:这篇不是常规的裁员报道,而是抓了一个更具体的信号:幸存下来的工程师被塞进数据标注岗,工程经理退回一线写代码。我会先打个折,正文没披露转岗规模和持续时间,所以没法判断这是临时缓冲还是长期降级。但经理下属比从 1:8 拉到 1:50 这个数字,加上 Meta 是 Scale AI 大股东,让整件事看起来像在用内部人力对冲外包成本。对从业者来说,这比丢工作还难受——留下来了,干的活却更边缘。

5月23日星期六

Mistral AI

Mistral 收购 Physics AI 公司 Emmi AI

Mistral AI 宣布已达成收购 Physics AI 先驱 Emmi AI 的最终协议,以强化其作为工业企业 AI 转型伙伴的定位。Emmi AI 成立于奥地利,专注物理 AI 与大型工程模型,可加速工程工作流、以实时仿真替代多日计算并构建数字孪生。Emmi 的联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。

推荐理由:Mistral 通过收购 Physics AI 公司 Emmi 补强工业仿真能力,读者可了解其向工程与制造场景延伸的路径。

5月21日星期四

新智元 · 公众号

中科大两篇顶会论文:教多模态大模型持续学新知识,同时不忘旧本事

中科大团队在顶会上发了两篇工作,专门解决多模态大模型“学新忘旧”的问题。一篇是 MMEVOKE,搞了一个包含 159 个子类、9422 个样本的评测集,用来检验模型在持续学习中会不会把之前的知识覆盖掉。另一篇是 KORE,提出用知识树扩充样本,再通过零空间约束微调来减少遗忘。正文没披露具体性能数字和训练成本,但思路很明确:让模型像人一样,学了新东西还能...

推荐理由:HKR-K 和 HKR-R 都站得住:文章给出了数据集规模和具体的微调机制。不过这只是论文阶段的知识注入方案,没有生产环境的验证或完整的复现细节,所以先打个折,放在低 featured 档。

r/LocalLLaMA

HRM 1B:一个用极低成本训练的小模型,性能号称能打 2B-7B 的开源选手

Sapientinc 开源了一个叫 HRM-Text 1B Base 的小模型,连训练代码也一起放出来了。论文里的说法是,它的性能可以和 2B 到 7B 的开源模型掰手腕,但训练用的数据量只有别人的百分之一到九百分之一,算力消耗更是只有别人的 1/96 到 1/432。具体来说,用 16 块 H100 GPU 训练了大概 46 小时,总花费约 1,47...

推荐理由:HKR 三项都站得住:HRM-Text 1B 有具体的低成本训练数字和公开代码。卡在 80 分是因为消息源是 Reddit,效率提升的说法还没有独立评测背书,我会先打个折。

5月19日星期二

量子位 · 公众号

京东和中科院信工所连发三篇论文,提出让大模型“自己教自己”的强化学习路线

这篇推文本身因为环境异常没加载出正文,我只能根据标题和外部信息给你还原一下。京东和中科院信工所联合发了三篇论文,核心思路叫 Self-Taught RLVR,也就是让模型在强化学习里自己生成训练信号、自己教自己,省掉人工标注或外部奖励模型。其中一篇叫 RLSD 的工作,在 Qwen3-VL-8B-Instruct 上只训了 200 步,就在 8 个基准...

推荐理由:我会先打个折:这不是哪个大厂发了新模型,而是京东和中科院信工所连着放了三篇论文,把 Self-Taught RLVR 这条路线从不同角度拆了一遍。亮点在 RLSD,它让模型自己生成推理步骤、自己打分、自己迭代,200 步就超过 GRPO 跑 400 步,等于训练量砍半还能赢,对算力吃紧的团队是个好消息。不过正文没披露复现需要多少卡、数据怎么配,这点先别太激动。整体属于有干货、有对比、但热度还没起来的阶段,放 featured 低位合适。

机器之心 · 公众号

从卖 token 到背 KPI:AI 公司开始按结果收费了

这篇文章讲的是 AI 商业模式的一个转向:不再按调用次数或月费收钱,而是直接对业务结果负责。Sierra 今年 5 月拿了 9.5 亿美元,估值超过 150 亿,做的就是客服场景的“结果即服务”——你只为它成功解决的客诉买单。灵犀(Lingxi)则说自己在 2025 年已经实现规模化盈利和正向现金流,同样走按效果付费的路子。不过正文因为微信环境验证没加...

推荐理由:这篇文章抓了一个很具体的商业信号:AI公司开始不按token或订阅收钱,而是按业务结果收费。Sierra的融资规模和零犀的盈利时间点让这个模式有了可验证的案例,不是空谈。我会先打个折,正文没披露具体分成比例或客户续约率,但“让AI背KPI”这个角度本身对从业者判断产品定价和交付压力有帮助,所以给了featured。

AI HOT 精选

Cursor 发布 Composer 2.5,底层和 Kimi K2.5 同源,号称效率提升 10 倍

Cursor 把 Composer 模型升级到了 2.5,说它在处理长任务、理解复杂指令上比之前强了不少,同等能力下效率能高出 10 倍。这次升级主要靠三件事:训练规模更大、强化学习环境搞得更复杂,还加了一套文本反馈机制,让模型能根据文字反馈自己调整。底层架构跟 Moonshot 的 Kimi K2.5 是同一套。另外 Cursor 正跟 SpaceX...

推荐理由:Cursor 发了 Composer 2.5,说同等能力下效率能提 10 倍,还提到用了更大的训练规模、更复杂的强化学习环境和文本反馈来调模型。我会先打个折:10 倍这个数目前只有厂商自己说,正文没给基准测试、没给价格、也没法复现验证,所以别太激动。但如果是真的,对用 Cursor 写代码的人来说确实挺省钱省时间。这条消息来自单一社交来源,信息量够让从业者关注,但缺硬数据支撑,所以分数定在 82,放在 featured 里提醒大家留意后续实测。

AI HOT 精选

Cursor 发布 Composer 2.5 编程模型,长任务效率号称提升十倍

Cursor 推出了 Composer 2.5,一个专门做长代码任务的模型。官方说在连续几十甚至上百步的复杂编程里,效率最高能到之前的十倍。技术上的关键是用了文本反馈来训练,解决了十万 token 级别超长轨迹的学习问题,让模型能稳定跟完一长串指令。底座还是拿 Moonshot 的 Kimi K2.5 继续训出来的。另外 Cursor 宣布要和 Spa...

推荐理由:Cursor 发 Composer 2.5,说长任务效率最高能提 10 倍,背后是用 Kimi K2.5 做二训、处理十万 token 级轨迹。我会先打个折——10 倍是官方说法,没看到独立评测,实际效果还得等用户跑起来再看。但 Cursor 本身是编程工具里的头部产品,这次更新又绑定了 Moonshot 的模型,对开发者选工具和模型都有参考价值。正文没披露二训具体用了多少样本、成本如何,这点先别太激动。整体信息量够、时效性强,给 82 分放在 featured 里合理。