跳到正文

#数据/训练

今日 4 条

6月8日星期一

AI HOT 精选

Hivemind 给 AI 编程助手加了个“记性”,能把每次干活的经验存下来复用

Hivemind 这个工具现在开放了持续学习功能,专门给 AI 编程智能体用。它会自动收集 Claude Code、Codex、Cursor、Hermes、Pi 这些助手干活时的操作轨迹,把成功的套路提炼成可复用的技能,存到你自己的云盘里,再同步给所有助手。内置的 SkillOpt 负责持续训练这些技能,效果上,Claude Code 准确率涨了 19...

推荐理由:HKR三项都站得住,但这是Hivemind的一次功能更新,不是大厂动作,也没有其他来源交叉验证。52个场景的测试结果让它有干货,够格进低位的featured。

AI HOT 精选

面壁智能开源 VoxCPM2 语音模型,200 万小时数据训练,支持 30 种语言和 9 种方言

OpenBMB 把 VoxCPM2 的技术报告和模型都放出来了,Apache 2.0 协议。这是个 20 亿参数的语音生成模型,用超过 200 万小时的多语言语音数据训练,能说 30 种语言和 9 种中文方言。它主要干三件事:按自然语言指令设计语音、可控地克隆声音,以及高保真地延续一段语音。技术方案上,它把语音拆成两步走——先用 16kHz 做语义编码...

推荐理由:HKR 三项都踩中了:200 万小时训练数据和 9 种方言是实打实的钩子,参数和协议信息也够新,对国内语音开发者有直接参考意义。分数定在 78 是因为技术报告正文没给出具体的评测基准和对比数字,实际效果和落地表现还不清楚,这点先别太激动。

Google DeepMind

Google DeepMind 公布塞拉利昂 AI 教学试验结果

Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,相当于八周内取得约 1.2 至 1.7 年的常规学习进度。

推荐理由:原文给出塞拉利昂随机对照试验的量化结果与交互数据,可了解 AI 辅助教学在真实课堂中的效果边界。

6月7日星期日

量子位 · 公众号

快手可灵提出 VLM-as-Teacher:生成视频时让视觉模型当老师,在线微调 LoRA 来遵守文字规则

这篇文章的正文被微信环境异常页挡住了,看不到具体技术细节。从标题和现有摘要看,快手可灵和城大合作了一个叫 VLM-as-Teacher 的方法。思路是在测试阶段用视觉语言模型(VLM)给视频生成模型(VGM)的 LoRA 模块打分反馈,边生成边优化,让模型学会按文字规则推理。他们搞了个 VBVR-Bench 基准,分数从 0.666 提到了 0.781...

推荐理由:正文被微信环境异常页挡住了,看不到技术细节,这点先打个折。但从标题和摘要看,快手可灵和城大搞的 VLM-as-Teacher,思路是在测试阶段让视觉语言模型给视频生成模型的 LoRA 打分,边跑边调,让模型学会按文字规则推理。VBVR-Bench 上分数从 0.666 提到 0.781,说明规则遵循能力有明显提升。方法本身有巧思,不是换模型架构,而是在推理时加一层在线优化,对可控视频生成是个实用方向。信息缺口在于没看到具体实现和消融实验,等正文能看了再补判断。

AI HOT 精选

AI 公司开始集体换用更便宜的模型,成本能砍掉九成

Tomasz Tunguz 观察到,基础模型公司往上抢应用层生意、最聪明的闭源模型越来越贵、开源模型又已经够用,这三件事逼着 AI 买家开始大规模“换芯”。Coinbase 把简单任务分流到便宜模型,用量指数级涨但成本没变;Lindy 把所有流量从 Anthropic 切到 DeepSeek v4,省了几百万美元,核心场景效果反而更好;Harvey 在...

推荐理由:这篇不是那种“AI 要颠覆一切”的空话,而是把 Coinbase、Lindy、Harvey 这些公司怎么在实际业务里换模型、省了多少钱讲得很清楚。Harvey 那个 84 美元对 954 美元的例子尤其直观,让人一看就知道成本压力有多大。它属于对行业成本结构变化的扎实观察,不是重大模型发布或产品上线,所以放在 featured 里、76 分这个位置是合适的。

AI HOT 精选

五个实验室,五个心智:用小模型搭了个会内幕交易的金融宫斗剧

这个项目用四家不同实验室的小模型(OpenAI 的 gpt-oss-20b、OpenBMB 的 MiniCPM3-4B、NVIDIA 的 Nemotron-Mini-4B 和一个自己微调的 0.5B Qwen)分别扮演市场里的不同角色,玩家则充当幕后金主,可以放贷、散布真假内幕消息、做空和贿赂。模型之间的差异本身就是卖点,让市场博弈更像真的吵架而不是念...

推荐理由:我会先打个折:这只是个实验项目,不是产品。但它的切入点很巧——用小模型之间的差异来制造博弈感,而不是硬靠 prompt 演。技术细节也够实在,vLLM 版本冲突、0.5B 模型的表现数据都摆出来了,做 agent 的人能直接参考。正文没披露微调那 0.5B Qwen 的具体数据配方,这点先别太激动。整体值得一看,放在低 featured 合理。

6月6日星期六

AI HOT 精选

Google 发布 Colab 命令行工具,本地终端能直接调用云端 GPU 跑脚本了

Google 把 Colab 搬进了终端。装一个命令行工具,就能在本地敲指令直接租用 A100 或 T4 这类高性能 GPU,把本地的 Python 脚本扔到云端跑,跑完再把模型、数据集和可回放的 notebook 日志拉回本地。它还给 AI 编程助手(比如 Antigravity、Claude Code)准备了现成的技能文件,让这些助手也能自己调 G...

推荐理由:Google 给 Colab 出了个命令行工具,不用开浏览器就能在终端里租 GPU 跑代码,跑完自动把模型和 notebook 日志拉回本地。还顺手给 Claude Code 这类 AI 编程助手配了技能文件,让助手也能自己调 GPU。对经常用 Colab 白嫖算力或者想给 agent 接远程执行环境的人来说,这比网页版灵活不少。不过正文没提价格变化和并发限制,实际租用体验还得看后续。

Hacker News 首页

General Instinct 开源 InstinctRazor:把 245GB 的大模型压到 48GB,能在本地设备上跑

General Instinct 开源了 InstinctRazor,一个专门给边缘设备用的模型压缩方案。他们拿 Qwen3.5-122B-A10B 开刀,这个模型原本是 BF16 格式的混合专家模型(MoE),体积大约 245GB。压缩后变成一个 48GiB 的 GGUF 文件,比 Gemma-4-26B-A4B 还小,但在 MMLU-Pro 和 G...

推荐理由:我会先打个折:这是 YC 的 Launch HN,不是独立评测,性能数据得等第三方复现。但亮点很实在——把一个 245GB 的 MoE 模型压到 48GiB,还能在消费级显存上跑 8k 上下文。正文没披露压缩后推理速度有多快,也没说 MMLU-Pro 具体掉了多少分,这点先别太激动。不过思路本身对想在本地跑大模型的团队挺省钱,所以放在 featured 合适。

6月5日星期五

新智元 · 公众号

Anthropic 警告 AI 研发已进入自我加速期,OpenAI 被指跨过可靠性门槛

这篇文章本身因为微信环境验证没抓到正文,只能根据已有的英文标题和摘要来还原。核心信息是两条:一是 Yann Dubois 在采访里说 OpenAI 大概在去年 12 月跨过了一个“可靠性阈值”,具体指什么、怎么验证的,正文没披露;二是 Anthropic 内部数据显示,到 2026 年第二季度,公司里每人每季度的代码贡献量已经是 2024 年第一季度的...

推荐理由:我会先打个折,因为这是二手采访分析,不是官方发布或可复现的测试。但三条理由都站得住:标题里的“可靠性阈值”是个悬念钩子,正文抛出了两个带时间或倍数的具体说法,而且讨论的是中美从业者都在盯的算力差距和效率竞赛。所以给到 82 分,放在 featured 位置,不往上拔了。

6月3日星期三

AI HOT 精选

微软 Build 2026:生图超谷歌,推理还在追

微软在 Build 2026 一口气发了七个自研模型,头一回做推理模型 MAI-Thinking-1。这是个万亿参数、每次激活 350 亿的大家伙,上下文窗口 12.8 万 token,专啃多步指令和代码。内部盲测说比 Anthropic 的 Sonnet 4.6 更受偏爱,但看公开跑分,大概跟 DeepSeek V3.2 打个平手。微软强调模型是从干...

推荐理由:微软在 Build 2026 上发了 7 个自研模型,图像生成直接对标 Google 并声称超越,推理模型则明确说还在追赶。同时公布了一种新调优方法和一个后台自主智能体。正文没披露具体模型名称、基准分数和开放时间,所以信息有冲击力但缺验证细节,重要性给到 84 是合适的,先别急着当定论。

The Verge · AI

英国裁定:谷歌必须让网站主能拒绝内容被 AI 搜索功能抓取

英国竞争与市场管理局(CMA)对谷歌提出新要求:网站主现在可以把自己的内容从 AI 搜索概览(AI Overviews)这类功能里撤出来,也能禁止谷歌拿这些内容去微调自己的 AI 模型。说白了,就是给了内容方一个“别用我的东西训练你”的选项。不过正文没披露这个退出机制具体怎么操作、是统一开关还是按功能细拆,也没说谷歌需要在多长时间内落实。

推荐理由:我会先打个折:正文没写具体时间表和违规处罚,所以重要性停在 80 分。但这条消息本身够硬——英国 CMA 要求 Google 让网站能选择不进入 AI Overviews,并且不能偷偷用这些内容微调模型。对做 AI 搜索和 RAG 的人来说,这意味着外挂资料库的入口可能被掐掉一部分,模型能用的公开数据也会变少。如果是真的落地,出版商至少多了一个谈判筹码,Google 的 AI 搜索训练管道也得改。

机器之心 · 公众号

大模型 SFT 的算力浪费有救了:同质化数据训练几百步就该停,新方法能提前揪出过拟合

这篇文章正文被微信环境验证挡住了,看不到具体内容。从标题和已有的英文摘要看,Junpeng Zhang 他们发现,用高度同质化的数据做 SFT 时,有效训练窗口其实很短,大概几百到一千步左右。他们搞了一个基于交互信号的预警方法,能在 loss 差距还没拉大之前就检测到过拟合,据称能省下 30% 到 50% 的训练算力。不过具体怎么检测、实验怎么设计的,...

推荐理由:这篇论文没画大饼,直接给了一个可操作的结论:同质化数据做 SFT,有效训练步数很短,几百到一千步就差不多了。他们还提出一种交互机理预警,能比传统看 loss 更早发现过拟合,实测能省下 30% 到 50% 的算力。对天天在调参、担心过拟合又心疼显卡钱的人来说,这个发现挺实用。不过正文没披露实验用的模型规模和具体数据配比,实际省下来的算力在不同场景下会打多少折扣,还得自己试。

6月2日星期二

r/LocalLLaMA

我花了几个月钻进 verl 的 RL 训练框架,最后还是放弃了:内部机制、维护分支的代价,还有一个 NCCL 的坑

作者深入研究了字节跳动的 verl(一个做 RLHF 强化学习微调的开源框架),把它的核心流程拆了一遍:DataProto 数据协议怎么走,模型怎么生成回答(rollout),怎么打分(reward),怎么算优势函数(advantage),最后怎么更新模型。作者本来维护了一个自己的分支,但因为上游几乎每天都有改动,同步的成本比自己做改动还高,最后只能停...

推荐理由:这是一篇来自一线的 RL 后训练框架使用报告,不是官方发布。作者没在推销什么,而是老实交代了 fork 又放弃的原因和踩坑记录。我会先打个折:信息密度不错,但只覆盖单机场景,正文没披露多机下的 NCCL 表现。对正在选型或折腾 verl 的人有参考价值,对其他人可能就只是看个热闹。

AI HOT 精选

NVIDIA Cosmos 3 在开放权重模型里拿了图像和视频生成双料第一

NVIDIA 的 Cosmos 3 在 Artificial Analysis 的开放权重榜单上,文本生图和图片转视频两项都排到了第一。它用了一种叫 Mixture-of-Transformers 的架构,把自回归推理器和扩散生成器拼在一起,有 16B 参数的 Nano 版和 64B 参数的 Super 版。Super 版在两项任务上分别超过了 HiD...

推荐理由:Cosmos 3 在 Artificial Analysis 的开放权重榜上把图像和视频生成的头名都拿了,我会先打个折——这只是单一基准的排名,不代表实际场景一定最强。但亮点在于它直接给了 16B 和 64B 两个尺寸,而且权重、代码、数据、微调方案全开源,这点对想自己训模型的人挺实在。正文没披露训练成本和推理延迟,所以别急着下“省钱”的结论。整体看,这条消息对关注开源多模态竞争的从业者有参考价值,放在 featured 档合适。

6月1日星期一

AI HOT 精选

OpenBMB 放出两个开源数据集,预训练语料和 SFT 样本都给了,HuggingFace 趋势榜第一

OpenBMB 跟清华 NLP、Modelbest 一起发了两个数据集,都挂在 HuggingFace 上。一个是 Ultra-FineWeb-L3,给预训练用的合成数据,总量超过 600B token,其中英文 400B+、中文 200B+,是目前最大的开源中文预训练合成数据集。另一个是 UltraData-SFT-2605,给模型做指令微调用的,有...

推荐理由:我会先打个折:正文没披露数据质量评测、去重细节和许可证,所以没法判断实际可用度。但两个数据集的体量摆在那,600B+ tokens 的网页语料和 15M+ 条 SFT 样本,对做预训练和指令微调的人是实打实的弹药。冲上 HuggingFace 趋势榜说明社区有需求,不过这点先别太激动,热度不等于质量。整体看,这是一次对开源训练数据供给的补充,尤其对中文场景,值得关注但需要等后续评测。

r/LocalLLaMA

我在一张 RTX 3060 上给冻结的 1.4B Mamba 主干挂了 8 个推理专家臂,这是拆解报告

作者用一张 12GB 显存的 RTX 3060 训练了一个叫 Mamba-Titan-1.4B-Reasoning 的模型。做法是把一个 1.4B 参数的 Mamba-1 主干完全冻结,只在第 24、25 层外挂了 8 个可训练的专家臂,组成一个总参数量 2.54B 的混合专家模型,每次推理只激活其中 2 个专家。数学题准确率大概做到 50%。正文没披...

推荐理由:这是一篇 Reddit 个人实验帖,不是论文,也没有独立复现,所以我会先打个折。但它的价值在于把一次失败解剖写得清楚:在单张 RTX 3060 上,冻结 Mamba 主干、外挂 8 路 MoE 做推理,最后数学准确率卡在 50% 左右。正文没披露训练时长和具体数据集,这点信息有缺口。对想用消费级显卡折腾推理模型的从业者来说,这篇能省掉一次踩坑,属于低门槛、有参考意义的 featured 内容。

5月31日星期日

量子位 · 公众号

复旦和通义搞了个 ToolCUA,专门教 Agent 在屏幕上选对工具

现在给 Agent 塞一堆工具,它经常不知道该点哪个。复旦和通义实验室提出了一套叫 ToolCUA 的训练方法,核心是用约 4000 个合成工具和 18 万步的“屏幕操作+工具调用”交叉轨迹来训练模型。他们训出来的 ToolCUA-8B 在 OSWorld-MCP 基准上跑到了 46.85% 的准确率。不过正文因为微信环境验证没抓到,具体训练细节和对比...

推荐理由:这篇文章抓了一个实际工程里的矛盾:工具越多,Agent 越不会选。我会先打个折,46.85% 的准确率不算高,但考虑到是 4k 工具的环境,这个数字说明问题确实难。18 万步合成轨迹是亮点,意味着训练数据不用全人工标,成本上友好一些。正文没披露推理延迟和实际部署的资源消耗,这点先别太激动。整体是一篇有痛点的研究发布,不是大模型或产品级发布,所以放在 featured 里合适。

5月30日星期六

机器之心 · 公众号

港中文新优化器 Pion 在“等谱流形”上更新大模型,解决 AdamW 和 Muon 训练崩溃问题

香港中文大学等团队搞了个新优化器叫 Pion,核心思路是不动权重矩阵的奇异值,只在“等谱流形”上做正交等价变换来更新参数。他们拿一个 6000 万参数、没用归一化层的类 LLaMA 模型试跑,Pion 稳定训练了 96 亿个 token,而 AdamW 和 Muon 都崩出 NaN 了。正文没披露更大规模模型或具体下游任务上的效果,所以这点先别太激动,...

推荐理由:我会先打个折:这篇是优化器数学,不是产品发布,所以分数在 78–84 之间。但它的钩子很直接——AdamW 和 Muon 会训崩,而 Pion 用“在等谱流形上更新”这个思路稳住了。正文给了 60M 模型、9.6B token 的无归一化实验,证明能避免 NaN,这对做训练的人有实际参考价值。信息量够,痛点准,所以 HKR 全过。

5月29日星期五

AI HOT 精选

Adam's Law:用模型训练时见过的高频词写提示,效果更好

FaceMind 团队在 100 种语言和四类核心任务上做了实验,结论很简单:保持意思不变,把提示词或微调文本换成预训练语料里出现频率更高的说法,大模型的表现会明显提升。他们把这个规律叫 Adam's Law(文本频率定律),相当于给数据工程补上了“频率”这个维度。原理不复杂——高频表达让模型在自己最熟悉的概率空间里干活,输出质量自然更稳。不过正文没披...

推荐理由:我会先打个折:正文没披露具体用了哪些模型、数据集和效果提升的幅度,所以没法判断这个“更好”到底好多少、在什么规模的模型上成立。但选题本身很聪明,用 100 种语言和四类任务把“高频词有效”这个反直觉结论撑起来了,对天天调提示词的人来说是个值得自己复现一下的线索。

机器之心 · 公众号

马嘉祺让大模型翻车,背后是低频词退化问题,有人一年前洗澡时就发现了

文章页面被微信环境验证挡住了,正文内容没拿到。从现有标题和英文摘要看,讲的是 FaceMind 团队把大模型在“马嘉祺”这类低频词上翻车的现象,和两篇论文串了起来:一篇是 EMNLP 2025 的 SLoW,另一篇是刚被 ACL 2026 接收为 Oral 的 Adam's Law。摘要里还提到一个具体数字——用高频词改写的方法,把 DeepSeek-...

推荐理由:这篇文章把马嘉祺让大模型翻车这个意外事件,和低频 token 退化这个技术问题绑在一起讲,切入点很巧。它不光讲现象,还给出了两篇顶会论文的机制解释,以及 DeepSeek-V3 上 8 个百分点的准确率提升,对做模型评测和提示工程的人有直接参考价值。不是大模型发布那种重磅消息,但属于扎实的研究信号,值得放进精选。

5月28日星期四

量子位 · 公众号

DeepSeek V4 用上华为昇腾芯片做训练,国产算力生态开始跑通闭环

这篇文章本身因为微信环境验证失败,正文内容没抓到,只能根据标题和摘要信息来聊。标题里提到的“芯模协同”,指的是 DeepSeek V4 在训练时直接跟华为昇腾芯片做适配优化,不是先拿英伟达跑完再移植。摘要里说 CANN(华为的 AI 计算框架)一口气开源了 65 个代码仓库,并且支持 70 多个主流模型“开箱即用”,不用等适配。另外 AIGCode 在...

推荐理由:这条主要讲的是国产算力生态的进展,不是 DeepSeek V4 本身发了什么新能力。但里面给的仓库数、适配模型数、MFU 这些数字比较具体,比一般的合作通稿有信息量。我会先打个折,因为正文没披露 V4 在昇腾上的完整训练规模或成本对比,MFU 也只给了 AIGCode 一个点,验证还不够全。不过对关心国产替代进度的人来说,这几个数字已经够拿来判断方向了,所以放在 featured 里。

机器之心 · 公众号

国产预训练具身大模型 Wall-OSS-0.5 开源,宣称跳过微调也能直接干活

X Square Robot 开源了一个叫 Wall-OSS-0.5 的视觉-语言-动作模型,主打“预训练完就能用”。他们放出了 40 万步的预训练 checkpoint,在 17 个真实机器人零样本任务里,有 4 个成功率超过 80%。这次开源的东西挺全:权重、代码、训练配方、消融实验,还有一个叫 DMuon 的优化器实现。不过正文因为环境验证没抓到...

推荐理由:我会先打个折:X Square Robot 不是顶级基础模型实验室,所以重要性停在 79。但这条消息本身挺实在——Wall-OSS-0.5 直接开源了一个 400k 步的预训练 checkpoint,在 17 个真机零样本任务里跑了分,有 4 项超过 80 分。这意味着你不用非得花大量算力和时间做后训练,拿过来就能在部分任务上跑出不错的效果。当然,正文没披露这 4 项具体是什么任务、难度如何,也没说剩下 13 项的表现分布,所以“后训练不再是必选项”这个结论得看场景,别太激动。整体来说,对做具身智能又缺资源的团队是个值得看一眼的发布。

AI HOT 精选

英伟达开源 Polar 框架,不改代码就能让 Codex 跑分涨近 6 倍

英伟达搞了个叫 Polar 的开源框架,专门解决一个实际问题:怎么在不重写 Codex、Claude Code 这些现成代码工具的前提下,用强化学习(GRPO,一种让模型在多步任务里根据奖励信号自己学会更优操作的训练方法)去训练它们。Polar 的做法很取巧,它不碰工具本身的执行逻辑,而是在模型和工具之间的 API 接口上做文章,把对话记录、采样结果这...

推荐理由:英伟达开源 Polar,用 GRPO 训练小模型 Qwen3.5-4B,Codex 在 SWE-Bench Verified 上从 3.8% 冲到 26.4%,这个提升幅度在代码 agent 圈子里很能打。技术细节和基准分都给得清楚,属于扎实的研究开源项,不是大模型或产品发布,所以放在 featured 档、82 分合理。

r/LocalLLaMA

有人整理了一份1030亿token的Usenet语料,覆盖1980到2013年,全是真人发言、没有AI污染

一个叫OwnerByDane的用户放出了一套从Usenet新闻组扒下来的语料,总规模1031亿token,包含4.08亿条帖子,横跨18347个新闻组,时间从1980年一直拉到2013年。这套数据最大的卖点是“前互联网时代、纯人类产出、零AI生成内容”,对想避开模型训练数据被AI输出污染的开发者来说,算是个稀缺资源。目前可以免费下载每个新闻组层级500...

推荐理由:我会先打个折:这事目前只在 Reddit 上发酵,完整语料要授权才拿得到,也没有第三方验证或跑过 benchmark,所以分数没给更高。但它的卖点很硬——103B token 的纯人类对话,时间跨度 33 年,对做微调、研究语言演变或者想避开合成数据的人都有吸引力。样本已经挂在 Hugging Face 上,作者还拿它微调了 Gemma 模型,至少说明能用。这点先别太激动,但如果授权条款不苛刻,这个语料库的价值不小。

5月27日星期三

Mistral AI

Mistral 收购 Emmi AI,加码面向航空航天等行业的 Physics AI 基础研究

Mistral 收购 Emmi AI,以推进面向工业工程的 Physics AI 基础研究,重点覆盖航空航天、汽车、半导体和能源等行业。其已发布成果包括 AB-UPT,可在单张 GPU 上处理 9M 表面和 140M 体积网格的原始几何数据而无需重新划分网格,以及面向大型多物理过程的端到端深度学习代理模型 NeuralDEM。

机器之心 · 公众号

AMD 论文发现 FP4 训练不稳,锅不在随机性不够

AMD 和宾州州立大学用 MI355X 原生 FP4 硬件预训练了 Llama 3.1-8B,端到端速度比 FP8 基线快了 9-10%。但论文指出,Wgrad(权重梯度)量化是拖后腿的环节,导致每个 token 的计算开销额外增加 26-27%,而且用确定性 Hadamard 方法也稳不住。正文没披露最终模型的验证集效果对比,这点先别太激动。

推荐理由:我会先打个折:这是一篇偏训练基础设施的研究,不是通用大模型发布,所以分数不会给到顶。但它的钩子很锋利——直接挑战“FP4 不稳定是因为随机性不足”这个流行说法,并且给出了在 AMD 最新硬件上跑 Llama 3.1-8B 的实测数据。速度提升 9-10% 是实打实的,但 Wgrad 带来的 26-27% 额外开销也说明这条路还没完全走通,这点先别太激动。对关心训练成本和硬件选型的从业者来说,这篇值得一看。

AI HOT 精选

面壁智能开源 ForgeTrain,一个完全由 AI 写出来的模型训练框架,零人类代码

面壁智能、清华和 OpenBMB 开源了 ForgeTrain,一个完全由 AI 编写、没有人类代码介入的大模型训练框架。他们用这套框架在华为昇腾芯片上预训练了 MiniCPM5-1B,这个模型在 AA 榜单的 2B 参数以下级别里排到了第一。同时开源的还有制造 ForgeTrain 的 Agent Harness 工具链。正文没披露训练成本、耗时和具...

推荐理由:我会先打个折:这不是一个顶配模型发布,而是一个工具链层面的开源动作,所以给 80 分、放 featured 比较合适。故事的核心是“AI 造 AI”——面壁智能说 ForgeTrain 是全球第一个零人类代码介入的生产级训练框架,并且已经在华为昇腾上跑通了 MiniCPM5-1B 的预训练。对从业者来说,这比单纯刷榜有意思,因为它直接关系到训练流程能不能自动化、能不能省人力。不过正文没披露这套 AI 写的代码质量到底怎么样、训练出来的模型跟人手写的框架比有没有性能差距,这点先别太激动。整体看,H、K、R 三条都踩中了,是个扎实的工具链新闻。

AI HOT 精选

TRL 新增增量权重同步:只传模型变化的部分,每步传输量从 1.2GB 降到 20-35MB

异步强化学习训练有个很现实的问题:每一步训练器都得把整个模型发给推理引擎。一个 7B 模型用 bf16 格式就要传 14GB,换成万亿参数模型更是要传 TB 级别的数据。Hugging Face 团队发现,在两次优化步骤之间,大约 99% 的 bf16 权重其实完全没变,真正变动的部分很小。他们合入了 TRL 的一个 PR,做法是把变动的权重打包成稀疏...

推荐理由:Hugging Face 在 TRL 里合了一个增量权重同步的 PR,用稀疏 safetensors 只传变化的部分,Qwen3-0.6B 单步载荷从 1.2GB 降到 20–35MB。对经常做分布式微调的人来说,这个压缩比很实在,能省带宽、省时间。正文没提更大规模模型或跨节点同步的实测数据,所以“万亿参数”目前更像一个能力上限的表述,实际效果还得看后续验证。整体是训练基础设施层面的改进,对从业者有用,但还没到必须全员关注的程度。

5月26日星期二

AI HOT 精选

商汤把 SenseNova-U1 的训练代码全开源了,一个框架同时训生图、修图、交错生成和理解

OpenSenseNova 在 GitHub 上放出了 SenseNova-U1 的完整训练代码,用 Apache-2.0 协议。代码覆盖了 8B 稠密模型和 A3B MoE(混合专家)架构,在一个统一框架里支持四种多模态任务:文生图、图片编辑、图文交错生成,以及文本与视觉理解。工程上为大规模训练做了准备,支持混合并行、流式可恢复的数据管线、用环境变量...

推荐理由:这条消息的卖点是“完整训练代码开源”,不是常见的只放权重。8B 密集和 A3B MoE 两种模型规格都给了,Apache-2.0 协议也干净。不过正文没披露训练用了多少数据、多少算力,也没有任何评测结果,所以实际效果和训练成本现在没法判断。我会先打个折:代码开源本身值得关注,但别急着对标闭源模型,等社区跑出结果再说。

机器之心 · 公众号

xAI 解散但 Grok 没停,马斯克预告新模型

马斯克说,1.5 万亿参数的 Grok V9-Medium 已经训完了,过几天开始做强化学习,计划两到三周后发布。Grok Build 现在支持同时跑 8 个子代理,上下文窗口拉到 25.6 万 token,还加了计划模式、竞技场模式、MCP 和 ACP。不过正文因为微信环境验证失败,具体技术细节和评测数据都没披露,这些功能实际效果怎么样还得等实测。

推荐理由:这条消息的钩子在于 xAI 解散的传闻和 Grok 上新同时出现,戏剧性够。马斯克亲自预告 1.5T 参数的 Grok V9-Medium,还给了两到三周的发布窗口,对盯着模型竞赛的人是个明确的信号。Grok Build 那边放出的 8 个子智能体、256K 上下文、Plan Mode 和 Arena Mode,说明他们在把智能体往实际业务流程里塞,不是只发个 API 就完事。我会先打个折:模型刚训完还没进强化学习,没跑分没对比,性能完全未知,这点先别太激动。但整体信息密度和时效性都够,放在 featured 里合理,给 82 分。

r/LocalLLaMA

一位律师用 12 块 V100 显卡搭本地集群跑法律文书起草,Qwen3.5-122B 模型跑到约 50 token/秒

Reddit 上一位律师分享了自己用 12 块 32GB 显存的 SXM V100 显卡搭建本地 AI 集群的进展,专门用来起草法律文书。核心模型是 Qwen3.5-122B-A10B,在 4 块 V100 上推理速度大约 50 token/秒。这套流程里还加了一个“验证器”,会在最终文件使用前自动拦截没有真实来源的引用、日期和 Bates 编号(案件...

推荐理由:这是一篇来自Reddit的第一手实验记录,不是厂商通稿。律师自己攒16块V100跑Qwen 122B做法律文书,速度约50 tok/s,还加了引用和日期验证器来拦截幻觉,信息量扎实。我会先打个折:来源是个人帖子,权威性有限,所以放在featured低段而不是p1。但HKR三项全中——故事性强、有可复现数字、切中本地部署和合规痛点,对想自己动手的团队是个不错的参照。

5月25日星期一

r/LocalLLaMA

《金融时报》报道了去安全护栏工具 Heretic,称其 10 分钟内就能解除 Meta Llama 3.3 的限制

Reddit 用户分享了一篇《金融时报》的文章,主角是一个叫 Heretic 的工具。这个工具专门用来移除开源模型(比如 Meta 的 Llama 3.3)内置的安全护栏,让模型能回答原本被禁止的敏感问题。文章提到,Heretic 的创建者 Philipp Emanuel Weidmann 说,用这个工具不到 10 分钟就能搞定一个模型。目前他们已经生...

推荐理由:Financial Times 用 Heretic 这个工具演示了一把,10 分钟就把 Meta Llama 3.3 的安全限制给卸了。文章说这个工具已经生成了 3500 多个“去审查”模型,总下载量冲到 1300 万次,说明滥用门槛低得吓人。我会先打个折:目前看到的只是 Reddit 上的摘要,不是 FT 的完整报道,也没有可复现的测试记录,所以事实部分先信这么多。但即便只是摘要,这几个数字也足够让做模型安全的人心里一紧了。

5月24日星期日

r/LocalLLaMA

OpenBMB 在华为昇腾 NPU 上把大模型从头训成 1.58-bit,8B 模型性能保住全精度 97%

OpenBMB 放出了 BitCPM-CANN,一个在华为昇腾 NPU 上原生跑通的 1.58-bit(三值)大模型训练方案。他们用和 MiniCPM4 一样的架构与数据,从零训了 0.5B、1B、3B、8B 四个尺寸。1B 到 8B 的模型在 11 个测试集上平均保住了全精度模型 95.7% 到 97.2% 的性能,3B 版本在 BBH 上打平,3B...

推荐理由:我会先打个折:目前只有 Reddit 帖子作为来源,没有吞吐量、显存占用或复现细节,所以先放在 featured 的底线。但这条信息本身挺实在——OpenBMB 在昇腾 NPU 上从零训练了四个 1.58-bit 的模型,不是推理时量化,而是训练阶段就压到极低比特。1B 到 8B 的性能保留率都在 95% 以上,说明这条路在国产硬件上走得通。对需要控制训练成本、又绑在昇腾生态里的团队来说,这是个值得跟的信号。

机器之心 · 公众号

Meta 裁员后留下的员工被塞进新坑:技术经理回去写代码,AI 工程师转岗做数据标注

这篇文章讲的是 Meta 裁员后没走的人日子也不好过。公司开始把一些工程经理重新赶回一线写代码(IC 岗),同时把部分做基础设施和 AI 的工程师调去搞数据标注。文章提到一个关键数字:经理和下属的比例从以前的 1:8 直接拉到了 1:50,说明管理层被大幅压缩。另外还爆了个料,说 Meta 持有数据标注公司 Scale AI 49% 的股份,但正文没展...

推荐理由:这篇不是常规的裁员报道,而是抓了一个更具体的信号:幸存下来的工程师被塞进数据标注岗,工程经理退回一线写代码。我会先打个折,正文没披露转岗规模和持续时间,所以没法判断这是临时缓冲还是长期降级。但经理下属比从 1:8 拉到 1:50 这个数字,加上 Meta 是 Scale AI 大股东,让整件事看起来像在用内部人力对冲外包成本。对从业者来说,这比丢工作还难受——留下来了,干的活却更边缘。

5月23日星期六

Mistral AI

Mistral 收购 Physics AI 公司 Emmi AI

Mistral AI 宣布已达成收购 Physics AI 先驱 Emmi AI 的最终协议,以强化其作为工业企业 AI 转型伙伴的定位。Emmi AI 成立于奥地利,专注物理 AI 与大型工程模型,可加速工程工作流、以实时仿真替代多日计算并构建数字孪生。Emmi 的联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。

推荐理由:Mistral 通过收购 Physics AI 公司 Emmi 补强工业仿真能力,读者可了解其向工程与制造场景延伸的路径。

5月21日星期四

新智元 · 公众号

中科大两篇顶会论文:教多模态大模型持续学新知识,同时不忘旧本事

中科大团队在顶会上发了两篇工作,专门解决多模态大模型“学新忘旧”的问题。一篇是 MMEVOKE,搞了一个包含 159 个子类、9422 个样本的评测集,用来检验模型在持续学习中会不会把之前的知识覆盖掉。另一篇是 KORE,提出用知识树扩充样本,再通过零空间约束微调来减少遗忘。正文没披露具体性能数字和训练成本,但思路很明确:让模型像人一样,学了新东西还能...

推荐理由:HKR-K 和 HKR-R 都站得住:文章给出了数据集规模和具体的微调机制。不过这只是论文阶段的知识注入方案,没有生产环境的验证或完整的复现细节,所以先打个折,放在低 featured 档。

r/LocalLLaMA

HRM 1B:一个用极低成本训练的小模型,性能号称能打 2B-7B 的开源选手

Sapientinc 开源了一个叫 HRM-Text 1B Base 的小模型,连训练代码也一起放出来了。论文里的说法是,它的性能可以和 2B 到 7B 的开源模型掰手腕,但训练用的数据量只有别人的百分之一到九百分之一,算力消耗更是只有别人的 1/96 到 1/432。具体来说,用 16 块 H100 GPU 训练了大概 46 小时,总花费约 1,47...

推荐理由:HKR 三项都站得住:HRM-Text 1B 有具体的低成本训练数字和公开代码。卡在 80 分是因为消息源是 Reddit,效率提升的说法还没有独立评测背书,我会先打个折。

5月19日星期二

量子位 · 公众号

京东和中科院信工所连发三篇论文,提出让大模型“自己教自己”的强化学习路线

这篇推文本身因为环境异常没加载出正文,我只能根据标题和外部信息给你还原一下。京东和中科院信工所联合发了三篇论文,核心思路叫 Self-Taught RLVR,也就是让模型在强化学习里自己生成训练信号、自己教自己,省掉人工标注或外部奖励模型。其中一篇叫 RLSD 的工作,在 Qwen3-VL-8B-Instruct 上只训了 200 步,就在 8 个基准...

推荐理由:我会先打个折:这不是哪个大厂发了新模型,而是京东和中科院信工所连着放了三篇论文,把 Self-Taught RLVR 这条路线从不同角度拆了一遍。亮点在 RLSD,它让模型自己生成推理步骤、自己打分、自己迭代,200 步就超过 GRPO 跑 400 步,等于训练量砍半还能赢,对算力吃紧的团队是个好消息。不过正文没披露复现需要多少卡、数据怎么配,这点先别太激动。整体属于有干货、有对比、但热度还没起来的阶段,放 featured 低位合适。

机器之心 · 公众号

从卖 token 到背 KPI:AI 公司开始按结果收费了

这篇文章讲的是 AI 商业模式的一个转向:不再按调用次数或月费收钱,而是直接对业务结果负责。Sierra 今年 5 月拿了 9.5 亿美元,估值超过 150 亿,做的就是客服场景的“结果即服务”——你只为它成功解决的客诉买单。灵犀(Lingxi)则说自己在 2025 年已经实现规模化盈利和正向现金流,同样走按效果付费的路子。不过正文因为微信环境验证没加...

推荐理由:这篇文章抓了一个很具体的商业信号:AI公司开始不按token或订阅收钱,而是按业务结果收费。Sierra的融资规模和零犀的盈利时间点让这个模式有了可验证的案例,不是空谈。我会先打个折,正文没披露具体分成比例或客户续约率,但“让AI背KPI”这个角度本身对从业者判断产品定价和交付压力有帮助,所以给了featured。

AI HOT 精选

Cursor 发布 Composer 2.5,底层和 Kimi K2.5 同源,号称效率提升 10 倍

Cursor 把 Composer 模型升级到了 2.5,说它在处理长任务、理解复杂指令上比之前强了不少,同等能力下效率能高出 10 倍。这次升级主要靠三件事:训练规模更大、强化学习环境搞得更复杂,还加了一套文本反馈机制,让模型能根据文字反馈自己调整。底层架构跟 Moonshot 的 Kimi K2.5 是同一套。另外 Cursor 正跟 SpaceX...

推荐理由:Cursor 发了 Composer 2.5,说同等能力下效率能提 10 倍,还提到用了更大的训练规模、更复杂的强化学习环境和文本反馈来调模型。我会先打个折:10 倍这个数目前只有厂商自己说,正文没给基准测试、没给价格、也没法复现验证,所以别太激动。但如果是真的,对用 Cursor 写代码的人来说确实挺省钱省时间。这条消息来自单一社交来源,信息量够让从业者关注,但缺硬数据支撑,所以分数定在 82,放在 featured 里提醒大家留意后续实测。