# TRL 新增增量权重同步：只传模型变化的部分，每步传输量从 1.2GB 降到 20-35MB

> 原标题：通过万亿参数与 Hub Bucket 实现增量权重同步：TRL 中的增量权重同步

- 来源：AI HOT 精选
- 发布时间：2026-05-27T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/28735
- 原文：https://huggingface.co/blog/delta-weight-sync

## 摘要

异步强化学习训练有个很现实的问题：每一步训练器都得把整个模型发给推理引擎。一个 7B 模型用 bf16 格式就要传 14GB，换成万亿参数模型更是要传 TB 级别的数据。Hugging Face 团队发现，在两次优化步骤之间，大约 99% 的 bf16 权重其实完全没变，真正变动的部分很小。他们合入了 TRL 的一个 PR，做法是把变动的权重打包成稀疏...

## 推荐理由

Hugging Face 在 TRL 里合了一个增量权重同步的 PR，用稀疏 safetensors 只传变化的部分，Qwen3-0.6B 单步载荷从 1.2GB 降到 20–35MB。对经常做分布式微调的人来说，这个压缩比很实在，能省带宽、省时间。正文没提更大规模模型或跨节点同步的实测数据，所以“万亿参数”目前更像一个能力上限的表述，实际效果还得看后续验证。整体是训练基础设施层面的改进，对从业者有用，但还没到必须全员关注的程度。

## 锐评

异步强化学习训练一直有个头疼的问题：训练器每更新一步，都得把整个模型重新发给推理引擎。一个 7B 模型用 bf16 格式就要传 14GB，换成万亿参数模型直接上 TB 级别，网络带宽根本扛不住。

Hugging Face 团队发现，两次优化步骤之间，大约 99% 的 bf16 权重其实纹丝不动，真正变动的部分很小。他们合入 TRL 的 PR 5417 就是利用这个特点，只把变动的权重打包成稀疏格式的 safetensors 文件，通过 Hugging Face Bucket 来中转。在 Qwen3-0.6B 上实测，每步传输量从 1.2GB 降到了 20-35MB，省了超过 97% 的流量。

这个方案目前依赖 Hugging Face 自家的 Bucket 存储做中转，不是点对点直传，延迟和外部依赖会多一层。正文没披露在更大规模模型（比如 70B 以上）上的实测数据，也没提多节点并发同步时的瓶颈在哪。如果是真的能在万亿参数规模上稳定跑，那确实省钱，但这点先别太激动，等社区复现再说。
