# OpenBMB 放出两个开源数据集，预训练语料和 SFT 样本都给了，HuggingFace 趋势榜第一

> 原标题：OpenBMB发布UltraData两大开源数据集，登顶HuggingFace趋势榜

- 来源：AI HOT 精选
- 发布时间：2026-06-01T13:01:24.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/31612
- 原文：https://x.com/OpenBMB/status/2061432928492810535

## 摘要

OpenBMB 跟清华 NLP、Modelbest 一起发了两个数据集，都挂在 HuggingFace 上。一个是 Ultra-FineWeb-L3，给预训练用的合成数据，总量超过 600B token，其中英文 400B+、中文 200B+，是目前最大的开源中文预训练合成数据集。另一个是 UltraData-SFT-2605，给模型做指令微调用的，有...

## 推荐理由

我会先打个折：正文没披露数据质量评测、去重细节和许可证，所以没法判断实际可用度。但两个数据集的体量摆在那，600B+ tokens 的网页语料和 15M+ 条 SFT 样本，对做预训练和指令微调的人是实打实的弹药。冲上 HuggingFace 趋势榜说明社区有需求，不过这点先别太激动，热度不等于质量。整体看，这是一次对开源训练数据供给的补充，尤其对中文场景，值得关注但需要等后续评测。

## 锐评

OpenBMB 联合清华 NLP 和 Modelbest 放出了两个数据集，都挂在 HuggingFace 上，直接冲上趋势榜。一个是 Ultra-FineWeb-L3，给预训练用的合成数据，总量超过 600B token，其中中文 200B+，是目前最大的开源中文预训练合成数据集。另一个是 UltraData-SFT-2605，给模型做指令微调用，1500 万条样本，标注了“思考”和“非思考”标签，覆盖数学、代码、知识和指令遵循，是国内首个开源的大规模 SFT 数据集。

这两个数据集都基于他们自己的 UltraData L0-L4 框架构建，并在 MiniCPM5-1B 上做了训练验证。但正文没披露在更大规模模型上的验证结果，也没给出具体评测基准和分数。1B 小模型能跑通，不代表 7B、13B 甚至更大模型上效果能线性放大。另外，合成数据的质量高度依赖生成流程和清洗策略，这部分细节正文也没展开。

如果是真的省钱——用合成数据替代人工标注和爬取清洗，对预算有限的团队是好事。但“最大”不等于“最好”，中文合成数据的多样性和事实准确性还需要更多第三方验证。建议先拿自己任务试几轮，别直接当生产数据全量灌进去。
