跳到正文
AI HOT 精选

OpenBMB 放出两个开源数据集,预训练语料和 SFT 样本都给了,HuggingFace 趋势榜第一

OpenBMB发布UltraData两大开源数据集,登顶HuggingFace趋势榜

OpenBMB 跟清华 NLP、Modelbest 一起发了两个数据集,都挂在 HuggingFace 上。一个是 Ultra-FineWeb-L3,给预训练用的合成数据,总量超过 600B token,其中英文 400B+、中文 200B+,是目前最大的开源中文预训练合成数据集。另一个是 UltraData-SFT-2605,给模型做指令微调用的,有...

推荐理由:我会先打个折:正文没披露数据质量评测、去重细节和许可证,所以没法判断实际可用度。但两个数据集的体量摆在那,600B+ tokens 的网页语料和 15M+ 条 SFT 样本,对做预训练和指令微调的人是实打实的弹药。冲上 HuggingFace 趋势榜说明社区有需求,不过这点先别太激动,热度不等于质量。整体看,这是一次对开源训练数据供给的补充,尤其对中文场景,值得关注但需要等后续评测。

读原文 ↗导出 Markdown