跳到正文
r/LocalLLaMA

有人整理了一份1030亿token的Usenet语料,覆盖1980到2013年,全是真人发言、没有AI污染

I built a 103B-token Usenet corpus (1980–2013) — pre-web, human-only, zero AI contamination. Got strong traction on r/ML, thought this community would find it useful.

一个叫OwnerByDane的用户放出了一套从Usenet新闻组扒下来的语料,总规模1031亿token,包含4.08亿条帖子,横跨18347个新闻组,时间从1980年一直拉到2013年。这套数据最大的卖点是“前互联网时代、纯人类产出、零AI生成内容”,对想避开模型训练数据被AI输出污染的开发者来说,算是个稀缺资源。目前可以免费下载每个新闻组层级500...

推荐理由:我会先打个折:这事目前只在 Reddit 上发酵,完整语料要授权才拿得到,也没有第三方验证或跑过 benchmark,所以分数没给更高。但它的卖点很硬——103B token 的纯人类对话,时间跨度 33 年,对做微调、研究语言演变或者想避开合成数据的人都有吸引力。样本已经挂在 Hugging Face 上,作者还拿它微调了 Gemma 模型,至少说明能用。这点先别太激动,但如果授权条款不苛刻,这个语料库的价值不小。

读原文 ↗导出 Markdown