# 有人整理了一份1030亿token的Usenet语料，覆盖1980到2013年，全是真人发言、没有AI污染

> 原标题：I built a 103B-token Usenet corpus (1980–2013) — pre-web, human-only, zero AI contamination. Got strong traction on r/ML, thought this community would find it useful.

- 来源：r/LocalLLaMA
- 发布时间：2026-05-27T20:23:41.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/28798
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tphhqk/i_built_a_103btoken_usenet_corpus_19802013_preweb/

## 摘要

一个叫OwnerByDane的用户放出了一套从Usenet新闻组扒下来的语料，总规模1031亿token，包含4.08亿条帖子，横跨18347个新闻组，时间从1980年一直拉到2013年。这套数据最大的卖点是“前互联网时代、纯人类产出、零AI生成内容”，对想避开模型训练数据被AI输出污染的开发者来说，算是个稀缺资源。目前可以免费下载每个新闻组层级500...

## 推荐理由

我会先打个折：这事目前只在 Reddit 上发酵，完整语料要授权才拿得到，也没有第三方验证或跑过 benchmark，所以分数没给更高。但它的卖点很硬——103B token 的纯人类对话，时间跨度 33 年，对做微调、研究语言演变或者想避开合成数据的人都有吸引力。样本已经挂在 Hugging Face 上，作者还拿它微调了 Gemma 模型，至少说明能用。这点先别太激动，但如果授权条款不苛刻，这个语料库的价值不小。

## 锐评

OwnerByDane放出的这套Usenet语料，核心卖点就一个：干净。1031亿token、4.08亿条帖子，时间跨度从1980年到2013年，正好卡在互联网大规模普及和AI生成内容泛滥之前。对现在被合成数据污染搞怕了的模型训练者来说，这种“纯人类产出”的文本确实有吸引力，尤其适合做基座模型的预训练或者风格微调。

目前每个新闻组层级可以免费下载500条帖子的样本，完整语料需要单独谈授权。但发布帖里没讲清楚几个关键点：去重做到什么程度、有没有过滤掉垃圾广告和重复灌水帖、不同新闻组之间的质量差异有多大。Usenet本身鱼龙混杂，有些组讨论质量很高，有些就是纯吵架，不处理干净直接喂给模型，效果会打折扣。另外1031亿token放在今天不算特别大，大概相当于几套高质量书籍语料的量级，能起多大作用还得看具体怎么用。

如果后续能补上数据处理流程的说明，这套语料的价值会更明确。
