# 中国正用“符合主流价值观”的数据集，争夺全球AI训练语料的话语权

> 原标题：具有中国特色的AI数据：中国争夺人工智能时代话语权

- 来源：纽约时报中文网
- 发布时间：2026-08-17T05:37:01.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51366
- 原文：https://cn.nytimes.com/china/20260817/china-ai-data-chatbots/

## 摘要

中国国家数据局发了份蓝图，要在2028年底前在20多个领域做出“高质量”数据集，并打算开放给全球用。上海人工智能实验室已经在GitHub和Hugging Face上发布了“万卷”这类多语种数据集，覆盖历史、法律、医学，但要求内容对齐“中国主流价值观”。分析人士说这有两个目的：一是把发展中国家拉进中国的AI生态，二是补上中文训练数据的缺口——国内数据散落...

## 推荐理由

这篇NYT的深度稿把中国国家数据局的AI数据蓝图讲得很清楚，有具体项目、有时间表，不是通稿。它踩中了话语权、数据开放和价值观对齐这几个敏感点，对从业者判断合规风险和数据生态走向有直接参考价值。不过它偏政策和生态叙事，不是产品发布或技术突破，所以分数卡在78分这个区间。

## 锐评

这条新闻的核心不是技术突破，而是数据主权的争夺。中国国家数据局计划在2028年前做出覆盖20多个领域的“高质量”数据集并开放给全球，这更像是在AI基础设施层铺设一条“中国标准”的管道。上海AI实验室的“万卷”数据集已经上线GitHub和Hugging Face，覆盖多语种，但明确要求对齐“中国主流价值观”。这相当于在训练数据的源头就内置了叙事框架。

普林斯顿的研究提供了一个佐证：ChatGPT和Claude在回答中文政治问题时，回答会比英文版更偏向北京，原因很可能是中文训练数据高度依赖官方媒体。所以，中国的策略很清晰——既然美国模型也要来爬中文数据，不如自己直接提供“干净”的素材，既解决了国内数据孤岛导致的中文语料不足问题，又能把发展中国家拉进自己的AI生态。

不过，文章没给出这些数据集被海外开发者实际采用的比例，也没说“万卷”这类数据在模型训练中的权重有多大。如果只是放在网上但没人用，那象征意义就大于实际效果。另外，数据标注从“廉价手工”转向“专家型”的成本有多高，正文也没算账。
