中国正用“符合主流价值观”的数据集,争夺全球AI训练语料的话语权
具有中国特色的AI数据:中国争夺人工智能时代话语权
中国国家数据局发了份蓝图,要在2028年底前在20多个领域做出“高质量”数据集,并打算开放给全球用。上海人工智能实验室已经在GitHub和Hugging Face上发布了“万卷”这类多语种数据集,覆盖历史、法律、医学,但要求内容对齐“中国主流价值观”。分析人士说这有两个目的:一是把发展中国家拉进中国的AI生态,二是补上中文训练数据的缺口——国内数据散落...
推荐理由:这篇NYT的深度稿把中国国家数据局的AI数据蓝图讲得很清楚,有具体项目、有时间表,不是通稿。它踩中了话语权、数据开放和价值观对齐这几个敏感点,对从业者判断合规风险和数据生态走向有直接参考价值。不过它偏政策和生态叙事,不是产品发布或技术突破,所以分数卡在78分这个区间。