# 五大出版商起诉 Meta，指控其训练 Llama 时逐字复制盗版书籍

> 原标题：Book publishers sue Meta over AI&#8217;s &#8216;word-for-word&#8217; copying

- 来源：The Verge · AI
- 发布时间：2026-05-05T16:52:38.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14533
- 原文：https://www.theverge.com/tech/924230/meta-publishers-lawsuit-ai-copyright

## 摘要

Macmillan、McGraw Hill 等五家出版商和作家 Scott Turow 把 Meta 告了，说它在训练 Llama 模型时，通过 LibGen、Anna’s Archive 和 Sci-Hub 这些盗版书库，大量复制了受版权保护的书籍和期刊文章。诉状里用了“逐字复制”这个说法，但正文没披露具体索赔金额和案件编号。

## 推荐理由

我会先打个折：正文没披露索赔金额和案件编号，所以没法判断规模有多大。但“逐字复制”这个说法很具体，不是泛泛的“风格相似”，对 Meta 来说比一般的训练数据争议更难撇清。诉状把 LibGen 这类盗版库直接点出来，等于把侵权链条画得很清楚，从业者看这个案子能感受到开源模型训练数据合规的雷区在哪。

## 锐评

Macmillan、McGraw Hill 等五家出版商和作家 Scott Turow 把 Meta 告了，核心指控是 Meta 训练 Llama 模型时，从 LibGen、Anna’s Archive 和 Sci-Hub 这三个盗版书库大量扒了受版权保护的书和期刊文章。诉状用了“逐字复制”这个说法，听起来很严重，但报道正文没披露具体是怎么证明“逐字”的，也没说索赔多少钱、案件编号是多少。

这事值得关注的点在于，它把 AI 训练数据的版权争议从新闻、图片延伸到了图书出版。出版商直接点名盗版来源，比泛泛说“用网上公开数据”更有针对性。但信息缺口也很明显：我们不知道 Meta 到底用了多少本书、模型输出里有没有真的复现原文段落，还是只是训练数据里有这些书。这些细节会直接影响官司的走向。

目前能确定的是诉讼已经提起，但离判决还远。如果后续有证据显示 Llama 确实能吐出大段原文，那对 Meta 会很不利；如果只是训练阶段用了盗版库但模型没记住原文，法律上怎么定性还是个未知数。
