五大出版商起诉 Meta,指控其训练 Llama 时逐字复制盗版书籍
Book publishers sue Meta over AI’s ‘word-for-word’ copying
Macmillan、McGraw Hill 等五家出版商和作家 Scott Turow 把 Meta 告了,说它在训练 Llama 模型时,通过 LibGen、Anna’s Archive 和 Sci-Hub 这些盗版书库,大量复制了受版权保护的书籍和期刊文章。诉状里用了“逐字复制”这个说法,但正文没披露具体索赔金额和案件编号。
推荐理由:我会先打个折:正文没披露索赔金额和案件编号,所以没法判断规模有多大。但“逐字复制”这个说法很具体,不是泛泛的“风格相似”,对 Meta 来说比一般的训练数据争议更难撇清。诉状把 LibGen 这类盗版库直接点出来,等于把侵权链条画得很清楚,从业者看这个案子能感受到开源模型训练数据合规的雷区在哪。