五大出版机构及作家斯科特·图罗夫联合向Meta Platforms及其首席执行官马克·扎克伯格提起拟议的集体诉讼,指控该公司在未获授权的情况下,复制了数百万册受版权保护的书籍与学术文章,用于训练其Llama人工智能模型。
爱思唯尔、Cengage Learning、哈德逊图书集团、麦克米伦出版公司以及麦格劳-希尔教育于5月5日向美国纽约南区联邦地区法院提交诉状。图罗夫及其创立的S.C.R.I.B.E.公司同为原告。
原告方要求获得损害赔偿并申请禁令,以制止相关侵权行为。其诉求包括要求Meta销毁或停止持有未经授权使用受保护作品所生成的副本。该案目前仍处于拟议集体诉讼阶段,尚未获得法院认证。
Meta方面一直主张,使用受版权保护的材料训练人工智能系统受美国合理使用原则保护。该公司承诺将强力应诉,并援引以往法院判决,指出某些形式的AI训练可被视为转换性使用。
出版社指控使用盗版图书馆资源
诉状指控,Meta在开发Llama模型前,从在线盗版图书馆及其他未经授权渠道获取版权材料,包括通过种子文件下载。
出版商还指控Meta移除或无视材料附带的版权管理信息,且未寻求许可或与权利人协商。原告认为,Meta利用这些作品打造了具有商业价值的产品,直接与作者和出版商构成竞争。
扎克伯格在诉状中被列为个人被告。原告指控其明知并授权了关于获取和使用受版权保护训练材料的决策。相关指控尚待法院裁决。
此案是近期由作家、出版商、新闻机构、艺术家及其他创作者针对生成式AI开发企业提起的众多诉讼之一。核心争议在于:为模型训练而复制作品是否构成合理使用,以及当材料来源未经授权时,企业能否援引该免责条款。
训练数据集规模迅速扩张
随着科技企业竞相提升系统性能,训练顶级AI模型所用的数据规模急剧攀升。
Meta报告称,Llama 3.1的模型训练使用了超过15万亿个Token。2025年4月发布的Llama 4模型文档显示,其Scout和Maverick模型在预训练阶段使用了多达40万亿个Token。
中国开发者DeepSeek在训练DeepSeek-V2时使用了8.1万亿个Token,随后将DeepSeek-V3的总量提升至14.8万亿。Epoch AI的模型数据库同样记录到各大语言模型训练数据量的广泛攀升。
Token总数并不等同于实际使用的书籍、文章或其他文件的数量,也无法直接证明底层材料的获取是否合法。然而,这些数据直观反映了开发领先AI系统所需的数据集规模。
法院区分训练行为与数据获取
以往的判决虽为科技企业使用受版权作品进行AI训练提供了一定保护,但法院也根据作品的获取与存储方式划定了界限。
2025年6月,美国地区法官文斯·查布利亚在由喜剧演员莎拉·西尔弗曼及作家理查德·卡德雷与克里斯托弗·戈登等组成的作者群体提起的合理使用诉讼中,裁定Meta胜诉。
法官认为,原告未能向法院提供充分证据证明市场损害。但他强调,该判决范围有限,并未确立在所有情况下使用受版权材料训练AI均属合法。诉讼的其他争议仍在继续。
另一项针对Anthropic的诉讼也得出了类似区别。一名联邦法官裁定,使用书籍训练大型语言模型属于转换性使用,可能构成合理使用;但法院认为,在永久中央资料库中保留数百万份盗版副本则不受该原则保护。
随后Anthropic同意支付15亿美元,以和解涉及盗版副本的相关索赔。联邦法官于2026年7月20日正式批准该和解协议。
针对Meta的诉讼目前仍在曼哈顿联邦法院审理中。法院尚未就出版社的指控、Meta的合理使用抗辩,或该案能否代表更广泛的权利人群体推进集体诉讼作出裁决。
来源:美国出版商协会
编辑团队:The Nation
