多家国际出版商起诉谷歌Gemini AI版权侵权,指控大规模系统性盗用
训练数据合法性再陷争议
AI训练数据的版权边界问题,又一次被推到了法庭上。7月15日,Hachette、Cengage、Elsevier等多家国际知名出版商联合对谷歌提起诉讼,指控其Gemini AI模型在未经版权持有人授权的情况下,将大量受版权保护的书籍、学术论文和期刊内容纳入训练数据集。
原告的诉求很直接:要求谷歌立即停止使用这些受保护内容,并赔偿经济损失。这不是孤立的个案,而是出版商针对AI公司发起的一系列版权诉讼中的最新一例。在此之前,《纽约时报》起诉OpenAI的案件仍在审理中,多家图片版权机构也对Stability AI等文生图公司提起了集体诉讼。
这场诉讼的核心争议并不新鲜,但杀伤力可能比以往更大。因为谷歌不同于纯粹的AI初创公司——它同时运营着全球最大的搜索引擎、最大的数字广告系统和最大的学术内容聚合平台Google Scholar。出版商指控谷歌「系统性」地将受版权保护的学术和出版内容纳入训练集,意味着谷歌在AI训练数据的获取上可能利用了自身在搜索和学术领域的事实垄断地位。
这事远没有表面上看起来那么简单。如果法院支持出版商的诉求,整个AI行业的训练数据合法性都将面临根本性质疑。过去几年,几乎所有主流大模型都通过大规模网络爬取来构建训练数据集,版权方默许或单方面主张权利已成行业常态。但如果法律明确要求每篇论文、每本书都需要单独授权才能用于训练,现有大模型的训练方式将需要彻底重构。
反过来看,谷歌的防御逻辑也并不弱。公司很可能主张合理使用原则——就像搜索引擎爬取网页摘要并不构成侵权一样,AI模型从公开内容中「学习」模式和规律,也不应被视为复制或发行受保护作品。这一论点在2015年的Authors Guild诉Google Books案中曾获得法院支持,谷歌当时成功主张了图书扫描项目属于合理使用。
有趣的是,就在同一周,多家执法机构和天主教领袖联合反对CLARITY Act,理由是该法案对加密行业的反洗钱保护力度不够。版权和技术监管这两个看似无关的战场,其实都指向同一个问题:当技术突破跑在了法律前面,旧规则是否还适用? 答案不同,但焦虑是相通的。
对普通读者来说,这起诉讼最值得关注的结果不在于谁赢谁输,而在于它可能会催生一套明确的「AI训练数据定价机制」。如果法院最终要求AI公司为训练数据付费,那么版权持有者将获得一个新的收入来源——这种可能性已经在推动大量版权方提前布局,比如Reddit和Stack Overflow已经与多家AI公司签订了数据授权协议。
官司可能要打上好几年,但「数据即资产」这个认知,已经被彻底焊死了。