多家國際出版商起訴谷歌Gemini AI版權侵權,指控大規模系統性盜用

訓練資料合法性再陷爭議

2026-07-15 20:53

AI訓練資料的版權邊界問題,又一次被推到了法庭上。7月15日,Hachette、Cengage、Elsevier等多家國際知名出版商聯合對谷歌提起訴訟,指控其Gemini AI模型在未經版權持有人授權的情況下,將大量受版權保護的書籍、學術論文和期刊內容納入訓練資料集。

原告的訴求很直接:要求谷歌立即停止使用這些受保護內容,並賠償經濟損失。這不是孤立的個案,而是出版商針對AI公司發起的一系列版權訴訟中的最新一例。在此之前,《紐約時報》起訴OpenAI的案件仍在審理中,多家圖片版權機構也對Stability AI等文生圖公司提起了集體訴訟。

這場訴訟的核心爭議並不新鮮,但殺傷力可能比以往更大。因為谷歌不同於純粹的AI初創公司——它同時運營著全球最大的搜尋引擎、最大的數字廣告系統和最大的學術內容聚合平臺Google Scholar。出版商指控谷歌「系統性」地將受版權保護的學術和出版內容納入訓練集,意味著谷歌在AI訓練資料的獲取上可能利用了自身在搜尋和學術領域的事實壟斷地位。

這事遠沒有表面上看起來那麼簡單。如果法院支援出版商的訴求,整個AI行業的訓練資料合法性都將面臨根本性質疑。過去幾年,幾乎所有主流大模型都透過大規模網路爬取來構建訓練資料集,版權方默許或單方面主張權利已成行業常態。但如果法律明確要求每篇論文、每本書都需要單獨授權才能用於訓練,現有大模型的訓練方式將需要徹底重構。

反過來看,谷歌的防禦邏輯也並不弱。公司很可能主張合理使用原則——就像搜尋引擎爬取網頁摘要並不構成侵權一樣,AI模型從公開內容中「學習」模式和規律,也不應被視為複製或發行受保護作品。這一論點在2015年的Authors Guild訴Google Books案中曾獲得法院支援,谷歌當時成功主張了圖書掃描專案屬於合理使用。

有趣的是,就在同一周,多家執法機構和天主教領袖聯合反對CLARITY Act,理由是該法案對加密行業的反洗錢保護力度不夠。版權和技術監管這兩個看似無關的戰場,其實都指向同一個問題:當技術突破跑在了法律前面,舊規則是否還適用? 答案不同,但焦慮是相通的。

對普通讀者來說,這起訴訟最值得關注的結果不在於誰贏誰輸,而在於它可能會催生一套明確的「AI訓練資料定價機制」。如果法院最終要求AI公司為訓練資料付費,那麼版權持有者將獲得一個新的收入來源——這種可能性已經在推動大量版權方提前佈局,比如Reddit和Stack Overflow已經與多家AI公司簽訂了資料授權協議。

官司可能要打上好幾年,但「資料即資產」這個認知,已經被徹底焊死了。