AI巨頭深陷模型蒸餾爭議:自己爬遍全網,卻告對手抄襲

當年默許爬資料的規則,如今反過來咬了自己一口

2026-07-13 10:04

一場極具諷刺意味的爭議正在 AI 圈發酵。Anthropic、OpenAI、谷歌這些頂尖玩家,長期奉行一套心照不宣的規則:網際網路上的公開資訊,可以合法拿來訓練模型。內容創作者們抗議多年,卻始終沒什麼辦法阻止自己的原創被無償抓取。

現在,風水輪流轉了。這些巨頭突然發現,自家砸下重金訓出來的模型成果,正被競爭對手用「模型蒸餾」的手法低成本複製、大規模複用。於是新一輪的技術倫理和合規口水戰被點燃。最諷刺的地方就在這裡——這些控訴別人抄襲的公司,自己正是靠爬遍全網資料起家的

所謂模型蒸餾,簡單說就是用一個強模型的輸出去訓練另一個模型,等於把大模型的能力便宜地搬運過來。業內有人辯解,蒸餾和爬取資料在技術上有本質區別,但坦白講,全球到現在也沒就這兩件事的合法性達成任何統一共識。一邊是 Anthropic 公開指控對手竊取其訓練成果,另一邊是網站主們反過來起訴 AI 公司非法爬資料,兩條戰線同時開打。

這場拉鋸暴露了 AI 行業最深的痛點:企業投入天量資金、人力和時間打磨模型,對手卻能用成熟技術以極低成本復刻。技術專家說得很直白,這種貓鼠遊戲很難有終局,因為資訊一旦公開傳播,就存在被二次拆解複用的可能。公平使用的邊界到底劃在哪,眼下是一筆算不清的糊塗賬

更微妙的是,這場爭議還牽扯到 AI 行業的成本結構。如果蒸餾被判定為侵權,那些靠開源模型和蒸餾起家的中小玩家會瞬間失去彈藥,行業門檻會被重新抬高,巨頭的領先優勢也就被制度性地保護起來。反過來,如果內容方在爬取官司裡佔了上風,那麼訓練資料的採購成本會大幅上升,最先扛不住的同樣是資金不夠雄厚的一批。無論哪個方向落地,都會重塑整個 AI 的競爭格局,這也是巨頭們不惜撕破臉也要爭的原因。

在我看來,這更像是整個行業在為早期的野蠻生長補課。當初默許無償抓取全網資料,享受的是資料紅利;如今被蒸餾反噬,嚐到的是同一套邏輯的苦果。規則不可能只對自己有利、對別人無效。等這些官司真正打出幾個標誌性判例,AI 訓練的資料倫理才可能被重新定價,而這一天,恐怕比模型迭代來得要慢得多。