AI巨头深陷模型蒸馏争议:自己爬遍全网,却告对手抄袭
当年默许爬数据的规则,如今反过来咬了自己一口
一场极具讽刺意味的争议正在 AI 圈发酵。Anthropic、OpenAI、谷歌这些顶尖玩家,长期奉行一套心照不宣的规则:互联网上的公开信息,可以合法拿来训练模型。内容创作者们抗议多年,却始终没什么办法阻止自己的原创被无偿抓取。
现在,风水轮流转了。这些巨头突然发现,自家砸下重金训出来的模型成果,正被竞争对手用「模型蒸馏」的手法低成本复制、大规模复用。于是新一轮的技术伦理和合规口水战被点燃。最讽刺的地方就在这里——这些控诉别人抄袭的公司,自己正是靠爬遍全网数据起家的。
所谓模型蒸馏,简单说就是用一个强模型的输出去训练另一个模型,等于把大模型的能力便宜地搬运过来。业内有人辩解,蒸馏和爬取数据在技术上有本质区别,但坦白讲,全球到现在也没就这两件事的合法性达成任何统一共识。一边是 Anthropic 公开指控对手窃取其训练成果,另一边是网站主们反过来起诉 AI 公司非法爬数据,两条战线同时开打。
这场拉锯暴露了 AI 行业最深的痛点:企业投入天量资金、人力和时间打磨模型,对手却能用成熟技术以极低成本复刻。技术专家说得很直白,这种猫鼠游戏很难有终局,因为信息一旦公开传播,就存在被二次拆解复用的可能。公平使用的边界到底划在哪,眼下是一笔算不清的糊涂账。
更微妙的是,这场争议还牵扯到 AI 行业的成本结构。如果蒸馏被判定为侵权,那些靠开源模型和蒸馏起家的中小玩家会瞬间失去弹药,行业门槛会被重新抬高,巨头的领先优势也就被制度性地保护起来。反过来,如果内容方在爬取官司里占了上风,那么训练数据的采购成本会大幅上升,最先扛不住的同样是资金不够雄厚的一批。无论哪个方向落地,都会重塑整个 AI 的竞争格局,这也是巨头们不惜撕破脸也要争的原因。
在我看来,这更像是整个行业在为早期的野蛮生长补课。当初默许无偿抓取全网数据,享受的是数据红利;如今被蒸馏反噬,尝到的是同一套逻辑的苦果。规则不可能只对自己有利、对别人无效。等这些官司真正打出几个标志性判例,AI 训练的数据伦理才可能被重新定价,而这一天,恐怕比模型迭代来得要慢得多。