紐約時報指控OpenAI藏證據

版權大戰再升級

2026-07-10 15:52

《紐約時報》和《每日新聞》在7月9日丟擲一記重錘:它們指控OpenAI在這樁跑了兩年的版權官司裡,就「能不能搜自己的訓練資料和聊天記錄」撒了謊。

紐約時報指控OpenAI藏證據
紐約時報指控OpenAI藏證據

整件事的由頭是這樣。OpenAI一直辯稱,自己沒有能力檢索龐大的訓練語料;又說要翻出並交出海量ChatGPT對話,技術上太重、還會觸碰使用者隱私。原告要這些資料,是想確認自家新聞有沒有進訓練集、ChatGPT又多頻繁地照搬輸出。

但在今年4月法院命令的 deposition 裡,OpenAI的資料隱私工程師Vinnie Monaco據稱承認了兩件事。其一,OpenAI其實早就在內部搜過訓練語料、評估過有沒有侵權新聞。其二,在《紐約時報》起訴之前,OpenAI就已經攢了一個約7800萬條去標識化ChatGPT對話的資料庫,專門用來判斷自己抄了多少;起訴後不久,又上了個叫「Project Giraffe」的工具集,裡面的「Bloom」過濾器專門記錄和留存輸出裡的「regurgitation(照搬)」。

更刺眼的是取證過程。原告本來要1.2億條聊天樣本,談判壓到2000萬;OpenAI去年12月交上去的版本,法院說因為遮得太狠「沒法用」。原告還主張OpenAI在起訴後刪了數十億條輸出、替換了數百萬條日誌,直接違反保全令。

現在原告請求法官制裁:不讓那2000萬樣本當證據、直接認定日誌會顯示大量照搬、不許OpenAI拿樣本辯解。OpenAI發言人Drew Pusateri全盤否認,反咬一口,說時報是案子走弱了才來侵犯無關使用者的隱私,「我們會繼續捍衛使用者隱私和早就立住的合理使用原則」。

這場仗,已經從「抄沒抄」打到了「取證公不公正」。