纽约时报指控OpenAI藏证据

版权大战再升级

2026-07-10 15:52

《纽约时报》和《每日新闻》在7月9日抛出一记重锤:它们指控OpenAI在这桩跑了两年的版权官司里,就「能不能搜自己的训练数据和聊天记录」撒了谎。

纽约时报指控OpenAI藏证据
纽约时报指控OpenAI藏证据

整件事的由头是这样。OpenAI一直辩称,自己没有能力检索庞大的训练语料;又说要翻出并交出海量ChatGPT对话,技术上太重、还会触碰用户隐私。原告要这些数据,是想确认自家新闻有没有进训练集、ChatGPT又多频繁地照搬输出。

但在今年4月法院命令的 deposition 里,OpenAI的数据隐私工程师Vinnie Monaco据称承认了两件事。其一,OpenAI其实早就在内部搜过训练语料、评估过有没有侵权新闻。其二,在《纽约时报》起诉之前,OpenAI就已经攒了一个约7800万条去标识化ChatGPT对话的数据库,专门用来判断自己抄了多少;起诉后不久,又上了个叫「Project Giraffe」的工具集,里面的「Bloom」过滤器专门记录和留存输出里的「regurgitation(照搬)」。

更刺眼的是取证过程。原告本来要1.2亿条聊天样本,谈判压到2000万;OpenAI去年12月交上去的版本,法院说因为遮得太狠「没法用」。原告还主张OpenAI在起诉后删了数十亿条输出、替换了数百万条日志,直接违反保全令。

现在原告请求法官制裁:不让那2000万样本当证据、直接认定日志会显示大量照搬、不许OpenAI拿样本辩解。OpenAI发言人Drew Pusateri全盘否认,反咬一口,说时报是案子走弱了才来侵犯无关用户的隐私,「我们会继续捍卫用户隐私和早就立住的合理使用原则」。

这场仗,已经从「抄没抄」打到了「取证公不公正」。