时间:2026年9月19日,星期五
地点:美国纽约南区联邦法院(SDNY)
人物:OpenAI公司(被告)、美国作者公会等出版商和作家群体(原告)、美国治安法官Ona T. Wang
事件详情:《华尔街日报》周五报道,周四解封的法庭文件显示,OpenAI员工在内部通讯中曾讨论使用LibGen(Library Genesis)盗版书籍库训练早期GPT模型的细节,包括被命名为"excise-libgen"和"project-clear"的Slack频道。OpenAI最终在2022年ChatGPT发布前将"Books1"和"Books2"两个数据集删除,但内部留有大量关于该决定及其依据的通信。法官Ona T. Wang裁定OpenAI放弃相关律师-客户特权保护,须向原告律师交出相关内部通讯。
背景:OpenAI早在2018年就开始从LibGen下载盗版书籍,构建"Books1"和"Books2"两个核心训练数据集。2022年ChatGPT发布前,OpenAI将这两个数据集删除,原告作者公会及多家出版商2023年提起诉讼,索赔金额可能高达数十亿美元。Anthropic此前在类似案件(Bartz v. Anthropic)中被判支付15亿美元和解金,涉及约500万本盗版书籍。
影响:法官Wang要求OpenAI交出所有相关Slack频道通信、电子邮件,并要求其内部律师接受关于删除数据决策的取证。法律专家David Schultz指出,一旦通讯显示OpenAI存在故意侵权或销毁证据意图,最高可判每件作品15万美元法定赔偿(正常上限750美元)。如果法庭作出不利推断,陪审团可被引导假设OpenAI行为"故意"且"销毁证据",进而触发罚金甚至缺席判决。OpenAI可能面临数十亿美元的赔偿责任,对行业AI训练数据合规造成深远影响。
总结:OpenAI此次法律风险源自其内部对盗版数据来源的明示认知。从"excise-libgen"频道命名到删除决策的内部争议,Slack记录正在法庭上成为关键证据。该案是Anthropic 15亿美元和解后,又一家头部AI公司在版权诉讼中遭遇重大挫败,对整个AI行业的训练数据合规性敲响警钟。
参考来源:
1. 《华尔街日报》WSJ:https://www.wsj.com/tech/ai/sketchy-af-what-to-know-about-how-openai-staff-discussed-book-pirating-fdc788a1
2. Bloomberg Law:https://news.bloomberglaw.com/ip-law/openai-risks-billions-as-court-weighs-privilege-in-copyright-row
3. MLex:https://www.mlex.com/mlex/articles/2415060/openai-discussions-about-deleting-pirated-books-not-privileged-us-judge-rules
4. Reuters:https://www.reuters.com/legal/litigation/openai-new-york-times-case-tees-up-key-test-ai-training-under-copyright-law-2026-09-08/
5. AI For Lawyers:https://aiforlawyers.substack.com/p/how-openai-harmed-its-own-case
6. Sterne Kessler:https://www.sternekessler.com/news-insights/client-alerts/ip-hot-topic-privilege-preserved-openai-escapes-forced-disclosure-of-attorney-communications-in-major-copyright-fight/
7. Northeast Times:https://northeasttimes.com/2026/09/18/internal-documents-show-tech-executives-worried-artificial-intelligence-training/







