时间:2026年9月17日(美东时间)
地点:美国纽约市曼哈顿联邦法院
人物:微软应用科学总监 Brent Hecht、微软 CEO Satya Nadella、OpenAI 总裁 Greg Brockman、OpenAI ChatGPT 负责人 Nick Turley、《纽约时报》诉讼代理团队
事件详情:纽约时报诉 OpenAI 与微软版权案披露的新一轮未删节法庭文件显示,微软高管 Brent Hecht 在 2023 年 1 月的一份内部备忘录中,将 AI 训练行为定性为"惊人规模、前所未有的窃取",并称为"人类历史上最大规模的劳动窃取"。文件同时显示,OpenAI 总裁 Greg Brockman 在员工报告存在绕过《纽约时报》付费墙的"黑客手段"时回复"啊不错"。微软内部数据还显示其 Copilot 答案引擎使时报网站相对必应搜索的点击率最高下降 93%,应用科学总监 Hecht 在 2024 年 1 月的内部演示中将这一恶性循环描述为"末日循环"。
背景:《纽约时报》于 2023 年 12 月起诉 OpenAI 与微软,指控其未经授权使用时报内容训练生成式 AI 模型,索赔金额高达数十亿美元。该案是 AI 行业最具代表性的版权诉讼之一。9 月初,美国政府曾提交支持 OpenAI 的法律意见书,主张训练构成合理使用。本次解封的新材料则与合理使用抗辩形成直接冲突。
影响:解封文件首次系统披露 OpenAI 中等规模训练数据集中包含《纽约时报》《每日新闻》《调查报告中心》三家出版商逾 91692 篇文章副本,从 Common Crawl 派生的数据集收录逾 200 万份 nytimes.com 文档;Project Mango 数据集包含至少 160903 件独立新闻作品。微软 CEO Nadella 在证词中承认,若事先知情 OpenAI 爬取付费墙内容训练模型,他将行使权利要求重新训练。这些内部承认可能动摇合理使用抗辩中关于"不替代原作品市场"的核心要件,并影响全球 AI 公司与出版商之间的版权授权与分成模式。
总结:本次解封文件把 AI 公司内部对训练数据来源的态度从"合理使用"转向"窃取劳动",标志着 AI 版权博弈进入新阶段,对全球大模型训练数据的合规获取路径将产生深远影响。
参考来源:
- TechCrunch: https://techcrunch.com/2026/09/17/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-new-unredacted-filings-reveal/
- Ars Technica: https://arstechnica.com/tech-policy/2026/09/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history/
- AGI Hunt: https://agihunt.info/en/p/1a0b0f155f8f1a724f10d3d1b52
- AIDirectory: https://aidirectory.com/news/court-filings-microsoft-exec-ai-scraping-theft
- GoKawiil: https://gokawiil.com/article/344896
- Research.io: https://research.io/rss/article/cd33e69f-1e50-4d3b-a42e-966647acceeb/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-ne







