时间:2026年9月26日
地点:英国牛津、美国加州OpenAI总部
人物:牛津大学博德利图书馆馆长Richard Ovenden、OpenAI首席运营官Brad Lightcap
事件详情:根据《卫报》依据信息自由法(FOI)获取的牛津内部会议纪要及文件,博德利图书馆数字化的古籍材料已被用于"填充OpenAI训练集"。然而牛津在2025年3月公开宣布与OpenAI五年合作时,仅提到利用OpenAI软件为图书馆藏品做数字化、便于研究者检索,并未提及将用于训练OpenAI模型。OpenAI发言人回应称,公司"很自豪"能够"确保当今的AI模型为未来保存世界的历史知识",并表示随着超过10亿人使用ChatGPT,确保模型"反映不同文化、历史与视角"至关重要。
背景:该合作是OpenAI NextGenAI计划的一部分,该计划向15所顶尖研究机构承诺投入5000万美元研究资金,牛津为英国唯一入选高校。博德利图书馆涵盖26家分支机构、馆藏1300万册文本,数字化对象包括1498年至1884年间的3500篇全球论文等此前未上网的公版材料。整个项目初始于2025年2月,原定6个月试点,主要涉及元数据创建、转录生成以及GLAM(美术馆、图书馆、档案馆、博物馆)领域AI工具基准测试。
影响:博德利治理委员会成员及工作人员在会议中表达了对合作的多重担忧,包括声誉风险、对大学环境承诺的影响以及训练AI的高能耗。牛津学者担忧AI输出内容的可信度、潜在版权侵权,以及对图书馆作为"可信知识机构"身份的冲击。该事件再次凸显AI训练数据来源透明度问题——高校与AI公司签订数据协议时,是否应明确披露训练用途引发广泛讨论。
总结:牛津博德利古籍被OpenAI用作训练集的消息曝光后,学术界对AI训练数据伦理与透明度提出新质疑。OpenAI强调"为未来保存历史知识"的使命,但图书馆工作人员对能源消耗和潜在版权风险表示担忧,反映出当前高校与AI公司在数据合作中"明面数字化、实质训练"的双轨现象仍缺乏统一规范。
参考来源:
1. https://www.theguardian.com/technology/2026/sep/26/oxford-university-bodleian-library-open-ai-chat-gpt
2. https://www.bbc.com/news/articles/cx2eqk46dkeo
3. https://www.ox.ac.uk/news/2025-09-19-oxford-becomes-first-uk-university-offer-chatgpt-edu-all-staff-and-students
4. https://www.thisisoxfordshire.co.uk/news/24984997.openai-university-oxford-partners-new-project/
5. https://fusionchat.ai/news/leading-the-way-oxford-university-libraries-embrace-ai-with-chatgpt-partnership
6. https://blogs.bodleian.ox.ac.uk/digital
7. https://www.conftool.org/fantastic-futures-2025/index.php?page=browseSessions&form_session=5&presentations=show







