牛津将800年典籍喂给OpenAI,新闻稿里只字未提

2026.09.26 20:34
牛津大学与OpenAI达成五年合作,将博德利图书馆超过1400万册历史文献大规模数字化。截至2025年6月,12.5万份学位论文和1万首16世纪民谣已被用于AI训练,而这一用途在最初的公告中完全未被提及。通过《卫报》获取的内部会议纪要显示,牛津校方成员对声誉风险和环保矛盾表达了明确担忧——这也引发了更深的追问:当AI公司把触角伸向图书馆的灰尘时,学术机构究竟是在守护知识,还是在充当数据供应商?

2025年3月,牛津大学向全世界宣布了一项合作:OpenAI将帮助博德利图书馆大规模数字化历史文献。新闻稿用了大量美好的词汇,开放、可访问、造福全球研究者。但有一件事,新闻稿没有说。

那些被扫描进电脑的古籍和论文,最终流向了哪里?

答案是OpenAI的训练数据集。

一座千年图书馆,变成AI的粮仓

博德利图书馆是欧洲最古老的图书馆之一,1602年由托马斯·博德利爵士创立,藏书超过1400万册,规模在英国仅次于大英图书馆。2025年2月,博德利启动了一项数字化试点项目,研究如何大规模扫描馆藏。OpenAI为该项目提供了资金,作为双方五年合作的一部分,也作为OpenAI“NextGenAI”联盟的组成部分。

按照牛津大学2025年3月4日的官方公告,首批被数字化的馆藏包括3500份全球学位论文,时间跨度从1498年到1884年。公告称,这些此前无法在线获取的古籍将变得“可供全球学生和研究人员检索和访问”。

这句话每个字都对。但它没说完整。

根据《卫报》通过信息自由法获得的牛津大学内部会议纪要,博德利图书馆委员会成员曾对与OpenAI合作可能带来的声誉风险表示担忧,也忧虑这项合作对牛津大学自身环保承诺的影响,因为AI训练是众所周知的能源密集型活动。而更关键的是,内部文件显示,被数字化的博德利馆藏资料已被用于“填充OpenAI的训练集”。

截至2025年6月,约12.5万张历史学位论文的扫描图像已被提供给OpenAI,这批文献主要为19至20世纪欧美大学的博士论文。除此之外,扫描范围还覆盖了1万首16世纪的“宽边民谣”,这些包含歌词和乐谱的印刷品曾经在都铎王朝的街头巷尾传唱。工作人员还在讨论继续数字化18世纪爱尔兰国家文件、爱尔兰小说家玛丽亚·埃奇沃思的私人信件,以及诺贝尔奖得主多萝西·霍奇金的青霉素实验笔记。而这还只是开始。

牛津与OpenAI的五年合作框架远不止“帮图书馆扫描古籍”。牛津大学加入了OpenAI的NextGenAI联盟,一个由OpenAI承诺出资5000万美元、涵盖15所顶尖研究机构的合作项目。作为回报,牛津师生获得了ChatGPT Edu的访问权限(从500人试点扩展到3000名教职员工),研究人员可申请OpenAI的研究资助和最新模型访问权(包括o1和4o)。博德利图书馆的数字化项目只是整个合作的一个“工作流”。

整个安排中最微妙的,是沟通的透明度。牛津大学3月4日的新闻稿描述数字化项目时,使用的措辞是“这些此前无法在线获取的馆藏,将变得可供全球学生和研究人员检索和访问”。没有任何一处明确说明,这些数字化资料也将用于训练OpenAI的大语言模型。

这恰恰是引发争议的核心。

法律上的安全区,信任上的雷区

从法律角度看,牛津的立场是站得住脚的。校方强调,提供给OpenAI的所有材料均为公版作品,已超过版权保护期。使用权是非排他性的,其他公司同样可以获取相同的公版文献。对于正面临多起版权诉讼的OpenAI来说,这是条干净的路子。近年来,作家、视觉艺术家和《纽约时报》等新闻机构相继起诉OpenAI,指控其在未获授权的情况下使用受版权保护的材料训练AI。选择与大学图书馆合作、只使用公版文献,是一条明智的避险航线。

但法律上的干净不等于沟通上的妥当。

如果数字化文献的训练用途从一开始就光明正大,为什么不在新闻稿中写清楚?对于一所拥有800年学术传承的大学来说,合作伙伴选择的透明度与选择本身一样重要。博德利图书馆委员会的顾虑正在于此。

与一家被多家版权方起诉的AI公司深度绑定,可能损害牛津的学术声誉。委员会的另一个担忧更加隐蔽:AI训练的能源消耗与牛津大学自身的环保承诺之间,是否存在不可调和的矛盾?

AI公司为什么盯上了图书馆

OpenAI对博德利图书馆的兴趣绝非孤例。2025年,OpenAI与哈佛大学图书馆达成合作,扫描约100万册公版图书用于AI训练,微软也参与了这项合作。波士顿公共图书馆、加州理工学院、麻省理工、密歇根大学,名单越来越长。这些合作大多通过NextGenAI联盟连接在一起,牛津是其中唯一的英国成员。

驱动这一趋势的,是AI行业正在面临的一场“数据饥荒”。

过去几年,大语言模型的主要训练数据来自互联网爬取。但随着AI生成内容越来越多地涌入网络,爬取数据的质量在急剧下降。AI公司称之为“数据污染”,模型生成的文本被其他模型爬走当训练数据,导致模型能力退化、输出趋同,甚至出现“模型近亲繁殖”效应。与此同时,版权诉讼的风险在不断堆积。2023年以来,多方版权方相继提起诉讼,法律边界至今不清晰。

在这种双重挤压之下,大学图书馆的历史文献成了一个诱人的替代方案。它们的优势相当独特。版权干净,数百年前的文献早已进入公共领域,不存在版权纠纷。文本质量高,学术论文和正式出版物经过同行评审和编辑校对,语言质量远高于互联网论坛的噪音文本。内容稀缺,这些文献此前未被大规模数字化,对AI模型来说是新鲜数据,而非已被重复爬取的内容。

《财富》杂志援引哈佛大学图书馆创新实验室的评论指出,大学图书馆的藏书中只有不到一半是英文文献,其余涵盖德语、法语、意大利语、西班牙语、拉丁语等多种语言。这种语言多样性对AI公司极具价值,因为当前AI模型在非英语语言上的表现仍远低于英语。

但硬币有另一面。哈佛图书馆创新实验室协调人克里斯蒂·穆克坦言:“当你处理如此大规模的数据集时,总会遇到有害内容和语言的棘手问题。”19世纪的学术文献中包含大量已被现代科学推翻的理论、种族主义叙事和殖民主义观点。一旦被AI模型吸收并作为训练数据,这些“知识化石”可能以模型偏见的形式复活。

从二手书到图书馆:AI数据采集的物理化转向

牛津只是这场更大运动中的一个节点。

2025年8月,《卫报》曾报道过一个奇特的新闻。二手书商发现,一些极为冷门的学术著作,比如一本关于18世纪非洲农具的指南,或1950年代赛车手的传记,突然被批量订购。书商们推测,这些订单来自AI公司,因为这类书籍在网络上几乎没有数字化版本,恰好是AI训练所需的“新鲜数据”。

从线下批量采购二手书,到与大学图书馆合作数字化历史文献,再到爬取互联网上海量的AI生成内容,AI公司的数据采集策略正在经历一场从“粗放”到“精细化”的转变。互联网的“低垂之果”已被摘尽,剩下的果实隐藏在图书馆的灰尘中、二手书店的货架上、以及档案馆的卡片目录里。

OpenAI与牛津的合作,是这个趋势最具象征意义的注脚。它意味着AI训练数据的争夺已经从互联网扩展到物理世界,从消费者的数字足迹扩展到人类数百年积累的文明遗产。

从牛津的角度看,这笔交易的逻辑是清晰的。OpenAI提供资金和技术,帮助博德利图书馆实现一个困扰了图书馆界几十年的目标,大规模数字化。牛津大学图书馆馆长理查德·奥文登在声明中表示:“博德利的使命是获取、保存和提供知识。几个世纪以来,我们不断寻找新的方式推进这一使命。”数字化是这一使命在21世纪的必然延伸,而OpenAI提供了实现它的资源。

更何况,牛津并非将馆藏数据独家授权给OpenAI。校方强调,数字化后的文献也将向公众开放。从信息开放的角度看,这似乎是一个双赢,OpenAI获得了训练数据,公众获得了数字化的历史文献。

但内部会议纪要透露出的不安说明问题没那么简单。博德利图书馆管理委员会的成员在会议中明确表达了对声誉风险的担忧:与一家深陷多起版权诉讼的AI公司合作,是否会损害牛津800年的学术声誉?虽然OpenAI在部分案件中取得了一些有利的法院裁决,但整体诉讼风险依然存在。更不用说,OpenAI自身的治理结构在过去一年中也经历了剧烈震荡。一所大学与这样一家公司结为深度合作伙伴,本身就意味着要承担对方声誉波动所带来的连带影响。

谁的知识,谁的未来

回到博德利图书馆。从1602年建馆至今的四个多世纪里,它见证了无数知识和思想的流转。培根的手稿在这里保存,爱因斯坦的著作在这里借阅,《哈利·波特》的电影场景在这里取景。现在,它的馆藏正在被转化成一个AI模型神经元网络中的权重分布。

牛津大学有一个底气十足的理由:这些都是公版文献,任何人在法律上都有权使用。的确如此。

但问题或许不在于能不能,而在于该不该让公众知道。

如果AI的崛起不可逆转,如果大语言模型注定要吸收人类有史以来积累的大部分文字,那么公众至少有权知道:自己的文化遗产正在被谁、以什么方式、在怎样的条件下被吸收。透明不仅是一种道德选择,在AI信任度持续走低的当下,透明本身就是一种战略资产。

对于其他还在观望的学术机构,牛津案例提供了一个清晰的警示。与AI公司合作数字化公版文献本身没有错。但合作的前提,应该是在第一份新闻稿里就把所有用途说清楚。而不是等到《卫报》通过信息自由法拿到了内部会议纪要,公众才得知真相。

图书馆的使命是保存知识,让知识被AI吸收不等于是让AI公司来定义知识的价值。

作品声明:内容由AI生成