オックスフォード大学が、世界的に著名なボドリアン図書館の歴史的文献をOpenAIのAIモデル学習に利用させていたことが、情報公開請求で入手した内部文書により明らかになった。2025年3月に発表されたパートナーシップでは、OpenAIのソフトウェアで図書館資料をデジタル化し学生・研究者向けの公開範囲を広げるとされていたが、当時の発表ではAIモデルの学習に使われるとは明言されていなかった。

博士論文12万5000点分のスキャンを提供済み

内部文書によれば、ボドリアン図書館がデジタル化した資料は「OpenAIの学習セットを構成するため」に使われていた。2025年6月までに、19〜20世紀の欧米大学の古い博士論文のスキャンデータ12万5000点がOpenAIに提供されていたという。オックスフォード大学はOpenAIが主導する研究支援プログラム「NextGenAI」に参加する英国唯一の機関で、同プログラムにはボストン公共図書館、カリフォルニア工科大学、MIT、ミシガン大学なども名を連ねている。

職員から評判リスクを懸念する声

情報公開請求で入手した会議議事録には、ボドリアン運営委員会メンバーを含む職員から、OpenAIとの提携がもたらす評判上のリスクや、AIの電力消費が大学の環境公約に与える影響を懸念する声が記録されていた。大学側は、提供対象の資料は規模が小さく著作権が切れた作品に厳密に限定されており、非独占的な形で共有されていると説明している。図書館側はスキャンデータの権利を保持し、将来的に一般公開する計画があるとも述べている。

学術機関のデータがAI企業の学習資源に

大学図書館が保有する希少な歴史的資料は、著作権の制約が少なく、質の高いテキストデータとしてAI企業にとって魅力的な学習資源になりつつある。今回の事例は、提携発表時点では学習利用が明示されていなかった点や、内部で懸念の声が上がっていた点を含め、学術機関とAI企業の連携がどこまで透明性を持って進められるべきかという課題を改めて浮かび上がらせている。