AnthropicのLLM学習と書籍裁断の保存論点
元記事公開日: -
出典: https://ledge.ai/articles/anthropic_book_scanning_rare_books
Anthropicは、購入した数百万冊の紙の書籍を外部業者が裁断・スキャンして作成したPDFをresearch libraryに保存し、その一部をLLMの学習データに用いた。社外配布しない形式変換はフェアユースと判断された一方、希少本・古書を物として保存する論点が残る。
背景
2026年8月、豪州の古書店では、ニッチな題名や数十年前の本を含む不自然な大量注文が報告された。ただし、AI企業による注文か、購入された本が裁断・スキャンされたかは確認されていない。古書には本文だけでなく、来歴や個体性にも価値があるとの見解が示されている。
要望・目的
research libraryから選んだ一部の書籍は、大規模言語モデル(LLM)の学習データに使われた。
実装・実施内容
カリフォルニア州北部地区連邦地裁の2025年6月23日付判決文では、Anthropicが数百万ドルを投じ、しばしば中古品を含む数百万冊の紙の書籍を購入したとされる。外部業者が製本を外してページを裁断・スキャンし、画像と機械可読テキストを含むPDFを作成した後、紙の原本を廃棄した。
結果・効果
裁判所は、購入した紙の書籍1冊をデジタルコピー1冊に置き換え、社外に配布しない形式変換についてフェアユースと判断した。一方、Anthropicが希少本を大量に破壊したという裏付けは確認されていない。Anthropicは、データ取得プログラムで希少本や古書を購入して破壊することはないと説明している。