AIgram

AnthropicのLLM学習と書籍裁断の保存論点

元記事公開日: -

AnthropicのLLM学習と書籍裁断の保存論点AI活用事例の構造図データ化選定対象外論点背景購入した書籍背景研究ライブラリ制約希少本の扱いAI処理LLM学習結論文化資産の論点https://ledge.ai/articles/anthropic_book_scanning_rare_books

出典: https://ledge.ai/articles/anthropic_book_scanning_rare_books

AI活用の概要

Anthropicは、購入した数百万冊の紙の書籍を外部業者が裁断・スキャンして作成したPDFをresearch libraryに保存し、その一部をLLMの学習データに用いた。社外配布しない形式変換はフェアユースと判断された一方、希少本・古書を物として保存する論点が残る。

背景

2026年8月、豪州の古書店では、ニッチな題名や数十年前の本を含む不自然な大量注文が報告された。ただし、AI企業による注文か、購入された本が裁断・スキャンされたかは確認されていない。古書には本文だけでなく、来歴や個体性にも価値があるとの見解が示されている。

要望・目的

research libraryから選んだ一部の書籍は、大規模言語モデル(LLM)の学習データに使われた。

実装・実施内容

カリフォルニア州北部地区連邦地裁の2025年6月23日付判決文では、Anthropicが数百万ドルを投じ、しばしば中古品を含む数百万冊の紙の書籍を購入したとされる。外部業者が製本を外してページを裁断・スキャンし、画像と機械可読テキストを含むPDFを作成した後、紙の原本を廃棄した。

結果・効果

裁判所は、購入した紙の書籍1冊をデジタルコピー1冊に置き換え、社外に配布しない形式変換についてフェアユースと判断した。一方、Anthropicが希少本を大量に破壊したという裏付けは確認されていない。Anthropicは、データ取得プログラムで希少本や古書を購入して破壊することはないと説明している。