AmazonがAIモデルの学習用データを構築する過程で、希少な書籍を物理的に破壊・廃棄している実態が調査によって浮き彫りになりました。今回の指摘は、書籍を保存すべき資産として扱うのではなく、AIの学習エンジンに読み込ませるためのデータ抽出手法として物理的な破壊が行われている点に焦点を当てています。
AI開発における大規模データセット構築の裏側として、書籍を裁断することでデジタルデータ化(OCR処理など)の効率を高めるプロセスが存在します。従来のスキャン手法よりも高速かつ高精度なデータ取り込みが可能な一方で、物理的な書籍の原型が損なわれるという代償を伴います。
希少本がAI学習のために廃棄されるプロセスに対し、著作権者や文化遺産保護の専門家から懸念の声が上がっています。効率的なAIトレーニングの追求と、情報の永続的な価値の保護をどう両立させるのか。大手テック企業が構築するAIデータセットの透明性について、今後さらなる議論が求められます。