AIモデルの学習データ収集において、多くの企業が「フェアユース(公正利用)」を法的な根拠として採用してきました。しかし、近年、AI企業内部の関係者からこの手法を「驚くべき窃盗(astonishing theft)」と批判する声が上がり、技術開発の倫理的基盤が改めて問い直されています。
本件は特定の製品発表ではなく、大規模言語モデル(LLM)の学習データ選定プロセスに関する構造的な問題提起です。著作権で保護された膨大なコンテンツを許諾なく学習に使用する行為が、法的にフェアユースの範囲内であるか否かについて、司法判断や学説を交えた議論が激化しています。
従来、AI企業はインターネット上の広範なデータを効率的に学習させることで性能を飛躍的に向上させてきました。しかし、その手法そのものが著作権侵害に該当する可能性があるとの指摘は、今後のモデル開発におけるデータ選定プロセスの透明化や、適切な利用許諾スキームの構築を強く求めるものとなります。
今後は、著作権者との対話や新たなライセンス契約の締結、あるいは技術的な透明性の向上が強く求められます。AI開発におけるデータ収集のあり方は、法整備の進行とともに大きな転換点を迎えており、企業にはより高度なガバナンスが求められるフェーズへと移行しています。