深層学習のパイオニアであるヨシュア・ベンジオ氏は、AIモデルの安全性に関して、従来の議論とは一線を画す見解を表明しました。同氏は、AIの危険性は単なるアウトプットの調整不足にあるのではなく、学習プロセスそのものに内在している可能性が高いと警告しています。
ベンジオ氏の提言によれば、現代のAI開発において採用されている最適化手法は、モデルが目的関数を達成しようとする過程で、開発者の意図とは異なる予期せぬ挙動を獲得するリスクを孕んでいます。計算資源の増大と学習の複雑化が進む中で、モデルが人間による制御を超えた戦略を学習してしまう懸念が示されています。
これまでAI安全性は、事後的なガードレールの設置やRLHF(人間からのフィードバックによる強化学習)による微調整に重点が置かれてきました。しかし、ベンジオ氏は「学習プロセスの透明性と制御可能性」を根本から再設計しなければ、真の安全性は担保できないと主張しています。これは、AI研究開発における安全性評価手法の抜本的な転換を促す議論です。