Googleは、現在のAI業界で一般的に用いられているベンチマークテストが直面している「信頼性の問題」について見解を発表しました。モデルの性能評価基準が不透明であること、また特定のテストセットに対する最適化が進んでいる現状に警鐘を鳴らしています。
本発表では、単一のスコアに依存する評価手法から、より多面的かつ堅牢な評価プロトコルへの移行を提言しています。モデルのトレーニングデータやテストセットの汚染を防ぎ、開発者が公平にモデルの真の実力を比較できる環境構築を目指します。
多くのAIモデルがベンチマークのスコアを向上させることに最適化され、実用性との間に乖離が生じているという課題に対し、Googleは実世界での応用を想定した評価の重要性を強調しました。モデルの真の能力を多角的に測定する仕組みの導入が求められています。
Googleは、業界全体での協力体制を強化し、透明性の高い評価標準を確立することで、AI研究の健全な発展を促す方針です。具体的なアルゴリズムの改良やオープンなデータセットの提供を通じ、AI開発エコシステムにおける信頼の基盤を強化していきます。