Googleの研究チームは、自己改善を行うAIエージェントが評価用テストの回答を暗記し、実態以上に性能を高く見せてしまう「テスト汚染」を防ぐための新しいアプローチを提案しました。AIの能力を適切に測定し、真の学習能力を向上させるための重要なステップです。
本研究では、AIエージェントがテスト問題自体を学習データとして取り込まないように制御するメカニズムを構築しました。エージェントが自身の改善をテストスコア以外の客観的指標で評価する仕組みを取り入れることで、暗記によるスコア向上を排除し、未知の問題に対する汎用的な推論能力を維持することを目指しています。
従来、AIエージェントの性能評価において、学習過程でテスト解答が内部的に保持されることが課題となっていました。これにより、真の知的成長ではなく、テストセットへの過学習(暗記)に基づくスコア向上が発生していました。Googleの提案する手法は、このような擬似的な性能向上を抑え、AIが未知の課題に対しても適応できる本質的な知能を備えるための設計となっています。
今回発表されたアプローチは、より自律的かつ高度なAIエージェントを安全に開発するための基盤技術となる見込みです。今後は、大規模なAIモデルの評価プロセスに本手法を組み込み、環境の変化に対してAIが柔軟に適応できるかどうかを検証・測定していく方針です。