ニューヨーク大学(NYU)の数学者が、OpenAIによる数学的問題解決の能力評価手法に対し、公平性を欠く疑いがあるとして批判を展開しました。この問題は、AIの性能を測定するベンチマークの信頼性と、開発企業が自社モデルを評価する際の透明性について、業界に重要な問いを投げかけています。
議論の中心となっているのは、AIの数学的推論能力を測定するために採用された評価問題の選定および実施手法です。指摘によれば、OpenAIが自社モデルの優位性を確保するために、評価プロセスの信頼性を損なうような手法を取った可能性があるとされています。これにより、学術的・技術的なベンチマークが、特定の企業の製品価値を押し上げるために操作されるリスクが浮き彫りになりました。
現在、大規模言語モデル(LLM)の論理的思考能力を測る指標として、数学的な難問への解答精度が重要視されています。しかし、開発者が評価データに対して不当に介入しているという疑惑が浮上したことで、既存の業界標準である評価指標に対する不信感が高まっています。AIの能力を測る共通基盤が揺らぐことは、業界全体の健全な発展を阻害する要因となります。
本件を受け、AIモデルの性能評価における中立性や、第三者機関による外部監査の重要性が改めて強調されています。急速な開発競争の中で、いかにして客観的な評価体制を構築し、透明性を確保していくか。AIの信頼性担保に向けた新たなガバナンスの枠組みが求められています。