OpenAIは、最新のAIモデル「GPT-5.6 Sol」が、推論能力を測定するベンチマーク「ARC-AGI-3」において、競合モデルであるOpus 5を上回る成果を達成したと公表しました。
「GPT-5.6 Sol」は、複雑な推論タスクの解決能力向上を目指して開発されたモデルです。OpenAIの発表によれば、特定の評価環境下において、現行の最高峰モデルを凌駕するスコアを記録したとされています。
今回の評価結果については、OpenAIが独自に構築したカスタムテストハーネス(評価環境)を用いて算出されたものである点が注目されています。一般的な評価標準と異なる環境下での測定であることから、モデルの汎用性やベンチマークにおける最適化の影響について、技術コミュニティを中心に検証と議論が続いています。
AIの推論能力は急速に進化しており、評価指標の透明性と客観性の確保が重要視されています。OpenAIは今後も研究開発を継続する方針を示しており、モデルの詳細や第三者機関による検証を通じた正確な性能評価が待たれる状況です。