OpenAIが開発中の次世代AIモデル「GPT-6 Astra」に関する初期評価結果が公開されました。本評価において、モデルは先行モデルと比較して情報の正確性が向上しており、ハルシネーション(幻覚)の発生が抑制されていることが示唆されています。
機能面での進歩が見られる一方で、セキュリティ検証においては依然として課題が残っています。特定の隠れたプロンプトインジェクション(命令文の注入)に対してモデルが脆弱であり、本来の制限を回避されてしまう事象が確認されました。
GPT-6 Astraは、従来モデルが抱えていた事実誤認の問題に対して、より強固な学習プロセスを通じて改善を図っています。しかし、モデルが複雑化するにつれ、プロンプトインジェクションへの対策は新たな段階に突入しています。OpenAIはハルシネーションの低減という成果を維持しつつ、今後は攻撃耐性の強化を重要な開発項目として継続的な安全性テストを実施していく方針です。