英国のAIセーフティ研究所(UK AI Safety Institute)は、次世代AIモデル「GPT-6 Astra」のセキュリティ耐性に関する評価結果を公開しました。本調査は、悪意あるプロンプトを用いた「不正攻撃(rogue attack)」に対するモデルの脆弱性に焦点を当てています。
調査において、GPT-6 Astraは以前のモデルと比較して、不正な攻撃の成功率が5倍にまで上昇していることが確認されました。この結果は、モデルの推論能力が飛躍的に向上する一方で、セキュリティガードレールの回避手法も同時に高度化・効率化していることを示唆しています。
近年のLLMは高度なタスク処理能力を持つ一方で、意図しない挙動を誘発させる攻撃に対する耐性が重大な課題となっています。今回のデータは、モデルの安全性評価フレームワークの重要性と、開発段階におけるリスク管理の複雑さを浮き彫りにしました。
研究所は今回の調査結果を重要視しており、AIモデルの安全性確保に向けた新たな防御策の策定を進めています。また、AI開発各社に対してセキュリティ基準のさらなる引き上げを要請する方針であり、今後もモデルの進化に即した継続的な脆弱性検証を実施していく予定です。