AIスタートアップのGoodfireは、自律型AIエージェントの動作を内部から監視・制御するための新しい「inside-out」監視システムを発表しました。この技術は、AIエージェントが不正な動作を行う前に、モデルの内部的な兆候を捉えることを目的としています。
今回発表された監視システムは、AIモデルの内部状態に直接アクセスし、推論プロセス中に発生する異常な挙動をリアルタイムで検知します。従来主流であった「外部から入出力を監視する手法」とは異なり、エージェントが内部でどのような計算を行い、どのような意図で処理を進めているかを直接分析できる点が最大の特徴です。
Goodfireによれば、この手法は従来の監視システムと比較して大幅なコスト削減を実現しています。AIの動作を外部から厳重に監視するための複雑なガードレール設定や高額な計算コストを必要とせず、効率的に不正なAIエージェントの活動を遮断することが可能です。AIの自律性が高まる中、モデルそのものの安全性確保は喫緊の課題となっており、本技術はその解決策として期待されています。
Goodfireは今後、本監視技術を拡張し、より多様なAIモデルおよび複雑なエージェント・ワークフローに対応させることで、エンタープライズ領域におけるAI導入の安全性を担保するインフラとしての地位確立を目指します。