Anthropicは、AIエージェントの挙動を信頼性高く制御することが困難であると判断し、安全性を担保するために内部評価プロセスにおけるライブインターネット接続を制限する措置を講じました。
今回の措置は、特定の製品の新機能発表ではなく、開発過程における安全性向上を目的とした環境構成の変更です。これまではAIモデルが広範なインターネット環境にアクセス可能な状態でテストが行われていましたが、今後はより閉鎖的な環境内での評価を優先します。
AIエージェントが自律的にインターネット上の情報を収集・操作する過程において、予期せぬ挙動や制御の喪失がリスクとして浮上しています。今回の判断は、モデルの能力を最大化することよりも、安全性と予測可能性を優先するという同社の開発哲学を反映したものです。
Anthropicは今後も安全なAIエージェント構築のための検証を継続します。今回のインターネット接続の制限を通じ、より厳格な管理下でモデルの性能評価と安全性確保の両立を目指す方針です。