Anthropicが提供するAIモデルにおいて、生物兵器の製造等に関連する有害な入力を制限するための安全フィルタが、約1年間にわたって正しく機能していなかったことが判明しました。この期間中に、当該フィルタを回避するリクエストが1億3300万件発生していたことが明らかになっています。
Anthropicは、AIの安全性(AI Safety)を企業の核として掲げ、責任あるAI開発を標榜してきました。しかし、今回の事態は、AIのガードレールが運用過程で意図せず無効化されたり、期待通りに機能しなくなったりするリスクを浮き彫りにしました。生物兵器に関連する高リスク領域において、長期間にわたり監視体制が機能していなかった点は、AIガバナンス上の大きな課題と言えます。
今回の事態を受け、Anthropicにはフィルタリングシステムの稼働状況の検証と、監視体制の抜本的な強化が求められています。AIモデル自体の性能向上に加え、運用時におけるガードレールの持続的な有効性をどのように担保し、技術的信頼性を維持していくかが、同社を含むAI業界全体の重大な責務となっています。