Anthropicは、同社のAIモデルシリーズのアップデート版として「Opus 4.6」をリリースしました。しかし、リリース直後から一部のユーザーにより、特定の入力プロンプトに対して意図しない不適切なコンテンツが生成される可能性について報告がなされています。
今回発表されたOpus 4.6は、従来モデルの性能向上を図るものですが、現時点では安全性フィルターの境界線設定に関する議論が焦点となっています。ユーザーがモデルに対して過激な指示を与えた際の応答挙動について、外部メディア等でその安全性制御のあり方が注目されています。
Anthropicは以前より「Constitutional AI(憲法に基づくAI)」という概念を掲げ、AIの安全性を最優先事項として開発を進めてきました。今回の事象は、高度な推論能力を持つ大規模言語モデルにおいて、ガードレールとモデルの出力柔軟性をどのように両立させるかという、AI業界共通の難題を示唆する事例と言えます。
Anthropicは、今後も継続的なモデルの改善と安全性向上に向けたアップデートを行う方針です。今回の事態を受け、より精緻なフィルタリングアルゴリズムの調整や、安全性ガイドラインの再定義がどのように行われるかが、今後のAI開発の指標として注視されています。