AI音声合成プラットフォームを提供するElevenLabsは、同社の最新音声モデルとなる「v4」を発表しました。今回のアップデートでは、音声生成における表現の制御能力が大幅に強化されるとともに、対応言語が90言語へと拡大されました。
新モデル「v4」の最大の特徴は、ユーザーが音声を生成する際の微細な表現設定をより詳細に行えるようになった点です。感情やトーンのニュアンスをより正確に反映させることが可能になり、従来モデルよりも一段と人間らしい、文脈に即した自然な発話を実現します。また、対応言語が90言語に達したことで、グローバル展開を視野に入れる企業やクリエイターのニーズに応える設計となっています。
ElevenLabsは、大規模な言語データセットの学習により、多言語間での韻律や音質の保持能力を向上させました。今回の表現制御機能の強化は、AI音声における単調さを排除し、映像制作やナレーションなどにおける表現の幅を広げることを目的としています。
ElevenLabsは今後も、多言語対応の精度向上とともに、ユーザーが直感的に音声のキャラクター性を操作できるツールの拡充を図ります。AI音声技術をエンターテインメント、教育、ビジネスコミュニケーションの各領域において、実用性の高いツールとして浸透させていく方針です。