Microsoftは、ボイスエージェントの対話精度と自然な応答能力を向上させる、新しい音声文字起こしモデルおよびテキスト読み上げ(TTS)モデルを発表しました。本リリースは、AIを活用した音声対話システムにおいて、人間と機械の間でより円滑なコミュニケーションを実現することを目的としています。
今回発表されたモデルは、従来の音声処理エンジンをアップデートした最新のAIモデル群です。文字起こしモデルは、多様なノイズ環境下での音声認識精度を向上させ、誤認識を低減します。また、テキスト読み上げモデルでは、より抑揚のある自然な音声を生成し、長時間の対話でも違和感の少ないエージェント体験を提供します。
Microsoftは、長年の音声AI研究に基づく大規模なデータセットと最適化されたアルゴリズムを活用しています。これにより、低遅延かつ高品位な音声変換が可能となり、顧客対応やパーソナルアシスタントなどのボイスエージェント用途において、効率的な処理と高い品質を両立させています。
Microsoftは、これらのモデルを自社の開発プラットフォームや製品群に順次統合していく予定です。開発者はこれらの新しいモデルを活用することで、より人間に近い応答性を備えたAIサービスを構築することが可能になります。