← VPO Blog に戻る
📊 Blog

AlibabaのAI音声合成が世界首位を獲得、16言語対応で感情表現豊かな新モデルを発表

#Alibaba #AI #テックリリース #新技術
O
Oikawa Shinichiro
VPO Founder & CEO
2026/07/22
Cover

リリースの概要

Alibabaは、最新の音声合成モデル「Qwen-Audio-3.0-TTS-Plus」を発表しました。本モデルは、AI性能の評価機関であるArtificial Analysisが公開する「Speech Arena」リーダーボードにおいて、プロバイダー音声部門で首位を獲得しました。Eloスコアは1,236を記録し、競合するSimba 3.2(1,234)、Gemini 3.1 Flash TTS(1,214)、Sonic 3.5(1,207)を上回る評価を得ています。

製品・新機能の詳細

Qwen-Audio-3.0-TTS-Plusは、用途に応じて「Flash」と「Plus」の2バージョンで展開されます。「Flash」はリアルタイム対話に特化しており、約300ミリ秒の低遅延を実現しています。「Plus」は高品質な音声出力を目的として設計されています。

本モデルは、タガログ語、マレー語、タイ語、ベトナム語を含む16言語をサポートしており、中国語の複数の地域方言にも対応しています。また、自然言語による指示や、「[angry](怒り)」「[giggles](笑い)」といったタグを付与することで、非言語的な感情表現や話法を細かく調整することが可能です。

技術的特徴と価格

音声クローン技術において、従来モデルよりもノイズが多い環境やエコーが強い環境での再現性が向上しています。提供はAlibaba Cloud Model Studio経由で行われ、価格は100万文字あたり27.60ドルです。

パフォーマンスに関する分析

生成速度については課題も報告されています。1秒あたりの処理速度は16文字となっており、Sonic 3.5(120文字/秒)やSimba 3.2(30.2文字/秒)と比較すると低速であるというデータが示されています。

出典・参照元: The Decoder (the-decoder.com)