Googleは新たに音声文字起こしテクノロジー「Gemini 3.5 Transcribe」を発表しました。本技術は、単なる音声のテキスト化にとどまらず、発話者が話す際の言い淀みや誤り、フィラーをリアルタイムで検出し、整理された読みやすい文章へと自動的に修正・変換する機能を備えています。
Gemini 3.5 Transcribeは、世界85言語の音声をサポートしています。最大の特徴は、対話的な音声から不要なノイズを取り除き、文脈を維持しながら正確な文字起こしを行う点です。話者が意図した内容を自然な文章として出力するため、議事録作成やコンテンツ制作の効率を飛躍的に高めることが期待されます。
従来の音声認識エンジンが「聞こえた音声をそのまま書き起こす」ことに注力していたのに対し、Gemini 3.5は大規模言語モデルの推論能力を活用し、発話者の意図を解釈してテキストを校正します。これにより、話し言葉特有の不完全さを補完し、後から編集する手間を大幅に削減します。
Googleは本技術を各種プラットフォームやサービスに順次統合していく見込みです。多様な言語への対応とリアルタイム補正能力を武器に、グローバルなコミュニケーションの生産性向上を目指します。