Microsoft、音声エージェント向け文字起こし・音声合成の新モデル3種を公開
Microsoftがリアルタイム文字起こし「MAI-Transcribe-2-Streaming」と音声合成2種を発表。第三者評価で精度1位を獲得し、コールセンターや音声エージェント開発の選択肢が広がる。
Microsoftは、リアルタイム文字起こしモデル「MAI-Transcribe-2-Streaming」と、音声合成モデル「MAI-Voice-2.1」「MAI-Voice-2.1-Flash」の3種を発表した。第三者評価機関Artificial Analysisのベンチマークで文字起こしの精度1位を獲得しており、コールセンターや音声アシスタントなど音声エージェント開発の選択肢が広がる。
音声エージェント開発競争の新局面
音声を使った対話型AIエージェントの開発競争が活発化する中、Microsoftは文字起こしと音声合成の両面で新モデルを投入した。これまで同社の音声基盤モデルは「Transcribe-1」が中心だったが、今回はストリーミング(リアルタイム処理)対応へと刷新し、応答速度と精度の両立を狙う。
文字起こし速度は競合の2倍、60言語に対応
MAI-Transcribe-2-Streamingは60言語に対応し、自動言語検出を継続的に行いながらリアルタイムで文字起こしする。最初の仮説(部分的な認識結果)を100ミリ秒強で出力し、最終的な文字起こし速度は主要競合の2倍に達するとMicrosoftは説明する。Artificial Analysisの第三者評価では、38モデル中で単語誤り率2.5%を記録し1位となり、最終テキストのレイテンシーは約0.13秒だった。価格は年内導入価格として1時間あたり0.54ドルに設定されている。
音声合成は23言語対応、ボイスクローニングにも対応
音声合成モデルのMAI-Voice-2.1は23言語・26ロケールに対応し、1つの音声モデルで各言語のネイティブアクセントを再現できる。数秒の参照音声からボイスクローニングも可能だが、悪用防止のガードレールを組み込んでいるという。高速版のMAI-Voice-2.1-Flashは最大45秒の音声をエンドツーエンドで150ミリ秒のレイテンシーで生成し、推論速度は55%向上、価格は同等モデル比で約60%安い100万文字あたり15ドルに抑えた。標準版は100万文字あたり22ドルとなる。
コールセンターや音声アシスタント開発への影響
3モデルはMicrosoft Foundry、MAI Playground、OpenRouterなど複数のプラットフォームで利用できる。Transcribe-2-Streamingは発話の途中でも音声エージェントが応答を開始できる設計のため、会話の間を詰めた自然なやり取りが求められるコールセンターや音声アシスタントの開発者にとって選択肢が増える。Microsoftが実施したテストでは、参加者の約半数が合成音声を実際の人間の声と区別できなかったとされ、音声合成の自然さが実用レベルに近づいていることを裏付けている。