Alibaba の音声AIチーム Qwen が、音声認識・音声合成・リアルタイム対話を刷新した新シリーズ「Qwen-Audio-3.1」を発表した。5つのモデルで構成する音声スタック全体を刷新すると同時に、料金を最大95%引き下げており、企業が音声AIを導入する際のコストを大きく下げる内容になっている。

5モデルで音声スタックを一新

Qwen-Audio-3.1は、既存のASR(音声認識)・TTS(テキスト音声変換)・リアルタイム対話モデルをアップグレードしたうえで、新たに「TTS-Next」と「ASR-Next」の2モデルを追加した。理解・生成・対話・制作をカバーする音声AIの一式として設計されている。

ASRは多言語・方言認識の精度を高め、フィラーワードや言い直しを自動的に除去する機能を備える。上位版のASR-Nextはさらに、複数話者をタイムスタンプ付きで識別し、感情や周囲の環境音、機械音まで検出できる。TTSは多言語間で自然な音声転送を実現し、感情・速度・話し方をテキストプロンプトで制御可能。TTS-Nextは言語モデルと拡散モデルを組み合わせ、セリフと効果音、環境音を単一パスでまとめて生成する。

リアルタイムモデルは26万トークンの文脈を保持

リアルタイム対話モデルは、同時発話・同時聴取と即座の割り込みに対応し、ユーザーの気分が沈んでいると検知した場合はより穏やかな速度で共感的に応答する仕組みを持つ。上位版の「Realtime Plus」はコンテキストウィンドウが26万2,144トークン(256×1,024)に達し、会話履歴やツール実行結果、セッション状態を要約なしに蓄積し続けられる。

Data Studiosの分析によれば、Realtime Plusは音声を直接処理する「音声をネイティブなインターフェースとするエージェントランタイム」として動作する。関数呼び出しによるデータベース照会やAPI操作、Web検索を音声対話の中でシームレスにこなせる点が特徴だ。

価格はASRで最大95%引き下げ

今回の発表で最も大きな変化は価格だ。TTSはおよそ70%、リアルタイム音声対話は約85%、そしてASRは最大95%のコスト削減となった。Alibaba Cloud Model Studioを通じて利用できる。

音声AIはこれまで、高品質なモデルほど処理コストがかさみ、大規模な導入のハードルとなってきた。Alibabaの前世代モデル「Qwen-Audio-3.0-TTS-Plus」は音声品質でSpeech Arenaのトップを獲得した一方、処理速度が競合に劣るという課題を抱えていた。今回の3.1シリーズでは、価格面での競争力を前面に押し出す戦略に転じた格好だ。

企業の音声AI導入コストを左右する動き

音声認識・音声合成のAPI価格が9割前後下がることは、コールセンターの自動応答や多言語カスタマーサポート、音声エージェントを検討する開発者・企業にとって直接的な導入判断材料になる。OpenAIやAnthropicが対話AIの価格競争を繰り広げる一方、音声AIの領域でもAlibabaが同様の価格引き下げ競争を仕掛けた形であり、今後は他の音声AIベンダーの追随価格改定にも注目が集まる。