ElevenLabsは、新しいテキスト音声変換(TTS)モデル「Eleven v4」と、その高速版「Eleven v4 Turbo」を公開した。表現力と発話の一貫性を高めたほか、対応言語を90以上に拡大し、レイテンシと発音精度の両面で従来モデルを上回る性能を示したとしている。

対応言語拡大と長文生成に対応

Eleven v4は、前バージョンのv3で70言語だった対応言語を90以上に拡大した。1回のリクエストで最大1万文字、音声にして約10分相当を生成でき、笑い声や囁き声、ドアの開閉音といった効果音もより正確に再現できるという。ユーザーは「感情」「一時停止」「音響効果」などのタグをテキストに挿入することで、ナレーションの抑揚や間を細かく制御できる。音声クローニング機能では、プロ品質のクローンに加え、10秒程度の音声サンプルから声を再現する「Instant Voice Clone」も引き続き利用できる。

低遅延を武器にするv4 Turbo

エージェント用途に最適化したv4 Turboは、音声生成開始までの遅延(レイテンシ)が中央値で約150ミリ秒と、ElevenLabsが競合製品として挙げる他社モデルの262〜814ミリ秒を大きく下回る。カスタマーサービスの音声エージェントなど、リアルタイム性が求められる場面での採用を見込む。

発音精度についても、ElevenLabsは独自ベンチマークでv3の85.6%からv4で91.7%へ向上したと説明している。第三者評価機関Artificial Analysisの調査でも音声モデルの首位にランクされたとしており、ブラインドテストではリスナーの65〜81%がv4を他社モデルより支持したという。

価格はキャンペーンで大幅割引

料金は通常、v4が100万文字あたり80ドル、v4 Turboが40ドルに設定されているが、10月12日までのキャンペーン期間中はそれぞれ22ドル、11ドルに割り引かれる。

音声生成モデルの改善は、字幕制作やゲーム開発、カスタマーサービスの音声エージェント、オーディオブック制作といった分野に直接影響する。対応言語の拡大と低遅延化が同時に進んだことで、非英語圏でのリアルタイム音声アプリケーション開発のハードルが下がる可能性がある。