Google、音声生成AI「Gemini 3.8 Flash TTS」発表 100言語超・声の一から作成に対応
Googleが表現力豊かな音声を生成する新モデル「Gemini 3.8 Flash TTS」「Flash-Lite TTS」を発表。自然言語で声を一から作れる機能や30秒サンプルでの声複製に対応し、開発者は即座にAPIで利用できる。
Googleは、新しい音声生成モデル「Gemini 3.8 Flash TTS」と、軽量版の「Gemini 3.8 Flash-Lite TTS」を発表した。自然言語のプロンプトだけで新しい声を一から作成できる点や、100以上の言語・方言に対応する点が特徴で、開発者はGemini APIとGoogle AI Studioを通じて即座に利用できる。
声のデザインから大量処理まで2モデルで対応
Gemini 3.8 Flash TTSは、キャラクター設計や創造的な演出に重点を置いたモデルだ。テキストで声質や話し方を指示するだけで、既存の音源に頼らず新しい声を生成できる。スクリプトの行ごとに演技の指示を与えることも可能で、数時間に及ぶ長編コンテンツの音声化にも対応する。
一方のGemini 3.8 Flash-Lite TTSは、大量処理や低コストでの運用を重視した設計だ。吹き替えや音声エージェント向けに最適化されており、トーンやペースを細かく制御できる。用途に応じてモデルを使い分けられる構成になっている。
声の複製と2000種類超のライブラリ
両モデルとも、わずか30秒の音声サンプルから声を複製する機能を備える。あらかじめ用意された2000種類以上の音声ライブラリからも選択でき、ゼロから声を作らなくても多様な用途に対応できる。
性能面では、Hume AIによる声のデザインに関するベンチマークで首位を獲得したとGoogleは説明している。日本語やブラジルポルトガル語、ベトナム語などの主要言語でも、第三者評価のVoice Arenaで上位にランクされた。
悪用対策と提供範囲
声の複製機能を使うには本人の同意確認が必須とされており、生成された音声にはすべて「SynthID」による目に見えない電子透かしが埋め込まれる。これにより、AI生成音声かどうかを後から検出できる仕組みを確保している。
提供範囲は開発者向けのGemini API・Google AI Studioに加え、エンタープライズ向けのGemini Enterpriseでも近日公開予定。一般ユーザーもGemini NotebookやGoogle Vidsを通じて利用できるようになる。ポッドキャストの自動生成やナレーション制作など、音声コンテンツ制作のハードルを下げる動きとして、ElevenLabsなど既存の音声AIスタートアップとの競争激化も予想される。