Googleは、対話型AIモデル「Gemini 3.8 Live」に視覚的なアバターを組み合わせた新機能「Live Avatar」を発表した。先週公開したGemini 3.8 Liveの音声対話機能に、ほぼリアルタイムでの視覚的な存在感を加えるもので、まずGemini Enterprise向けに提供が始まった。

音声と映像を同時に処理する対話体験

Live Avatarは、ユーザーからの視覚・音声入力を同時に処理し、リップシンクと自然な表情でリアルタイムに応答する。従来の音声のみのアシスタントと異なり、画面上のアバターが会話に合わせて表情や口の動きを変化させることで、対面での会話に近い体験を実現する。

Googleは、対話中にバックグラウンドでツール呼び出し(tool calls)を実行できる非同期処理にも対応したと説明している。複雑なタスクを裏側で処理しながら会話のテンポを止めない設計で、ユーザーを待たせずに情報検索や操作を並行して進められる。

97言語対応、企業ブランドに合わせたアバター生成も

Live Avatarは97言語のネイティブな音声同期に対応する。言語を切り替えても視覚的な一貫性が保たれるため、多言語でのカスタマーサポートや接客用途を想定した設計とみられる。

エンタープライズ向けの機能として、参照画像から企業ブランドに合わせたカスタムアバターを生成できる点も特徴だ。企業は自社のキャラクターやマスコットをベースにしたアバターを作成し、顧客対応の窓口として活用できる。

生成される映像には知覚的な電子透かし技術「SynthID」が埋め込まれており、AI生成コンテンツであることを技術的に検出できるようにしている。

エンタープライズ活用が先行、生成AIの「顔」をめぐる競争が加速

Live AvatarはGemini Enterpriseから提供が始まっており、一般ユーザー向けのGeminiアプリへの展開時期は明らかにされていない。音声アシスタントに視覚的な人格を持たせる動きは、OpenAIやMetaなど他社も進めており、対話型AIの「顔」をどう作るかは各社の差別化ポイントになりつつある。

企業にとっては、コールセンターやオンライン接客をAIアバターに置き換える選択肢が広がる一方、SynthIDのような透かし技術の実効性や、なりすまし・誤解を招く表現への対策も今後の課題になりそうだ。