Google、長尺動画AI「AI Video Co-Director」を発表、10分間の一貫した動画生成に成功
Googleが生成動画の「意味的ドリフト」を抑える新フレームワークを発表。GeminiとVeoを統合し、キャラクターの一貫性を保ったまま10分間の連続動画生成を実現した。
Google Researchが、長尺の生成動画で一貫性を保つための新しい統合フレームワーク「AI Video Co-Director」を発表した。GeminiとVeoの上位に置かれるオーケストレーション層として機能し、10分間の連続動画をキャラクターや背景を崩さずに生成できるという。
動画生成の弱点「意味的ドリフト」
生成動画には、時間が経つにつれてキャラクターの見た目が微妙に変化したり、上流の生成エラーが下流の映像に連鎖的に波及したりする問題がある。Googleはこれを「意味的ドリフト(semantic drift)」と呼び、長尺動画の自動生成を妨げる主要因の一つに挙げている。
数秒単位のクリップでは高精細な映像を生成できても、時間軸が伸びると顔や光の当たり方が少しずつずれていく現象は、これまで多くの動画生成モデルに共通する課題だった。
4つのフレームワークで一貫性を制御
AI Video Co-Directorは、以下4つの仕組みを組み合わせて構成されている。
- AI Video Co-Director: 多腕バンディットアルゴリズムを使い、創作戦略・物語の展開方法・映像の作風をパイプライン全体で最適化する
- CANVAS: キャラクター・場所・物体の状態を持続的な視覚記憶として保持し、同一シーン内での自然な転換とキャラクターの同一性維持を担う
- A²RD: 「検索・生成・改善・更新」のループでセグメント単位に動画を生成し、物語を進める「外挿」と一貫性を保つ「内挿」を動的に切り替える
- VQQA: 生成結果に対して視覚的な質問を投げかける自律的な改善ループで、ピクセルを直接編集するのではなくプロンプト側を段階的に磨き上げる
ベンチマークで10分の連続動画を実証
Googleは自社開発のベンチマーク「GenAD-Bench」でAI Video Co-Directorが81.4点のスコアを記録したと発表した。さらに「HardContinuityBench」「LVBench-C」という2つの専用ベンチマークでも改善が見られたとしている。実証実験では、10分間途切れることのない動画の生成に成功した。
この研究はGoogle Researchのシニアリサーチサイエンティストであるヤーレ・ソン氏とイーウェン・ソン氏によるもので、関連論文は自然言語処理系の国際会議COLM 2026およびEMNLP 2026で発表される予定だ。
クリエイターへの影響
Googleは、この技術によって「時間的一貫性と世界状態の追跡という煩雑な作業」をシステム側が肩代わりし、クリエイターが長尺の映像ナラティブを生成しやすくなるとしている。個々のクリップをつなぎ合わせる編集作業を減らし、プロ品質の映像制作を一般に近づける可能性がある技術として注目される。