Black Forest Labs は 2026 年 7 月 23 日、次世代動画生成モデル「Flux 3」を発表した。最大の特徴は、動画生成の際にネイティブオーディオを同時に生成できるようになった点だ。これまでの動画生成ツールでは、映像と音声を別々に生成してから合成していたが、Flux 3 はテキスト指示だけで動画と音声を統合的に生成する。

ネイティブオーディオ生成が実現したこと

従来の動画生成ワークフロー:

  1. テキスト・画像から動画を生成
  2. 別の音声生成 AI で音声を作成
  3. 動画編集ツールで合成
  4. 音声と映像がズレていないか確認・修正

Flux 3 のワークフロー:

  1. 「人が笑い、会話する動画を音声付きで生成」と指示
  2. Flux 3 が映像と音声を同時生成
  3. 完成

ネイティブオーディオ対応により、以下が実現される。

自然な口の動き・音声同期:人物の顔表情・口の動きと音声が自動で同期。わざわざアフレコやリップシンクを調整する必要がない。

多言語対話ビデオ:複数言語での会話シーンを自動生成。字幕翻訳ではなく、実際に各言語で話す登場人物の動画が制作できる。

制作時間の短縮:テキスト指示から完成動画までが大幅に短縮。従来なら数日かかる作業が数分で完結。

対応する生成モード

Flux 3 は以下の多彩な入力形式をサポートしている。

  • テキスト to ビデオ:テキスト説明から動画を生成
  • 画像 to ビデオ:静止画を元に動画を生成
  • ビデオ to ビデオ:既存動画をスタイル変換・シーン拡張
  • キーフレーム指定:複数のキーフレーム画像から動画を生成、素材をつなぎ合わせて長尺動画化

つまり、イラスト素材から動画化したり、既存のショート動画をつなぎ合わせて長編を制作したり、と制作パターンが大幅に増える。

制限・現在の展開状況

生成可能な動画の最大長は20 秒。業界標準が数秒だった時代から見れば大幅な進化だが、3 分・5 分といった中程度の長さ動画には「複数クリップの生成・つなぎ合わせ」が必要だ。ただし Flux 3 はこれを前提に設計されており、複数クリップを自動でシームレスにつなぐ機能も備えているという。

利用可能性

  • Flux 3 ビデオ:既に利用可能(Black Forest Labs の API・Web UI)
  • Flux 3 イメージ:早期アクセスが数週間以内に開始予定

競合モデルとの性能比較

BFL が内部テストで報告した競争力:

比較対象BFL の優位度詳細
Luma Ray 3.293% ユーザー選好Flux 3 が大幅に優先選択
Runway Gen-4.577% ユーザー選好Flux 3 が優位
Seedance 2.052% ユーザー選好ほぼ互角(Seedance が若干有利)
Gemini Omni Flash52% ユーザー選好ほぼ互角

BFL 自身が「独立した検証結果はまだ」と注釈を付けているが、業界トップクラスの性能に到達していることは確実だ。

応用例と産業への影響

コンテンツ制作:YouTube・TikTok など短尺動画プラットフォームの制作者が、スクリプトから 5 分以内で完成動画を生成可能に。

マーケティング・広告:商品紹介動画、ブランド CM を超短期間で複数パターン制作。A/B テスト効率が飛躍的に向上。

教育・説明動画:講師が口述だけで、字幕・背景・イラスト・音声が統合された教材動画を生成。

ロボティクス応用:BFL は Flux 3 をロボット動作計画の「世界モデル」として利用するテストも進行中。Audi でのロボットアーム動作予測に応用されている。

業界への波紋

動画生成分野は Runway、Luma、Seedance、Google が主導権を競っていたが、Black Forest Labs の急速な進化が競争を激化させている。特にネイティブオーディオはこれまで「別工程」だったため、統合的なアプローチは市場に新しい価値をもたらす可能性が高い。

今後、ほかのプレイヤーも同様の機能追加を急ぐと予想される。