Black Forest Labs Flux 3:ネイティブオーディオ生成で動画制作を一気通貫化
Black Forest Labs が Flux 3 を発表。テキストや画像から動画を生成する際に、初めてネイティブオーディオ生成に対応。最大 20 秒の動画を音声付きで一括作成可能。Runway Gen-4.5 や Luma Ray 3.2 を上回る性能を内部テストで確認。
Black Forest Labs は 2026 年 7 月 23 日、次世代動画生成モデル「Flux 3」を発表した。最大の特徴は、動画生成の際にネイティブオーディオを同時に生成できるようになった点だ。これまでの動画生成ツールでは、映像と音声を別々に生成してから合成していたが、Flux 3 はテキスト指示だけで動画と音声を統合的に生成する。
ネイティブオーディオ生成が実現したこと
従来の動画生成ワークフロー:
- テキスト・画像から動画を生成
- 別の音声生成 AI で音声を作成
- 動画編集ツールで合成
- 音声と映像がズレていないか確認・修正
Flux 3 のワークフロー:
- 「人が笑い、会話する動画を音声付きで生成」と指示
- Flux 3 が映像と音声を同時生成
- 完成
ネイティブオーディオ対応により、以下が実現される。
自然な口の動き・音声同期:人物の顔表情・口の動きと音声が自動で同期。わざわざアフレコやリップシンクを調整する必要がない。
多言語対話ビデオ:複数言語での会話シーンを自動生成。字幕翻訳ではなく、実際に各言語で話す登場人物の動画が制作できる。
制作時間の短縮:テキスト指示から完成動画までが大幅に短縮。従来なら数日かかる作業が数分で完結。
対応する生成モード
Flux 3 は以下の多彩な入力形式をサポートしている。
- テキスト to ビデオ:テキスト説明から動画を生成
- 画像 to ビデオ:静止画を元に動画を生成
- ビデオ to ビデオ:既存動画をスタイル変換・シーン拡張
- キーフレーム指定:複数のキーフレーム画像から動画を生成、素材をつなぎ合わせて長尺動画化
つまり、イラスト素材から動画化したり、既存のショート動画をつなぎ合わせて長編を制作したり、と制作パターンが大幅に増える。
制限・現在の展開状況
生成可能な動画の最大長は20 秒。業界標準が数秒だった時代から見れば大幅な進化だが、3 分・5 分といった中程度の長さ動画には「複数クリップの生成・つなぎ合わせ」が必要だ。ただし Flux 3 はこれを前提に設計されており、複数クリップを自動でシームレスにつなぐ機能も備えているという。
利用可能性:
- Flux 3 ビデオ:既に利用可能(Black Forest Labs の API・Web UI)
- Flux 3 イメージ:早期アクセスが数週間以内に開始予定
競合モデルとの性能比較
BFL が内部テストで報告した競争力:
| 比較対象 | BFL の優位度 | 詳細 |
|---|---|---|
| Luma Ray 3.2 | 93% ユーザー選好 | Flux 3 が大幅に優先選択 |
| Runway Gen-4.5 | 77% ユーザー選好 | Flux 3 が優位 |
| Seedance 2.0 | 52% ユーザー選好 | ほぼ互角(Seedance が若干有利) |
| Gemini Omni Flash | 52% ユーザー選好 | ほぼ互角 |
BFL 自身が「独立した検証結果はまだ」と注釈を付けているが、業界トップクラスの性能に到達していることは確実だ。
応用例と産業への影響
コンテンツ制作:YouTube・TikTok など短尺動画プラットフォームの制作者が、スクリプトから 5 分以内で完成動画を生成可能に。
マーケティング・広告:商品紹介動画、ブランド CM を超短期間で複数パターン制作。A/B テスト効率が飛躍的に向上。
教育・説明動画:講師が口述だけで、字幕・背景・イラスト・音声が統合された教材動画を生成。
ロボティクス応用:BFL は Flux 3 をロボット動作計画の「世界モデル」として利用するテストも進行中。Audi でのロボットアーム動作予測に応用されている。
業界への波紋
動画生成分野は Runway、Luma、Seedance、Google が主導権を競っていたが、Black Forest Labs の急速な進化が競争を激化させている。特にネイティブオーディオはこれまで「別工程」だったため、統合的なアプローチは市場に新しい価値をもたらす可能性が高い。
今後、ほかのプレイヤーも同様の機能追加を急ぐと予想される。