Black Forest Labs、座標指定で部分編集するFLUX 3 Image公開、参照画像10枚・4K対応
Black Forest LabsがFLUX 3 Imageを正式公開した。バウンディングボックスで画像内の要素を個別に指定し、他の部分を変えずに複数回編集できる。参照画像は最大10枚、出力は4K解像度まで対応する。
Black Forest Labs(BFL)が、画像生成・編集モデル「FLUX 3 Image」を正式に公開した。画像内の要素をバウンディングボックス(座標指定の枠)で個別に指定し、他の部分を変更せずに複数回編集できるのが特徴だ。7月に発表したマルチモーダルモデル「FLUX 3」ファミリーのうち、動画・音声に続いて画像生成コンポーネントが利用可能になった形だ。
座標でシーンを組み立てる仕組み
FLUX 3 Imageは、画像内の各要素を0から1000のグリッド座標(y_min, x_min, y_max, x_max)で指定する方式を採用した。ユーザーは複数のボックスを使ってシーン内の要素を個別に配置でき、ボックスで囲んでいない部分は編集後も完全に保持される。
モデルは「グローバルキャプション(全体の説明)」「要素テーブル(各要素のIDと座標、説明)」「シーンプロンプト」という3層構造で画像を組み立てる。LLMがテキストプロンプトからレイアウトを自動生成し、ユーザーは不適切な配置だけを手動調整すればよい設計だ。再記述・置換・移動といった編集操作を繰り返し適用でき、変更内容は蓄積されていく。
参照画像10枚・4K出力に対応
生成時には最大10枚の参照画像を組み合わせてシーンを構成できる。出力解像度は5456×3072ピクセルのネイティブ4Kまで対応し、細部のテクスチャを保持したまま高品質な画像を生成できるという。
利用方法は、ブラウザ上でボックスを手描きできる「Playground」、プログラムからレイアウトプロンプトを送る「BFL API」、企業向けにカスタムデプロイできる商用ウェイトの3通りが用意されている。価格は個別相談制で、具体的な料金は公開されていない。
動画・音声に続く画像版、オープンウェイトは数週間後
BFLは7月、テキスト・画像・動画・音声・ロボット動作を単一アーキテクチャで扱うマルチモーダルモデル「FLUX 3」を発表していた。当初は動画・音声生成が先行公開され、画像生成は「数週間以内に早期アクセスを開始する」と予告されていた経緯がある。今回のFLUX 3 Image公開は、この予告されていた画像版の実装にあたる。
オープンウェイト版「FLUX 3 Dev」は2026年内に別途提供される計画で、今回公開されたFLUX 3 Imageはクローズドソースでの提供となる。
画像編集ワークフローへの影響
従来の画像生成AIは、画像全体を再生成するか、マスク指定による大まかな部分編集にとどまることが多かった。FLUX 3 Imageの座標ベース編集は、バナー広告やプロダクト画像のように複数要素を独立して配置・調整する必要がある制作現場との親和性が高い。構造化された座標指定はAIエージェントからの呼び出しとも相性がよく、デザインツールやワークフロー自動化への組み込みが進む可能性がある。