画像・動画生成モデルで知られるBlack Forest Labs(BFL)が、ロボット工学向けのオープンAIモデル「FLUX 3 Action」を公開した。ロボットの作業空間を撮影する複数のカメラ映像から、次に取るべき動作と環境の変化を予測するモデルで、重みデータはHugging Faceで公開され誰でも利用できる。

70億パラメータで前世代比最大3.95倍高速

FLUX 3 Actionはマルチモーダル対応の「FLUX 3」をベースにしており、テキスト・ビデオ・ロボットの状態データをそれぞれ個別にエンコードしたうえで、FLUX 3のバックボーン層を通じて将来のビデオフレームとロボットの動作を同時に予測する設計だ。

パラメータ数は70億個で、BFLの従来モデルの半分以下に抑えられている。それでいて処理速度は前世代モデル比で最大3.95倍に向上した。ビデオデータを95%以上含むマルチモーダル事前学習に加え、ガイダンス蒸留による推論オーバーヘッドの削減、単一ステップでの予測を可能にするステップ蒸留といった技術を組み合わせ、小型化と高速化を両立させている。

ロボット動作ベンチマークで小型ながら新記録

BFLによると、FLUX 3 Actionはロボットの動作精度を測るベンチマーク「RoboLab-120」で42.2%の成功率を達成し、より小さいパラメータ数ながら新記録を樹立した。複雑なタスクでは、推論エージェント「GPT 6 Astra」と組み合わせるハイブリッド運用も可能で、この構成では推論コストを29%削減できるという。

オンデバイス展開への道を開く

大規模な推論モデルは計算コストが高く、ロボット本体に搭載するには不向きだった。FLUX 3 Actionのような軽量モデルが実用レベルの成功率を出せることが示されたことで、クラウド依存を減らしたオンデバイスでのロボット制御が現実味を帯びる。

重みデータがHugging Faceで公開されているため、研究者や開発者は自前のロボットや、ビデオゲームなどのデジタル環境でモデルを試すことができる。オープンな動作予測モデルの普及は、ロボティクス開発のハードルを下げ、大手企業以外のプレイヤーが参入しやすくなる土壌を作る可能性がある。