9月24日、MarkTechPostが「Black Forest Labs Releases FLUX 3 Action: A 7B Open-Weights World Action Model That Tops RoboLab-120」と題した記事を公開した。画像・動画生成モデル「FLUX」シリーズで知られるBlack Forest Labs(BFL)が、そのアーキテクチャをロボット制御へ転用した7Bオープンウェイト世界行動モデル「FLUX 3 Action」をリリースし、RoboLab-120ベンチマークで首位を獲得した——精度・速度ともにNVIDIAの16Bモデルを上回るという結果は、ロボット制御AIのスケール則に再考を迫るものだ。
「速さ vs 精度」のトレードオフを崩した7Bモデル
ロボット制御AIの世界では長らく、二択が強いられてきた。WAM(World Action Model)と呼ばれるカテゴリは、カメラ映像の未来フレームとロボット動作を同時に予測する手法で精度は高いが、処理が重い。一方、VLA(Vision-Language-Action)モデルは軽快だが精度で劣る。
具体的な数字で言えば、NVIDIAのCosmos 3 Nano(16B、WAM)はRoboLab-120で36.8%を記録するが、B200上での処理時間はVLAのπ0.5(3.3B)比で約4.7倍かかる。π0.5は速いが成功率は28.0%にとどまる。
Black Forest Labs(BFL)が今回リリースしたFLUX 3 Actionは、7BパラメータのWAMでありながら、RoboLab-120で42.92%を記録し首位に立った。Cosmos 3 Nanoより6.1ポイント高く、パラメータ数は56%少ない。速度面でもCosmos 3 Nano(FP8)比で最大3.95倍高速という結果を出している。
アーキテクチャ:画像生成モデルの技術をロボへ転用
FLUX 3 ActionはBFLのマルチモーダル基盤モデルFLUX 3から派生している。BFLはStable Diffusionの中心的な開発者たちが創業したスタジオで、フローマッチング(Flow Matching)ベースの画像・動画生成モデル「FLUX」シリーズを手がけてきた。FLUX 3はその最新世代であり、画像・動画・音声を統合的に扱うマルチモーダル基盤として設計されている。FLUX 3 Actionはその事前学習済みバックボーンを受け継ぎ、ロボット制御用の行動デコードヘッドを追加した構成だ。生成モデルとして大規模な動画データを学習したバックボーンが、世界の物理的ダイナミクスの理解をロボット制御に持ち込むという発想が核心にある。
事前学習では画像・動画・音声データを使用し、動画が学習トークンの95%以上を占める。テキスト、動画フレーム、ロボットの状態をトークンに変換し、バックボーンの出力から動画フレームとロボット動作を同時にデコードする構造だ。
事前学習の効果は顕著で、事前学習なしにDROIDデータだけで訓練した場合、RoboLabスコアは1%未満にとどまった。事前学習ありでは**11.6%**まで跳ね上がる。ロボット動作データ単体では汎化が難しく、大規模な動画事前学習が効いているという結果だ。
中間学習(Midtraining)では、事前学習データ(36.95%)と行動アライメント済み動画(63.05%)を混合。ゲーム映像、一人称視点の手作業動画、グリッパー、テレオペレーションなど14種類のエンボディメントを対象とし、多くのロボットデータはEE50と呼ばれる50次元の共有エンドエフェクタ行動空間で統一されている。
ベンチマーク結果
RoboLab-120は、Isaac Sim上の120種類のテーブルトップタスクをDROIDスタイルのFrankaアームで各10回試行するベンチマークだ。
| モデル | タイプ | パラメータ | RoboLab-120 |
|---|---|---|---|
| FLUX 3 Action | WAM | 7B | 42.92% |
| Cosmos3-Nano-Policy | WAM | 16B | 36.8% |
| π0.5 | VLA | 3.3B | 28.0% |
| DreamZero | WAM | 14B | 25.7% |
| GR00T N1.6 | VLA | 3B | 7.2% |
実機評価では、Positronic RoboticsがFrankaアームで10タスク・各3回のブラインド評価を実施。FLUX 3 Actionは30試行中28成功(93.3%)、Cosmos 3 Nanoは27/30、DreamZeroは20/30、π0.5は13/30だった。
3種類のチェックポイントと速度のトレードオフ
DROIDポリシーはBF16とFP8それぞれで以下の3レシピが提供される。
- Base: 4サンプリングステップ、スプリットガイダンス(動画CFG 4、行動CFG 1)
- Guidance-distilled: ガイダンスパスを1回に削減、1.8〜2倍高速、成功率は0.6〜1.08ポイント上昇
- Step-distilled: 1サンプリングステップ、3.15〜4倍高速、成功率は3.51〜4.32ポイント低下
1回の推論で32アクション(15Hz、2.13秒分)を出力する。π0.5が1.0秒分であることと比較すると、1コール当たりのカバー時間が長い。FP8のStep-distilledは、ワークステーション・データセンターGPUではπ0.5比1.34〜2.28倍高速だが、RTX 5090ではπ0.5より遅い点は留意が必要だ。
ファインチューニングとエッジ展開
独自デモンストレーションでのファインチューニングも可能で、DROIDレシピとSO-101向けLoRAレシピが公開されている。約200件のデモからSO-101のピック&プレーススキルを習得した例がドキュメントに示されている。
NVIDIAとの連携によりHugging Face LeRobotへのネイティブ統合とNVIDIA Jetsonでのエッジ展開もサポートする。LeRobotからの利用は以下のコードで始められる。
from lerobot.policies.flux3 import Flux3Policy
from lerobot.policies.factory import make_pre_post_processors
repo_id = "black-forest-labs/flux-3-action-droid"
policy = Flux3Policy.from_pretrained(repo_id)
preprocessor, postprocessor = make_pre_post_processors(policy.config, pretrained_path=repo_id)
なお、モデルの出力はジョイント目標値のみで、速度・力・ワークスペース制限は組み込まれていない。これらの制限はアプリケーション側で実装する必要がある。
ライセンスはFLUX Kommunity Licenseで、非商用利用のみ許可されている(「Kommunity」はBFLによるブランド表記であり、誤字ではない)。商用展開を検討する場合は別途確認が必要だ。ウェイト、コード、レシピはGitHubリポジトリとドキュメントで公開されている。
詳細はBlack Forest Labs Releases FLUX 3 Action: A 7B Open-Weights World Action Model That Tops RoboLab-120を参照していただきたい。