7月24日、Black Forest Labsが「FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence.」と題した記事を公開した。画像・動画・音声を単一アーキテクチャで同時学習するマルチモーダル基盤モデル「FLUX 3」の発表で、動画生成では主要競合モデルに対し予備的な評価ながら77〜93%の勝率を記録したとしている。さらに動画生成で得た表現をロボット制御のアクション予測に転用する取り組みも進んでおり、「生成AIの技術基盤を現実世界のインテリジェンス全般に拡張する」という野心的な方向性が示されている。
「モダリティを分けて学習する」アプローチからの脱却
FLUX 3の設計思想の核心は、画像・動画・音声を別々のモデルで扱うのではなく、同一のアーキテクチャで同時学習する点にある。
BFLの説明によれば、各モダリティは「同一の現実世界を異なるセンサーで投影したもの」に過ぎない。画像は特定時点の空間構造を捉え、動画は時間次元と物理的なダイナミクスを加え、音声は視覚だけでは検出できない因果関係(衝撃と音の対応など)を明らかにする。それぞれを単独で学習すれば、その投影の良いモデルが得られる。だがすべてを同時に学習することで、モダリティ間の相互制約が追加の情報を提供する——音はその衝撃に一致しなければならず、動きは質量に従わなければならない、という具合だ。
技術的な基盤として、BFLはSelf-Flowと呼ぶ独自アプローチを採用している。これはマルチモーダルな生成と理解を同一アーキテクチャ内でアライメントする手法で、FLUX 3ではこれを大規模に拡張してコンピュートとデータを増強した。Self-FlowはFréchet距離(生成品質を測る指標)において従来のFlow Matchingを上回り、ロボット操作タスクの成功率でも改善が見られるとしている。
動画生成:競合比較での勝率が公開
現時点で最も具体的なデータが示されているのが動画生成機能だ。
FLUX 3 Videoは最長20秒の動画をネイティブ音声付きで1回の生成で出力できる。テキスト→動画、画像→動画、動画→動画の変換に加え、キーフレーム間のトランジション生成、多言語ダイアログ、個別クリップを連結した長尺シーケンス生成にも対応する。スタイルの幅は広く、手持ちカメラ映像風からアニメーション、シネマティックまでカバーするとしている。
初期評価(720p・10秒のテキスト→動画クリップで実施)での比較勝率は以下の通りだ。BFLは「モデルとハーネスはまだ開発中であり、これらは予備的な結果」と明示しており、数値の解釈には留意が必要だ:
| 比較対象 | FLUX 3が優位とされた割合 |
|---|---|
| Runway Gen-4.5(Runwayの動画生成モデル) | 77% |
| Luma Ray 3.2(Luma AIの動画生成モデル) | 93% |
| Grok Imagine Video(xAIの動画生成モデル) | 69% |
| Kling v3 Pro(Kuaishouの動画生成モデル) | 60% |
| Happy Horse v1(ByteDanceの動画生成モデル) | 59% |
| Seedance 2.0(ByteDanceの動画生成モデル) / Gemini Omni Flash(Googleのマルチモーダルモデル) | 52% |
アーリーアクセス期間中にさらなる改善を見込むとしており、現時点の数値はあくまで開発途上における暫定的な指標として示されている。
画像生成とロボティクスへの展開
画像生成機能(FLUX 3 Image)は数週間以内にアーリーアクセスを開始する予定だ。ミッドトレーニング中の評価では、複雑なプロンプトへの対応力と多言語テキストのレンダリング精度が旧バージョンから大幅に向上しているという。
物理AIへの応用も今回の発表の重要な柱だ。ロボット学習スタートアップのmimic roboticsと共同で、FLUX 3の動画バックボーンを転用した「FLUX-mimic」を開発している。巧緻な操作(dexterous manipulation)のための動作モデルとして、Audiの実生産タスクでテストが行われているとしている。動画生成で学んだ「物体がどう動くか」の表現が、ロボットのアクション予測に転用できるという仮説の実証を目指している。
単一モデルで複数モダリティを統合学習するアーキテクチャが、生成AIの領域を超えてロボティクスのような実世界応用にも有効であるかどうかは、今後の検証次第だ。FLUX-mimicのリリースとその評価結果が、この方向性の妥当性を測る重要な試金石となるだろう。
リリース計画
今後数週間〜数ヶ月で段階的に公開される予定のコンポーネントは以下の通りだ:
- FLUX 3 Video:動画・音声の生成・編集(API+プライベートウェイト)
- FLUX-mimic / FLUX 3 Action:アクション予測(選定パートナー向け)
- FLUX 3 Image:画像生成・編集(API+プライベートウェイト)
- FLUX 3 Dev:コンテンツ生成とアクション予測向けのオープンウェイト公開
アーリーアクセスの申請はこちらから受け付けている。採用もドイツ・米国で行っている。
詳細はFLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence.を参照していただきたい。