FLUX 3は画像・動画・音声を単一モデルで同時学習 — 動画生成で主要競合に77〜93%の勝率(予備的結果)、ロボット制御への転用も視野に
DRANK

7月24日、Black Forest Labsが「FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence.」と題した記事を公開した。画像・動画・音声を単一アーキテクチャで同時学習するマルチモーダル基盤モデル「FLUX 3」の発表で、動画生成では主要競合モデルに対し予備的な評価ながら77〜93%の勝率を記録したとしている。さらに動画生成で得た表現をロボット制御のアクション予測に転用する取り組みも進んでおり、「生成AIの技術基盤を現実世界のインテリジェンス全般に拡張する」という野心的な方向性が示されている。

by @tf_official
Related Topics: AI Machine Learning Deep Learning