10月6日、The Decoderが「Reka AI's omni-model Rho-1 handles text, images, video, and robot control in a single model」と題した記事を公開した。Reka AIが発表したRho-1は、テキスト・画像・動画・ロボット制御アクションを、外部モデルへの委譲なしに単一の重みセットで完結させる190億パラメータのオムニモデルだ。カメラ映像を解釈するのと同じ重みが、そのままロボットの動作制御にも使われる——この設計の潔さは、従来のマルチモーダルAIとは一線を画す。さらに注目すべきは、ロボット訓練データの深刻な不足を「一般の動画から制御信号を逆算する」という逆ダイナミクスモデルで乗り越えた点だ。
単一モデルで全モダリティを処理——Rho-1の核心
多くのAIシステムは、タスクに応じて専用のモデルを呼び出す構成を取る。ツールコールや外部モデルへの委譲が一般的だ。これに対してRho-1は、すべてのモダリティをトークンとして同一のコンテキストウィンドウ上で処理する。外部モデルへのルーティングは一切行わない。
この設計の含意は大きい。カメラ画像を予測するのと同じ重みが、ロボットの動作制御にも使われる。マルチモーダルという言葉は近年広く使われるようになったが、Rho-1のような「単一の重みセットで入出力を完結させる」設計は、世界モデル(world model)研究の文脈で注目されているアプローチだ。物理世界の動作を内部的にシミュレートできるモデルを目指す研究潮流であり、単なるテキスト予測を超えた汎用的な推論・行動能力を視野に入れている。
動画生成についても、リアルタイムで連続した動画を生成し、生成中に新しい指示を受け取った場合も再起動なしに即応できる。テキスト・画像・動画・ロボット制御という異なる性質のタスクが、同じアーキテクチャのなかで統一的に扱われている点が、Rho-1の最大の特徴といえる。
ロボット訓練データの不足をどう克服したか
ロボット制御を単一モデルに組み込む上での最大の障壁は、訓練データの希少性だ。ロボット動作のラベル付きデータは、テキストや画像と比較して圧倒的に少ない。専用のロボットデータを大量に収集しようとすれば、コストと時間の両面で現実的でない壁にぶつかる。
Reka AIはこの問題に対して、逆ダイナミクスモデル(inverse dynamics model)を構築することで対処した。通常のインターネット上の動画から制御信号を逆算して抽出する仕組みだ。ある状態から次の状態への遷移を観測することで、その間に取られたであろう行動を推定する——この発想により、専用のロボット動作データがなくても、大量の一般動画から制御に必要な情報を引き出せる。
逆ダイナミクスモデルの詳細はReka AI公式ブログで公開されている(※当該ブログリンクは元記事内でも参照されているものだ)。関心のある読者はReka AIの公式ブログ(Inverse Dynamics Model for Interactive World Models)で技術的な詳細を確認できる。
訓練には320台のH100 GPUを使用し、期間は約3ヶ月だ。大規模な計算資源を要する点は否めないが、ロボット専用データへの依存を避けながらこの規模のオムニモデルを構築できたこと自体、手法の有効性を示している。
ベンチマーク・他モデルとの比較
元記事によれば、Rho-1はロボット制御タスクを含む複数のベンチマークで評価されている。単一モデルで複数モダリティを処理しながらも、個別タスク向けに最適化された専用モデルと競合できる水準の性能を示しているとされる。詳細な数値については元記事および関連論文を参照されたい。
比較対象として意識されているのは、ツールコールや外部モデルへの委譲によってマルチモーダル対応を実現する一般的なLLMベースのシステムだ。Rho-1のアプローチはそれらとアーキテクチャの思想から異なっており、「単一モデルで閉じていること」を設計上の優先事項として明示している点が特徴的だ。
Reka AIの立ち位置と背景
Reka AIはマルチモーダルAI分野での実績がある。元記事の記載によれば、Reka Coreをリリースしており、GPT-4・Claude 3・Gemini Ultraとベンチマーク上で競合するマルチモーダル言語モデルとして注目を集めた。Rho-1はその流れを受けた研究成果の一つとして位置づけられる。
Rho-1のリリースは、AI研究全体で進む「世界モデル」へのシフトとも連動している。ただし、テキストから動画を生成するモデルが即座に世界モデルとみなせるかどうかについては、研究者の間で定義の議論が続いており、Rho-1がその定義を満たすかどうかも現時点では慎重に判断する必要がある。ロボット制御まで含めた統一的な処理を単一モデルで実現している点は、世界モデルの要件に近づく試みとして評価されうるが、リサーチプレビューの段階であり、さらなる検証が求められる。
現時点ではリサーチプレビューの段階であり、一般向けの製品提供には至っていない。
詳細はReka AI's omni-model Rho-1 handles text, images, video, and robot control in a single modelを参照していただきたい。