テキスト・画像・動画・ロボット制御を190億パラメータの単一モデルで——Reka AIの「Rho-1」が切り開くオムニモデルの新地平
DRANK

10月6日、The Decoderが「Reka AI's omni-model Rho-1 handles text, images, video, and robot control in a single model」と題した記事を公開した。Reka AIが発表したRho-1は、テキスト・画像・動画・ロボット制御アクションを、外部モデルへの委譲なしに単一の重みセットで完結させる190億パラメータのオムニモデルだ。カメラ映像を解釈するのと同じ重みが、そのままロボットの動作制御にも使われる——この設計の潔さは、従来のマルチモーダルAIとは一線を画す。さらに注目すべきは、ロボット訓練データの深刻な不足を「一般の動画から制御信号を逆算する」という逆ダイナミクスモデルで乗り越えた点だ。

by @tf_official
Related Topics: AI Deep Learning Robotics