9月20日、The Decoderが「Runway wants to turn AI video generation into a live stream you control in real time」と題した記事を公開した。プロンプトを入力してから数十秒〜数分待つのが当たり前だったAI動画生成を、フレームバイフレームでリアルタイムに「操縦」できるライブストリーム形式に転換する——Runwayが目指しているのはそんな根本的なパラダイムシフトだ。カメラワーク、音声、外部コマンドをその場で受け付け、動画の内容を即座に制御できる世界を同社は本格的に追求し始めている。
フレームバイフレームで動画を「操縦」する
Runwayが目指しているのは、動画生成の待ち時間をゼロに近づけることだ。現在の動画生成AIは、プロンプトを入力してから完成した動画が出力されるまでの時間が長く、ユーザーはその間ただ待つしかない。Runwayはこの構造を根本から変えようとしている。
キーとなる技術は**GWM-1(General World Model 1)**だ。同モデルはGen-4.5をベースとし、動画をフレームバイフレームで逐次生成する。カメラの動き、ロボットへのコマンド、音声といった入力をリアルタイムで受け付け、その場で動画の内容を制御できる設計だ。従来モデルが「完成品を待つ」体験を提供するのに対し、GWM-1は「生成しながら介入できる」体験を目指している点が根本的に異なる。
この方向性はすでに複数のプロダクトで試されている。2026年3月に発表したRunway Charactersがその先駆けで、直近では**Solaris**というシステムも公開した。SolarisはGen-4.5を使い、UIをフレームバイフレームで生成し、クリックや音声入力に即座に反応する。いずれもリアルタイム生成という同じ哲学のもとに設計されており、Runwayがこのアーキテクチャを単なる研究段階にとどめず、製品レベルで検証し続けていることが見て取れる。
コスト面でも有利になる理由
Runwayはリアルタイム生成のメリットをスピードだけでなく、コスト削減の観点からも強調している。
モデルが高速になれば使用するGPU時間が減り、同じ品質を出力するコストが下がる。「ある品質水準における出力コスト」がアプリケーションの採算性を左右するとRunwayは主張しており、リアルタイム生成によってこれまで採算の合わなかった用途が成立するようになると見ている。コストの壁が下がることで、エンタープライズ向けのカスタム映像制作や、インタラクティブな広告・教育コンテンツといった領域への普及が加速する可能性がある。
また、コンピュート負荷の配分も変わる。現在の動画生成モデルはトレーニング時に大きな計算資源を消費するが、リアルタイム生成モデルではその負荷が推論時(使用時)にシフトする。各フレームを再生に追いつくスピードで生成しながら、複数セッションが同一ハードウェアを共有する設計が求められる。このトレードオフをインフラ側でどう吸収するかが、サービスとしての実用性を左右する重要な課題だ。
エラーが雪だるま式に増幅する問題
フレームバイフレーム生成には固有の技術的難題がある。
テキスト生成モデルは途中で誤りに気づけば文章を修正できるが、動画モデルは前のフレームを土台として次のフレームを生成するため、小さな誤りが連鎖的に増幅していく。たとえばある1フレームで被写体の輪郭が微妙にズレると、それを正しい状態として学習した次のフレームではさらにズレが拡大し、数秒後には破綻した映像になりかねない。Runwayはこれをアーキテクチャ上の中心的な問題と位置づけており、対策として「モデル自身の出力でモデルを訓練する」手法を採用している。誤りのない入力だけでなく、自分が生成した(場合によっては歪んだ)出力も学習データとして使うことで、誤りを増幅させるのではなく自己修正する能力を持たせる。

同様のアプローチはスタートアップのDecartが**MirageLSDで採用しており、意図的に歪んだ画像を学習データに混ぜることで対策している。Google DeepMindの世界モデルGenie 3**は24fps・720pでインタラクティブな3D世界を数分間にわたって整合性を保って生成できるとしており、業界全体でこの課題への取り組みが加速している。
ロボットと自動運転への応用
Runwayが長期的に最も大きなユースケースと見ているのが、ロボティクスと自律走行だ。
ロボットや自動運転車の行動評価には、エッジケース(想定外の状況)にリアルタイムで反応できる仮想環境が必要になる。RunwayはすでにGWM RoboticsというGWM-1の派生モデルを発表しており、ロボット向けの合成訓練データを生成する用途に特化している。実世界では収集困難な危険シナリオや稀少シチュエーションを仮想空間で大量に生成できる点が、この用途での最大の価値だ。
Waymoも同様のアプローチを取っており、Genie 3を基盤とした**Waymo World Model**を構築している。象との遭遇、竜巻、浸水した住宅街など、実際の車両が遭遇したことのない状況をシミュレートでき、Waymoのドライバーシステムは公道に出る前に仮想空間で数十億マイルを走行するとされている。
2026年3月にはRunwayがNvidiaと共同開発したリアルタイムモデルのリサーチプレビューをGTCカンファレンスで公開している。Vera Rubinプラットフォーム上で動作し、最初のフレームを100ミリ秒以内に生成するよう設計されているが、提供開始の時期は未発表のままだ。
詳細はRunway wants to turn AI video generation into a live stream you control in real timeを参照していただきたい。