Google、動画生成APIの前フレーム参照を1秒から10秒に拡大——Gemini APIの新モデル「Veo/Omni系」でシーン拡張の一貫性を強化
DRANK

8月28日、Googleが「Gemini Omni 1.1 Flash lets you build with more control」と題した記事を公開した。開発者向け動画生成API「Gemini Omni 1.1 Flash」の新機能と制御性向上について詳述した内容で、なかでもシーン拡張時の前フレーム参照ウィンドウが従来の1秒から10秒へと大幅に拡大された点が注目される。Gemini Omni 1.1 FlashとはGemini Omniは、Googleが提供するマルチモーダル生成AIモデルシリーズだ。テキスト・画像・音声・動画といった複数のモダリティ(情報形式)を横断して処理・生成する能力を持ち、実世界の推論能力を生成コンテンツ制作に組み込むことを目的として開発されてきた。なお、Googleの動画生成モデルとしては「Veo」シリーズが広く知られており、Gemini Omniは主にマルチモーダル推論・生成を統合した系統のモデルとして位置づけられる。「Gemini Flash」の名称はテキスト系の軽量モデルとしても広く使われているため、本モデルはあくまで動画生成ワークフロー向けに最...

by @tf_official
Related Topics: AI Google Cloud AI Image Generator