8月25日、The Decoderが「Alibaba's Wan3.0 generates AI videos up to 30 seconds long from text, images, and documents」と題した記事を公開した。AlibabaのAI動画生成モデル「Wan3.0」がベータ公開され、PDFやPowerPointといった静的ドキュメントをそのまま最大30秒・1080pの動画に変換できる——これが前世代から最も大きく踏み込んだ点だ。テキスト・画像・Web・音声まで一括処理するマルチモーダルアーキテクチャを備え、APIと専用Webサイトの両方から利用できる。
PDFやPowerPointを動画に変換——Wan3.0の入力の幅が広い
Wan3.0の最大の特徴は、入力ソースの多様さだ。テキストや画像はもちろん、Webページ・PDF・PowerPointファイルも受け付ける。静的なドキュメントをそのまま動画に変換できる点は、前世代のWan2.5にはなかった機能だ。
マルチモーダル処理も強化されており、1つのプロンプトに対して画像10枚・動画5本・音声クリップ5本を同時に含めることができる。テキスト・画像・動画・音声を並行処理するアーキテクチャを採用している。
最大30秒、1080p——前世代から倍増
動画の最大長は30秒で、前世代Wan2.5の15秒から倍増した。解像度は480p・720p・1080pに対応する。プロンプトの内容に応じて最適な動画尺を自動推奨する機能も備えており、既存動画を延長するエクステンションツールも用意されている。
AI生成動画で頻出する課題——顔やUIのビジュアル崩れ、フレーム間のドリフト——についても、Alibabaはキャラクター・小道具・空間レイアウトの一貫性を参照素材から維持する仕組みで対処したと説明している。
Wan2.5からの主な改善点まとめ
Wan2.5(プレビュー段階)と比較すると、Wan3.0では以下の点が主に強化されている。
- 最大動画長:15秒 → 30秒(倍増)
- ドキュメント入力対応:Wan2.5では非対応だったPDF・PowerPoint・Webページへの対応を追加
- マルチモーダル入力の拡充:1プロンプトあたり画像10枚・動画5本・音声5本を同時処理
- 時間的一貫性の改善:キャラクター・小道具・空間レイアウトの維持精度を向上
なお、Sora・Kling・Runwayといった競合モデルとの直接的な品質比較は、元記事では言及されていない。
料金体系:1080p・30秒で$6〜$8.40
APIアクセスはQwen Cloud経由で提供されており、料金は以下の通りだ。
| 解像度 | Standard(1秒あたり) | Prime(1秒あたり) | 30秒(Standard) | 30秒(Prime) |
|---|---|---|---|---|
| 480p | $0.05 | $0.068 | $1.50 | $2.04 |
| 720p | $0.10 | $0.14 | $3.00 | $4.20 |
| 1080p | $0.20 | $0.28 | $6.00 | $8.40 |
現在StandardプランはQwen Cloud上で30%割引が適用されているが、この割引がベータ期間限定の一時的なものか、恒久的な価格設定かは元記事では明示されていない。正式リリース時に価格が変更される可能性がある点は留意しておきたい。
StandardとPrimeの違いは生成速度で、品質の差については明示されていない。利用はwan.videoのWebサイト、Alibaba Cloud Model Studio、またはAPIから可能だ。
Alibabaが想定するユースケース
Alibabaが公式に挙げているユースケースは以下の通りだ:
- 映像制作の高速化(フィルム制作ワークフローへの組み込み)
- ショートドラマ・SNSクリップの生成(コンテンツクリエイター向け)
- マーケティング・研修動画の自動生成(企業向け)
- 自動運転・ロボティクス向けシミュレーション映像の生成(技術開発者向け)
Alibabaの背景:AI投資を積極的に拡大
Wan3.0のリリースは、Alibabaがグループ全体でAI投資を急拡大している時期と重なる。同社は直近の四半期で営業利益が前年同期比75%減となったことを報告しているが、これはAI関連投資の急増が主因であり、事業の収益基盤が悪化したわけではない。あわせて、香港上場企業として過去最大規模の株式売却でAI開発資金を調達すると発表しており、Wan3.0はその投資加速の成果の一つと位置づけられる。コストを抑えながら商用化を急ぐ姿勢が、積極的な価格設定にも表れている。
詳細はAlibaba's Wan3.0 generates AI videos up to 30 seconds long from text, images, and documentsを参照していただきたい。