9月22日、Michal Sutterが「Alibaba Qwen Releases Qwen-Image-2.1: A 7B Open-Weight Model for Image Generation and Editing」と題した記事を公開した。Alibaba Qwenチームが画像生成と編集を1つのモデルに統合した7Bオープンウェイトモデル「Qwen-Image-2.1」をリリースした。注目すべき点として、前モデルが採用していたApache 2.0ライセンスから商用有償のQwen Research Licenseへの変更があり、商用利用を検討する開発者・企業にとっては見落とせない変更だ。
ライセンス変更:Apache 2.0から商用有償へ
研究・評価目的での利用は可能だが、商用デプロイはQwenとの別途ライセンス契約が必要なQwen Research Licenseが適用される。前モデルのApache 2.0から変更された点であり、商用利用を検討する場合は事前確認が必須だ。
画像生成モデル市場では、MetaのLlama系やBlack Forest LabsのFLUXシリーズなど、オープンウェイトかつ商用利用可能なモデルが競合として存在する。Qwen-Image-2.1はこうした競合と比較して技術的な強みを主張しつつも、ライセンス面では一歩後退した形となる。商用プロダクトへの組み込みを前提にモデル選定をしている開発者は、この点を最初に確認しておく必要がある。
20Bから7Bへ、生成と編集を1チェックポイントに統合
2025年8月にリリースされた初代Qwen-Imageは20Bのパラメータを持ち、編集機能は別チェックポイント(Qwen-Image-Edit)として提供されていた。今回のQwen-Image-2.1は、その両機能を1つのチェックポイントにまとめ、パラメータ数を約3分の1の7Bに圧縮した。
ただし、「7B」はあくまで拡散トランスフォーマー(DiT)部分のみのカウントである。パイプライン全体では別途Qwen3-VL 8Bのテキストエンコーダーも読み込まれる点は、デプロイ時のキャパシティプランニングで注意が必要だ。
アーキテクチャ:prefix KV cacheが速度の鍵
GitHubリポジトリによると、パイプラインは以下の4コンポーネントで構成される。
- Transformer: 32層、7B、シングルストリームDiT、因果的アテンション(causal attention)
- テキストエンコーダー: Qwen3-VL 8B(テキスト指示と参照画像を1つの表現に変換)
- VAE: 64チャネルRGBAオートエンコーダー、16倍空間圧縮、ネイティブ透過対応
- スケジューラー: Flow Matching + Euler離散スケジューリング + ダイナミックシフティング
速度面での肝はアテンションマスクの設計にある。テキストトークンにはトークンレベルの因果的マスク、画像トークンには画像内チャンクレベルの双方向マスク(Qwenはこれを「mixed-granularity attention」と呼ぶ)を適用する。条件プレフィックス(テキストと参照画像)はノイズ付きの潜在変数より前に配置されるため、デノイジングステップをまたいでKV(キー・バリュー)キャッシュを使い回せる。テキストと参照画像の計算は最初のステップで1回だけ行い、残りのステップではそのキャッシュを再利用する仕組みだ。参照画像が多いほど節約効果が大きくなる。
主な機能
- ネイティブ透過(RGBA)出力: テキストからRGBA画像を生成、透過レイヤーの編集、写真からの被写体切り抜きが可能。
- マルチ参照編集: 最大10枚の参照画像を受け付ける。READMEのサンプルでは、6枚の顔写真からグループ写真を合成したり、5枚の参照からコーディネートを生成している。
- ローカル編集: 丸囲みや塗りつぶしアノテーション、マスクで編集対象の領域を指定できる。人物・製品のアイデンティティを保持した編集に対応。
- ネイティブ2K出力: デフォルト解像度2048×2048、最大2752×1536の7アスペクト比をサポート。
ベンチマーク結果
Qwenチームは独自ベンチマーク「Qwen-Image-Bench」での比較をブログで公開している。Qwen-Image-2.1の総合スコアは60.28で、オープンウェイトモデルの中では最上位(32BのFLUX 2 Maxは55.33)。ただし、クローズドモデルではGPT Image 2.5 Sunburstが67.01でトップに立ち、上位6モデルはすべてクローズドという状況だ。
自社ベンチマークである点には注意が必要だ。画像生成モデルの評価に広く用いられる独立系ベンチマークとしてGenEvalやT2I-CompBenchなどが存在するが、現時点でそれらによる第三者検証は確認できていない。Qwen-Image-Benchのスコアはあくまで参考値として捉え、独立した評価結果が出揃うまでは過度に信頼しないことが望ましい。
動かし方
PyTorch 2.4.0以降、transformers 5.17以降、Diffusers(ソースから)、accelerate、pillowが必要。最小限のtext-to-imageコードは以下のとおり。
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night",
num_inference_steps=40,
).images[0]
image.save("t2i.png")
image=引数に参照画像を渡せば同じパイプラインで編集にも対応する。GPUメモリが少ない環境ではpipe.enable_model_cpu_offload()でメモリ使用量を抑えられる。
サービング面では、vLLM-Omni(FP8量子化、prefix KVキャッシュ、テンソル並列)、SGLang(Cache-DiT、マルチGPU並列)、ComfyUIがDay 0でサポートされている。NVIDIA以外もAMD(ROCm)およびFlagOS経由で8チッププラットフォームに対応する。
また、短いプロンプトを詳細なプロンプトに展開するprompt-rewritingモデルとして、Qwen3.5-VL 9BをファインチューニングしたT2I用と編集用の2チェックポイントも同時リリースされている。
詳細はAlibaba Qwen Releases Qwen-Image-2.1: A 7B Open-Weight Model for Image Generation and Editingを参照していただきたい。