7月22日、The Decoderが「Alibaba's Qwen-Image-3.0 renders full infographic grids and readable ten-pixel text in a single pass」と題した記事を公開した。AlibabaのQwen-Image-3.0が1回の生成パスで複雑なレイアウトを出力し、10ピクセルの可読テキストを描画できる画像生成モデルとして登場した。前バージョンのQwen-Image-2.0がリリースされたのはわずか今年5月のことであり、そのわずか数か月で次世代モデルへと更新されたことになる。
10ピクセルで読めるテキストと、LaTeX数式の描画
画像生成AIの文字描画は長らく弱点とされてきた。その状況を変えようとするのが、Alibabaが新たにリリースしたQwen-Image-3.0だ。
最も目を引く仕様は、10ピクセルの小さなテキストを可読状態で生成できるという点である。デモでは、架空の代数幾何学論文1ページ分が生成されており、添字・上付き文字・分数・総和・積を含む複数行のLaTeX数式が再現されている。

架空の数学論文ページ。添字・上付き文字・総和・積を含む複数行の数式を描画。| 画像: Alibaba
他のデモでは、クジラザメのインフォグラフィック(大量のテキスト入り)、模擬新聞ページ、教師の赤ペンコメントを模した手書き風注釈なども示されている。
4,500トークンのプロンプトで3×3の9パネルグリッドを一発生成
Qwen-Image-3.0が受け付けるプロンプトは最大4,500トークン。この長さが、複数パーツを組み合わせるのではなく、1回のパスで密度の高いレイアウトを生成することを可能にしている。
公開されたデモの一つは、3×3グリッドに9つの独立したインフォグラフィックを敷き詰めたものだ。カバーする内容はトンネル付近の車間距離、垂線、儒教の感情と理性、回転円筒からの射体離脱速度、肝吸虫のライフサイクル、右側胸部痛、位数72の群に対するシロー定理、銀行の内部統制、動植物細胞のDNAと多岐にわたる。

工学・哲学・物理・医学・数学・金融・細胞生物学にわたる内容が1枚の画像にまとめられた3×3グリッド。| 画像: Alibaba
さらに、ネストされたUIのデモも公開されている。VSCodeウィンドウの中にQwen Chatの画面があり、その中にWeChatの会話スレッドがあり、その中にコーヒーの淹れ方を説明するポスターが含まれるという、4層ネスト構造のインターフェースを1枚の画像で表現している。
言語サポートと画像編集
Qwen-Image-3.0は12言語をネイティブサポートしており、日本語・韓国語・スペイン語が含まれる。Webのリアルタイムデータを取り込む機能も持ち、杭州の天気予報の生成デモや、水墨画家の斉白石(チー・バイシー)とフィンセント・ファン・ゴッホを同じ模擬ライブ配信スタジオに配置したデモが示されている。
画像編集の例としては、破損した鷹の闘争を描く伝統的な水墨画の修復デモがある。欠損部分を元の筆致と墨のグラデーションに合わせて補完するというものだ。また、昆虫の写真から分類学的情報・形態ラベル・拡大詳細図・スケールバーを備えた同定プレートを生成するデモも公開されている。

昆虫写真から同定プレートを生成。ラベル、クローズアップ、スケールバー付き。| 画像: Alibaba
デモの技術的水準と実用上の限界
The Decoderは、一部のデモの実用性については疑問も呈している。研究者は通常、論文をLaTeXで執筆・組版するため、数式入り論文ページを画像として生成しても、最終成果物ではなくモックアップや視覚的なドラフト向けの用途にとどまる可能性が高い。新聞ページや複雑なインフォグラフィックについても同様で、検索可能・編集可能なフォーマットの方が制作現場では柔軟性が高い。
この点は、競合モデルとの比較においても文脈を与える。前バージョンのQwen-Image-2.0はわずか今年5月にリリースされたばかりで、Alibaba独自のアリーナプラットフォームでの評価ではOpenAIのGPT-Image-2とGoogleのNano Banana Pro(Googleが2025年にリリースした画像生成モデル)に僅差で及ばない結果だった。Qwen-Image-3.0はその差を埋めるべく投入された位置づけとなるが、デモ段階のモデルである以上、実運用での再現性は今後の検証を待つ必要がある。
現時点でQwen-Image-3.0は招待制のAPIアクセスのみで提供されており、Qwen Chatなどのファーストパーティアプリへの展開は近日中に予定されている。初代Qwen-Imageのようなオープンライセンスでのモデルウェイト公開は見込み薄とのことだ。
詳細はAlibaba's Qwen-Image-3.0 renders full infographic grids and readable ten-pixel text in a single passを参照していただきたい。