Qwen-Image-3.0 とは?
Qwen-Image-3.0 は Alibaba の Qwen による第3世代の画像生成モデルで、視覚的な美しさのみに注力するのではなく、現実世界のクリエイティブやデザインのワークフローで有用性を高めることを目的としています。テキストから画像 (T2I) と 画像から画像 (I2I) の編集 の両方をサポートし、複雑なレイアウト、情報量の多いビジュアル、正確なテキスト描画、多言語タイポグラフィ、精緻な画像コンポジションを特に重視しています。
Alibaba は Qwen-Image-3.0 を、豊富なコンテンツ、忠実なディテール、深い知識 の3つの中核能力で位置づけています。最大約 4.5K トークン のプロンプトを受け付け、新聞、ストーリーボード、試験問題、マルチパネルのインフォグラフィック、UI モックアップなどの複雑な構成を単一リクエストで詳細に指定できます。10 ピクセル ほどの小さな文字の描画にも対応し、12 言語と 20 以上のフォント をサポート。髪の毛の一本一本、毛穴、顔の微細な表情といった繊細な視覚ディテールの再現にも設計されています。
Qwen-Image-3.0 の主な機能は?
複雑なレイアウト生成: Qwen-Image-3.0 は情報密度の高いビジュアル構成に特化しています。Alibaba は、3×3 のビジュアルグリッド、数学スライド、新聞、ストーリーボード、メニュー、試験問題など、複数の画像をつなぎ合わせるのではなく単一画像で生成された構造化デザインを例示しています。
長文の画像生成指示: 本モデルは最大約 4.5K トークン のプロンプトに対応し、オブジェクト、関係、タイポグラフィ、レイアウト、視覚的ヒエラルキー、スタイリングを1回の生成リクエスト内で詳細に指定できます。
きめ細かなテキストレンダリング: Qwen-Image-3.0 は小さな文字の描画に特化しており、Alibaba は 10px 程度の文字を強調しています。ポスター、インフォグラフィック、ダイアグラム、UI コンセプト、教育素材など、読めるテキストが画像の一部として重要なデザインに特に適しています。
多言語タイポグラフィ: 本モデルは 12 言語 と 20 以上のフォントでネイティブ描画に対応し、多言語のマーケティング素材、ローカライズ済みグラフィック、プロダクト UI、国際的なコンテンツ制作における有用性を拡大します。
画像編集: Qwen-Image-3.0 は参照画像と編集指示を組み合わせた image-to-image の生成・編集をサポートします。Alibaba の現行 API ドキュメントでは、I2I ワークフローに 1~3 枚の参照画像 が対応しています。
複数出力: API は1リクエストあたり最大 6 枚の出力画像 をサポートし、同一プロンプトから複数のバリエーションを生成できます。
Qwen-Image-3.0 技術仕様
Alibaba は Standard モデルの具体的なアクセスおよび機能情報を公開しています。以下の表は、開発者がショーケースを API の保証と取り違えないよう、文書化された制限とマーケティングレベルの主張を分けて示しています。
| 仕様 | Qwen-Image-3.0 |
|---|---|
| 開発元 | Alibaba Qwen Team |
| モデルタイプ | 画像 生成および画像編集 |
| 主なポジショニング | 品質・速度・コストのバランス |
| モデル ID | qwen-image-3.0 |
| 入力モダリティ | テキスト と画像 |
| 出力モダリティ | 画像 |
| 生成モード | テキストから画像; 画像から画像; 指示付き編集 |
| 最大プロンプト | 約 4.5K トークン |
| 参照画像 | 1-3 |
| 出力ピクセル範囲 | 総ピクセル数は 512 x 512 から 2048 x 2048 まで |
| 出力形式 | PNG |
| 小さなテキストレンダリング(主張) | 約 10 px |
| ネイティブでレンダリング可能な言語 | 12 |
| Standard のレート制限 | 文書化されたリージョンで 20 RPM |
| 関数呼び出し | 非 対応 |
| バッチ推論 | 非 対応 |
| ファインチューニング | 非 対応 |
| CometAPI エンドポイント | /v1/images/generations; /v1/images/edits |
Qwen-Image-3.0 ベンチマーク性能
| モデル | T2I Elo | T2I 順位 | 編集 Elo | 編集順位 | API 価格 / 1K |
|---|---|---|---|---|---|
| GPT Image 2 (high) | 1,367 | #1 | 1,257 | #4 | $211 |
| Nano Banana 2 | 1,319 | #3 | 1,250 | #7 | $67 |
| Qwen-Image-3.0-Pro | 1,284 | #9 | 1,250 | #5 | $43 |
| Seedream 5.0 Pro | 1,279 | #10 | 1,247 | #8 | $90 |
| Qwen-Image-3.0 | 1,275 | #11 | 1,218 | #15 | $30 |
結果の意味
- Standard と Pro の比較: テキストから画像の差はわずか 9 Elo だが、編集では Pro が 32 Elo リード。したがって、Pro に支払う最大の理由は初回生成よりも編集品質である可能性が高い。
- Seedream 5.0 Pro との比較: Standard はテキストから画像で 4 Elo 差で劣るのみで、Pro は 5 Elo リード。これらの小さな差は公表された不確実性の範囲内にあり、確定的な序列ではなく競合クラスターとして扱うべき。
- Nano Banana 2 との比較: Standard はテキストから画像で 44 Elo、編集で 32 Elo 劣後。Pro は編集の差を 1,250 Elo の同点まで縮める。
- GPT Image 2 との比較: GPT は Standard に対し、テキストから画像で 92 Elo、編集で 39 Elo のリード。したがって Qwen の訴求点は普遍的な品質リーダーシップではなく、価格性能とレイアウト特化にある。
- 旧 Qwen Image 2.0 Pro と比較すると、同じリーダーボードで Standard 3.0 はテキストから画像で 39 Elo 向上し、代表価格は 1,000 画像あたり $75 から $30 に低下。
Qwen-Image-3.0 vs GPT Image 2 vs Nano Banana 2
どの画像モデルも、あらゆる実運用の観点で首位というわけではありません。一般的嗜好、編集忠実度、テキスト描画、参照容量、出力解像度、グラウンディング、レイテンシ、コストなど、重視する軸によって勝者は異なります。以下の比較は、文書化された機能と独立した Arena の結果に焦点を当てています。
| 次元 | Qwen 3 Standard | Qwen 3 Pro | GPT Image 2 | Nano Banana 2 | Seedream 5 Pro |
|---|---|---|---|---|---|
| ポジショニング | 品質 / 速度 / コストのバランス | Qwen 最高 の忠実度 | プレミアムな 汎用画像モデル | 高速・ 大規模な Gemini 画像モデル | プロフェッショナルな デザインと編集 |
| T2I / 編集 Elo | 1,275 / 1,218 | 1,284 / 1,250 | 1,367 / 1,257 | 1,319 / 1,250 | 1,279 / 1,247 |
| 公称出力 | 約 2K | 約 2K | 柔軟な サイズ | 最大 4K | CometAPI 上で 約 2K |
| 参照入力 | 1-3 | 1-3 | 対応 | 複数参照 | CometAPI 上で 最大 10 |
| タイポグラフィの観点 | 4.5K の指示; 10px 主張; 12 言語 | 同じ中核 に注力しつつより高い忠実度 | 強力な 多言語テキスト | テキスト + 検索グラウンディング | 高密度 インフォグラフィックと空間制御 |
| Web グラウンディング | なし | なし | API の主要機能 ではない | Google 検索と画像検索 | アクセス経路 依存 |
| 最適用途 | コストを抑えた 高密度レイアウト | 高品質な Qwen 編集 | 最大の 一般的選好 | 高速な 4K と最新情報ワークフロー | 精密な編集 と多参照デザイン |