什麼是 Qwen-Image-3.0?
Qwen-Image-3.0 是 Alibaba Qwen 的第三代影像生成模型,旨在使 AI 生成影像更貼近真實世界的創意與設計工作流程,而非僅專注於視覺美感。它同時支援 文字到影像(T2I) 與 影像到影像(I2I)編輯,特別強調複雜版面、資訊密集的視覺內容、精準的文字渲染、多語排版,以及細緻的影像構圖。
Alibaba 將 Qwen-Image-3.0 的定位圍繞三大核心能力:豐富內容(Rich Content)、真實細節(Authentic Details)、深層知識(Deep Knowledge)。該模型可接受最長約 4.5K tokens 的提示,允許使用者在單次請求中描述如報紙、分鏡(storyboards)、試卷、多分欄資訊圖(infographics)與介面模型等複雜構圖。它亦可渲染小至 10 像素 的文字,支援 12 種語言與超過 20 種字型,並設計用於重現髮絲、毛孔、臉部微表情等精細視覺細節。
Qwen-Image-3.0 的關鍵功能是什麼?
複雜版面生成: Qwen-Image-3.0 專為高資訊密度的視覺構圖設計。Alibaba 展示了在單張影像中生成的版面,包括 3×3 視覺網格、數學簡報、報紙、分鏡、菜單、試卷,以及其他結構化設計,而無需將多張影像拼接。
更長的影像生成指令: 該模型支援最長約 4.5K tokens 的提示,讓使用者能在一次生成請求中更充分地指定物件、關係、排版、版面、視覺層級與風格。
細粒度文字渲染: Qwen-Image-3.0 專為渲染小字而設計,Alibaba 強調可達 10px。這使其特別適用於海報、資訊圖、示意圖、UI 概念、教育素材,以及其他需要在影像中呈現可讀文字的設計。
多語排版: 該模型原生支援 12 種語言 與超過 20 種字型 的渲染,擴展其在多語行銷素材、本地化圖形、產品介面與國際化內容製作中的實用性。
影像編輯: Qwen-Image-3.0 支援以參考影像結合編輯指令的以影像生影像(I2I)生成與編輯。Alibaba 目前的 API 文件在 I2I 工作流程中支援 1–3 張參考影像。
多重輸出: 該 API 每次請求最多支援輸出 6 張影像,允許使用者從同一提示中生成多個變體。
Qwen-Image-3.0 技術規格
Alibaba 為 Standard 模型提供了具體的存取與能力資訊。下表將已文件化的限制與行銷層面的宣稱區分開來,以免開發者將展示視為 API 保證。
| 規格 | Qwen-Image-3.0 |
|---|---|
| 開發者 | Alibaba Qwen Team |
| 模型類型 | 影像生成與影像編輯 |
| 主要定位 | 品質、速度與成本的平衡 |
| 模型 ID | qwen-image-3.0 |
| 輸入模態 | 文字與影像 |
| 輸出模態 | 影像 |
| 生成模式 | 文字到影像; 影像到影像; 指令式編輯 |
| 最大提示 | 約 4.5K tokens |
| 參考影像 | 1-3 |
| 輸出像素範圍 | 總像素從 512 x 512 到 2048 x 2048 |
| 輸出格式 | PNG |
| 宣稱小字渲染 | 約 10 px |
| 原生視覺文字語言 | 12 |
| 標準速率限制 | 已記錄區域為 20 RPM |
| 函式呼叫 | 不支援 |
| 批次推論 | 不支援 |
| 微調 | 不支援 |
| CometAPI 端點 | /v1/images/generations; /v1/images/edits |
Qwen-Image-3.0 基準表現
| 模型 | T2I Elo | T2I 排名 | 編輯 Elo | 編輯排名 | API 價格 / 1K |
|---|---|---|---|---|---|
| GPT Image 2 (high) | 1,367 | #1 | 1,257 | #4 | $211 |
| Nano Banana 2 | 1,319 | #3 | 1,250 | #7 | $67 |
| Qwen-Image-3.0-Pro | 1,284 | #9 | 1,250 | #5 | $43 |
| Seedream 5.0 Pro | 1,279 | #10 | 1,247 | #8 | $90 |
| Qwen-Image-3.0 | 1,275 | #11 | 1,218 | #15 | $30 |
結果解讀
- Standard 與 Pro:在文字到影像上差距僅 9 Elo,但 Pro 在編輯上領先 32 Elo。因此,選擇 Pro 的最強理由可能是編輯品質,而非首次生成。
- 對比 Seedream 5.0 Pro:Standard 在文字到影像僅落後 4 Elo,而 Pro 領先 5 Elo。這些小差距落在已發布的不確定性範圍內,應視為競爭集群,而非明確排序。
- 對比 Nano Banana 2:Standard 在文字到影像落後 44 Elo,在編輯落後 32 Elo。Pro 將編輯差距縮小到與 1,250 Elo 打成平手。
- 對比 GPT Image 2:GPT 在文字到影像上領先 Standard 92 Elo,在編輯上領先 39 Elo。因此,Qwen 的訴求在於性價比與版面專長,而非全面的品質領先。
- 與先前的 Qwen Image 2.0 Pro 相比,Standard 3.0 模型在同一排行榜上的文字到影像 Elo 提升了 39,而代表性價格從每 1,000 張影像 $75 降至 $30。
Qwen-Image-3.0 對比 GPT Image 2 與 Nano Banana 2
沒有任何影像模型在所有生產向度上全面領先。整體偏好、編輯保真、文字渲染、參考容量、輸出解析度、對齊能力、延遲與成本,可能指向不同的最佳選擇。下列比較聚焦於已文件化的能力與獨立 Arena 成果。
| 維度 | Qwen 3 Standard | Qwen 3 Pro | GPT Image 2 | Nano Banana 2 | Seedream 5 Pro |
|---|---|---|---|---|---|
| 定位 | 品質 / 速度 / 成本平衡 | Qwen 最高保真度 | 高端通用影像模型 | 快速、高吞吐量的 Gemini 影像模型 | 專業設計與編輯 |
| T2I / 編輯 Elo | 1,275 / 1,218 | 1,284 / 1,250 | 1,367 / 1,257 | 1,319 / 1,250 | 1,279 / 1,247 |
| 標稱輸出 | 約 2K | 約 2K | 彈性尺寸 | 最高 4K | 在 CometAPI 約 2K |
| 參考輸入 | 1-3 | 1-3 | 支援 | 多參考 | 在 CometAPI 最高 10 個 |
| 字體/排版側重 | 4.5K 提示;10px 宣稱;12 種語言 | 相同核心側重且保真度更高 | 強大的多語文字 | 文字加搜尋對齊 | 高密度資訊圖與空間控制 |
| 網路對齊 | 否 | 否 | 非標誌性 API 功能 | Google 搜尋與 Image Search | 取決於存取路徑 |
| 最佳適用 | 高密度版面且成本可控 | 高品質 Qwen 編輯 | 整體偏好最大 | 快速 4K 與即時資訊工作流程 | 精確編輯與多參考設計 |