人工智慧

阿里 Qwen-Image-3.0 問世:主打圖裡的字更精準

2026 年 7 月 21 日,阿里巴巴旗下 Qwen 團隊發布第三代圖像生成基礎模型 Qwen-Image-3.0。這次升級的重點不再只是「畫得好看」,而是要把生成的圖做到「能直接拿去用」:一份報紙版面、一張試卷、一組短劇分鏡、一張九宮格知識圖,一句夠長的指令就能產出。官方用一句話概括這次轉向的方向:「落字成畫,字字如印。」

能撐起這句話的關鍵,是模型讀懂複雜指令、把大量文字準確排進畫面的能力,這也是 Qwen-Image-3.0 這次改動幅度最大的地方。

最大升級:複雜圖文一次生成

官方表示,Qwen-Image-3.0 能讀懂的提示詞長度,從前一代大約 1,000 個 token 拉長到 4,500 個 token,相當於放大 4.5 倍。提示詞變長,代表使用者能在同一句指令裡塞進更多版面規範、文字內容與排版要求,不用把一張複雜的圖拆成好幾次生成,再自己手動拼接。

Qwen-Image-3.0 可讀懂的提示詞從前一代約 1,000 token 拉長到 4,500 token,官方宣稱放大約 4.5 倍
提示詞長度從約 1,000 token 拉到 4,500 token,一句指令能塞進更多版面與排版要求(資料來源:Qwen 官方)。

官方舉的例子包括報紙版面、試卷、短劇分鏡表,以及一張把多個知識點濃縮進去的九宮格知識圖。這幾種輸出的共同點是版面裡文字量大、排版規則細,過去的生成模型很容易漏字、錯字或排版跑掉。官方宣稱,這一代連 10 像素大小的小字都清晰可讀,同時能處理 LaTeX 數學公式、上下標、手寫批註,以及報紙那種資訊密集的排版方式;也能在同一張圖裡同時畫出多層 UI 介面,等於把好幾個應用程式畫面排進同一張構圖。

官方示範 Qwen-Image-3.0 以一句 4,500 token 長指令,一次生成報紙、試卷、短劇分鏡、九宮格知識圖與多層 UI 版面
一句長指令就能一次產出報紙、試卷、九宮格知識圖這類文字量大的版面,過去得多次生成再手動拼接(資料來源:Qwen 官方)。

官方主打的三大能力

除了長指令與複雜排版,官方在發表時把 Qwen-Image-3.0 的能力歸納成三個重點。

官方把 Qwen-Image-3.0 歸納為三大能力:文字與風格涵蓋、細節真實度,以及語義並置與空間控制
官方主打的三大能力,其中細節真實度屬單方面宣稱,實際表現仍待更多獨立測試確認。

第一是文字與風格的涵蓋範圍。官方宣稱支援 12 種語言、20 種以上的字型,以及 100 種以上的藝術風格,也能渲染各式各樣的使用者介面畫面,同一個模型不只處理中英文,連多語言版面、不同視覺風格的需求都一次涵蓋。

第二是細節真實度。官方形容這一代的人像生成連毛孔、髮絲都纖毫畢現,肌膚質感逼近攝影作品的水準。這類形容詞屬於官方單方面的宣稱,實際表現如何,仍要等更多獨立測試出爐才能確認。

第三是語義並置與空間控制。官方稱,模型能在同一張畫面裡安排多個物件、角色或元素的相對位置與關係,處理多層語意嵌套的複雜指令,像是畫面左側呈現一個情境、右側疊一層另一個情境的說明文字,這類需要同時理解多組空間與語意關係的要求。

編輯功能同步進化

這一代的進步不只發生在「從零生成」,官方也把文生圖累積的文字渲染能力、細節表現與世界知識,轉移到圖片編輯的場景裡。

官方列出的編輯功能包括古畫修復、全景圖生成、把手繪草圖轉換成簡報投影片,以及多角度鏡頭生成。以古畫修復為例,模型得先看懂畫作原本的筆觸、色調與缺損位置,才能補上合理的內容;手繪草圖轉簡報則需要模型讀懂草圖裡的版面意圖,重新排成一張正式的簡報頁面。這兩種任務都仰賴模型對「這張圖原本該長什麼樣子」有一定程度的理解,不只是單純的像素修補。

使用方式與開放進度

目前 Qwen-Image-3.0 已經在阿里雲百煉與 Qwen AI 平台開放 API 邀請測試,開發者申請後就能取得存取權限,把這個模型接進自己的產品或工作流程。官方也表示,Qwen Studio 與 Qwen App 即將開放免費體驗,讓一般使用者不用寫程式,也能直接在介面上試用這一代的生成與編輯功能。

Qwen-Image-3.0 現階段開放進度:API 邀請測試已開放,Qwen Studio 與 Qwen App 免費體驗即將上線
現階段開發者可先透過 API 邀測接入,一般使用者的免費體驗要等 Qwen Studio、Qwen App 上線(資料來源:Qwen 官方)。

換句話說,現階段主要是開發者與早期嘗鮮者能先上手,一般使用者得再等 Qwen Studio、Qwen App 的免費體驗上線,才有機會不透過 API 直接使用。

背景與初步觀察

把時間拉長一點看,Qwen-Image-3.0 延續的是 Qwen-Image 這條產品線一路演進的血緣。初代 Qwen-Image 採用 20B 參數規模、MMDiT(多模態擴散 Transformer)架構,總共堆疊 60 層,這是官方當時公開的規格,3.0 這一代目前還沒有另外公布對應的參數細節。

這一代目前先開放 API,還沒有附上模型權重、技術報告或跑分數據。不過,Qwen-Image 初代曾以 Apache 2.0 授權開源,第二代也發布過技術報告,先例都在,這代看起來走的是「先上線、細節後補」的節奏,權重與更完整的技術資料有機會之後陸續補上。

發布首日,國外社群像 Hacker News 上的初步討論反應不一。有使用者反映複雜排版偶爾還是會出錯,部分語言的呈現也有瑕疵;也有人肯定這一代在文字渲染方向的進展。不過模型才剛上線,能拿到的實測樣本還很少,現在下定論仍嫌太早,Qwen 系列在文字渲染上原本就是強項之一,這一代等於是把「資訊密度」這件事再往前推一步。

至於跑分,前一代 Qwen-Image 2.0 Pro 在阿里自家建置的 Qwen-Image-Bench 排行裡大約排在第 5 名,由 GPT Image 2 拿下第一;Qwen-Image-3.0 目前還沒有官方公布的跑分成績。

對設計、行銷與網站經營者來說,這類模型的意義比較接近加速草稿的工具。一張資訊圖、一張海報草案,或是一組 UI 初稿,原本要花時間排版拼接的步驟,有機會靠一句指令先跑出接近完成度的版本。最後要不要正式對外使用,還是得看文字的正確性與版面細節,多半得靠人工再確認、再修一輪。

資料來源
  1. Qwen-Image-3.0: Rich Content, Authentic Details, Deep Knowledge — Qwen
  2. Qwen-Image-3.0: Rich Content, Authentic Details, Deep Knowledge (Discussion) — Hacker News
  3. Qwen-Image-Bench: Beyond Basic Generation — Evaluating T2I Models in Complex Scenarios — Alibaba Cloud
  4. QwenLM/Qwen-Image — GitHub