Qwen-Image-2.1:透明背景、10 張參考圖編輯與 2K 輸出
探索 Qwen-Image-2.1 的 7B 統一影像模型,支援原生 RGBA 輸出、最多 10 張參考圖、遮罩引導編輯,以及原生 2K 生成。
1. Qwen-Image-2.1 以單一 7B 模型同時處理生成與編輯
Qwen-Image-2.1 在同一模型管線中結合文字生成影像與影像編輯。其視覺生成元件採用具備 70 億參數的 32 層 Single-Stream DiT 架構。Qwen3-VL 8B 負責編碼文字與條件影像,而混合粒度注意力與 Prefix KV Cache 重複使用機制可減少重複運算。
這項設計在多圖編輯時尤其重要。模型可快取參考圖與編輯指令,不必在每個去噪步驟中再次處理相同的靜態內容。這為同時涉及人物、服裝、鞋履、包款或多個室內設計參考資料的任務,建立了更有效率的基礎。
2. 原生透明影像生成功能現已內建
常見的工作流程是先生成標準影像,再於後續移除背景。Qwen-Image-2.1 則可直接生成帶有原生 Alpha 通道的影像、編輯既有透明圖層,或從一般 RGB 相片中擷取選定主體,作為 RGBA 素材。
這使其適用範圍不僅限於貼圖與插畫。商品去背圖、人物、圖形元素與透明文字,都能直接進入後續的版面配置與合成工作流程。
Qwen 也展示了透明圖層中的表情與排版文字編輯,以及從真實照片中擷取主體。實際的改變不只是模型能夠移除背景,而是生成、編輯、擷取與透明素材輸出如今都整合在同一個模型中。
3. 最多 10 張參考圖支援更複雜的構圖
Qwen-Image-2.1 支援最多 10 張參考圖。官方展示包括將六張人像合成為團體照、以五個獨立參考資料組合出一套穿搭,以及利用 10 張家具圖片設計室內空間。
對電商與時尚團隊而言,多參考圖影像編輯可將模特兒、服裝、鞋履、包款與造型參考圖放入同一項任務。工作流程不再受限於每次只能編輯一張來源影像。
4. 圓圈、塗繪區域與獨立遮罩可引導局部編輯
局部影像編輯不只依賴文字。Qwen 的發布資料展示了三種標示目標區域的方法:
- 以不同顏色的圓圈圈選多個需要分別修改的區域。
- 在指定位置塗繪,告訴模型要在哪裡新增或替換內容。
- 將原始影像與獨立遮罩作為兩個輸入提供,以保留會被覆蓋式標註遮住的來源像素。
相較於在提示詞中描述「左側的物件」或「靠近頂部的項目」,這些輸入方式更精確。它們也為反覆與連續編輯提供了更清楚的控制方法。
5. Qwen 強調人像與商品保真度
Qwen 將人像身分與商品一致性列為兩項主要改進領域。人像編輯旨在保留可辨識的臉部特徵,而商品編輯則著重於當物品移至新場景時,維持其文字排版、材質紋理與外形。
這項能力與商品圖像工作流程尤其相關,但目前仍應視為 Qwen 的官方展示。若沒有以相同輸入進行重複測試,現有證據尚不足以證實其具備穩定的生產級商品保真度。
6. 原生 2K 輸出、文字排版與人像美學也有所提升
官方實作採用預設 2048 × 2048 尺寸,並列出適用於 1:1、4:3、3:4、3:2、2:3、16:9 與 9:16 輸出的建議尺寸。Qwen 的發布資料也展示了複雜文字排版、資訊圖表、全景圖、根據角色三視圖生成的分鏡,以及具備更細緻光影與細節的人像。
這些能力共同讓 Qwen-Image-2.1 不只是精簡的文字生成影像模型。它的設計旨在涵蓋從素材生成到後續編輯的更完整流程。
Qwen-Image-2.1 發布目前尚未證明的事項
- 官方範例未提供足夠完整的提示詞、設定或重複輸出結果,無法證實其一致性。
- 現有資料未確認 WeShop 是否已整合 Qwen-Image-2.1,也未記錄 WeShop 點數、生成時間與可調整設定。
- 開放權重採用 Qwen Research License。官方授權條款指出,模型材料的商業用途須另行取得商業授權。
- Qwen-Image-Bench 是由供應商發布的基準測試,不應取代在真實電商、設計或人像工作流程中的測試。
誰應該關注 Qwen-Image-2.1?
- 需要透明人物、商品、貼圖或合成元素的視覺設計師。
- 需要結合模特兒、服裝、鞋履、包款及其他參考資料的電商與時尚團隊。
- 希望以圓圈、塗繪區域或遮罩控制局部編輯的創作者。
- 對較小型模型、本地部署及更高效率多圖推理感興趣的開發者。
最終重點
Qwen-Image-2.1 的發布可用一句話概括:一個 7B 視覺生成元件現在能在同一創意管線中處理標準影像、透明影像、多參考圖構圖與局部編輯。
其最具特色且已有文件佐證的能力,是原生 RGBA 輸出與最多支援 10 張參考圖。下一個問題是,在反覆進行真實世界生成時,它能否穩定處理複雜商品、人像、文字排版與局部編輯。







