Qwen-Image 2.1 將影像生成與編輯整合進單一開放權重研究模型
阿里巴巴 Qwen 團隊將 Qwen-Image 2.1 定位為統一的影像生成與編輯模型,並公布透明度、參考控制與廠商基準測試成績。

阿里巴巴 Qwen 團隊以開放權重研究授權釋出 Qwen-Image 2.1,商業使用則須適用另行條款。這次釋出被定位為同時支援文字生成影像與影像編輯的單一模型,而不是將「依提示建立影像」與「修改既有影像」拆成兩套系統。這種整合是核心變化:Qwen-Image 2.1 不只被描述為生成器,也被描述為可接收指令、視覺參考與局部引導的編輯模型。
這項釋出受到關注,原因是許多影像工作流程會在創作與修訂之間反覆移動。使用者可能先從文字提示開始,接著要求角色保持一致、物件被改動、背景被調整,或輸出具透明區域的素材。Qwen-Image 2.1 宣稱的設計直接對應這條流程。它支援原生 RGBA 透明度、最多十張參考影像、用於局部指令的遮罩與圓圈、身分保留,以及七種長寬比的 2K 輸出,顯示其目標是受控迭代,而不只是從提示到圖片的輸出。
Qwen-Image 2.1 的變化
最明顯的變化,是在一次開放權重研究釋出中整合生成與編輯。就實務而言,該模型被描述為可在統一框架內處理新影像建立與既有影像修改。這本身並不能證明它在所有任務上的品質相同;但它代表 Qwen 團隊將生成與編輯呈現為同一版本的能力,並由同一套較廣架構與工具路徑支援。
原生 RGBA 透明度是另一項值得注意的變化,因為它把透明度視為影像輸出的一部分,而不是後處理假設。RGBA 包含 alpha 通道,因此模型的原生支援可能影響需要透明區域的輸出。已驗證資訊未說明這項能力在不同提示下的可靠程度,也未證明它優於其他做法。它顯示的是:透明度是 Qwen-Image 2.1 公布的能力,而非另行描述的外部附加元件。
模型也透過參考影像條件擴大控制方式。Qwen-Image 2.1 支援最多十張參考影像,並支援用於局部指令的遮罩與圓圈。這些功能對應不同控制形式:參考影像可引導外觀或內容,遮罩與圓圈則可指示指令應套用的位置。釋出資料也宣稱支援身分保留,這在同一主體需要於多次編輯或生成中維持可辨識時具有相關性。不過,簡報資料未提供身分一致性的獨立量測,因此這項能力應視為公布功能,而非已驗證的效能主張。
架構如何被描述
Qwen-Image 2.1 使用具 70 億參數、32 層的視覺擴散 Transformer,以及 80 億參數的 Qwen3-VL 編碼器。前者是釋出資料所描述的視覺生成骨幹,Qwen3-VL 編碼器則提供系統的視覺語言部分。這些數字描述的是官方公布的模型規模與架構,但若沒有獨立評估,並不會自動轉換為品質、速度或效率。
釋出資料也點名混合粒度注意力與 prefix key-value caching 作為偏向效率的設計選擇。混合粒度注意力被描述為意在提升效率,prefix key-value caching 也在同一脈絡中被提出。已驗證事實不包含吞吐量、記憶體使用、延遲或成本量測,因此效率討論必須保持有限:這些技術是其宣稱設計的一部分,但其真實世界影響在此並未由獨立測試建立。
模型支援七種長寬比的 2K 輸出。這讓該版本具備明確輸出目標與一組構圖選項,對需要不只單一正方形格式的工作流程可能相關。不過,「2K」支援與多種長寬比,應與美感或任務準確度分開看待。輸出尺寸描述的是解析度能力;它不能證明文字呈現、物件位置、編輯結果、身分保留或透明度在所有情況下都正確。
基準測試數字顯示什麼
在 Qwen 自家的基準測試中,Qwen-Image 2.1 得分 60.28,Nano Banana 2 則為 59.82。這是廠商回報的基準測試結果,不是獨立測試。這項區分很重要。企業基準測試可以提供一個有用訊號,說明發布者如何評估其模型;但它本身無法決定更廣泛使用情境、其他評估方法或外部測試條件下的比較效能。
就數字而言,分數差距不大:60.28 對 59.82。已驗證事實未提供基準測試方法、任務組成、變異、信賴區間或獨立重現結果。因此,這個數字只支援有限結論:Qwen 回報 Qwen-Image 2.1 在 Qwen 自家基準測試中高於 Nano Banana 2。它不能證明整體優越性、穩定的使用者端優勢,或在每一種生成與編輯情境中都有更好表現。
這項區分也適用於模型的功能組合。支援透明度、參考影像、遮罩、圓圈、身分保留與 2K 輸出,描述的是系統被設計來執行的事項。基準測試分數描述的是它在 Qwen 回報評估中的表現。兩者單獨都不能證明模型在特定生產管線、創意流程或研究設定中的行為。若要驗證發布者報告之外的品質、穩健性與效率,仍需要獨立量測。
對研究工作流程的實務意涵
開放權重研究授權對研究人員具有意義,因為它允許在研究條款下存取模型權重,而商業使用需要另行條款。這種結構將研究可得性與不受限制的商業部署分開。實務意涵是,實驗室、開發者與評估者可在授權條件內檢視此版本;但考慮商業使用的組織,必須超出研究授權範圍,取得適當條款。
工具支援是另一個實務要素。官方宣布支援 Diffusers、ComfyUI、vLLM 與 SGLang。這點重要,因為這些框架與介面會影響模型被測試、整合或比較的速度。支援公告並不能證明每一項整合的成熟度,也不能證明各執行環境的效能。它表示 Qwen-Image 2.1 是以數種常見部署與工作流程路徑為考量而釋出。
對影像生成與編輯研究而言,最具體的意涵,是多種控制介面被放進同一個開放權重研究模型:文字提示、參考影像、局部遮罩與圓圈、身分保留、透明度,以及多種輸出長寬比。因此,這項釋出提供研究人員一個可跨創作與修訂任務檢視的模型。未解問題同樣清楚:基準測試由廠商回報,效率提升被描述為設計意圖,而已公布控制能力的實務品質仍需要獨立量測。
資料來源
- Alibaba Qwen releases Qwen-Image 2.1MarkTechPost · 2026年9月21日
- Qwen-Image-2.1 model cardHugging Face · 2026年9月21日



