Qwen-Image-2.1: पारदर्शिता, 10-रेफरेंस एडिटिंग और 2K आउटपुट
Qwen-Image-2.1 के 7B यूनिफाइड इमेज मॉडल को जानें, जिसमें नेटिव RGBA आउटपुट, अधिकतम 10 रेफरेंस, मास्क-गाइडेड एडिट और नेटिव 2K जनरेशन शामिल हैं।
1. Qwen-Image-2.1 जनरेशन और एडिटिंग, दोनों के लिए 7B मॉडल का उपयोग करता है
Qwen-Image-2.1 टेक्स्ट-टू-इमेज जनरेशन और इमेज एडिटिंग को एक मॉडल पाइपलाइन में संयोजित करता है। इसका विज़ुअल-जनरेशन कंपोनेंट 7B पैरामीटर वाली 32-लेयर Single-Stream DiT आर्किटेक्चर का उपयोग करता है। Qwen3-VL 8B टेक्स्ट और कंडीशनल इमेज को एन्कोड करता है, जबकि mixed-granularity attention और Prefix KV Cache का पुन: उपयोग बार-बार होने वाली गणना को कम करता है।
यह डिज़ाइन मल्टी-इमेज एडिटिंग में सबसे अधिक महत्वपूर्ण है। मॉडल हर denoising चरण में एक ही स्थिर संदर्भ को दोबारा प्रोसेस करने के बजाय रेफरेंस इमेज और एडिटिंग निर्देशों को कैश कर सकता है। इससे किसी व्यक्ति, कपड़ों, जूतों, बैग या एक साथ कई इंटीरियर-डिज़ाइन रेफरेंस वाले कार्यों के लिए अधिक कुशल आधार बनता है।
2. नेटिव पारदर्शी इमेज जनरेशन अब अंतर्निहित है
एक सामान्य वर्कफ़्लो में पहले एक मानक इमेज बनाई जाती है और फिर उसका बैकग्राउंड हटाया जाता है। इसके बजाय Qwen-Image-2.1 नेटिव Alpha चैनल वाली इमेज जनरेट कर सकता है, मौजूदा पारदर्शी लेयर्स को एडिट कर सकता है या किसी सामान्य RGB फोटो से चुने हुए विषय को RGBA एसेट के रूप में एक्सट्रैक्ट कर सकता है।
इससे यह क्षमता स्टिकर और इलस्ट्रेशन से आगे भी प्रासंगिक हो जाती है। प्रोडक्ट कटआउट, लोग, ग्राफ़िक एलिमेंट और पारदर्शी टेक्स्ट सीधे आगे के लेआउट और कंपोज़िटिंग वर्कफ़्लो में जा सकते हैं।
Qwen पारदर्शी लेयर्स के भीतर एक्सप्रेशन और टाइपोग्राफी एडिट के साथ-साथ वास्तविक फोटो से विषय एक्सट्रैक्शन भी प्रदर्शित करता है। व्यावहारिक बदलाव केवल इतना नहीं है कि मॉडल बैकग्राउंड हटा सकता है। जनरेशन, एडिटिंग, एक्सट्रैक्शन और पारदर्शी-एसेट आउटपुट अब एक ही मॉडल के भीतर मौजूद हैं।
3. अधिकतम 10 रेफरेंस इमेज अधिक जटिल कंपोज़िशन को सपोर्ट करती हैं
Qwen-Image-2.1 अधिकतम 10 रेफरेंस इमेज को सपोर्ट करता है। आधिकारिक डेमो में छह पोर्ट्रेट को मिलाकर एक ग्रुप फोटो बनाना, पांच अलग-अलग रेफरेंस से एक आउटफिट तैयार करना और 10 फर्नीचर इमेज से इंटीरियर डिज़ाइन करना शामिल है।
ईकॉमर्स और फैशन टीमों के लिए, मल्टी-रेफरेंस इमेज एडिटिंग मॉडल, परिधान, जूते, बैग और स्टाइलिंग रेफरेंस को एक ही कार्य में शामिल कर सकती है। वर्कफ़्लो अब एक बार में केवल एक सोर्स इमेज एडिट करने तक सीमित नहीं है।
4. सर्कल, पेंट किए गए क्षेत्र और अलग मास्क लोकल एडिट को निर्देशित कर सकते हैं
लोकल इमेज एडिटिंग केवल टेक्स्ट पर निर्भर नहीं करती। Qwen की रिलीज़ सामग्री लक्ष्य क्षेत्र की पहचान करने के तीन तरीके दिखाती है:
- अलग-अलग बदलाव की आवश्यकता वाले कई क्षेत्रों के चारों ओर अलग रंग के सर्कल बनाएं।
- मॉडल को यह बताने के लिए किसी स्थान पर पेंट करें कि वहां कंटेंट कहां जोड़ना या बदलना है।
- मूल इमेज और एक अलग मास्क को दो इनपुट के रूप में दें, ताकि ओवरले एनोटेशन द्वारा छिपाए जाने वाले सोर्स पिक्सल सुरक्षित रहें।
ये इनपुट किसी प्रॉम्प्ट में “बाईं ओर की वस्तु” या “ऊपर के पास की आइटम” का वर्णन करने की तुलना में अधिक सटीक हैं। ये क्रमिक और दोहरावदार एडिट के लिए अधिक स्पष्ट नियंत्रण विधि भी प्रदान करते हैं।
5. Qwen पोर्ट्रेट और प्रोडक्ट फिडेलिटी को प्रमुखता देता है
Qwen पोर्ट्रेट आइडेंटिटी और प्रोडक्ट कंसिस्टेंसी को सुधार के दो प्रमुख क्षेत्रों के रूप में सूचीबद्ध करता है। पोर्ट्रेट एडिट का उद्देश्य पहचाने जा सकने वाले चेहरे के फीचर्स बनाए रखना है, जबकि प्रोडक्ट एडिट किसी आइटम को नए दृश्य में ले जाने पर उसकी टाइपोग्राफी, टेक्सचर और आकार बनाए रखने पर केंद्रित हैं।
यह क्षमता प्रोडक्ट-इमेज वर्कफ़्लो के लिए विशेष रूप से प्रासंगिक है, लेकिन फिलहाल इसे आधिकारिक Qwen डेमो के रूप में ही वर्णित किया जाना चाहिए। एक ही इनपुट के साथ बार-बार परीक्षण किए बिना, उपलब्ध साक्ष्य लगातार प्रोडक्शन-ग्रेड प्रोडक्ट फिडेलिटी स्थापित नहीं करते हैं।
6. नेटिव 2K आउटपुट, टाइपोग्राफी और पोर्ट्रेट एस्थेटिक्स में भी सुधार हुआ है
आधिकारिक इम्प्लीमेंटेशन 2048 × 2048 के डिफ़ॉल्ट आकार का उपयोग करता है और 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 और 9:16 आउटपुट के लिए अनुशंसित आयाम सूचीबद्ध करता है। Qwen की रिलीज़ सामग्री में जटिल टाइपोग्राफी, इन्फोग्राफिक्स, पैनोरमा, कैरेक्टर टर्नअराउंड से जनरेट किए गए स्टोरीबोर्ड और अधिक सुविचारित लाइटिंग व विवरण वाले पोर्ट्रेट भी दिखाए गए हैं।
ये क्षमताएं मिलकर Qwen-Image-2.1 को एक कॉम्पैक्ट टेक्स्ट-टू-इमेज मॉडल से कहीं अधिक स्थापित करती हैं। इसे एसेट जनरेशन से लेकर उसके बाद की एडिटिंग तक के व्यापक पथ को कवर करने के लिए डिज़ाइन किया गया है।
Qwen-Image-2.1 रिलीज़ अभी क्या साबित नहीं करती
- आधिकारिक उदाहरणों में स्थिरता स्थापित करने के लिए पर्याप्त पूर्ण प्रॉम्प्ट, सेटिंग या बार-बार के आउटपुट शामिल नहीं हैं।
- उपलब्ध सामग्री यह पुष्टि नहीं करती कि WeShop ने Qwen-Image-2.1 को इंटीग्रेट किया है, न ही WeShop क्रेडिट, जनरेशन समय और उपलब्ध सेटिंग का विवरण देती है।
- ओपन वेट्स Qwen Research License का उपयोग करते हैं। आधिकारिक लाइसेंस के अनुसार, मॉडल सामग्री के व्यावसायिक उपयोग के लिए अलग व्यावसायिक लाइसेंस आवश्यक है।
- Qwen-Image-Bench विक्रेता द्वारा प्रकाशित बेंचमार्क है और इसे वास्तविक ईकॉमर्स, डिज़ाइन या पोर्ट्रेट वर्कफ़्लो में परीक्षण का विकल्प नहीं होना चाहिए।
Qwen-Image-2.1 पर किसे ध्यान देना चाहिए?
- ऐसे विज़ुअल डिज़ाइनर जिन्हें पारदर्शी लोग, प्रोडक्ट, स्टिकर या कंपोज़िटिंग एलिमेंट चाहिए।
- ईकॉमर्स और फैशन टीमें जो मॉडल, कपड़े, जूते, बैग और अन्य रेफरेंस को संयोजित करती हैं।
- ऐसे क्रिएटर जो सर्कल, पेंट किए गए क्षेत्रों या मास्क से लोकल एडिट को नियंत्रित करना चाहते हैं।
- छोटे मॉडल, लोकल डिप्लॉयमेंट और अधिक कुशल मल्टी-इमेज इन्फ़रेंस में रुचि रखने वाले डेवलपर।
अंतिम निष्कर्ष
Qwen-Image-2.1 रिलीज़ को एक वाक्य में संक्षेपित किया जा सकता है: एक 7B विज़ुअल-जनरेशन कंपोनेंट अब एक ही क्रिएटिव पाइपलाइन में मानक इमेज, पारदर्शी इमेज, मल्टी-रेफरेंस कंपोज़िशन और लोकल एडिटिंग को संभालता है।
इसकी सबसे विशिष्ट प्रलेखित क्षमताएं नेटिव RGBA आउटपुट और अधिकतम 10 रेफरेंस इमेज का सपोर्ट हैं। अगला प्रश्न यह है कि यह जटिल प्रोडक्ट, पोर्ट्रेट, टाइपोग्राफी और लोकल एडिट को बार-बार की वास्तविक दुनिया की जनरेशन में कितनी विश्वसनीयता से संभालता है।







