Qwen-Image-2.1: Transparansi, Pengeditan 10 Referensi, dan Output 2K
Jelajahi model gambar terpadu 7B Qwen-Image-2.1, dengan output RGBA native, hingga 10 referensi, pengeditan berpanduan mask, dan pembuatan 2K native.
1. Qwen-Image-2.1 Menggunakan Model 7B untuk Pembuatan dan Pengeditan
Qwen-Image-2.1 menggabungkan pembuatan teks-ke-gambar dan pengeditan gambar dalam satu pipeline model. Komponen pembuatan visualnya menggunakan arsitektur Single-Stream DiT 32 lapisan dengan 7B parameter. Qwen3-VL 8B mengodekan teks dan gambar kondisional, sementara perhatian granularitas campuran dan penggunaan ulang Prefix KV Cache mengurangi komputasi berulang.
Desain ini paling penting dalam pengeditan multi-gambar. Model dapat menyimpan cache gambar referensi dan instruksi pengeditan alih-alih memproses konteks statis yang sama kembali pada setiap langkah denoising. Hal ini menciptakan fondasi yang lebih efisien untuk tugas yang melibatkan seseorang, pakaian, sepatu, tas, atau beberapa referensi desain interior sekaligus.
2. Pembuatan Gambar Transparan Native Kini Sudah Terintegrasi
Alur kerja umum adalah membuat gambar standar terlebih dahulu lalu menghapus latar belakangnya. Sebagai gantinya, Qwen-Image-2.1 dapat membuat gambar dengan kanal Alpha native, mengedit lapisan transparan yang sudah ada, atau mengekstrak subjek terpilih dari foto RGB biasa sebagai aset RGBA.
Hal ini membuat kapabilitas tersebut relevan lebih dari sekadar untuk stiker dan ilustrasi. Potongan produk, orang, elemen grafis, dan teks transparan dapat langsung masuk ke alur kerja tata letak dan kompositing berikutnya.
Qwen juga mendemonstrasikan pengeditan ekspresi dan tipografi di dalam lapisan transparan, serta ekstraksi subjek dari foto nyata. Perubahan praktisnya bukan sekadar model dapat menghapus latar belakang. Pembuatan, pengeditan, ekstraksi, dan output aset transparan kini berada dalam model yang sama.
3. Hingga 10 Gambar Referensi Mendukung Komposisi yang Lebih Kompleks
Qwen-Image-2.1 mendukung hingga 10 gambar referensi. Demonstrasi resmi mencakup penggabungan enam potret menjadi foto grup, perakitan pakaian dari lima referensi terpisah, dan perancangan interior dari 10 gambar furnitur.
Bagi tim ecommerce dan fesyen, pengeditan gambar multi-referensi dapat memasukkan model, pakaian, sepatu, tas, dan referensi gaya ke dalam tugas yang sama. Alur kerja ini tidak lagi terbatas pada pengeditan satu gambar sumber dalam satu waktu.
4. Lingkaran, Area yang Diwarnai, dan Mask Terpisah Dapat Memandu Pengeditan Lokal
Pengeditan gambar lokal tidak hanya bergantung pada teks. Materi rilis Qwen menunjukkan tiga cara untuk mengidentifikasi area target:
- Gambar lingkaran berwarna berbeda di sekitar beberapa area yang memerlukan perubahan terpisah.
- Warnai suatu lokasi untuk memberi tahu model tempat menambahkan atau mengganti konten.
- Berikan gambar asli dan mask terpisah sebagai dua input, sehingga piksel sumber yang akan tertutup anotasi overlay tetap terjaga.
Input ini lebih presisi daripada mendeskripsikan “objek di sebelah kiri” atau “item di dekat bagian atas” dalam prompt. Input tersebut juga menciptakan metode kontrol yang lebih jelas untuk pengeditan iteratif dan berurutan.
5. Qwen Menyoroti Fidelitas Potret dan Produk
Qwen mencantumkan identitas potret dan konsistensi produk sebagai dua area peningkatan utama. Pengeditan potret ditujukan untuk mempertahankan fitur wajah yang mudah dikenali, sedangkan pengeditan produk berfokus pada pelestarian tipografi, tekstur, dan bentuk saat item dipindahkan ke adegan baru.
Kapabilitas ini sangat relevan untuk alur kerja gambar produk, tetapi saat ini sebaiknya dideskripsikan sebagai demonstrasi resmi Qwen. Tanpa pengujian berulang menggunakan input yang sama, bukti yang tersedia belum membuktikan fidelitas produk yang konsisten pada tingkat produksi.
6. Output 2K Native, Tipografi, dan Estetika Potret Juga Meningkat
Implementasi resmi menggunakan ukuran default 2048 × 2048 dan mencantumkan dimensi yang direkomendasikan untuk output 1:1, 4:3, 3:4, 3:2, 2:3, 16:9, dan 9:16. Materi rilis Qwen juga menampilkan tipografi kompleks, infografik, panorama, storyboard yang dibuat dari tampilan karakter, serta potret dengan pencahayaan dan detail yang lebih terarah.
Bersama-sama, kapabilitas ini menempatkan Qwen-Image-2.1 sebagai lebih dari sekadar model teks-ke-gambar yang ringkas. Model ini dirancang untuk mencakup jalur yang lebih luas, dari pembuatan aset hingga pengeditan berikutnya.
Hal yang Belum Dibuktikan oleh Rilis Qwen-Image-2.1
- Contoh resmi tidak menyertakan cukup prompt lengkap, pengaturan, atau output berulang untuk membuktikan konsistensi.
- Materi yang tersedia tidak mengonfirmasi bahwa WeShop telah mengintegrasikan Qwen-Image-2.1 atau mendokumentasikan kredit WeShop, waktu pembuatan, dan pengaturan yang tersedia.
- Open weights menggunakan Qwen Research License. Lisensi resmi menyatakan bahwa penggunaan komersial materi model memerlukan lisensi komersial terpisah.
- Qwen-Image-Bench adalah benchmark yang diterbitkan vendor dan tidak seharusnya menggantikan pengujian dalam alur kerja ecommerce, desain, atau potret yang nyata.
Siapa yang Perlu Memperhatikan Qwen-Image-2.1?
- Desainer visual yang memerlukan orang, produk, stiker, atau elemen kompositing transparan.
- Tim ecommerce dan fesyen yang menggabungkan model, pakaian, sepatu, tas, dan referensi lainnya.
- Kreator yang ingin mengontrol pengeditan lokal dengan lingkaran, area yang diwarnai, atau mask.
- Developer yang tertarik pada model lebih kecil, penerapan lokal, dan inferensi multi-gambar yang lebih efisien.
Kesimpulan Akhir
Rilis Qwen-Image-2.1 dapat dirangkum dalam satu kalimat: komponen pembuatan visual 7B kini menangani gambar standar, gambar transparan, komposisi multi-referensi, dan pengeditan lokal dalam satu pipeline kreatif.
Kapabilitas terdokumentasinya yang paling khas adalah output RGBA native dan dukungan hingga 10 gambar referensi. Pertanyaan berikutnya adalah seberapa andal model ini menangani produk kompleks, potret, tipografi, dan pengeditan lokal dalam pembuatan nyata yang berulang.







