Qwen-Image-2.1: 투명성, 10개 레퍼런스 편집 및 2K 출력
네이티브 RGBA 출력, 최대 10개 레퍼런스, 마스크 기반 편집, 네이티브 2K 생성을 지원하는 Qwen-Image-2.1의 7B 통합 이미지 모델을 살펴보세요.
1. Qwen-Image-2.1은 생성과 편집에 하나의 7B 모델을 사용합니다
Qwen-Image-2.1은 텍스트-이미지 생성과 이미지 편집을 하나의 모델 파이프라인으로 결합합니다. 시각 생성 구성 요소는 70억 개의 파라미터를 갖춘 32레이어 Single-Stream DiT 아키텍처를 사용합니다. Qwen3-VL 8B는 텍스트와 조건 이미지들을 인코딩하며, 혼합 세분성 어텐션과 Prefix KV Cache 재사용은 반복 연산을 줄입니다.
이 설계는 멀티 이미지 편집에서 특히 중요합니다. 모델은 매 디노이징 단계마다 동일한 고정 컨텍스트를 다시 처리하는 대신, 레퍼런스 이미지와 편집 지침을 캐시할 수 있습니다. 따라서 인물, 의류, 신발, 가방 또는 여러 인테리어 디자인 레퍼런스를 한 번에 다루는 작업을 더욱 효율적으로 수행할 수 있는 기반을 제공합니다.
2. 네이티브 투명 이미지 생성 기능이 기본으로 탑재되었습니다
일반적인 워크플로에서는 먼저 표준 이미지를 생성한 후 배경을 제거합니다. 대신 Qwen-Image-2.1은 네이티브 알파 채널을 가진 이미지를 생성하고, 기존 투명 레이어를 편집하거나, 일반 RGB 사진에서 선택한 피사체를 RGBA 에셋으로 추출할 수 있습니다.
이 기능은 스티커와 일러스트를 넘어 더 폭넓게 활용할 수 있습니다. 제품 컷아웃, 인물, 그래픽 요소 및 투명 텍스트를 후속 레이아웃 및 합성 워크플로로 바로 옮길 수 있습니다.
Qwen은 투명 레이어 내 표정 및 타이포그래피 편집과 실제 사진에서의 피사체 추출도 시연합니다. 실질적인 변화는 단순히 모델이 배경을 제거할 수 있다는 점이 아닙니다. 이제 생성, 편집, 추출 및 투명 에셋 출력이 모두 동일한 모델 안에 포함됩니다.
3. 최대 10개의 레퍼런스 이미지로 더 복잡한 구성을 지원합니다
Qwen-Image-2.1은 최대 10개의 레퍼런스 이미지를 지원합니다. 공식 시연에는 여섯 장의 인물 사진을 그룹 사진으로 결합하는 사례, 다섯 개의 개별 레퍼런스로 의상을 구성하는 사례, 10개의 가구 이미지로 인테리어를 디자인하는 사례가 포함됩니다.
이커머스 및 패션 팀은 멀티 레퍼런스 이미지 편집을 통해 모델, 의류, 신발, 가방 및 스타일링 레퍼런스를 하나의 작업에 포함할 수 있습니다. 더 이상 한 번에 하나의 원본 이미지만 편집하는 방식에 제한되지 않습니다.
4. 원, 칠한 영역 및 별도 마스크로 부분 편집을 안내할 수 있습니다
부분 이미지 편집은 텍스트에만 의존하지 않습니다. Qwen의 출시 자료는 대상 영역을 지정하는 세 가지 방법을 보여 줍니다.
- 별도 변경이 필요한 여러 영역 주위에 서로 다른 색상의 원을 그립니다.
- 콘텐츠를 추가하거나 교체할 위치를 모델에 알려 주기 위해 해당 위치 위에 칠합니다.
- 원본 이미지와 별도 마스크를 두 개의 입력으로 제공하여, 오버레이 주석으로 가려질 수 있는 원본 픽셀을 보존합니다.
이러한 입력 방식은 프롬프트에서 “왼쪽의 물체” 또는 “상단 근처의 항목”이라고 설명하는 것보다 더 정확합니다. 또한 반복적이고 순차적인 편집을 위한 더욱 명확한 제어 방법을 제공합니다.
5. Qwen은 인물 및 제품 충실도를 강조합니다
Qwen은 인물 정체성과 제품 일관성을 두 가지 주요 개선 영역으로 제시합니다. 인물 편집은 알아볼 수 있는 얼굴 특징을 유지하도록 설계되었으며, 제품 편집은 제품이 새로운 장면으로 이동할 때 타이포그래피, 질감 및 형태를 보존하는 데 중점을 둡니다.
이 기능은 제품 이미지 워크플로에 특히 유의미하지만, 현재로서는 Qwen의 공식 시연으로 설명해야 합니다. 동일한 입력을 사용하는 반복 테스트가 없다면, 현재 उपलब्ध한 근거만으로는 일관된 프로덕션급 제품 충실도를 입증할 수 없습니다.
6. 네이티브 2K 출력, 타이포그래피 및 인물 미학도 향상되었습니다
공식 구현은 기본 크기로 2048 × 2048을 사용하며, 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 및 9:16 출력에 권장되는 크기를 제시합니다. Qwen의 출시 자료는 복잡한 타이포그래피, 인포그래픽, 파노라마, 캐릭터 턴어라운드에서 생성된 스토리보드, 그리고 조명과 디테일이 더 의도적으로 표현된 인물 사진도 보여 줍니다.
이러한 기능을 종합하면 Qwen-Image-2.1은 단순한 소형 텍스트-이미지 모델을 넘어섭니다. 에셋 생성부터 후속 편집까지 더 넓은 경로를 포괄하도록 설계되었습니다.
Qwen-Image-2.1 출시가 아직 입증하지 못한 점
- 공식 예시에는 일관성을 입증할 만큼 충분한 전체 프롬프트, 설정 또는 반복 출력이 포함되어 있지 않습니다.
- 현재 제공되는 자료는 WeShop이 Qwen-Image-2.1을 통합했는지 확인하지 않으며, WeShop 크레딧, 생성 시간 및 제공 설정도 문서화하지 않습니다.
- 공개 가중치는 Qwen Research License를 사용합니다. 공식 라이선스는 모델 자료의 상업적 사용에 별도의 상업용 라이선스가 필요하다고 명시합니다.
- Qwen-Image-Bench는 공급업체가 게시한 벤치마크이므로 실제 이커머스, 디자인 또는 인물 워크플로에서의 테스트를 대체해서는 안 됩니다.
Qwen-Image-2.1에 주목해야 할 대상은 누구인가요?
- 투명한 인물, 제품, 스티커 또는 합성 요소가 필요한 비주얼 디자이너
- 모델, 의류, 신발, 가방 및 기타 레퍼런스를 결합하는 이커머스 및 패션 팀
- 원, 칠한 영역 또는 마스크로 부분 편집을 제어하고 싶은 크리에이터
- 더 작은 모델, 로컬 배포 및 효율적인 멀티 이미지 추론에 관심 있는 개발자
핵심 요약
Qwen-Image-2.1 출시는 한 문장으로 요약할 수 있습니다. 하나의 7B 시각 생성 구성 요소가 이제 하나의 크리에이티브 파이프라인 안에서 표준 이미지, 투명 이미지, 멀티 레퍼런스 구성 및 부분 편집을 처리합니다.
가장 차별화된 문서화 기능은 네이티브 RGBA 출력과 최대 10개 레퍼런스 이미지 지원입니다. 다음 질문은 반복적인 실제 생성 전반에서 복잡한 제품, 인물, 타이포그래피 및 부분 편집을 얼마나 안정적으로 처리하는가입니다.







