Qwen-Image-2.1:透明化、10参照編集、2K出力
ネイティブRGBA出力、最大10件の参照画像、マスクガイド編集、ネイティブ2K生成を備えた、Qwen-Image-2.1の7B統合画像モデルをご紹介します。
1. Qwen-Image-2.1は、生成と編集の両方に7Bモデルを使用
Qwen-Image-2.1は、テキストからの画像生成と画像編集を1つのモデルパイプラインに統合しています。そのビジュアル生成コンポーネントは、70億パラメータの32層Single-Stream DiTアーキテクチャを採用しています。Qwen3-VL 8Bがテキストと条件付き画像をエンコードし、混合粒度アテンションとPrefix KV Cacheの再利用によって反復計算を削減します。
この設計が特に重要になるのは、複数画像の編集です。モデルは、各デノイジングステップで同じ静的コンテキストを再処理する代わりに、参照画像と編集指示をキャッシュできます。これにより、人物、衣服、靴、バッグ、複数のインテリアデザイン参照を同時に扱うタスクに、より効率的な基盤が生まれます。
2. ネイティブ透明画像生成を標準搭載
一般的なワークフローでは、まず通常の画像を生成し、その後で背景を削除します。Qwen-Image-2.1では、ネイティブのアルファチャンネルを持つ画像の生成、既存の透明レイヤーの編集、通常のRGB写真から選択した被写体をRGBAアセットとして抽出することが可能です。
この機能は、ステッカーやイラストだけにとどまりません。商品切り抜き、人物、グラフィック要素、透明テキストを、後続のレイアウトや合成ワークフローへ直接取り込めます。
Qwenは、透明レイヤー内での表情やタイポグラフィの編集、実写写真からの被写体抽出も紹介しています。実用面での変化は、単にモデルが背景を削除できるということではありません。生成、編集、抽出、透明アセット出力が、すべて同じモデル内に収まっています。
3. 最大10件の参照画像で、より複雑な構成をサポート
Qwen-Image-2.1は、最大10件の参照画像をサポートします。公式デモには、6枚のポートレートを組み合わせた集合写真、5つの別々の参照からのコーディネート作成、10枚の家具画像からのインテリアデザインが含まれます。
Eコマースやファッションチームでは、マルチ参照画像編集により、モデル、衣服、靴、バッグ、スタイリングの参照を同じタスクに含められます。ワークフローは、1回に1枚の元画像を編集するだけのものではなくなります。
4. 円、塗りつぶし領域、個別マスクでローカル編集をガイド
ローカル画像編集は、テキストだけに依存しません。Qwenのリリース資料では、対象領域を特定する3つの方法が示されています。
- 個別に変更が必要な複数の領域を、異なる色の円で囲む。
- コンテンツを追加または置き換える場所をモデルに伝えるため、対象箇所を塗りつぶす。
- 元画像と別個のマスクを2つの入力として渡し、重ねた注釈で隠れてしまう元のピクセルを保持する。
これらの入力は、プロンプトで「左側の物体」や「上部付近のアイテム」と説明するよりも正確です。また、反復的・連続的な編集のための、より明確な制御方法にもなります。
5. Qwenが強調するポートレートと商品の忠実度
Qwenは、ポートレートのアイデンティティ保持と商品の一貫性を、主な改善領域として挙げています。ポートレート編集では認識可能な顔の特徴を維持することを目指し、商品編集では、アイテムを新しいシーンへ配置する際にもタイポグラフィ、テクスチャ、形状を保持することに重点を置いています。
この機能は、特に商品画像のワークフローに関連しますが、現時点ではQwen公式のデモとして説明すべきです。同一の入力を使用した反復テストがなければ、利用可能な証拠だけでは、一貫した本番品質の商品忠実度を確立できません。
6. ネイティブ2K出力、タイポグラフィ、ポートレート表現も向上
公式実装では、デフォルトサイズとして2048 × 2048を使用し、1:1、4:3、3:4、3:2、2:3、16:9、9:16出力の推奨寸法を示しています。Qwenのリリース資料では、複雑なタイポグラフィ、インフォグラフィック、パノラマ、キャラクターの設定画から生成されたストーリーボード、より意図的なライティングとディテールを備えたポートレートも紹介されています。
これらの機能を合わせると、Qwen-Image-2.1はコンパクトなテキスト画像生成モデル以上の存在になります。アセット生成から後続の編集まで、より幅広いプロセスをカバーするよう設計されています。
Qwen-Image-2.1のリリースがまだ証明していないこと
- 公式の例には、一貫性を確立するために十分な完全なプロンプト、設定、反復出力が含まれていません。
- 利用可能な資料では、WeShopがQwen-Image-2.1を統合していること、またはWeShopのクレジット、生成時間、公開設定は確認できません。
- オープンウェイトにはQwen Research Licenseが適用されます。公式ライセンスでは、モデル素材を商用利用するには別途商用ライセンスが必要とされています。
- Qwen-Image-Benchはベンダーが公開したベンチマークであり、実際のEコマース、デザイン、ポートレートのワークフローにおけるテストの代わりにはなりません。
Qwen-Image-2.1に注目すべき人
- 透明な人物、商品、ステッカー、合成用要素を必要とするビジュアルデザイナー。
- モデル、衣服、靴、バッグ、その他の参照を組み合わせるEコマースおよびファッションチーム。
- 円、塗りつぶし領域、マスクでローカル編集を制御したいクリエイター。
- 小型モデル、ローカルデプロイ、より効率的な複数画像推論に関心のある開発者。
まとめ
Qwen-Image-2.1のリリースは、一文でまとめられます。1つの7Bビジュアル生成コンポーネントが、標準画像、透明画像、マルチ参照コンポジション、ローカル編集を1つのクリエイティブパイプライン内で処理できるようになりました。
文書化された機能の中で特に特徴的なのは、ネイティブRGBA出力と最大10件の参照画像のサポートです。次の課題は、複雑な商品、ポートレート、タイポグラフィ、ローカル編集を、反復的な実環境の生成においてどれだけ安定して処理できるかです。







