Qwen-Image-2.1:透明图、10参考图编辑与2K输出
探索 Qwen-Image-2.1 的 7B 统一图像模型,支持原生 RGBA 输出、最多 10 张参考图、蒙版引导编辑和原生 2K 生成。
1. Qwen-Image-2.1 使用一个 7B 模型同时进行生成与编辑
Qwen-Image-2.1 将文生图和图像编辑整合在同一模型管线中。其视觉生成组件采用 32 层 Single-Stream DiT 架构,拥有 7B 参数。Qwen3-VL 8B 用于编码文本和条件图像,而混合粒度注意力与 Prefix KV Cache 复用则可减少重复计算。
这一设计在多图编辑中尤为重要。模型可以缓存参考图和编辑指令,无需在每一个去噪步骤中重复处理相同的静态上下文。这为同时涉及人物、服装、鞋履、包袋或多张室内设计参考图的任务提供了更高效的基础。
2. 原生透明图像生成现已内置
一种常见工作流是先生成标准图像,再移除背景。Qwen-Image-2.1 则可以直接生成带原生 Alpha 通道的图像,编辑现有透明图层,或从普通 RGB 照片中提取选定主体并生成 RGBA 资产。
这使该能力的应用不再局限于贴纸和插画。产品抠图、人物、图形元素和透明文字可直接进入后续的版式设计与合成工作流。
Qwen 还展示了在透明图层中进行表情和文字排版编辑,以及从真实照片中提取主体。实际变化不只是模型能够移除背景,而是生成、编辑、提取和透明资产输出如今都在同一个模型中完成。
3. 最多 10 张参考图支持更复杂的构图
Qwen-Image-2.1 支持最多 10 张参考图。官方演示包括将六张人像组合成一张合影、从五张独立参考图中搭配出一套造型,以及利用 10 张家具图像设计室内空间。
对于电商与时尚团队,多参考图像编辑可以将模特、服装、鞋履、包袋和造型参考整合到同一任务中。工作流不再局限于一次编辑一张源图。
4. 圆圈、涂抹区域和独立蒙版可引导局部编辑
局部图像编辑并不只依赖文本。Qwen 的发布资料展示了三种指定目标区域的方式:
- 使用不同颜色的圆圈标记多个需要分别修改的区域。
- 在某个位置涂抹,告诉模型应在何处添加或替换内容。
- 将原图和独立蒙版作为两个输入提供,保留会被叠加标注遮挡的源像素。
这些输入方式比在提示词中描述“左边的物体”或“靠近顶部的物品”更加精准。它们也为迭代式和连续式编辑提供了更清晰的控制方法。
5. Qwen 强调人像与产品保真度
Qwen 将人像身份保持和产品一致性列为两项主要改进方向。人像编辑旨在保留可辨识的面部特征,而产品编辑则侧重于在物品进入新场景时保留其文字、纹理和形状。
这项能力尤其适用于产品图工作流,但目前应将其视为 Qwen 的官方演示。若没有使用相同输入进行反复测试,现有证据尚无法证明其具有稳定的生产级产品保真度。
6. 原生 2K 输出、文字排版和人像美学也有所提升
官方实现采用默认 2048 × 2048 尺寸,并列出了适用于 1:1、4:3、3:4、3:2、2:3、16:9 和 9:16 输出的推荐尺寸。Qwen 的发布资料还展示了复杂文字排版、信息图、全景图、根据角色设定图生成的分镜,以及在光影和细节方面更具表现力的人像。
这些能力共同表明,Qwen-Image-2.1 不只是一个紧凑型文生图模型。它旨在覆盖从资产生成到后续编辑的更广泛流程。
Qwen-Image-2.1 的发布尚未证明什么
- 官方示例未提供足够完整的提示词、设置或重复输出,因此无法证明其一致性。
- 现有资料未确认 WeShop 是否已集成 Qwen-Image-2.1,也未说明 WeShop 积分、生成时间和可用设置。
- 开放权重采用 Qwen Research License。官方许可声明指出,模型材料的商业使用需要另行获得商业许可。
- Qwen-Image-Bench 是由供应商发布的基准测试,不应替代在真实电商、设计或人像工作流中的测试。
谁应关注 Qwen-Image-2.1?
- 需要透明人物、产品、贴纸或合成元素的视觉设计师。
- 需要组合模特、服装、鞋履、包袋及其他参考素材的电商与时尚团队。
- 希望通过圆圈、涂抹区域或蒙版控制局部编辑的创作者。
- 对小型模型、本地部署和更高效多图推理感兴趣的开发者。
最终结论
Qwen-Image-2.1 的发布可以用一句话概括:一个 7B 视觉生成组件现可在同一创作管线中处理标准图像、透明图像、多参考图构图和局部编辑。
其最具特色且已有文档说明的能力,是原生 RGBA 输出及最多支持 10 张参考图。下一个问题是,它在重复的真实场景生成中,能否稳定处理复杂产品、人像、文字排版和局部编辑。







