返回 文章 学习 CMS 文章

Qwen-Image-2.1 开源:7B 视觉生成组件统一图像生成与编辑,原生支持透明图像

Qwen-Image-2.1 用 7B 视觉生成组件把图像生成、透明图层与多样化编辑统一进一个开源模型。

Qwen-Image-2.1开源图像模型文生图图像编辑
成长分 / 100 70 综合收获、行动、留存与影响

Qwen-Image-2.1 开源:7B 视觉生成组件统一图像生成与编辑,原生支持透明图像
为什么值得读了解 Qwen 家族最新开源图像模型在生成质量、推理效率与成本之间的平衡思路。

掌握原生透明图像生成与编辑、最多 10 张参考图像、局部编辑等新增能力的具体表现。

关键洞察
  1. 视觉生成组件仅 7B 参数,包含 32 个 Single-Stream DiT 层,在紧凑规模下仍追求出色生成质量。
  2. 采用混合粒度注意力架构:文本使用 token 级因果掩码,图像生成使用 chunk 级掩码,并通过 KV 缓存复用提升多图编辑的推理效率并降低内存占用。
  3. 原生透明能力被整合进统一模型,可通过提示词决定输出普通图像或带透明通道的图像,并支持编辑透明图层、替换透明文字、从 RGB 照片提取 RGBA 图层。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:14840

Qwen-Image-2.1 banner

我们很高兴开源 Qwen-Image-2.1,这是 Qwen 家族中的一款图像模型,在生成质量、推理效率与成本之间取得平衡。Qwen-Image-2.1 将文生图生成与图像编辑统一在单一模型中,其视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。

本次更新带来四项关键改进:

紧凑高效:轻量级架构与推理优化在图像质量与计算成本之间取得平衡。原生透明,统一创作与编辑:根据提示词生成普通图像或透明图像,编辑透明图层,并从照片中提取主体。多样化编辑:最多可使用10 张参考图像,指定局部编辑,保留人物与产品,并处理广泛的任务。逼真质感与精致美学:改进的文字排版、人像光照与精细细节,使生成的图像更具视觉吸引力。

紧凑高效#

Qwen-Image-2.1 采用轻量级架构。其视觉生成组件包含 32 个 Single-Stream DiT 层和 7B 参数。尽管规模紧凑,该模型仍能提供出色的图像生成质量。下方的 Qwen-Image-Bench 对比展示了它与其他开源和闭源模型的性能表现。

Qwen-Image-Bench 评估对比

Qwen-Image-Bench 评估对比

推理效率是另一个重点,尤其是在使用多张输入图像进行编辑时。这一优化来自混合粒度注意力架构。文本(包括系统前缀和编辑指令)使用 token 级因果掩码,而图像生成使用 chunk 级掩码。KV 缓存复用使输入图像和编辑指令可作为静态上下文,在第一步中计算并缓存,以提升推理效率并降低内存占用。

Qwen-Image-2.1 混合粒度注意力架构

Qwen-Image-2.1 混合粒度注意力架构

原生透明,统一创作与编辑#

原生透明是本次发布的一大新增能力。2025 年 12 月,我们推出了 Qwen-Image-Layered,作为支持透明图像生成的专用模型。Qwen-Image-2.1 现将这一能力整合进统一模型,通过提示词决定输出普通图像还是带透明通道的图像。

以下为直接从文本生成的透明图像示例:

从文本生成的透明图像(1)

从文本生成的透明图像(2)

从文本生成的透明图像(3)

除了单个主体之外,该模型还能生成由多个元素组成的更复杂的透明图像,为设计和素材创作开辟了更多可能性。

包含多个元素的透明合成图(1)

包含多个元素的透明合成图(2)

通过统一生成与编辑,Qwen-Image-2.1 还支持直接编辑透明图像。例如,它可以在保留透明背景的同时改变主体的表情。左侧为输入,右侧为编辑结果。

在透明图像上进行表情编辑:输入与结果(1)

在透明图像上进行表情编辑:输入与结果(2)

透明图层中的文字也可以编辑。在以下示例中,“BLOOM”被替换为“Qwen-Image”。

透明文字编辑:将 BLOOM 替换为 Qwen-Image(1)

透明文字编辑:将 BLOOM 替换为 Qwen-Image(2)

这一能力也适用于真实照片。给定一张 RGB 图像,模型可以将所需主体提取为带透明度的 RGBA 图层,从而更便于在后续的设计与合成工作中复用元素。

从 RGB 照片中提取透明 RGBA 图层(1)

从 RGB 照片中提取透明 RGBA 图层(2)

多样化编辑#

Qwen-Image-2.1 在四个方面改进了编辑:多参考图像、局部编辑、保真度保持和任务覆盖。

多参考:最多 10 张输入图像#

Qwen-Image-2.1 支持最多 10 张参考图像,可将多个主体和素材组合成协调的构图。在下面的合影示例中,左侧的六张单人肖像被汇聚到一张照片中。

由六张肖像参考图生成的合影

由六张肖像参考图生成的合影

在虚拟试穿中,五个输入——模特、服装、鞋子、包和帽子——可以组合成一套完整的穿搭。

由五张参考图像生成的完整穿搭

由五张参考图像生成的完整穿搭

在室内设计中,模型可以使用 10 张家具陈设图像生成完整的房间布置。

由十张家具陈设参考图生成的室内场景

由十张家具陈设参考图生成的室内场景

局部编辑:灵活的区域选择#

Qwen-Image-2.1 支持使用圆圈、手绘标注和单独的蒙版来指定编辑应发生的位置。

第一个示例使用不同颜色的圆圈一次性标识三个区域:“移除蓝色圆圈中的金属手表,将红色圆圈中的头发改为黑色,并将绿色圆圈中的区域替换为灰色短袖亚麻睡衣。”标注后的输入位于左侧,结果位于右侧。

对圆圈引导的手表、头发和服装编辑(1)

对圆圈引导的手表、头发和服装编辑(2)

手绘标注提供了另一种标识区域的方式。在此示例中,模型在输入图像右侧以白色标记的区域中添加了一名潜水员。

手绘引导编辑:在标记区域添加潜水员(1)

手绘引导编辑:在标记区域添加潜水员(2)

圆圈和手绘标注会遮挡部分原始内容。为保留完整的输入,Qwen-Image-2.1 也接受原始图像和单独的蒙版作为两个输入。以下示例要求模型使用这两张图像生成一名骑马的牛仔:

局部编辑输入:原始图像和单独的蒙版(1)

局部编辑输入:原始图像和单独的蒙版(2)

模型编辑蒙版指定的区域,生成以下结果:

蒙版引导编辑结果:一名骑马的牛仔

蒙版引导编辑结果:一名骑马的牛仔

局部编辑还可以支持连续创作。通过在保留场景其余部分的同时进行连续修改,编辑后的图像可以组合成简单的动画,如下方的水豚葫芦兄弟示例所示。

保真度:保留人物与产品#

保真度的改进集中在人像身份产品一致性上。对于人像,模型能更好地保留面部特征,使人物身份在多次编辑中保持更高的一致性。下方每一组均左侧为输入,右侧为编辑结果。

人像保真度示例一:输入与结果(1)

人像保真度示例一:输入与结果(2)

人像保真度示例二:输入与结果(1)

人像保真度示例二:输入与结果(2)

人像保真度示例三:输入与结果(1)

人像保真度示例三:输入与结果(2)

在产品编辑方面,该模型旨在保留文本、纹理和形状,使产品的标志性特征在新图像中保持一致。

产品保真度示例一:输入与结果(1)

产品保真度示例一:输入与结果(2)

产品保真度示例二:输入与结果(1)

产品保真度示例二:输入与结果(2)

产品保真度示例三:输入与结果(1)

产品保真度示例三:输入与结果(2)

任务覆盖范围:全景图、信息图与故事板#

Qwen-Image-2.1 支持广泛的编辑任务,包括全景图、信息图和故事板生成,在不同应用之间实现能力平衡。

例如,从这张自拍开始:

用于全景图生成的自拍输入

用于全景图生成的自拍输入

模型生成了以下全景图:

根据自拍生成的全景图

根据自拍生成的全景图

随后可以在可视化工具中从不同视角探索该全景图。

在信息图生成方面,一张模特照片可以扩展为细节丰富、信息密集的构图。

用于信息图生成的模特照片输入

用于信息图生成的模特照片输入

根据模特照片生成的复杂信息图

根据模特照片生成的复杂信息图

该模型还可以将三视图角色参考转化为完整的故事板,为叙事和视觉故事提供素材。

用于故事板生成的三视图角色参考

用于故事板生成的三视图角色参考

根据角色参考生成的完整故事板

根据角色参考生成的完整故事板

逼真纹理与精致美学#

Qwen-Image-2.1 进一步提升了视觉质量,尤其关注排版和肖像。文本渲染不仅考虑内容本身,还考虑字体样式、布局及其与整体构图的关系。以下示例展示了不同场景下的文本渲染。

文本渲染示例一

文本渲染示例一

文本渲染示例二

文本渲染示例二

文本渲染示例三

文本渲染示例三

文本渲染示例四

文本渲染示例四

对于人像,改进的光照和精细细节让生成的图像呈现出更逼真的外观。

人像光照与细节示例一

人像光照与细节示例一

人像光照与细节示例二

人像光照与细节示例二

结论#

凭借紧凑的 7B 视觉生成组件,Qwen-Image-2.1 将图像生成、透明度和广泛的编辑能力集于一个模型之中。更快的推理速度、对最多 10 张参考图像的支持、灵活的局部编辑,以及针对人物和产品提升的保真度,使其成为设计、内容创作、电商和视觉叙事领域的实用工具。

我们希望您享受使用 Qwen-Image-2.1 进行创作的乐趣!