
我们很高兴开源 Qwen-Image-2.1,这是 Qwen 家族中的一款图像模型,在生成质量、推理效率与成本之间取得平衡。Qwen-Image-2.1 将文生图生成与图像编辑统一在单一模型中,其视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。
本次更新带来四项关键改进:
紧凑高效:轻量级架构与推理优化在图像质量与计算成本之间取得平衡。原生透明,统一创作与编辑:根据提示词生成普通图像或透明图像,编辑透明图层,并从照片中提取主体。多样化编辑:最多可使用10 张参考图像,指定局部编辑,保留人物与产品,并处理广泛的任务。逼真质感与精致美学:改进的文字排版、人像光照与精细细节,使生成的图像更具视觉吸引力。
紧凑高效#
Qwen-Image-2.1 采用轻量级架构。其视觉生成组件包含 32 个 Single-Stream DiT 层和 7B 参数。尽管规模紧凑,该模型仍能提供出色的图像生成质量。下方的 Qwen-Image-Bench 对比展示了它与其他开源和闭源模型的性能表现。

Qwen-Image-Bench 评估对比
推理效率是另一个重点,尤其是在使用多张输入图像进行编辑时。这一优化来自混合粒度注意力架构。文本(包括系统前缀和编辑指令)使用 token 级因果掩码,而图像生成使用 chunk 级掩码。KV 缓存复用使输入图像和编辑指令可作为静态上下文,在第一步中计算并缓存,以提升推理效率并降低内存占用。

Qwen-Image-2.1 混合粒度注意力架构
原生透明,统一创作与编辑#
原生透明是本次发布的一大新增能力。2025 年 12 月,我们推出了 Qwen-Image-Layered,作为支持透明图像生成的专用模型。Qwen-Image-2.1 现将这一能力整合进统一模型,通过提示词决定输出普通图像还是带透明通道的图像。
以下为直接从文本生成的透明图像示例:



除了单个主体之外,该模型还能生成由多个元素组成的更复杂的透明图像,为设计和素材创作开辟了更多可能性。


通过统一生成与编辑,Qwen-Image-2.1 还支持直接编辑透明图像。例如,它可以在保留透明背景的同时改变主体的表情。左侧为输入,右侧为编辑结果。


透明图层中的文字也可以编辑。在以下示例中,“BLOOM”被替换为“Qwen-Image”。


这一能力也适用于真实照片。给定一张 RGB 图像,模型可以将所需主体提取为带透明度的 RGBA 图层,从而更便于在后续的设计与合成工作中复用元素。


多样化编辑#
Qwen-Image-2.1 在四个方面改进了编辑:多参考图像、局部编辑、保真度保持和任务覆盖。
多参考:最多 10 张输入图像#
Qwen-Image-2.1 支持最多 10 张参考图像,可将多个主体和素材组合成协调的构图。在下面的合影示例中,左侧的六张单人肖像被汇聚到一张照片中。

由六张肖像参考图生成的合影
在虚拟试穿中,五个输入——模特、服装、鞋子、包和帽子——可以组合成一套完整的穿搭。

由五张参考图像生成的完整穿搭
在室内设计中,模型可以使用 10 张家具陈设图像生成完整的房间布置。

由十张家具陈设参考图生成的室内场景
局部编辑:灵活的区域选择#
Qwen-Image-2.1 支持使用圆圈、手绘标注和单独的蒙版来指定编辑应发生的位置。
第一个示例使用不同颜色的圆圈一次性标识三个区域:“移除蓝色圆圈中的金属手表,将红色圆圈中的头发改为黑色,并将绿色圆圈中的区域替换为灰色短袖亚麻睡衣。”标注后的输入位于左侧,结果位于右侧。


手绘标注提供了另一种标识区域的方式。在此示例中,模型在输入图像右侧以白色标记的区域中添加了一名潜水员。


圆圈和手绘标注会遮挡部分原始内容。为保留完整的输入,Qwen-Image-2.1 也接受原始图像和单独的蒙版作为两个输入。以下示例要求模型使用这两张图像生成一名骑马的牛仔:


模型编辑蒙版指定的区域,生成以下结果:

蒙版引导编辑结果:一名骑马的牛仔
局部编辑还可以支持连续创作。通过在保留场景其余部分的同时进行连续修改,编辑后的图像可以组合成简单的动画,如下方的水豚葫芦兄弟示例所示。
保真度:保留人物与产品#
保真度的改进集中在人像身份和产品一致性上。对于人像,模型能更好地保留面部特征,使人物身份在多次编辑中保持更高的一致性。下方每一组均左侧为输入,右侧为编辑结果。






在产品编辑方面,该模型旨在保留文本、纹理和形状,使产品的标志性特征在新图像中保持一致。






任务覆盖范围:全景图、信息图与故事板#
Qwen-Image-2.1 支持广泛的编辑任务,包括全景图、信息图和故事板生成,在不同应用之间实现能力平衡。
例如,从这张自拍开始:

用于全景图生成的自拍输入
模型生成了以下全景图:

根据自拍生成的全景图
随后可以在可视化工具中从不同视角探索该全景图。
在信息图生成方面,一张模特照片可以扩展为细节丰富、信息密集的构图。

用于信息图生成的模特照片输入

根据模特照片生成的复杂信息图
该模型还可以将三视图角色参考转化为完整的故事板,为叙事和视觉故事提供素材。

用于故事板生成的三视图角色参考

根据角色参考生成的完整故事板
逼真纹理与精致美学#
Qwen-Image-2.1 进一步提升了视觉质量,尤其关注排版和肖像。文本渲染不仅考虑内容本身,还考虑字体样式、布局及其与整体构图的关系。以下示例展示了不同场景下的文本渲染。

文本渲染示例一

文本渲染示例二

文本渲染示例三

文本渲染示例四
对于人像,改进的光照和精细细节让生成的图像呈现出更逼真的外观。

人像光照与细节示例一

人像光照与细节示例二
结论#
凭借紧凑的 7B 视觉生成组件,Qwen-Image-2.1 将图像生成、透明度和广泛的编辑能力集于一个模型之中。更快的推理速度、对最多 10 张参考图像的支持、灵活的局部编辑,以及针对人物和产品提升的保真度,使其成为设计、内容创作、电商和视觉叙事领域的实用工具。
我们希望您享受使用 Qwen-Image-2.1 进行创作的乐趣!
