Qwen 于 2026 年 9 月 20 日发布 Image 2.1。官方仓库把它定位为一个统一的文本到图像生成与图像编辑模型,而不是两个互不相关的系统。视觉生成组件包含 70 亿参数,由 32 层 Single-Stream Diffusion Transformer(DiT)构成。这个参数规模描述的是图像生成核心,不应与完整流程中单独使用的文本编码器混为一谈。
架构采用 mixed-granularity attention 和 prefix key-value cache 复用。按照 Qwen 的说明,文本和条件图像的 prefix 可以在初始阶段计算一次,并在后续 denoising 步骤中重复使用。这样做的目标,是在保持一个模型同时负责生成和编辑的同时,减少重复计算。需要强调的是,这是项目方给出的工程设计说明,并不是独立评测结论。实际效率会受到 GPU、计算精度、推理后端和输入条件影响,必须在具体环境中测量。
最具体的变化之一是原生透明输出。Image 2.1 不仅能生成普通图像,也能生成带 alpha 通道的 RGBA 图像。它还可以编辑透明图层,并从照片中提取主体。官方仓库给出了请求透明背景的提示词写法,以及把结果保存为 RGBA 文件的示例。对于需要抠图、贴纸、合成或商品图像的工作流,这意味着透明通道可以成为模型输出的一部分,而不必总是依赖独立的后处理模型。

透明棋盘格与主体抠图展示了上一段所述的原生 RGBA 能力,而不是额外的背景移除步骤。
编辑路径还支持多张参考图。官方资料称,多主体构图最多可以使用 10 张参考图;局部修改可以通过圆形标记、涂抹注释或独立 mask 指定,并以保留人物和产品的身份特征为目标。这里的“保留”是模型设计目标,不等于任何输入下都能完整保持每张脸、每件衣服或每个细节。最终结果仍取决于提示词、参考图、编辑方式和输入图像质量。

可见的编辑示例说明了如何用局部指令改变现有图像的一部分,对应上一段讨论的编辑流程。
Qwen 还宣称改进了文字呈现、人物光照和细节表现。模型原生支持 2K 生成,并列出正方形、4:3、3:4、3:2、2:3、16:9 和 9:16 等推荐纵横比。这些信息说明了支持范围和推荐配置,并不保证所有文字都清晰可读,也不保证完全没有 artifact。展示图用于说明预期用途;实际可读性需要结合目标语言、字体风格、分辨率和提示词逐一检查。

合成后的多个主体展示了上一段所述的多参考图构图功能;这只是演示,并不保证质量。
技术栈不只包含 70 亿参数的 DiT。文本编码器是 Qwen3-VL 8B,它把文本指令和条件图像编码成统一表示。VAE 是 64 通道的 RGBA autoencoder,空间压缩倍率为 16,并支持原生透明。调度器采用 Flow Matching,配合 Euler discrete scheduling 和 dynamic shifting。这些组件共同解释了模型为何能同时接收文本和图像条件,并输出 RGB 或 RGBA 结果;但仅凭组件名称无法判断某一张具体图片的质量。
对于希望把短提示词扩展成详细描述的用户,项目提供了两个经过微调的 Qwen3.5-VL 9B prompt-rewriting checkpoint:一个面向文本到图像,一个面向图像编辑。配套代码既可以用 Transformers 在本地运行,也可以通过 vLLM 服务器运行;输出包含改写后的详细提示词和纵横比选择。这部分不是强制步骤,用户也可以直接调用图像 pipeline;它更像是在短指令不足以描述需求时使用的辅助环节。
发布时还列出了多条集成路径。官方 README 表示,Diffusers 从第一天起通过 QwenImage21Pipeline 支持该模型,同时列出 ComfyUI 的原生首日支持、vLLM-Omni 的高性能推理、SGLang-Diffusion 的原生推理,以及 LightX2V 的加速方案。模型权重链接到 Hugging Face 和 ModelScope。通过这些成熟工具,用户可以更方便地开始尝试,但安装依赖、显存、软件版本和操作系统兼容性仍然需要自行核对。
官方 quick start 使用 PyTorch、Transformers、Diffusers、Accelerate 和 Pillow,并展示了面向 CUDA 的 pipeline。仓库还介绍了 CPU offload、vLLM 离线推理、在线服务、SGLang 命令,以及通过 FlagOS 适配多种 accelerator 的方案。选择很多,并不意味着所有组合速度相同,也不意味着它们都能装进每一张消费级 GPU。开始之前应检查所选后端的显存需求、精度设置和 offload 选项。
许可证是这次发布不能忽略的一部分。仓库采用 Qwen Research License Agreement,其中把 Non-Commercial 定义为仅用于研究或评估。许可证授予的是有限、不可转让、免版税的非商业使用权;如果要用于商业目的,必须取得单独的商业许可。再分发时需要遵守通知和署名条件,使用这些材料创建或改进的模型还涉及额外展示要求。因此,计划做产品、付费服务或商业部署的人,不能因为权重公开就推定自己拥有商用权,而应阅读完整条款并取得必要授权。
Image 2.1 的意义可以分成两层。技术上,它把相对紧凑的 70 亿参数生成组件与编辑、透明输出、多参考图合成、2K 生成和一组推理工具放在同一套发布中。实践上,它是否有用取决于后端、可用硬件、提示词和参考图质量,以及使用目的是否符合许可证。官方资料提供了值得测试的能力集合,同时也把实验性使用与商业部署之间的边界清楚地摆在了使用者面前。
