先说结论:Qwen-Image-2.1 是 2026 年 9 月最强的开源权重图像模型发布之一。它把生成、编辑、透明与多参考合成放进同一个 7B 视觉模型:原生支持 2K 输出、透明 RGBA 图像、最多 10 张参考图、圈选或蒙版局部编辑,并保持人物与产品的身份一致性。
基准成绩:Qwen-Image-Bench 总分 60.28,在 Qwen 已发布的对比中高于 Nano Banana 2.0 的 59.82、GPT Image 1.5 的 59.65 与 FLUX 2 Max 的 55.33。基准覆盖质量、美学、对齐、真实保真与创意生成五个维度。
最大的实际优势是工作流灵活性:生成一张图、接着编辑、合成参考图、把主体抠成透明、局部修改——全程不用切换模型。Day-0 支持 Diffusers、ComfyUI、vLLM-Omni、SGLang 与 LightX2V。
唯一的重大商业限制:权重采用 Qwen Research License Agreement,当前只允许非商业研究与评估,商用需要 Qwen 单独授权。这让它对研究和本地实验的吸引力,远大于不受限制的商用部署。
评分:编辑 9.3/10、本地灵活性 9.2/10、画质 9.0/10、功能广度 9.4/10、商用就绪 7.5/10,综合 9.0/10——当本地控制与图像编辑比托管商用 API 更重要时,它是强选择。
速查:要本地可控 + 强编辑,直接下它;要开箱即用的商用 API,先解决许可证。
Qwen-Image-2.1 是阿里 Qwen 团队的统一文生图 + 图像编辑模型:视觉生成组件 7B 参数、32 层 Single-Stream DiT。创作与编辑不再拆成两套系统,一个模型家族覆盖两条工作流。
这对真实创作更实用:生成产品图、改背景、换衣服、去物体、加排版文字、导出透明背景主体——生成与后续编辑由同一个模型负责。
架构同时强调推理效率:混合粒度注意力与前缀 KV-cache 复用,让静态文本与参考图上下文在去噪全程复用,多参考图编辑时收益最大。
模型于 2026 年 9 月 20 日发布,权重同步上线 Hugging Face 与 ModelScope。官方推荐七种画幅:1:1、4:3、3:4、3:2、2:3、16:9、9:16;其中 16:9 为 2752×1536,1:1 默认 2048×2048,默认采样 40 步。
官方规格表:7B 生成组件、Qwen3-VL 8B 编码器、64 通道 RGBA VAE、16 倍空间压缩
Qwen-Image-Bench 是本次发布的主评测:围绕专业创作流程构建,5 个顶层维度、23 项子能力、56 个细粒度评估面,数据集含 1,000 条双语提示词,评判系统是 Q-Judger。
已发布对比中,Qwen-Image-2.1 总分 60.28,在 29 个模型里排第 7,高于 Nano Banana 2.0、GPT Image 1.5 与 FLUX 2 Max。
Qwen-Image-Bench 总榜(节选):Qwen-Image-2.1 以 60.28 分位列第 7
但这个结果必须标注准确:60.28 是厂商自测成绩,不是独立复现的行业分数。它由 Qwen 自己的评估框架产出,而不是第三方跨实验室测试。
成绩仍然值得注意:图像生成组件只有 7B,更高分的模型多为闭源。参数量无法跨闭源系统直接比较,但它支持一个判断——Qwen 从紧凑的视觉核心中榨出了可观能力。
这套基准测的不是简单的图文相似度:质量看真实感、细节与分辨率;美学看构图、色彩和谐、打光、人像与风格控制;对齐看属性、动作、布局、关系与场景;真实保真看世界知识与文化元素;创意生成看想象力、文字渲染、平面设计与视觉叙事。
五维分项:Qwen-Image-2.1 与头部模型在各维度的得分对照
这套结构与 2.1 的卖点高度契合:文字排版、产品保真、参考合成、设计应用与透明素材,对干活的设计师比一个总分更有意义。
官方称 2.1 改进了文字排版、人像打光、真实质感与细节,60.28 的总分支撑了它在已发布对比中的强文生图位置。
更实用的差别是:生成不必是终点。第一张图接近但某个属性不对时,同一个模型直接改,不用从头再来——生成只是起点,编辑才是闭环,工作流容忍不完美的初稿。
文字渲染是本次重点:基准把文字准确性、文字布局、字体与跨语言生成列为创意生成下的独立评估面。海报、包装、演示图、社媒创意、产品标签与信息图都用得上;但长文案、小字号或复杂多语言混排,仍要在最终分辨率下逐字核对。
Qwen-Image-2.1 可以直接生成 RGBA 图像:alpha 通道由模型的 64 通道 VAE 原生支持,不是后接一个抠图阶段。
这是实打实的工作流改进:不用再「生成 → 抠图 → 修边缘」,直接向模型要一个透明素材;同一能力还支持编辑透明图层,以及从照片中提取主体。
生成与编辑在同一条管线里:喂一张图做简单修改,或喂多张图做合成与身份保持编辑。
局部控制是显式的:圈选、涂抹标注与蒙版三级精度——描述一个局部目标、大致画一圈、或给出精确蒙版,远比让模型从一句话里猜区域可靠。圈出手表要求移除、标注发型换颜色、蒙版衣服换装,同时保持人物与场景不变。
最多 10 张参考图是另一个大能力:官方示例包括多人合成,以及用人物、衣物、配饰的独立参考组装整套穿搭。实际优势是构图控制——不用把每张参考图口头描述一遍,模型直接看图。
但 10 张参考也意味着更难的题:信息更多,身份与属性一致性仍取决于最终构图的复杂度,以及提示词给每张参考的分工是否清晰。
多参考工作流对照:人物场景、时尚穿搭、产品、分镜与风格迁移
三级局部控制让它更像AI 原生图形编辑器,而非一次性生成器;最强的使用场景,是只需要改图的一部分。
Qwen-Image-2.1 支持原生 2K 生成,官方仓库把 2048×2048 列为默认尺寸,并给出七种画幅的推荐分辨率。
七种推荐画幅与尺寸:1:1 为 2048×2048,16:9 为 2752×1536
社媒图、演示配图、产品摄影与移动端布局,都能按目标构图直接生成,不用先出方图再二次裁切。
架构为 32 层 Single-Stream DiT + Qwen3-VL 8B 编码器 + RGBA VAE。混合粒度注意力让静态文本与参考图上下文通过前缀 KV 缓存复用:编辑时参考图与指令在去噪各步保持不变,重复计算纯属浪费,架构直接复用编码后的条件。
发布即有 vLLM-Omni 与 SGLang 的优化推理支持,含 FP8 量化、CUDA graphs 与多卡并行。
随主模型还发布了两个 9B 提示词改写模型——文生图与图像编辑各一,均从 Qwen3.5-VL 9B 微调。用户给短指令如「把这张图做成高级影棚产品广告」,改写器先扩写成详细提示词,再交给 7B 视觉模型:语言模型负责指令扩展,视觉模型负责生成与编辑。
Day-0 生态支持:Diffusers 提供 QwenImage21Pipeline,ComfyUI 原生工作流,vLLM-Omni 高性能推理,SGLang 优化扩散推理,LightX2V 加速。
本地生态一览:Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 与 ModelScope
注意 7B 只是视觉生成组件:整条推理栈还包括 Qwen3-VL 8B 编码器与 VAE,显存占用取决于精度、分辨率与卸载策略。Qwen 官方文档提供 CPU 卸载方案,ComfyUI 的打包模型含 BF16、INT8 与 W4A8 编码器变体。
所以它比超大图像模型更适合本地,但别把它当成每张消费级显卡都能一键跑起来的轻量模型。
对比 2.0 Pro 与 Nano Banana 2对比 Qwen Image 2.0 Pro,最重要的差异是部署方式:2.1 可下载、为本地推理与定制设计;2.0 Pro 属于托管产品线。
Qwen-Image-2.1 对比 Qwen Image 2.0 Pro:可下载权重 vs 托管服务
对比 Nano Banana 2,基准分 60.28 对 59.82 是有用的数据点,但不能据此宣布「全面胜出」——这是 Qwen 自家评测管线。
更有意义的差异是产品形态:2.1 给开发者可下载权重、本地控制、原生 RGBA 与十图参考编辑;Nano Banana 2 是商业托管服务。一个强调对推理栈的所有权,一个强调省心。
Qwen-Image-2.1 对比 Nano Banana 2:开放权重与本地控制 vs 闭源托管
Qwen-Image-2.1 采用 Qwen Research License Agreement:允许非商业研究与评估,商用需要 Qwen 单独授权——与早期采用更宽松许可的 Qwen-Image 发布显著不同。
对研究者、学生、模型测试与个人实验,可下载权重依然价值很高;但对代理机构、SaaS 产品或商用图像生成器,它不能在研究条款下直接进生产环境。
实践中,许可是技术决策的一部分:免费下载但商用需单独协议的模型,经济上仍可能划算,只是商业论证与宽松许可的开源模型完全不同。
场景适配度:产品图、海报营销、透明素材等八项 Excellent,商用 SaaS 受限
原文给出的适配清单:产品图(2K + 产品保真 + 编辑)、海报与营销图(排版与设计编辑)、透明素材(原生 RGBA)、人物合成(最多 10 张参考)、时尚穿搭(多参考工作流)、本地修图(蒙版与标注)、ComfyUI 工作流(Day-0 支持)、研究与基准(可下载权重)均为 Excellent;商用 SaaS 因许可受限,托管企业 API 为 Moderate——官方尚未公布按张计费的一线 API 价格。
把 Qwen-Image-2.1 当作「创作-精修」管线,而不是一次性生成器。原文给出九步建议:
先定画幅:从目标宽高比与输出尺寸开始,别先出图再裁。复杂需求先改写:brief 里视觉要求多,先用提示词改写模型扩写。固定种子出初稿:固定 seed 生成第一版构图,方便对照迭代。小改走局部:小修小补用圈选、涂抹标注或蒙版,不重抽。要合成用透明:素材要叠进其他设计时,直接用 RGBA 透明生成。构图对了再上 2K:构图确认后,再拉到完整 2K 尺寸出片。导出前过细节:文字、人脸、logo、手部与产品细节逐项核对。商用先清许可:任何商业使用前,先解决 Qwen Research License。图像模型高度任务相关:围绕自己的实际工作建一个小评测集,比盯着一个基准分数有用。
自建评测集的十个维度:排版、人像、产品、编辑、多参考、透明、构图、提示遵循、2K 细节与迭代成本
真正有用的指标是每张可用图的成本:两次编辑就能交付的模型,胜过首图惊艳、却经不起精确修改的模型。
值不值得?对研究、本地实验,以及编辑和生成同样重要的图像工作流——值得。7B 视觉生成、2K 输出、RGBA 透明、十图参考与广泛的本地生态组合在一起,异常全能。
最终结论:Qwen-Image-2.1 是 2026 年 9 月最强的开源权重图像发布之一。价值来自生成、编辑、透明、多参考合成与本地部署的合体,而不是单点画质分:60.28 在 29 模型对比中排第 7,压过 Nano Banana 2.0、GPT Image 1.5 与 FLUX 2 Max——但它是 Qwen 自家基准,要如实标注。
产品特性对日常更重要:原生 RGBA 省掉抠图环节,十图参考简化复杂合成,蒙版与涂抹标注让局部编辑更容易,ComfyUI、Diffusers、vLLM-Omni 与 SGLang 提供多条部署路径。
作者评分:编辑 9.3/10、本地灵活性 9.2/10、画质 9.0/10、功能广度 9.4/10、商用就绪 7.5/10,综合 9.0/10。
一句话:想要本地生成编辑一体的图像模型,它值得下载——商用部署前,许可证必须当作决策核心。
综合评分 9.0,买一块「生成编辑一体」的本地图像引擎
7B 视觉核心同时接下生成与编辑,原生 2K、透明 RGBA 与十图参考把多条工作流收成一条。短板同样直白:研究许可证卡商用,60.28 的基准分出自厂商自测——下载试用零门槛,商用上线先谈授权。