7B小模型反超闭源,千问Qwen-Image-2.1开源:原生透明图

阿里千问这回搞了个大动作,正式开源新一代图像模型Qwen-Image-2.1。这次直接把文生图和图像编辑整合到一个模型里,操作更顺手。视觉生成部分只有7B参数,看着不大,实力却相当硬核。 在Qwen-Image-Bench公开评测里,它拿到60.28的总分,直接坐上开源第一的宝座。

这成绩不仅超过了闭源的Nano Banana 2.0,还把GPT Image 1.5也甩在了身后。官方给它的定位很明确,就是千问图像系列里最平衡、性价比最高的开源生图模型。 技术细节上,视觉生成用了32层Single-Stream DiT架构,原生支持2K分辨率输出。

整个管线算下来,包含Qwen3-VL 8B文本编码器在内,总参数量大约是16.22B。这个配置在保证画质的同时,控制住了算力消耗。 推理这块也有讲究,引入了混合粒度注意力结构。文本部分比如系统前缀、编辑指令,走的是Token级因果掩码。

图像生成部分则走Chunk级掩码,还配合了KV Cache复用机制。简单来说,就是把输入图像和编辑指令当成静态上下文,在第一步就预计算好缓存。 这种设计在多图输入的场景下效果特别明显。推理速度和显存开销都能得到很好的平衡,跑起来既快又省资源。

对于需要处理大量图片的用户来说,这是个实打实的利好消息。 这次更新里,最有实用价值的功能得数原生RGBA透明图。模型能根据提示词,自己判断该输出普通图像还是带透明通道的图像。以前那种繁琐的额外抠图环节,现在完全不需要了。

这项能力其实吸收了去年12月发布的Qwen-Image-Layered专用模型,并且做了大幅扩展。不光能生成单个主体的透明素材,连多元素组合的复杂结构图像也能搞定。透明图层里的文字、人物表情,都支持直接编辑,灵活度很高。

举个例子,输入一张普通的RGB真实照片,模型就能提取出主体,输出带Alpha通道的RGBA图层。像毛发边缘这种传统抠图的头疼问题,从根源上就被绕开了,效果干净利落。 编辑能力方面,这次升级了四个维度。

首先,参考图的上限提到了10张。你可以把多张人像合成一张合照,或者输入模特、衣服、鞋子、包包、帽子这五张图,直接生成一套完整的穿搭方案。 还有更实用的玩法,比如参考10张家装图,模型能输出一套室内布置方案。

局部编辑支持圈选、涂抹和独立掩码这三种方式。你可以一次性指定多个区域分别修改,用掩码方式的话,还能完整保留原图的其他信息,互不干扰。 在人像和商品的保真度上,也做了针对性增强。修图前后,面部特征能保持高度一致。

商品放到新场景里,文字、纹理和形态都不会走样。同时,模型还覆盖了全景图、信息图、分镜图等多种任务类型,适用范围更广。 文字生成方面,除了内容要准确,现在还更注重字体、排版和画面整体的协调感。人物表现上,强化了光影和细节刻画,让生成出来的结果看起来更接近真实质感,不再是那种一眼假的塑料感。

热门推荐