Token导航 LogoToken导航

阿里云云栖发布Qwen-Image-2.1开源生图模型

更新时间 2026-09-22来源 BubbleBrain正文 3469字阅读约 11分钟9 张图片
图片

这两天云栖大会,  又是最热闹的时候。阿里在现场公布了一系列大模型进展,而且还在前两天开源了Qwen-Image-2.1 图像模型,最有意思的是这玩意参数才7B,本地部署非常友好,而且表现真的很亮眼。

图片

开源生图模型 里面,它排在第一。

这么牛逼的话,我肯定要翻一下官方发的技术博客。发现这次能力强是因为有几个特点:

一是算法上,更加聪明。

混合粒度注意力对文本和图像采取不同的处理方式。也就是文本走Token级因果掩码,而图像生成部分采用的是Chunk级别的掩码并配合KV Cache 复用,把输入图像和编辑指令在首步计算缓存,能够大幅加速推理速度,显存开销更低。

二是训练任务上更加统一。

这个模型在训练的时候,就是同时要求学会生成与编辑。包括这次特别更新的一项重要能力是,能直接生成透明图像,也是来自于去年12月发布的Qwen-Image-Layered而积累下的能力。

三是结构更加轻量。

视觉生成部分参数量仅仅7B ,采用了32层 Single-Stream DiT 的架构。模型小也就意味着训练上会更加聚焦、部署的门槛就更低。

所以Qwen-Image-2.1的所有能力都是天然打通的。

OKK,那现在我们开始进入实测。

第一个测试的case 是非常常见的电商场景里会遇到的, 模特换装。

图片
假如,我是说假如,你是一个卖衣服鞋子的卖家,你需要让用户看到穿上衣服和鞋子之后是什么样的效果,那这就是一个很好的例子。

模特穿上灰色T恤和白色板鞋的效果感觉非常贴合,看不出什么毛病。

还有还有, 让模特 换个包 试试

图片

Qwen-Image-2.1 在一致性上做的是真不错。

还有个比较有意思的是,如果嫌prompt里说明怎么编辑修改比较慢的话,我们可以直接通过灵魂手绘的方式。

比如这里,我胡乱圈了两个地方,一个是不要红圈里的图案,还有一个是绿圈圈出来的头发变成红色。

图片

Qwen-Image-2.1 理解起来没什么难度。 硬要挑一点带面的瑕疵,就是背景有点点颜色不同。

接着来,第二个case 是 多个人物合影 。

提示词在这儿:

上下滑动查看完整内容

五张参考图中的五位男性人物共同拍摄一张合影,严格保持每位人物各自的面部特征、发型、身材比例与整体形象一致,确保五个人都能清晰对应各自参考图。图1人物站在最左侧,身体微微侧向中间,一只手插入口袋,另一只手自然下垂,姿态轻松。图2人物站在左侧靠中位置,双手自然交叉放在身前,头部轻微偏向镜头,表情自然。图3人物站在画面正中央,作为视觉中心,正面面对镜头,一只手比出简单手势,另一只手自然垂下。图4人物站在右侧靠中位置,身体微微后仰,一只手搭在旁边人物肩膀上,另一只手放松垂下,增加朋友合影的互动感。图5人物站在最右侧,身体略微侧身,一只手插入口袋,另一只手抬起做自然随性的手势。五个人的姿势、手势和身体方向都明显不同,但整体关系自然统一,像真实朋友或团队一起拍摄的合影。人物之间保持合理距离和轻微前后层次,构图协调,五人全部清晰入镜,避免人物遮挡、重复、融合、错位以及多余手脚,真实摄影质感。

图片

这里我觉得  Qwen-Image-2.1 最变态的是它的指令遵循能力。我对照提示词来看,五个人物真的按照提示词说的一模一样的姿势做出来。

要知道这只是一个仅仅7B的小模型啊。。。

再来一个多人的case,这次我给了九张参考图:

图片

我指定了其中的四个人穿上参考图中的新鞋,并且AJ的logo要放在左上角。Qwen-Image-2.1 也完成的非常好。主要是生成速度确实非常快,很丝滑。

还没完,文字渲染这个场景,7B的模型也做的非常不错。

比如下面这里有三个case:

图片

最左边是一个票据风格的音乐节海报,右边两个是明显有字体设计和排版的。我其实还是惊讶于它的指令遵循能力,下面是最右边那个case的提示词:

上下滑动查看完整内容

这是一张以李白《将进酒》为主题的新中式文字海报设计,竖版构图,画面以文字排版为绝对主体,不使用人物,不使用复杂插画。整体气质豪放、洒脱、诗意,具有盛唐浪漫主义与现代东方平面设计结合的视觉风格。背景采用微微泛黄的米白色宣纸质感,带有自然纸纤维、轻微墨迹晕染和旧书页般的温润质感。整体配色以墨黑、米白、朱砂红为主,局部加入极淡的灰墨色,画面克制但具有强烈的书法张力。画面中央以极大的行书 / 狂草书法字体写出主标题:“将进酒”三个字纵向排列,笔画粗细变化明显,具有飞白、枯笔、墨色浓淡与自然毛笔拖痕,字形潇洒奔放,部分笔画可轻微越出排版网格,形成强烈的视觉冲击。主标题旁边以较小的行书写:“李白”并在旁边加入一枚朱红色篆刻印章,印有“太白”二字。画面上方以较小的宋体或仿宋字体横向排列:“唐 · 李白《将进酒》”形成传统书法字体与现代规整字体之间的对比。画面中下部选取诗中最具代表性的文字,以大小不一的书法字体错落排版:“君不见黄河之水天上来,奔流到海不复回。”“人生得意须尽欢,莫使金樽空对月。”“天生我材必有用,千金散尽还复来。”“烹羊宰牛且为乐,会须一饮三百杯。”其中“人生得意须尽欢”使用较大的行书字体重点突出;“天生我材必有用”可采用更粗、更奔放的狂草书写,成为第二视觉中心。画面最下方以细小宋体排版一句:“古来圣贤皆寂寞,惟有饮者留其名。”文字周围保留大量留白,使整个画面具有呼吸感。局部可加入极淡的水墨酒痕、圆形杯底墨印、飞溅墨点和一条抽象的黄河水墨曲线,但所有装饰元素必须弱化,不能抢夺文字主体。不要山水画,不要人物肖像,不要具象酒壶插画。整体版式采用现代东方编辑设计,书法大字与规整宋体混排,纵向文字与横向文字交错,大量留白,局部文字轻微错位、叠压、越界,呈现出豪迈、醉意、自由而高级的视觉效果。整体像一张当代书法艺术展海报,具有强烈的文化感、收藏感与设计感。

 Qwen—Image—2.1  做的非常完美,文字放置的位置,字体,排布都很到位。

然后我还特意试了试这次最重要的更新,透明图像。

它可以直接通过提示词就生成这种能把主体和背景分开的图。

图片

这三个case很好的可以看出不仅是单个的透明物体图没问题,就算是多个的透明物体,生成也没什么压力。

这个透明图像能一键做到这个效果,对做品牌IP、电商设计都非常实用,设计师以后都不用自己手动抠图了。

最后再聊几句这次的云栖大会吧 。

看完阿里这次公布的进展,我认为有两个方向是值得大家关注的,

一是要继续往上探模型的能力上限。

比如语言模型这边,Qwen 4 已经在训练中了,估计要不了多久就能跟大家见面。后续的Qwen 4.5 、Qwen 5 总参数规模还将迈向5-10亿。

特别是他们还提到了RSI,也就是递归自我改进。

按照这次云栖大会阿里披露的内容来看,这项探索已经进入了模型训练、推理优化与模型协同设计等等环节。

比如模型训练。

以前模型要更新,通常是研究员先从评测或者用户反馈里找问题,再准备数据、做训练,看看效果怎么样。下一轮,继续从人工分析开始。

而这次,按照阿里的介绍,Qwen3.8-Max 已经能自主搭建训练流程、构造训练数据、设计实验和定位缺陷,在人类完全零参与的情况下持续迭代超过一个月,完成了 33 轮有效迭代。 这里的“零参与”,就是RSI

也就是说,模型已经开始参与发现问题、做实验、再改进的过程。结合 RSI、后训练等一系列技术优化,Qwen3.8-Max 新版本在 Artificial Analysis 上的得分从 40 分提升到了 45 分

再比如推理优化。

他们说,Qwen3.8-Max  在此前没有接触过的平头哥新款 GPU 上,自主适配、优化了 Qwen3.8-Flash 的推理框架,实现了单实例推理吞吐量提升 96%

让模型不停地发现问题、验证想法,再把有效的改进用到下一轮迭代里,它能帮助研究员把下一轮模型做得更好,跑的更快,这就是为什么大家都在讨论RSI的原因 。

二是还要把好用的能力做得更便宜,更容易用起来。

比如像图像这边,一个7B的模型已经可以把很多活儿干得像模像样了。

而且这次大会还提到了视频、语音、音乐和世界模型。对于一个做内容的人来说,非常期待未来这些更强的能力能不能更顺畅丝滑的接入到我自己的创作流程里。

回过头来,再说说图像。

除了 Qwen-Image-2.1 开源,这次云栖大会 3.1 也已经亮相预热了。偏重商业场景的 3.1,要继续往前推一步:把原本数小时的设计制作压缩到秒级,继续提升精准编辑的能力。

这个方向我是很期待的。毕竟真正做东西的时候,第一张图生成出来,往往才刚开始。后面还有客户的修改、商品细节的调整,以及那些这里改一下,其他地方千万别动的需求。

一个 7B 模型已经把能力亮出来了,接下来,我更期待看看 3.1  能把这些真实的活儿干到什么程度。

文章标签阿里云大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多