
财闻 顾群生 发自杭州
六七张参考图,可以生成一段30秒短剧;一个六人团队,已经运营起十几个AI歌手。
9月22日,在云栖大会视听生成分论坛上,阿里介绍了千问图像模型Qwen-Image-2.1的更新,展示万相视频生成模型在短剧、音乐MV等场景中的应用,并发布音乐生成模型Happy Shrimp 1.1。
千问生图强化编辑,支持多图组合
阿里巴巴(BABA.US)ATH事业群Token Foundry Qwen-Image技术负责人吴晨飞介绍,Qwen-Image-2.1已于9月20日开源,视觉生成部分参数规模为70亿,支持图像生成与编辑。此次更新重点包括原生透明图像、多图输入、局部编辑,以及人物和商品特征的保留。
吴晨飞在现场展示了多张参考图组合生成的案例,包括将六张人物照片合成一张合影,将上衣、裤子、帽子等搭配到模特身上,以及输入空房间和家具图片,生成室内布置效果。

针对局部修改,模型提供圈选、涂抹和掩码等方式。用户可以圈出需要修改的区域,通过文字说明调整要求;也可以保留原图,额外输入一张标记修改区域的图片,减少对原始画面的干扰。
透明图像的生成和编辑也是此次更新的重点。吴晨飞以火焰特效为例解释,透明度不仅涉及抠图,还包括火焰边缘与中心不同的透明程度。模型原生支持透明图像后,创作者可以生成、修改独立素材,再进行拼接。
在人像和商品编辑中,模型需要处理姿态变化与细节保留之间的问题。例如,手串从平放变为戴到手腕上后,仍需保持商品特征;衣物穿到模特身上后,也要保留复杂纹理。
吴晨飞表示,在短剧分镜制作中,输入人物多个角度的参考图,有助于保持不同镜头中的人脸一致性。
对于模型规模,吴晨飞表示,团队追求在达到可用标准的前提下,尽可能减少完成任务的成本。他同时透露,Qwen-Image-3.1正在推进中。

英特尔(INTC.US)首席工程师、端侧AI首席架构师罗宁介绍,英特尔已在Qwen-Image-2.1发布首日完成支持,后续将与千问团队继续推进端侧适配和优化,让图像生成与编辑能力在本地设备上运行。
万相3.0,跨镜头一致性仍是难点
视频生成部分,阿里巴巴ATH事业群Token Foundry多模态生成算法科学家张士伟围绕万相3.0介绍了技术进展。模型支持文本、图像、视频和音频的组合输入,团队主要从画面、运动和音频三个维度改善生成效果,包括提高画面细节、减少运动崩坏和穿模,以及改善人声、音效和音色一致性。

现场播放了影视短片、短剧、电商广告和音乐MV等案例。据张士伟介绍,其中一段30秒短剧由六七张参考图生成。电商广告案例中,模型根据标有拍摄要求的参考图生成视频,音乐MV案例重点展示了音乐节奏与视频内容的配合。
对于更长视频的生成,多模态生成算法科学家姜文韬表示,用户已不满足于数秒的简单片段,而是希望精准控制人物、场景和运镜,并让这些要求在多个镜头中持续成立。
他指出,随着条件增多、时长增加,仅靠细化文字描述,模型仍容易遗漏局部要求,难以保持前后一致。团队正在探索引入图像、音频、视频,以及布局、轨迹等控制信息,并围绕创作要求规划剧情、分镜和参考素材。
音乐模型更新,AI歌手探索变现
音乐方面,Happy Shrimp技术负责人林轩介绍,1.1版本加强了对创作意图的理解,并改善旋律、编曲层次和演唱表达。例如,针对过去部分AI音乐编曲过满的问题,新版本更注重段落留白和情绪推进。
林轩同时表示,目前还无法随意控制音乐中的任意元素。如何在修改某段鼓组时保留旋律、人声和其他段落,仍是团队希望进一步解决的问题。

小旭音乐创始人卢小旭随后展示了团队制作的AI歌手。他介绍,音乐、语音和视频需要借助不同工具完成,角色还要经过形象筛选、音色训练和持续运营。
目前,六人团队运营十几个数字歌手,正在尝试广告、MV定制和数字人孵化等业务,商业变现仍处于早期探索阶段。







