
作者|赖捷
编辑|张洁
有句心灵鸡汤,叫“迈出第一步就是胜利”。
但对愈加火爆的AI视频行业而言,很多想入局的新人往往第一步都迈不出去。
虽然我们脑海里有故事,也知道可以用AI把它变成剧本、生成人物形象、做成提示词,但最后的生成结果大概率是绝望的三个字——不能用。更绝望的是往往不知道问题出在哪。
专业人士同样困扰,一部AI作品涉及非常复杂的流程,写剧本、做分镜、画人物形象、给每一帧关键镜头画参考图,然后把它们融进提示词,再检查这些提示词是否准确。
管理这些流程的难度,不亚于让一个人同时炒五盘菜。基础模型很重要,但管理创作流程同样关键。
有什么解法?千问最近推出的“千问创作”,集成了Wan 3.0、Wan 3.0 Prime视频模型能力,以及Qwen-Image 3.0的生图能力,更上线了新功能——拉群聊,把导演、编剧、美术、摄影、剪辑……统统拉进群,让各领域的Agent在同一场对话中,管理视频生产流程。而且,你可以在千问APP手机端、网页端,通过发语音直接摇人、管理后续流程。

想象下,韩国著名导演李沧东是搞文学出身的,他初入行时想拍电影该咋整?显然不是自己写镜头语言、设计美术形象,而是找家韩式烤肉馆,把圈内专业人士请来一起聊聊,你一句我一句,分工有了、工作流程也有了。
千问创作的“Agent Teams”,就是那一场五花烤肉酒局。而有了创意后直接语音摇人讨论,是更低成本的沟通方式。

有创意想做AI视频?
我用千问创作摇人
现在,我假设自己是制片人,看看千问创作能做啥。
最近“薛甄珠抓小三”的二创视频特别火,被AI魔改成了韩剧财阀版、日剧清新版……我是游戏迷,想做个游戏版。
直接去千问网页端或手机端,点进“千问创作”,用语音告诉它我的想法,然后千问的创作助手开始帮我摇人了,先邀请了一位叫“洛圣都”的导演加入饭局,让他专注于游戏GTA风格,然后编剧、摄影、剪辑纷纷到场,为我规划整部的剧情、画面。

与传统饭局“喝完大酒却没结果”不同,它们很快一次性为我生成了视频,编剧还把“打小三”改成了更为海派文明的“摔咖啡”。以下是前30秒的视频效果,总体来说,还算比较精确地还原了GTA游戏那种特殊的“机械感”:
AI创作领域里,中国风寓言故事是经久不衰的题材。而我自己觉得,“坐井观天”这个典故的内涵其实还没被充分挖掘。
这一次,我选择用手机端的千问APP,进入千问创作,直接语音输入。

它给我找来一位擅长寓言故事的编剧,一口气规划了十个故事,第一集,讲青蛙跳出井后,发现井上面还有井,这口井在一个封闭的动物园里,而动物园又在封闭的城市中,层层套叠,永远逃不出那片天;第二集,讲青蛙跳出了井,却一直背着井去远方,哪怕到了新世界也依然愿意住在井里,可谓“背井离乡”……
然后是一位擅长水墨画风的美术师,负责设计角色图、关键帧参考图。

千问创作设计的形象图
最后由摄影师把所有的道具、角色图融入到提示词中,哪一段必须引用哪张图,一清二楚。
最后生成效果是这样的:
可以看到,蛙跳出井后的转场以及随后无穷尽的“天井”,极具压迫感。
总结下来,千问创作的新模式有诸多好处。
首先,是真实还原了剧组创作过程。有了创意马上找人聊,然后编剧形成脚本、导演写出讲戏的台本、美术画出风格、摄影师把所有元素细化进分镜、剪辑则把零碎的视频拼接成几分钟的长片……所有的问题,都可以在群聊里完成,哪一帧出了问题、哪一段剧情要修改,都可以直接用自然语言解决,你甚至都不用像真工作群聊那样@某人,因为创作助手会自动识别摇人,它相当于你的超级助理。

出问题时,千问创作会规划解决方案
其次,创作者真的可以只动嘴,用手机说话也行——千问创作已经集成到千问APP,你有什么灵光一现的点子,可以先找创作助手聊聊,它帮你规划,你来选择。而传统创作大部分情况得用电脑,得储存拖动各种资产素材,非常麻烦,而且大部分人其实没有日常背着电脑出行的习惯。这种手机创作模式,非常适合哪些没有复杂剧情的轻量AI视频。
最后,是成本透明可控。Wan3.0模型在千问首发上线时,提供的是会员四折起优惠,理论上720p视频可以低到0.26元每秒,价格相比市面同帧率视频几乎砍了一半。但熟悉AI视频创作的朋友肯定知道,价格不等于最终成本,它还取决于你抽卡成功率。而千问创作,恰恰会指引大家控制成本。我做视频时,导演会反复提醒,剧本中涉及到复杂画面,最好先出几张关键帧参考图;每次生成消耗积分前,它会弹出提示,这样可以让创作者再检查下提示词;生成视频后不满意,可以对关键帧进行编辑修改,无需整片重抽卡。


拉群之外千问还能做什么?
哪些必须创作者手搓?
当然,群聊不是万能解药。一个公司干事的人活不行,群聊拉再多也是白搭。在“Agent Teams”之外,千问创作也提供了单兵能力。
这是我在对话框输入简单创意后,让它直出的养生饮料广告视频,它会为我规划方向、设计提示词,生成效果也基本符合电商需求:
这是由作者用千问创作生成的史诗风格视频,我把它称为“文明起源”——一个猩猩最初只会使用石头,慢慢地进化为能使用弓箭等简单工具,随着大脑的进化,它们会慢慢学会造子弹、造火箭、造星际旅行的飞船。
这一切进化都浓缩到了30秒不到的视频里,一镜到底,这非常考验大模型对视觉细节的拿捏。
而千问创作调用的主力模型,是Wan3.0、Wan3.0 Prime,支持单段30秒的视频生成,人物场景一致性更好。Wan3.0 Prime满血版的生成速度更快,实测后发现,普通工作日无论是白天还是夜晚,30秒视频大概5分钟就能出片。
千问创作的图片模型则是Qwen-Image 3.0、Qwen-Image 3.0 Pro。图片模型,是新入局创作者比较容易忽略的功能,因为大家往往会觉得提示词足够好,就能生成好视频,但实际上,参考图往往最终决定了视频质量。
比如我想设计一个剧情——世界末日之后,人类纷纷到喵星避难,需要一个慵懒的橘猫作为签证官,这是千问创作直出的避难所造型和橘猫形象,审美基本在线,我全程只进行了语音指令以及选择风格两个操作。


这里面有个很重要的细节,就是文字准确性。AI视频的一大痛点,是直出时会经常出现文字错误,招牌、字幕等。Qwen-Image 3.0的一大改进,是提升了文字控制力,生成的文字基本没有错误,特别是小号字,下图是它生成的喵星签证文件细节,用设定好的图片去生成视频,就不会因为一个字错了而重复抽卡。

这是我用一句非常简单的提示词做的科普图,“请做一张脑机接口原理和发展历史示意图”。可以看到,它对关键技术名称的描述文字,哪怕是英语小字,乃至&等专业符号,都是准确的。生图模型领域经常出现的字词错误,以及忽略小细节的毛病,可能即将成为历史。

这些细节把控,有利于创作者去做科普、知识相关的视频。
当然,看完以上介绍,可千万别觉得做AI视频就是一键生成的事,说几句话做几个选择就能产出爆款,工具可以帮你降低入门成本,但关键细节需要自己控制。
比如我做“橘猫签证官”这个一次性生成的视频,画风、形象、剧情、配音都很流畅,但在生成视频时,我没有对手部文件细节等关键帧进行控制,这就会导致橘猫在签证时的文件动作细节出现问题:
这也是AI视频制作时的普遍痛点,画面比较单一的人物对话、打斗,现在几乎可以做到很惊艳,无需费神,但涉及到复杂的镜头转换、动作逻辑小细节,创作者就必须手动去审查、修改每一处提示词,任何一处细节错误都会导致重来。
所以,如果你想做一部精细完美的作品,依然得去学习影视创作基础,学习镜头语言,积累经验。这方面,千问创作也为专业创作者准备了画布功能,对镜头语言进行精细控制。

“千问创作”发布时,
AI视频工具正发生哪些改变?
AI视频有多火?根据中国网络视听协会的数据,二季度国内共上线的微短剧是23.9万部,其中真人剧8.6万部,AI剧15.3万部。
但普通人更真实的体感是,现在刷短视频,几乎一半以上都是AI视频,看到惊艳的视频,网友往往会本能反应——这是不是忘了标注AI生成。
大量普通人开始参与AI创作,一个重要的原因,就是视频模型的发展解决了场景不一致的问题,半年前还经常出现的穿帮,现在已经不是问题。而在AI视频工具层面,行业也在发生变化——从局部环节的优化,转换为全流程的辅助。
过往的工具,通常比较细分专业,它辅助创作者解决某个具体问题,比如虚拟资产的管理、后期的剪辑,而千问助手想要解决的,是影片从创意到最终落地各个环节的能力。
这背后,则是AI创作的全民化趋势,普通人把创意落地,是从0到1;成熟团队把已经落地的案例快速复制,是从1到100,而从0到1是最难的,需要一个相对普适的工具。
当工具越来越完善,成本越来越低,整个行业会更加比拼人的灵感和世界观,当整个剧组的能力都可以用Agent来实现,那人真正重要的能力,还是审美和创意。
欢迎分享、点赞、推荐一起研究AI







