Token导航 LogoToken导航

MiniMax H3开源三周衍生模型达300个

更新时间 2026-09-22来源 娱乐资本论正文 4296字阅读约 14分钟11 张图片

作者|罗兰

近期,河豚君在和一位AI影视从业者交流时,听到一套生产流程:前期用本地化部署的H3出草稿、抽卡、调提示词,等要出成片的时候,再调用官方API。这位从业者的原话是,“本地不用排队,成本更低,一晚上能抽几十版,到成片阶段再花钱买清晰度。”

当然,这套流程之所以成立,本质还是因为H3上传了权重。8月3日,MiniMax H3的权重上线Hugging Face,开源三周,全球下载量突破2400万次,公开衍生模型超过300个。据MiniMax在8月26日中期业绩会上披露,H3的下载量已经排在开源模型前列。

图片

AI作图 by娱乐资本论

这引出了河豚君更多的问题:开源与闭源会给行业带来什么不同的影响?影视行业的会不会被进一步重写?当越来越多的人可以参与创作,行业的核心竞争力会不会被彻底改变?

带着这些问题,河豚君采访了MiniMax内容生态负责人悠哩。

#本文已采访一相关人士,他们也是「娱乐资本论」2026年采访的第288位采访对象

图片

开源六周,300多个衍生模型带来了什么

在整个采访的开始,河豚君把从业者的用法直接抛给悠哩:本地部署出草稿、API出成片,并询问她如何看待这件事。

在悠哩看来,对部分有一定技术能力的创作团队而言,本地化部署出草稿、调提示词、训练主角或画风的LoRA,等到出成片时再调用API,从而在保证质量的前提下优化成本,这确实是一个不错的选择。

随后她补充道,“当然,这并不是标准答案,现如今对AI的应用,其实没有共通的方案,毕竟有的人在意速度,有的人在意成本,有的人在意清晰度和质量,还是要结合团队情况确定具体的使用方法。当然这也是开源带来的好处之一,各大社区里都有大量的后训练模型,可以让各种不同的团队都能找到合适自己的方案。”(这里需要注意的是,严格意义上来说,Minimax H3只把负责生成768p音视频的H3-Base权重公开,负责把多模态指令"翻译"成模型能懂的中间表示的Context-IR、以及把768p重生成到2K的Regenerate-2K,仍只在API侧。)

图片

5090+128GB内存本地化H3的生成效果

事实也确实如她所说,作为目前相当火热的开源模型,H3在ComfyUI社区镜像上线一周,下载量就突破600万次(MiniMax在8月13日的口径为近700万次);英伟达研究团队在开源首日使用Sol Engine,只用4.5小时就完成了首轮推理优化,把33B的模型搬上了消费级显卡。

开源6周后,H3一度延伸出300多个不同的后训练模型,河豚君将这些衍生模型大致分成五类,对于影视行业而言,它们都有各自的价值。

第一类也是最常见的,是加速模型。larryvrh的Turbo LoRA在开源第3天发布,把20步压到4至8步;LightX2V的4步Turbo版月下载量超过150万,是目前下载量靠前的加速方案。这些加速LoRA也在很大程度上优化了“抽卡”的效率和成本。

随着Fal的H3 Max,一个5秒的视频只需要3秒就能生成的超级极速版H3出现,一台24小时不间断直播的AI电视台随即上线,屏幕上没有主持人,也没有编播表,观众只需要在输入一段提示词,就能决定电台剧情的未来走向。对此,悠哩则表示,这其实算是AI的一个拐点,意味着AI生成真的能完成直播。

图片

知名开发者 Pieter Levels 上线的24小时AI直播网站

第二类,则是画质优化。fal的Realism People修改了注意力投影层,国产作者TuTu_1018的"电影质感"LoRA则直接针对过锐、硬光做了修正,这些都能在很大程度上修正“塑料感”和“广告棚布光”。

三是运镜与动作派,Jojocodex的Camera Motion LoRA把推、拉、摇、移、环绕、升降、航拍、手持等9类运镜做成了可控开关,还附了55条提示词库,同一位作者的Wushu Action LoRA已经迭代到第7版,用924段武打素材训练,让大全动作变得更加有打击感,Spatial Physics LoRA用CLEVRER、WISA、PhyCo三个物理推理数据集训练,专治碰撞、堆叠、掉落违反物理。

而在开源社区里,“武打0.5+物理0.3+运镜0.8”是流传最广的一张配方卡,能够让H3产出的武打短片从“人物乱动”变成一个有打击反馈,有镜头冲击的功夫展示。

四是角色与参考派,依托Ref2VA分区,最多可输入9张图、3段视频、3段音频,做角色参考、动作迁移、声音克隆,这些都能够很好的帮助角色一致性。

第五类则是功能扩展派,把视频模型往别处用:线稿上色、局部重绘、三视图、360°全景、VR180、流式生成,甚至还可以只输出单帧当图片模型用。

更特别的是,9月,腾讯联合新加坡国立大学、香港理工大学则走了一条完全不同的路,用8000条游戏视频、微调0.199%的参数,就让H3变成了可以用键盘WASD控制角色移动、IJKL控制镜头运动的世界模型H3-World。

图片

图片

AI改变了3件事

功能越来越丰富,AI越来越强大,但在悠哩看来,AI带来的改变本质只有3件。

第一是门槛。这是最为直观的一项,在他看来AI最重要的价值就是把表达这件事的门槛拉低了。以前创作既有人脉门槛,也有专业门槛;但现在只要有想法,有好奇心,有开放的心态,就可以做出自己的作品。

当然,这点也并不完全是好事,对于刚想入行的创作者,悠哩表示,如果想以专业者身份入局、追求商业回报,那么就必须意识到,随着AI技术的发展,必然会导致生产的门槛越来越低,生产者也会变得更多,内容基数也会随之扩充,竞争只会更激烈。

第二是生产链路,除了常规的让影片生产变得更简单之外,更关键的是降低了生产链路带来的损耗。她提到,在传统内容工业里,一个创意可能需要经历从编剧传到导演、分镜、摄影、布景和后期的超长链路,在这个传递的过程中,由于理解、传达等一系列的因素,创意会被层层磨损。

图片

传统分镜图

与之截然相反的是,在AI时代,创作表达可以变成一件极其个人化的事情。单独一个人也能完成创作,使得创作者的审美和经验可以完整贯穿一部作品,而不必经历层层传话带来的过多损耗。

不可否认的是,现阶段AI对创意也同样有损耗,但在悠哩看来,这种损耗也会随着时间的推移,被技术的迭代变得更小乃至最终消失。就像一两年前的AI模型几乎完全没有打光意识,几乎无法理解顶光、背光、环境光之间的区别,但现在,创作者只需要在提示词里写上“伦勃朗光+轮廓光”,AI也能理解并很好的执行。

甚至现在,在后期层面上也有所优化。过去AI视频更多生成的是中间性的画面,剪辑、包装、上字幕和声音这些环节很难触及,而后期在人力和成本上的占比都很大。H3在这一版里专门补了文字渲染:字幕、小字、游戏界面文字和motion graphic这类动效。

图片

抖音@肖恩AI实战派 用H3创作的AI女团混剪

第三是反馈机制和速度,作为曾经的影视导演,她对此有相当直观的感受:实拍时代,一部剧在剧本阶段的收到反馈的时间往往以月计,拍摄阶段则可能需要9个月才能直观得到最终的成果反馈,在成片推送阶段,接受观众检验并获得反馈可能是一年以后的事情了。

而到了AI模型时代,从剧本到画面再到连贯的片段,导演获得的反馈几乎是实时的。编剧上午给出剧本,可能2小时后导演就能通过AI了解最终展现的影片效果和部分预览,而在这个过程中,导演还能根据自己的感受随时调整内容,并将随时迸发出的灵感加入到影片中去。

《离婚记》就是一个很好的案例。悠哩介绍,山音(MiniMax超级创作者、离婚记作者)拍摄该片的选题是来自生活和长期积累,但最终画面中两人从正常空间打到屏幕里、再打到Windows桌面上,却是生成过程中突然冒出来的想法。以及,打斗过程中主角会把桌面上的弹窗拿起来丢给对方,也是他看到H3的生成结果后“突发奇想尝试一下”的结果。

图片

《离婚记》弹窗对打

“这意味着,很多时候剧集的制作都可以在边做、边试错、边改的过程中完成。”

图片

从短片到长剧,模型厂正改变片场

回到MiniMax自己。开放权重之前,在H3开源之前,行业内的旗舰级视频模型大多是闭源的。因此,MiniMax在8月3日开放权重,成为目前为数不多的开源旗舰级视频模型后。河豚君问了个看起来理所当然的问题:MiniMax是基于什么样的行业判断,选择把模型开源?

悠哩的回答出人意料。“我们不是判断出了什么机会才决定开源,而是一直在践行开源的价值观。”反直觉的是,开源并没有损害MiniMax的营收增长。8月26日中期业绩会公开披露,8月,MiniMax的ARR已经超过8亿美元,To B业务占比约80%。

开源之外,MiniMax过去半年的动作,发现Minimax和内容的结合非常紧密,河豚君梳理出一份对模型厂商来说不太"本分"的清单。

在长剧上,Minimax在4月与恒星引力签署AI内容战略合作协议,推进S+级电视剧;上线55分钟AIGC韩语悬疑长片《霉》,拿下第十六届北京国际电影节AIGC单元最佳导演奖、最佳技术突破奖、香港国际AI电影节最佳叙事设计奖以及戛纳世界人工智能电影节最佳先锋实践奖。

图片

韩语悬疑长片《霉》

而在赛事和短片赛道,H3上线后也有《离婚记》《黄金时代》两部短片在短视频平台收获百万点赞;并且和上海国际电影节合办AI片场,让一位传统影视创作者搭档一位AI创作者组队拍片;此外还有戛纳世界人工智能电影节、上海西岸美术馆年度特展。

不到半年,MiniMax从短片、短剧、漫剧做到长片、长剧,一家模型公司把内容形态几乎做了个遍。而在河豚君看来,现阶段模型厂商和内容生产者深度合作,本质还是基于两层需求。

第一层是验证。 视频模型的能力需要被看见,而让人看见的办法就是拿出作品。《离婚记》证明了模型能实现Windows XP弹窗这一类视觉效果;55分钟的《霉》则证明视频模型能支撑近一小时的叙事稳定性。

第二层是探索可能性。 对模型厂商来说,深度合作能具体理解创作者的使用习惯、痛点和方法论,为下一代模型迭代提供方向。悠哩在采访中反复提到一个词:“零gap”,一线从业者的使用痛点,能够快速得到模型算法的重视和反馈。

采访最后,悠哩透露了MiniMax目前的动作:在视频侧,Design产品将接入更多优秀的H3开源变体,并支持ComfyUI本地部署。

而在谈及AI内容会不会成为标配时,她的判断则是:AI内容会从一眼看出是AI,到无法辨别什么是AI,到不愿辨别,最终不需要辨别。“这个趋势我觉得是一定的。在技术迭代的过程中想到更新的形式和更适配的内容,就能够找到自己的一席之地。使用AI这件事情的难度变得越来越低。能够被留下来的、真正被看到的决定性因素,还是创作者的表达到底能不能吸引人。”

文章标签模型发布开源
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多