Token导航 LogoToken导航TokenDH.com

Qwen3.8-Omni-Flash 发布:音视频降价 98%,全模态开始抢活?

更新时间 2026-09-19来源 Aike正文 1215字阅读约 4分钟3 张图片

一、这次的重点,不是"能听懂"

阿里今天上线的 Qwen3.8-Omni-Flash,卖点不在"听得懂",在"干得动"。

9 月 18 日,千问团队发布新一代原生全模态模型。文本、图像、音频、视频四种输入,1M token 上下文。

官方给它的定位写得很直白:让全模态模型从"理解全模态内容",走到"规划任务、调用工具、完成创作"。

更值得盯的是价格。每小时音频输入的成本降幅超过 98%,每小时音视频输入降幅超过 93%。

过去几年,音视频一直是全模态模型最贵、最难用的那部分。输入进去,出个摘要,人再接着干。

这次的口径变了:音视频直接变成智能体开工的对象。

图片

先说技术底子。模型基于 Qwen3.8-Flash-Next 架构,在模型层面原生处理四类信息,不是把语音识别和图像识别拼在一起各算各的。

它还支持 2 通道与 4 通道空间音频解析,覆盖 113 种语言和方言。

音视频这条线上的动作是连着来的。前后脚,千问云还上线了实时音视频同传模型,端到端时延压到约 2.3 秒。

这意味着什么?一整场两小时的会议、一整部电影,可以直接丢进去,不用先切段、抽帧、再接一条外部流水线。

二、音视频智能体,具体接的是什么活

官方列的场景很具体:视频剪辑、音乐视频创作、影视制作与解说、音视频转图文摘要、实时对话。

会议场景最能说明问题。多说话人识别一直是老大难。

在 AliMeeting 测试上,它的说话人错误率从上代的 88.11 降到 3.35,带说话人归属的字错率从 89.61 降到 17.18。

还有个细节我挺喜欢。官方做了一次"模型优化模型"的实验:12 小时内把 Qwen2.5-Omni-3B 的四川话识别字错率,从 25.79% 压到 15.30%

配套也一起放了出来,Qwen-MM-Plugins 管长程工作流,Qwen-Live Harness 管实时交互,两个都开源。模型本身没有开源。

图片

三、跑分和价格,赢在哪、还没赢在哪

官方口径是 29 项评测平均分提升超 25%,音视频 Agent 方向涨得最凶。

WildClawBench-MM 提升 36.5 分,AgenticVBench 提升 22.3 分,UniClawBench 拿到 69.6 分。

对标 Gemini 3.8 Flash,音频能力整体超过,音视频能力接近

但也不是全项领先。AgenticVBench 上 Gemini 是 45.0,Qwen 是 36.8;OmniGAIA 是 78.6 对 74.0;部分视频理解测试,Gemini 仍然占优。

所以"接近 Gemini"这个说法,准确范围是音频与音视频的整体能力,不是每一项都咬住了。

图片

四、收个尾

把这几件事放在一起,脉络就清楚了。音视频正在从"感知输入",变成智能体理解环境、推理、执行任务的核心介质。

而价格塌到这个位置,自动分析长会议、播客、直播、海量视频素材,就从"要不要做"变成了"顺手做"。

以前卡住这件事的不是模型不够聪明,是账单太贵。现在账单这一关松了,被卡的环节就往后移。

真正稀缺的,从来不是模型能不能干,而是谁知道该拿它去接哪个活。

文章标签Qwen阿里云模型发布价格调整智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多