9 月 18 日,阿里千问正式上线了新一代原生全模态模型 Qwen3.8-Omni-Flash。名字里的「Omni」不是新词,但这次官方给出的定位很具体:让全模态模型从「看懂内容」走到「规划任务、调用工具、完成创作」。翻译成大白话就是——不只会描述你给它的音视频,还要能干活。
一句话说清它变了什么:从「看懂」到「会干活」
前几代多模态模型的典型用法是「描述」:给它一张图,它告诉你图里有什么;给它一段音频,它转成文字。这类能力有用,但离替代工作流还差得远——描述完之后,剩下的整理、剪辑、排版还是得人来做。
Qwen3.8-Omni-Flash 想补的是后半段:理解之后,能规划步骤、调用工具、把结果做出来。官方列举的典型工作流包括视频剪辑、音乐视频创作、影视制作与解说、音视频到图文摘要、音视频实时对话。这些场景的共同点是:输入是音视频,输出是要能直接用的成片或文案,中间不需要人再手工转换格式。
1M 上下文 + 四种模态,直接输入
规格层面,这次的关键数字有两个:一是支持 1M 长序列,二是文本、图像、音频、视频四种模态可以原生直接输入。
1M 上下文的意义在于,长视频不用再切成小段分批喂。以前处理一部两小时的电影或一场两小时的会议录音,得先切片、再拼接、还要处理上下文丢失的问题;现在可以整段丢进去,一次完成理解。官方列出的最大输入约 99 万 token、最大输出约 13 万 token,留出的推理空间也比较充裕。
音频部分还支持 2 通道与 4 通道的空间音频解析,这对会议场景尤其重要——能区分「谁在说话」,而不是把所有人混成一团文字。官方强调模型在长音频理解、音视频推理、音视频描述与多说话人识别上都有明显提升。
29 项评测平均提升 25%+,音频超过 Gemini 3.8 Flash
按官方公布的数据,Qwen3.8-Omni-Flash 在累计 29 项评测中,平均得分比上一代 Qwen3.5-Omni-Plus 提升超过 25%。几项关键指标的提升幅度值得单独拎出来看:
- WildClawBench-MM(音视频 Agent):提升 36.5 分;
- AgenticVBench:提升 22.3 分;
- UniClawBench:取得 69.6 分;
- LongAudioSpan(长音频):提升 8.3 分;
- OmniVideoBench(音视频理解):提升 9.6 分。
会议场景的指标变化更夸张:AliMeeting 数据集上,说话人日志错误率(DER)从 88.11 降到 3.35,连接词错误率(cpWER)从 89.61 降到 17.18。这些数字说明它在「多人、长时段、带口音」的真实会议录音上,可用性比上一代高了一个量级——从「基本没法用」变成了「能用但还要人工核一下」。
横向对比方面,官方给出的口径是:音视频能力接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash。这个说法需要第三方评测进一步验证,但从官方愿意直接点名对标来看,底气是有的。
价格是另一个重点:音视频输入降价 93%
如果说能力提升是意料之中,那价格就是这次真正的杀手锏。
官方数据是:每小时音频输入的 API 价格降幅超过 98%,每小时音视频输入的价格降幅超过 93%。对做音视频类应用的团队来说,这不是小数点后的优化,而是直接决定「这个功能能不能上」的门槛变化。
举个大白话的例子:以前用多模态模型处理一小时的会议录音或素材,成本可能是几块到几十块;价格降九成之后,同样的钱能处理十倍以上的量。很多原本「算下来不划算」的场景,比如自动剪短视频、批量做影视解说、给长视频生成图文摘要,都会变得可行。对内容团队来说,这意味着以前只能对重点素材做的事,现在可以对全量素材做一遍。
配套开源与上手方式
围绕这个模型,千问还开源了两套配套工具:面向长程工作流的 Qwen-MM-Plugins,以及面向实时交互的 Qwen-Live Harness。前者解决的是 Agent 框架如何原生接入多模态能力,后者针对实时对话场景。
接入方式上,模型兼容 DashScope 与 OpenAI 协议,已经上线千问 AI 平台,存量代码的迁移成本不高。官方还给了一个挺有意思的案例:在「用模型优化模型」的实验中,Qwen3.8-Omni-Flash 在 12 小时内把另一个小模型(Qwen2.5-Omni-3B)的四川话识别字符错误率从 25.79% 降到了 15.30%——等于让一个新模型去给老模型做专项补课。
放在整个 9 月的大模型节奏里看,这一波动作相当密集:9 月 13 日 DeepSeek 放出 V4.1-Flash,9 月 17 日千问上线实时同传模型,9 月 18 日 Omni-Flash 跟上,谷歌据说也在测试 Gemini 4 Pro。对开发者来说,选择变多是好事,但也意味着要花更多时间做选型和成本核算。至少在多模态这条线上,国产模型的性价比优势,这个月又被拉大了一截。


