产品服务

帝恩思产品矩阵

一站式域名管理与DNS优化专家,致力于让您的在线业务更稳定、更快速、更安全,助力您轻松驾驭数字世界,实现无限可能!

查看全部产品 >
在线工具

帝恩思域名检测工具箱

面向站长、运维工程师、企业IT 人员,一站式域名与网站检测工具箱。快速排查异常,辅助 DNS 运维与安全自查。

首页 / 资讯 / AI智讯 / 千问上线Qwen3.8-Omni-Flash,音视频Agent能力大幅升级

千问上线Qwen3.8-Omni-Flash,音视频Agent能力大幅升级

时间:2026-09-21 10:20:22 来源:51DNS.COM
分享:

阿里千问正式发布新一代原生全模态模型Qwen3.8-Omni-Flash,已上线千问AI平台开放调用。模型原生支持文本、图像、音频、视频四类输入,搭载100万token超长上下文窗口。相比上一代Qwen3.5-Omni-Plus,在近30项评测平均得分提升超26%,音视频输入API成本最高降幅98%。配套推出实时版本Qwen3.8-Omni-Flash-Realtime,新增空间音频“听声辨位”能力,同步开源Qwen-MM-Plugins与Qwen-Live工具链,面向会议分析、视频创作、多模态智能体开发场景,为企业多模态应用落地提供低成本高性能方案。

千问

一、模型核心规格:原生全模态,百万长上下文

Qwen3.8-Omni-Flash基于Qwen3.8-Flash-Next新一代架构打造,属于原生一体化全模态模型,并非文本模型外挂视觉/音频模块。输入支持文本、图片、音频、视频,上下文窗口达到1Mtoken,能够一次性处理数小时长视频、海量图文文档、完整代码库,长内容检索与信息留存能力显著增强。

模型同时推出实时分支Qwen3.8-Omni-Flash-Realtime,主打低延迟音视频对话,首创空间音频解析,支持2/4通道音频“听声辨位”,识别声源方位,适合实时会议、远程现场交互场景。API层面兼容DashScope与OpenAI协议,开发者迁移成本低,支持函数调用、联网搜索、结构化输出、思考模式,可快速嵌入业务系统。

本次发布同步开源配套Qwen-MM-Plugins、Qwen-LiveHarness工具链,降低多模态Agent开发门槛,方便开发者搭建端到端音视频自动化工作流。

二、能力亮点:从内容理解升级为多模态智能体交付

本次模型最大变化,是将Omni系列从看懂音视频”升级到**自主规划、调用工具、完成端到端交付的Agent能力。

1、长音视频深度理解:可解析数小时视频,自动定位画面、音频关键片段,完成会议纪要提取、待办与风险梳理,后续自动执行发邮件、检索资料、生成报告等链式任务。

2、音视频创作智能体:支持MV脚本、短剧翻译、长影片解说。可识别歌曲节奏情绪生成带时间戳歌词;短剧场景实现角色识别、口语翻译、配音克隆、成片质检一体化。

3、保留并强化传统强项:延续Qwen系列编程、GUI图形界面操作、长文档推理能力,图文、代码、通用推理评测保持高性能,多模态任务不会挤压文本推理效果。

4、成本大幅下降:音视频输入API单价最高下降98%,大幅降低企业批量处理长视频、音频内容的计费成本,适合大规模内容审核、媒资归档场景。

三、行业落地场景与开发价值

Qwen3.8-Omni-Flash面向企业生产力场景,典型落地场景如下:

1、企业会议:线上会议实时转写、要点提取、风险识别、会后任务自动分发。

2、媒体与短视频:批量媒资解析、视频摘要、字幕生成、影视解说脚本、短剧本地化翻译。

3、智能体开发:多模态Agent,读取截图、录屏、音频、文档,自主操作GUI、调用API完成业务流程。

4、内容安全:长视频、直播回放批量内容审计,识别画面、音频中的违规信息。

5、知识库:百万token长文档+音视频混合知识库,支持跨图文音视频联合检索问答。

对开发者而言,统一全模态模型可以简化架构,无需对接多个独立文、图、音、视频模型,一套API即可处理全部模态输入,降低系统复杂度。

四、企业接入与选型建议

1、场景选型:纯文本、代码任务优先选用Qwen3.8-Flash;音视频、图文混合、多模态Agent场景选择Qwen3.8-Omni-Flash;实时音视频对话选用Realtime实时版本。

2、成本评估:长音频、长视频大批量处理,该模型的降价带来显著成本优势,适合媒资、直播回放、企业会议常态化处理。

3、架构注意:1M上下文虽然强大,但长输入会增加token消耗,建议结合上下文缓存机制,减少重复内容计算,降低延迟与费用。

4、安全管控:企业接入多模态API时,增加输入内容审核,防范用户上传恶意视频、图片、音频,做好内容鉴权与日志留存。

五、总结

千问Qwen3.8-Omni-Flash的发布,标志全模态大模型从“感知理解”走向**任务化智能体交付**。百万上下文、四模态原生输入、音视频API成本大幅下调,叠加实时分支与开源工具链,大幅降低企业搭建音视频智能应用的门槛。

对于媒体、政企、开发者而言,这套模型适合长视频分析、会议智能总结、多模态自动化Agent等业务。在多模态应用落地时,企业需要结合内容安全、token成本、缓存策略做整体架构设计,充分发挥全模态模型的生产力价值。

关键词:

联系我们