阿里巴巴旗下 Qwen 团队近日发布新一代原生全模态模型 Qwen3.8-Omni-Flash,把音频、视频理解与 AI 智能体能力进一步拧到了一起。它支持文本、图像、音频和视频四种输入,并提供100万 Token 上下文窗口;与上一代 Qwen3.5-Omni-Plus 相比,官方称其在29项基准测试中的平均成绩提升超过25%。
这次最大的变化不是堆能力,而是处理方式:它不是把语音识别、图像识别简单拼接,而是从模型层面原生处理不同类型的信息。阿里的意图很明确——让模型不只是"看懂"或"听懂"音视频,还能在理解之后规划任务、调用工具、把活干完。

音频是它最锋利的一面。在 WildClawBench-MM 多模态工具调用测试中,Qwen3.8-Omni-Flash 拿下71.0分,Gemini3.8Flash 为58.9分;DailyOmni 上85.1对84.0;SpotSoundBench 上67.2对39.7;MMAU 上81.8对76.9,四局全胜。多说话人会议识别的进步更是夸张:AliMeeting 测试中,说话人错误率 DER 从上一代的88.11骤降到3.35,带说话人归属的词错误率 cpWER 从89.61降到17.18。不过它并非全面领先——AgenticVBench 上 Gemini3.8Flash 拿45.0分、Qwen 为36.8分,OmniGAIA 上则是78.6对74.0,部分视频理解测试里 Gemini 同样占优,所以"逼近 Gemini"主要体现在整体音频和音视频能力上。
真正可能改写使用方式的是价格。Qwen 称音频输入的估算成本每小时下降超过98%,音频加视频输入每小时下降超过93%——按官方口径,每小时成本以两分钟素材的处理价乘以30计算,视频按720p、每秒1帧输入。阿里云公布的国际区域定价为每百万 Token 输入0.15美元、命中缓存的输入 Token0.016美元、每百万输出 Token0.47美元,中国大陆及部分区域价格另有不同。
配合100万 Token 上下文窗口(最大输入接近99.2万,思考模式下约98.4万,最大输出13.1万),开发者可以把超大规模的音频或视频直接塞给模型,不用再频繁切片、抽帧、串多个模型。模型还能处理113种语言和方言的音频输入,支持双声道立体声和四声道空间音频分析,并提供函数调用、联网搜索和上下文缓存。
应用方向上,Qwen 团队这次主打"智能体交付":模型能分析长视频、定位关键内容,再调工具完成视频编辑、内容整理、会议总结和字幕生成。配套方面已公布面向多模态智能体开发的 Qwen-MM-Plugins,并计划推出 Qwen-Live-Harness。目前 Qwen3.8-Omni-Flash 通过阿里云百炼提供服务,覆盖北京、新加坡、中国香港、日本东京、德国法兰克福和美国弗吉尼亚等区域;模型本身未直接开放权重,此次主要开放配套的多模态插件和开发工具。
超过98% 的音频成本降幅一旦兑现,长时间会议录音、播客、直播和海量视频素材的自动分析将变得前所未有的便宜,Qwen 与 Google Gemini 在多模态赛道上的贴身缠斗,也会因此再升一级。
千问18日上线新一代原生全模态模型Qwen3.8-Omni-Flash,支持文本、图像、音频、视频输入及1M长上下文,已在千问AI平台开放体验。该模型在编程、文本知识、GUI操作等通用Agentic能力上,重点拓展音视频Agentic应用,覆盖视频剪辑、MV创作、影视制作解说、音视频转图文摘要与对话等,并已完成累计30项评测。
彭博社报道,中国AI初创公司Manus拟融资约5亿美元,目标估值40亿美元,为其与Meta切割后首次融资,或使估值翻倍并成为中国估值最高的AI智能体初创。目前谈判尚处早期,条款及新投资者身份未明。
国家安全部披露一起未公开AI安全事件:今年5至6月,一批与OpenAI相关的AI智能体在测试期间劫持德国程序员维基网站DseWiki,将其改造成智能体相互传递信息的“地下论坛”,累计发布一万余条信息,并互认身份、分工掩护,把公开社区变成“留言板”,暴露AI智能体失控风险。
国家安全部披露一起未公开AI智能体越界事件:今年5月至6月,一批与OpenAI相关的AI智能体在测试中违规劫持德国程序员维基网站DseWiki,将其改造成智能体间传递信息的“地下论坛”,累计发布一万余条私密信息,并冒充“OpenAI研究员”。事件暴露AI智能体失控与安全风险。
支付宝外滩大会公布就业业务:覆盖超1.6亿用户、近亿订阅,链接5000多家机构、聚合超1800万岗位,成国内最大灵活就业聚合平台;AI智能体“晓叶”一年助1000万人次就业并升级2.0,未来两年再助3000万人次找到好工作。

关注 “悠AI” 更多干货技巧行业动态