千问上线 Qwen3.8-Omni-Flash:1M 上下…

AI广播站2天前更新 小悠
14 0 0

千问于18日上线新一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频与视频输入及1M 长上下文,已在千问 AI 平台开放体验。该模型在此前编程、文本知识工作与 GUI 操作等通用 Agentic 能力之上,着重拓展以音视频为核心的 Agentic 应用,覆盖视频剪辑、MV 创作、影视制作与解说、音视频转图文摘要及音视频对话等需综合处理多模态内容的工作流。

在累计30项评测中,其平均得分较上一代 Qwen3.5-Omni-Plus 提升超26%。音视频 Agent、Coding 与长程任务方面,WildClawBench-MM 提升36.5分,AgenticVBench 提升22.3分,UniClawBench 取得69.6分;基础能力上,LongAudioSpan 提升8.3分,OmniVideoBench 提升9.6分,OmniCap-IF 的 CSR/ISR 分别提升8.5/14.1分,AliMeeting 的 DER/cpWER 由88.11/89.61降至3.35/17.18。

千问上线 Qwen3.8-Omni-Flash:1M 上下文,30项评测平均提升超26%

官方称其音视频能力接近 Gemini3.8Flash,音频能力整体超过后者;API 每小时音频输入价格降幅超98%,音视频输入价格降幅超93%。

为支撑长程工作流与实时交互,千问扩展了 Qwen-MM-Plugins 并开源 Qwen-Live Harness。在 Agentic Understanding 模式下,OmniVideoBench 准确率由63.4升至67.8,Token 消耗从145,736降至79,117,降幅约45.7%。

团队还将模型推向研发环节本身:12小时内自主完成评测集选择、数据构建与4轮迭代,累计构建3,413条训练数据,将 Qwen2.5-Omni-3B 的四川话识别字符错误率从25.79% 降至15.30%,相对下降约40.7%。同步推出的 Realtime 版本为首个支持"听声辨位"的全模态大模型。

阿里巴巴Qwen团队发布原生全模态模型Qwen3.8-Omni-Flash,支持文本、图像、音频、视频四类输入,上下文窗口达100万Token,29项基准较上代平均提升超25%。其最大变化在于处理方式:不再简单拼接语音、图像识别,而是从模型层原生融合多模态理解与AI智能体能力。

字节跳动大模型部门Seed完成组织调整:Seed Foundation Model新设四个一级部门,负责人向吴永辉汇报。调整整合预训练数据、强化学习及模型后训练资源,B端与C端产品模型能力分开布局。其中Pretrain Data由李成刚负责,统一整合文本、编程、视觉、语音等预训练数据团队,支撑新Omni模型。

阿里云在2026年5月20日峰会上宣布全面升级至“智能体时代”技术体系,重构芯片、云平台、模型到推理的完整链路,从服务人类转向支撑智能体全天候运行的“AI工厂”。核心底座包括平头哥真武M890芯片及超节点服务器,实现训推一体化,为海量智能体提供高效、持续的计算支持。

小红书开源Relax强化学习训练引擎,专为多模态与智能体场景设计,支持文字、图像、音频、视频统一处理,精准契合AI行业发展趋势。

MiniMax开源其自我迭代模型M2.7,华为昇腾AI同日宣布完成0Day适配,开发者可在昇腾Atlas系列产品上无缝部署。该模型核心突破在于其智能体能力,通过将早期版本引导为研究型Agent,使模型具备自我进化与迭代循环功能。

千问上线 Qwen3.8-Omni-Flash:1M 上下…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...