近日,阿里通义千问团队正式发布新一代实时语音合成模型Qwen-Audio-3.0-TTS,推动语音合成从“能说话”迈向“会表达”。其Plus版本已在全球权威榜单Artificial Analysis的Speech Arena中斩获全球第一,综合表现超越Gemini3.1TTS、ElevenLabs v3等主流模型。
本次发布包含双版本:Flash版主打实时交互,首包延迟约300ms,适配智能助手等低延时场景;Plus版聚焦高质量生成,自然度与音色还原度更优。

一是多语种与方言覆盖升级,支持16种语言,Plus版在全部16种语言上的平均说话人相似度达82.75,位列行业第一;同时支持20种中文方言,避免“方言特色弱化”问题,更贴近母语者表达。
二是支持Free-style自然语言指令,无需专业标注,用“温柔客服语气”“带货主播风格”等自然语言即可精准生成对应语音。
三是细粒度标签控制,支持[gasp]、[angry]等结构化标签,可精确调控呼吸、笑声等非语言细节,适配游戏、有声书等场景。
四是复杂声学鲁棒性强,即便参考音频存在高噪声、高混响,也能自动过滤杂音、保留音色,合成质量稳定。
配套精品音色库覆盖指令、方言、小语种等多类音色,支持48K高清音频输出(预计7月24日开放),单次合成最长支持3分钟长文本。目前模型已在阿里云百炼平台全面开放,开发者可接入体验,共同探索语音交互新可能。
阿里通义千问Qwen3.7系列两款预览模型悄然上线,定位明确:Max-Preview为旗舰级“大脑”,主打综合性能天花板,目前仅开放思考模式;Plus-Preview为均衡型选择。两款模型将在5月20日阿里云峰会正式官宣。
小米发布MiMo-V2.5全链路语音模型系列,包括三款TTS模型和一款开源ASR模型,覆盖语音输入与输出。TTS模型能精准调度情绪、语气和角色身份,让声音可编程、可创作、可复刻,提升人机交互自然度,开启语音智能新纪元。
肯德基推出AI点餐助手“小K”,基于阿里通义千问大模型,结合RAG技术,实现自然语言理解和多轮对话。用户可直接输入需求,如“10人开会、预算350元”,系统将智能推荐套餐,简化点餐流程,提升体验。
微信拦截腾讯元宝红包链接,用户需复制网址到浏览器打开,影响便捷性。正值春节红包大战关键期,此举引发关注。
微盟推出“AI试衣”解决方案,通过自研模型和行业知识库,实现高度还原的虚拟试穿,旨在解决服饰电商消费者决策难、退换货率高的痛点,以技术重塑零售体验。

关注 “悠AI” 更多干货技巧行业动态