7月31日,阿里通义千问正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,主打"长音频不丢词、行业词不用教",已在阿里云百炼平台开放调用。
一是长音频上下文记忆,转写时可参考前文语义,几小时会议中的人名、技术概念全程保持一致,告别跨片段"断片";

二是内置多行业词库,医疗场景专业词召回率达95.36%,IT编程达91.87%,无需人工配置即可精准识别冷门术语;
三是分级热词定制,企业专属词汇即时生效,多数场景召回率突破99%,不因热词增多而误触发;四是集成语音润色,一步完成去口头禅、清理重复、处理自我纠正和语义重组,输出可读性接近"ASR+大模型润色"两步方案;
五是一套模型覆盖30余种语言,七语种平均语义错误率17.09%,优于Azure、Gemini等同业模型,适配跨国会议和出海客服场景。
同步推出的Qwen-Audio-3.0-ASR-Streaming面向实时场景,理论出字延迟300毫秒,中文工业场景错字率7.80%,英文11.52%,领跑行业。该系列此前已在Artificial Analysis评测中以1.7%错字率拿下全球第一,广泛应用于会议纪要、实时字幕、教育录播、智能客服等领域。
阿里发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,专注精准识别专业词汇。模型优化上下文一致性、行业词与热词定制,支持语音润色并直接输出结构化文本。团队构建了覆盖医疗、IT、股票等领域的多行业高质量词库,评测显示行业词识别效果显著提升。
阿里通义实验室发布Fun-ASR1.5语音识别大模型,通过统一架构实现通用性与精准度的平衡。该模型支持全球30种主流语言,并深度适配汉语七大方言及20多种地方口音,在多语言、多方言及复杂语境下表现突出。
钉钉与通义实验室语音团队联合推出新一代语音识别大模型Fun-ASR,为企业用户提供更强大、灵活的语音转写能力。该模型高效处理复杂语音信号,精准识别行业术语,提升专业领域准确性,并支持多语言和口音识别,拓展应用场景。
国产大模型全球下载量破100亿次,万亿级开源模型频出,人工智能产业链整体突破。国家发改委表示,上半年我国AI自主创新加速,深度求索、月之暗面等发布万亿参数开源大模型,下一步将统筹高质量发展与高水平安全。
科技圈迎来效率革命,字节跳动旗下Seed团队发布Seedance2.5音视频联合生成模型,主打一镜成片。单次生成时长从15秒延至30秒,并支持多轮无缝延长,让复杂情节更连贯。模型深度优化材质、光影与肤质,有效消除塑料感,实现逼真实拍质感,赋能多个产业场景。

关注 “悠AI” 更多干货技巧行业动态