阿里发布语音识别新模型,医疗词汇"听中率&quo…

AI广播站12小时前更新 小悠
8 0 0

阿里巴巴正式发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,核心目标很直接——让 AI 精准听懂专业词汇。模型在上下文一致性、行业词识别和热词定制化三个维度做了系统性优化,同时具备语音润色能力,可直接输出结构化文本。

研究团队持续从医疗、IT 编程、股票、社会名人等领域挖掘专业词汇,建成了覆盖多行业的高质量词库。在最新行业词汇内部评测中,新模型对各行业专业词的"听中率"均有明显提升,其中医疗场景更是突破了 95.36%。

阿里发布语音识别新模型,医疗词汇"听中率"破 95%,曾拿全球最低错字率

Qwen-Audio-ASR-Flash 系列已在会议纪要整理、实时字幕、教育录播、智能客服等场景中得到验证,此前曾在 AI 评测平台 Artificial Analysis 上以 1.7% 的错字率拿下全球第一。这意味着在真实的办公和教育环境中,AI 语音转文字的准确度已经摸到了可用性的天花板。

目前该模型已通过阿里云百炼平台开放调用,提供三个版本:实时语音识别最长 5 分钟的 Flash 版、离线文件转写的 Filetrans 版,以及实时语音识别 Streaming 版。当 AI 不仅"能听",还能听懂你行业里那些拗口的专业术语,语音交互的最后一公里,或许就快跑通了。

7月31日,阿里通义千问发布语音识别大模型,主打长音频不丢词、行业词不用教。其升级点:长音频上下文记忆,确保会议转写一致;内置医疗、IT等行业词库,专业词召回率分别为95.36%和91.87%,无需人工配置。已在阿里云百炼平台开放调用。

阿里通义实验室发布Fun-ASR1.5语音识别大模型,通过统一架构实现通用性与精准度的平衡。该模型支持全球30种主流语言,并深度适配汉语七大方言及20多种地方口音,在多语言、多方言及复杂语境下表现突出。

钉钉与通义实验室语音团队联合推出新一代语音识别大模型Fun-ASR,为企业用户提供更强大、灵活的语音转写能力。该模型高效处理复杂语音信号,精准识别行业术语,提升专业领域准确性,并支持多语言和口音识别,拓展应用场景。

特斯拉中国7月31日推送2026.14.13版本更新,覆盖Model 3/Y/S/X等车型。核心升级是接入豆包大模型,实现更精准的实时信息查询与自然流畅的语音对话,显著提升车内智能交互体验。

LG AI研究院7月31日在Hugging Face发布K-EXAONE 2.0模型,为韩国主权AI项目第二代。采用混合注意力MoE架构,总参数7500亿、激活参数370亿,规模是初代3倍以上,系韩国最大AI基础模型。模型以Apache 2.0完全开源,在韩国AI发展史中颇为罕见。

阿里发布语音识别新模型,医疗词汇"听中率&quo…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...