在嘈杂的人群中精准锁定并听清某个人的声音,人类的听觉系统能够轻而易举地做到这一点,但对于传统的自动语音识别(ASR)模型来说,多人同时讲话的“鸡尾酒会难题”却长期是一个未被彻底攻克的行业痛点。为了解决这一长期困扰业界的难题,小米近日正式开源了工业级目标说话人语音识别大模型 CocktailASR-1。
该模型彻底改变了传统语音识别的任务输入方式,采用基于参考声纹的目标说话人识别机制。用户只需提供一段参考音频,模型便会利用声纹嵌入精准定位目标说话人,在多人混合音频中只转录该特定人物的语音,而其他人说话的内容、混响以及背景噪声均会被自动过滤,从而将复杂的混合音频任务转化为高效的目标说话人识别。

在底层架构设计上,CocktailASR-1采用了一个端到端的大语言模型架构,具体由 D2V2音频编码器、Adapter 以及大模型解码器串联组成,且所有权重均整合在同一个检查点中。在实际使用时,输入格式为将参考音频与目标单声道音频进行拼接,中间插入一秒静音作为分隔。这种设计让模型具备极高的通用性,无论是单人还是复杂的多元场景,无需切换模型即可一气呵成。
多项基准测试数据验证了该模型的强悍实力。在模拟多说话人测试中,其在 LibriMix2mix 和 LibriSpeechMix2mix 数据集上的字错率(WER)分别压低至4.11% 和2.90%。相比之下,同赛道的多款知名模型在混合场景下表现全军覆没,例如在 LibriMix3mix 测试中,部分竞品的字错率高达76% 到121% 不等,而 CocktailASR-1的字错率仅为12.29%,展现出了颠覆性的降维打击优势。即便是面对更具挑战的真实会议录制场景,如 AMI SDM 和 AliMeeting Far,该模型也大幅领先现有的各类解决方案。而在单人场景下,其在 LibriSpeech、WenetSpeech 以及 CommonVoice-zh 等数据集上也实现了全面超越。
除了突破性的识别精度外,该模型在工程落地和实用性方面还具备两大亮点功能。首先是强大的负样本拒识能力。当参考音频对应的人并不参与当前对话时,模型能够直接输出空文本,从而有效防止智能音箱、车载语音助手等智能设备被旁人的声音误触发。测试显示其在多个数据集上的负样本拒识率表现优异。其次,模型支持思维链推理功能,能够在输出最终答案前通过特定的标签展示其判断说话人的推理过程,虽然该功能对精度影响极小,但极大提升了系统的可解释性与调试便利性。
目前,CocktailASR-1的相关代码已在 GitHub 按照 Apache2.0协议正式开源,且具备极简的依赖环境,仅需 torch、torchaudio、transformers 和 soundfile 等基础库即可轻松从 HuggingFace 加载并部署使用。小米此次在语音技术底层逻辑上的全新转向,标志着语音识别正从传统的“捕获所有声音”正式迈向聚焦于“锁定一个声音”的全新发展阶段。
9月11日外滩大会上,具身智能业界与投资人围绕行业泡沫等话题讨论。嘉宾认为“泡沫感”源于产业阶段、估值与商业价值错配,行业仍处“黎明前期”;关键能力初现,但距规模化生产力仍有距离,需突破系统工程、算力和数据等瓶颈。
支付宝“碰一下”发布面向品牌商的无界经营智能体“图图”,依托百万级商家设备网络,连接4亿消费者与百万门店,助力品牌线下增长。继线下触点AI升级及门店智能体“晓雨”后,支付宝再次以AI重构线下经营,实现全球首个大规模线下人、货、场AI全面升级。
《金融时报》报道,Anthropic称今年已阻止多起科学家利用其AI开展可能助研生物武器的研究,列举五起案例,涉事者绕过管控、混淆目的以规避安全防护。事件凸显AI对公共安全的潜在威胁。
OpenAI推出全双工语音模型GPT-Live-1,采用单一模型架构取代传统“语音转文字—推理—文字转语音”级联流程,显著降低延迟,实现类人流畅交互。该模型已上线API,面向开发者,能更稳健应对停顿、打断和话题转换等复杂对话场景。
AI服务平台WorkBuddy宣布全面上线DeepSeek最新V4.1-Flash模型,并开启两周免费试用,降低开发者与用户体验门槛。该模型已登陆DeepSeek API,具备原生多模态支持能力,用户调用时只需将模型设置项调整为对应标识即可。此举体现大模型领域迭代持续加快。

关注 “悠AI” 更多干货技巧行业动态