音频大模型记不住谁在说话?墨大新基准VoxMem揭穿:32…

AI广播站21小时前更新 小悠
11 0 0

当语音AI被拉进一场长达数小时、横跨几十轮的真实对话,它到底能不能记住"这句话是谁说的、用什么样的语气、背景里有什么声音"?墨尔本大学与新南威尔士大学的联合团队觉得,现有的评测根本答不了这个问题,于是端出了专门戳这块软肋的基准VoxMem。

他们先点破了旧评测的两道硬伤:一是只盯着转写出来的文字内容,把声音里藏着的身份信息、情绪线索、环境声一股脑丢掉;二是没法把"历史有多长"这个变量单独剥离出来看,于是模型表现差,到底是记性差还是被长度拖垮的,谁也说不清。VoxMem的打法是建一套"声学证据 × 记忆操作"的二维分类法,把考察维度正交拆开,覆盖15种组合,而且所有题目在8K到64K的不同历史长度下保持原样不动——等于只拧"对话长度"这一颗旋钮,其余全锁死,让记忆效果的变化能干净地归因到长度上。

音频大模型记不住谁在说话?墨大新基准VoxMem揭穿:32K上下文下全员不及格

这套基准的体量不轻:共3196个评测实例、34743个语音会话,合计约177小时音频,足以模拟一场漫长的多轮交谈。而对15个主流音频大模型的实测结果,相当打脸。在32K上下文长度下,所有模型的整体准确率都没能越过40%这条线。更值得玩味的是偏科方向:模型对"说了什么"的语义记忆,明显强过对说话人身份、副语言线索(语气、情绪)和环境声这三类声音原生信息的记忆;尤其追踪语气起伏、背景声变化的准确率极低,基本处于抓瞎状态。而且随着历史长度往上加,各类信息的记忆准确率全在往下掉。

团队据此下了个判断:当前音频大模型的语音记忆瓶颈,主要卡在"识别、定位、把信息关联绑定"这几个环节,而不是推理操作本身——换句话说,模型不是不会想,而是连"谁在什么时候、以什么方式说了什么"这种底层事实都没接稳,上层推理自然无从谈起。VoxMem这套基准,等于给语音AI量体温时换了一支更细的体温计,逼着业界正视一个长期被文字转写掩盖的事实:听得懂词,不等于记得住人、语气和整个世界。

Stability AI 发布新一代音频大模型Stable Audio3,并开源部分权重。该模型基于潜扩散技术,支持高品质立体声输出,生成速度显著提升。提供多种规格版本,满足音乐创作和音效制作等需求,并支持可变长度音频生成。

LPM1.0模型发布,能通过单张参考图实时生成人物说话、聆听及唱歌视频。其核心突破在于多模态处理,可同步整合文本、音频与图像,生成唇形精准同步、表情细腻且情绪过渡自然的动态画面。该模型支持接入ChatGPT等主流语音AI,将传统语音对话升级为具备视觉反馈的实时交互。

Speechify发布原生Windows客户端,从文本转语音工具升级为全栈语音助手。应用集成三类本地AI模型,支持跨应用实时听写与文档转录,对标Superwhisper等竞品。为保障响应速度与隐私,在Copilot+ PC等高性能设备上支持完全本地化运行,用户无需上传音频至云端,即可利用本地NPU或GPU驱动的Whisper模型。

微软开源VibeVoice语音AI模型,支持ASR和TTS,具备长音频处理、多说话人对话生成及实时低延迟特性,已在GitHub获27K星。采用MIT协议,支持本地部署,无需云端费用,旨在推动语音合成领域创新。

班加罗尔语音AI初创公司Arrowhead获300万美元种子轮融资,由Stellaris Venture Partners领投,CRED创始人库纳尔·沙阿等天使投资人跟投。资金将用于优化AI模型、扩充团队,并拓展金融服务市场。

音频大模型记不住谁在说话?墨大新基准VoxMem揭穿:32…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...