Meta 首个实时音频感知模型来了:20 多人同时说话也能…

AI广播站4小时前更新 小悠
7 0 0

Meta 推出 Muse Voice Transcribe,这是其首个实时音频感知模型。开发者可通过 Meta Model API 调用该能力,定价为每1000分钟音频3美元(约合20.2元人民币),相当于每小时0.18美元。

该模型在同一流程中整合了流式自动语音识别、说话人分离与端点检测。所谓“流式”,就是边说边转写,模型不必等整段音频说完才出结果,而是一小段一小段持续输出文字,延迟更低,适合实时听写、会议记录、通话字幕等场景。用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。

Muse Voice Transcribe 可在包含20余名说话者的录音中分离不同发言者,还能识别说话是否结束,从而自动确定一段输入的边界。在语言支持上,模型训练覆盖70余种语言,其中25种在发布时完成验证;支持长度超过1小时的音频,也支持句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置,提升特定语言、术语或场景下的识别效果。

为了兼顾实时响应和识别准确度,Meta 引入了名为“自适应延迟”(adaptive delay)的动态决策机制。系统不会对所有词语采用固定的速度与准确度取舍,而是针对每个词判断需要额外接收多少音频后再输出识别结果:对于较容易识别的语音,系统会更快提交转写结果;而对于发音不清、术语较多或语境复杂的词语,则调用更多前后文音频信息来提升准确度。

Meta 方面表示,截至2026年9月1日,Muse Voice Transcribe 位列 Artificial Analysis 流式语音转文本排行榜第1名。

知名AI企业Runway发布界面世界模型Solaris,实现软件与网页无需预写代码即可实时逐帧渲染图形交互界面,打破传统界面依赖固定框架的模式。该系统或将弥合“知晓事物”的AI助手与界面生成之间的割裂,推动交互式数字体验迈向实时生成新阶段。

浙江消防披露:57岁湖南籍男子杨师傅在宁波登山,登顶后改走陌生路线,盲信AI推荐的下山路径,结果越走越偏、体力耗尽,报警后才脱险。杨师傅平日体能较好仍被困,事后AI回复令人哭笑不得。消防提醒野外登山勿轻信AI,应选成熟路线确保安全。

港股震荡背景下,AI独角兽实现资本与技术共振:视频生成模型落地、商业化超预期,股价自8月31日累涨超20%。主因MiniMax多模态技术实质突破及商业化变现指数级增长,8月31日其H3Max768P/480P版本接入开放平台。

8月31日,中科院大连化物所联合科大讯飞、阿里云等发布我国化工行业首个大模型迭代版——智能化工大模型3.0 Pro。该版本实现从专业知识问答向化工任务智能执行系统的跨越,成为技术底座级创新成果,推动化工智能化转型。

9月1日开学季,阿里通义千问APP升级学习功能:新增同步教材单元作文辅导、初中语文数学教材精讲,拍题讲解扩展至高中大学数理化,全部免费。作文辅导不直接给范文,而是连续提问引导学生梳理素材与结构,如“我的心爱之物”逐步挖掘细节,完成审题构思。

Meta 首个实时音频感知模型来了:20 多人同时说话也能…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...