英伟达首款开源全双工语音模型VoiceChat 11B正式…

AI广播站1小时前更新 小悠
3 0 0

在实时人工智能语音交互赛道上,硬件与技术巨头英伟达(NVIDIA)迎来全新突破。公司近日正式推出了旗下首款开源端到端全双工语音对话模型NemotronLabs VoiceChat11B,标志着其在语音生成与理解的底层架构上迈出了重要一步。

与以往需要串联语音识别(ASR)、大语言模型(LLM)以及语音合成(TTS)的传统分步架构不同,该模型通过一个统一的网络直接完成流式语音理解与生成。这一技术路径不仅彻底消除了多模型编排带来的繁琐交接,还大幅压缩了响应延迟。实测数据显示,其平滑轮换延迟低至448毫秒,且具备边听边说的全双工交互能力。当用户在中途插话时,智能体能够迅速让出话语权,展现出极高的流畅度。

英伟达首款开源全双工语音模型VoiceChat 11B正式发布

值得一提的是,作为首个在对话持续进行时支持工具调用的开源全双工模型,VoiceChat11B 创新性地引入了独立的输出通道与预置的“保持”话术机制。在处理复杂的外部 API 请求时,系统可以通过侧通道自动触发操作员定义的过渡台词,有效避免了等待期间可能出现的长时间静默,让语音智能体的工程化落地变得更加顺畅。

不过,从实际部署角度来看,该模型目前仍处于试点阶段。由于其需要单张至少配备80GB 显存的高性能 GPU 才能高效运行,且官方将其标注为“仅限研究用途”,目前尚未提供成熟的托管 API。业内人士指出,尽管在长上下文及多轮对话的极端场景下仍存在一些局限性,但其开放的权重与容器设计,依然为联络中心、汽车座舱、零售点餐以及智能无障碍辅助等领域的开发者提供了全新的探索方向。

英伟达牵头的开放安全人工智能联盟成立仅一周成员已超120家,其SAFE工作组启动AI安全事件处理提案征集,由Linux基金会管理。联盟在黑帽大会完善方案,聚焦保密报告、通知机制与无责复盘,推动AI安全行业共享。

据《华尔街日报》报道,英伟达已对前OpenAI首席科学家兼联合创始人伊尔亚·苏茨克维的保密实验室SSI完成实质性投资,金额未公开。核心以大量旗舰GPU换取算力提升一个数量级,此前该实验室主要依赖谷歌TPU。这标志着英伟达罕见直接押注前沿AI安全研究。

英伟达将向伊尔亚·苏茨克维创立的安全超级智能实验室SSI投资50亿美元,双方达成长期合作,强化AI算力与模型研发。这是英伟达首次在深入了解其进展后投资,财务细节未公布。SSI未来将大规模采用英伟达算力。消息于周一公布。

硅谷AI开源路线辩论白热化。OpenAI与Anthropic以国家安全为由游说推动限制中国开源模型,而黄仁勋、纳德拉、马斯克、扎克伯格、皮查伊等公开支持开源,阵营交锋。核心争议是中国开源AI快速崛起,智谱、月之暗面等近期发布新模型,挑战美国领先地位。

英伟达正与OpenAI洽谈大单,拟提供约2500亿美元融资担保,支持其承租软银旗下能源子公司在俄亥俄州开发的10吉瓦数据中心。计入芯片后,项目总投资或突破5000亿美元,成为全球最大数据中心。

英伟达首款开源全双工语音模型VoiceChat 11B正式…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...