支持耳语与情绪控制!Fish Audio 周年重磅发布 S…

AI广播站15小时前更新 小悠
4 0 0

在成立周年之际,Fish Audio 正式推出其迄今最强大的生产级语音大模型 S2.1Pro。与针对脚本旁白的传统文本转语音(TTS)系统不同,该模型专为实时对话语音场景打造,目前已通过 Fish Audio API 上线,同时提供满足开发与测试需求的合理限额免费版本。

在技术性能方面,S2.1Pro 实现了约90毫秒的首帧音频播放延迟,可无缝支持自然顺畅的对话轮替;模型覆盖83种语言并采用统一的语音识别架构。在语音控制灵活性上,模型突破了预设情绪菜单的限制,允许直接在文本中嵌入自由格式的括号标签,精准实现耳语、紧张笑声等行内细粒度指令。

支持耳语与情绪控制!Fish Audio 周年重磅发布 S2.1Pro 实时对话语音模型

此外,S2.1Pro 原生支持多说话人对话生成,且仅需10至30秒的短参考样本即可完成高质量语音克隆,在无需额外微调的前提下精准复刻目标语调与说话风格。

S2.1Pro 的推出标志着语音 AI 正在从传统的脚本式合成向极低延迟、高拟真度交互的实时对话模式加速演进,为全球化智能语音交互落地提供了更低门槛与高可用度的算力基础设施。

特斯拉在华完成车机语音大模型服务备案,将接入生成式AI,提升语音交互智能化水平,符合监管要求,为车主带来更自然的座舱体验。

复旦大学MOSS团队发布MOSS-Speech,首次实现端到端语音对话,模型已在Hugging Face上线并开源。采用“层拆分”架构,冻结原文本模型,新增语音理解、语义对齐和声码器层,可一次性完成语音问答、情绪模仿和笑声生成,无需传统三段式流程。评测显示,在ZeroSpeech2025任务中词错率降至4.1%,情感识别准确率达91.2%。

Fish Audio发布升级版S1语音克隆模型,在情感表现力和拟真度上实现突破。该模型能生成富有情绪、节奏和语气变化的真人级声音,仅需10秒语音样本即可克隆人声,完整保留原声的口音、语调、节奏及说话习惯,效果逼真。

9月19日,小米公司宣布开源其首个原生端到端语音大模型 Xiaomi-MiMo-Audio,这一创新成果标志着语音技术领域的一次重大突破。五年前,GPT-3的出现开启了语言通用人工智能(AGI)的新纪元,但语音领域一直受限于对大规模标注数据的依赖,难以实现类似的语言模型的少样本泛化能力。如今,小米推出的 Xiaomi-MiMo-Audio 模型基于创新的预训练架构和上亿小时的训练数据,首次在语音领域实现了基于 In-Context Learning(ICL)的少样本泛化,并在预训练过程中观察到了明显的“涌现”行为。

Xiaomi-MiMo-Audio 模型在多个标准评测基准中表现出色,其性能不仅超越了同参数量的开源模型,还在音频理解基准 MMAU 的标准测试集上超过了 Google 的闭源语音模型 Gemini-2.5-Flash,并在音频复杂推理基准 Big Bench Audio S2T 任务中超越

阶跃星辰发布开源语音大模型Step-Audio2mini,在国际基准测试中获SOTA成绩。该模型统一音频推理与生成,在语音理解、跨语言翻译和情感解析等场景表现优异,具备强大的多模态音频能力。

支持耳语与情绪控制!Fish Audio 周年重磅发布 S…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...