阶跃星辰今日正式发布StepAudio3系列模型,包括StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen和StepAudio3Music,五款模型均已上线阶跃星辰开放平台,其中多款模型在Artificial Analysis榜单中位列全球第一。该系列覆盖真人级语音生成、完整音频生成、实时语音交互、复杂语音理解及音乐创作等场景。
其中,StepAudio3Realtime支持原生全双工实时对话,可同时理解语义、语气、情绪、副语言及环境声音,并支持推理与语音生成并行、Tool Call及长任务异步执行。在Artificial Analysis Conversational Dynamics榜单中综合得分98.9%,位列全球第一;语音推理准确率99.7%,同样排名全球第一。

StepAudio3ASR融合语音识别与大模型上下文理解能力,支持中文、英文、方言、中英混说、长音频及医疗、法律、金融等专业场景,WER仅1.7%,并列全球第一。StepAudio3TTS则强化音色、语调、节奏、停顿及笑声、迟疑、结巴等副语言表现,支持流式生成,面向实时语音交互。
此外,StepAudio3Gen可统一生成角色人声、音效、环境音和背景音乐,并支持多角色及声音时序控制;StepAudio3Music支持歌曲创作、清唱配乐、翻唱及基于ABC记谱法的多轮创作,可通过自然语言控制曲风、旋律、节奏、乐器和情绪。整体来看,StepAudio3正将语音模型能力从单一识别或生成拓展至完整音频内容生产与实时智能交互。
多家主要企业客户(英伟达、Palantir、Booz Allen Hamilton等)因担忧专有数据安全,限制在敏感项目中使用Anthropic和OpenAI前沿模型,引发企业AI市场震动。起因是Anthropic今年6月政策允许其Fable模型保留客户数据30天以检测滥用,触发信任危机。
微信AI助手“小微”因隐私质疑上热搜,微信澄清“直接读取聊天记录、偷看隐私”等说法失实。该助手为原生AI,尚在小范围内测,支持文字语音交互,可查天气、快递、外卖,并在朋友圈、公众号、聊天、视频号等场景主动唤起,辅助内容总结。
知情人士透露,Anthropic、OpenAI与谷歌早在Anthropic CEO公开呼吁前,已就联合成立AI行业标准机构展开磋商。自7月起,三家公司CEO层级以下代表组成工作组定期开会。OpenAI CEO奥特曼也在内部表示支持设立AI测试与审计机构。
盖茨基金会未来两年将投入10亿美元推动人工智能发展,让前沿技术惠及最贫困地区。盖茨还就全球大模型格局、算力碳排放及中国人形机器人等话题发表看法,指出按不同衡量方式,中美目前各有四家领先大模型企业。
盖茨基金会宣布未来两年至少投入10亿美元推动AI普惠,并发布《目标守卫者报告》,呼吁抓住窗口期避免AI扩大贫富差距。报告提出实现普惠需解决三大问题,首要是支持所有语言,目前早期大语言模型训练数据九成以上来自英语。

关注 “悠AI” 更多干货技巧行业动态