字节跳动发布Seed Audio 1.0:音频生成从“会说…

近日,字节跳动正式推出音频创作模型Seed Audio1.0,标志着AI音频生成技术从单一语音合成阶段,迈入完整声音场景创作的崭新阶段。该模型目前已上线火山方舟体验中心,向创作者开放测试。

长期以来,影视级音频内容生产依赖多模型分别生成人声、音效与环境声,再通过人工繁琐拼接与混音,流程冗长且难以保证整体叙事一致性。Seed Audio1.0的核心突破在于,它并非简单拼接素材,而是在统一框架下联合建模多种音频要素,端到端生成可服务于叙事的“完整声音作品”。

字节跳动发布Seed Audio 1.0:音频生成从“会说”迈向“会创作”

据官方介绍,Seed Audio1.0具备三大核心能力。首先是精准的时空编排,支持以100毫秒的精度按时间线控制对白、音效的入场时机,完美适配视频配音与广告制作。其次是稳定的音色演绎,支持零样本生成与长音频延展,在保持角色音色一致性的同时,能自然呈现愤怒、喜悦等不同情绪,甚至允许同一音色演绎多个角色。第三是地道的多语种支持,覆盖包括中文、英语、日语在内的20余种语言,确保声音在不同语种下都能符合本土的表达节奏与重音习惯。

评测数据显示,该模型在九大类常见创作场景中的音频可用率已超过90%,多语言生成的自然度MOS评分普遍达到4分以上(优秀水平)。

从“会说”到“会创作”,Seed Audio1.0的发布降低了高质量音频内容的制作门槛。未来,团队计划进一步融合视频参考等多模态输入,并探索可控翻译技术,持续优化长音频与分轨生成能力,助力创作者将脑海中的声音构想高效转化为可听见的作品。

https://seed.bytedance.com/seedaudio1_0

火山方舟体验中心 – 登录 – 选择语音模型 – 语音合成 – Doubao-音频生成-1.0

字节跳动视频生成模型Seedance2.5将于7月16日全量开放API,正式商用,降低高品质视频生成门槛。此前6月23日发布,预告7月初终落地。旗下即梦预热,将推会员折扣。

字节跳动发布多模态AI模型Seedream5.0Pro,推动图像创作从生成迈向设计。该模型在图文匹配、结构合理性、文字渲染和画面质感上显著提升,并重点突破复杂信息可视化能力,能精准解析意图,将数据、概念和密集文字转化为专业视觉呈现。

字节跳动AI硬件团队Ocean核心成员、豆包手机硬件产品负责人林夕近期离职,成为公司2024年启动AI手机项目以来首位核心硬件负责人出走,引发外界对项目前景的猜测。内部消息人士否认“豆包手机项目彻底消失”传闻,称项目并未关停,而是转入新调整阶段。

字节跳动旗下AI助手豆包正灰度测试社交功能,已打通飞书账号体系。内测新增独立“对话”页面,支持添加豆包好友或飞书好友;收到好友申请时AI会自动发送打招呼消息,已添加的人类好友对话列表中将显示“人类”标识。

火山引擎在2026原动力大会上发布豆包视频生成模型Seedance 2.5,实现跨越式升级。新模型支持单段原生30秒视频直出,可同时导入最多50个全模态素材,生成可控性大幅提升。目前全球企业内测,预计7月初正式上线。

字节跳动发布Seed Audio 1.0:音频生成从“会说…

关注 “悠AI” 更多干货技巧行业动态

© 版权声明

相关文章

没有相关内容!

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...