2026-06-25 09:14
火山引擎发布豆包音频生成模型1.0:一句话生成影视级音频,角色声音 10 分钟都不"串戏"
文本核心速览
- 一句话生成影视级音频—豆包音频生成模型1.0支持单条Prompt同时生成对白、音效和背景音乐,端到端输出成品,无需传统多轨剪辑与混音,大幅简化制作流程。
- 长音频角色声音一致—通过文生音频与参考音频深度联动,模型在长音频中保持音色高度统一,单次支持2分钟创作,可多次延长,解决角色第1分钟与第10分钟“串戏”难题。
- 音色与风格解耦控制—同一音色可适配不同情绪和语境,支持方言、口音等细节,实现“一声多角”,提升角色配音与创意音频生产的灵活性。
- 产品开放与即将上线—火山方舟已开启API邀测,个人体验中心提供30分钟创作额度;模型即将集成至剪映、即梦、番茄等产品中。
一条Prompt抢了后期剪辑师的工作
昨日,火山引擎把豆包音频生成模型1.0(Doubao-Seed-Audio 1.0)塞进了开发者手里——支持文本或音频任一模态输入,直接端到端输出完整音频作品。
省掉所有后期,敲一段就出成品
群里在传的核心突破:用一条Prompt就能搞定对白、音效、背景音乐的全要素生成,彻底扔掉人工多轨剪辑的老路子。过去一段成片级音频意味着对白、音效、配乐得逐条生成、手动对齐、多轨混音,流程繁琐还吃后期技术。有创作者试了说,现在单条指令里可以同时定义多个角色的台词、语气和情绪节奏,连笑声、叹息、停顿、方言口音都能嵌入,背景音乐和环境音效同步生成,输出即成品——敲一段描述,直接收到能上线的有声剧、播客节目或品牌音频。
长音频不“串戏”,角色声音首尾如一
最让长音频创作者头疼的是前后一致性——第1分钟和第10分钟听起来是不是同一个人。豆包音频生成模型1.0实现了文生音频与参考音频的深度联动,长音频里音色高度统一。测试者反馈,单次支持2分钟音频创作,通过多次延长功能可以在长程生成里保持音色一致,有声书、播客、长剧集都够用。更狠的是,模型支持音色与风格的解耦控制——同一音色可以切换不同情绪和语境,甚至实现“一声多角”,同一个声音在不同角色设定下呈现差异化表达,角色配音和创意音频生产的灵活性明显提升。
现在怎么用、接下来看什么
目前火山方舟已开启API邀测,个人用户在体验中心能领30分钟创作额度。豆包音频生成模型1.0还即将上线剪映、即梦、番茄等产品。接下来盯着看:传统音频后期制作公司和配音演员的饭碗被端走了多少?内容创作者和短视频平台谁先吃红利?
来源: aibase阅读原文