什么是音频生成
音频生成将角色配音、情绪演绎、背景音乐与环境音效整合到一条创作链路中。你无需分别完成配音、音效制作和混音,只需描述期望的声音内容与效果,即可生成完整音频。核心能力
- 描述即创作:通过自然语言描述角色、台词、情绪、声音风格、节奏和场景,直接生成对应音频。
- 多角色多音轨一体生成:支持在一次任务中生成多角色对白、背景音乐与环境音效,并完成整体声音编排。
- 灵活的参考音色:可从音色广场选择平台音色、使用个人音色或上传本地参考音频,最多添加 3 个参考音色。
- 完整创作链路:支持灵感模板、生成试听、音频下载与历史作品回听,覆盖从创意到成品的完整流程。
主要特性
- 自然语言控制声音表现:可直接描述角色年龄、声线、语气、情绪、说话方式和节奏,也可描述笑声、叹气、停顿等副语言表现。
- 多角色连续演绎:可在同一段音频中定义多个角色及对应台词,并分别设置角色声音与情绪。
- 人声、音乐与音效统一生成:背景音乐、环境声、动作音效和角色台词可在同一提示词中描述,无需分别生成后再进行混音。
- 参考音色与文字描述结合:有明确声音需求时可添加参考音色;没有合适音色时,也可以直接通过文字描述创建角色声音。
当前主要面向中文音频创作,暂不支持参考图片、多语种创作和时间戳级精确控制。
提示词写法建议
推荐按照 角色列表 → 场景 → 音频内容 的结构描述。先明确有哪些角色及其声音特征,再描述整体场景,最后按照实际发生顺序编排台词、背景音乐、环境音和具体音效,可以获得更加稳定、完整的生成效果。- 角色列表:写明角色名称,并补充年龄、性别、声音质感、情绪基调或角色类型。如已选择音色广场或个人克隆音色,可直接作为该角色的参考声音。
- 场景:描述时间、地点、人物状态和整体氛围,帮助模型建立完整的声音环境。
- 角色台词:使用
{speaker:角色名}标记说话人,并在台词前用括号补充语气、情绪、音量、语速或动作状态。 - 声音元素:使用
[背景音乐]、[背景音效]、[音效]等标签描述不同类型的声音,并按照希望出现的先后顺序编排。
参数选择建议
计费说明
请参考 计费规则。典型应用场景
播客与有声内容
适用于播客、有声书、广播剧和故事类内容。你可以通过多角色声音与连续对白快速生成完整音频,提升长内容的生产效率。广告与品牌营销
适用于广告口播、品牌短片、宣传视频和信息流素材。你可以快速尝试不同角色、语气、情绪和声音方案,缩短从创意到成品的制作周期。短视频与剧情内容创作
适用于剧情短视频、知识视频、AI 漫剧和解说内容。你可以一次生成多角色对白、情绪表达、背景音乐与环境音效,减少配音、找音效和后期混音的制作成本。开始使用
1
描述创作内容
输入期望生成的角色、台词、情绪、背景音乐和环境音效,也可以从灵感模板开始创作。
2
添加参考音色
如有明确的角色声音需求,可从音色广场、个人音色中选择声音,或上传本地参考音频。最多支持添加 3 个参考音色。
3
生成并试听
提交生成任务,完成后试听生成结果。
4
下载或再次创作
下载满意的音频结果,或调整提示词和参考音色重新生成。历史作品可随时回听。