Skip to main content
SenseAudio 音频生成服务面向短视频、播客、有声内容与品牌营销等场景,提供基于自然语言描述的完整音频生成能力。你可以直接描述角色、台词、情绪、声音风格、背景音乐和环境音效,也可以添加参考音色,一次生成包含多角色人声与声音环境的完整音频。

什么是音频生成

音频生成将角色配音、情绪演绎、背景音乐与环境音效整合到一条创作链路中。你无需分别完成配音、音效制作和混音,只需描述期望的声音内容与效果,即可生成完整音频。

核心能力

  • 描述即创作:通过自然语言描述角色、台词、情绪、声音风格、节奏和场景,直接生成对应音频。
  • 多角色多音轨一体生成:支持在一次任务中生成多角色对白、背景音乐与环境音效,并完成整体声音编排。
  • 灵活的参考音色:可从音色广场选择平台音色、使用个人音色或上传本地参考音频,最多添加 3 个参考音色。
  • 完整创作链路:支持灵感模板、生成试听、音频下载与历史作品回听,覆盖从创意到成品的完整流程。

主要特性

  • 自然语言控制声音表现:可直接描述角色年龄、声线、语气、情绪、说话方式和节奏,也可描述笑声、叹气、停顿等副语言表现。
  • 多角色连续演绎:可在同一段音频中定义多个角色及对应台词,并分别设置角色声音与情绪。
  • 人声、音乐与音效统一生成:背景音乐、环境声、动作音效和角色台词可在同一提示词中描述,无需分别生成后再进行混音。
  • 参考音色与文字描述结合:有明确声音需求时可添加参考音色;没有合适音色时,也可以直接通过文字描述创建角色声音。
当前主要面向中文音频创作,暂不支持参考图片、多语种创作和时间戳级精确控制。

提示词写法建议

推荐按照 角色列表 → 场景 → 音频内容 的结构描述。先明确有哪些角色及其声音特征,再描述整体场景,最后按照实际发生顺序编排台词、背景音乐、环境音和具体音效,可以获得更加稳定、完整的生成效果。
  • 角色列表:写明角色名称,并补充年龄、性别、声音质感、情绪基调或角色类型。如已选择音色广场或个人克隆音色,可直接作为该角色的参考声音。
  • 场景:描述时间、地点、人物状态和整体氛围,帮助模型建立完整的声音环境。
  • 角色台词:使用 {speaker:角色名} 标记说话人,并在台词前用括号补充语气、情绪、音量、语速或动作状态。
  • 声音元素:使用 [背景音乐][背景音效][音效] 等标签描述不同类型的声音,并按照希望出现的先后顺序编排。

参数选择建议

计费说明

请参考 计费规则

典型应用场景

播客与有声内容

适用于播客、有声书、广播剧和故事类内容。你可以通过多角色声音与连续对白快速生成完整音频,提升长内容的生产效率。

广告与品牌营销

适用于广告口播、品牌短片、宣传视频和信息流素材。你可以快速尝试不同角色、语气、情绪和声音方案,缩短从创意到成品的制作周期。

短视频与剧情内容创作

适用于剧情短视频、知识视频、AI 漫剧和解说内容。你可以一次生成多角色对白、情绪表达、背景音乐与环境音效,减少配音、找音效和后期混音的制作成本。

开始使用

1

描述创作内容

输入期望生成的角色、台词、情绪、背景音乐和环境音效,也可以从灵感模板开始创作。
2

添加参考音色

如有明确的角色声音需求,可从音色广场、个人音色中选择声音,或上传本地参考音频。最多支持添加 3 个参考音色。
3

生成并试听

提交生成任务,完成后试听生成结果。
4

下载或再次创作

下载满意的音频结果,或调整提示词和参考音色重新生成。历史作品可随时回听。