说明
基于 WebSocket 的同声传译接口,支持实时语音识别、翻译与译文播报。通信包含 JSON 控制消息与二进制音频消息两类。- 接入地址:
wss://api.senseaudio.cn/ws/v1/audio/simulat-interpreting - 鉴权方式:Bearer Token,格式
Authorization: Bearer SENSEAUDIO_API_KEY - 音频格式:PCM signed 16-bit little-endian,采样率 16000Hz,单声道
- 模型参数:
sensenova-livetranslate-1.0 - 计费单位:按输入音频时长计费,详见 计费说明
- 使用场景:跨语言会议、实时交流、直播与国际活动
请求头 (Request Headers)
通信流程
客户端事件
1. task_start - 开始任务
客户端收到connected_success 后发送 task_start 事件配置参数。服务端返回 task_started 后方可开始推送二进制音频帧。
请求参数
audio_setting
vad_setting(可选)
voice_input_setting
当前可用的输入语言与目标语言包括:
ChineseEnglishJapaneseKoreanCantoneseGermanFrenchSpanishPortugueseItalianRussian
tts_setting
请求示例
task_started。
2. 发送音频
音频通过 WebSocket 二进制消息发送,不要放入 JSON,也不要进行 Base64 编码。 音频必须符合以下要求:- PCM signed 16-bit
- 小端序(little-endian)
- 采样率 16000Hz
- 单声道
3. task_finish
音频发送完成后,客户端发送:task_finish 后,不要继续发送音频或其他业务事件。服务端会继续处理已经接收的剩余音频,随后返回 task_finished。
服务端事件
通用消息格式
除 WebSocket Ping 控制帧外,服务端业务事件均为 JSON 文本消息:错误处理
连接建立后的错误通过task_failed.base_resp 返回。客户端应同时记录 status_code、status_msg 和 session_id。
常见错误包括:
- 首条消息不是
task_start - 建立连接后长时间未发送
task_start - 重复发送
task_start - 在
task_started前发送音频 - 在
task_finish后继续发送音频 - 使用文本帧发送音频
- 使用二进制帧发送 JSON
- 输入音频不是 16000Hz、16-bit、单声道 PCM
- 模型不存在或不支持同声传译
- 余额不足或并发受限
调用示例
Python
依赖:Node.js
依赖:计费说明
请参考 计费规则。相关资源
同声传译介绍
查看同声传译能力概览、使用场景与参数建议。
模型列表
查看同声传译模型与其他可调用模型。