Skip to main content

说明

基于 WebSocket 的同声传译接口,支持实时语音识别、翻译与译文播报。通信包含 JSON 控制消息与二进制音频消息两类。
  • 接入地址wss://api.senseaudio.cn/ws/v1/audio/simulat-interpreting
  • 鉴权方式:Bearer Token,格式 Authorization: Bearer SENSEAUDIO_API_KEY
  • 音频格式:PCM signed 16-bit little-endian,采样率 16000Hz,单声道
  • 模型参数sensenova-livetranslate-1.0
  • 计费单位:按输入音频时长计费,详见 计费说明
  • 使用场景:跨语言会议、实时交流、直播与国际活动
  • 音频必须为 PCM 16-bit little-endian / 16kHz / 单声道
  • 控制消息必须以 JSON 文本帧 发送,音频数据必须以 二进制帧 发送。
  • 客户端需等待 connected_success 后再发送 task_start,等待 task_started 后再开始推送音频。
  • 当前 API 不支持断线恢复,连接断开后需要重新建立连接并创建新任务。

请求头 (Request Headers)


通信流程


客户端事件

1. task_start - 开始任务

客户端收到 connected_success 后发送 task_start 事件配置参数。服务端返回 task_started 后方可开始推送二进制音频帧。 请求参数

audio_setting

vad_setting(可选)

voice_input_setting

当前可用的输入语言与目标语言包括:
  • Chinese
  • English
  • Japanese
  • Korean
  • Cantonese
  • German
  • French
  • Spanish
  • Portuguese
  • Italian
  • Russian

tts_setting

请求示例
任务启动成功后,服务端返回 task_started

2. 发送音频

音频通过 WebSocket 二进制消息发送,不要放入 JSON,也不要进行 Base64 编码。 音频必须符合以下要求:
  • PCM signed 16-bit
  • 小端序(little-endian)
  • 采样率 16000Hz
  • 单声道
建议每次发送约 100ms 音频,即 3200 字节。

3. task_finish

音频发送完成后,客户端发送:
发送 task_finish 后,不要继续发送音频或其他业务事件。服务端会继续处理已经接收的剩余音频,随后返回 task_finished

服务端事件

通用消息格式

除 WebSocket Ping 控制帧外,服务端业务事件均为 JSON 文本消息:

错误处理

连接建立后的错误通过 task_failed.base_resp 返回。客户端应同时记录 status_codestatus_msgsession_id 常见错误包括:
  • 首条消息不是 task_start
  • 建立连接后长时间未发送 task_start
  • 重复发送 task_start
  • task_started 前发送音频
  • task_finish 后继续发送音频
  • 使用文本帧发送音频
  • 使用二进制帧发送 JSON
  • 输入音频不是 16000Hz、16-bit、单声道 PCM
  • 模型不存在或不支持同声传译
  • 余额不足或并发受限

调用示例

Python

依赖:
示例代码:

Node.js

依赖:
示例代码:

计费说明

请参考 计费规则

相关资源

同声传译介绍

查看同声传译能力概览、使用场景与参数建议。

模型列表

查看同声传译模型与其他可调用模型。