Skip to main content

说明

基于 WebSocket 的流式语音转文字接口,协议风格对齐 OpenAI Realtime。全部消息均为 JSON 文本帧,PCM 音频以 Base64 放入 JSON 字段传输,适用于实时字幕、边录边转、直播转写等场景。
  • 接入地址wss://api.senseaudio.cn/ws/v1/realtime/transcriptions
  • 鉴权方式:Bearer Token,格式 Authorization: Bearer SENSEAUDIO_API_KEY
  • 消息载体:全部为文本 JSON 帧(音频也以 Base64 放在 JSON 中,非二进制帧)
  • 音频格式:PCM signed 16-bit little-endian,单声道;采样率支持 16000 / 24000
  • 模型参数:默认 senseaudio-asr-stream-1.5-260910
  • 计费单位:按音频时长计费,3.6 元 / 小时,详见 计费说明
  • 离线转写:文件批量转写请使用 语音识别转写
  • 本接口与 /ws/v1/audio/transcriptions(语音识别 WebSocket)协议不兼容:本接口全部使用 JSON 文本帧,音频必须 Base64 编码。
  • 声道数不可通过接口配置,服务端固定为单声道 channel=1
  • 客户端需先发送 session.update,收到 session.updated 后再开始推送音频。

请求头 (Request Headers)


通信流程


客户端事件

1. session.update - 初始化会话

必须作为首个业务消息发送,用于配置音频格式、识别模型、VAD 与扩展能力。 请求参数 请求示例

2. input_audio_buffer.append - 追加音频

每段音频一个 JSON 帧,audio 为 Base64 编码的 PCM 字节。建议每片约 100ms(16kHz 时约 3200 字节,24kHz 时约 4800 字节)。

3. sense_asr.session.finish - 结束识别

音频全部发送完成后发送:

服务端事件

session.updated 示例
sense_asr.session.finished 示例

与语音识别 WebSocket 的区别


代码示例


注意事项

  1. 全部 JSON 文本帧:控制消息与音频消息均使用文本帧;音频必须 Base64 编码,不要发送二进制帧。
  2. 事件顺序连接 → session.update → session.updated → append 音频 → finish → finished
  3. 音频参数:PCM s16le / 单声道;采样率须与 format.rate 一致(16000 或 24000)。
  4. 实时节奏:建议按约 100ms 一片发送,避免过快占满缓冲或过慢导致 VAD 误触发。
  5. 计费:按识别音频时长计费,不足 1 秒按 1 秒计时,单价 3.6 元 / 小时

相关资源

语音识别介绍

模型对比、接口选型与接入步骤。

语音识别 WebSocket

二进制帧协议的实时识别接口。

离线转写 API

基于 HTTP 的文件识别接口。

产品定价

语音识别计费规则。