Skip to main content

什么是端到端实时语音?

端到端实时语音通过一个 WebSocket 连接完成语音输入、语义理解、模型回复和语音输出的完整链路。开发者只需要按协议发送 pcm_s16le 音频帧,并处理服务端返回的 JSON 事件与二进制音频帧,即可实现自然的实时语音对话体验。

主要特性

  • 实时语音交互:支持客户端持续上传语音,服务端实时返回转写、文本与音频回复。
  • 低延迟流式链路:文本帧以 JSON 事件返回,音频帧以 PCM 二进制数据返回,便于边接收边处理。
  • 多轮对话:单个 WebSocket 连接内可连续完成多轮用户输入与模型回复。
  • 回复打断:客户端可发送 cancel 打断当前模型回复,适合语音助手和实时对话场景。
  • 动态配置:支持通过 update 在会话中更新音色或系统提示词等配置。
  • 函数调用:支持通过 tools 注册 Function Tool Schema,并通过 tool.call / tool.result 完成本地工具调用。

应用场景

语音助手

面向 App、桌面端或硬件设备,构建可持续对话的语音助手,实现问答、指令执行、信息查询等能力。

智能客服

用于售前咨询、售后答疑、业务办理和人工转接前置分流,通过语音交互降低用户输入成本。

教育陪伴

支持口语练习、知识问答、课程陪练等实时互动场景,结合模型回复和语音输出形成自然对话体验。

车载与 IoT 交互

适合车载系统、智能音箱、机器人等需要实时语音控制和多轮反馈的终端设备。

模型版本

当前模型版本为 senseaudio-realtime-1.0。该模型支持实时语音转写、模型文本增量回复、模型语音回复、对话配置更新、打断以及函数调用等能力。 通过 tools 接入天气查询、订单查询、知识库检索、转人工等本地业务能力,让模型在对话中触发外部工具。

API 能力概览

端到端实时语音 API 使用 WebSocket 协议接入,核心能力包括:
  • 建立连接:连接 wss://api.senseaudio.cn/ws/v1/realtime/voice-dialog,通过 Authorization: Bearer SENSEAUDIO_API_KEY 鉴权。
  • 开始对话:发送 start 初始化会话,指定 model: senseaudio-realtime-1.0、音色、系统提示词和输入音频设置。
  • 上传音频:按 pcm_s16le16000Hz、单声道发送二进制音频帧,推荐每 40ms 发送一帧。
  • 提交音频:发送 commit 手动提交当前一轮音频输入。
  • 打断回复:发送 cancel 取消当前模型回复。
  • 更新配置:发送 update 更新音色或系统提示词。
  • 函数调用:通过 tools 注册工具,收到 tool.call 后执行本地逻辑,并用 tool.result 回传结果。
  • 结束会话:发送 end 主动结束当前 WebSocket 会话。
服务端会返回 readyspeech.starteduser.transcript.deltauser.transcript.doneassistant.text.deltaassistant.text.doneassistant.audio.startassistant.audio.doneturn.donetool.calltool.cancelledcommand.ackerror 等事件。

开始使用

1

获取 API Key

前往 API 密钥 页面创建您的 API Key,并在请求头中使用 Authorization: Bearer SENSEAUDIO_API_KEY 鉴权。
2

建立 WebSocket 连接

使用服务端程序连接 wss://api.senseaudio.cn/ws/v1/realtime/voice-dialog。浏览器原生 WebSocket 不能设置自定义 Authorization 请求头,浏览器场景建议通过受控后端代理接入。
3

发送 start 消息

连接建立后,第一条客户端文本消息必须是 start,并指定 modelsenseaudio-realtime-1.0
4

等待 ready 后发送音频

收到服务端 ready 后,按 pcm_s16le16000Hz、单声道持续发送音频二进制帧。
5

处理服务端事件

监听用户转写、模型文本回复、模型音频帧和工具调用事件,根据业务需要播放音频、展示文本或执行本地工具。
6

结束会话

用户结束对话时发送 end,服务端会正常关闭 WebSocket 连接。

相关资源

端到端实时语音模型

查看 WebSocket 接口、事件协议、参数说明和 Python 调用示例。

计费

查看端到端实时语音模型及其他能力的计费规则。

自定义智能体

创建和管理可绑定模型、音色与配置的自定义智能体。

模型列表与计费说明

查看模型 ID、价格和计费单位说明。

技术支持

如需技术支持或商务咨询,请发送邮件至 senseaudio.support@sensetime.com 也可以先查看 端到端实时语音模型 API 参考,确认接入地址、鉴权方式、音频格式、事件类型和完整调用示例。