什么是端到端实时语音?
端到端实时语音通过一个 WebSocket 连接完成语音输入、语义理解、模型回复和语音输出的完整链路。开发者只需要按协议发送pcm_s16le 音频帧,并处理服务端返回的 JSON 事件与二进制音频帧,即可实现自然的实时语音对话体验。
主要特性
- 实时语音交互:支持客户端持续上传语音,服务端实时返回转写、文本与音频回复。
- 低延迟流式链路:文本帧以 JSON 事件返回,音频帧以 PCM 二进制数据返回,便于边接收边处理。
- 多轮对话:单个 WebSocket 连接内可连续完成多轮用户输入与模型回复。
- 回复打断:客户端可发送
cancel打断当前模型回复,适合语音助手和实时对话场景。 - 动态配置:支持通过
update在会话中更新音色或系统提示词等配置。 - 函数调用:支持通过
tools注册 Function Tool Schema,并通过tool.call/tool.result完成本地工具调用。
应用场景
语音助手
面向 App、桌面端或硬件设备,构建可持续对话的语音助手,实现问答、指令执行、信息查询等能力。智能客服
用于售前咨询、售后答疑、业务办理和人工转接前置分流,通过语音交互降低用户输入成本。教育陪伴
支持口语练习、知识问答、课程陪练等实时互动场景,结合模型回复和语音输出形成自然对话体验。车载与 IoT 交互
适合车载系统、智能音箱、机器人等需要实时语音控制和多轮反馈的终端设备。模型版本
当前模型版本为
senseaudio-realtime-1.0。该模型支持实时语音转写、模型文本增量回复、模型语音回复、对话配置更新、打断以及函数调用等能力。
通过 tools 接入天气查询、订单查询、知识库检索、转人工等本地业务能力,让模型在对话中触发外部工具。
API 能力概览
端到端实时语音 API 使用 WebSocket 协议接入,核心能力包括:- 建立连接:连接
wss://api.senseaudio.cn/ws/v1/realtime/voice-dialog,通过Authorization: Bearer SENSEAUDIO_API_KEY鉴权。 - 开始对话:发送
start初始化会话,指定model: senseaudio-realtime-1.0、音色、系统提示词和输入音频设置。 - 上传音频:按
pcm_s16le、16000Hz、单声道发送二进制音频帧,推荐每40ms发送一帧。 - 提交音频:发送
commit手动提交当前一轮音频输入。 - 打断回复:发送
cancel取消当前模型回复。 - 更新配置:发送
update更新音色或系统提示词。 - 函数调用:通过
tools注册工具,收到tool.call后执行本地逻辑,并用tool.result回传结果。 - 结束会话:发送
end主动结束当前 WebSocket 会话。
ready、speech.started、user.transcript.delta、user.transcript.done、assistant.text.delta、assistant.text.done、assistant.audio.start、assistant.audio.done、turn.done、tool.call、tool.cancelled、command.ack、error 等事件。
开始使用
1
获取 API Key
前往 API 密钥 页面创建您的 API Key,并在请求头中使用
Authorization: Bearer SENSEAUDIO_API_KEY 鉴权。2
建立 WebSocket 连接
使用服务端程序连接
wss://api.senseaudio.cn/ws/v1/realtime/voice-dialog。浏览器原生 WebSocket 不能设置自定义 Authorization 请求头,浏览器场景建议通过受控后端代理接入。3
发送 start 消息
连接建立后,第一条客户端文本消息必须是
start,并指定 model 为 senseaudio-realtime-1.0。4
等待 ready 后发送音频
收到服务端
ready 后,按 pcm_s16le、16000Hz、单声道持续发送音频二进制帧。5
处理服务端事件
监听用户转写、模型文本回复、模型音频帧和工具调用事件,根据业务需要播放音频、展示文本或执行本地工具。
6
结束会话
用户结束对话时发送
end,服务端会正常关闭 WebSocket 连接。相关资源
端到端实时语音模型
查看 WebSocket 接口、事件协议、参数说明和 Python 调用示例。
计费
查看端到端实时语音模型及其他能力的计费规则。
自定义智能体
创建和管理可绑定模型、音色与配置的自定义智能体。
模型列表与计费说明
查看模型 ID、价格和计费单位说明。