SenseASR 语音识别(HTTP)
语音识别
语音识别转写
音频文件转写,支持多种 ASR 模型
POST
SenseASR 语音识别(HTTP)
说明
基于 HTTP 协议的语音识别服务,兼容 OpenAI Audio API 风格,便于从现有系统迁移。- 接口地址:
https://api.senseaudio.cn/v1/audio/transcriptions - Content-Type:
multipart/form-data - 鉴权方式:Bearer Token,详见 快速接入
- 模型矩阵:Lite / Standard / Pro / DeepThink,能力差异详见 语音识别介绍
- 实时识别:低延迟场景请使用 WebSocket 实时识别
Authorizations
string
必填
Bearer 鉴权头,格式为
Bearer SENSEAUDIO_API_KEY,其中 SENSEAUDIO_API_KEY 为您的 API Key。Body
multipart/form-datafile
必填
音频文件(wav / mp3 / ogg / flac / aac / m4a / mp4 等),≤ 10 MB。
string
必填
模型名称。可选值:
senseaudio-asr-lite-1.5-260319、senseaudio-asr-1.5-260319、senseaudio-asr-pro-1.5-260319、senseaudio-asr-deepthink-1.5-260319。string
音频内容语言代码(ISO-639-1,部分 ISO-639-3),如
zh / en / ja;不设置则自动检测。string
默认值:"json"
响应格式:
json / text / verbose_json。boolean
默认值:"false"
是否流式返回(lite 不支持)。
boolean
默认值:"false"
自动标点(仅 asr / pro,deepthink 静默忽略)。
boolean
默认值:"false"
说话人分离(仅 asr / pro)。
integer
最大说话人数 1–20,配合说话人分离使用(仅 asr-pro 支持)。
string[]
时间戳粒度:
word = 字级 / segment = 句级(仅 asr / pro)。string
翻译目标语言代码(lite 不支持,pro / deepthink 支持)。
string
热词增强,英文逗号分隔(仅 lite)。
string
默认值:"auto"
识别模式:
auto / record_only(仅 deepthink 流式模式生效)。boolean
默认值:"false"
缩写词自动替换。
Response
200 — application/json
string
识别出的文本内容(所有
response_format 均返回)。number
音频时长(秒),
verbose_json 下返回。object
音频元信息,
verbose_json / 流式下返回。object[]
分段结果(需
response_format=verbose_json 或 timestamp_granularities[]=segment)。object[]
字级结果,需设置
timestamp_granularities[]=word。响应格式详解
JSON(默认)
Text
纯文本,Content-Type: text/plain。
Verbose JSON
流式响应 (SSE)
Content-Type: text/event-stream
语言支持
language 用于指定音频内容的语言(留空则自动检测);target_language 将识别结果翻译为另一语言。
各模型参数支持
senseaudio-asr-lite-1.5-260319 支持语种
senseaudio-asr-1.5-260319 / senseaudio-asr-pro-1.5-260319 支持语种
senseaudio-asr-deepthink-1.5-260319 支持语种
同senseaudio-asr-1.5-260319 / senseaudio-asr-pro-1.5-260319 表,用于翻译输出。
各模型调用示例
senseaudio-asr-lite-1.5-260319
轻量级模型。热词增强示例:senseaudio-asr-1.5-260319
标准模型。字级 / 句级时间戳示例:senseaudio-asr-pro-1.5-260319
专业版。说话人分离 + 字级时间戳 + 翻译:senseaudio-asr-deepthink-1.5-260319
深度理解模型。翻译示例:错误处理
错误时返回非 200 状态码,响应体:相关指南
授权
格式:Bearer <API_KEY>
请求体
multipart/form-data
音频文件(wav/mp3/ogg/flac/aac/m4a/mp4 等),≤10MB
模型名称
可用选项:
senseaudio-asr-lite-1.5-260319, senseaudio-asr-1.5-260319, senseaudio-asr-pro-1.5-260319, senseaudio-asr-deepthink-1.5-260319 语言代码(ISO-639-1/3),如 zh/en/ja,不设置会自动检测
示例:
"zh"
响应格式
可用选项:
json, text, verbose_json 是否流式返回(lite 不支持)
自动标点(仅 asr/pro)
说话人分离(仅 asr/pro)
最大说话人数 1-20(仅 asr-pro)
必填范围:
1 <= x <= 20示例:
4
word=字级 / segment=句级(仅 asr/pro)
可用选项:
word, segment 翻译目标语言代码(lite 不支持)
示例:
"en"
热词增强,逗号分隔(仅 lite)
示例:
"张三,李四,项目Alpha"
识别模式(仅 deepthink 流式)
可用选项:
auto, record_only 缩写词自动替换