curl --request POST \
--url https://api.senseaudio.cn/v1/audio/transcriptions \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: multipart/form-data' \
--form file=@audio.mp3 \
--form model=senseaudio-asr-1.5-260319 \
--form 0.file='@example-file' \
--form 1.file='@example-file'{
"text": "<string>",
"duration": 123,
"audio_info": {
"duration": 123,
"format": "<string>"
},
"segments": [
{
"id": 123,
"start": 123,
"end": 123,
"text": "<string>",
"speaker": "<string>",
"translation": "<string>"
}
],
"words": [
{
"word": "<string>",
"start": 123,
"end": 123
}
]
}{
"code": "invalid",
"message": "<string>"
}{
"code": "invalid",
"message": "<string>"
}{
"text": "<string>",
"segments": [
{
"start": 123,
"end": 123,
"text": "<string>",
"speaker": "<string>"
}
],
"base_resp": {
"status_code": 123,
"status_msg": "<string>"
}
}语音识别
语音识别转写
音频文件转写,支持多种 ASR 模型
POST
/
v1
/
audio
/
transcriptions
curl --request POST \
--url https://api.senseaudio.cn/v1/audio/transcriptions \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: multipart/form-data' \
--form file=@audio.mp3 \
--form model=senseaudio-asr-1.5-260319 \
--form 0.file='@example-file' \
--form 1.file='@example-file'{
"text": "<string>",
"duration": 123,
"audio_info": {
"duration": 123,
"format": "<string>"
},
"segments": [
{
"id": 123,
"start": 123,
"end": 123,
"text": "<string>",
"speaker": "<string>",
"translation": "<string>"
}
],
"words": [
{
"word": "<string>",
"start": 123,
"end": 123
}
]
}{
"code": "invalid",
"message": "<string>"
}{
"code": "invalid",
"message": "<string>"
}{
"text": "<string>",
"segments": [
{
"start": 123,
"end": 123,
"text": "<string>",
"speaker": "<string>"
}
],
"base_resp": {
"status_code": 123,
"status_msg": "<string>"
}
}说明
基于 HTTP 协议的语音识别服务,兼容 OpenAI Audio API 风格,便于从现有系统迁移。- 接口地址:
https://api.senseaudio.cn/v1/audio/transcriptions - Content-Type:
multipart/form-data - 鉴权方式:Bearer Token,详见 快速接入
- 模型矩阵:Lite / Standard / Pro / DeepThink,能力差异详见 语音识别介绍
- 音频输入:
file(≤ 10 MB 直传)或file_id(大文件,先 文件上传);详见下方表格,两者都传时优先file_id - 实时识别:低延迟场景优先使用 流式 ASR;二进制帧协议见 语音识别 WebSocket
Authorizations
string
必填
Bearer 鉴权头,格式为
Bearer SENSEAUDIO_API_KEY,其中 SENSEAUDIO_API_KEY 为您的 API Key。Body
multipart/form-data音频输入方式
file 与 file_id 二选一必填;同时传入时 优先使用 file_id。
| 参数 | 类型 | 适用场景 | 限制 / 说明 |
|---|---|---|---|
file | file | 小文件直接上传转写 | 格式:wav / mp3 / ogg / flac / aac / m4a / mp4 等;大小:≤ 10 MB |
file_id | string | 大文件转写 | 先调用 文件上传(purpose=speech_to_text,大小 < 500 MB)获取 file.file_id,再传本参数;可替代 file |
file
见上方「音频输入方式」表格。
string
见上方「音频输入方式」表格。
string
必填
模型名称。可选值:
senseaudio-asr-lite-1.5-260319、senseaudio-asr-1.5-260319、senseaudio-asr-pro-1.5-260319、senseaudio-asr-deepthink-1.5-260319。string
音频内容语言代码(ISO-639-1,部分 ISO-639-3),如
zh / en / ja;不设置则自动检测。string
默认值:"json"
响应格式:
json / text / verbose_json。boolean
默认值:"false"
是否流式返回(lite 不支持)。
boolean
默认值:"false"
自动标点(仅 asr / pro,deepthink 静默忽略)。
boolean
默认值:"false"
说话人分离(仅 asr / pro)。
integer
最大说话人数 1–20,配合说话人分离使用(仅 asr-pro 支持)。
string[]
时间戳粒度:
word = 字级 / segment = 句级(仅 asr / pro)。string
翻译目标语言代码(lite 不支持,pro / deepthink 支持)。
string
热词增强,英文逗号分隔(仅 lite)。
string
默认值:"auto"
识别模式:
auto / record_only(仅 deepthink 流式模式生效)。boolean
默认值:"false"
缩写词自动替换。
Response
200 — application/json
string
识别出的文本内容(所有
response_format 均返回)。number
音频时长(秒),
verbose_json 下返回。object[]
object[]
响应格式详解
JSON(默认)
{ "text": "识别出的文本内容" }
Text
纯文本,Content-Type: text/plain。
识别出的文本内容
Verbose JSON
{
"text": "道可道非常道",
"duration": 2.1,
"audio_info": { "duration": 5230, "format": "wav" },
"segments": [
{
"id": 0,
"start": 0.0,
"end": 2.0,
"text": "道可道非常道",
"speaker": "speaker_0",
"translation": "Translated"
}
],
"words": [
{ "word": "道", "start": 0.27, "end": 0.51 },
{ "word": "可", "start": 0.57, "end": 0.81 }
]
}
流式响应 (SSE)
Content-Type: text/event-stream
data: {"delta": {"text": "增量文本"}, "finish_reason": null}
data: {"delta": {"text": "。"}, "finish_reason": "stop", "audio_info": {...}}
data: [DONE]
| 字段 | 说明 |
|---|---|
delta.text | 本次返回的增量文本 |
finish_reason | null(进行中)/ stop(完成)/ error(错误) |
语言支持
language 用于指定音频内容的语言(留空则自动检测);target_language 将识别结果翻译为另一语言。
各模型参数支持
| 模型 | language | target_language |
|---|---|---|
senseaudio-asr-lite-1.5-260319 | ✅ | ❌ |
senseaudio-asr-1.5-260319 | ✅ | ❌ |
senseaudio-asr-pro-1.5-260319 | ✅ | ✅ |
senseaudio-asr-deepthink-1.5-260319 | ✅ | ✅ |
部分模型仅支持
language 或 target_language,请以上表为准。senseaudio-asr-lite-1.5-260319 支持语种
| 代码 | 语言 | 代码 | 语言 | 代码 | 语言 |
|---|---|---|---|---|---|
zh | 中文 | en | 英文 | yue | 粤语 |
ja | 日文 | ko | 韩文 | vi | 越南语 |
id | 印尼语 | th | 泰语 | ms | 马来语 |
tl/fil | 菲律宾语 | ar | 阿拉伯语 | hi | 印地语 |
bg | 保加利亚语 | hr | 克罗地亚语 | cs | 捷克语 |
da | 丹麦语 | nl | 荷兰语 | et | 爱沙尼亚语 |
fi | 芬兰语 | el | 希腊语 | hu | 匈牙利语 |
ga | 爱尔兰语 | lv | 拉脱维亚语 | lt | 立陶宛语 |
mt | 马耳他语 | pl | 波兰语 | pt | 葡萄牙语 |
ro | 罗马尼亚语 | sk | 斯洛伐克语 | sl | 斯洛文尼亚语 |
sv | 瑞典语 |
senseaudio-asr-1.5-260319 / senseaudio-asr-pro-1.5-260319 支持语种
| 代码 | 语言 | 代码 | 语言 | 代码 | 语言 |
|---|---|---|---|---|---|
ar | 阿拉伯语 | yue | 粤语 | zh | 中文 |
nl | 荷兰语 | en | 英文 | fr | 法语 |
de | 德语 | id | 印尼语 | it | 意大利语 |
ja | 日文 | ko | 韩文 | ms | 马来语 |
pt | 葡萄牙语 | ru | 俄语 | es | 西班牙语 |
th | 泰语 | tr | 土耳其语 | ur | 乌尔都语 |
vi | 越南语 |
senseaudio-asr-deepthink-1.5-260319 支持语种
同senseaudio-asr-1.5-260319 / senseaudio-asr-pro-1.5-260319 表,用于翻译输出。
各模型调用示例
通过 file 直传(≤ 10 MB)
curl https://api.senseaudio.cn/v1/audio/transcriptions \
-H "Authorization: Bearer $SENSEAUDIO_API_KEY" \
-F file="@meeting.wav" \
-F model="senseaudio-asr-1.5-260319" \
-F language="zh"
通过 file_id 转写(大文件)
先调用 文件上传(purpose=speech_to_text)拿到 file_id,再用本接口转写:
# 1) 上传大文件
curl -X POST https://api.senseaudio.cn/v1/files/upload \
-H "Authorization: $SENSEAUDIO_API_KEY" \
-F "purpose=speech_to_text" \
-F "file=@/path/to/long_audio.wav"
# 2) 用返回的 file_id 转写(可替代 -F file="@...")
curl https://api.senseaudio.cn/v1/audio/transcriptions \
-H "Authorization: Bearer $SENSEAUDIO_API_KEY" \
-F file_id="file-E4avzR574Mm42YoCytmiND" \
-F model="senseaudio-asr-1.5-260319" \
-F language="zh"
file 与 file_id 同时传入时,服务端优先使用 file_id。senseaudio-asr-lite-1.5-260319
轻量级模型。热词增强示例:curl https://api.senseaudio.cn/v1/audio/transcriptions \
-H "Authorization: Bearer $SENSEAUDIO_API_KEY" \
-F file="@meeting.wav" \
-F model="senseaudio-asr-lite-1.5-260319" \
-F language="zh" \
-F hotwords="张三,李四,项目Alpha,季度复盘"
{ "text": "张三和李四负责项目Alpha的季度复盘工作" }
senseaudio-asr-1.5-260319
标准模型。字级 / 句级时间戳示例:curl https://api.senseaudio.cn/v1/audio/transcriptions \
-H "Authorization: Bearer $SENSEAUDIO_API_KEY" \
-F file="@interview.wav" \
-F model="senseaudio-asr-1.5-260319" \
-F response_format="verbose_json" \
-F "timestamp_granularities[]=word"
senseaudio-asr-pro-1.5-260319
专业版。说话人分离 + 字级时间戳 + 翻译:curl https://api.senseaudio.cn/v1/audio/transcriptions \
-H "Authorization: Bearer $SENSEAUDIO_API_KEY" \
-F file="@meeting.wav" \
-F model="senseaudio-asr-pro-1.5-260319" \
-F response_format="verbose_json" \
-F enable_speaker_diarization="true" \
-F max_speakers="4" \
-F "timestamp_granularities[]=word" \
-F target_language="en"
senseaudio-asr-deepthink-1.5-260319
深度理解模型。翻译示例:curl https://api.senseaudio.cn/v1/audio/transcriptions \
-H "Authorization: Bearer $SENSEAUDIO_API_KEY" \
-F file="@complex_audio.mp3" \
-F model="senseaudio-asr-deepthink-1.5-260319" \
-F target_language="en"
{ "text": "The weather is nice today, suitable for going out for a walk." }
错误处理
错误时返回非 200 状态码,响应体:{
"code": "invalid",
"message": "file is required"
}
| HTTP | code | 说明 |
|---|---|---|
| 400 | invalid | 参数错误 |
| 429 | rate_limit_error | 请求频率过高 |
| 500 | internal_error | 服务端错误 |
相关指南
授权
格式:Bearer <API_KEY>
请求体
multipart/form-data
- 使用 file 直传
- 使用 file_id
【方式一】直接上传音频(wav/mp3/ogg/flac/aac/m4a/mp4 等),≤ 10 MB。与 file_id 二选一;同时传入时优先 file_id。
模型名称
可用选项:
senseaudio-asr-lite-1.5-260319, senseaudio-asr-1.5-260319, senseaudio-asr-pro-1.5-260319, senseaudio-asr-deepthink-1.5-260319 【方式二】已上传文件 ID(先调 /v1/files/upload,purpose=speech_to_text)。可替代 file;与 file 同时存在时优先本字段。
示例:
"file-E4avzR574Mm42YoCytmiND"
语言代码(ISO-639-1/3),如 zh/en/ja,不设置会自动检测
示例:
"zh"
响应格式
可用选项:
json, text, verbose_json 是否流式返回(lite 不支持)
自动标点(仅 asr/pro)
说话人分离(仅 asr/pro)
最大说话人数 1-20(仅 asr-pro)
必填范围:
1 <= x <= 20示例:
4
word=字级 / segment=句级(仅 asr/pro)
可用选项:
word, segment 翻译目标语言代码(lite 不支持)
示例:
"en"
热词增强,逗号分隔(仅 lite)
示例:
"张三,李四,项目Alpha"
识别模式(仅 deepthink 流式)
可用选项:
auto, record_only 缩写词自动替换