语音识别(MiMo‑V2.5-ASR)- OpenAI API 兼容
请求地址
https://api.xiaomimimo.com/v1/chat/completions
请求头
接口支持以下两种认证方式,请选择其中一种添加到请求头中:
api-key: $MIMO_API_KEY
Content-Type: application/json
请求体
- messagesarray必选消息列表。隐藏子属性由终端用户发送的消息。隐藏子属性messages.contentarray必选用户消息的内容。
详细用法请参考 语音识别。
隐藏子属性一个由指定类型的内容部分组成的数组。对于语音识别,仅支持单条音频输入。隐藏子属性隐藏子属性messages.content.input_audioobject必选通过 data URL 传入音频时,
format字段选填;若仅传入 Base64 编码音频数据,则format为必填项。若同时携带MIME_TYPE与format,二者取值必须匹配。隐藏子属性messages.content.input_audio.datastring必选采用 data URL 格式的 Base64 编码音频。输入音频仅支持mp3、wav两种格式:mp3:MIME_TYPE取值audio/mpeg、audio/mp3wav:MIME_TYPE取值audio/wav
messages.content.input_audio.formatstring编码音频数据的格式。
可选值:mp3,wavmessages.content.typestring必选内容部分的类型。
可选值:input_audiomessages.rolestring必选消息作者的角色。
可选值:user - modelstring必选用于生成响应的模型 ID。
可选值:mimo-v2.5-asr - asr_optionsobject语音识别(ASR)自定义配置参数。隐藏子属性asr_options.languagestring默认值: auto指定音频识别语种,仅支持单一语种。
auto:自动检测音频语种zh:中文en:英文
auto,zh,en - streamboolean默认值: false如果设置为
true,模型的响应数据会在生成过程中通过SSE(server-sent events)的形式流式传输到客户端。
Chat 响应对象(非流式输出)
- choicesarray包含生成的回复选项列表。隐藏子属性choices.finish_reasonstring模型停止生成 token 的原因:
stop:模型到达自然结束点或触发了用户指定的停止序列length:因超出模型最大生成长度而终止content_filter:内容因触发过滤策略而被拦截
choices.indexinteger选项列表中对应选项的索引。choices.messageobject模型生成的对话补全消息。隐藏子属性choices.message.contentstring消息的内容。choices.message.rolestring消息作者的角色。 - createdinteger对话补全对象创建时的 Unix 时间戳(以秒为单位)。
- idstring响应的唯一标识符。
- modelstring用于生成结果的模型。
- objectstring对象类型,仅为
chat.completion。 - usageobject | null该对话补全请求的用量信息。隐藏子属性usage.completion_tokensinteger模型输出内容花费的 token。usage.prompt_tokensinteger提示词使用的 token 数量。usage.total_tokensinteger请求中使用的 token 总数(提示词 + 补全结果)。usage.completion_tokens_detailsobject补全中使用的 token 数量明细。隐藏子属性usage.completion_tokens_details.reasoning_tokensinteger模型为推理生成的 token 数量,固定为
0。usage.prompt_tokens_detailsobject提示中使用的 token 数量明细。隐藏子属性usage.prompt_tokens_details.cached_tokensinteger命中缓存的 token 数量。usage.prompt_tokens_details.audio_tokensinteger提示中存在的音频输入 token 数量。usage.secondsinteger音频时长(秒)。
Chat 响应 chunk 对象(流式输出)
- choicesarray包含生成的回复选项列表。隐藏子属性choices.deltaobject流式模型响应生成的对话补全增量。隐藏子属性choices.delta.contentstring数据块消息的内容。choices.delta.rolestring消息作者的角色。choices.finish_reasonstring | null模型停止生成 token 的原因:
stop:模型到达自然结束点或触发了用户指定的停止序列length:因超出模型最大生成长度而终止content_filter:内容因触发过滤策略而被拦截
choices.indexinteger选项列表中对应选项的索引。 - createdinteger对话补全对象创建时的 Unix 时间戳(以秒为单位)。每个数据块均使用相同的时间戳。
- idstring对话补全对象的唯一标识符。每个数据块均使用相同的 ID。
- modelstring用于生成结果的模型。
- objectstring对象类型,仅为
chat.completion.chunk。 - usageobject | null该对话补全请求的用量信息。隐藏子属性usage.completion_tokensinteger模型输出内容花费的 token。usage.prompt_tokensinteger提示词使用的 token 数量。usage.total_tokensinteger请求中使用的 token 总数(提示词 + 补全结果)。usage.completion_tokens_detailsobject补全中使用的 token 数量明细。隐藏子属性usage.completion_tokens_details.reasoning_tokensinteger模型为推理生成的 token 数量,固定为
0。usage.prompt_tokens_detailsobject提示中使用的 token 数量明细。隐藏子属性usage.prompt_tokens_details.cached_tokensinteger命中缓存的 token 数量。usage.prompt_tokens_details.audio_tokensinteger提示中存在的音频输入 token 数量。usage.secondsinteger音频时长(秒)。
curl --location --request POST 'https://api.xiaomimimo.com/v1/chat/completions' \
--header "api-key: $MIMO_API_KEY" \
--header 'Content-Type: application/json' \
--data-raw '{
"model": "mimo-v2.5-asr",
"messages": [
{
"role": "user",
"content": [
{
"type": "input_audio",
"input_audio": {
"data": "data:{MIME_TYPE};base64,$BASE64_AUDIO"
}
}
]
}
],
"asr_options": {
"language": "auto"
}
}'响应
{
"id": "9f51eba459dd4dfdabb31cabba0cb7dc",
"choices": [
{
"finish_reason": "stop",
"index": 0,
"message": {
"content": "Good morning. Could you tell me what the weather will be like today?",
"role": "assistant",
"audio": null,
"tool_calls": null,
"audio_tokens": []
}
}
],
"created": 1780398283,
"model": "mimo-v2.5-asr",
"object": "chat.completion",
"usage": {
"completion_tokens": 20,
"prompt_tokens": 46,
"total_tokens": 66,
"completion_tokens_details": {
"reasoning_tokens": 0
},
"prompt_tokens_details": {
"audio_tokens": 25,
"cached_tokens": 45
},
"seconds": 4
}
}更新时间 2026 年 07 月 17 日