本文介绍Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash非实时语音识别HTTP API的参数和接口细节。
用户指南:非实时语音识别。关于支持的音频格式、文件大小限制、时长限制等输入要求,请参见音频规格。
接口地址
华北2(北京)
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
调用时请将{WorkspaceId}替换为真实的Workspace ID。
新加坡
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
调用时请将{WorkspaceId}替换为真实的Workspace ID。
重要阿里云百炼为华北2(北京)、新加坡地域推出了业务空间专属域名,能够为推理请求提供卓越的性能和更高的稳定性,建议迁移至新域名:
- 华北2(北京)地域:从
dashscope.aliyuncs.com迁移至{WorkspaceId}.cn-beijing.maas.aliyuncs.com - 新加坡地域:从
dashscope-intl.aliyuncs.com迁移至{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com
{WorkspaceId}需要替换为真实的Workspace ID。现有域名仍可正常使用。
请求头
参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|
Authorization | string | 是 | 鉴权令牌,格式为 |
Content-Type | string | 是 | 请求参数的媒体类型,固定为 |
X-DashScope-SSE | string | 是 | 用于控制是否以SSE流式方式返回结果。设置为 |
请求参数model 指定模型名。支持Qwen-Audio-3.0-ASR-Flash和Fun-ASR-Flash系列模型,详情请参见支持的模型与地域。 input 输入信息。 parameters 模型参数。 说明润色顺滑功能默认关闭,暂未开放。 润色顺滑:模型在识别语音的同时,自动清理无意义语气词和口吃重复,处理说话过程中的自我纠正,理顺口语表达,并规范标点与文本格式。输出结果更加简洁、流畅、易读,同时尽可能保留用户的最终意图和关键信息。 | 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 非流式流式携带上下文-非流式携带上下文-流式Base64可输入Base64编码数据(Data URL),格式为:
即时热词 |
响应参数request_id 本次请求的唯一标识。 output 输出结果。 usage 用量信息。仅在 属性 duration 已处理的音频时长,单位秒。 | 非流式流式仅当音频时长不少于1分钟且设置 返回示例: |
SSE 流式结果处理逻辑
在流式模式下,客户端需关注以下处理要点:
- 每收到一个SSE事件,解析
data字段中的JSON。 - 通过
output.sentence.sentence_end判断当前句子是否结束:当该值为true时,该句识别完成,词级时间戳已稳定,可作为最终结果使用;当该值为false时,识别仍在进行中,文本和时间戳可能在后续事件中更新。 usage信息仅在句子结束事件中返回,可用于计量音频处理时长。