header object (必选) 属性 task_id string (必选) 客户端生成的任务 ID(UUID 格式),用于关联后续事件。 | 基本请求{
"header": {
"action": "run-task",
"task_id": "2bf83b9a-baeb-4fda-8d9a-xxxxxxxxxxxx",
"streaming": "duplex"
},
"payload": {
"task_group": "audio",
"task": "asr",
"function": "recognition",
"model": "qwen-audio-3.0-asr-flash-streaming",
"parameters": {
"format": "pcm",
"sample_rate": 16000
},
"input": {}
}
}
携带上下文{
"header": {
"action": "run-task",
"task_id": "2bf83b9a-baeb-4fda-8d9a-xxxxxxxxxxxx",
"streaming": "duplex"
},
"payload": {
"task_group": "audio",
"task": "asr",
"function": "recognition",
"model": "qwen-audio-3.0-asr-flash-streaming",
"parameters": {
"format": "pcm",
"sample_rate": 16000
},
"input": {
"context": [
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "你好啊"
}
]
},
{
"role": "assistant",
"content": [
{
"type": "text",
"text": "你好啊,我是通义千问,有什么可以帮助你的?"
}
]
}
]
}
}
}
即时热词{
"header": {
"action": "run-task",
"task_id": "2bf83b9a-baeb-4fda-8d9a-xxxxxxxxxxxx",
"streaming": "duplex"
},
"payload": {
"task_group": "audio",
"task": "asr",
"function": "recognition",
"model": "qwen-audio-3.0-asr-flash-streaming",
"parameters": {
"format": "pcm",
"sample_rate": 16000,
"vocabulary": {"张三": 5, "李四": 5}
},
"input": {}
}
}
|
payload object (必选) 属性 model string (必选) 指定模型名。支持Qwen-Audio-3.0-ASR-Flash-Streaming和Fun-ASR-Realtime系列模型,详情请参见支持的模型与地域。 input object (必选) 输入对象。不携带上下文时传入{}。
重要 仅 qwen-audio-3.0-asr-flash-streaming、fun-asr-realtime 和 fun-asr-realtime-2025-11-07 模型支持上下文。 parameters object (必选) 语音识别参数。 属性 format string (必选) 音频格式。 取值范围:
重要 opus/speex:必须使用Ogg封装; wav:必须为PCM编码; amr:仅支持AMR-NB类型。 sample_rate integer (必选) 采样率(Hz)。 取值范围:8k模型仅支持 8000 Hz,其他模型支持任意采样率。 vocabulary_id string (可选) 预编译热词列表 ID。 需预先调用创建热词列表接口生成,识别时传入该 ID 即可使用列表中的热词。 适用于词汇已知且相对稳定、需要跨请求复用同一词表的场景。 使用方法请参见预编译热词。 vocabulary object (可选) 即时热词。 以键值对形式传入,键为热词文本(string),值为热词权重(integer),无需预先创建热词列表。权重取值范围为 [1, 5] 或 50:取 [1, 5] 时值越大模型越倾向输出该词;取 50 时为超级热词,召回率大幅提升,但超级热词数量最多不超过 50 个。 适用于临时性、会话级别的热词优化。 与预编译热词同时配置时,仅即时热词生效。使用方法请参见即时热词。
重要 仅qwen-audio-3.0-asr-flash-streaming支持即时热词。 language_hints array[string] (可选) 待识别音频语种。无默认值,不设置时模型自动识别。 对于 Qwen-Audio-3.0-ASR-Flash-Streaming 系列模型,最多支持设置 4 个值,即便设置超出 4 个,也仅前 4 个生效;对于 Fun-ASR-Realtime 系列模型,仅支持设置 1 个值,即便设置多个,也仅第一个生效。 点击查看支持的语言代码 qwen-audio-3.0-asr-flash-streaming、fun-asr-realtime、fun-asr-realtime-2025-11-07: zh: 中文 en: 英文 ja: 日语 ko:韩语 vi:越南语 th:泰语 id:印尼语 ms:马来语 tl:菲律宾语 hi:印地语 ar:阿拉伯语 fr:法语 de:德语 es:西班牙语 pt:葡萄牙语 ru:俄语 it:意大利语 nl:荷兰语 sv:瑞典语 da:丹麦语 fi:芬兰语 no:挪威语 el:希腊语 pl:波兰语 cs:捷克语 hu:匈牙利语 ro:罗马尼亚语 bg:保加利亚语 hr:克罗地亚语 sk:斯洛伐克语
fun-asr-realtime-2026-02-28: fun-asr-realtime-2025-09-15: fun-asr-flash-8k-realtime、fun-asr-flash-8k-realtime-2026-01-28:
semantic_punctuation_enabled boolean (可选) 是否启用语义断句。 默认值:false。 语义断句准确性更高,适合会议转写场景;VAD(Voice Activity Detection,语音活动检测)断句延迟较低,适合交互场景。 max_sentence_silence integer (可选)
重要 仅在semantic_punctuation_enabled参数为false时生效。 VAD 断句静音阈值(ms)。当一段语音后的静音时长超过该阈值时,系统会判定该句子已结束。 默认值:1300。 取值范围:[200, 6000]。 multi_threshold_mode_enabled boolean (可选)
重要 仅在semantic_punctuation_enabled参数为false时生效。 是否启用多阈值模式。启用后可防止 VAD 断句切割过长。 默认值:false。 heartbeat boolean (可选) 是否启用心跳包。 默认值:false。 静音音频指的是在音频文件或数据流中没有声音信号的内容。静音音频可以通过多种方法生成,例如使用音频编辑软件如Audacity或Adobe Audition,或者通过命令行工具如FFmpeg。 speech_noise_threshold float (可选) 语音与噪音的判定阈值,用于调整语音活动检测(VAD)的灵敏度。 取值范围:[-1.0, 1.0]。 取值说明: 此参数为高级配置参数,调整可能显著影响识别效果,建议: 调整前充分测试验证效果 根据实际音频环境小幅度调整(建议步长 0.1)
special_word_filter string (可选) 指定在语音识别过程中需要处理的敏感词,并支持对不同敏感词设置不同的处理方式。详情请参见敏感词过滤。 |