接口说明

更新时间:
复制 MD 格式

录音文件识别极速版通过 HTTPS POST 请求上传音频或提交音频文件链接,并同步返回识别结果,适用于音视频字幕、准实时质检等对识别时效性要求较高的场景。一般来说,30 分钟的音频可在 10 秒内完成识别。

前提条件

已获取项目 Appkey 和 NLS Token,分别参见创建项目和获取Token。

计费和并发限制

录音文件识别极速版仅提供商用版,不支持试用。使用前需开通商用版。计费与开通方式请参见计费概述和付费方式;并发限制请参见并发说明。

功能与使用限制

  • 支持 MP4、AAC、MP3、OPUS、WAV 格式。音频实际编码需与 format 参数一致,否则可能识别失败或返回空结果。

  • 文件大小不超过 100 MB,时长不超过 2 小时。超过 2 小时的音频请使用录音文件识别普通版。

  • 支持 8000(电话)和 16000(非电话)采样率模型。服务端根据 sample_rate 对音频自动升采样或降采样。

  • 支持中文数字转阿拉伯数字、词级别结果、时间戳校准,以及仅识别首个声道。

  • 支持在控制台为项目配置热词和定制语言模型。

语种和方言模型需在控制台为项目配置,不能通过请求参数指定。配置方法请参见管理项目。完整支持范围请参见本文的语种和方言。

代码示例

示例从环境变量 NLS_APP_KEY 和 NLS_TOKEN 读取凭证。设置为已获取的 Appkey 和有效 NLS Token,不要将凭证或包含 Token 的完整请求 URL 写入日志。示例使用 16 kHz WAV 音频,可使用示例音频。使用其他音频时,调整 format、sample_rate 及项目模型。

cURL

上传本地音频文件,audio_file 默认为 nls-sample-16k.wav。

: "${NLS_APP_KEY:?Set NLS_APP_KEY}"
: "${NLS_TOKEN:?Set NLS_TOKEN}"
audio_file="${1:-nls-sample-16k.wav}"
curl --silent --show-error --max-time 120 --request POST \
  "https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/FlashRecognizer?appkey=${NLS_APP_KEY}&token=${NLS_TOKEN}&format=wav&sample_rate=16000" \
  --header 'Content-Type: application/octet-stream' \
  --data-binary "@${audio_file}"

Java

使用 JDK 11 或更高版本,无需额外依赖。第一个程序参数为本地文件路径或音频 URL,必须提供。

import java.net.URI;
import java.net.URLEncoder;
import java.net.http.HttpClient;
import java.net.http.HttpRequest;
import java.net.http.HttpResponse;
import java.nio.charset.StandardCharsets;
import java.nio.file.Path;
import java.time.Duration;

public class FlashRecognizer {
    private static String requiredEnv(String name) {
        String value = System.getenv(name);
        if (value == null || value.isBlank()) {
            throw new IllegalArgumentException("Missing environment variable: " + name);
        }
        return value;
    }

    public static void main(String[] args) throws Exception {
        if (args.length != 1) {
            throw new IllegalArgumentException("Provide a local audio path or an HTTPS audio URL");
        }
        String query = "appkey=" + URLEncoder.encode(requiredEnv("NLS_APP_KEY"), StandardCharsets.UTF_8)
                + "&token=" + URLEncoder.encode(requiredEnv("NLS_TOKEN"), StandardCharsets.UTF_8)
                + "&format=wav&sample_rate=16000";
        boolean remote = args[0].startsWith("https://") || args[0].startsWith("http://");
        if (remote) {
            query += "&audio_address=" + URLEncoder.encode(args[0], StandardCharsets.UTF_8);
        }
        HttpRequest.BodyPublisher body = remote
                ? HttpRequest.BodyPublishers.noBody()
                : HttpRequest.BodyPublishers.ofFile(Path.of(args[0]));
        HttpRequest request = HttpRequest.newBuilder()
                .uri(URI.create("https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/FlashRecognizer?" + query))
                .timeout(Duration.ofSeconds(120))
                .header("Content-Type", remote ? "application/text" : "application/octet-stream")
                .POST(body).build();
        HttpClient client = HttpClient.newBuilder().connectTimeout(Duration.ofSeconds(10)).build();
        HttpResponse<String> response = client.send(request,
                HttpResponse.BodyHandlers.ofString(StandardCharsets.UTF_8));
        System.out.println("HTTP status: " + response.statusCode());
        System.out.println(response.body());
        // Check the JSON status field; recognized text is in flash_result.sentences.
    }
}

C++

使用 C++11 或更高版本及 libcurl。第一个程序参数为本地音频路径,必须提供。

#include <curl/curl.h>
#include <cstdlib>
#include <fstream>
#include <iostream>
#include <sstream>
#include <string>

size_t receive(char* data, size_t size, size_t count, void* output) {
    const size_t bytes = size * count;
    static_cast<std::string*>(output)->append(data, bytes);
    return bytes;
}

int main(int argc, char** argv) {
    const char* appkey = std::getenv("NLS_APP_KEY");
    const char* token = std::getenv("NLS_TOKEN");
    if (!appkey || !token || argc != 2) {
        std::cerr << "Set NLS_APP_KEY and NLS_TOKEN; provide a local WAV path\n";
        return 1;
    }
    std::ifstream file(argv[1], std::ios::binary);
    if (!file) return 1;
    std::ostringstream buffer;
    buffer << file.rdbuf();
    const std::string audio = buffer.str();
    if (curl_global_init(CURL_GLOBAL_DEFAULT) != CURLE_OK) return 1;
    CURL* client = curl_easy_init();
    if (!client) { curl_global_cleanup(); return 1; }
    char* encodedKey = curl_easy_escape(client, appkey, 0);
    char* encodedToken = curl_easy_escape(client, token, 0);
    if (!encodedKey || !encodedToken) {
        curl_free(encodedKey); curl_free(encodedToken);
        curl_easy_cleanup(client); curl_global_cleanup(); return 1;
    }
    std::string url = "https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/FlashRecognizer?appkey=";
    url += std::string(encodedKey) + "&token=" + encodedToken + "&format=wav&sample_rate=16000";
    curl_free(encodedKey); curl_free(encodedToken);
    curl_slist* headers = curl_slist_append(nullptr, "Content-Type: application/octet-stream");
    std::string response;
    curl_easy_setopt(client, CURLOPT_URL, url.c_str());
    curl_easy_setopt(client, CURLOPT_POST, 1L);
    curl_easy_setopt(client, CURLOPT_HTTPHEADER, headers);
    curl_easy_setopt(client, CURLOPT_POSTFIELDS, audio.data());
    curl_easy_setopt(client, CURLOPT_POSTFIELDSIZE_LARGE, static_cast<curl_off_t>(audio.size()));
    curl_easy_setopt(client, CURLOPT_CONNECTTIMEOUT, 10L);
    curl_easy_setopt(client, CURLOPT_TIMEOUT, 120L);
    curl_easy_setopt(client, CURLOPT_WRITEFUNCTION, receive);
    curl_easy_setopt(client, CURLOPT_WRITEDATA, &response);
    CURLcode result = curl_easy_perform(client);
    long status = 0;
    curl_easy_getinfo(client, CURLINFO_RESPONSE_CODE, &status);
    curl_slist_free_all(headers);
    curl_easy_cleanup(client);
    curl_global_cleanup();
    if (result != CURLE_OK) {
        std::cerr << curl_easy_strerror(result) << '\n'; return 1;
    }
    std::cout << "HTTP status: " << status << '\n' << response << '\n';
    // Check the JSON status field; recognized text is in flash_result.sentences.
    return status >= 200 && status < 300 ? 0 : 1;
}

预编译库和示例工程

C++示例使用第三方函数库curl处理HTTPS请求和响应,下载curl库和示例文件。

目录说明如下:

文件/文件夹

说明

CMakeLists.txt

示例工程的CMakeList文件。

demo

其中的restfulFlashRecognizerDemo.cpp是极速版RESTful API示例。

include

其中curl文件夹是curl库头文件目录。

lib

包含curl动态库,版本为curl-7.60。根据平台不同选如下版本:

  • Linux:Glibc 2.5、Gcc 4/Gcc 5。

  • Windows:VS2013、VS2015。

readme.txt

说明。

release.log

更新记录。

version

版本号。

build.sh

示例编译脚本。

编译运行操作步骤:

假设示例文件已解压至path/to路径下,在Linux终端依次执行如下命令编译运行程序。

  • 支持Cmake:

    1. 确认本地系统已安装Cmake 2.4及以上版本。

    2. 切换目录:cd path/to/sdk/lib。

    3. 解压缩文件:tar -zxvpf linux.tar.gz。

    4. 切换目录:cd path/to/sdk。

    5. 执行编译脚本:./build.sh。

    6. 切换目录:cd path/to/sdk/demo。

    7. 执行示例程序:./restfulFlashRecognizerDemo <your-token> <your-appkey>。

  • 不支持Cmake:

    1. 切换目录:cd path/to/sdk/lib。

    2. 解压缩文件:tar -zxvpf linux.tar.gz。

    3. 切换目录:cd path/to/sdk/demo。

    4. 使用g++编译命令编译示例程序:g++ -o restfulFlashRecognizerDemo restfulFlashRecognizerDemo.cpp -I path/to/sdk/include -L path/to/sdk/lib/linux -lssl -lcrypto -lcurl -D_GLIBCXX_USE_CXX11_ABI=0。

    5. 指定库路径:export LD_LIBRARY_PATH=path/to/sdk/lib/linux/。

    6. 执行示例程序:./restfulFlashRecognizerDemo <your-token> <your-appkey>。

Python

使用 Python 3 标准库,无需额外依赖。第一个程序参数为本地文件路径或音频 URL,默认读取 nls-sample-16k.wav。

import json
import os
import sys
import urllib.error
import urllib.parse
import urllib.request

audio_file = sys.argv[1] if len(sys.argv) > 1 else "nls-sample-16k.wav"
params = {
    "appkey": os.environ["NLS_APP_KEY"],
    "token": os.environ["NLS_TOKEN"],
    "format": "wav",
    "sample_rate": 16000,
}
if audio_file.startswith(("https://", "http://")):
    params["audio_address"] = audio_file
    audio = b""
    content_type = "application/text"
else:
    with open(audio_file, "rb") as source:
        audio = source.read()
    content_type = "application/octet-stream"
url = "https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/FlashRecognizer?"
request = urllib.request.Request(
    url + urllib.parse.urlencode(params), data=audio,
    headers={"Content-Type": content_type}, method="POST",
)
try:
    with urllib.request.urlopen(request, timeout=120) as response:
        result = json.load(response)
except urllib.error.HTTPError as error:
    with error:
        result = json.load(error)
print("task_id:", result.get("task_id"))
if result.get("status") != 20000000:
    raise RuntimeError("Recognition failed: " + str(result.get("status")))
for sentence in result["flash_result"]["sentences"]:
    print(sentence["channel_id"], sentence["text"])

PHP

使用 PHP 7.3 或更高版本,并启用 cURL 扩展。第一个程序参数为本地文件路径或音频 URL,默认读取 nls-sample-16k.wav。

<?php
$appkey = getenv('NLS_APP_KEY');
$token = getenv('NLS_TOKEN');
if (!$appkey || !$token) {
    throw new RuntimeException('Set NLS_APP_KEY and NLS_TOKEN');
}
$source = $argv[1] ?? 'nls-sample-16k.wav';
$params = ['appkey' => $appkey, 'token' => $token, 'format' => 'wav', 'sample_rate' => 16000];
$remote = preg_match('/^https?:\/\//', $source) === 1;
if ($remote) {
    $params['audio_address'] = $source;
    $body = '';
} else {
    $body = file_get_contents($source);
    if ($body === false) {
        throw new RuntimeException('Cannot read audio file');
    }
}
$url = 'https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/FlashRecognizer?'
    . http_build_query($params, '', '&', PHP_QUERY_RFC3986);
$curl = curl_init($url);
curl_setopt_array($curl, [
    CURLOPT_POST => true,
    CURLOPT_POSTFIELDS => $body,
    CURLOPT_RETURNTRANSFER => true,
    CURLOPT_CONNECTTIMEOUT => 10,
    CURLOPT_TIMEOUT => 120,
    CURLOPT_HTTPHEADER => ['Content-Type: ' . ($remote ? 'application/text' : 'application/octet-stream')],
]);
$response = curl_exec($curl);
if ($response === false) {
    $error = curl_error($curl);
    if (PHP_VERSION_ID < 80000) { curl_close($curl); }
    throw new RuntimeException($error);
}
if (PHP_VERSION_ID < 80000) { curl_close($curl); }
$result = json_decode($response, true, 512, JSON_THROW_ON_ERROR);
echo 'task_id: ' . ($result['task_id'] ?? '') . PHP_EOL;
if (($result['status'] ?? null) !== 20000000) {
    throw new RuntimeException('Recognition failed: ' . ($result['status'] ?? 'unknown'));
}
foreach ($result['flash_result']['sentences'] as $sentence) {
    echo $sentence['channel_id'] . ': ' . $sentence['text'] . PHP_EOL;
}

cURL、Java 和 C++ 示例输出完整 JSON 响应。解析时先检查 status 是否为 20000000,再读取 flash_result.sentences 中各句的 text。Python 和 PHP 示例已包含该处理。

交互流程

客户端发送 POST 请求:上传音频二进制数据,或通过 audio_address 提交音频文件链接。服务端同步返回 JSON 识别结果。响应体中的 task_id 标识本次任务,可用于排查问题。

image

服务地址

地域

公网 URL

VPC 内网 URL

上海

https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/FlashRecognizer

http://nls-gateway-cn-shanghai-internal.aliyuncs.com/stream/v1/FlashRecognizer

北京

https://nls-gateway-cn-beijing.aliyuncs.com/stream/v1/FlashRecognizer

http://nls-gateway-cn-beijing-internal.aliyuncs.com/stream/v1/FlashRecognizer

深圳

https://nls-gateway-cn-shenzhen.aliyuncs.com/stream/v1/FlashRecognizer

http://nls-gateway-cn-shenzhen-internal.aliyuncs.com/stream/v1/FlashRecognizer

公网地址适用于具有公网访问能力的服务器。使用内网地址时,ECS 实例需位于对应地域的专有网络(VPC)中;经典网络不支持内网访问。内网访问不产生 ECS 公网流量费用。

示例使用上海公网地址。通过内网访问时,改用对应地域的 HTTP 地址;Host 为所选 URL 的域名,通常由 HTTP 客户端自动设置。

请求说明

请求方法为 POST,路径为 /stream/v1/FlashRecognizer。参数均放在 URL 查询字符串中,参数值需进行 URL 编码。两种输入方式共用下表中的参数。

上传二进制音频流

将音频原始二进制数据放入请求体,Content-Type 设置为 application/octet-stream。Content-Length 为音频数据的字节数,可由 HTTP 客户端根据请求体设置。

使用音频文件链接

将音频文件 URL 经 URL 编码后放入 audio_address 查询参数,Content-Type 设置为 application/text,请求体为空。音频 URL 必须可由服务端访问;使用有有效期的链接时,需确保识别期间链接仍有效。

请求参数

参数

类型

必填

说明

appkey

String

是

项目 Appkey。

token

String

是

用于鉴权的 NLS Token。

format

String

是

音频编码格式:MP4、AAC、MP3、OPUS、WAV。

audio_address

String

按输入方式

使用音频文件链接时必填,值为音频文件 URL。上传二进制音频时不填写。

sample_rate

Integer

否

模型采样率。8000(电话)或 16000(非电话),默认 16000。音频会自动升采样或降采样至此值。

vocabulary_id

String

否

热词表 ID。默认不添加。

customization_id

String

否

定制语言模型 ID。默认不添加。

enable_inverse_text_normalization

Boolean

否

是否将中文数字转换为阿拉伯数字。默认 false。

enable_word_level_result

Boolean

否

是否返回词级别结果。默认 false。

enable_timestamp_alignment

Boolean

否

是否启用时间戳校准。默认 false。

first_channel_only

Boolean

否

是否只识别首个声道。不设置时,8 kHz 模型处理双声道,16 kHz 模型仅处理首个声道;false:两种模型均处理双声道;true:两种模型均只处理首个声道。多声道按处理的声道叠加计费,例如处理双声道为双倍计费。

speech_noise_threshold

Float

否

噪音阈值,范围 [-1, 1]。越接近 -1,噪音越可能被识别为语音;越接近 1,语音越可能被判为噪音。此参数为高级参数,调整后需重点检查识别效果。

special_word_filter

String

否

JSON 格式的敏感词过滤配置。默认不处理。支持删除指定词语或将其替换为星号。详见下文。

sentence_max_length

Integer

否

每句最多展示字数,范围 [4, 50],默认不启用。启用后如不填写字数,则按照长句断句。适用于控制单行字幕字数。

自定义过滤词

将以下 JSON 序列化为字符串,经 URL 编码后赋给 special_word_filter 查询参数。filter_with_empty 删除匹配的词语,filter_with_signed 将匹配的词语替换为星号。两项可单独配置。

{
  "filter_with_empty": {
    "word_list": [
      "北京"
    ]
  },
  "filter_with_signed": {
    "word_list": [
      "天气"
    ]
  }
}

此示例过滤中文词语“北京”和“天气”。开启过滤但未配置自定义词语时,使用默认敏感词表。

响应说明

成功时,响应体中的 status 为 20000000,message 为 SUCCESS。识别文本位于 flash_result.sentences[].text,不要从 result 字段读取。以下示例对应前文的中文音频。

{
  "task_id": "0123456789abcdef0123456789abcdef",
  "result": "",
  "status": 20000000,
  "message": "SUCCESS",
  "flash_result": {
    "duration": 3101,
    "completed": true,
    "sentences": [
      {
        "text": "北京的天气。",
        "begin_time": 880,
        "end_time": 3080,
        "channel_id": 0
      }
    ],
    "latency": 695
  }
}

字段

类型

说明

task_id

String

32 位任务 ID,用于排查问题。

status

Integer

服务状态码,20000000 表示成功。

message

String

服务状态描述。

result

String

本接口不通过此字段返回识别文本。

flash_result

Object

识别结果,字段见下表。

flash_result 字段

字段

类型

说明

duration

Integer

处理的音频时长,单位为毫秒。识别多个声道时按处理声道累计,不一定等于源文件的播放时长。

latency

Integer

服务端处理时长,单位为毫秒。

completed

Boolean

任务是否完成。

sentences

Array

句子结果列表。

sentences.text

String

句子级别识别文本。

sentences.begin_time

Integer

句子开始时间,单位为毫秒。

sentences.end_time

Integer

句子结束时间,单位为毫秒。

sentences.channel_id

Integer

声道编号,从 0 开始。

sentences.words

Array

开启词级别结果时返回的词列表。

sentences.words.text

String

词文本。

sentences.words.punc

String

词尾标点,无标点时为空字符串。

sentences.words.begin_time

String

词开始时间,单位为毫秒,以字符串返回。

sentences.words.end_time

String

词结束时间,单位为毫秒,以字符串返回。

失败时,根据响应体的 status 和 message 定位原因。例如,Token 无效时可返回 40000001。状态码及处理方法请参见错误码。

语种和方言

下表列出各模型的支持情况。ITN 表示逆文本归一化,顺滑表示去除口语中的不流畅内容。

语种

语言

模型名称

采样率

标点

ITN

顺滑

语义断句

声音和文本对齐

英语

通用-英文,教育直播-英文,教育内容分析-英文

16k

支持

支持

支持

不支持

支持

电话客服(通用)

8k

支持

支持

支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

日语

通用-日语

16k

支持

支持

不支持

不支持

支持

西班牙语

通用-西班牙语

16k

支持

支持

不支持

不支持

不支持

通用-西班牙客服通用

8k

支持

支持

不支持

不支持

不支持

阿拉伯语

通用-阿拉伯语

16k

支持

不支持

不支持

不支持

不支持

哈萨克语

通用-哈萨克语

16k

支持

不支持

不支持

不支持

不支持

韩语

通用-韩语

16k

支持

支持

不支持

不支持

不支持

泰语

通用-泰语

16k

不支持

不支持

不支持

不支持

不支持

通用-泰语客服通用

8k

不支持

不支持

不支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

印尼语

通用-印尼语

16k

支持

支持

不支持

不支持

不支持

电话客服(通用)

8k

支持

支持

不支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

俄语

通用-俄语

16k

支持

支持

不支持

不支持

不支持

越南语

通用-越南语

16k

支持

支持

不支持

不支持

不支持

通用-越南语客服通用

8k

支持

支持

不支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

法语

通用-法语

16k

支持

支持

不支持

不支持

不支持

德语

通用-德语

16k

支持

支持

不支持

不支持

不支持

意大利语

通用-意大利语

16k

支持

不支持

不支持

不支持

不支持

印地语

通用-印地语

16k

支持

不支持

不支持

不支持

不支持

马来语

通用-马来语

16k

支持

不支持

不支持

不支持

不支持

通用-马来语客服通用

8k

支持

不支持

不支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

菲律宾语

通用-菲律宾语

16k

支持

支持

不支持

不支持

不支持

电话客服(通用)

8k

支持

支持

不支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

泰米尔语

通用-泰米尔语

16k

支持

不支持

不支持

不支持

不支持

葡萄牙语

通用-葡萄牙语

16k

支持

支持

不支持

不支持

不支持

土耳其语

通用-土耳其语

16k

支持

不支持

不支持

不支持

不支持

波兰语

通用-波兰语

16k

支持

不支持

不支持

不支持

不支持

乌克兰语

通用-乌克兰语

16k

支持

不支持

不支持

不支持

不支持

罗马尼亚语

通用-罗马尼亚语

16k

支持

不支持

不支持

不支持

不支持

荷兰语

通用-荷兰语

16k

支持

不支持

不支持

不支持

不支持

希腊语

通用-希腊语

16k

支持

不支持

不支持

不支持

不支持

匈牙利语

通用-匈牙利语

16k

支持

不支持

不支持

不支持

不支持

爪哇语

通用-爪哇语

16k

支持

不支持

不支持

不支持

不支持

孟加拉语

通用-孟加拉语

16k

支持

不支持

不支持

不支持

不支持

缅甸语

通用-缅甸语

16k

支持

不支持

不支持

不支持

不支持

老挝语

通用-老挝语

16k

支持

不支持

不支持

不支持

不支持

斯瓦希里语

通用-斯瓦希里语

16k

支持

不支持

不支持

不支持

不支持

阿塞拜疆语

通用-阿塞拜疆语

16k

支持

不支持

不支持

不支持

不支持

波斯语

通用-波斯语

16k

支持

不支持

不支持

不支持

不支持

僧伽罗语

通用-僧伽罗语

16k

支持

不支持

不支持

不支持

不支持

加泰罗尼亚语

通用-加泰罗尼亚语

16k

支持

不支持

不支持

不支持

不支持

高棉语

通用-高棉语

16k

支持

不支持

不支持

不支持

不支持

希伯来语

通用-希伯来语

16k

支持

不支持

不支持

不支持

不支持

克罗地亚语

通用-克罗地亚语

16k

支持

不支持

不支持

不支持

不支持

豪萨语

通用-豪萨语

16k

支持

不支持

不支持

不支持

不支持

马拉地语

通用-马拉地语

16k

支持

不支持

不支持

不支持

不支持

泰卢固语

通用-泰卢固语

16k

支持

不支持

不支持

不支持

不支持

旁遮普语

通用-旁遮普语

16k

支持

不支持

不支持

不支持

不支持

瑞典语

通用-瑞典语

16k

支持

不支持

不支持

不支持

不支持

保加利亚语

通用-保加利亚语

16k

支持

不支持

不支持

不支持

不支持

丹麦语

通用-丹麦语

16k

支持

不支持

不支持

不支持

不支持

挪威语

通用-挪威语

16k

支持

不支持

不支持

不支持

不支持

坎纳达语

通用-坎纳达语

16k

支持

不支持

不支持

不支持

不支持

马拉雅拉姆语

通用-马拉雅拉姆语

16k

支持

不支持

不支持

不支持

不支持

捷克语

通用-捷克语

16k

支持

不支持

不支持

不支持

不支持

乌尔都语

通用-乌尔都语

16k

支持

不支持

不支持

不支持

不支持

尼泊尔语

通用-尼泊尔语

16k

支持

不支持

不支持

不支持

不支持

蒙古语(外蒙)

通用-蒙古语(外蒙)

16k

支持

不支持

不支持

不支持

不支持

乌兹别克语

通用-乌兹别克语

16k

支持

不支持

不支持

不支持

不支持

方言

语言

模型名称

采样率

标点

ITN

顺滑

语义断句

声音和文本对齐

粤语

通用-粤语

16k

支持

支持

支持

不支持

支持

电话客服(通用)

8k

支持

支持

支持

不支持

支持

粤中自由说

8k

支持

支持

支持

不支持

不支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

粤语(繁体)

通用-粤语(繁体)

8k

支持

不支持

不支持

不支持

不支持

通用-粤语(繁体)

16k

支持

不支持

不支持

不支持

不支持

四川话

通用-四川话

16k

支持

支持

支持

支持

支持

电话客服(通用)

8k

支持

支持

支持

支持

支持

湖北话

通用-湖北话

16k

支持

支持

支持

支持

支持

通用-湖北话

8k

支持

支持

支持

支持

支持

上海话

通用-上海话

16k

支持

支持

支持

支持

不支持

湖南话

通用-湖南话

16k

支持

支持

支持

支持

支持

河南话

通用-河南话

16k

支持

支持

支持

支持

支持

通用-河南话

8k

支持

支持

支持

支持

支持

浙江话

通用-浙江话

16k

支持

支持

支持

支持

不支持

东北话

通用-东北话

16k

支持

支持

支持

支持

支持

山东话

通用-山东话

16k

支持

支持

支持

支持

支持

天津话

通用-天津话

16k

支持

支持

支持

支持

支持

陕西话

通用-陕西话

16k

支持

支持

支持

支持

支持

山西话

通用-山西话

16k

支持

支持

支持

支持

支持

贵州话

通用-贵州话

16k

支持

支持

支持

支持

支持

云南话

通用-云南话

16k

支持

支持

支持

支持

支持

甘肃话

通用-甘肃话

16k

支持

支持

支持

支持

支持

苏州话

通用-苏州话

16k

支持

支持

支持

支持

不支持

闽南语

通用-闽南语

16k

支持

支持

支持

支持

不支持

江西话

通用-江西话

16k

支持

支持

支持

支持

支持

宁夏话

通用-宁夏话

16k

支持

支持

支持

支持

支持

广西话

通用-广西话

16k

支持

支持

支持

支持

支持

通用-广西话

8k

支持

支持

支持

支持

支持

中文普通话

识音石 V1 - 端到端模型,教育内容分析,医疗内容分析,新闻媒体内容分析,娱乐视频内容分析,音视频离线转写(升级版),新零售领域识别模型,出行领域识别模型,汽车领域

16k

支持

支持

支持

支持

支持

中英自由说

16k

支持

支持

支持

支持

不支持

识音石 V1 - 端到端模型

8k

支持

支持

支持

支持

支持

东南亚多语言

16k

支持

不支持

不支持

不支持

不支持

错误码

通用错误码、录音文件识别极速版错误码及处理方法,请参见错误码。