录音文件识别极速版通过 HTTPS POST 请求上传音频或提交音频文件链接,并同步返回识别结果,适用于音视频字幕、准实时质检等对识别时效性要求较高的场景。一般来说,30 分钟的音频可在 10 秒内完成识别。
前提条件
计费和并发限制
录音文件识别极速版仅提供商用版,不支持试用。使用前需开通商用版。计费与开通方式请参见计费概述和付费方式;并发限制请参见并发说明。
功能与使用限制
支持 MP4、AAC、MP3、OPUS、WAV 格式。音频实际编码需与
format参数一致,否则可能识别失败或返回空结果。文件大小不超过 100 MB,时长不超过 2 小时。超过 2 小时的音频请使用录音文件识别普通版。
支持 8000(电话)和 16000(非电话)采样率模型。服务端根据
sample_rate对音频自动升采样或降采样。支持中文数字转阿拉伯数字、词级别结果、时间戳校准,以及仅识别首个声道。
支持在控制台为项目配置热词和定制语言模型。
代码示例
示例从环境变量 NLS_APP_KEY 和 NLS_TOKEN 读取凭证。设置为已获取的 Appkey 和有效 NLS Token,不要将凭证或包含 Token 的完整请求 URL 写入日志。示例使用 16 kHz WAV 音频,可使用示例音频。使用其他音频时,调整 format、sample_rate 及项目模型。
cURL
上传本地音频文件,audio_file 默认为 nls-sample-16k.wav。
: "${NLS_APP_KEY:?Set NLS_APP_KEY}"
: "${NLS_TOKEN:?Set NLS_TOKEN}"
audio_file="${1:-nls-sample-16k.wav}"
curl --silent --show-error --max-time 120 --request POST \
"https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/FlashRecognizer?appkey=${NLS_APP_KEY}&token=${NLS_TOKEN}&format=wav&sample_rate=16000" \
--header 'Content-Type: application/octet-stream' \
--data-binary "@${audio_file}"
Java
使用 JDK 11 或更高版本,无需额外依赖。第一个程序参数为本地文件路径或音频 URL,必须提供。
import java.net.URI;
import java.net.URLEncoder;
import java.net.http.HttpClient;
import java.net.http.HttpRequest;
import java.net.http.HttpResponse;
import java.nio.charset.StandardCharsets;
import java.nio.file.Path;
import java.time.Duration;
public class FlashRecognizer {
private static String requiredEnv(String name) {
String value = System.getenv(name);
if (value == null || value.isBlank()) {
throw new IllegalArgumentException("Missing environment variable: " + name);
}
return value;
}
public static void main(String[] args) throws Exception {
if (args.length != 1) {
throw new IllegalArgumentException("Provide a local audio path or an HTTPS audio URL");
}
String query = "appkey=" + URLEncoder.encode(requiredEnv("NLS_APP_KEY"), StandardCharsets.UTF_8)
+ "&token=" + URLEncoder.encode(requiredEnv("NLS_TOKEN"), StandardCharsets.UTF_8)
+ "&format=wav&sample_rate=16000";
boolean remote = args[0].startsWith("https://") || args[0].startsWith("http://");
if (remote) {
query += "&audio_address=" + URLEncoder.encode(args[0], StandardCharsets.UTF_8);
}
HttpRequest.BodyPublisher body = remote
? HttpRequest.BodyPublishers.noBody()
: HttpRequest.BodyPublishers.ofFile(Path.of(args[0]));
HttpRequest request = HttpRequest.newBuilder()
.uri(URI.create("https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/FlashRecognizer?" + query))
.timeout(Duration.ofSeconds(120))
.header("Content-Type", remote ? "application/text" : "application/octet-stream")
.POST(body).build();
HttpClient client = HttpClient.newBuilder().connectTimeout(Duration.ofSeconds(10)).build();
HttpResponse<String> response = client.send(request,
HttpResponse.BodyHandlers.ofString(StandardCharsets.UTF_8));
System.out.println("HTTP status: " + response.statusCode());
System.out.println(response.body());
// Check the JSON status field; recognized text is in flash_result.sentences.
}
}
C++
使用 C++11 或更高版本及 libcurl。第一个程序参数为本地音频路径,必须提供。
#include <curl/curl.h>
#include <cstdlib>
#include <fstream>
#include <iostream>
#include <sstream>
#include <string>
size_t receive(char* data, size_t size, size_t count, void* output) {
const size_t bytes = size * count;
static_cast<std::string*>(output)->append(data, bytes);
return bytes;
}
int main(int argc, char** argv) {
const char* appkey = std::getenv("NLS_APP_KEY");
const char* token = std::getenv("NLS_TOKEN");
if (!appkey || !token || argc != 2) {
std::cerr << "Set NLS_APP_KEY and NLS_TOKEN; provide a local WAV path\n";
return 1;
}
std::ifstream file(argv[1], std::ios::binary);
if (!file) return 1;
std::ostringstream buffer;
buffer << file.rdbuf();
const std::string audio = buffer.str();
if (curl_global_init(CURL_GLOBAL_DEFAULT) != CURLE_OK) return 1;
CURL* client = curl_easy_init();
if (!client) { curl_global_cleanup(); return 1; }
char* encodedKey = curl_easy_escape(client, appkey, 0);
char* encodedToken = curl_easy_escape(client, token, 0);
if (!encodedKey || !encodedToken) {
curl_free(encodedKey); curl_free(encodedToken);
curl_easy_cleanup(client); curl_global_cleanup(); return 1;
}
std::string url = "https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/FlashRecognizer?appkey=";
url += std::string(encodedKey) + "&token=" + encodedToken + "&format=wav&sample_rate=16000";
curl_free(encodedKey); curl_free(encodedToken);
curl_slist* headers = curl_slist_append(nullptr, "Content-Type: application/octet-stream");
std::string response;
curl_easy_setopt(client, CURLOPT_URL, url.c_str());
curl_easy_setopt(client, CURLOPT_POST, 1L);
curl_easy_setopt(client, CURLOPT_HTTPHEADER, headers);
curl_easy_setopt(client, CURLOPT_POSTFIELDS, audio.data());
curl_easy_setopt(client, CURLOPT_POSTFIELDSIZE_LARGE, static_cast<curl_off_t>(audio.size()));
curl_easy_setopt(client, CURLOPT_CONNECTTIMEOUT, 10L);
curl_easy_setopt(client, CURLOPT_TIMEOUT, 120L);
curl_easy_setopt(client, CURLOPT_WRITEFUNCTION, receive);
curl_easy_setopt(client, CURLOPT_WRITEDATA, &response);
CURLcode result = curl_easy_perform(client);
long status = 0;
curl_easy_getinfo(client, CURLINFO_RESPONSE_CODE, &status);
curl_slist_free_all(headers);
curl_easy_cleanup(client);
curl_global_cleanup();
if (result != CURLE_OK) {
std::cerr << curl_easy_strerror(result) << '\n'; return 1;
}
std::cout << "HTTP status: " << status << '\n' << response << '\n';
// Check the JSON status field; recognized text is in flash_result.sentences.
return status >= 200 && status < 300 ? 0 : 1;
}
预编译库和示例工程
C++示例使用第三方函数库curl处理HTTPS请求和响应,下载curl库和示例文件。
目录说明如下:
文件/文件夹 | 说明 |
CMakeLists.txt | 示例工程的CMakeList文件。 |
demo | 其中的restfulFlashRecognizerDemo.cpp是极速版RESTful API示例。 |
include | 其中curl文件夹是curl库头文件目录。 |
lib | 包含curl动态库,版本为curl-7.60。根据平台不同选如下版本:
|
readme.txt | 说明。 |
release.log | 更新记录。 |
version | 版本号。 |
build.sh | 示例编译脚本。 |
编译运行操作步骤:
假设示例文件已解压至path/to路径下,在Linux终端依次执行如下命令编译运行程序。
-
支持Cmake:
确认本地系统已安装Cmake 2.4及以上版本。
切换目录:
cd path/to/sdk/lib。解压缩文件:
tar -zxvpf linux.tar.gz。切换目录:
cd path/to/sdk。执行编译脚本:
./build.sh。切换目录:
cd path/to/sdk/demo。执行示例程序:
./restfulFlashRecognizerDemo <your-token> <your-appkey>。
-
不支持Cmake:
切换目录:
cd path/to/sdk/lib。解压缩文件:
tar -zxvpf linux.tar.gz。切换目录:
cd path/to/sdk/demo。使用g++编译命令编译示例程序:
g++ -o restfulFlashRecognizerDemo restfulFlashRecognizerDemo.cpp -I path/to/sdk/include -L path/to/sdk/lib/linux -lssl -lcrypto -lcurl -D_GLIBCXX_USE_CXX11_ABI=0。指定库路径:
export LD_LIBRARY_PATH=path/to/sdk/lib/linux/。执行示例程序:
./restfulFlashRecognizerDemo <your-token> <your-appkey>。
Python
使用 Python 3 标准库,无需额外依赖。第一个程序参数为本地文件路径或音频 URL,默认读取 nls-sample-16k.wav。
import json
import os
import sys
import urllib.error
import urllib.parse
import urllib.request
audio_file = sys.argv[1] if len(sys.argv) > 1 else "nls-sample-16k.wav"
params = {
"appkey": os.environ["NLS_APP_KEY"],
"token": os.environ["NLS_TOKEN"],
"format": "wav",
"sample_rate": 16000,
}
if audio_file.startswith(("https://", "http://")):
params["audio_address"] = audio_file
audio = b""
content_type = "application/text"
else:
with open(audio_file, "rb") as source:
audio = source.read()
content_type = "application/octet-stream"
url = "https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/FlashRecognizer?"
request = urllib.request.Request(
url + urllib.parse.urlencode(params), data=audio,
headers={"Content-Type": content_type}, method="POST",
)
try:
with urllib.request.urlopen(request, timeout=120) as response:
result = json.load(response)
except urllib.error.HTTPError as error:
with error:
result = json.load(error)
print("task_id:", result.get("task_id"))
if result.get("status") != 20000000:
raise RuntimeError("Recognition failed: " + str(result.get("status")))
for sentence in result["flash_result"]["sentences"]:
print(sentence["channel_id"], sentence["text"])
PHP
使用 PHP 7.3 或更高版本,并启用 cURL 扩展。第一个程序参数为本地文件路径或音频 URL,默认读取 nls-sample-16k.wav。
<?php
$appkey = getenv('NLS_APP_KEY');
$token = getenv('NLS_TOKEN');
if (!$appkey || !$token) {
throw new RuntimeException('Set NLS_APP_KEY and NLS_TOKEN');
}
$source = $argv[1] ?? 'nls-sample-16k.wav';
$params = ['appkey' => $appkey, 'token' => $token, 'format' => 'wav', 'sample_rate' => 16000];
$remote = preg_match('/^https?:\/\//', $source) === 1;
if ($remote) {
$params['audio_address'] = $source;
$body = '';
} else {
$body = file_get_contents($source);
if ($body === false) {
throw new RuntimeException('Cannot read audio file');
}
}
$url = 'https://nls-gateway-cn-shanghai.aliyuncs.com/stream/v1/FlashRecognizer?'
. http_build_query($params, '', '&', PHP_QUERY_RFC3986);
$curl = curl_init($url);
curl_setopt_array($curl, [
CURLOPT_POST => true,
CURLOPT_POSTFIELDS => $body,
CURLOPT_RETURNTRANSFER => true,
CURLOPT_CONNECTTIMEOUT => 10,
CURLOPT_TIMEOUT => 120,
CURLOPT_HTTPHEADER => ['Content-Type: ' . ($remote ? 'application/text' : 'application/octet-stream')],
]);
$response = curl_exec($curl);
if ($response === false) {
$error = curl_error($curl);
if (PHP_VERSION_ID < 80000) { curl_close($curl); }
throw new RuntimeException($error);
}
if (PHP_VERSION_ID < 80000) { curl_close($curl); }
$result = json_decode($response, true, 512, JSON_THROW_ON_ERROR);
echo 'task_id: ' . ($result['task_id'] ?? '') . PHP_EOL;
if (($result['status'] ?? null) !== 20000000) {
throw new RuntimeException('Recognition failed: ' . ($result['status'] ?? 'unknown'));
}
foreach ($result['flash_result']['sentences'] as $sentence) {
echo $sentence['channel_id'] . ': ' . $sentence['text'] . PHP_EOL;
}
cURL、Java 和 C++ 示例输出完整 JSON 响应。解析时先检查 status 是否为 20000000,再读取 flash_result.sentences 中各句的 text。Python 和 PHP 示例已包含该处理。
交互流程
客户端发送 POST 请求:上传音频二进制数据,或通过 audio_address 提交音频文件链接。服务端同步返回 JSON 识别结果。响应体中的 task_id 标识本次任务,可用于排查问题。
服务地址
|
地域 |
公网 URL |
VPC 内网 URL |
|
上海 |
|
|
|
北京 |
|
|
|
深圳 |
|
|
公网地址适用于具有公网访问能力的服务器。使用内网地址时,ECS 实例需位于对应地域的专有网络(VPC)中;经典网络不支持内网访问。内网访问不产生 ECS 公网流量费用。
示例使用上海公网地址。通过内网访问时,改用对应地域的 HTTP 地址;Host 为所选 URL 的域名,通常由 HTTP 客户端自动设置。
请求说明
请求方法为 POST,路径为 /stream/v1/FlashRecognizer。参数均放在 URL 查询字符串中,参数值需进行 URL 编码。两种输入方式共用下表中的参数。
上传二进制音频流
将音频原始二进制数据放入请求体,Content-Type 设置为 application/octet-stream。Content-Length 为音频数据的字节数,可由 HTTP 客户端根据请求体设置。
使用音频文件链接
将音频文件 URL 经 URL 编码后放入 audio_address 查询参数,Content-Type 设置为 application/text,请求体为空。音频 URL 必须可由服务端访问;使用有有效期的链接时,需确保识别期间链接仍有效。
请求参数
|
参数 |
类型 |
必填 |
说明 |
|
appkey |
String |
是 |
项目 Appkey。 |
|
token |
String |
是 |
用于鉴权的 NLS Token。 |
|
format |
String |
是 |
音频编码格式:MP4、AAC、MP3、OPUS、WAV。 |
|
audio_address |
String |
按输入方式 |
使用音频文件链接时必填,值为音频文件 URL。上传二进制音频时不填写。 |
|
sample_rate |
Integer |
否 |
模型采样率。8000(电话)或 16000(非电话),默认 16000。音频会自动升采样或降采样至此值。 |
|
vocabulary_id |
String |
否 |
热词表 ID。默认不添加。 |
|
customization_id |
String |
否 |
定制语言模型 ID。默认不添加。 |
|
enable_inverse_text_normalization |
Boolean |
否 |
是否将中文数字转换为阿拉伯数字。默认 false。 |
|
enable_word_level_result |
Boolean |
否 |
是否返回词级别结果。默认 false。 |
|
enable_timestamp_alignment |
Boolean |
否 |
是否启用时间戳校准。默认 false。 |
|
first_channel_only |
Boolean |
否 |
是否只识别首个声道。不设置时,8 kHz 模型处理双声道,16 kHz 模型仅处理首个声道;false:两种模型均处理双声道;true:两种模型均只处理首个声道。多声道按处理的声道叠加计费,例如处理双声道为双倍计费。 |
|
speech_noise_threshold |
Float |
否 |
噪音阈值,范围 [-1, 1]。越接近 -1,噪音越可能被识别为语音;越接近 1,语音越可能被判为噪音。此参数为高级参数,调整后需重点检查识别效果。 |
|
special_word_filter |
String |
否 |
JSON 格式的敏感词过滤配置。默认不处理。支持删除指定词语或将其替换为星号。详见下文。 |
|
sentence_max_length |
Integer |
否 |
每句最多展示字数,范围 [4, 50],默认不启用。启用后如不填写字数,则按照长句断句。适用于控制单行字幕字数。 |
自定义过滤词
将以下 JSON 序列化为字符串,经 URL 编码后赋给 special_word_filter 查询参数。filter_with_empty 删除匹配的词语,filter_with_signed 将匹配的词语替换为星号。两项可单独配置。
{
"filter_with_empty": {
"word_list": [
"北京"
]
},
"filter_with_signed": {
"word_list": [
"天气"
]
}
}
此示例过滤中文词语“北京”和“天气”。开启过滤但未配置自定义词语时,使用默认敏感词表。
响应说明
成功时,响应体中的 status 为 20000000,message 为 SUCCESS。识别文本位于 flash_result.sentences[].text,不要从 result 字段读取。以下示例对应前文的中文音频。
{
"task_id": "0123456789abcdef0123456789abcdef",
"result": "",
"status": 20000000,
"message": "SUCCESS",
"flash_result": {
"duration": 3101,
"completed": true,
"sentences": [
{
"text": "北京的天气。",
"begin_time": 880,
"end_time": 3080,
"channel_id": 0
}
],
"latency": 695
}
}
|
字段 |
类型 |
说明 |
|
task_id |
String |
32 位任务 ID,用于排查问题。 |
|
status |
Integer |
服务状态码,20000000 表示成功。 |
|
message |
String |
服务状态描述。 |
|
result |
String |
本接口不通过此字段返回识别文本。 |
|
flash_result |
Object |
识别结果,字段见下表。 |
flash_result 字段
|
字段 |
类型 |
说明 |
|
duration |
Integer |
处理的音频时长,单位为毫秒。识别多个声道时按处理声道累计,不一定等于源文件的播放时长。 |
|
latency |
Integer |
服务端处理时长,单位为毫秒。 |
|
completed |
Boolean |
任务是否完成。 |
|
sentences |
Array |
句子结果列表。 |
|
sentences.text |
String |
句子级别识别文本。 |
|
sentences.begin_time |
Integer |
句子开始时间,单位为毫秒。 |
|
sentences.end_time |
Integer |
句子结束时间,单位为毫秒。 |
|
sentences.channel_id |
Integer |
声道编号,从 0 开始。 |
|
sentences.words |
Array |
开启词级别结果时返回的词列表。 |
|
sentences.words.text |
String |
词文本。 |
|
sentences.words.punc |
String |
词尾标点,无标点时为空字符串。 |
|
sentences.words.begin_time |
String |
词开始时间,单位为毫秒,以字符串返回。 |
|
sentences.words.end_time |
String |
词结束时间,单位为毫秒,以字符串返回。 |
失败时,根据响应体的 status 和 message 定位原因。例如,Token 无效时可返回 40000001。状态码及处理方法请参见错误码。
语种和方言
下表列出各模型的支持情况。ITN 表示逆文本归一化,顺滑表示去除口语中的不流畅内容。
语种
语言 | 模型名称 | 采样率 | 标点 | ITN | 顺滑 | 语义断句 | 声音和文本对齐 |
英语 | 通用-英文,教育直播-英文,教育内容分析-英文 | 16k | 支持 | 支持 | 支持 | 不支持 | 支持 |
电话客服(通用) | 8k | 支持 | 支持 | 支持 | 不支持 | 不支持 | |
东南亚多语言 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 | |
日语 | 通用-日语 | 16k | 支持 | 支持 | 不支持 | 不支持 | 支持 |
西班牙语 | 通用-西班牙语 | 16k | 支持 | 支持 | 不支持 | 不支持 | 不支持 |
通用-西班牙客服通用 | 8k | 支持 | 支持 | 不支持 | 不支持 | 不支持 | |
阿拉伯语 | 通用-阿拉伯语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
哈萨克语 | 通用-哈萨克语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
韩语 | 通用-韩语 | 16k | 支持 | 支持 | 不支持 | 不支持 | 不支持 |
泰语 | 通用-泰语 | 16k | 不支持 | 不支持 | 不支持 | 不支持 | 不支持 |
通用-泰语客服通用 | 8k | 不支持 | 不支持 | 不支持 | 不支持 | 不支持 | |
东南亚多语言 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 | |
印尼语 | 通用-印尼语 | 16k | 支持 | 支持 | 不支持 | 不支持 | 不支持 |
电话客服(通用) | 8k | 支持 | 支持 | 不支持 | 不支持 | 不支持 | |
东南亚多语言 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 | |
俄语 | 通用-俄语 | 16k | 支持 | 支持 | 不支持 | 不支持 | 不支持 |
越南语 | 通用-越南语 | 16k | 支持 | 支持 | 不支持 | 不支持 | 不支持 |
通用-越南语客服通用 | 8k | 支持 | 支持 | 不支持 | 不支持 | 不支持 | |
东南亚多语言 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 | |
法语 | 通用-法语 | 16k | 支持 | 支持 | 不支持 | 不支持 | 不支持 |
德语 | 通用-德语 | 16k | 支持 | 支持 | 不支持 | 不支持 | 不支持 |
意大利语 | 通用-意大利语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
印地语 | 通用-印地语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
马来语 | 通用-马来语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
通用-马来语客服通用 | 8k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 | |
东南亚多语言 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 | |
菲律宾语 | 通用-菲律宾语 | 16k | 支持 | 支持 | 不支持 | 不支持 | 不支持 |
电话客服(通用) | 8k | 支持 | 支持 | 不支持 | 不支持 | 不支持 | |
东南亚多语言 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 | |
泰米尔语 | 通用-泰米尔语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
葡萄牙语 | 通用-葡萄牙语 | 16k | 支持 | 支持 | 不支持 | 不支持 | 不支持 |
土耳其语 | 通用-土耳其语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
波兰语 | 通用-波兰语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
乌克兰语 | 通用-乌克兰语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
罗马尼亚语 | 通用-罗马尼亚语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
荷兰语 | 通用-荷兰语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
希腊语 | 通用-希腊语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
匈牙利语 | 通用-匈牙利语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
爪哇语 | 通用-爪哇语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
孟加拉语 | 通用-孟加拉语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
缅甸语 | 通用-缅甸语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
老挝语 | 通用-老挝语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
斯瓦希里语 | 通用-斯瓦希里语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
阿塞拜疆语 | 通用-阿塞拜疆语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
波斯语 | 通用-波斯语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
僧伽罗语 | 通用-僧伽罗语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
加泰罗尼亚语 | 通用-加泰罗尼亚语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
高棉语 | 通用-高棉语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
希伯来语 | 通用-希伯来语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
克罗地亚语 | 通用-克罗地亚语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
豪萨语 | 通用-豪萨语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
马拉地语 | 通用-马拉地语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
泰卢固语 | 通用-泰卢固语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
旁遮普语 | 通用-旁遮普语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
瑞典语 | 通用-瑞典语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
保加利亚语 | 通用-保加利亚语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
丹麦语 | 通用-丹麦语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
挪威语 | 通用-挪威语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
坎纳达语 | 通用-坎纳达语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
马拉雅拉姆语 | 通用-马拉雅拉姆语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
捷克语 | 通用-捷克语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
乌尔都语 | 通用-乌尔都语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
尼泊尔语 | 通用-尼泊尔语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
蒙古语(外蒙) | 通用-蒙古语(外蒙) | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
乌兹别克语 | 通用-乌兹别克语 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
方言
语言 | 模型名称 | 采样率 | 标点 | ITN | 顺滑 | 语义断句 | 声音和文本对齐 |
粤语 | 通用-粤语 | 16k | 支持 | 支持 | 支持 | 不支持 | 支持 |
电话客服(通用) | 8k | 支持 | 支持 | 支持 | 不支持 | 支持 | |
粤中自由说 | 8k | 支持 | 支持 | 支持 | 不支持 | 不支持 | |
东南亚多语言 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 | |
粤语(繁体) | 通用-粤语(繁体) | 8k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
通用-粤语(繁体) | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 | |
四川话 | 通用-四川话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
电话客服(通用) | 8k | 支持 | 支持 | 支持 | 支持 | 支持 | |
湖北话 | 通用-湖北话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
通用-湖北话 | 8k | 支持 | 支持 | 支持 | 支持 | 支持 | |
上海话 | 通用-上海话 | 16k | 支持 | 支持 | 支持 | 支持 | 不支持 |
湖南话 | 通用-湖南话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
河南话 | 通用-河南话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
通用-河南话 | 8k | 支持 | 支持 | 支持 | 支持 | 支持 | |
浙江话 | 通用-浙江话 | 16k | 支持 | 支持 | 支持 | 支持 | 不支持 |
东北话 | 通用-东北话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
山东话 | 通用-山东话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
天津话 | 通用-天津话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
陕西话 | 通用-陕西话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
山西话 | 通用-山西话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
贵州话 | 通用-贵州话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
云南话 | 通用-云南话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
甘肃话 | 通用-甘肃话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
苏州话 | 通用-苏州话 | 16k | 支持 | 支持 | 支持 | 支持 | 不支持 |
闽南语 | 通用-闽南语 | 16k | 支持 | 支持 | 支持 | 支持 | 不支持 |
江西话 | 通用-江西话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
宁夏话 | 通用-宁夏话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
广西话 | 通用-广西话 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
通用-广西话 | 8k | 支持 | 支持 | 支持 | 支持 | 支持 | |
中文普通话 | 识音石 V1 - 端到端模型,教育内容分析,医疗内容分析,新闻媒体内容分析,娱乐视频内容分析,音视频离线转写(升级版),新零售领域识别模型,出行领域识别模型,汽车领域 | 16k | 支持 | 支持 | 支持 | 支持 | 支持 |
中英自由说 | 16k | 支持 | 支持 | 支持 | 支持 | 不支持 | |
识音石 V1 - 端到端模型 | 8k | 支持 | 支持 | 支持 | 支持 | 支持 | |
东南亚多语言 | 16k | 支持 | 不支持 | 不支持 | 不支持 | 不支持 |
错误码
通用错误码、录音文件识别极速版错误码及处理方法,请参见错误码。