自学习平台FAQ

更新时间:
复制 MD 格式

本文介绍自学习平台中热词、定制语言模型和识别效果验证的常见问题。

热词

业务类热词和名称类热词有什么区别?

类型

用途

业务类(泛热词)

添加业务相关词汇,不限定为人名或地名;词条仍需符合长度、格式等要求。

名称类(类热词)

目前支持人名和地名。同一词表只能包含一种类别。

重要

8 kHz 采样率的 ASR 模型暂不支持名称类热词。

词条要求和创建方法,请参见在控制台创建热词。

如何通过控制台添加热词?

准备符合要求的热词文件,在控制台创建热词词表,再将词表应用到项目。操作步骤请参见在控制台创建热词。

如何通过 POP API 创建热词词表?

调用 CreateAsrVocab 创建业务专属热词词表,无需依赖控制台配置。还可以调用 GetAsrVocab 获取词表、UpdateAsrVocab 更新词表、DeleteAsrVocab 删除词表,以及 ListAsrVocab 列举词表。参数和示例请参见使用 POP API 创建业务专属热词。

如何设置业务类热词的权重?

控制台不支持调整业务类热词的权重,可以通过 POP API 设置。参数说明请参见使用 POP API 创建业务专属热词。

热词有数量限制吗?

  • 通过 POP API 创建业务专属热词时,每个账号默认最多可创建 10 个词表,每个词表最多包含 500 个热词。

  • 通过控制台创建热词时,每类热词最多可创建 10 组,每组最多包含 500 行。

如果热词数量超过限制,建议使用自学习平台训练定制语言模型。词表限制请参见使用 POP API 创建业务专属热词和在控制台创建热词。

如何使用 SDK 设置业务类热词?

在控制台创建并应用到项目的业务类热词通过项目 Appkey 生效,无需在代码中指定词表 ID。通过 POP API 创建的词表,需要在识别请求中通过 vocabulary_id 指定词表 ID。

如果请求中指定了 vocabulary_id,该请求使用指定的业务专属词表,优先于控制台为项目配置的业务类热词。

一句话识别、实时语音识别和录音文件识别的设置方法,请参见使用 SDK 设置业务专属热词。

定制语言模型

定制语言模型有哪些训练语料和数量限制?

训练语料需使用 UTF-8 无 BOM 编码,单个文件不超过 10 MB,每行不超过 500 个字符。每个账号最多可创建 10 个定制语言模型。完整要求请参见定制语言模型;通过 POP API 管理模型和数据集的限制,请参见使用 POP API 创建自学习模型。

如何使用通过控制台或 POP API 创建的自学习模型?

控制台和 POP API 创建的模型,使用方式如下。

创建方式

在识别中使用

控制台

将训练完成的模型应用到项目后,通过项目 Appkey 使用,无需在代码中指定模型 ID。训练时选择的基础模型必须与项目配置的语音识别模型一致,定制模型才会在项目的模型列表中显示。

POP API

训练完成后,在识别请求中通过 customization_id 指定模型 ID,并确保训练所用的基础模型与项目的语音识别模型一致。

控制台操作请参见定制语言模型;一句话识别、实时语音识别和录音文件识别的 SDK 设置方法,请参见使用 SDK 2.0 设置自学习模型。

除了热词,还可以如何优化识别效果?

可以使用自学习平台的语言模型定制功能,通过业务相关的文本语料训练定制语言模型,再将模型用于语音识别。操作方法请参见定制语言模型。

如何优化自学习模型的训练语料?

先排除发音不清、音频质量差等问题,再针对识别错误补充相关业务语料。对于难以识别的关键词,可以适当重复关键词或包含关键词的句子,例如先重复 10 次,再根据识别效果调整。避免过度重复,以免影响同音词或近音词的识别。更多建议请参见定制语言模型。

效果验证

如何使用自动化测试评估识别效果?

上传带标注的测试音频,或仅上传文本,由服务合成音频构建测试集;也可以选择已有测试集。使用同一测试集比较模型的识别结果和准确率。测试集准备和操作方法请参见自动化测试。