定制语言模型

更新时间:
复制 MD 格式

介绍如何在控制台创建和训练定制语言模型。

前提条件

已开通智能语音交互服务,详情请参见开通服务。

训练语料说明

调用限制

  • 该功能免费开放给所有开通智能语音交互免费版和商用版的用户。

  • 训练数据为领域相关的文本,与待识别语音数据越接近,优化效果越好。

  • 以文本方式保存,使用UTF-8(无BOM)格式编码,文件大小不超过10 MB。

  • 每位用户最多支持创建10个模型。

  • 一句话或者一个被加强调优的关键词单独一行,控制每行的长度在500个字符以内。

  • 文本中的数字需要按照发音替换为对应的汉字。例如,“58.9元”需要转换为“五十八点九元”。

  • 文件中需要至少有一行为句子(大于4个词)。

  • 只采用逗号(,)、句号(。)、问号(?)和感叹号(!),句尾需要加标点。像书名号(《》)、双引号(“”)等标点应去除。

优化建议

对于识别不准确的关键词,可以将含该词的句子或者关键词(一个关键词在训练文本中独占一行)多复制几行,例如10行。如果效果仍不满意,可以适当增加复制行数。

说明
  • 需要首先排除关键词识别不准确,不是由发音不清晰或者音频质量不好造成的。

  • 建议经过识别试错,谨慎提供训练语料,避免相同发音的其他内容识别错误。

操作步骤

重要

定制模型名称不能与已有定制模型的名称重复。

  1. 登录智能语音交互控制台。

  2. 在左侧菜单单击自学习平台 > 语言模型定制。首次使用时,按页面提示开通功能。

  3. 在模型页签单击创建模型。

    1. 选择基础模型:输入定制模型名称,并选择基础模型,然后单击下一步。

    2. 上传语料:可上传数据集或选择已有数据集,完成后单击确定。

  4. 在创建的模型右侧单击训练模型。训练完成后,模型状态自动更新为模型上线,可在项目中使用该模型。

  5. 在左侧菜单单击全部项目,然后单击项目右侧的项目功能配置。

  6. 在自学习区域的语言模型配置中,选择创建的模型。

    说明

    语言模型定制时选择的基础模型需要与当前项目配置的语音识别模型一致,定制模型名称才会显示在下拉框中。