智能语音交互提供语音识别、语音合成和语音分析能力。本文介绍各项服务的功能与适用场景,帮助选择符合业务需求的服务。
语音识别
语音识别将音频中的语音转换为文本。可根据音频来源、时长和结果时效要求选择服务。
|
服务 |
输入方式 |
音频时长/文件限制 |
结果返回方式与时效 |
适用场景 |
|
短语音 |
一分钟内 |
识别单次提交的语音 |
语音搜索、短对话、控制口令 |
|
|
持续输入音频流 |
长时间不间断语音 |
边输入边获取识别结果 |
会议、演讲、直播的实时转写 |
|
|
已有文件的HTTP URL |
时长≤12小时;音频≤512 MB;视频≤2 GB |
异步;试用版24小时内,商用版3小时内 |
已有录音或视频的非实时转写 |
|
|
直接上传音频文件 |
时长≤2小时且文件≤100 MB |
同步;同一次请求中返回结果 |
短视频编辑、字幕生成、准实时质检 |
|
|
已有文件的HTTP URL |
时长≤12小时;音频≤512 MB;视频≤2 GB |
异步;24小时内 |
可接受较长等待时间的质检、媒资管理、字幕生成 |
录音文件识别和闲时版的上述处理时效不适用于半小时内提交超过500小时录音的大规模任务;此类需求需联系售前专家。极速版和闲时版仅提供商用版。一句话识别、实时语音识别和录音文件识别提供试用版,具体试用条件见下文“相关文档”中的计费方式。
完整的语种、方言和模型支持情况,请参见各识别服务接口说明中的语种列表。选择模型时,需同时核对音频采样率:例如电话录音通常使用8 kHz,查看对应采样率下的语种和方言支持范围。
音频格式、采样率和声道要求也因服务而异,请参见上表中对应的接口说明。
语音合成
语音合成将文本转换为语音。控制台提供语音合成、长文本语音合成和流式文本语音合成(CosyVoice大模型)三类服务,可根据文本长度、输入方式和音频返回方式选择。
服务 | 调用方式 | 文本输入方式 | 文本长度 | 音频返回方式 | 适用场景 |
|---|---|---|---|---|---|
语音合成 | 一次提交 | ≤300个字符 | 流式返回,可边接收边播放 | 短文本播报、提示语 | |
长文本语音合成 | 一次提交 | ≤1万个字符 | 流式返回,可边接收边播放 | 需尽快开始播放的文章、小说朗读 | |
一次提交 | ≤10万个字符 | 异步获取;3小时内完成 | 提前生成长篇文章、小说音频 | ||
流式文本语音合成(CosyVoice大模型) | 同一会话分批发送 | 分批文本限制见接口说明 | 流式返回,无需等待完整文本生成 | 大语言模型流式文本的语音输出 |
使用CosyVoice音色朗读已准备好的长文本时,还可调用CosyVoice长文本语音合成接口。该接口每个会话仅接收一次文本,最多10000个字符,流式返回音频,不支持流式输入文本。
语音合成提供试用版和商用版。长文本语音合成及上述两种CosyVoice合成接口仅支持商用版,不支持试用。语音合成、实时长文本和异步长文本语音合成的字符数按1个汉字、英文字母、标点或句子中间空格各计1个字符;不同服务的文本长度限制和计费字符数口径需分别查看,不应混用。
各服务支持的音色、语种和音频格式,请参见对应文档的音色列表及参数说明。
设备端语音合成
离线语音合成通过设备本地模型将文本转换为语音,合成时无需联网,适用于无网络环境的播报、有声阅读和无障碍播报。使用前需完成SDK激活,按设备激活数量收费。
语音分析
语音分析用于检测音频中的声音事件,或分析说话人的声音特征和语种。
|
服务 |
分析对象 |
输出结果 |
适用场景 |
|
背景音乐、哭声、笑声、爆炸声等声音事件 |
声音事件及其起止时间 |
安全陪护、内容审核、音视频辅助剪辑 |
|
|
输入语音与指定用户的声音特征 |
1:1比对验证结果 |
声音登录、客户身份核验 |
|
|
音频中说话人的声音 |
性别识别结果 |
用户画像 |
|
|
中文、英文、粤语语音 |
语种识别结果,不输出转写文本 |
智能客服、会议、语音指令中的语种判定 |