功能特性

更新时间:
复制 MD 格式

智能语音交互提供语音识别、语音合成和语音分析能力。本文介绍各项服务的功能与适用场景,帮助选择符合业务需求的服务。

语音识别

语音识别将音频中的语音转换为文本。可根据音频来源、时长和结果时效要求选择服务。

服务

输入方式

音频时长/文件限制

结果返回方式与时效

适用场景

一句话识别

短语音

一分钟内

识别单次提交的语音

语音搜索、短对话、控制口令

实时语音识别

持续输入音频流

长时间不间断语音

边输入边获取识别结果

会议、演讲、直播的实时转写

录音文件识别

已有文件的HTTP URL

时长≤12小时;音频≤512 MB;视频≤2 GB

异步;试用版24小时内,商用版3小时内

已有录音或视频的非实时转写

录音文件识别极速版

直接上传音频文件

时长≤2小时且文件≤100 MB

同步;同一次请求中返回结果

短视频编辑、字幕生成、准实时质检

录音文件识别闲时版

已有文件的HTTP URL

时长≤12小时;音频≤512 MB;视频≤2 GB

异步;24小时内

可接受较长等待时间的质检、媒资管理、字幕生成

录音文件识别和闲时版的上述处理时效不适用于半小时内提交超过500小时录音的大规模任务;此类需求需联系售前专家。极速版和闲时版仅提供商用版。一句话识别、实时语音识别和录音文件识别提供试用版,具体试用条件见下文“相关文档”中的计费方式。

说明

完整的语种、方言和模型支持情况,请参见各识别服务接口说明中的语种列表。选择模型时,需同时核对音频采样率:例如电话录音通常使用8 kHz,查看对应采样率下的语种和方言支持范围。

音频格式、采样率和声道要求也因服务而异,请参见上表中对应的接口说明。

语音合成

语音合成将文本转换为语音。控制台提供语音合成、长文本语音合成和流式文本语音合成(CosyVoice大模型)三类服务,可根据文本长度、输入方式和音频返回方式选择。

服务

调用方式

文本输入方式

文本长度

音频返回方式

适用场景

语音合成

实时合成

一次提交

≤300个字符

流式返回,可边接收边播放

短文本播报、提示语

长文本语音合成

实时合成

一次提交

≤1万个字符

流式返回,可边接收边播放

需尽快开始播放的文章、小说朗读

异步合成

一次提交

≤10万个字符

异步获取;3小时内完成

提前生成长篇文章、小说音频

流式文本语音合成(CosyVoice大模型)

流式合成

同一会话分批发送

分批文本限制见接口说明

流式返回,无需等待完整文本生成

大语言模型流式文本的语音输出

使用CosyVoice音色朗读已准备好的长文本时,还可调用CosyVoice长文本语音合成接口。该接口每个会话仅接收一次文本,最多10000个字符,流式返回音频,不支持流式输入文本。

语音合成提供试用版和商用版。长文本语音合成及上述两种CosyVoice合成接口仅支持商用版,不支持试用。语音合成、实时长文本和异步长文本语音合成的字符数按1个汉字、英文字母、标点或句子中间空格各计1个字符;不同服务的文本长度限制和计费字符数口径需分别查看,不应混用。

说明

各服务支持的音色、语种和音频格式,请参见对应文档的音色列表及参数说明。

设备端语音合成

离线语音合成通过设备本地模型将文本转换为语音,合成时无需联网,适用于无网络环境的播报、有声阅读和无障碍播报。使用前需完成SDK激活,按设备激活数量收费。

语音分析

语音分析用于检测音频中的声音事件,或分析说话人的声音特征和语种。

服务

分析对象

输出结果

适用场景

声音事件检测

背景音乐、哭声、笑声、爆炸声等声音事件

声音事件及其起止时间

安全陪护、内容审核、音视频辅助剪辑

说话人识别

输入语音与指定用户的声音特征

1:1比对验证结果

声音登录、客户身份核验

性别识别

音频中说话人的声音

性别识别结果

用户画像

语种识别

中文、英文、粤语语音

语种识别结果,不输出转写文本

智能客服、会议、语音指令中的语种判定

相关文档

  • 了解试用版与商用版的区别、试用额度及升级方式,请参见计费方式。

  • 查询各服务的计费规则及资源包信息,请参见计费项。

  • 了解调用并发和QPS限制,请参见并发和QPS说明。