视频翻译

更新时间:
复制 MD 格式

视频翻译技术利用人工智能和机器学习算法,能够高效、准确地将视频内容从源语言转换为一种或多种目标语言。这项技术不仅涵盖字幕翻译,还包括语音(口播)翻译和面容(口型)同步翻译,确保翻译后的内容在视觉和听觉上的一致性与自然性。同时,它能够跨越语言障碍,丰富教育内容,提升娱乐体验,从而极大地促进跨文化交流。

说明

目前已开通的区域为:

  • 字幕级翻译:华东2(上海)、华北2(北京)、华南1(深圳)、华东1(杭州)、亚太东南 1(新加坡)、美洲(美国-西部)

  • 语音级翻译:华东2(上海)、华北2(北京)、华南1(深圳)、华东1(杭州)、亚太东南 1(新加坡)、美洲(美国-西部)

  • 面容级翻译:华东 2(上海)、亚太东南 1(新加坡),其他地域暂不支持。

Demo体验

AI体验馆,即刻体验视频翻译。

功能优势

多语言与方言支持:

  • 支持超过40种国家语言的翻译服务。

  • 提供中国10多种方言的支持,满足多样化的语音需求。

  • 一次翻译任务支持输出超过40种不同的目标语言。

广泛的视频格式兼容性:

  • 支持多种主流视频格式,包括MP4、WebM、MOV、M3U8等,确保您的内容无缝集成。

丰富的音频格式与自定义选项:

  • 支持MP3、WAV等多种音频格式。

  • 允许用户进行个性化配置,以满足不同场景下的具体需求。

功能特性

智能媒体服务所提供的视频翻译服务,支持字幕级翻译语音(口播)级翻译面容(口型)级翻译。其主要功能特性包括:

功能

功能描述

特性亮点

字幕级翻译

  • 提取现有视频字幕

  • 擦除原字幕

  • 多语种字幕翻译

  • 一次翻译任务支持输出多目标语种视频

  • 新字幕回填

高效、准确的文字翻译,适用于需要快速添加多语言支持的场景。

语音(口播)级翻译

在字幕级翻译的基础上还支持音色复刻,使用原说话人的音色进行字幕播报。音色从源文件(视频或音频)中自动提取,不支持上传外部参考音频。一次翻译任务支持输出多目标语种视频,完成音频回填。还支持通过情感级别配音控制配音情感强度(仅支持中英互译和API调用)。

在文字翻译的基础上增加了声音维度,保持了原声的真实性和情感传递,提升观众体验。

面容(口型)级翻译

前两种翻译能力的基础上,还支持说话人口型对齐。

最高级别的翻译服务,确保视觉和听觉的一致性,特别适合于高度真实的互动或宣传内容。

语音翻译修正/二次剪辑

  • 可通过云剪辑(可视化操作)和OpenAPI对翻译结果进行语音、字幕翻译的二次修正。

  • 支持翻译后视频的再创作。

灵活调整翻译输出,满足个性化需求,允许用户根据具体情况进行微调,以达到最佳效果。

计费说明

计费说明详见视频翻译计费

使用说明

为了让用户能够轻松创建和管理视频翻译任务,我们提供了控制台、云剪辑和OpenAPI三种途径。

  • 智能媒体服务控制台:适合希望通过图形界面直观操作的用户。

  • 云剪辑:对于熟悉视频编辑且希望灵活调整翻译输出的用户来说,云剪辑提供了更为精细的操作空间。用户可以在剪辑工程中直接添加素材,使用AI翻译工具进行翻译,并对结果进行二次修正。

  • OpenAPI:面向开发者和技术人员,通过编程接口调用视频翻译服务,允许集成到第三方系统中自动化处理大批量视频翻译工作。

不同翻译级别支持的方式如下:

创建翻译任务

方法一:通过控制台创建翻译任务

  1. 访问智能媒体服务-视频翻译, 进入翻译任务列表页。

  2. 在顶部左上角根据实际情况选择地域。

  3. 单击创建翻译任务按钮进入到创建翻译任务页面。

  4. 根据页面提示,完成参数设置:

    • 翻译方式:选择字幕级翻译、语音级翻译、面容级翻译。

    • 选择源文件:上传需要翻译的视频文件。目前支持mp4、webm、mov格式的视频。

    • 字幕来源:包括是否擦除原字幕、字幕来源等选项。其中,字幕来源包括OCR识别ASR识别指定srt源字幕文件三种方式。

      • OCR识别:当您没有现成的字幕文件但拥有带有可见文字的视频时,可以通过OCR识别技术从视频画面中提取字幕文本。为了提高效率和准确性,用户还可以指定OCR识别范围

      • ASR识别:如果您的视频文件没有字幕,可以通过ASR识别从音轨中识别语音提取字幕。

      • OCR/ASR识别:结合OCRASR的一种提取字幕的方式,优先使用OCR识别字幕,如果OCR识别失败,则通过ASR识别获取到字幕。

      • 指定srt源字幕文件:如果已经有现成的字幕文件(如.srt格式),可以直接将其加载到视频编辑软件中与视频同步播放。

      系统不支持全自动判断字幕来源模式,需要根据视频实际情况手动选择。如果不确定视频是否含有人声,或希望系统自动适配,建议选择OCR/ASR识别(对应 OpenAPI 参数 TextSource=OCR_ASR):系统会优先尝试 OCR 识别画面文字,识别失败后自动切换为 ASR 识别语音,避免因声音判断错误导致任务失败。

      如果视频仅包含背景音乐(BGM)而没有有效人声,直接执行语音翻译会导致任务失败,此时需要关闭语音翻译(对应 OpenAPI 参数 NeedSpeechTranslate=false)。若仍需提取画面文字字幕,可配合使用OCR识别OCR/ASR识别模式。

    • 翻译语言:支持一次性选择多个目标语言,提交翻译任务后,系统将为您生成多个目标语言的视频文件。

    • 存储目录与文件名:指定翻译后文件的存储位置和名称。

  5. 确认所有参数无误后,单击提交翻译任务以完成任务创建。

  6. 您可以通过任务列表查询任务状态、参数及翻译结果。当任务状态变更为处理完成时,单击查看详情了解任务详细信息。

    任务详情页包含三个区域:基础设置展示源文件类型、翻译方式、翻译语言(如中文 > 英语、日语)、创建时间及任务状态等;高级设置展示擦除源字幕、目标字幕类型、字幕来源、是否开启二次编辑等配置项;输出结果以表格列出各目标语言的输出路径,并提供翻译修正/编辑下载操作。

方法二:通过云剪辑创建翻译任务

准备工作

如果您对云剪辑尚不熟悉,建议您首先学习并了解云剪辑相关的操作指南。

操作流程

  1. 访问智能媒体服务-云剪辑

  2. 在顶部左上角根据实际情况选择地域。

  3. 视频剪辑工程页签下,单击创建剪辑工程,按照页面提示完成剪辑工程创建后,单击列表中的剪辑按钮进入到云剪辑的创作页面。

  4. 在左上方资源库中,单击导入素材从屏幕右侧添加素材的弹窗中,选择所需要翻译的文件,添加到资源库中,然后单击文件右下角的image图标或者直接拖动文件添加到下方的剪辑操作区的轨道。云剪辑创作页面初始界面左侧提供 资源库素材库数字人智能配音字幕贴纸 等功能菜单,可通过右上角 + 导入素材 按钮添加视频、音频或图片素材。

  5. 请在下方剪辑轨道中选择需要进行翻译的音频或视频,点击右上方属性编辑区的AI翻译按钮以打开视频翻译操控面板。根据页面提示,依次完成翻译类型、字幕提取、翻译语言及字幕擦除等设置,最后点击发起任务以提交翻译任务。此处以语音级别翻译为例。

  6. 请稍候几分钟,您将能够在剪辑轨道上查看翻译结果,详见下方说明。翻译任务完成后,下方剪辑轨道区将显示三条轨道:字幕轨包含目标语言字幕,视频轨包含擦除原字幕后的视频,音频轨包含翻译后的音频。

  7. 完成任务后,您可以单击右上方的导出为 > 导出视频,系统将弹出合成视频的窗口。请根据页面提示进行相应填写后,单击确定,即可将翻译完成的视频进行合成与导出。翻译完成后,剪辑轨道呈现三条轨道:字幕轨道包含多段英文翻译字幕片段,视频轨道为已执行字幕擦除的源视频,音频轨道为目标语言的配音音频文件并显示波形。可在右侧片段设置面板中对各翻译片段进行批量管理。

方法三:通过OpenAPI创建视频翻译

image
  1. 创建翻译任务

    根据您的业务需求设置相应的接口参数,并调用提交视频翻译任务。在提交时,请确保您已经仔细阅读了视频翻译参数介绍与示例,以正确配置各项参数。

    其中,字幕来源(TextSource)和语音翻译(NeedSpeechTranslate)参数的配置建议如下:

    • 系统不支持全自动判断字幕来源模式。如果不确定视频是否有声,或希望自动适配,建议将 TextSource 设置为 OCR_ASR:系统会优先尝试 OCR 识别画面文字,识别失败后自动切换为 ASR 识别语音,避免因声音判断错误导致任务失败。

    • 如果视频仅包含背景音乐(BGM)而没有有效人声,直接执行语音翻译会导致任务失败,此时需要将 NeedSpeechTranslate 设置为 false。若仍需提取画面文字字幕,可配合使用 TextSource=OCR 或 TextSource=OCR_ASR 模式。

  2. 查询单个翻译任务结果

    要获取特定视频翻译任务的状态和结果,可以调用GetSmartHandleJob - 获取视频翻译任务结果。此接口允许您检索指定任务的详细信息,包括处理进度、完成时间以及最终的翻译输出链接。

  3. 查询翻译任务列表

    如果您需要查看所有正在进行或已完成的视频翻译任务,可以使用ListSmartJobs - 获取视频翻译任务列表来列出这些任务。

  4. 删除翻译任务

    对于已完成并且不再需要保存的任务,可以通过调用删除智能任务将其从系统中移除,释放资源。

语音翻译-二次修正(可选)

重要
  • 如果对语音级别的翻译结果不满意,并希望对结果进行二次修正,请在提交翻译任务之前启用“是否开启二次编辑”参数。接下来将介绍两种针对语音级翻译结果进行二次修正的方法。

  • 注意:当前版本的“面容级翻译”仅支持对语音进行二次翻译修正,暂不支持对视频中人物的面容口型进行二次修正。

方法一:通过OpenAPI实现

通过调用OpenAPI实现语音级翻译结果的修正。详见语音翻译 - 人工修正

方法二:通过云剪辑(webSDK)实现

准备工作

如果您对云剪辑尚不熟悉,建议您首先学习并了解云剪辑相关的操作指南。

操作流程

  1. 访问智能媒体服务-视频翻译, 进入翻译任务列表页,选择需要进行二次修正的任务。

  2. 并在操作列中单击翻译修正/剪辑按钮,以打开相应的云剪辑工程。后续操作详见下方视频讲解:

常见问题

结合音频波形图设置单行字幕的起止时间

例如,您希望将翻译后的字幕“Great where are you”拆分为两段,分别为“Great”和“where are you”。您可以通过调整字幕的起止时间,尽量将字幕的起止时间点音频波形的波谷处相对应。经过这样的处理,语音翻译的二次修正效果将会更加优化。

控制二次修正的字幕字数

在进行二次翻译修正时,如需对翻译后的双语字幕内容进行编辑,务必确保调整后的字幕字数不超过调整前字数的1.5倍,否则可能导致二次翻译修正后的语音语速过快。

例如:第一次翻译后的某一行译文为:Let's talk about this later. We need to go home now

错误示例:Let's discuss this matter in more detail at a later time. Right now, we should focus on heading back home as it's important to ensure we get there safely and in good time. We can revisit this conversation when we are both more relaxed and have ample opportunity to explore all the aspects thoroughly.

正确示例:Let's pick this up another time. We should be going home now.

视频翻译任务处理需要多长时间?

1 分钟以内的视频通常需要数分钟至十余分钟完成处理,实际处理速度约为视频时长的 3 倍(不含排队等待时间)。实际耗时受以下因素影响:

  • 视频码率与帧率:码率、帧率越高,处理耗时越长。

  • 系统当前排队情况:任务提交后需排队等待处理资源,高峰期排队时间会增加整体耗时。

  • 算法复杂度:翻译级别(字幕级、语音级、面容级)越高,涉及的算法处理越复杂,耗时相应增加。

建议提交任务后,通过[GetSmartHandleJob - 获取视频翻译任务结果](t2161217.xdita#)接口查询任务状态,获取最终处理结果。

为什么输出视频比例异常或变形?如何保持原视频比例?

默认行为:常规场景下,请求参数中不建议包含 Width 和 Height 字段(如需通过代码构造请求,序列化时应跳过值为 0 或 null 的字段),系统默认会按源视频的原始比例输出结果,无需额外配置。

异常原因:如果 OutputConfig 中显式将 Width 或 Height 设置为 0,或源视频本身是依赖 SAR(Sample Aspect Ratio)拉伸显示的非标准格式(如 PAL 宽屏 DVD 等),可能导致比例计算错误,从而出现输出视频比例异常或变形。

解决方案:对于含黑边或非标准 SAR 的特殊视频,若默认按源比例输出的效果不符合预期,建议先通过媒体分析获取视频的实际显示宽高比,再在 OutputConfig 中显式设置与该比例匹配的 Width 和 Height 值,以强制修正输出比例。

视频翻译任务失败或无法下载的排查方法

视频翻译任务失败或输出视频无法下载,可按以下场景排查:

  • 下载失败或页面响应缓慢:按 F12 打开浏览器开发者工具,检查 NetworkConsole 面板中的报错信息;也可以尝试更换浏览器(如 Safari)以排除浏览器插件或安全策略的拦截问题;同时检查接口返回结果中是否包含 RequestId,便于进一步排查或提交工单。

  • 内容审核失败:如果任务因源视频或字幕内容触发敏感词拦截而失败,需要检查并修改相关内容,确保提交内容符合平台内容审核规范后重新提交任务。

  • 接口报错 'src property must be a valid json object':该报错通常是因为请求参数中缺少输出配置信息,即 Timeline 中只配置了输入(input)而缺少输出(output)配置。请参考官方示例,在请求中补全 OutputConfig 参数后重新提交。

  • 通过 VOD 工作流调用视频翻译失败:VOD(视频点播)工作流不支持直接调用视频翻译服务,因为工作流中无法配置翻译目标语言等必要参数。如需使用视频翻译能力,请改用 OpenAPI 方式直接调用。

相关文档

如果您想通过OpenAPI提交翻译任务,可提前了解视频翻译参数介绍与示例