字幕配置功能通过大模型翻译技术,可将您直播音频中的人声处理为多语言内容,从而有效提升观众在跨语言、嘈杂或静音环境下的观看体验,帮助您的内容触达更广泛的全球受众。本文介绍如何通过视频直播控制台完成字幕配置。
应用场景
- 无障碍观看
为听障人士生成原文字幕,支持办公室、图书馆等静音场所及地铁、商场等嘈杂环境下的无障碍观看体验。 - 跨境业务与全球交流
适用于跨国电商直播、产品发布会、国际会议、教育培训及海外嘉宾演讲等多种场景,助力跨语言沟通和市场拓展。
注意事项
- 直播延迟:为保证字幕的稳定和完整,会给关联的转码流或添加字幕后缀的源流带来 15 到 30 秒的额外直播延迟。
- 计费说明:
- 字幕:按字幕任务的实际运行时长计费。详见字幕计费。
- 转码:如果您拉取的是转码流,则会产生转码费用。按实际转码时长计费。计费时长取决于转码的触发方式。详见转码计费。
- 推流触发:从开始推流时计费,直到推流结束。
- 拉流触发:从有观众开始拉取转码流时计费,直到转码任务结束。通常小于等于推流时长。
注意
如选择纯字幕模式,则观众拉取添加字幕后缀的源流,也会产生转码费用。
- 生效时间:添加、编辑或删除字幕配置后,必须等待 3-5 分钟并重新推流,变更后的字幕配置才会生效。
工作流程

- 配置与关联:添加字幕配置,并通过
AppName、字幕后缀和转码后缀,与一个或多个直播流关联。 - 推流与识别:当您开始推流后,系统会自动识别人声内容。
- 处理与合成:根据字幕配置,系统对识别后的人声内容进行处理,包括生成字幕、生成同传声音替换原声,以及驱动数字人口型与同传声音同步,并将最终的处理结果合入到直播流中。
- 拉流观看:观众通过拉取关联了字幕配置的转码流,或拼接了字幕后缀的源流,即可观看最终效果。
前提条件
- 已在同一域名空间下,添加推流域名和拉流域名。详见添加域名。
- 已在域名空间下添加转码配置,用于后续关联。确保转码配置和即将添加的字幕配置拥有相同的域名空间和
AppName。详见转码配置。
操作步骤
- 登录视频直播控制台。
- 左侧导航栏选择功能配置,右侧页面单击字幕配置页签。
- 在域名空间下拉列表中,选择转码配置所在的域名空间。
- 单击添加配置。

- 在弹出的添加字幕配置对话框中,完成以下配置。
- 关联转码配置。

| 配置项 | 说明 |
|---|
AppName | 推流地址的 AppName。例如推流地址为 rtmp://push.example.com/live/test?authinfo,则 AppName 为 live。 |
字幕后缀 | 为源流添加的字幕后缀。如不配置,默认为 _subtitle。您可以在源流地址后拼接此后缀,为您的原始直播流直接添加字幕、同传声音等效果,不改变分辨率和码率等。 如需自定义该字幕后缀,您必须以短横线(-)或下划线(_)开头,长度为 1-100 个字符,并支持以下字符: - 大写字母 A - Z
- 小写字母 a - z
- 短横线(-)
- 下划线(_)
示例: - 源流地址:
rtmp://pull.example.com/live/test - 字幕流(包含字幕、同传声音等效果的源流)地址:
rtmp://pull.example.com/live/test_subtitle
|
转码后缀 | 选择当前 AppName 下的一个或多个转码后缀(如 _uhd、_hd),为转码流添加字幕、同传声音等效果。这样,观众在切换清晰度时,也能体验到字幕、同传声音等效果。 警告 AppName 下的每个转码后缀,仅能绑定一个字幕配置。
示例: - 源流地址:
rtmp://pull.example.com/live/test - 转码流(包含字幕、同传声音等效果)地址:
rtmp://pull.example.com/live/test_hd
|
- 根据使用场景,选择具体的模式。
| 使用场景 | 推荐功能 | 模式选择 | 说明 |
|---|
| 为直播提供基础字幕,方便静音或嘈杂环境下观看。 | 原文 ASR 字幕 | 声影同传 > 原文 ASR 字幕 | 通过语音识别,在视频画面叠加原文字幕。 |
进行跨语言文字交流,触达全球观众。 | 字幕翻译(即字幕配置) | 纯字幕或声影同传 > 翻译同传 说明 推荐选择声影同传 > 翻译同传,翻译效果更佳。 | 通过语音识别,在视频画面叠加翻译字幕,但保留原声音频。 |
| 提供配音式翻译体验,如同观看译制片。 | 同传声音 | 声影同传 > 翻译同传 | 提供同传声音,并替换原声。 |
| 追求沉浸式真人翻译体验,提升专业性。 | 同传声音 + 数字人口型 | 声影同传 > 翻译同传 | 在同传声音的基础上,通过 AI 技术驱动说话人口型与翻译音频同步,效果以假乱真。 |
- 完成相关配置。
- 翻译同传

| 配置项 | 说明 |
|---|
播出延迟 | 配置播出延迟时长,以保证同传声音和字幕的翻译处理完成。取值范围为 5-60 秒。建议取值如下: - 同时开启数字人口型、同传声音、字幕时:20
- 同时开启同传声音、字幕时:12
- 仅开启字幕时:8
说明 如果字幕出现的时间要早于原声或画面,可适当降低播出延迟时长,让字幕与原声或画面对齐,反之亦然。 |
| 字幕/同传 | 选择翻译同传。 |
字幕语言 | 选择原文和译文的语言。原文支持中文、英文,译文支持中文、英文、日语、西班牙语、印尼语、葡萄牙语、法语、德语。 |
数字人口型 | 是否开启数字人口型功能。开启后,说话人口型将与同传声音同步,提升直播的沉浸感。 说明 开启数字人口型功能后,会自动开启同传声音功能。 |
同传声音 | 是否开启同传声音功能。 开启功能后,将使用带有音色复刻效果的翻译语音替换直播原声。您还可以完成以下配置: - 降噪:开启后,可有效减轻翻译语音中的背景噪音(如电流声、环境杂音),提升最终输出音频的清晰度。
- 音量均衡:开启后,系统会自动调节输出音频的音量,使其保持在稳定、舒适的水平,有效避免声音忽高忽低或出现刺耳的突然爆音,显著提升观众的听觉体验。
|
字幕配置 | 是否开启字幕功能。开启后,将在画面上显示字幕。 支持配置原文和译文字幕的显示行数、字号、样式、底色、边距、字幕排序(原文在上或译文在上)等。其中, - 字幕格式:设置显示的字幕。
- 原文+译文:显示双语字幕,字幕显示顺序以字幕排序为准。
- 译文:仅显示译文字幕。
- 原文:仅显示原文字幕。
- 字幕行数:设置每种语言字幕最多显示的行数。
说明 在显示双语字幕时,该配置将分别应用于原文和译文。例如,选择 2 行,则原文和译文均最多显示 2 行,使字幕总共占用 4 行屏幕空间。 - 1 行:每种语言的字幕最多显示一行,内容可能被截断。
- 2 行:每种语言的字幕最多显示两行,内容可能被截断。
- 自动:根据字幕总字数和每行最大字符数自动换行,确保内容完整显示。
- 译文字数/原文字数:每行字幕的最大字符数。当字幕行数设置为 1 行或 2 行时,如果原文或译文的字幕总字数超出显示范围,内容将会被截断。例如译文每行字幕的最大字符数为 10,字幕行数为 2 行,则当译文字幕总字数超出 20 时,20 字后的内容会被截断。
说明 - 系统会综合您设置的译文字数/原文字数、字幕左右边距、字号和屏幕分辨率等因素,计算出每行最终可显示的最大字符数。
- 每个文字、字母、符号或数字均为一个字符。
|
关键词库 | 添加您期望在翻译时保持固定译法的专有词汇,如品牌名、人名或特定术语。系统会严格按照此词库翻译,以确保准确性。 格式为原文:译文,每个原文:译文之间用英文逗号(,)隔开。例如火山引擎:Volcengine,视频直播:MediaLive。 警告 - 输入的原文或译文本身不可包含英文逗号(,)。
- 输入框内的全部内容,总字符数不超过 3 万。
|
易错词 | 如果您在设置关键词库后,仍然存在错译的情况,可选择配置易错词,包括容易翻错的译文及其纠正后的译法。长度为 1-50 个字符,最多可添加 500 对易错词,建议根据实际效果调整。 只要译文中包含您设置的易错词,系统就会自动将其替换为纠正后的译法。例如,当 Tim 被错译为蒂姆或提姆时,您可以添加以下易错词进行纠错: - 蒂姆(译文)> Tim(纠正)
- 提姆(译文)> Tim(纠正)
这样,在译文字幕中,Tim 就不再会被错译成蒂姆或提姆,确保了翻译的准确性。 |
- 原文 ASR 字幕

| 配置项 | 说明 |
|---|
播出延迟 | 配置播出延迟时长,以保证字幕翻译处理完成。取值范围为 0-60 秒。 建议取值如下: - 出字方式为整句时:15
- 出字方式为实时流式时:2-3
说明 如果字幕出现的时间要早于原声或画面,可适当降低播出延迟时长,让字幕与原声或画面对齐,反之亦然。 |
| 字幕/同传 | 选择原文ASR字幕。 |
字幕语言 | 选择原文字幕的语言。 - 出字方式为整句时,支持中文、英文、日语、西班牙语、印尼语、葡萄牙语、法语、德语、韩语。
- 出字方式为实时流式时,支持中文和英文。
|
字幕配置 | 打开字幕配置开关。支持配置原文字幕的出字方式、显示行数、字号、样式、底色、边距等。其中, - 出字方式:原文字幕的显示方式。
- 整句:字幕会一句一句地完整显示。系统会等一句话说完后,再将与这段声音对应的整句字幕一次性显示出来。这种方式能保证上下文的完整和阅读的连贯性,体验类似于观看电影字幕。
- 实时流式:字幕会逐字或逐词地显示出来,而不会等待一句话结束。该方式追求实时性,让观众几乎在听到声音的同时就能看到文字,体验类似于手机上的语音输入。
- 字幕行数:设置原文字幕最多显示的行数。
- 1 行:原文字幕最多显示一行,内容可能被截断。
- 2 行:原文字幕最多显示两行,内容可能被截断。
- 自动:根据字幕总字数和每行最大字符数自动换行,确保内容完整显示。
- 原文字数:每行字幕的最大字符数。当字幕行数设置为 1 行或 2 行时,如果原文的字幕总字数超出显示范围,内容将会被截断。例如原文每行字幕的最大字符数为 10,字幕行数为 2 行,则当原文字幕总字数超出 20 时,20 字后的内容会被截断。
说明 - 系统会综合您设置的原文字数、字幕左右边距、字号和屏幕分辨率等因素,计算出每行最终可显示的最大字符数。
- 每个文字、字母、符号或数字均为一个字符。
|
| 热词库 | 添加热词(如产品名、流行语),可以提升语音识别准确率。热词需与原文语言一致,热词之间以空格分隔,输入的总字符数不超过 3 万。 |
易错词 | 如果您在设置热词库后,仍然存在原文字幕识别错误的情况,可选择配置易错词,包括容易识别错误的字幕及其纠正后的写法。长度为 1-50 个字符,最多可添加 500 对易错词,建议根据实际效果调整。 只要字幕中包含您设置的易错词,系统就会自动将其替换为纠正后的写法。例如,当 word 被错误识别为 world 时,您可以添加以下易错词进行纠错:world(字幕)> word(纠正)。 这样,在原文字幕中,word 就不再会被错误识别为 world,确保了字幕识别的准确性。 |
- 纯字幕

| 配置项 | 说明 |
|---|
翻译语言 | 选择原文和译文的语言。当前原文和译文均支持中英混合、英语、日语和韩语。 说明 - 如只需显示原文字幕,可将译文和原文设置为同一语言。
- 通常情况下,中英混合仅会作为原文语言,而对应的译文语言为英语、日语或韩语。
|
预设效果 | 如需快速配置,请直接选用一种预设效果。选用后,建议仅修改字幕格式和字体。 说明 - 如果您在选择预设效果后,又手动修改了字幕行数、每行字数、左右边距和底部边距,系统会自动取消选中的预设效果。
- 如需高度自定义字幕样式,请不要选择任何预设效果,而是直接通过字幕调整功能进行详细配置。
|
字幕调整 | 设置字幕格式、字幕行数、每行字数、字体、边距等。其中, - 字幕格式:设置是否显示原文字幕。
- 翻译字幕:仅显示译文字幕。
- 双语字幕:以译文字幕在上、原文字幕在下的方式显示双语字幕。
- 字幕行数:设置每种语言字幕最多显示的行数。
说明 在显示双语字幕时,该配置将分别应用于原文和译文。例如,选择 2 行,则原文和译文均最多显示 2 行,使字幕总共占用 4 行屏幕空间。 - 1 行:每种语言的字幕最多显示一行,内容可能被截断。
- 2 行:每种语言的字幕最多显示两行,内容可能被截断。
- 自动:根据字幕总字数和每行最大字符数自动换行,确保内容完整显示。
- 每行字数:每行字幕的最大字符数。当字幕行数设置为 1 行或 2 行时,如果原文或译文的字幕总字数超出显示范围,内容将会被截断。例如译文每行字幕的最大字符数为 10,字幕行数为 2 行,则当译文字幕总字数超出 20 时,20 字后的内容会被截断。
说明 - 系统会综合您设置的每行字数、字幕左右边距、字体和屏幕分辨率等因素,计算出每行最终可显示的最大字符数。
- 每个文字、字母、符号或数字均为一个字符。
|
| 热词库 | 添加热词(如产品名、流行语),可以提升语音识别准确率。热词需与原文语言一致,热词之间以空格分隔,输入的总字符数不超过 3 万。 |
- 在对话框右侧,按照界面提示,在线测试字幕效果。
说明
- 此处选择的源流尺寸仅用于效果预览,不会更改源流的分辨率。字幕任务输出的画面朝向继承自源流。
- 此处上传的背景图无大小、格式等限制。
- 确认无误后,单击确定。添加字幕配置后,可随时编辑或删除字幕配置。编辑配置时,支持修改除
AppName 和字幕后缀以外的所有配置。
添加、编辑或删除字幕配置后,必须等待 3-5 分钟并重新推流,变更后的字幕配置才会生效。
后续操作
- 通过地址生成器生成源流地址和转码流地址。
- 完成以下配置,单击生成拉流地址。
- 地址类型:选择拉流地址。
- 选择域名:选择添加字幕配置时使用的域名空间下的拉流域名。
- AppName 和 StreamName:填写与推流地址一致的
AppName 和 StreamName。例如推流地址为 rtmp://push.example.com/live/test?authinfo,则 AppName 为 live,StreamName 为 test。
- 获取源流地址和转码流地址。

- 源流地址:在获取的源流地址后手动拼接字幕后缀,例如源流地址为
rtmp://pull.example.com/live/test,字幕后缀为 _subtitle,则必须使用 rtmp://pull.example.com/live/test_subtitle 播放包含字幕、同传声音等效果的源流。 - 转码流地址:使用获取的转码流地址,即可播放包含字幕、同传声音等效果的转码流。
- 使用推流地址推送源流,字幕任务会自动启动。确保直播内容中包含清晰、稳定的人声音频。
- 使用以下任一方式,拉取关联了字幕配置的转码流,或添加了字幕后缀的源流,以体验字幕、同传声音等效果。
| 方法 | 场景 | 说明 |
|---|
| 第三方拉流工具 | 无 SDK 开发资源。 | 在第三方拉流工具中,配置拉流地址,播放直播流。详见对应的官方文档或咨询官方客服。 |
| Web 拉流 SDK | 在 Web 浏览器中观看直播。 | 集成 Web 拉流 SDK,在您的网站或 Web 应用中播放直播流。详见功能集成。 |
客户端 SDK | 在移动端自有 App 中观看直播。 | 集成客户端 SDK,在移动端 App 中播放直播流。详见: |
视频直播控制台 | 用于开发或测试阶段的快速预览和调试。 | 在控制台的 Web 拉流页面,输入拉流地址进行快速播放验证。详见Web 拉流。 |
常见问题
为什么我看不到字幕或者字幕配置不生效?
如果您已添加字幕配置,但看不到字幕或字幕配置不生效,请逐一排查以下问题:
- 检查生效时间:字幕配置有 3-5 分钟的生效延迟,请确保您在配置完成后等待了足够长的时间。
- 检查是否重新推流:添加或变更字幕配置后,必须停止旧的推流,然后重新开始一个新的推流才能加载新配置。请确认您已执行此操作。
- 检查源流:确保直播内容中包含清晰、稳定的人声音频。如果直播内容是静音或背景音过于嘈杂,系统将无法识别音频,也就无法生成字幕。
- 检查是否开启字幕功能:如选择声影同传模式,确保已开启字幕配置开关。

- 检查是否开启同传声音功能:开启同传声音功能后,才会提供翻译语音,否则仅会输出原声。

- 检查拉流地址:确保使用正确的拉流地址。拉流地址必须是关联字幕配置的转码流地址,或添加字幕后缀的源流地址。
- 检查原文和译文配置:确保原文语言与源流音频中的语言一致,译文语言为观众所需的语言。
为什么我无法选择转码后缀?

确保您在字幕配置中填写的 AppName,与您想要关联的转码配置的 AppName 一致。
我的直播面向全球观众,如何为他们提供不同语言的字幕?
为同一个 AppName 添加多种译文语言的字幕配置,当您使用该 AppName 推流时,观众即可按需选择字幕语言。
以下示例中,当使用 AppName live 推流时,观众可以切换观看英文字幕、日文字幕和无字幕版本,同时,在每种字幕版本中,可以切换原画、超清和高清档位的清晰度。

- 在转码配置页面,为
AppName live 添加以下转码流后缀的配置:
_uhd(无字幕的超清档位)_hd(无字幕的高清档位)_enuhd(英文字幕的超清档位)_enhd(英文字幕的高清档位)_jpuhd(日文字幕的超清档位)_jphd(日文字幕的高清档位)
- 在字幕配置页面,为
AppName live 添加以下字幕配置:
- 将字幕后缀设置为
_en,关联转码后缀 _enuhd 和 _enhd,并设置译文语言为英文。 - 将字幕后缀设置为
_jp,关联转码后缀 _jpuhd 和 _jphd,并设置译文语言为日文。
- 使用推流地址
rtmp://push.example.com/live/test 推送源流。 - 观众可通过不同的拉流地址,切换不同的语言和清晰度。
一场直播只想开特定语言的字幕,不想启动所有字幕,该怎么做?
默认情况下,在为一个 AppName 配置了多种语言的字幕后,当您使用该 AppName 推流时,系统会自动启动所有关联的字幕任务。这在某些只需要部分语言字幕的场景下,会产生不必要的成本。
为解决此问题,您可以在推流地址中添加以下参数,来精确控制每次推流具体需要开启哪些语言的字幕。
custom_trans:必须携带此参数并设置取值为 1,系统才会识别 trans_suffix 参数。若不携带该参数,系统将默认启动所有关联的字幕任务。trans_suffix:指定本次推流要开启字幕任务的转码后缀或字幕后缀。多个取值之间用英文逗号 (,) 分隔。例如,推流地址是 rtmp://push.example.com/live/test,您为字幕后缀 _en 配置了英文字幕,为转码后缀 _fr 配置了法文字幕,则可使用以下推流地址,只开启英文和法文字幕:rtmp://push.example.com/live/test?custom_trans=1&trans_suffix=_en,_fr。
注意
如果某场直播不需要显示任何字幕,在推流地址仅携带 custom_trans=1 即可,例如 rtmp://push.example.com/live/test?custom_trans=1,此时不收取字幕费用。
声影同传任务与字幕配置的声影同传模式,我应该选择哪个?
声影同传任务与字幕配置的声影同传模式使用相同的翻译模型,翻译效果相同。请根据具体的使用场景,选择合适的模式。
- 如果满足以下场景,建议选择声影同传任务:
- 活动导向:需要为单场或少数几场重要的活动(如发布会、跨国会议)进行同传。
- 需要手动控制:希望在直播过程中,只对特定时段(如海外嘉宾发言时)开启翻译。
- 低延迟需求:体育赛事等对低延迟要求较高的直播场景,可以选择实时同传模式降低延迟。
- 如果您有大量直播间需要常态化、自动化地开启同传功能,建议选择字幕配置的声影同传模式。
我的直播只有字幕,没有语音,能使用字幕功能吗?
不能。字幕功能仅支持识别人声内容并翻译,无法根据原文字幕进行翻译。
字幕功能是否支持翻译弹幕、评论、聊天消息等互动文本?
不支持。字幕功能仅针对直播流中的人声音频进行识别和翻译,不支持对弹幕、评论、聊天消息等互动文本内容进行翻译。
我可以导出字幕文件吗
不可以。视频直播暂不支持导出字幕文件。
我的直播涉及多种语言,例如主播说中文,但直播过程中会唱日文歌曲,能否均翻译为英文?
不可以。目前暂不支持自动检测直播语言,仅支持根据同传任务配置的输入语言和输出语言进行翻译。此类场景下,建议将输入语言设置为主播主要使用的语言(如中文)。在本例中,仅会将中文内容翻译为英文,而日文歌曲部分则仍保留日文。