You need to enable JavaScript to run this app.
文档中心
AI 数据湖服务

AI 数据湖服务

复制全文
下载 pdf
音频生成
复刻语音合成
复制全文
下载 pdf
复刻语音合成

复刻语音合成算子将输入文本合成为语音音频,支持通过声音风格描述设计音色,也支持基于参考音频进行可控克隆或高保真续写。

算子介绍

算子 ID:las_voice_forge

适用场景

  • 文本转语音:旁白、播报、短视频配音等文本转语音场景。
  • 稳定音色复用:品牌音色、虚拟人、智能客服等稳定音色复用场景。
  • 高保真续写:有提示音频与准确逐字稿的人物声音高保真续写场景。
  • 长音频生成:长文本讲解、课程内容、资讯播报等长音频生成场景。

核心能力

  • 多种语音合成能力:
    • Voice Design 文本控音色:仅通过 style_prompt 描述目标声音风格,无需样音即可生成语音。
    • 可控声音克隆:通过 reference_audio_uri 提供样音,基于样音音色合成目标文本。
    • 高保真声音续写:同时提供 prompt_audio_uriprompt_text,提升音色、语速、韵律一致性。
  • 长文本切分与拼接:支持按自然边界切分长文本、逐段合成并自动拼接。
  • 质量自检与重试:支持在检测到疑似低质量结果时自动重新生成。
  • 多格式音频输出:支持 wav、mp3、ogg_opus、pcm,并可配置采样率和码率。
  • 对象存储落盘:支持多种音频格式,可将结果写入 TOS,并返回音频地址、格式、采样率、时长和字符数等信息。

效果展示

  • 场景1:基于 style-prompt 的声音设计

    "text": "欢迎使用声音复刻算子,这是一个语音合成示例。"
    
  • 输出音频

    无参考音频.wav
    未知大小

场景2:有参考音频的声音克隆

"text": "欢迎使用声音复刻算子,这是一个语音合成示例。"
  • 输入参考音频
    旁白.wav
    未知大小
  • 输出音频
    有参考音频.wav
    未知大小
  • 场景3:高保真音频续写

    "text": "小寨子的日升月落里,重复着平淡的日常,确在细微处留下不一样的故事。"
    
  • 输入提示音频

    旁白.wav
    未知大小

  • 输出音频

    音频续写.wav
    未知大小

支持的地域

  • 北京:cn-beijing

算子性能

细分项
性能影响说明

最大 Submit RPM

5

最大 Poll RPM

300

输入与输出要求

输入要求

细分

详细要求

输入数据模态

  • Text
  • Audio(参考音频、提示音频)

输入格式:文本

  • 输入文本支持 <break time="500ms"/><break time="2s"/> 两种停顿写法,单次停顿最长按 30000 毫秒处理。<break> 标签不会被朗读。
  • 当前不支持完整 SSML,也不支持 <speak><prosody><emphasis> 等其他标签。

输入格式:音频

  • 格式:支持 WAV
  • 大小:不得过 50 MB,时长范围为 0.1 到 300 秒;生产场景建议使用单人、清晰、低噪、约 5 到 15 秒的音频。
  • 其他:
    • 参考音频:通过 reference_audio_uri 请求参数输入给模型参考音频,适用于基于参考音频进行声音克隆的场景。
    • 提示音频:
      • 通过 prompt_audio_uri 请求参数输入给模型提示音频,且需要同时输入 prompt_text(提示音频对应的精确文本),可进一步提升输出音频的音色、语速、韵律与提示音频的一致性。
      • 此场景下以提示音频的声音和表达方式合成新音频,不支持再配置 style_prompt 来指定生成音频的风格。

输入路径

通过请求参数 reference_audio_uriprompt_audio_uri提供给算子输入数据,当前支持公网 URL、TOS 路径这两种方式。

  • 公网 URL:公网可访问的音频 URL,格式为 http/https
    • 公网 URL 不支持需要登录态或额外 Header 鉴权的地址;临时 URL 需在任务执行期间有效。
  • TOS 路径:将待处理数据上传至与当前 LAS 服务同主账号、同地域的 TOS Bucket后,可提供 TOS 路径,格式为tos://bucket_name/demo
    • TOS 对象需存在且具备读取权限。

输出要求

细分

详细要求

输出数据模态

  • Audio

输出格式:音频

  • 格式:支持 wavmp3ogg_opuspcm
  • 其他:pcm 输出为无 WAV 头的裸 s16le 单声道流,下游需要结合 sample_rate 解码。bit_ratewav / pcm 不生效。

输出路径:对象存储

通过请求参数 output_object_storage_dir 指定算子输出结果的存储路径,当前支持设置为 TOS 路径。

  • TOS 路径:与LAS服务同主账号、同地域下,有可写权限的 TOS Bucket 目录,格式:tos://bucket/output/

计费说明
  • 计费标准

    细分项
    计费标准说明

    计费项

    基于原始请求文本字符数统计用量,进行计费。

    计费类型

    按量计费,单位:元/万字符,按实际的计费用量每小时出账。

    单价

    1.5 元/万字符

注意与前提

细分项

注意与前提

开通 LAS

  • 如果您是一个全新的火山引擎用户,此前未开通过 LAS 产品,您可先开通 LAS,不使用 LAS 的计费功能仅开通 LAS 产品不会产生费用。开通操作请参见准备工作
  • 开通完成后可查看算子介绍文档,了解算子能力、上手引导等,详情可参见:LAS 智能数据处理算子

费用

调用算子前,您需先了解使用算子时的模型调用费用,详情请参见大模型调用计费

鉴权(API Key)

调用算子前,您需要先生成算子调用的API Key,并建议将API Key配置为环境变量,便于更安全地调用算子,详情请参见获取 API Key 并配置

BaseURL

调用算子前,您需要先根据您当前使用的LAS服务所在地域,了解算子调用的BaseURL,用于配置算子调用路径参数取值。
详情请参见获取 Base URL,下文中的调用示例仅作为参考,实际调用时需替换为您对应地域的路径取值。

Rest API 调用

API 调用说明

  • 本算子的 API 为异步任务接口,您需要通过 Submit 接口提交任务获得任务的 task_id,再通过 Poll 接口获取对应任务(task_id)运行状态,并获取算子处理结果。
  • 注意,任务提交后,任务的 task_id 有效期为 3 天,超过 3 天后即无法通过此 task_id 来获取算子处理结果。

Submit

接口说明

提交 las_voice_forge 声音复刻 / 语音合成任务。接口返回异步任务 ID,任务完成后需通过 Poll 接口查询合成结果。

请求参数

参数
类型
是否必填
示例值
描述
operator_id
string
las_voice_forge
算子 ID,固定为 las_voice_forge
operator_version
string
v1
算子版本,固定为 v1
data
VoiceForgeUserReqParams
复刻语音合成业务参数。
callback
object
{"url":"https://example.com/callback"}
任务终态回调配置,回调地址为 callback.url;不传则通过 Poll 获取结果。
pending_timeout_minutes
integer
60
PENDING 排队超时分钟数,范围 30 到 4320;超时后任务进入 EXPIRED

返回数据

参数
类型
示例值
描述
metadata
Metadata
请求元信息。

示例

请求示例

curl --location "https://operator.las.cn-beijing.volces.com/api/v1/submit" \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $LAS_API_KEY" \
--data '{
    "operator_id": "las_voice_forge",
    "operator_version": "v1",
    "data": {
        "req_params": {
            "text": "欢迎使用声音复刻算子,这是一个语音合成示例。",
            "audio_params": {
                "format": "wav",
                "sample_rate": 48000
            }
        },
        "engine_params": {
            "style_prompt": "沉稳专业的男声,语速适中"
        },
        "service_params": {
            "response_mode": "audio_uri"
        }
    },
    "pending_timeout_minutes": 60
}'

返回示例

{
  "metadata": {
    "task_id": "ffb57ea6450c894f354c",
    "task_status": "PENDING",
    "business_code": "0",
    "error_msg": ""
  }
}

错误码

HttpStatusCode

错误码

错误信息

描述

400

Parameter.Invalid

The parameter is invalid.

字段类型、枚举、数值范围或参数依赖不正确。

400

Operator.InvalidId

The operator id is invalid.

operator_id 不正确或不可用。

400

Operator.InvalidVersion

The operator version is invalid.

operator_version 不正确。

400

Tts.InvalidText

The synthesis text is empty after cleaning.

文本为空或处理后为空。

400

Tts.TextTooLong

The synthesis text exceeds the maximum length.

文本超过允许长度。

400

Tts.TooManySegments

The synthesis text has too many segments.

长文本切分段数过多。

400

Tts.ReferenceAudioInvalid

The reference audio is invalid.

参考或提示音频地址、格式或内容不符合要求。

400

Tts.ReferenceAudioRequired

Reference audio is required.

当前合成方式缺少所需的参考音频。

400

Tts.InvalidRequest

The TTS request is invalid.

参数组合不正确,例如 prompt_audio_uriprompt_text 未同时提供。

401

Authorization.Missing

Missing Authorization.

缺少鉴权信息。

401

ApiKey.Invalid

The api key is invalid.

API Key 无效。

429

Server.Busy

Server is Busy, please try again later.

服务繁忙或限流。

500

Tts.InternalError

TTS Internal Error

语音合成服务异常。

500

Tts.AudioSaveFailed

Failed to transcode or persist the audio.

音频转码或保存失败。

500

Tts.EngineLoadFailed

The synthesis engine failed to load.

合成服务暂不可用。

500

Tts.EngineGpuOom

The synthesis engine ran out of GPU memory.

合成资源不足。

500

Tts.RequestTimeout

The synthesis request timed out.

合成任务超时。

Poll

接口说明

通过任务 ID 查询 las_voice_forge 声音复刻 / 语音合成任务的状态和结果。任务完成后返回音频地址、音频格式、采样率、时长等信息。

请求参数

名称

类型

是否必选

示例值

描述

operator_id

string

las_voice_forge

算子 ID,固定为 las_voice_forge

operator_version

string

v1

算子版本,固定为 v1

task_id

string

ffb57ea6450c894f354c

Submit 接口返回的异步任务 ID。

返回数据

参数
类型
示例值
描述
metadata
Metadata
请求元信息与任务状态。
data
VoiceForgeUserResp
任务完成后的语音合成结果。

示例

请求示例

curl --location "https://operator.las.cn-beijing.volces.com/api/v1/poll" \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $LAS_API_KEY" \
--data '{
    "operator_id": "las_voice_forge",
    "operator_version": "v1",
    "task_id": "ffb57ea6450c894f354c"
}'

返回示例

{
  "metadata": {
    "task_id": "ffb57ea6450c894f354c",
    "task_status": "COMPLETED",
    "submit_time": "2026-07-21T16:04:06+08:00",
    "end_time": "2026-07-21T16:04:09+08:00",
    "business_code": "0",
    "error_msg": ""
  },
  "data": {
    "data": "",
    "audio_uri": "https://example-bucket.tos-cn-beijing.volces.com/voice_forge/tts/demo.wav?X-Tos-Signature=...",
    "audio_format": "wav",
    "sample_rate": 48000,
    "duration_sec": 3.04,
    "text_chars": 11,
    "segment_count": 1,
    "reference_audio_used": true
  }
}

错误码

HttpStatusCode

错误码

错误信息

描述

400

TaskId.Invalid

The task id is invalid.

任务 ID 为空、不存在或无权访问。

400

Parameter.Invalid

The parameter is invalid.

参数校验失败或任务结果解析失败。

400

Tts.InvalidText

The synthesis text is empty after cleaning.

文本为空或处理后为空。

400

Tts.TextTooLong

The synthesis text exceeds the maximum length.

文本超过允许长度。

400

Tts.TooManySegments

The synthesis text has too many segments.

长文本切分段数过多。

400

Tts.InvalidRequest

The TTS request is invalid.

请求参数组合不正确。

400

Tts.ReferenceAudioInvalid

The reference audio is invalid.

参考或提示音频不符合要求。

401

Authorization.Missing

Missing Authorization.

缺少鉴权信息。

401

ApiKey.Invalid

The api key is invalid.

API Key 无效。

429

Server.Busy

Server is Busy, please try again later.

服务繁忙或限流。

500

Server.InternalError

General Internal Error

服务端内部错误。

500

Tts.InternalError

TTS Internal Error

语音合成服务异常。

500

Tts.AudioSaveFailed

Failed to transcode or persist the audio.

音频转码或保存失败。

500

Tts.EngineLoadFailed

The synthesis engine failed to load.

合成服务暂不可用。

500

Tts.EngineGpuOom

The synthesis engine ran out of GPU memory.

合成资源不足。

500

Tts.RequestTimeout

The synthesis request timed out.

合成任务超时。

最近更新时间:2026.08.18 15:31:10
这个页面对您有帮助吗?
有用
有用
无用
无用