You need to enable JavaScript to run this app.
文档中心
复制全文
下载 pdf
产品概述
模型列表
复制全文
下载 pdf
模型列表
本文档汇总火山语音各产品线的可用模型及其支持的功能与参数,便于您在调用接口前确认所选模型的能力边界
音频创作
豆包音频生成模型 1.0 (Seed-Audio 1.0) 是业内首个可通过单条 Prompt 直接生成影视级音频的模型,支持文本、音频等多模态输入,显著降低声音创作门槛,兼顾高表现力与全要素覆盖。
注意
如果对某个参考音频较为满意,可使用声音复刻大模型将其训练为专属音色。此后调用时只需传入固定的 Speaker ID,无需每次重复上传同一参考音频。
豆包音频生成模型1.0(简称Seed Audio 1.0)的相关功能说明如下
功能
Seed Audio 1.0
支持语种
中文、英文
可演绎方言口音,但不支持纯方言输出
参考生成限制
  • 文本
  • prompt输入限制3k字符
  • 在 prompt 中,单次用于合成人声的文本建议控制在 400 字符以内;若待合成文本过长,模型可能会在有限时长内加快语速以完成请求
  • 图片:单次支持输入1张图片,支持base64编码或URL传入
  • 音频:最多支持上传3条参考音频
接入方案
非流式http接口
音频时长
最长2min
音频格式
wav / mp3 / pcm / ogg_opus
采样率
8K,16K,24K,48K
SSML
AI生成标识
语音合成
豆包语音合成大模型
基于新一代语音大模型,可将文本转化为自然流畅、富有表现力的高质量语音,广泛适用于智能助手、有声内容、数字人播报、智能客服等多种业务场景。
豆包声音复刻大模型
基于少量参考音频即可完成目标音色的复刻,生成贴近原声的合成音频,适用于个性化音色定制、品牌专属音色等场景。当前主要包含以下模型版本:
  • 豆包声音复刻大模型 seed-icl-2.0支持调用声音复刻接口生成的专属音色进行音频合成
注意
使用豆包声音复刻大模型(ICL)前,需先通过声音复刻接口完成目标音色的训练
豆包语音合成大模型2.0(简称TTS2.0)、豆包声音复刻大模型(简称ICL 2.0)的功能差异对比如下
模型名称
TTS 2.0
ICL 2.0
适用音色
可使用声音复刻接口训练的音色
SSML
仅支持标签
仅支持标签
时间戳
"enable_subtitle":True
Image
Image
语音指令
"context_texts":[]
Image
Image
AIGC生成标识
Image
Image
Latex公式朗读
Image
Image
模型支持语种
语种
TTS 2.0
icl2.0
中(zh)
支持
支持
英(en)
支持
支持
日(ja)
支持
支持
韩(ko)
支持
支持
墨西哥西语(mx)
支持
支持
巴西葡萄牙语(pt-BR)
支持
支持
印尼(id)
支持
支持
马来语(ms)
支持
支持
泰语(th)
支持
支持
越南语(vi)
支持
支持
菲律宾语(fil)
支持
支持
德语(de)
支持
支持
法语(fr)
支持
支持
西班牙西语(es)
支持
支持
俄罗斯语(ru)
支持
支持
阿拉伯(ar)
支持
支持
葡萄牙葡语(pt)
支持
语音识别
豆包流式语音识别模型
豆包流式语音识别模型基于大模型能力,可将音频实时转写为文本,实现 "边说边出字" 的交互体验。模型提供两种调用模式以适配不同业务场景
  • 双向流式:在说话过程中可逐字输出识别结果,并随着语义完整度持续修正,适用于实时会议字幕、直播字幕、智能外呼等需要即时呈现文字的场景。
  • 流式输入:在说完一句话后输出该句的完整识别结果,适用于智能体对话、语音消息转写、语音输入法等以句子为单位处理语音的场景。
按计费方式划分,模型提供以下两个版本:
  • 小时版 volc.seedasr.sauc.duration:按实际语音识别时长计费,支持“资源包预付费”和“按调用后付费”两种计费模式,详见计费说明
  • 并发版 volc.seedasr.sauc.concurrent:按并发数包月付费,不再收取时长费用 ;需在控制台预付费购买并发资源,购买后在并发额度内不限时长使用。
豆包录音文件识别模型
支持将音频文件(<5小时)转写成文本数据,内置自动标点、语义顺滑、数字规整、智能分句等功能,可按需自由组合,适用于非实时的语音识别场景。
豆包录音文件识别模型提供三个版本,可根据对识别时效与成本的不同要求选择
模型版本
豆包录音文件识别标准版
volc.seedasr.auc
豆包录音文件识别极速版
volc.bigasr.auc_turbo
豆包录音文件识别闲时版
volc.bigasr.auc_idle
基本介绍
上传录音文件后,通过查询接口获得结果
上传录音文件后快速返回结果,无需查询
利用闲时算力识别,成本更低
返回时间
适中,3h内返回
极速,30min音频10s返回
较慢,24h内返回
音频时长
<5h
<2h
<5h
文件大小
<512MB
<100MB
<512MB
音频格式
raw / wav / mp3 / ogg
wav / mp3 / ogg
raw / wav / mp3 / ogg
三个版本在功能支持上略有差异,对比如下:
功能项
豆包流式语音识别模型2.0
豆包录音文件识别模型2.0
接入方式
双向流式
流式输入
标准版
极速版
闲时版
支持语种
中英文
中英文、方言、小语种
中英文、方言、小语种
中英文、方言、小语种
中英文、方言、小语种
热词
Image
Image
Image
Image
Image
正则替换词
Image
Image
Image
Image
Image
敏感词过滤
Image
Image
Image
Image
Image
智能分句
Image
Image
Image
Image
Image
字/词时间戳
Image
Image
Image
Image
Image
上下文
Image
Image
Image
Image
Image
语义顺滑
"enable_ddc":True
目前仅支持中英文
Image
Image
Image
Image
Image
文本归一化
"enable_itn":True
开启后:“一九七零年”->“1970年”
Image
Image
Image
Image
Image
双声道识别
Image
Image
Image
Image
Image
输出语音停顿、分句、分词信息
Image
Image
Image
Image
Image
性别检测
Image
Image
Image
Image
Image
语种检测
Image
Image
Image
Image
Image
情绪检测
Image
Image
Image
Image
Image
Function Call
支持音乐、地图领域的推荐词辅助识别
Image
Image
Image
Image
Image
说话人分离
Image
Image
Image
Image
Image
实时语音
豆包端到端实时语音大模型是一款超拟人、低时延的实时语音交互模型,采用端到端架构直接处理语音输入与输出,在保证自然拟人表达的同时显著降低交互延迟,主要用于实现语音对话交互能力。模型支持中文英文两大语种,目前提供以下三个版本:
S2S-全双工版本:具备更精准的意图理解、抗干扰和动态判停能力,能主动参与对话并自然处理插话、停顿及复杂环境噪声。其响应更快、误触发和误打断更少,多轮交流体验更接近真人对话。
S2S-Omni版本(S2S-O版本):面向通用语音交互的端到端低时延模型,引入合规授权曲库,支持唱歌等富媒体表达,适用于闲聊陪伴、智能客服、车载交互等多种场景
S2S-Strong Character版本:面向角色扮演与情感陪伴的强人格模型,内置完善的角色控制指令体系,输出文本可携带角色相关的动作与表情描述,适用于虚拟陪伴、互动剧情、IP 角色对话等场景
功能
全双工版本
O2.0版本
SC2.0版本
判停与抗干扰
Image
Image
Image
精品音色
包含音色:vv、xiaohe、yunzhou、xiaotian
Image
Image
Image
System Prompt配置
Image
Image
Image
复刻音色
支持声音复刻v3接口克隆的音色
Image
Image
Image
唱歌
Image
Image
Image
联网搜索
Image
Image
Image
热词
Image
Image
Image
正则替换词
Image
Image
Image
AIGC内容标识
Image
Image
Image
最近更新时间:2026.09.10 17:11:49
这个页面对您有帮助吗?
有用
有用
无用
无用