You need to enable JavaScript to run this app.
文档中心
复制全文
下载 pdf
产品概述
产品简介
复制全文
下载 pdf
产品简介
本文为您介绍火山引擎智能豆包语音的产品体系、核心能力与典型应用场景,并提供各产品的能力预览 Demo,帮助您快速了解并选择最适合业务需求的语音产品。
音频创作
基本介绍
豆包音频生成模型 1.0 (Seed-Audio 1.0) 是业内首个可通过单条 Prompt 直接生成影视级音频的模型,支持文本、音频等多模态输入,显著降低声音创作门槛,兼顾高表现力与全要素覆盖。
核心优势
  • 0 样本多模态生成: 基于文本、图片、参考音频等数据,通过自然语言指导音频生成,大幅降低音色打造与效果调优的门槛
  • 影视级多轨混音
  • 单条指令即可定义多角色台词、语气与情绪节奏,自动完成时序编排与转场衔接
  • 笑声、叹息、停顿、方言口音等副语言细节可直接写入 Prompt 精准还原
  • 背景音乐、环境音效与人声一体化生成,无需额外混音软件,输出即成品
  • 长时音色一致性: 通过音色复刻方式,在长音频中保持音色统一,解决有声书、播客、长剧集等长程生成场景下音色不稳定的问题
应用场景
  • 音视频创作 / 编辑: 面向短视频、广告、电商配音,可短时间内打造海量音色,让用户低门槛、便捷地创建适配自己视频的声音,并对合成效果 (风格、情感、局部修改) 灵活可控,实现语音、背景音乐与音效的一站式生成。
  • 有声书: 面向有声小说、多播、有声剧生产,可替代真人声优录音,大幅降低人工录制成本,快速产出高质量有声内容。
  • 游戏配音: 替代部分真人录音,以更强的可控性适配多角色、多情绪的游戏场景,并支持语音、背景音乐与音效的一站式生成。
  • AI 播客生产: 快速生成多角色对谈音频,降低制作门槛,让播客内容实现规模化、批量化产出
能力预览
类型
标题
Prompt & 参考音频
demo
文生音频
悬疑刑侦片
先是一声手机震动的声音,环境中持续的鸟鸣声。音乐以马林巴为主奏乐器,加入合成器lead、电贝斯、打击乐,整体情绪紧张悬疑。男子1(中青年男性,台湾口音,嗓音低沉,浑厚)用严肃语气说道:“钟sir,你是什么时候被收买的?” 男子2(中年男性,台湾口音,嗓音沙哑,成熟)平静无奈的语气说:“既然你都知道了,我也没有什么好隐瞒的。阿标手上有些证据,搭配上李勋的人证,足够让青龙帮垮台。”男子1继续追问,语气中带着怀疑困惑:“你现在说这些,是要我继续相信你?”男子2以一种告诫的口吻说:“信不信都无所谓。我打来只是想提醒你,阿标已经失去耐心,最好待在男公馆别乱跑。在那里,青龙帮的人,不敢轻举妄动。”男子1简短地问道:“为什么?”男子2解释道:“据说跟青龙帮的帮规有关,细节我也不清楚。只知道男公馆对他们来说,是个不能动手的地方。”男子1的语气变得更加尖锐和不解,他说:“我就当你被阿标收买了,那你打这通电话的意图是什么?不是应该希望李峋落入他们手里吗?”男子2的声音听起来充满了无力感和宿命感,他缓缓说道:“有些事,不是我能选择的。宇川,这是我唯一能做的。保护好李峋,也保重自己。”然后出现一阵轻微的汽车行驶声,接着是一声轻微的汽车刹车声,随后是两声高跟鞋走路脚步声。
0:00 / 0:00
灵山宣战
音乐以合成器pad铺底,同时有合成打击乐、弦乐组、管乐组合奏,整体情绪紧张悬疑,先是一声沉闷的类似钟声“咚”的特效音,并伴随着一阵长时间的低频氛围音效,然后是一声尖锐的风声呼啸而过的特效音,紧接着是一声沉重的石门机关开启声,随后又是一声快速闪过的风声特效音,再出现连续两声的类似于“咻”的法术闪过特效音,之后是一声较长的类似于“唰”的转场特效音,再出现一声类似于“咻”的法术闪过特效音,最后是一声类似于“呼”的风声转场特效音。六耳猕猴(青年男性,嗓音偏尖细,沙哑,张扬,奇幻电影)声音有混响感,用一种非常得意和满足的语气说道:“爽!这斗战胜佛的位置,坐着就是舒服,嘿嘿嘿。”对话中夹杂着一声类似于“唰”的法术闪过特效音,然后是一声轻微的走路脚步声,接着是一声跳跃落地的声音,紧跟着是两声布鞋在地面摩擦的脚步声,如来佛祖(中年男性,嗓音浑厚,沉稳,有力,威严,庄重)声音整体带有明显回响,语速平缓,语气庄重地说道:“斗战胜佛入我沙门一年,斩妖除魔,功德无量,今日,特赐汝九转金莲一株,以示嘉奖。”对话中夹杂着一声类似于“唰”的法术闪过特效音,然后是一阵多人布鞋走路脚步声,六耳猕猴先是发出一阵用力的呼喝声,接着语气变得恭敬而正式,回应道:“弟子,谢佛祖恩典。”对话后先是一声沉闷的雷声,然后是一阵多人慌乱的跑步脚步声,接着是一声类似于“哗”的法术爆炸特效音,再出现一声金属嗡鸣声,众人发出惊慌失措的呼喊声。男子1(中年男性,嗓音低沉,气质成熟)用惊慌的语气问道:“发生什么事了?”对话中夹杂着一声多人摔倒在地的声音,然后是一声沉闷的爆炸声,接着是一阵持续的电流声,六耳猕猴疑惑的“嗯?”了一声。然后出现一声类似于“呼”的风声转场特效音,男子2(中年男性,嗓音低沉,气质沉稳)用困惑且警惕的语气问道:“怎么回事儿?”对话中夹杂着一声沉闷的爆炸声,然后是一阵多人痛苦的尖叫声,接着是一声重物落地的撞击声,再出现一声爆炸声,男子3(中老年男性,声音低沉,沙哑,威严感)用惊慌但霸气的语气问道:“敌袭!何方妖孽敢擅闯灵山!”对话中夹杂着一声多人摔倒在地的声音,然后是一声沉闷的爆炸声,接着是一阵持续的电流声,观音菩萨(中青年女性,嗓音柔和,温柔,知性)轻声的“啊”了一声。然后出现一声类似于“呼”的风声转场特效音,紧接着是一声巨大的石门被撞开的破碎声,男子4(中年男性,嗓音沙哑,成熟)用震惊地语气说道:“这是?”其中夹杂着多人的惊呼声。如来佛祖用震惊的语气说:“这股气息…”音乐以弦乐组合奏为主,加入中国大鼓,整体情绪紧张激烈对话中夹杂着一声沉闷的爆炸声,然后是一阵多人痛苦的尖叫声和惊呼声,接着是一声重物落地的撞击声,再出现一声爆炸声,须菩提(老年男性,嗓音低沉,沙哑,苍老,气质沉稳)声音带有回响,充满了压抑已久的愤怒,说道:“当初,汝等言他是妖猴,吾忍了,后来,汝等压他五百年,吾忍了,如今,汝等是非不分真假不明,害我徒儿枉死,让这只六耳冒名顶替,这口气,吾若是再忍,枉为师表,吾徒悟空何在?今日,为师来为他,”接着音量提高,一字一句地说道:“找回公道!”对话中夹杂着一声沉闷的爆炸声,然后是一阵多人痛苦的尖叫声,接着是一声重物落地的撞击声,再出现一声爆炸声,然后出现一声类似于“呼”的风声转场特效音,紧接着是一阵急促的跑步声,最后出现一声类似于“呼”的风声转场特效音。六耳猕猴显示一阵害怕地惊呼,然后用惊讶和不解的语气问道:“佛祖,这,这是谁?”如来佛祖的声音充满了力量和威严,一字一顿地说道:“斜月三星洞,”接着音量提高,大喊道:“须菩提!”
0:00 / 0:00
电商直播带货
背景音乐极其微弱,以东北风格为主,女声演唱,整体音乐氛围热闹积极。带货主播1(青年女声,声音明亮,带有东北口音,热情)状态积极、仔细且设身处地的为直播间观众介绍道:"金黄色的,这一定是很好的这个品质榴莲,那我进来瞅一眼吧。"期间穿插着带货主播2(青年女声,声线温柔甜美)认同的"对"的声音。带货主播1继续热情高亢的介绍道:"A加级别的树熟的当地国的这一个,金枕头榴莲肉儿。"这是带货主播2也补充说道:"金枕"带货主播1接着说道:"而且是带核榴莲肉朋友们,不是属于把那个里面的那个核给您抠出去的。其实人为干预越少,您可能吃着更安心一点儿点儿,并且呢它放得住,保质期是18个月呢。"还有碰触塑料包装袋发出的声音。同时带货主播1继续推销道:"啊,所以就是看您家里冰箱冷冻层的地方了。要是真有地方,我建议大家能买两包儿,不买一包儿。"带货主播1接着说:"因为买两包儿我们还有一个10块钱的小优惠,还有一个10块钱的小优惠。你看噼里啪啦已经在把1打在公屏上。"说到这时语气搞怪地说道:"熟练地让人心疼。"期间不停地穿插着带货主播2的赞同附和声:"对""嗯"。带货主播2(青年女声,声线温柔甜美)笑着赞同道:"哎呦,是"带货主播1继续强调道:"熟练地让人心疼。"
0:00 / 0:00
参考音频生成
爷爷宠溺独白
参考音频
0:00 / 0:00
Prompt
爷爷(70岁以上,沙哑沧桑的音色,温和慈祥,气息不稳,饰演者为@音频1 )整体节奏缓慢有适当的停顿,声音偶发颤抖,语气充满了慈爱和宠溺,带着笑意说道:"好嘞,那爷爷就来偏爱小丸子吧!就算世界上所有人全都不偏爱小丸子,可爷爷我仍然会最最最最偏爱丸子你呀!5月真好啊!马上就是丸子的生日啦!嗯,那今天爷爷什么都买给你!"
0:00 / 0:00
技术讲解
参考音频
0:00 / 0:00
Prompt
中年男性(35-40岁,嗓音低沉,略微沙哑,轻微气泡音,有口音,说话期间会不时的吸、咽口水,饰演者为@音频1 )
语速稍微偏快,语气沉稳而肯定的说道:"Java它…Java这块就不…不需要…因为Java本身有一个释放机制、垃圾回收机制,它都不需要你自己处理了,它自动回收机制。但是C++这块代码这是个难点,像你说这些内存的…把那对象进行存储,还有释放。呃……这块需要你在代码里面要体现出来,所以说这个是个难点啊。呃…是个难点,容易犯错的地方。很多人…做C++这么多年,很多人…做过C++多少年的甚至10年的人,他这块…一个指针、一个是内存这块,他都代码经常犯错。这种…就是我了解的,就是一些那个…我们这些同行里头,他们经常都犯错。所以说,所以我认为C++这块吧…它的器械电子、精工行业、工业方面制造比…应用比较广一些。呃…是…我…觉得它技术含量…还是比…尽管它更新没有比较慢些,它技术含量比Java…还是大多了,对。"语言组织得不好,说起话来有些吞吞吐吐,偶尔还有一些无法分辨的说话内容。
0:00 / 0:00
语音合成
基本介绍
模型适用参数、支持的语种可参考模型列表文档
基于新一代语音大模型,可根据上下文自动理解文本的情绪与语调,合成富有表现力的音频,支持中、英、日、西等多语种及多种方言口音
核心优势
  • 情感自然演绎:根据上下文智能预测文本情绪与语调,实现自然情感表达
  • 高自然度:在口语自然度、连贯性、拟人度、音质、韵律、气口、情感、语气词表达等各方面,可以带来更生动、更具情感表现力的听觉体验;
  • 多风格:提供 130+ 款超自然音色,涵盖趣味口音、角色扮演、客服等多种风格
应用场景
  • 聊天陪伴: 适用于 AI 助手、情感陪聊等场景,提供拟真人的交互体验
  • 有声阅读: 支持笑声、哭腔等副语言表达,让有声书与小说演绎更加真实生动
  • 音视频配音: 覆盖短视频剪辑、广告营销、新闻播报、电商带货等内容创作场景
  • 数字人播报: 与虚拟形象配合,实现自然的口型驱动与情感同步
  • 在线教育: 可复刻教师音色,标准化讲解内容,减轻重复授课负担。
  • 智能客服与外呼: 以接近真人客服的自然播报,服务于咨询应答、回访关怀等场景。
能力预览
立即体验:前往体验中心,即刻开始语音合成,体验豆包语音合成能力
应用场景
speaker_id
文案
demo
AI对话助手
少年梓辛2.0
zh_male_shaonianzixin_uranus_bigtts
您好!我是您的 AI助手,随时准备为您服务。无论是解答疑惑、提供创意,还是陪您闲聊,都没问题。
0:00 / 0:00
客服场景
温婉珊珊2.0
saturn_zh_female_wenwanshanshan_cs_tob
今天也辛苦啦,先放下手里的事,泡一杯热茶,坐下来歇一会儿,我陪你说说话
0:00 / 0:00
语音闲聊
爽快思思2.0
zh_female_shuangkuaisisi_uranus_bigtts
走啦走啦!天这么好,别在屋里闷着,咱出去溜达溜达,买杯奶茶,再看看去哪里玩
0:00 / 0:00
语音闲聊
温暖阿虎/Alvin 2.0
zh_male_wennuanahu_uranus_bigtts
So what do you wanna talk about? Sports, music, or maybe that movie you watched last weekend? I'm all ears
0:00 / 0:00
角色演绎
调皮公主
saturn_zh_female_tiaopigongzhu_tob
哈哈,看我把这皇宫搅得鸡飞狗跳,他们肯定拿我没办法
0:00 / 0:00
角色演绎
悠悠君子2.0
zh_male_youyoujunzi_uranus_bigtts
春日的午后,翻开一卷旧书,茶香袅袅,光阴静好。文字与心意之间,自有山川湖海。
0:00 / 0:00
声音复刻
基本介绍
模型适用参数、支持的语种可参考模型列表文档
大模型声音复刻提供轻量级的音色定制能力。在普通环境下录制最短5s音频,即可快速生成与本人音色、说话风格、口音相一致的专属音色,并保留原始录音的声学环境特征,用于后续的语音合成
核心优势
  • 快速复刻:最短录制5s音频即可启动复刻,音频上传后,秒级完成复刻,几乎无等待时延,可立即调用合成试听
  • 高度还原:精准还原说话人的音色、说话风格、口音及声学环境
  • 低成本调优:如果复刻效果不满意,可更换音频重新训练,每个音色最多支持 10 次训练
  • 跨语种迁移:支持合成跨语种语音,支持中文、英文、日语、西班牙语(墨西哥口音)、葡萄牙语(巴西口音)、印尼语,让声音轻松 "说外语"
应用场景
  • 视频配音:复刻 IP、搞怪等特色声音,丰富创作形式,提升内容生产效率。
  • 数字人驱动:与数字人形象定制结合,实现 "形象 + 声音" 一体化的个性化形象方案。
  • 语音助手:定制具有品牌或情感属性的交互音色(如家人、朋友的声音),可用于手机助手、导航播报、游戏语音等场景,带来更具特色的交互体验。
  • 在线教育:复刻教师音色,替代重复性、标准化的讲解工作,提高授课效率,同时缓解长时间授课带来的咽喉负担。
  • 有声书:以家人或朋友的声音陪伴用户阅读,打造温暖、亲切且高度定制化的听书体验。
能力预览
立即体验:前往体验中心,即刻开始录制或上传音频,体验豆包声音复刻能力
原音频
复刻效果
中文-素人
0:00 / 0:00
0:00 / 0:00
中文-少女音
0:00 / 0:00
0:00 / 0:00
中文-ip
0:00 / 0:00
0:00 / 0:00
英文-ip
0:00 / 0:00
0:00 / 0:00
英文-素人
0:00 / 0:00
0:00 / 0:00
注意
  • 新版本随机性:受模型自身特性影响,对于表现力强、韵律起伏明显的音色,同一句文本多次合成可能呈现不同的效果,您可根据场景需要灵活运用
  • 实践建议:为获得最佳复刻效果,建议使用 10–15 秒、低噪声、情感平稳的音频作为Prompt,更多细节请参考声音复刻ICL-最佳实践
语音识别
基本介绍
语音识别(ASR)是一项将音频中的人声内容自动转写为文字的能力,广泛应用于会议记录、字幕生成、语音交互、内容质检等场景。通用语音识别在高品质语音输入下通常能达到较高的转写准确率,但在实际场景中,受环境、语境及垂直领域复杂性的影响,仍存在以下难点:
  • 噪声环境下识别性能显著下降
  • 同音字词难以准确区分
  • 专有名词识别能力有限,如地名、行业术语等
  • 上下文一致性难以保证,如人名、"他 / 她 / 它" 等代词的连贯指代
基于此,火山引擎语音识别大模型全新升级,可在嘈杂、专业、多轮对话等复杂场景下稳定输出准确、连贯的转写结果,目前大模型语音识别提供两种识别模式:
  • 双向流式模式:支持长音频实时转写,实现边说边出字的效果,适用于实时会议字幕、直播字幕、智能外呼等场景
  • 流式输入模式:以流式方式接收音频输入,按句返回识别结果,适用于智能体对话、IM 语音消息转写、语音输入法等场景
  1. 大模型录音文件识别:支持时长不超过 4 小时的音频文件转写,内置自动标点、语义顺滑、数字规整、智能分句等功能,可按需组合启用。适用于会议纪要整理、智能外呼质检、课后教辅与学情分析等非实时场景
核心优势
  • 超高准确率:与业界主流语音识别大模型相比,转写错误率更低,在多类公开测试集与真实业务场景中均表现稳定
  • 上下文感知:模型可结合历史对话、视频编辑记录、会议参与信息等多维上下文进行推理,在长对话、多轮交互等场景下,输出结果更准确、更连贯
  • 多方言识别:支持识别普通话与多种方言,包括上海话、闽南语,四川、陕西、粤语等国内主流方言
应用场景
  • 语音交互:实时将语音转写为文字,作为设备、硬件或应用的输入信号,提升人机交互的便捷性与响应速度
  • 内容审核与质检: 将通话或音频内容转写为文本,结合质检规则进行违规识别与处置;也可基于文本开展数据分析,挖掘潜在的业务机会
  • 会议与访谈转写:支持会议、访谈音频的实时或异步转写,自动切分有效语音段并按句分段,显著提升会议记录与内容整理效率
  • 游戏语音与输入法:在游戏内语音、手机输入法等场景下提供 "边说边出字" 的实时体验,降低文字输入成本,提高沟通效率
  • 音视频字幕生成:自动将音视频中的语音和歌词识别为文本,一键生成对应字幕,适用于视频剪辑、视频观看、视频会议等多种场景
能力预览
立即体验:前往体验中心,即刻开始录制或上传音频,体验豆包语音识别能力
场景
人名、上下文推理
专业名词、上下文推理
多方言混合识别
DEMO
Replay
Play
00:00 / 00:00 Live
00:00
Fullscreen
Cssfullscreen
1x
  • 2x
  • 1.5x
  • 1x
  • 0.75x
  • 0.5x
Click and hold to drag
Replay
Play
00:00 / 00:00 Live
00:00
Fullscreen
Cssfullscreen
1x
  • 2x
  • 1.5x
  • 1x
  • 0.75x
  • 0.5x
Click and hold to drag
Replay
Play
00:00 / 00:45 Live
00:00
Fullscreen
Cssfullscreen
1x
  • 2x
  • 1.5x
  • 1x
  • 0.75x
  • 0.5x
Click and hold to drag
实时语音
基本介绍
豆包端到端实时语音大模型是一款超拟人、低时延的实时语音交互模型,基于 Speech2Speech 端到端框架将语音与文本模态深度融合,可在语音对话中提供接近真人的表达效果与流畅的交互节奏。
模型优势
相较于传统对话链路,端到端实时语音模型在架构、对话效果、指令控制与时延等方面均有显著优势
对比纬度
豆包实时语音模型
传统级联对话链路
模型架构
采用 Speech2Speech 端到端框架,原生融合语音与文本模态,统一完成语音理解与生成
ASR → LLM → TTS 三段式串联,即语音先写转文本,将转写的文本送入LLM生成对话回复,再由文本生成语音
对话自然度
  1. 更接近真人在语音聊天中的对话口语习惯和语音表现力
  1. 情感理解能力更强,对情感的适时表达有模型自己的理解
  1. 模型会根据对语义的理解进行声音的氛围渲染和声线切换
  1. 对话节奏丝滑,支持更自然的打断
  • 对用户的情绪以及副语言信息的理解有限
  • 语音表现力与情感上限较低
指令遵循
支持通过自然语言对情绪、语速、音量、声线、风格等进行精细控制,且具有涌现能力
较难实现用户的深度声音控制和演绎指令
响应时延
超低时延,接近真人对话节奏
无法实现超低延迟,一般对话时延2秒以上
扩展能力
支持唱歌、方言、口音模仿、角色扮演等多样化表达
——
应用场景
情感陪聊:智商情商双在线,依托超自然的对话效果与极低时延,对用户的各类情感诉求给予深度共情与温暖承接,无论是鼓励、关心还是遗憾,都能恰到好处地接住,成为用户随时可聊的贴心密友
儿童与老人陪伴:具备出色的方言识别能力,可轻松应对全国主流方言对话;支持悄悄话、唱歌、风格模仿、讲故事等丰富表达,让孩子拥有一个会玩会闹的好玩伴,让老人多一位耐心倾听的好伙伴
语音助手:兼顾高智商与情感表达,可作为手机、智能座舱、可穿戴设备等场景下的语音助手,为用户提供高效、自然且富有温度的交互体验
智能语音外呼: 在产品介绍、价格沟通、客户回访、问题答疑、情绪安抚等外呼场景下,可呈现接近真人客服的对话表现,胜任更复杂的业务沟通任务,并为人工坐席提供有效辅助
能力预览
立即体验:前往体验中心,即刻开始语音对话,体验豆包实时语音能力
Feature
拟人对话
指令控制
声线模仿
唱歌
DEMO
Replay
Play
00:00 / 00:00 Live
00:00
Fullscreen
Cssfullscreen
1x
  • 2x
  • 1.5x
  • 1x
  • 0.75x
  • 0.5x
Click and hold to drag
Replay
Play
00:00 / 00:00 Live
00:00
Fullscreen
Cssfullscreen
1x
  • 2x
  • 1.5x
  • 1x
  • 0.75x
  • 0.5x
Click and hold to drag
Replay
Play
00:00 / 00:00 Live
00:00
Fullscreen
Cssfullscreen
1x
  • 2x
  • 1.5x
  • 1x
  • 0.75x
  • 0.5x
Click and hold to drag
Replay
Play
00:00 / 00:00 Live
00:00
Fullscreen
Cssfullscreen
1x
  • 2x
  • 1.5x
  • 1x
  • 0.75x
  • 0.5x
Click and hold to drag
音色设计
基本介绍
豆包音色设计模型支持文本与图片双模态输入,为用户设计专属音色。用户既可以通过自然语言描述年龄、性别、声线、情感、风格等维度生成音色,也可以直接上传角色图片,由模型自动生成贴合人物形象的音色
核心优势
  • 图生音色:上传角色图片即可一键生成贴合形象的音色,可直接复用视频参考图或视频截图,无需人工二次描述,有效解决 AI 剧、短剧、故事片等场景中 "角色音色难找、版权风险高" 的痛点
  • 文生音色:用一句话描述角色名、年龄性别、人设职业、口音语言、声线气质、风格场景,以及情绪、语速、语调、音量等维度,即可生成声线、口音、情绪与韵律均贴合角色的专属音色
  • 轻松接入:生成的音色 ID 可直接用于声音复刻合成与长文本合成,推理接口无需变更;存量客户还可复用已购音色槽位的剩余次数进行音色设计,接入成本低
应用场景
  • 数字人 / 视频配音:为不同角色打造专属音色,适用于视频剪辑、广告营销、新闻播报、电商带货等场景。
  • 有声小说: 为小说中的不同角色设计贴合音色,提升有声播报的代入感。
  • 情感陪伴 (APP / 硬件): 生成风格贴合的拟人音色,为陪伴类 APP 与智能硬件提供共情交互体验。
  • 语音助手: 支持厂商预设或用户自定义音色,为手机、耳机、眼镜、音箱、手表等终端带来拟真人的语音交互。
能力预览
立即体验:前往体验中心,即刻开始语音对话,体验豆包实时语音能力
场景
输入图片
风格预测
效果demo
影视类
星象师(男性中年40-50岁、沉稳有磁性带威严、普通话、庄重古典) 语速中等偏慢、语调起伏较大、愤怒痛心地质问道:“我绘星象助你避灾,你却用星轨布杀阵!长公主,紫微垣的星光落进你眼里......怎么就化成了鸩毒?”
0:00 / 0:00
后宫高位妃嫔(女性25-35岁、沉稳威严略带清冷、普通话、端庄威严风格) 语速适中,语调偏低沉,严肃警示地说道:“后宫之中,最忌讳的就是喜怒形于色,让别人轻易猜到你的心思。”
0:00 / 0:00
动漫/虚拟IP
粉色马尾战术少女(女性18-25岁、清澈有活力略带干练、普通话、热情动员) 稍快但清晰、语调偏高富有感染力、激昂充满热情、宣传式号召:“加入舰队,一起上天吧!为了全人类的福祉,开荒拓野,勇往直前。大夏联盟的顶级舰队——红鳞舰队,我们是你的不二选择!”
0:00 / 0:00
营销
田间促销员(男性30-40岁,洪亮、富有感染力,普通话,营销推广风格) 语速较快,语调上扬,热情兴奋,大声吆喝:“快快加入我们,一起AI致富。”
0:00 / 0:00
日常类
雪地青年(男性18-25岁、干净清冽、普通话、日常自语) 语速适中,语调平和偏低,情绪平静释然,自然讲述:“最近生活有点乱,出来走走,想让脑子透透气。就这么一个人待会儿,也挺好。”
0:00 / 0:00
语音播客
基本介绍
豆包语音播客模型基于豆包端到端实时语音大模型(S2S)构建,可将输入文本自动提炼为双人对话形式的口语化文本,并生成对应的双人播客音频。同时,播客模型支持模拟真人对话中的附和、停顿、衔接等交互细节,并可对接深度搜索能力,整体效果接近专业播客录制水准
核心优势
  • 高语音自然度:在合成结果中保留附和、停顿、语气词、呼吸等口语化特征,对话听感自然,接近专业播客录制效果
  • 高效内容生成:基于端到端链路一键生成,无需人工录制即可输出双人对话播客,显著降低内容生产成本
  • 时效信息覆盖:集成深度搜索能力,输入热点话题后可快速生成基于最新资讯的播客音频,满足时效性内容生产需求
应用场景
  • 播客创作平台:为播客类 APP 或 SaaS 平台提供 AI 播客生成能力,丰富内容供给,降低创作门槛
  • 音视频内容生产:为音视频剪辑及音频创作平台提供素材转音频能力,支持基于文档、网页等输入自动生成观点解读、信息播报类音频内容
  • 新闻资讯播报:将新闻资讯网页或 APP 中的图文内容自动总结并输出为双人对话播报,丰富资讯产品的呈现形式
  • 儿童陪伴教育:为儿童教育类 APP 提供双人对话音频生成能力,可用于双人教学、科普讲解、故事讲述等有声内容的批量生产
能力预览
立即体验:前往体验中心,输入话题或者上传文件,体验豆包实时语音能力
Replay
Play
00:00 / 00:00 Live
00:00
Fullscreen
Cssfullscreen
1x
  • 2x
  • 1.5x
  • 1x
  • 0.75x
  • 0.5x
Click and hold to drag
语音同传
基本介绍
豆包同声传译大模型采用端到端架构,在单一模型中完成语音识别、语义理解与翻译输出,实现高准确率、低时延的实时同传能力。
模型支持两种工作模式:
  • 语音到文本(S2T):流式输入语音,输出对应目标语种的翻译文本
  • 语音到语音(S2S):流式输入语音,模型在完成翻译的同时自动复刻说话人音色,并以原说话人的音色输出目标语种语音
核心优势
  • 零样本声音复刻:基于全双工语音理解与生成框架,无需预先录制说话人音频,传译过程中即可完成音色采样,并以复刻音色输出译文语音。
  • 高质量翻译:在多人对话、中英混杂、发音不清等复杂场景下仍可保持稳定的翻译质量,支持多说话人区分,并具备语义纠错能力,对中国文化与专业领域内容的处理尤为出色。
  • 低时延同步:实现翻译文本与语音的同步生成及声音复刻,语音延迟可低至 2–3 秒,显著提升实时交互体验。
  • 节奏自适应:在翻译质量、延迟与语音节奏间智能平衡,可根据说话人的清晰度、流畅度动态调整输出节奏,并在长时间传译中保持稳定的语音节律。
应用场景
  • 国际会议与商务会议:在跨语种会议中提供实时字幕与同传翻译能力,消除语言障碍,提升各方协作效率,可应用于会议字幕、AI 同传等场景
  • 手机通话与智能助手:集成至手机助手或实时通话功能,为跨语种通话提供同声传译服务
  • 智能硬件:可接入耳机、智能眼镜、翻译机等硬件设备,为跨境办公、出行旅游等场景提供跨语言交流支持
  • 在线教育:在教育类 APP 或学习硬件中提供实时翻译字幕,帮助用户跨越语言障碍,扩展学习内容的可及范围
能力预览
立即体验:前往体验中心,即刻开始语音对话,体验豆包实时语音能力
场景
端到端,0样本复刻
复杂场景下的精准理解
低时延,3秒返回
DEMO
Replay
Play
00:00 / 00:00 Live
00:00
Fullscreen
Cssfullscreen
1x
  • 2x
  • 1.5x
  • 1x
  • 0.75x
  • 0.5x
Click and hold to drag
Replay
Play
00:00 / 00:00 Live
00:00
Fullscreen
Cssfullscreen
1x
  • 2x
  • 1.5x
  • 1x
  • 0.75x
  • 0.5x
Click and hold to drag
Replay
Play
00:00 / 00:00 Live
00:00
Fullscreen
Cssfullscreen
1x
  • 2x
  • 1.5x
  • 1x
  • 0.75x
  • 0.5x
Click and hold to drag
语音妙计
基本介绍
豆包语音妙记模型是飞书妙记同款的音视频内容结构化模型,基于飞书在字节跳动内外的应用经验针对企业场景深度调优,可将会议、培训、销售电话、访谈等音视频内容转化为带多层级章节结构的文字稿,并自动提取总结、章节、流程、问答、待办等结构化信息,提升音视频内容的检索效率与二次利用价值。
核心优势
  • 效果领先:依托大模型语音识别与豆包 LLM,在语音转文本与音频结构化分析任务上稳定领先,达到行业先进水平
  • 规模化验证:飞书妙计同款模型,在飞书场景下经过千万级小时的使用与持续打磨,可稳定输出高质量结构化内容
  • 灵活接入:以通用 API 形式开放底层原子能力,无需页面集成,企业可按需选用并快速集成至自身业务系统
应用场景
  • 企业办公:自动生成会议纪要与面试记录,便于回顾、检索与跨轮次信息同步。
  • 金融证券:对业绩发布会等多语种内容生成结构化摘要,辅助投资经理与终端用户获取财报信息。
  • 在线教育:对直播或录播课程进行内容总结与教学质量分析。
  • 手机助手:为手机笔记类 APP 与 AI 助手提供录音纪要能力。
  • 新闻媒体:快速整理音视频素材并辅助撰写初稿,提升内容生产效率。
机器翻译
基本介绍
豆包机器翻译模型(Doubao Seed-X)是一款自研的多语言文本翻译模型,可在 32 种语言之间实现文本到文本的互译。模型面向真实业务场景进行优化,在语义忠实、表达地道、阅读流畅三个维度均有重点提升,可广泛应用于短视频、办公协作、跨境电商、游戏与社交等场景。
核心优势
  • 翻译质量领先
  • 在 FLORES-200 等多个公开多语种测试集的自动评估中表现突出
  • 通过母语级译者人工评估与业务难例测试持续验证,主客观评价均优于传统模型
  • 贴近真实业务场景
  • 短视频翻译:可准确处理短文本、口语化表达、强情绪内容及符号、表情、网络梗等元素
  • 办公翻译:可有效处理省略表达、礼貌用语、跨团队语境与高密度术语,在对话、技术文档与会议口语等场景中翻译效果优于传统模型
  • 复杂表达处理得当
  • 在保持原意的前提下,可进行语序调整、从句拆分与省略补全,输出更自然的目标语言表达
  • 针对 IM 与社交文本,可识别致谢、请求、提醒、委婉等意图,输出更贴合语境的译文
应用场景
  • 游戏:支持游戏内素材、UGC 用户聊天等内容的多语种翻译
  • 跨境电商:支持商品物料、商家与买家 IM 沟通等场景的多语种翻译
  • 跨国企业:支持公司内部资料多语言翻译、员工跨国沟通等场景
自学习平台
基本介绍
火山引擎自学习平台为开发者提供专属定制的语音与翻译优化工具,只需简单配置,即可显著提升专有词汇的识别与翻译准确率。
平台主要提供以下三个核心功能
  • 热词 :在使用语音识别、音视频字幕相关服务时,若存在部分词汇识别效果不好的情况,可考虑通过添加热词,提高该类词语的识别效果
  • 替换词 :支持将语音识别别、音视频字幕生成场景下模型识别出的特定词汇,自动替换为目标词汇,常用于敏感词替换、文本规范化等场景
  • 术语词:可应用于豆包同声传译、豆包机器翻译模型,可配置术语词对,提升已配置术语词翻译的准确率
控制台相关接口
基本介绍
控制台相关接口将控制台的常用功能开放为 API, 便于开发者通过程序化方式管理账号资源、服务状态与用量数据,无需登录控制台手动操作。
接口能力
按使用场景可分为以下五类
  • 音色管理: 查询可用音色列表。
  • API Key 管理: 支持 API Key 的获取、创建、更新与删除。
  • 服务管理: 开通、暂停、停用服务,并查询服务状态。
  • 资源与订单管理: 查询和购买资源包;查询、下单与续费声音复刻。
  • 用量与配额查询: 查询 Quota、调用量,以及 QPS / 并发数据。
最近更新时间:2026.08.18 17:02:19
这个页面对您有帮助吗?
有用
有用
无用
无用