本文为您介绍火山引擎智能豆包语音的产品体系、核心能力与典型应用场景,并提供各产品的能力预览 Demo,帮助您快速了解并选择最适合业务需求的语音产品。
基本介绍
豆包音频生成模型 1.0 (Seed-Audio 1.0) 是业内首个可通过单条 Prompt 直接生成影视级音频的模型,支持文本、音频等多模态输入,显著降低声音创作门槛,兼顾高表现力与全要素覆盖。
核心优势
- 0 样本多模态生成: 基于文本、图片、参考音频等数据,通过自然语言指导音频生成,大幅降低音色打造与效果调优的门槛
- 单条指令即可定义多角色台词、语气与情绪节奏,自动完成时序编排与转场衔接
- 笑声、叹息、停顿、方言口音等副语言细节可直接写入 Prompt 精准还原
- 背景音乐、环境音效与人声一体化生成,无需额外混音软件,输出即成品
- 长时音色一致性: 通过音色复刻方式,在长音频中保持音色统一,解决有声书、播客、长剧集等长程生成场景下音色不稳定的问题
应用场景
- 音视频创作 / 编辑: 面向短视频、广告、电商配音,可短时间内打造海量音色,让用户低门槛、便捷地创建适配自己视频的声音,并对合成效果 (风格、情感、局部修改) 灵活可控,实现语音、背景音乐与音效的一站式生成。
- 有声书: 面向有声小说、多播、有声剧生产,可替代真人声优录音,大幅降低人工录制成本,快速产出高质量有声内容。
- 游戏配音: 替代部分真人录音,以更强的可控性适配多角色、多情绪的游戏场景,并支持语音、背景音乐与音效的一站式生成。
- AI 播客生产: 快速生成多角色对谈音频,降低制作门槛,让播客内容实现规模化、批量化产出
能力预览
基本介绍
基于新一代语音大模型,可根据上下文自动理解文本的情绪与语调,合成富有表现力的音频,支持中、英、日、西等多语种及多种方言口音
核心优势
- 情感自然演绎:根据上下文智能预测文本情绪与语调,实现自然情感表达
- 高自然度:在口语自然度、连贯性、拟人度、音质、韵律、气口、情感、语气词表达等各方面,可以带来更生动、更具情感表现力的听觉体验;
- 多风格:提供 130+ 款超自然音色,涵盖趣味口音、角色扮演、客服等多种风格
应用场景
- 聊天陪伴: 适用于 AI 助手、情感陪聊等场景,提供拟真人的交互体验
- 有声阅读: 支持笑声、哭腔等副语言表达,让有声书与小说演绎更加真实生动
- 音视频配音: 覆盖短视频剪辑、广告营销、新闻播报、电商带货等内容创作场景
- 数字人播报: 与虚拟形象配合,实现自然的口型驱动与情感同步
- 在线教育: 可复刻教师音色,标准化讲解内容,减轻重复授课负担。
- 智能客服与外呼: 以接近真人客服的自然播报,服务于咨询应答、回访关怀等场景。
能力预览
立即体验:前往体验中心,即刻开始语音合成,体验豆包语音合成能力 基本介绍
大模型声音复刻提供轻量级的音色定制能力。在普通环境下录制最短5s音频,即可快速生成与本人音色、说话风格、口音相一致的专属音色,并保留原始录音的声学环境特征,用于后续的语音合成
核心优势
- 快速复刻:最短录制5s音频即可启动复刻,音频上传后,秒级完成复刻,几乎无等待时延,可立即调用合成试听
- 高度还原:精准还原说话人的音色、说话风格、口音及声学环境
- 低成本调优:如果复刻效果不满意,可更换音频重新训练,每个音色最多支持 10 次训练
- 跨语种迁移:支持合成跨语种语音,支持中文、英文、日语、西班牙语(墨西哥口音)、葡萄牙语(巴西口音)、印尼语,让声音轻松 "说外语"
应用场景
- 视频配音:复刻 IP、搞怪等特色声音,丰富创作形式,提升内容生产效率。
- 数字人驱动:与数字人形象定制结合,实现 "形象 + 声音" 一体化的个性化形象方案。
- 语音助手:定制具有品牌或情感属性的交互音色(如家人、朋友的声音),可用于手机助手、导航播报、游戏语音等场景,带来更具特色的交互体验。
- 在线教育:复刻教师音色,替代重复性、标准化的讲解工作,提高授课效率,同时缓解长时间授课带来的咽喉负担。
- 有声书:以家人或朋友的声音陪伴用户阅读,打造温暖、亲切且高度定制化的听书体验。
能力预览
立即体验:前往体验中心,即刻开始录制或上传音频,体验豆包声音复刻能力
注意
- 新版本随机性:受模型自身特性影响,对于表现力强、韵律起伏明显的音色,同一句文本多次合成可能呈现不同的效果,您可根据场景需要灵活运用
- 实践建议:为获得最佳复刻效果,建议使用 10–15 秒、低噪声、情感平稳的音频作为Prompt,更多细节请参考声音复刻ICL-最佳实践
基本介绍
语音识别(ASR)是一项将音频中的人声内容自动转写为文字的能力,广泛应用于会议记录、字幕生成、语音交互、内容质检等场景。通用语音识别在高品质语音输入下通常能达到较高的转写准确率,但在实际场景中,受环境、语境及垂直领域复杂性的影响,仍存在以下难点:
- 上下文一致性难以保证,如人名、"他 / 她 / 它" 等代词的连贯指代
基于此,火山引擎语音识别大模型全新升级,可在嘈杂、专业、多轮对话等复杂场景下稳定输出准确、连贯的转写结果,目前大模型语音识别提供两种识别模式:
- 双向流式模式:支持长音频实时转写,实现边说边出字的效果,适用于实时会议字幕、直播字幕、智能外呼等场景
- 流式输入模式:以流式方式接收音频输入,按句返回识别结果,适用于智能体对话、IM 语音消息转写、语音输入法等场景
- 大模型录音文件识别:支持时长不超过 4 小时的音频文件转写,内置自动标点、语义顺滑、数字规整、智能分句等功能,可按需组合启用。适用于会议纪要整理、智能外呼质检、课后教辅与学情分析等非实时场景
核心优势
- 超高准确率:与业界主流语音识别大模型相比,转写错误率更低,在多类公开测试集与真实业务场景中均表现稳定
- 上下文感知:模型可结合历史对话、视频编辑记录、会议参与信息等多维上下文进行推理,在长对话、多轮交互等场景下,输出结果更准确、更连贯
- 多方言识别:支持识别普通话与多种方言,包括上海话、闽南语,四川、陕西、粤语等国内主流方言
应用场景
- 语音交互:实时将语音转写为文字,作为设备、硬件或应用的输入信号,提升人机交互的便捷性与响应速度
- 内容审核与质检: 将通话或音频内容转写为文本,结合质检规则进行违规识别与处置;也可基于文本开展数据分析,挖掘潜在的业务机会
- 会议与访谈转写:支持会议、访谈音频的实时或异步转写,自动切分有效语音段并按句分段,显著提升会议记录与内容整理效率
- 游戏语音与输入法:在游戏内语音、手机输入法等场景下提供 "边说边出字" 的实时体验,降低文字输入成本,提高沟通效率
- 音视频字幕生成:自动将音视频中的语音和歌词识别为文本,一键生成对应字幕,适用于视频剪辑、视频观看、视频会议等多种场景
能力预览
立即体验:前往体验中心,即刻开始录制或上传音频,体验豆包语音识别能力
基本介绍
豆包端到端实时语音大模型是一款超拟人、低时延的实时语音交互模型,基于 Speech2Speech 端到端框架将语音与文本模态深度融合,可在语音对话中提供接近真人的表达效果与流畅的交互节奏。
模型优势
相较于传统对话链路,端到端实时语音模型在架构、对话效果、指令控制与时延等方面均有显著优势
应用场景
情感陪聊:智商情商双在线,依托超自然的对话效果与极低时延,对用户的各类情感诉求给予深度共情与温暖承接,无论是鼓励、关心还是遗憾,都能恰到好处地接住,成为用户随时可聊的贴心密友
儿童与老人陪伴:具备出色的方言识别能力,可轻松应对全国主流方言对话;支持悄悄话、唱歌、风格模仿、讲故事等丰富表达,让孩子拥有一个会玩会闹的好玩伴,让老人多一位耐心倾听的好伙伴
语音助手:兼顾高智商与情感表达,可作为手机、智能座舱、可穿戴设备等场景下的语音助手,为用户提供高效、自然且富有温度的交互体验
智能语音外呼: 在产品介绍、价格沟通、客户回访、问题答疑、情绪安抚等外呼场景下,可呈现接近真人客服的对话表现,胜任更复杂的业务沟通任务,并为人工坐席提供有效辅助
能力预览
立即体验:前往体验中心,即刻开始语音对话,体验豆包实时语音能力
基本介绍
豆包音色设计模型支持文本与图片双模态输入,为用户设计专属音色。用户既可以通过自然语言描述年龄、性别、声线、情感、风格等维度生成音色,也可以直接上传角色图片,由模型自动生成贴合人物形象的音色
核心优势
- 图生音色:上传角色图片即可一键生成贴合形象的音色,可直接复用视频参考图或视频截图,无需人工二次描述,有效解决 AI 剧、短剧、故事片等场景中 "角色音色难找、版权风险高" 的痛点
- 文生音色:用一句话描述角色名、年龄性别、人设职业、口音语言、声线气质、风格场景,以及情绪、语速、语调、音量等维度,即可生成声线、口音、情绪与韵律均贴合角色的专属音色
- 轻松接入:生成的音色 ID 可直接用于声音复刻合成与长文本合成,推理接口无需变更;存量客户还可复用已购音色槽位的剩余次数进行音色设计,接入成本低
应用场景
- 数字人 / 视频配音:为不同角色打造专属音色,适用于视频剪辑、广告营销、新闻播报、电商带货等场景。
- 有声小说: 为小说中的不同角色设计贴合音色,提升有声播报的代入感。
- 情感陪伴 (APP / 硬件): 生成风格贴合的拟人音色,为陪伴类 APP 与智能硬件提供共情交互体验。
- 语音助手: 支持厂商预设或用户自定义音色,为手机、耳机、眼镜、音箱、手表等终端带来拟真人的语音交互。
能力预览
立即体验:前往体验中心,即刻开始语音对话,体验豆包实时语音能力
基本介绍
豆包语音播客模型基于豆包端到端实时语音大模型(S2S)构建,可将输入文本自动提炼为双人对话形式的口语化文本,并生成对应的双人播客音频。同时,播客模型支持模拟真人对话中的附和、停顿、衔接等交互细节,并可对接深度搜索能力,整体效果接近专业播客录制水准
核心优势
- 高语音自然度:在合成结果中保留附和、停顿、语气词、呼吸等口语化特征,对话听感自然,接近专业播客录制效果
- 高效内容生成:基于端到端链路一键生成,无需人工录制即可输出双人对话播客,显著降低内容生产成本
- 时效信息覆盖:集成深度搜索能力,输入热点话题后可快速生成基于最新资讯的播客音频,满足时效性内容生产需求
应用场景
- 播客创作平台:为播客类 APP 或 SaaS 平台提供 AI 播客生成能力,丰富内容供给,降低创作门槛
- 音视频内容生产:为音视频剪辑及音频创作平台提供素材转音频能力,支持基于文档、网页等输入自动生成观点解读、信息播报类音频内容
- 新闻资讯播报:将新闻资讯网页或 APP 中的图文内容自动总结并输出为双人对话播报,丰富资讯产品的呈现形式
- 儿童陪伴教育:为儿童教育类 APP 提供双人对话音频生成能力,可用于双人教学、科普讲解、故事讲述等有声内容的批量生产
能力预览
立即体验:前往体验中心,输入话题或者上传文件,体验豆包实时语音能力
Replay
Play
00:00
/
00:00
Live
Fullscreen
Cssfullscreen
1x
基本介绍
豆包同声传译大模型采用端到端架构,在单一模型中完成语音识别、语义理解与翻译输出,实现高准确率、低时延的实时同传能力。
模型支持两种工作模式:
- 语音到文本(S2T):流式输入语音,输出对应目标语种的翻译文本
- 语音到语音(S2S):流式输入语音,模型在完成翻译的同时自动复刻说话人音色,并以原说话人的音色输出目标语种语音
核心优势
- 零样本声音复刻:基于全双工语音理解与生成框架,无需预先录制说话人音频,传译过程中即可完成音色采样,并以复刻音色输出译文语音。
- 高质量翻译:在多人对话、中英混杂、发音不清等复杂场景下仍可保持稳定的翻译质量,支持多说话人区分,并具备语义纠错能力,对中国文化与专业领域内容的处理尤为出色。
- 低时延同步:实现翻译文本与语音的同步生成及声音复刻,语音延迟可低至 2–3 秒,显著提升实时交互体验。
- 节奏自适应:在翻译质量、延迟与语音节奏间智能平衡,可根据说话人的清晰度、流畅度动态调整输出节奏,并在长时间传译中保持稳定的语音节律。
应用场景
- 国际会议与商务会议:在跨语种会议中提供实时字幕与同传翻译能力,消除语言障碍,提升各方协作效率,可应用于会议字幕、AI 同传等场景
- 手机通话与智能助手:集成至手机助手或实时通话功能,为跨语种通话提供同声传译服务
- 智能硬件:可接入耳机、智能眼镜、翻译机等硬件设备,为跨境办公、出行旅游等场景提供跨语言交流支持
- 在线教育:在教育类 APP 或学习硬件中提供实时翻译字幕,帮助用户跨越语言障碍,扩展学习内容的可及范围
能力预览
立即体验:前往体验中心,即刻开始语音对话,体验豆包实时语音能力
基本介绍
豆包语音妙记模型是飞书妙记同款的音视频内容结构化模型,基于飞书在字节跳动内外的应用经验针对企业场景深度调优,可将会议、培训、销售电话、访谈等音视频内容转化为带多层级章节结构的文字稿,并自动提取总结、章节、流程、问答、待办等结构化信息,提升音视频内容的检索效率与二次利用价值。
核心优势
- 效果领先:依托大模型语音识别与豆包 LLM,在语音转文本与音频结构化分析任务上稳定领先,达到行业先进水平
- 规模化验证:飞书妙计同款模型,在飞书场景下经过千万级小时的使用与持续打磨,可稳定输出高质量结构化内容
- 灵活接入:以通用 API 形式开放底层原子能力,无需页面集成,企业可按需选用并快速集成至自身业务系统
应用场景
- 企业办公:自动生成会议纪要与面试记录,便于回顾、检索与跨轮次信息同步。
- 金融证券:对业绩发布会等多语种内容生成结构化摘要,辅助投资经理与终端用户获取财报信息。
- 在线教育:对直播或录播课程进行内容总结与教学质量分析。
- 手机助手:为手机笔记类 APP 与 AI 助手提供录音纪要能力。
- 新闻媒体:快速整理音视频素材并辅助撰写初稿,提升内容生产效率。
基本介绍
豆包机器翻译模型(Doubao Seed-X)是一款自研的多语言文本翻译模型,可在 32 种语言之间实现文本到文本的互译。模型面向真实业务场景进行优化,在语义忠实、表达地道、阅读流畅三个维度均有重点提升,可广泛应用于短视频、办公协作、跨境电商、游戏与社交等场景。
核心优势
- 在 FLORES-200 等多个公开多语种测试集的自动评估中表现突出
- 通过母语级译者人工评估与业务难例测试持续验证,主客观评价均优于传统模型
- 短视频翻译:可准确处理短文本、口语化表达、强情绪内容及符号、表情、网络梗等元素
- 办公翻译:可有效处理省略表达、礼貌用语、跨团队语境与高密度术语,在对话、技术文档与会议口语等场景中翻译效果优于传统模型
- 在保持原意的前提下,可进行语序调整、从句拆分与省略补全,输出更自然的目标语言表达
- 针对 IM 与社交文本,可识别致谢、请求、提醒、委婉等意图,输出更贴合语境的译文
应用场景
- 游戏:支持游戏内素材、UGC 用户聊天等内容的多语种翻译
- 跨境电商:支持商品物料、商家与买家 IM 沟通等场景的多语种翻译
- 跨国企业:支持公司内部资料多语言翻译、员工跨国沟通等场景
基本介绍
火山引擎自学习平台为开发者提供专属定制的语音与翻译优化工具,只需简单配置,即可显著提升专有词汇的识别与翻译准确率。
平台主要提供以下三个核心功能
- 热词 :在使用语音识别、音视频字幕相关服务时,若存在部分词汇识别效果不好的情况,可考虑通过添加热词,提高该类词语的识别效果
- 替换词 :支持将语音识别别、音视频字幕生成场景下模型识别出的特定词汇,自动替换为目标词汇,常用于敏感词替换、文本规范化等场景
- 术语词:可应用于豆包同声传译、豆包机器翻译模型,可配置术语词对,提升已配置术语词翻译的准确率
基本介绍
控制台相关接口将控制台的常用功能开放为 API, 便于开发者通过程序化方式管理账号资源、服务状态与用量数据,无需登录控制台手动操作。
接口能力
按使用场景可分为以下五类
- API Key 管理: 支持 API Key 的获取、创建、更新与删除。
- 服务管理: 开通、暂停、停用服务,并查询服务状态。
- 资源与订单管理: 查询和购买资源包;查询、下单与续费声音复刻。
- 用量与配额查询: 查询 Quota、调用量,以及 QPS / 并发数据。