产品动态
豆包音频生成模型1.0
业内首个可通过单条 Prompt 直接生成影视级音频的模型,支持文本、音频等多模态输入,显著降低声音创作门槛,兼顾高表现力与全要素覆盖。
豆包实时语音模型3.0
原生全双工端到端语音大模型(Seeduplex),具备精准遵循、抗干扰、动态判断三大优势,不仅更懂何时听、何时说,还能在对话中直接调用工具完成任务,实现“边听边说边办事”的实时交互体验。
豆包机器翻译模型
支持 32 种语言互译,提供高质量、上下文感知的翻译能力,并支持术语定制,满足专业领域翻译需求。
豆包音色设计模型
支持文本与图片双模态输入,为每个角色定制更贴合需求的专属音色。覆盖故事片、AI 电影、AI 短剧等场景,解决音色版权与人物声音同质化问题,让角色表达更丰富、更生动。
豆包实时语音模型2.0
在延续 1.0 低时延、高质量体验的基础上,合成效果更可控、音色更灵活、复刻更出色,歌唱表现也全面升级。
豆包语音识别模型2.0
将语音识别从“听懂文字”升级为“看懂场景”。在语音识别过程中,将上下文理解的范围从纯文本扩展到视觉层面,通过理解图像和视频内容,帮助模型更精准地完成语音转录。
豆包声音复刻模型2.0
支持灵活引用对话上下文,并结合语音指令标签,精准调控语气、节奏与表达,让合成效果更自然、更贴合场景。
豆包语音合成模型2.0
供更加自然、更丰富情感、更具有表现力的语音合成效果
豆包录音文件识别-闲时版
利用闲时算力进行录音文件识别,性价高,适用于大批量、对时效性要求较低的录音文件识别任务处理
豆包语音妙记模型
将企业内大量存在的会议/培训/销售电话/访谈等音视频内容,转化为结构化的有多层级章节结构的文字稿
豆包录音文件识别-极速版
上传录音文件后,快速返回识别文字结果
豆包语音播客模型
智能提炼文本并生成自然流畅的双人对话,让内容更生动、更具沉浸感
豆包同声传译大模型
高准确率、低时延的语音到文本 & 语音到语音的同声传译能力。该模型支持以下两种模式
- 语音转文本(S2T):接收语音输入,转化成翻译文本
- 语音转语音(S2S):接收语音输入,在语义理解与翻译的同时,复刻说话人音色,以目标语种进行语音输出
豆包实时语音模型
超拟人、低时延的实时语音交互模型,呈现接近真人的语音表达水准
最近更新时间:2026.08.31 16:47:33