You need to enable JavaScript to run this app.
文档中心
AI 数据湖服务

AI 数据湖服务

复制全文
下载 pdf
算子总览
支持的算子列表:在线算子
复制全文
下载 pdf
支持的算子列表:在线算子

视频

视频生成

算子名称

使用方式

算子简介

视频生成增强版/基础版
视频生成(Doubao-Seedance-1.x系列模型)

  • 在线
  • LAS视频生成增强版/基础版服务以 Seedance 系列模型为核心,围绕视频生成的前置、后置链路,叠加视频格式转换、视频切分、视频修复、字幕生成、音视频合并、视频超分等能力,扩展视频生成模型的能力边界、提升生成视频的质量和时长,降低token消耗成本,帮助客户提升生产效率。

视频编辑增强版

  • 在线
  • 视频编辑增强版在线服务,基于输入视频和参考图片完成视频内容替换,支持场景替换和物体替换,尽量保留原视频中的主体动作、镜头节奏与时序连续性,输出替换后的视频结果。
  • 核心功能:
    • 支持 scene_replace 场景替换,保持原视频中的人物、商品、动作和镜头结构,替换背景或环境风格。
    • 支持 object_replace 物体替换,基于参考图片将视频中的目标物体替换为指定样式或商品。
    • 支持通过 user_prompt 补充自然语言编辑约束,例如保留动作、移除水印、避免字幕或控制风格细节。
    • 支持有限次数的自动评估与重试,帮助在复杂素材上获得更稳定的替换结果。
    • 支持返回最终视频结果和 result.json 诊断文件,便于调用方留存生成结果与过程信息。

视频编辑增强版 2.0

  • 在线
  • 视频编辑增强版 2.0 在线服务,提供面向业务场景的视频编辑模板,在保持原视频动作、镜头、构图和时间线的基础上,完成直通生成、通用关键帧编辑、换脸、完整人物替换、通用主体替换或全局风格迁移,提供定向业务场景下更高质量的视频编辑能力。
  • 核心功能:
    • 模板化路由:业务只声明编辑目标,服务端模板负责选择 VLM、关键帧重绘、结构视频和 Seedance 提示词组装流程。
    • 通用关键帧编辑:VLM 理解视频和用户意图,选择关键帧并使用 Seedream 基于源帧画布编辑。
    • 完整人物替换:将原视频作为动作和时间线依据,以目标人物图和重绘关键帧锁定最终人物外观。
    • 风格迁移:默认使用纯深度结构视频保留空间、动作和镜头运动,减少原视频颜色、材质、字幕和摄影风格对结果的干扰。
    • 多主体映射:可在 user_prompt 中将多个源主体分别绑定到 image_urls 中不同的目标图。
    • 可控降级allow_fallback=true 时,预处理失败可降级为 basic 等价的直通生成;强语义编辑建议设为 false,避免返回未完成编辑的结果。

短剧·影视解说智作

  • 在线
  • “短剧·影视解说智作”算子能够基于多集短剧或单部电影素材,自动建立剧情事件索引,按照故事线索,以 shortmidlong 三种大致时长范围规划跳剪解说视频。算子会自动完成画面剪辑、解说稿生成、TTS 配音、字幕生成、混音渲染和结果上传,支持中英文解说、可选参考音频音色克隆以及字幕底框和位置控制,一次任务产出一条适合视频平台投放的高光解说素材。
  • 核心功能:
    • 跨集剧情理解:自动分析多集短剧或电影素材,抽取关键事件、人物关系、冲突推进和视觉高光。
    • 线索发现与筛选:发现并筛选适合生成高光解说的候选线索,包括主线、人物线、冲突线和关系线。
    • 多语言解说:支持通过 narration_language 生成中文或英文解说。
    • TTS 音色控制:支持通过 tts_clone_prompt_audio_url 提供参考音频;不传时使用执行服务的默认音色。
    • 字幕样式与位置控制:支持选择半透明模糊、白色圆角或黑色圆角字幕底框,并通过 subtitle_position 控制字幕位置。
    • 投流化密集解说:默认生成节奏紧凑、先抛钩子、结尾留悬念的解说稿,并自动完成 TTS 配音与字幕渲染。

音频重建

  • 在线
  • 音频重建算子算子可基于输入的多个待处理视频顺序,合并视频画面,重新规划覆盖整片的音频时间轴,生成统一音频并替换原视频音轨,最终输出合成视频、独立重建音频和 SRT 字幕,适用于面向多个 AI 生成子视频的统一成片场景。
  • 核心功能:
    • 多片段顺序合并:按照请求中的片段顺序拼接视频,形成统一成片。
    • 权威口播稿直通:提供 voiceover_script 时,严格以该脚本作为唯一朗读内容,不消费片段原音,也不进行语义改写或扩写。
    • 原音转写与纠音:未提供整片口播稿时,逐段转写原音;识别到语音时,prompt 仅作为错字、专有名词、读音和声音风格的参考,不新增原音中不存在的句子。
    • 显式台词安全提炼:某段原音未识别出语音时,只从 prompt 中提炼明确标注的台词、口播或旁白,并过滤动作、字幕、嘴型和画面说明;没有明确朗读内容时不会凭空生成台词。
    • 跨片音频统一:对不同片段中的说话人和声音风格进行跨片归并,自动规划连续时间轴,并根据内容将片段路由为语音、声音或静音,尽量保持成片音色与听感一致。
    • 自动音频生成与组装:系统根据视频时长和音频时间轴自动选择整片、分层或分段生成方式;提示词中的音色、语气、BGM、音效与混音线索可用于辅助新音轨生成,但不会保留原音轨中的 BGM 或音效。
    • 口播密度控制:使用整片口播稿时,可检查文案与视频时长是否匹配,避免单位时长内文本过密。
    • 多结果输出:同时返回成片视频、独立音频、SRT 字幕及重建音频总时长。

内容创作

算子名称

使用方式

算子简介

短剧剧本生成

  • 在线
  • 短剧/电影剧本生成算子是面向短剧以及长视频/电影等连载或超长视频内容的自动化剧本逆向提取工具。算子依托视觉多模态大模型(VLM),能够自动提取全剧/全片角色、分析人物关系,并基于画面与台词逆向生成包含场景、动作、神态及对话等细节的高质量文本剧本和角色表,助力视频内容的二次创作、出海翻译与版权保护。
  • 核心功能:
    • 角色一致性识别:突破单集、单片段孤立理解的局限,能够在长篇连载或超长电影中稳定追踪核心角色。在面临换装、侧脸或复杂场景切换时,保障跨集人物身份与设定的高度一致,最终构建完整的全局角色表。
    • 高保真剧本逆向还原:结合视频画面与对白台词,逆向输出专业级分镜剧本(电影模式下带有精确时间戳)。精细还原场景布置、人物情绪、肢体动作以及关键对白,提供可以直接投入二次开发或翻译校对的高质量文本底稿。
    • 双模式自适应架构
      • 短剧模式:支持批量传入多集短剧列表,严格按照输入顺序处理,保持连载剧情的连贯性与角色一致性。
      • 电影模式:针对单集数小时的电影或长录像,自动启动长视频自适应处理策略,有效缓解大模型长上下文带来的细节遗忘问题。
    • 灵活的输出格式定制:提供开放的自定义指令(Prompt)接口。您可以根据具体的业务要求(如:侧重心理描写、特定的分镜排版格式、特定的文本标记等)自由调整单集剧本的生成样式,满足不同下游业务的直接对接需求。
    • 便捷的结果交付:支持将生成的角色表与全集剧本直接安全地写入您指定的云端存储(TOS),也可生成打包好的预签名下载链接。

短剧剧本裂变

  • 在线
  • 用于在已有分集剧本的基础上完成定向改写。算子会保留原剧本的核心人物结构、冲突链路、情绪曲线和爽点节奏,对人物身份、世界观设定、地域语境、行业背景和关键术语进行系统性重写,生成适配目标市场和目标题材的新剧本版本。输出结果包括裂变后的分集剧本目录、全集剧本、大纲和前后映射表,适合用于短剧出海、爆款复刻和内容方向测试。
  • 核心功能:
    • 保留骨架的定向改写:保留原剧本的角色功能、关系拓扑、关键事件顺序和主线推进逻辑,只改写表层设定与表达语境。
    • 地域化改写:支持面向不同地域语境生成目标剧本,包括人物命名风格、制度背景、对白表达和社会关系逻辑的同步适配。
    • 题材化改写:支持按目标题材完成整体风格迁移,将同一剧情骨架改写为不同内容赛道下可复用的新剧本。
    • 批量分集处理:支持通过目录或列表方式一次性提交多集剧本,按输入顺序处理并保持全集叙事连贯性。
    • 结构化结果交付:输出裂变后分集剧本、全集剧本、大纲和映射表,便于后续视频制作、校对、人工精修和效果复盘。
      • 分集剧本目录:裂变后每一集剧本,通常位于 {output_tos_path}/{task_id}/episodes/
      • 全集剧本:完整串联后的裂变剧本,便于整体审校。
      • 剧本大纲:提炼后的结构化大纲,便于快速查看主线走向。
      • 映射表:记录裂变前后的角色、事件、冲突和术语映射关系,便于人工校对和复盘。

短剧剧本解析

  • 在线
  • 短剧剧本解析算子用于将短剧剧本文本自动转化为结构化资产表。算子会读取一个或多个剧本文件,自动识别剧本格式与输出语言,提取人物、道具、场景三类资产,并通过视觉扩写补充人物外观、人物造型、道具视觉描述和场景空间描述,最终将结果保存为 JSON 文件。
  • 核心功能:
    • 多剧本输入解析:支持传入一个或多个剧本文件,按输入顺序拼接处理,适合单集、多集或全集剧本解析。
    • 人物资产表提取:识别人物名称、性别、基础外观、出场场次,并为主要人物补充符合剧本背景的多套造型描述。
    • 道具资产表提取:识别关键道具、出现位置、剧情用途和视觉特征,辅助道具设计与资产管理。
    • 场景资产表提取:识别主要场景、空间类型、时间状态、氛围和视觉布置,辅助场景搭建与分镜生成。
    • 中英文剧本适配:支持中文短剧编号格式和英文 Hollywood/Fountain slug-line 格式;auto 模式下自动识别剧本格式并决定资产表输出语言。
    • 超长剧本稳定处理:对超过阈值的长剧本自动按场次边界分片,降低超长上下文请求带来的超时和截断风险。
    • TOS 产物交付:人物表、道具表、场景表和剧本背景信息均保存为 JSON 文件,并返回对应 TOS 路径。

视频脚本规划

  • 在线
  • 输入视频主题和创作要求,即可生成一份可用于后续制作的视频生产规划。规划会将创意拆解为清晰的内容结构、镜头安排、素材建议和时长节奏,适合教育及营销视频的前期策划。
  • 核心功能:
    • 从创意到制作方案:将主题、受众和表达目标整理成可执行的视频生产规划。
    • 镜头与节奏规划:拆解视频内容,规划各部分的镜头方向、时长和衔接关系。
    • 素材使用建议:根据内容需要安排视频、图片等素材的使用方式,方便后续制作。
    • 适配不同内容类型:支持课程讲解和营销电商视频策划。

视频 Prompt 生成

  • 在线
  • 视频 Prompt 生成算子将自然语言创作需求整理为可执行的视频生成 Prompt。可选传入最多 9 张参考图片,帮助模型理解人物、商品、场景或风格素材。
  • 核心功能:
    • 将创作目标、内容要求和语言要求整理为单份视频生成 Prompt。
    • 支持结合参考图片描述人物、商品、场景和视觉风格。

视频分镜

  • 在线
  • 视频分镜算子,基于多模态大模型对输入视频进行镜头/场景切分、全局角色识别、场景级人物关联以及人物图片抽取。算子会输出场景汇总结果、人物注册表、每个场景的切片视频,以及按人物归档的图片文件,便于后续检索、剪辑和内容理解。
  • 核心功能:
    • 支持基于 VLM 的场景切分,也支持 min_segment_duration == max_segment_duration 时的等时长切分。
    • 支持全局角色提取与去重聚合,生成角色注册表。
    • 支持场景内人物关联,输出人物在场景中的出现时间区间、关键帧时间点与 bbox 信息。
    • 支持自动切出每个场景的独立视频文件。
    • 支持为每个角色抽取并筛选代表性图片,按人物归档输出。
    • 支持输出 token 用量与 LLM 请求次数,便于评估成本。

分镜脚本生成

  • 在线
  • 分镜脚本生成算子面向剧本生产和电商口播视频工作流,将输入文本转换为标准 storyboard_bundle。当前提供两种能力:剧本结合人物、道具、场景三个资产 JSON 生成分镜,以及口播文案直接生成分镜。
  • 核心功能:
    • 剧本和权威资产表转分镜:保留输入人物、道具、场景资产的标识和设定,将剧本拆解为镜头,并把每个镜头绑定到对应资产。
    • 口播文案转分镜:保留口播原意和核心卖点,按语义组织镜头时长、画面动作、口播及可直接用于后续视频生成的结构化描述。
    • 画面忠实扩展:输入中已有画面和动作时优先沿用并补足必要细节;只有口播时根据文案可验证内容设计画面,避免无依据虚构。
    • 标准结果交付:统一输出 storyboard_bundle_manifest.json,关联分镜、人物、场景、道具及变更与校验报告。

爆款文案生成

  • 在线
  • 参考视频生成商品口播与分镜算子,面向电商短视频创作场景。算子会联合理解参考视频、目标商品图片和可选的自然语言要求,生成可直接交给下游文生视频流程的标准分镜包。
  • 核心功能:
    • 联合理解参考视频画面、口播和目标商品图片,识别商品核心用途、使用对象和可见卖点证据。
    • 支持参考分镜、文案、卖点、钩子或自由融合,并通过 user_prompt 指定创作重点。
    • 默认生成最多 N+1 套候选,其中 N 为输入视频数;允许部分候选通过,但至少返回一套结构可用结果。
    • 每套候选包含完整口播、完整可读分镜、逐镜头结构化描述,以及生成依据和创作说明。
    • 输出与标准 storyboard bundle 协议对齐,可继续交给文生视频或其他分镜下游处理。

视频理解

算子名称

使用方式

算子简介

视频精细理解

  • 在线
  • LAS 视频精细理解 API 面向各类视频内容,提供多维度、精细化的结构化理解。无论是短视频、电影片段还是长时会议录像,用户上传视频即可获得可搜索、可问答的内容数据和精细摘要。
  • 核心功能
    • 全局精细理解:支持小时级(最大支持 3 小时、10 GB)视频,生成连贯时间线与章节总结。
    • 事件与行为识别:精准检测关键事件、人物动作、场景变化和逻辑关系。
    • 视频问答:基于视频内容的自然语言问答,快速定位答案及时间戳。
    • 高效摘要与标签:自动生成章节摘要、主题标签和人物关系,便于知识管理。
    • 结构化输出:提供 JSON 格式 timeline、事件列表,方便二次处理或知识库构建。

视频提示词逆向生成

  • 在线
  • 视频提示词逆向生成算子面向视频复刻和分镜再创作场景。算子先理解源视频事实,再结合每个分镜的时间范围、画面描述和参考图片,输出逐片段、可执行的视频生成 Prompt。
  • 核心功能:
    • 基于源视频事实和分镜时间窗逐段生成 Prompt,避免跨片段混入内容。
    • 保留已验证的主体身份、空间关系、关键动作顺序、原声台词和声音表现。
    • 支持在不改变源视频事实的前提下指定目标视觉风格和目标音色。
    • 支持在分镜中绑定参考图片,并在生成结果中返回对应引用。

视频内容理解(豆包系列)增强版

  • 在线
  • 视频内容理解算子,支持对视频文件使用豆包模型进行理解,包括视频内容的解析与自然语言描述生成。
  • 将视频压缩到50M以内,再使用豆包模型进行视频理解;
  • 支持视频格式:mp4、wmv、webm、mkv、m4v、flv、avi、mov,因视频文件格式变种较多,不能保证所有文件都能被识别,请通过测试验证文件能够被正常识别。

视频剪辑

算子名称

使用方式

算子简介

视频智能剪辑

  • 在线
  • 视频智能剪辑算子,基于多模态大模型实现视频智能剪辑能力,帮助用户从长视频中快速提取有价值的内容片段。支持自然语言描述的剪辑需求理解、参考图像辅助识别(角色、物品、场景等)、多维度视频内容分析(视觉、字幕、剧情),并输出标准化的剪辑决策信息(时间戳、描述、标签等)。
  • 核心功能:
    • 支持多种剪辑场景:角色片段提取、高光片段检测、产品片段检测、自定义剪辑等。
    • 基于自然语言描述的灵活剪辑需求理解,支持用户自定义需求。
    • 支持参考图像辅助识别(角色、物品、场景等)。
    • 多维度视频内容分析(视觉、字幕、剧情)。
    • 支持 ASR 增强的语义理解,适用于对话内容丰富、无字幕的视频,提升片段边界流畅性。
    • 支持短剧三要素渲染(标题、提示语、角标),适合短剧竖屏场景。
    • 支持精彩前置功能,自动提取 10-15 秒具有吸引力的片段作为开场。
    • 标准化的剪辑决策输出(时间戳、描述、标签等)。
    • 自动生成视频片段文件并上传至 TOS。

爆款素材剪辑

  • 在线
  • 爆款素材剪辑算子能够基于多集短剧视频,自动完成分镜检测、语义分析、剪辑决策与视频合成,批量生成多个适合在短视频平台投放的引流素材视频。
  • 核心功能:
    • 多集短剧批量处理:一次性输入多集短剧,自动完成全部分析与剪辑,批量输出多个爆款素材。
    • 智能剪辑方案生成:自动分析剧情内容,生成多种剪辑方案(顺剪/跳剪),满足不同投放需求。
    • 非正片内容自动清洗:自动检测并去除定格画面、前后集重复内容等无关画面。
    • 分镜级语义理解:对每个镜头进行剧情理解与重要性评级,输出结构化分镜分析结果。
    • 剧本还原:自动还原多集短剧的完整剧本,包含角色关系、场景结构与剧情脉络。
    • 短剧三要素渲染:支持在素材中添加剧名标题、提示语和角标,适配短剧竖屏场景。
    • 精彩前置:支持将高光片段前置到素材开头,快速吸引观众注意力。

视频智能混剪

  • 在线
  • 视频智能混剪算子基于对输入素材的理解、语音识别、语义检索与大模型编排能力,将口播、空镜或长实拍素材按文案、结构化分镜或自然语言创作要求自动匹配、排序并剪辑合成为最终成片。
  • 核心功能:
    • 算子会先完成素材理解和分镜匹配,再依据设置的剪辑场景模式(mode)生成剪辑方案。支持的剪辑场景模式包括:
      • 口播原声匹配mode=speech_match, 输入需要剪辑提取的脚本文案,算子会在视频素材 ASR 中定位对应片段,剪辑输出命中片段的原始音画。此类场景下,输入的视频素材的视频画面和音频均可直接用于剪辑输出。
      • 画面语义匹配mode=visual_match ,通过自然语音描述需要提取剪辑出的视频素材,例如视频画面的描述或视频内容文案的描述,此场景下,通常输入的视频素材的画面可用于剪辑输出,但音频通常不可用,您可选择输入 TTS 旁白来替代素材原声。
      • 口播营销混剪mode=marketing_headtalk 对拍摄好的口播素材进行智能粗剪,并按语义选择性插入空镜;当前为您预置了汽车真人口播常见下的剪辑模板,您可直接选用。
      • 长实拍流程剪辑mode=long_real_shot 面向谈价、交车、维修、探店等长实拍素材,按原声原画整理完整故事线进行智能剪辑,并支持通过 target_duration_sec 参数设置输出视频时长。
    • 不同剪辑场景模式下,可灵活设置输入的视频素材的应用场景。
      • 通过素材角色(role)参数,将输入的视频素材标记为 speech(口播/主体素材)、voiceover(仅使用音频)或 broll(仅提供画面)。
    • 结构化分镜:支持使用 speechvisual_descriptiondurationvideo_id 控制每个脚本单元。
    • 智能包装:支持字幕特效、音效和 BGM。
    • 方案与产物交付:算子处理完成后返回最终剪辑方案、SRT 字幕、无字幕成片和带字幕成片等产物。您也可通过 data.match_scheme 查看生成的剪辑方案和成片中,输入的脚本单元与视频素材片段的匹配关系。

视频翻译

算子名称

使用方式

算子简介

视频翻译

  • 在线
  • 视频翻译算子,可高效、精准地将视频内容从源语言转换为一种或多种目标语言,服务范围不仅包含字幕翻译,还涉及语音翻译,最终输出配音后的视频以及相应语言的字幕文件。
  • 核心功能:
    • 多语种支持:支持多种语言的翻译,输入语言支持25种语言的视频输入,输出语言支持31种语言的音频配音,涵盖中文、英语、日语、印尼语、西班牙语、葡萄牙语、韩语、法语、德语等多种常见语言。依托大模型强大的翻译能力,可实现极高的翻译准确率与术语本地化能力,满足全球化内容传播的需求。
    • 音色复刻:能够精准提取视频中说话人的声音,实现对说话人声音特质1:1还原。同时,翻译后的语音能够与原始视频的时长精准对齐,确保视频的流畅性和一致性。
    • 便捷的结果交付:支持将翻译后字幕、配音后人声音频与视频直接安全地写入您指定的云端存储(TOS),同时生成预签名下载链接。

视频字幕翻译

  • 在线
  • 视频字幕翻译算子,支持从视频中提取字幕并进行多语言翻译。用户可以选择通过 OCR 识别画面内嵌字幕,或通过 ASR 提取音频字幕,再对识别出的字幕进行精修和翻译,输出多种格式的字幕文件。
  • 核心功能:
    • 双字幕来源:支持 OCR 识别画面内嵌字幕和 ASR 提取音频字幕两种方式。
    • 多种精度级别:每种字幕来源均支持低精度和高精度两档配置,满足不同场景需求。
    • 多语言翻译:支持 25 种语言的字幕翻译,包括中文、英文、日文、韩文、法文、德文、西班牙文等。
    • 多格式输出:支持同时输出多种格式的字幕文件。
    • 双语字幕识别:OCR 模式支持识别翻译型双语字幕和对话型双语字幕。

视频修复

算子名称

使用方式

算子简介

视频修复

  • 在线
  • 输入单个视频,输出擦除指定内容后的修复视频。支持字幕、滚动字幕、文字水印、角标、Logo 和剧集信息,能够分别控制字幕与水印的擦除范围。
  • 核心功能:
    • 支持多种目标擦除:水印、字幕、滚动字幕等。
    • 基于多模态大模型的智能检测,精准定位需要修复的区域。
    • 支持精确 mask 生成,保留边缘细节。
    • 支持视频分段处理,处理长视频更稳定。
    • 自动处理音频保留,无需额外操作。
    • 支持输出 TOS 地址,结果自动上传。

字幕擦除

  • 在线
  • 字幕擦除算子,自动检测并擦除视频画面中的内嵌硬字幕,输出擦除后的视频文件。适合面向竖屏白色字幕的视频进行字幕擦除,提供高效、经济的字幕擦除方案,适用于对成本和速度有较高要求的通用场景。
  • 核心能力:
    • 智能自动检测画面内嵌字幕区域并擦除。
    • 面向竖屏白色字幕场景优化,处理效率高、成本低。
    • 异步任务处理,提交后通过轮询获取结果。
    • 输出擦除后的视频文件及视频时长。

字幕擦除精细版

  • 在线
  • 字幕擦除精细版算子,自动检测并擦除视频画面中的内嵌硬字幕,输出擦除后的视频文件。适合面向竖屏白色字幕的视频进行字幕擦除,相比标准版擦除后的效果更好,不会留下比较明显的模糊,能精准重建背景纹理、更大程度地还原视频原始画面,适用于短剧出海、专业二创等对画质要求极高的场景。
  • 核心能力
    • 智能自动检测画面内嵌字幕区域并擦除。
    • 支持指定区域擦除:可通过比例坐标精确指定需要擦除的区域。
    • 高质量无痕擦除,细节保留更完整,不会留下明显模糊,画质更高。
    • 支持 Subtitle / Text 两种擦除模式,覆盖字幕及画面文字场景。
    • 支持 Quality / Size 两种输出编码策略,兼顾画质与文件体积。
    • 异步任务处理,提交后通过轮询获取结果。

视频处理

算子名称

使用方式

算子简介

人脸模糊

  • 在线
  • 人脸模糊算子,面向视频内容的自动化人脸模糊处理工具。算子能够自动识别视频中的人脸,并根据用户指定的模糊等级,对人脸进行模糊处理,保护用户隐私。
  • 核心能力
    • 自动检测视频帧中的人脸并进行模糊处理
    • 支持多种模糊类型(马赛克、高斯)
    • 支持多种不同区域的精细模糊(如脸部椭圆形模糊、贴脸型模糊、眼部区域模糊等)
    • 统一输出模糊后的视频路径(即使未检测到人脸也会重新编码输出)

视频超分

  • 在线
  • 视频超分在线服务,基于视频超分模型对输入视频进行清晰度增强与分辨率提升,输出更高分辨率的视频结果。适用于老片修复、素材增强、4K 制作和视频清晰化等场景。
  • 核心能力
    • 支持通过 target_width 指定目标分辨率。
    • 支持自动保持视频方向并推导目标分辨率。
    • 支持自动保留原视频音频,并自动上传到 TOS。

视频分辨率调整(在线)

  • 在线

视频分辨率调整算子,核心功能:

  • 智能分辨率调整到指定范围内
  • 支持多种宽高比保持策略
  • 可控制视频质量和编码参数
  • 保持音频流不受影响

音视频合并

  • 在线
  • 音视频合并算子,基于 FFmpeg 对输入的视频和音频素材进行顺序拼接、时长调整和最终合成。算子支持 1 对 1、1 对多、多对 1、多对多等多种输入组合;当视频和音频总时长不一致时,会根据配置自动选择变速对齐或按较短时长裁剪,并将结果视频与处理映射文件上传到 TOS。
  • 核心功能:
    • 支持多段视频顺序拼接。
    • 支持多段音频顺序拼接。
    • 支持视频、音频分别按目标时长预处理后再合成。
    • 支持自动选择对齐策略:优先变速,超出阈值时自动裁剪。
    • 支持输出最终视频文件和映射文件,便于追踪每次合并的输入、时长和对齐策略。
    • 输出目录自动按账号、请求链路和输入哈希隔离,避免不同任务结果互相覆盖。

视频插帧

  • 在线
  • 视频插帧算子用于对输入视频进行升帧处理,通过生成中间帧提升画面流畅度,并输出新的高帧率视频文件。您可以按需指定目标帧率、选择插帧模式,并决定是否保留原始音频流。
  • 使用限制
    • 输入视频需要可被服务访问,支持 http/httpstos://
    • output_tos_path 必须是当前账号可写的 TOS 目录。
    • target_fps 必须大于 0,且不能小于源视频帧率。
    • 当前版本视频时长限制为 3 小时,视频大小限制为 10GB
    • 算子依赖 CUDA GPU 和视频插帧模型,分辨率越高、目标帧率越高、视频越长,整体耗时越高。

视频帧采样

  • 在线
  • 视频抽帧算子支持对输入视频按指定帧率进行抽帧,将抽取的图片帧上传至指定 TOS 存储路径。任务完成后,您可以获取视频元信息以及每一帧的访问地址。算子支持可配置的抽帧频率、最大帧数限制、输出图片格式和缩放策略,适用于视频理解、检测、审核、摘要、封面生成等场景。
  • 核心功能:
    • 按帧率抽帧:按指定 FPS(0.1 ~ 5.0)对视频进行均匀抽帧。
    • 最大帧数限制:可设置 max_frames 参数控制输出帧数上限,避免长视频产生过多帧。
    • 多格式输出:支持输出 jpgpng 两种图片格式。
    • 灵活缩放:支持按短边缩放(resize_short_side)或指定目标分辨率(resize_hw),满足不同场景需求。
    • 自定义输出路径:通过输出路径模板自定义抽帧图片在 TOS 上的存储路径。
    • 长视频支持:适合处理长时间视频,可通过 max_frames 控制输出规模。

音频

音频生成

算子名称

使用方式

算子简介

复刻语音合成

  • 在线
  • 本算子将输入文本合成为语音音频,支持通过声音风格描述设计音色,也支持基于参考音频进行可控克隆或高保真续写。
  • 核心功能:
    • 多种语音合成能力:
      • Voice Design 文本控音色:仅通过 style_prompt 描述目标声音风格,无需样音即可生成语音。
      • 可控声音克隆:通过 reference_audio_uri 提供样音,基于样音音色合成目标文本。
      • 高保真声音续写:同时提供 prompt_audio_uriprompt_text,提升音色、语速、韵律一致性。
    • 长文本切分与拼接:支持按自然边界切分长文本、逐段合成并自动拼接。
    • 质量自检与重试:支持在检测到疑似低质量结果时自动重新生成。
    • 多格式音频输出:支持 wav、mp3、ogg_opus、pcm,并可配置采样率和码率。
    • 对象存储落盘:支持多种音频格式,可将结果写入 TOS,并返回音频地址、格式、采样率、时长和字符数等信息。

音频识别

算子名称

使用方式

算子简介

语音转文字(豆包语音ASR)

  • 在线
  • 语音转文字(豆包系列)算子,为语音识别模块,基于 LAS ASR 服务的录音转写解决方案。
  • 核心功能
    • 接入火山引擎LAS ASR接口
    • 支持自动断句、数字规整、说话人或通道分离(可选)
    • 并发处理多个音频文件,提供结构化 JSON 与可读文本两种输出
  • 适合转写最长2小时的录音文件,支持标点补全、智能断句、说话人分离等高级功能。

语音转文字(Doubao-录音文件识别)增强版

  • 在线
  • LAS语音转文字(Doubao-录音文件识别)增强版算子基于豆包录音文件识别大模型,能够将输入音频/视频文件中的语音,转写为文本输出。支持多种音/视频格式、多语种、音频降噪及大文件处理,适用于内容质检审核、音视频字幕生成、语音搜索、课堂内容分析等场景。
  • 核心功能
    • 多格式音频/视频输入识别:
      • 除音频外,新增支持视频文件输入,las算子可自动提取视频音轨进行识别。
      • 除raw/wav/mp3/ogg外,扩展支持mp4/mov/mkv/flac等容器格式。
      • las算子对于输入的音视频文件无文件大小/时长限制。
      • 除公网https url访问外,也支持tos内网路径访问(tos://bucket-name/路径名/文件名)。
    • 音频前处理增强,提升模型效果:
      • 内置音频降噪模块,可有效降低背景噪声对识别的影响,提升录音文件转写的准确率。
    • 多语种支持:
      • 可自动识别语种或按用户指定语言进行识别。
      • 扩充识别语种至 99 种,满足多语种、多区域的音频数据处理需求。

语音转文字(Doubao-Seed-2.0-lite)增强版

  • 在线
  • LAS语音转文字(Doubao-Seed-2.0-lite)增强版算子在底层 SeedASR 识别的基础上,默认开启 Doubao-Seed-2.0-lite 多模态精修能力:先完成输入下载、音频抽取、时长探测与基础 ASR 识别,再将音频切片、识别草稿与热词上下文发送给多模态模型进行精修,对专有名词、数字、标点、语义连贯性进行纠正,并补全漏识别内容。支持多种音/视频格式、多语种、说话人分离、热词增强与敏感词保护,适用于会议访谈、播客课程、内容质检等对文本质量要求较高的场景。
  • 核心功能:
    • 多模态精修(默认开启):
      • 在基础识别结果之上,调用 Doubao-Seed-2.0-lite 多模态模型,对专有名词、数字、标点、语义连贯性进行纠正与补全,显著提升转写文本质量。
      • 精修失败时可回退基础 ASR 结果,保证可用性。
    • 多格式音频/视频输入识别:
      • 支持音频与视频文件输入,自动提取视频音轨进行识别。
    • 丰富的识别能力:
      • 支持文本规范化(ITN)、自动标点、语义顺滑(DDC)、说话人分离。
    • 热词与敏感词:
      • 支持热词直传与热词表增强,热词同时进入底层 ASR 与精修 Prompt。
      • 支持敏感词保护:系统脱敏内容可不送精修模型,并支持自定义置空/星号替换。

音频处理

算子名称

使用方式

算子简介

人声分离

  • 在线
  • 将音频或视频中的第一路音频分离为人声轨伴奏/背景轨两条音轨,支持 WAV、MP3、AAC 输出;视频输入还可自动生成保留原画面、仅含人声音轨的 MP4,适合二创去背景乐、ASR/字幕预处理提纯人声、伴奏提取等场景。
  • 核心功能:
    • 双音轨输出:基于输入音视频返回人声轨与非人声残差轨。
    • 人声视频输出:视频输入可额外生成保留原画面、仅含人声音轨的 MP4。
    • 共同峰值增益:可对两条音轨施加同一安全增益,保持两轨相对比例。
    • 多格式输出:支持 WAV、MP3、AAC 音频格式,满足后期编辑、算法处理、试听和分发等需求。

音频格式转换(在线)

  • 在线
  • ”音频格式转换“算子。音频格式转换用于将音频或视频文件统一转换为指定的音频格式,并输出到指定的存储路径。
  • 该算子主要用于数据处理流水线中的音频格式标准化、视频抽音频、训练数据准备等场景,支持批量并发处理与可配置的音频编码参数
  • 核心功能
    • 音频 / 视频统一转换为音频
    • 支持自定义输出音频格式
    • 支持自定义输出路径(TOS)
    • 支持音频编码参数扩展
    • 批量并发处理能力

音频切分

  • 在线
  • ”音频切分“算子,用于从音频或视频文件中提取音频,并按照指定规则将音频切分为多个片段,输出到用户指定的存储路径。
    该算子主要用于长音频或视频的结构化处理场景,如音频预处理、数据切分、训练数据构建等,支持批量并发处理以及灵活的输出路径组织方式。
  • 核心功能
    • 音频/视频提取与切分
    • 支持自定义切分规则
    • 支持自定义输出音频格式
    • 支持输出路径模板
    • 支持音频编码参数扩展

图片

图像生成

算子名称

使用方式

算子简介

图片生成(Seedream 系列模型)

  • 在线
  • 图片生成( Seedream 系列模型)算子,可根据用户输入的文本或参考图像生成高质量图片,支持组图与流式输出。
  • 核心功能
    • 文生图/图生图/组图生成
    • 支持流式输出(SSE)与非流式输出
    • 输出格式支持 url 与 b64_json

图片处理

算子名称

使用方式

算子简介

图片重采样

  • 在线
  • 图像重采样算子用于对输入图像进行尺寸重采样(仅支持降采样),并将结果保存到用户指定的 TOS 目录。支持 4 种插值算法(nearest/bilinear/bicubic/lanczos)与 .jpg / .png 输出格式,适用于图像预处理、数据标准化、离线数据集构建等场景。
  • 核心功能
    • 多种插值算法
      • nearest:速度最快,适合像素风格图像
      • bilinear:速度与质量平衡
      • bicubic:更平滑的高质量缩放
      • lanczos:抗锯齿效果更好,适合照片
    • URL / TOS 输入支持
      • image_src_type=image_url:输入公网 URL
      • image_src_type=image_tos:输入 tos:// 地址
    • 输出到 TOS
      • tos_dir 必填,指定输出目录(文件夹级别)
      • 输出文件名由服务端生成(可通过 image_name 辅助命名),并追加 _resample 后缀标识
    • 输出格式与 DPI 控制
      • 输出格式支持 .jpg / .png
      • 支持设置输出 DPI(target_dpi

文档

文档解析

算子名称

使用方式

算子简介

PDF 文档解析(豆包)

  • 在线
  • PDF 内容解析算子,支持对 PDF 文件进行视觉模型解析与 Markdown 结构化输出。
  • 核心功能
    • 支持 PDF 页面渲染与视觉模型解析,输出高保真 Markdown,完整还原原文结构(标题层级、表格、公式、图片区域)。
    • 自动识别图片区域并返回 boundingbox 信息及图片预签名 URL。
    • 支持逐页和整书 Markdown 汇总,便于后续内容处理和展示。

多模态

多模态向量化

算子名称

使用方式

算子简介

图文 embedding(豆包系列模型)

  • 在线
  • 离线
  • 多模态向量生成处理器,支持图像/视频与文本的联合向量生成,实现跨模态检索能力。
  • 核心功能
    • 多模态向量化支持:支持图像/视频与文本的联合向量生成,实现跨模态检索能力,参考文档
    • 输入格式自适应:
      • 原生支持图像/视频的base64编码、二进制数据、URL等输入格式
      • 自动处理媒体格式转换(JPEG/PNG/MP4/AVI等)

多模态深度思考

算子名称

使用方式

算子简介

多模态深度思考(Doubao-seed-2.0)

  • 在线
  • 多模态场景下提供大模型的深度思考能力,使用具备深度思考能力的模型,对图片、视频或文本进行分析理解,并返回结构化文本输出。算子会自动构建符合多模态模型规范的 message 结构,用户只需按约定提供图片 / 视频 / 文本数据即可完成推理。
  • 核心功能
    • 深度思考机制:模型在回答问题前自动进行问题拆解和逻辑推理,生成思维链(reasoning_content)
    • 多模态场景支持:同时支持图片 / 视频 / 文本输入,自动完成多模态消息拼装
    • 输入简化机制:支持本地文件、HTTP/HTTPS URL、TOS/S3 对象存储等多种数据源,通过简单配置即可实现视觉理解能力
    • 灵活思考模式:支持通过 thinking_type 参数控制深度思考模式(enabled / disabled / auto),在回答质量与性能之间灵活权衡

多模态深度思考(Doubao-seed-1.8)

  • 在线

目标检测与分割

算子名称

使用方式

算子简介

空间感知

  • 在线
  • 空间感知算子面向图片与视频提供对象检测、实例分割和跨帧跟踪能力。调用方可使用自然语言、像素点或像素框指定目标,获得映射到源媒体坐标的对象框、实例 mask 和视频轨迹标识,适合需要结构化视觉结果的具身操作、工业巡检和内容分析场景。
  • 核心功能
    • 文本目标检测:根据对象名称、类别或外观描述,在图片或视频采样帧中返回目标 bbox;视频结果带有跨帧轨迹标识。
    • 交互式实例分割:使用正负点或像素框约束目标,返回源分辨率网格上的实例 mask。
    • 文本定位后分割:通过 grounded_segmentation@v1 先根据文字描述找到目标,再沿目标轮廓将其从背景中精确圈出,并在后续视频帧中持续跟踪。
    • 视频目标跟踪:在采样帧之间保持对象实例和轨迹身份,逐帧返回 bbox、mask 与时间信息。

向量检索

通用检索

算子名称

使用方式

算子简介

Lance 通用检索

  • 在线
  • Lance 通用检索算子为存储在火山引擎对象存储(TOS)上的 Lance 及 LanceDB 格式数据提供统一、高效的检索能力,支持向量检索、全文检索、混合检索和纯量查询,适用于海量结构化、非结构化数据检索场景。
  • 核心功能:
    • 多模式检索支持:支持向量检索(vector)、全文检索(fts)、混合检索(hybrid)、纯量查询(scalar)四种检索模式。
    • 多模态输入:向量检索支持向量数组、文本字符串、Base64 编码图片三种输入类型。
    • 数据过滤:支持 SQL WHERE 子句进行 pre-filter 或 post-filter 数据过滤。
    • 结果重排:混合检索模式支持 RRF(Reciprocal Rank Fusion)重排算法。
    • 列选择:支持指定返回列,减少数据传输。
最近更新时间:2026.09.22 11:48:08
这个页面对您有帮助吗?
有用
有用
无用
无用