本文面向世界模型、视频理解模型、视频生成模型的数据生产团队,介绍如何通过视频精细理解 API 面向大规模预训练数据生产通用视频描述:为原始视频生成统一的整段语义描述,或生成带时间边界的结构化描述。方案不绑定某个垂直场景或动作标签体系,产物可进入训练数据生产、筛选、质检和人工复核链路。
在大规模视频预训练数据生产中,核心需求通常不是为某一个固定场景写专用规则,而是把不同来源、不同内容形态的视频转成稳定、可批处理、可抽检的文本监督信号。
训练方向 | 大规模数据需求 | 推荐产物 |
|---|---|---|
世界模型 | 从通用视频中学习场景、物体、空间关系、动作变化和物理过程。 | 通用视频描述、空间关系、动作过程、事件片段。 |
视频理解模型 | 构建覆盖多来源内容的视频级语义、片段索引和时序监督数据。 | 视频级细粒度描述、稠密视频描述、事件级和动作/场景级时间段。 |
视频生成模型 | 构建高质量视频-文本配对,覆盖主体、动作、镜头、风格和时间变化。 | 生成式提示词、镜头描述、运动描述、风格描述、可用性标签。 |
对比项 | 视频级细粒度描述 | 稠密视频描述 |
|---|---|---|
最适合 | 大规模视频级文本监督、视频-文本配对、检索索引、生成提示词。 | 片段级时序监督、长视频切片、事件索引、批量质检。 |
优点 | 文本完整、自然,便于作为通用视频级语义标签。 | 结构统一,有时间边界,便于批量裁切、过滤和抽检。 |
结果消费 | 与原视频组成视频-文本对,进入预训练样本池。 | 按 |
推荐组合 | 先生成全局语义描述,用于粗筛和视频级训练。 | 再生成可切片的时序描述,用于细粒度样本派生。 |
视频级细粒度描述用于面向大规模视频语料,为每个完整视频生成一段通用中文描述,不输出时间戳、列表或 JSON。它不依赖特定场景规则,适合作为视频级语义标签、视频-文本配对和预训练数据文本监督。
在请求中将 task_template 设置为 general_video_captioning,只需额外传入视频地址。
{ "operator_id": "las_long_video_understand", "operator_version": "v1", "data": { "video_url": "tos://bucket/path/to/video.mp4", "task_template": "general_video_captioning" } }
general_video_captioning,生成一段通用中文描述。稠密视频描述用于面向大规模视频语料,把通用视频内容组织成视频级概述、事件段和动作/场景段,并输出带 start/end 的 JSON。它强调统一结构和时间边界,适合片段级索引、时序监督构建、自动切片和批量质检,不限定某个场景类别。
在请求中将 task_template 设置为 dense_video_captioning,只需额外传入视频地址。
{ "operator_id": "las_long_video_understand", "operator_version": "v1", "data": { "video_url": "tos://bucket/path/to/video.mp4", "task_template": "dense_video_captioning" } }
dense_video_captioning,按时间切分,生成动作、场景内容总结。