You need to enable JavaScript to run this app.
文档中心
文档控制台
注册
AI 数据湖服务

AI 数据湖服务

复制全文
下载 pdf
行业实践
模型训练
复制全文
下载 pdf
模型训练

本文面向世界模型、视频理解模型、视频生成模型的数据生产团队,介绍如何通过视频精细理解 API 面向大规模预训练数据生产通用视频描述:为原始视频生成统一的整段语义描述,或生成带时间边界的结构化描述。方案不绑定某个垂直场景或动作标签体系,产物可进入训练数据生产、筛选、质检和人工复核链路。

典型场景

在大规模视频预训练数据生产中,核心需求通常不是为某一个固定场景写专用规则,而是把不同来源、不同内容形态的视频转成稳定、可批处理、可抽检的文本监督信号。

训练方向

大规模数据需求

推荐产物

世界模型

从通用视频中学习场景、物体、空间关系、动作变化和物理过程。

通用视频描述、空间关系、动作过程、事件片段。

视频理解模型

构建覆盖多来源内容的视频级语义、片段索引和时序监督数据。

视频级细粒度描述、稠密视频描述、事件级和动作/场景级时间段。

视频生成模型

构建高质量视频-文本配对,覆盖主体、动作、镜头、风格和时间变化。

生成式提示词、镜头描述、运动描述、风格描述、可用性标签。

相关算子
  • 视频精细理解算子:可产出通用视频级描述和稠密视频描述(带时间边界的片段级描述),覆盖整体语义、主体与环境、动作变化、镜头信息、字幕/画面文字和时间推进等通用维度。

应用实践

使用建议

对比项

视频级细粒度描述

稠密视频描述

最适合

大规模视频级文本监督、视频-文本配对、检索索引、生成提示词。

片段级时序监督、长视频切片、事件索引、批量质检。

优点

文本完整、自然,便于作为通用视频级语义标签。

结构统一,有时间边界,便于批量裁切、过滤和抽检。

结果消费

与原视频组成视频-文本对,进入预训练样本池。

start/end 切出事件片段或动作/场景片段,进入片段级样本池。

推荐组合

先生成全局语义描述,用于粗筛和视频级训练。

再生成可切片的时序描述,用于细粒度样本派生。

  • 如果训练目标是视频-文本对齐,优先选择视频级细粒度描述。
  • 如果训练目标需要片段级时序监督、自动切片或长视频索引,优先选择稠密视频描述。
  • 生成结果只基于画面内容,不应根据音频、文件名或外部背景补充画面中没有出现的信息。
  • 批量生产前建议先抽样评估:检查视频级细粒度描述是否准确,稠密视频描述的时间段是否连续、是否重叠、是否存在臆造。

实践参考1:视频级细粒度描述

任务说明

视频级细粒度描述用于面向大规模视频语料,为每个完整视频生成一段通用中文描述,不输出时间戳、列表或 JSON。它不依赖特定场景规则,适合作为视频级语义标签、视频-文本配对和预训练数据文本监督。

调用方式

在请求中将 task_template 设置为 general_video_captioning,只需额外传入视频地址。

{
  "operator_id": "las_long_video_understand",
  "operator_version": "v1",
  "data": {
    "video_url": "tos://bucket/path/to/video.mp4",
    "task_template": "general_video_captioning"
  }
}

效果展示

  • 示例1:输入视频
  • 应用场景1:细粒度描述
    • 任务模版:general_video_captioning,生成一段通用中文描述。
    • 适用场景:适合作为视频级语义标签、视频-文本配对和预训练数据文本监督。
    • 输出结果示例
      Image
      EP01-general.json
      未知大小

实践参考2:稠密视频描述

任务说明

稠密视频描述用于面向大规模视频语料,把通用视频内容组织成视频级概述、事件段和动作/场景段,并输出带 start/end 的 JSON。它强调统一结构和时间边界,适合片段级索引、时序监督构建、自动切片和批量质检,不限定某个场景类别。

调用方式

在请求中将 task_template 设置为 dense_video_captioning,只需额外传入视频地址。

{
  "operator_id": "las_long_video_understand",
  "operator_version": "v1",
  "data": {
    "video_url": "tos://bucket/path/to/video.mp4",
    "task_template": "dense_video_captioning"
  }
}

效果展示

  • 示例1:输入视频
  • 应用场景2:稠密视频描述
    • 任务模版:dense_video_captioning,按时间切分,生成动作、场景内容总结。
    • 适用场景:强调统一结构和时间边界,适合片段级索引、时序监督构建、自动切片和批量质检,不限定某个场景类别。
    • 输出结果示例:
      Image
      EP01.json
      未知大小
最近更新时间:2026.07.28 19:09:30
这个页面对您有帮助吗?
有用
有用
无用
无用