You need to enable JavaScript to run this app.
文档中心
AI 数据湖服务

AI 数据湖服务

复制全文
下载 pdf
视频理解
视频精细理解
复制全文
下载 pdf
视频精细理解

视频精细理解算子面向通用视频内容,支持直接对视频进行理解与分析。无论是短视频、影视片段、课程录屏还是监控录像,用户上传视频并给出 query 或 task_template 后,即可对视频内容进行描述、问答、信息提取,并结合时间戳定位相关片段。支持小时级(最大支持 3h、10G)视频输入,也支持结合画面、语音、音乐和音效,按视频中的事件和动作阶段生成带时间信息的结构化描述。

算子介绍

算子 ID:las_video_understanding、las_long_video_understand (旧版 ID)

适用场景

支持一些视频内容理解类的任务:

  • 跨片段问答:整合多clip信息回答复杂问题;
  • 高光生成:提取关键片段(情感高潮、剧情转折等);
  • 角色追踪:持续锁定目标实体并分析其行为;
  • 章节拆解:按逻辑拆分长视频为章节;
  • 音视频综合分析:结合画面变化、语音内容和音效线索输出综合理解结果;
  • 金句抽取:提取视频中的核心观点或精彩台词。

典型应用场景如下。

场景类型

考察能力

示例问题

体育比赛

角色追踪、战术识别、跨片段总结、高光生成

"总结球员本场所有得分时刻及方式"

电视剧

高光生成、时序推理、情绪轨迹分析、角色关系梳理

"梳理本集中男女主角关系变化的三个关键片段"

教育公开课

章节拆解、要点摘要、跨片段问答、Slide OCR

"将演讲按议程拆分为章节并生成要点"

测评类

参数抽取、屏幕OCR、情绪分析

"总结手机评测的三个优点和两个缺点"

教程类

操作步骤拆解、风险提示识别、检索索引

"分解PS教程为操作指南并关联时间戳"

监控交通类

事件检测、违规识别、车牌OCR、目标追踪

"检测视频中违规停车车辆及车牌"

核心能力

  • 全局精细理解:支持小时级(最大支持 3h、10G)视频,可生成连贯时间线、章节总结等内容。
  • 音视频联合理解:支持结合视频画面、语音、背景音和音效进行综合分析,适用于需要同时关注视觉和听觉线索的场景。
  • 事件与行为识别:精准检测关键事件、人物动作、场景变化和逻辑关系。
  • 视频问答:基于视频内容的自然语言问答,快速定位答案及时间戳。
  • 高效摘要与标签:可生成章节摘要、主题标签和人物关系等内容,便于知识管理。
  • 结构化输出:支持输出时间线、事件列表等内容,方便二次处理或知识库构建。
  • 场景化任务模板:提供通用视频描述、细粒度视频描述、音视频综合理解、具身交互物品识别、动作时序标注、目标检测等内置模板,降低 Prompt 设计和参数调优成本;支持 模板名@版本号 格式指定模板版本,未传版本号时默认使用 v1

效果展示


【预置任务模板:大模型预训练场景示例】
  • 示例1:输入视频
  • 应用场景1:细粒度描述
    • 任务模版:general_video_captioning,生成一段通用中文描述。
    • 适用场景:适合作为视频级语义标签、视频-文本配对和预训练数据文本监督。
    • 输出结果示例
      Image
      EP01-general.json
      未知大小
  • 应用场景2:稠密视频描述
    • 任务模版:dense_video_captioning,按时间切分,生成动作、场景内容总结。
    • 适用场景:强调统一结构和时间边界,适合片段级索引、时序监督构建、自动切片和批量质检,不限定某个场景类别。
    • 输出结果示例:
      Image
      EP01.json
      未知大小

【预置任务模板:具身智能应用示例】
  • 应场景1输入视频:左右机械臂辅助视角视频拼接后的视频
  • 场景2输入视频:主视角视频
  • 先基于辅助视角视频捕获更清晰细节的物品细节,识别物品,再基于主视角视频进行动作时序标注。
  • 应用场景1:交互物品识别
    • 任务模版:embodied_active_object_detection@v2
    • 输出结果示例:
      Image
      shuiguo.json
      未知大小
    • 算子处理结果后续建议:
      • 将返回结果中物品清单整理成简短文本,作为后续时序标准请求中的 task_context.prompt_context
      • 上下文中的每一行都以产出的稳定实例 IDobj_001obj_002 …)开头,这样主视角 caption 在多次操作同一物体(例如"第 2 次拿起同一个黄色长尾夹")时,可以复用同一稳定 ID 对齐。
      • 在物品清单之后追加一段【动作类别词表】与【skill 填写规则】,明确告知模型可选的标准化原子动作类别,为每个动作片段输出对应的 skill 标签。
  • 应用场景2:动作时序标注
    • 任务模板:embodied_action_captioning@v2
    • 关键参数:
      • 将交互物品识别结果作为task_context.prompt_context输入。
    • 输出结果示例:
      Image
      shuiguo.json
      未知大小
以上示例视频为开源 Hugging Face 测试数据集中的一个测试数据,仅作为本算子的调用效果展示。

【自定义Query任务:影视剧/体育赛事总结】
  • 示例2:输入视频
  • 算子配置示例:可自定义query,灵活设置视频内容提取、总结等要求
    "data": {
          "video_url": "tos://las-doctest/las-ai/input/video/sports/体育赛事.mov",
          "query": "请生成一份详细的 比赛文字直播日志 。按时间顺序列出所有得分事件,格式为: [时间] 球队 - 事件 - 当前比分 。请确保不遗漏任何一个进球。"  ,      
          "fps": 5,
          "model_name": "doubao-seed-2-1-pro-260628"
        }
    
  • 结果示例
    [13.0-16.0] 蓝队 - 12号队友接7号传球后投篮,球颠进篮筐得分 - 2:0
    [26.8-28.4] 红队 - 14号接3号长传快攻上篮得分 - 2:2
    [42.2-43.4] 蓝队 - 33号在内线接到队友传球后扣篮得分 - 4:2
    [59.0-60.4] 红队 - 8号接队友传球后三分出手命中 - 4:5
    [74.0-75.2] 蓝队 - 12号球员接队友长传快攻上篮得分 - 6:5
    

支持的地域

  • 北京:cn-beijing
  • 上海:cn-shanghai
  • 广州:cn-guangzhou

算子性能

细分项
性能影响说明

最大 RPM

600

最大并发度

10

耗时

  • 总耗时与视频时长、内容复杂度、网络环境相关。

输入与输出要求

输入要求

细分
详细说明

支持的输入数据模态

  • 视频
  • 文本(任务补充文本)

输入格式:视频

  • 格式:mp4, mov, avi, mkv 等常见视频格式均支持
  • 大小:最大支持输入 3 小时、10 GB 的视频;对于需要输出较多事件和动作细节的任务,建议优先处理 30 分钟以内视频

输入路径要求

通过请求参数 video_url提供给算子输入数据,当前支持公网 URL、TOS 路径这两种方式。

  • 公网 URL:公网可访问的视频 URL,格式为 http/https
  • TOS 路径:将待处理数据上传至与当前 LAS 服务同主账号、同地域的 TOS Bucket后,可提供 TOS 路径,格式为tos://bucket_name/demo

输出要求

细分
详细说明

输出数据模态

  • 文本

输出路径:API 返回

算子处理完成后,直接通过算子 Poll 接口的返回参数将结果返回。

计费说明
  • 计费标准

    细分项
    计费标准说明

    计费项

    包括4个计费项:模型输入、模型输出、缓存存储、缓存命中。需支付的费用为所有计费项的计费之和。

    计费类型

    按量计费,单位:元/百万 Tokens,按实际的计费用量每小时出账。

    单价

    各计费项的单价以调用模型时,基于模型输入长度进行阶梯定价,处于不同输入长度的梯度范围内的单价不同。

  • 计费详情
    计费公式:总费用 = 模型输入费用 + 模型输出费用 + 缓存存储费用 + 缓存命中费用

    模型类型
    条件
    (千 token)
    输入(非音频)
    元/百万token
    输入(音频)
    元/百万token
    缓存存储
    元/百万token/小时
    缓存命中(非音频)
    元/百万token
    缓存命中(音频)
    元/百万token
    输出
    元/百万token

    doubao-seed-2.1-pro

    输入长度 [0, 256]

    12

    不涉及

    0.034

    2.4

    不涉及

    60

    doubao-seed-2.1-turbo

    输入长度 [0, 256]

    6

    不涉及

    0.034

    1.2

    不涉及

    30

    doubao-seed-2.0-pro

    输入长度 [0, 32]

    6.4

    不涉及

    0.034

    1.28

    不涉及

    32

    输入长度 (32, 128]

    9.6

    不涉及

    0.034

    1.92

    不涉及

    48

    输入长度 (128, 256]

    19.2

    不涉及

    0.034

    3.84

    不涉及

    96

    doubao-seed-2.0-lite

    输入长度 [0, 32]

    1.2

    18

    0.034

    0.24

    3.6

    7.2

    输入长度 (32, 128]

    1.8

    27

    0.034

    0.36

    5.4

    10.8

    输入长度 (128, 256]

    3.6

    54

    0.034

    0.72

    10.8

    21.6

    doubao-seed-2.0-mini

    输入长度 [0, 32]

    0.4

    6

    0.034

    0.08

    1.2

    4

    输入长度 (32, 128]

    0.8

    12

    0.034

    0.16

    2.4

    8

    输入长度 (128, 256]

    1.6

    24

    0.034

    0.32

    4.8

    16

  • 计费预估

    • 基于上述计费详情表格,您可预估输入的视频大约为多少 Token,结合算子请求代码预估大约多少 Token,作为整体模型输入长度的预估。
    • 注意:此预估结果并不能作为准确的输入长度数据,仅作为参考,实际进行任务处理时,还会有系统 Prompt 等其他输入,但其他输入的长度一般不会很长。

    说明

    当前,使用 doubao-seed-2.1 模型时,产生的费用账单中,影响因子依旧展示为 doubao-seed-2.0 相关的影响因子。您可根据账单中的单价等详情来明确当前账单实际使用的模型类型。

注意与前提

细分项

注意与前提

开通 LAS

  • 如果您是一个全新的火山引擎用户,此前未开通过 LAS 产品,您可先开通 LAS,不使用 LAS 的计费功能仅开通 LAS 产品不会产生费用。开通操作请参见准备工作
  • 开通完成后可查看算子介绍文档,了解算子能力、上手引导等,详情可参见:LAS 智能数据处理算子

费用

调用算子前,您需先了解使用算子时的模型调用费用,详情请参见大模型调用计费

鉴权(API Key)

调用算子前,您需要先生成算子调用的API Key,并建议将API Key配置为环境变量,便于更安全地调用算子,详情请参见获取 API Key 并配置

BaseURL

调用算子前,您需要先根据您当前使用的LAS服务所在地域,了解算子调用的BaseURL,用于配置算子调用路径参数取值。
详情请参见获取 Base URL,下文中的调用示例仅作为参考,实际调用时需替换为您对应地域的路径取值。

API 调用

API 调用说明

  • 本算子的 API 为异步任务接口,您需要通过 Submit 接口提交任务获得任务的 task_id,再通过 Poll 接口获取对应任务(task_id)运行状态,并获取算子处理结果。
  • 注意,任务提交后,任务的 task_id 有效期为 3 天,超过 3 天后即无法通过此 task_id 来获取算子处理结果。

Submit

接口说明

调用 las_video_understanding 算子进行视频精细理解。最小可用请求可传入 video_urlquery,也可传入 video_urltask_template,其余字段可根据任务复杂度和分析需求按需配置。

请求参数

参数
类型
是否必填
示例值
描述
operator_id
string
las_video_understanding
算子ID: las_video_understanding 或者 las_long_video_understand (旧)
operator_version
string
v1
算子版本
data
long_video_understand_info
算子参数

返回参数

参数
类型
示例值
描述
metadata
object
请求元信息
task_id
string
task-xxx
异步模式下的任务 ID,用于作业状态查询。
task_status
string
PENDING
异步模式下的任务状态。
  • PENDING, 提交任务排队
  • RUNNING, 正在运行
  • COMPLETED, 已经完成
  • FAILED, 失败
  • TIMEOUT, 超时
business_code
string
0
业务码。提交成功时通常返回 0 。
error_msg
string
如有异常,会返回详细的异常信息。

推荐配置

场景

推荐参数

通用摘要、基础问答

使用默认参数即可

体育比赛、动作细节分析

可适当提高 fps;对球衣号码、小目标等细节识别要求较高时,可尝试 media_resolution=high

会议纪要、课程拆解、剧情梳理

可尝试 clip_context=long;当任务涉及复杂归纳时,可进一步尝试提高 reasoning_effort

同一视频重复分析、复用已缓存视频

use_responses_api=true,并传入 previous_response_ids;视频缓存有效期为 1 小时

示例

请求示例

curl --location "https://operator.las.cn-beijing.volces.com/api/v1/submit" \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $LAS_API_KEY" \
--data '{
    "operator_id": "las_video_understanding",
    "operator_version": "v1",
    "data": {
      "video_url": "https://example.com/video.mp4",
      "task_template": "general_video_captioning@v1"  
    }
}'

返回示例

{
  "metadata": {
    "task_id": "task-20251125163544-abc123",
    "task_status": "PENDING",
    "business_code": "0",
    "error_msg": ""
  }
}

Poll

接口说明

查询视频理解任务的执行状态和结果。

请求参数

名称

类型

是否必选

示例值

描述

operator_id

string

las_video_understanding

算子 ID

operator_version

string

v1

算子版本

task_id

string

task-xxx

任务 ID

返回数据

参数
类型
示例值
描述
metadata
metadata
请求元信息
task_id
string
task-xxx
异步模式下的任务 ID。
task_status
string
COMPLETED
异步模式下的任务状态。
  • PENDING, 提交任务排队
  • RUNNING, 正在运行
  • COMPLETED, 已经完成
  • FAILED, 失败
  • TIMEOUT, 超时
异步任务通常需要结合 task_status=COMPLETEDbusiness_code=0 判断任务已真正完成。
submit_time
string
2026-07-21T16:04:06+08:00
任务提交时间,格式为 ISO 8601 时间戳。
end_time
string
2026-07-21T16:04:06+08:00
任务结束时间,格式为 ISO 8601 时间戳。
business_code
string
0
业务码。业务处理成功时通常返回 0
error_msg
string
如有异常,会返回详细的异常信息。
data
long_video_understand_result
返回的数据
token_usages
list of token_usage_info
[{"model_name":"doubao-seed-2-0-lite-260215","token_usage":{"prompt_tokens":4453444,"completion_tokens":10929}}]
token 使用情况
model_name
string
"doubao-seed-2-0-lite-260215"
模型名称
token_usage
object
{"prompt_tokens": 4453444, "completion_tokens": 10929, "cached_tokens": 10032, "cached_store_tokens": 10032, "total_tokens": 4464373}
Token 使用量
video_duration
float
847.296
原始视频时长
resolution
string
1920x1080
原始视频分辨率
final_summary
string
视频整体讲述了...
最终总结
response_ids
list of string
["cache_resp_test"]
开启 Responses API 后返回的响应标识符列表,可在后续 Submit 请求中通过 previous_response_ids 传入,以复用已缓存的视频内容

示例

请求示例

curl --location "https://operator.las.cn-beijing.volces.com/api/v1/poll" \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $LAS_API_KEY" \
--data '{
    "operator_id": "las_video_understanding",
    "operator_version": "v1",
    "task_id": "task-20251125163544-abc123"
}'

返回示例

{
    "metadata": {
        "task_id": "task-20251125163544-abc123",
        "task_status": "COMPLETED",
        "submit_time": "2026-07-21T16:04:06+08:00",
        "end_time": "2026-07-21T16:04:06+08:00",
        "business_code": "0",
        "error_msg": ""
    },
    "data": {
        "token_usages": [
            {
                "model_name": "doubao-seed-2-0-lite-260215",
                "token_usage": {
                    "prompt_tokens": 4453444,
                    "completion_tokens": 10929,
                    "cached_tokens": 2612,
                    "cached_store_tokens": 2612,
                    "total_tokens": 4464373
                }
            }
        ],
        "video_duration": 847.296,
        "resolution": "1920x1080",
        "final_summary": "视频整体讲述了...",
        "response_ids": [
            "cache_resp_test"
        ]
    }
}

错误码

HttpCode

错误码

错误信息

说明

400

Model.InvalidName

The model name is invalid.

模型名称不合法

401

Authorization.Missing

Missing Authorization.

缺少鉴权

401

ApiKey.Invalid

The api key is invalid.

API不合法

最近更新时间:2026.09.17 22:13:02
这个页面对您有帮助吗?
有用
有用
无用
无用