You need to enable JavaScript to run this app.
文档中心
文档控制台
注册
AI 数据湖服务

AI 数据湖服务

复制全文
下载 pdf
内容创作
短剧剧本解析
复制全文
下载 pdf
短剧剧本解析

短剧剧本解析算子用于将短剧剧本文本自动转化为结构化资产表。算子会读取一个或多个剧本文件,自动识别剧本格式与输出语言,提取人物、道具、场景三类资产,并通过视觉扩写补充人物外观、人物造型、道具视觉描述和场景空间描述,最终将结果保存为 JSON 文件。

算子介绍

算子ID:las_short_drama_script_parse

适用场景

  • 短剧资产拆解:从剧本快速生成角色、道具、场景清单,支持制片、美术、服化道和视觉资产规划。
  • 文生图/文生视频前处理:将剧本文本拆解为可复用的结构化视觉资产,供角色定妆、场景生成和镜头生成使用。
  • 多集剧本资产合并:对多集短剧进行统一解析,合并跨集重复资产,形成全剧级资产表。
  • 出海内容本地化:支持英文剧本输入和英文资产表输出,便于海外短剧制作与本地化流程。
  • 成本与规模评估:返回按模型聚合的 token 消耗,辅助预估大剧本解析成本。

核心能力

  • 多剧本输入解析:支持传入一个或多个剧本文件,按输入顺序拼接处理,适合单集、多集或全集剧本解析。
  • 人物资产表提取:识别人物名称、性别、基础外观、出场场次,并为主要人物补充符合剧本背景的多套造型描述。
  • 道具资产表提取:识别关键道具、出现在剧集中的场次位置、视觉特征和道具状态变化,辅助道具设计与资产管理。
  • 场景资产表提取:识别主要场景、空间类型、时间状态、氛围和视觉布置,辅助场景搭建与分镜生成。
  • 中英文剧本适配:支持中文短剧编号格式和英文 Hollywood/Fountain slug-line 格式;auto 模式下自动识别剧本格式并决定资产表输出语言。
  • 超长剧本稳定处理:对超过阈值的长剧本自动按场次边界分片,降低超长上下文请求带来的超时和截断风险。
  • TOS 产物交付:人物表、道具表、场景表和剧本背景信息均保存为 JSON 文件,并返回对应 TOS 路径。

效果展示

  • 输入剧本:
  • 通常输入剧本中仅包含核心剧情、相关人物/环境等简单描述。例如:
    Image

支持输入多集剧本,以下为两个输入示例

  • 剧集1
    ep_001.md
    未知大小
  • 剧集2
    ep_002.md
    未知大小
  • 剧本解析结果:
  • 人物资产表:
    基于全局剧本汇总人物列表,记录人物性别、出现剧集场次,并合理扩写补充人物外观、造型等内容。
    Image
    character_table.json
    未知大小
  • 道具资产表:
    基于全局剧本汇总道具列表,记录道具的状态变化,并合理扩写补充道具的外观特性内容
    Image
    prop_table.json
    未知大小
  • 场景资产表:
    基于全局剧本汇总场景列表,并合理扩写补充场景的空间类型、时间状态等内容
    Image
    scene_table.json
    未知大小

支持的地域

  • 北京:cn-beijing
  • 上海:cn-shanghai
  • 广州:cn-guangzhou

算子性能

细分项
性能影响说明

最大 RPM

600

最大并发数

10

输入与输出要求

输入要求

细分

详细要求

输入数据模态

  • 文本

输入格式:文本

  • 格式:支持 Markdown、TXT
  • 数量:单次任务支持输入一个或多个剧本文件
  • 剧本内容样式:剧本内容必须使用 UTF-8 编码,且内容不能为空,剧集内容每场戏必须包含独立的场次标记行,格式为 X-Y 场次描述,支持中文和英文剧本;更多要求请参见参考1:输入剧本内容样式要求
  • 其他:当输入剧本较长,导致输入给算子模型的长度过长,超过 LAS 的阈值(20 万字符)后,算子会按场次边界分片,并在输出时合并资产表。

输入路径要求

通过请求参数 script_urls 提供给算子输入数据,当前支持公网 URL、TOS 路径这两种方式。

  • 公网 URL:公网可访问的 URL,格式为 http/https
    • 公网 URL 不支持需要登录态或额外 Header 鉴权的地址;临时 URL 需在任务执行期间有效。
  • TOS 路径:将待处理数据上传至与当前 LAS 服务同主账号、同地域的 TOS Bucket后,可提供 TOS 路径下的文件地址,格式为tos://bucket_name/demo.md
    • TOS 对象需存在且具备读取权限。

输出要求

细分

详细要求

输出数据模态

  • 文本
  • 格式:JSON

输出路径:TOS

您可通过请求参数output_tos_path 指定算子输出结果的存储路径,当前支持设置为 TOS 路径。

  • TOS 路径:与LAS服务同主账号、同地域下,有可写权限的 TOS Bucket 目录,格式:tos://bucket/output/

输出路径:预签名 URL

如果您没有配置 output_tos_path 参数,任务运行完成后,生成结果将通过预签名链接返回,您可单击对应链接直接下载,链接有效期为 11 小时。

计费说明
  • 计费标准

    细分项
    计费标准说明

    计费项

    包括2个计费项:模型输入、模型输出。需支付的费用为所有计费项的计费之和。

    • 算子处理完成任务后,您可以在 poll 接口的返回结果中查看到模型的 Token 用量。
    • token_usage.prompt_tokens :模型输入的 Token 用量。
    • token_usage.completion_tokens :模型输出的 Token 用量。

    计费类型

    按量计费,单位:元/百万 Tokens,按实际的计费用量每小时出账。

    单价

    模型输入、模型输出的单价不同。

    • 输入:15 元/百万 Tokens
    • 输出:75 元/百万 Tokens

注意与前提

细分项

注意与前提

开通 LAS

  • 如果您是一个全新的火山引擎用户,此前未开通过 LAS 产品,您可先开通 LAS,不使用 LAS 的计费功能仅开通 LAS 产品不会产生费用。开通操作请参见准备工作
  • 开通完成后可查看算子介绍文档,了解算子能力、上手引导等,详情可参见:LAS 智能数据处理算子

费用

调用算子前,您需先了解使用算子时的模型调用费用,详情请参见大模型调用计费

鉴权(API Key)

调用算子前,您需要先生成算子调用的API Key,并建议将API Key配置为环境变量,便于更安全地调用算子,详情请参见获取 API Key 并配置

BaseURL

调用算子前,您需要先根据您当前使用的LAS服务所在地域,了解算子调用的BaseURL,用于配置算子调用路径参数取值。
详情请参见获取 Base URL,下文中的调用示例仅作为参考,实际调用时需替换为您对应地域的路径取值。

Rest API 调用

Submit

接口说明

提交 las_short_drama_script_parse 算子进行短剧剧本解析任务。

请求参数

参数
类型
是否必填
示例值
描述
operator_id
string
las_short_drama_script_parse
算子 ID。
operator_version
string
v1
算子版本,目前仅支持 v1。
data
ShortDramaScriptParseReqParams
算子参数。

返回数据

参数
类型
示例值
描述
metadata
metadata
请求元信息。

示例

请求示例

# 请将 INPUT_PATH 设置为可访问的剧本文件路径
export INPUT_PATH="tos://bucket/scripts/demo_script.md"
# 请将 OUTPUT_PATH 设置为可写入的 TOS 输出目录
export OUTPUT_PATH="tos://bucket/output/script_parse/"

curl --location "https://operator.las.cn-beijing.volces.com/api/v1/submit" \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $LAS_API_KEY" \
--data '{
    "operator_id": "las_short_drama_script_parse",
    "operator_version": "v1",
    "data": {
        "script_urls": ["$INPUT_PATH"],
        "output_tos_path": "$OUTPUT_PATH"
    }
}'

返回示例

{
  "metadata": {
    "task_id": "task-20260724130000-abc123",
    "task_status": "PENDING",
    "business_code": "0",
    "error_msg": ""
  }
}

错误码

HttpStatusCode

错误码

错误信息

描述

400

Parameter.Invalid

invalid parameter

参数不合法,如 script_urls 为空、URL 协议非 http/https/tos,或其他入参越界。

400

Parameter.Missing

Missing required parameter

缺少必需参数,如缺少 script_urls;或输入含 tos://、指定 output_tos_path 时缺少客户 TOS 凭证。

400

Tos.AccessFailed

Failed to access TOS path with provided credentials

TOS 路径访问失败或凭证无效。

400

DramaScript.Invalid

invalid drama script

剧本文件无效,如非 UTF-8 文本、内容为空或无法解析。

400

DramaScript.NoBeat

no valid beat found in drama script

未从剧本中识别到有效场次(beat)。

400

DramaScript.ExtractEmpty

script asset extraction returned empty result

资产抽取结果为空,未提取到人物/道具/场景。

400

DramaScript.LLMTruncated

LLM output was truncated

模型输出被截断(finish_reason=length)。

400

DramaScript.LLMFailed

LLM call failed during drama script parsing

剧本解析过程中模型调用失败。

401

Authorization.Missing

Missing Authorization.

缺少鉴权。

401

ApiKey.InValid

The api key is invalid.

API Key 不合法。

500

InternalError

Internal error

服务内部错误。

Poll

接口说明

查询短剧剧本解析任务的执行状态和结果。

请求参数

名称

类型

是否必选

示例值

描述

operator_id

string

las_short_drama_script_parse

算子 ID。

operator_version

string

v1

算子版本。

task_id

string

task-xxx

Submit 接口返回的任务 ID。

返回数据

参数
类型
示例值
描述
metadata
metadata
请求元信息。
data
ShortDramaScriptParseResponse
task_status 为 COMPLETED 时返回解析结果。

示例

请求示例

curl --location "https://operator.las.cn-beijing.volces.com/api/v1/poll" \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $LAS_API_KEY" \
--data '{
    "operator_id": "las_short_drama_script_parse",
    "operator_version": "v1",
    "task_id": "task-20260724130000-abc123"
}'

返回示例

{
  "metadata": {
    "task_id": "task-20260724130000-abc123",
    "task_status": "COMPLETED",
    "submit_time": "2026-07-21T16:04:06+08:00",
    "end_time": "2026-07-21T16:04:06+08:00",
    "business_code": "0",
    "error_msg": ""
  },
  "data": {
    "script_char_count": 60702,
    "character_count": 6,
    "prop_count": 5,
    "scene_count": 10,
    "artifacts": {
      "character_table_path": "tos://bucket/output/character_table.json",
      "prop_table_path": "tos://bucket/output/prop_table.json",
      "scene_table_path": "tos://bucket/output/scene_table.json",
      "script_context_path": "tos://bucket/output/script_context.json"
    },
    "token_usages": [
      {
        "token_usage": {
          "prompt_tokens": 100000,
          "completion_tokens": 20000,
          "total_tokens": 120000
        }
      }
    ]
  }
}

错误码

HttpStatusCode

错误码

错误信息

描述

400

Parameter.Invalid

invalid parameter

参数不合法,如 script_urls 为空、URL 协议非 http/https/tos,或其他入参越界。

400

Parameter.Missing

Missing required parameter

缺少必需参数,如缺少 script_urls;或输入含 tos://、指定 output_tos_path 时缺少客户 TOS 凭证。

400

Tos.AccessFailed

Failed to access TOS path with provided credentials

TOS 路径访问失败或凭证无效。

400

DramaScript.Invalid

invalid drama script

剧本文件无效,如非 UTF-8 文本、内容为空或无法解析。

400

DramaScript.NoBeat

no valid beat found in drama script

未从剧本中识别到有效场次(beat)。

400

DramaScript.ExtractEmpty

script asset extraction returned empty result

资产抽取结果为空,未提取到人物/道具/场景。

400

DramaScript.LLMTruncated

LLM output was truncated

模型输出被截断(finish_reason=length)。

400

DramaScript.LLMFailed

LLM call failed during drama script parsing

剧本解析过程中模型调用失败。

401

Authorization.Missing

Missing Authorization.

缺少鉴权。

401

ApiKey.InValid

The api key is invalid.

API Key 不合法。

500

InternalError

Internal error

服务内部错误。

参考

参考1:输入剧本内容样式要求

通用格式要求

输入剧本的内容,每场剧本内容必须包含独立的场次标记行,基本格式为:

X-Y 场次描述

该格式不限制正文语言。中文和英文剧本均可使用,例如 1-1 日 外 秦岭山中1-1 INT. OFFICE - DAY 都可以被识别。

  • 详细格式要求
    • X 表示集号,Y 表示该集内的场次号,分别由 1~3 位数字组成。
    • 集号与场次号之间只支持半角中划线 - 或下划线 _
    • 分隔符两侧可以有空格,例如 1 - 2
    • 场次号后如有场景描述,需用空格隔开,例如 1-1 日 外 山中;编号单独成行时可直接换行。
    • 场次标记必须单独成行并尽量顶格书写;如需缩进,行首最多保留 3 个空格。
    • 编号前可添加 ######场号:场号:,例如 ### 1-1 日 外 山中
  • 内容示例
    # 第 1 集剧本
    
    ## 正文剧本
    
    ## 1-1 内景 航空管制中心大厅 日
    
    出场人物:苏星晚、陆霆川
    
    △ 冷光灯照亮航空管制中心大厅,墙面上的多块监测屏幕显示着航班轨迹、气象雷达等信息,苏星晚身着藏青色空管制服坐在管制台的黑色办公椅上,视线看向前方屏幕。
    
    苏星晚(神色严肃):中南8562,前方两公里强雷雨回波,立即右转航道120,否则有坠毁风险!
    ……
    

英文 Hollywood/Fountain 格式

英文剧本既可以使用上文的 X-Y 集-场编号格式,也可以通过 Hollywood/Fountain slug line 识别场次。

  • 详细格式要求
    • 支持 INT.EXT.EST.I/E.INT./EXT.EXT./INT.
    • 场景类型大小写不敏感,句点可以省略,但建议使用标准写法。
    • 场景类型后必须包含空格和非空的场景描述。
    • 使用 Hollywood/Fountain 格式并由算子自动识别时,剧本应至少包含两条合法的英文场景标题。
    • 支持 EPISODE 1EP. 2EP 3 等分集标题。
    • 没有分集标题时,整份英文剧本会被视为第 1 集,场次号按出现顺序自动生成。
  • 内容示例
    EPISODE 1
    
    INT. COFFEE SHOP - DAY
    Sarah sits beside the window, holding a red notebook.
    
    SARAH
    We need to leave before noon.
    
    EXT./INT. CAR - NIGHT
    John starts the engine and checks the rear-view mirror.
    

参考:解析结果表字段说明

算子处理完成任务后,会生成人物、道具、场景、剧本背景资产表。对应表字段说明如下。

字段名

人物资产表

道具资产表

场景资产表

id

人物在当前表内的唯一标识

道具在当前表内的唯一标识

场景在当前表内的唯一标识

name

人物名称

道具名称

场景名称

gender

人物性别

不涉及

不涉及

location

不涉及

不涉及

场景所属的粗粒度大地点

appearance/description

人物基础外貌形象描述

道具外形特征/基础常态描述

场景环境、空间结构、视觉布置等描述

makeups

人物服装、妆造、年龄阶段等造型描述

道具状态变化描述

场景时段/状态/氛围变体描述

occur_beats

人物出现的场次编号,格式 beat_X_Y

道具出现的场次编号,格式 beat_X_Y

场景出现的场次编号,格式 beat_X_Y

total_count

人物总数

道具总数

场景总数

version

schema 版本

schema 版本

schema 版本

最近更新时间:2026.08.03 15:27:47
这个页面对您有帮助吗?
有用
有用
无用
无用