You need to enable JavaScript to run this app.
文档中心
AI 数据湖服务

AI 数据湖服务

复制全文
下载 pdf
文档解析
PDF 文档解析(豆包)
复制全文
下载 pdf
PDF 文档解析(豆包)

PDF 内容解析算子,支持对 PDF 文件和图片文件进行视觉模型解析与 Markdown 结构化输出,支持对模糊、复杂排版、繁体、复杂公式等内容进行解析并输出高保真 Markdown 解析结果。

算子介绍

算子 ID:las_pdf_parse_doubao

核心能力

  • 可更准确的解析模糊、复杂排版、繁体、复杂公式等内容,输出高保真 Markdown 结果;支持两种解析模式:normal 模式、detail 模式。
    • normal 模式:默认开启,不进行深度思考。该模式解析速度更快,适用于绝大多数文档场景。
    • detail 模式:代表开启深度思考。该模式在 normal 模式基础上进行更细致的分析,但耗时相对更长、费用更高。
  • 可完整还原原文结构(标题层级、表格、公式、图片区域)。
    • 自动识别图片区域并返回 bounding box 信息及图片预签名 URL。
    • 支持逐页和整书 Markdown 汇总,便于后续内容处理和展示。
  • 支持长智能分段:当输入图片或 PDF 页面的宽高比低于阈值(默认 0.334)时,智能分段后分别解析并合并,提升解析质量。

效果展示


【示例1:PDF报告解析】
  • 输入示例
    Image
  • 输入原文件
    多模态数据湖解决方案-白皮书.pdf
    未知大小
  • 解析结果示例
    Image
  • 高保真结果
    多模态数据湖解决方案-md解析.zip
    未知大小

【示例2:模糊、重影、繁体、纵向排版】
  • 输入示例
    Image
  • 输入原文件
    写与读.pdf
    未知大小
  • 解析结果示例
    Image
  • 高保真结果
    写与读-md解析.zip
    未知大小

【示例3:复杂公式】
  • 输入示例
    Image
  • 输入原文件
    薛定谔方程科普:量子力学的核心语言.pdf
    未知大小
  • 解析结果示例
    Image
    注:您需使用具备复杂公式渲染能力的Markdown编辑工具进行查看
  • 高保真结果示例
    薛定谔方程科普-md解析.zip
    未知大小

支持的地域

  • 北京:cn-beijing
  • 上海:cn-shanghai

算子性能

细分项
性能影响说明

最大 RPM

600

最大并发

10

耗时

  • 总耗时与页数、网络环境相关。
    • 长页面分段会增加额外的模型调用开销,总耗时相应增加。
    • 对于超大分辨率或超大页数的文档,解析耗时与资源占用会显著增加。

输入与输出要求

输入要求

细分

详细要求

支持的输入数据模态

  • 文本(PDF)
  • 图片

输入格式:PDF

  • 大小:单次最大支持 400 页的 PDF 文档解析;总文件大小不超过 1GB。
    • 超出 400 页建议通过 start_page 和 num_pages 参数分开多次请求解析。
  • 其他要求:输入的 PDF 文档需要尽量不包含复杂动态对象或受保护内容。

    注意

    当前仅支持解析可渲染的页面内容;若页面为复杂动态对象或受保护内容,则无法处理。

输入格式:图片

  • 格式:PNG、JPEG、BMP、WebP 等常见图片格式

输入路径要求

通过请求参数 url 提供给算子输入数据,当前支持公网 URL、TOS 路径这两种方式。

  • 公网 URL:公网可访问的PDF 或图片 URL,格式为 http/https
    • 公网 URL 不支持需要登录态或额外 Header 鉴权的地址;临时 URL 需在任务执行期间有效。
  • TOS 路径:将待处理数据上传至与当前 LAS 服务同主账号、同地域的 TOS Bucket后,可提供 TOS 路径,格式为tos://bucket_name/demo
    • TOS 对象需存在且具备读取权限。

输出要求

细分

详细要求

输出数据模态

  • 文本(Markdown、JSON文件)
  • 图片

输出路径:TOS

通过请求参数output_tos_path 指定算子输出结果的存储路径,当前支持设置为 TOS 路径。

  • TOS 路径:与LAS服务同主账号、同地域下,有可写权限的 TOS Bucket 目录,格式:tos://bucket/output/
  • 输出结果目录结构:输出结果包含:result.mdresult_preview.mdimages/detail.json
    tos://bucket/output/{task_id}/
    ├── result.md
    ├── result_preview.md
    ├── images/
    │   ├── xxxx.png
    │   └── xxxx.png
    └── detail.json
    

计费说明
  • 计费标准

    细分项
    计费标准说明

    计费项

    基于输入PDF/图片智能分段后的页数统计用量,并进行计费。

    说明

    当输入的PDF/图片过长(宽高比低于阈值)时,LAS 会自动分段再解析,完成后poll 接口的返回参数 billable_pages 即为智能分段后的计费页数。

    计费类型

    按量计费,单位:元/页,按实际的计费用量每小时出账。

    单价

    与选择的PDF解析模式有关。

  • 计费详情
    计费公式:总费用 = 单价 * 用量

    细分场景
    单价
    • PDF解析模式:normal模式

    0.02 元/页

    • PDF解析模式:detail模式

    0.04 元/页

注意与前提

细分项

注意与前提

开通 LAS

  • 如果您是一个全新的火山引擎用户,此前未开通过 LAS 产品,您可先开通 LAS,不使用 LAS 的计费功能仅开通 LAS 产品不会产生费用。开通操作请参见准备工作
  • 开通完成后可查看算子介绍文档,了解算子能力、上手引导等,详情可参见:LAS 智能数据处理算子

费用

调用算子前,您需先了解使用算子时的模型调用费用,详情请参见大模型调用计费

鉴权(API Key)

调用算子前,您需要先生成算子调用的API Key,并建议将API Key配置为环境变量,便于更安全地调用算子,详情请参见获取 API Key 并配置

BaseURL

调用算子前,您需要先根据您当前使用的LAS服务所在地域,了解算子调用的BaseURL,用于配置算子调用路径参数取值。
详情请参见获取 Base URL,下文中的调用示例仅作为参考,实际调用时需替换为您对应地域的路径取值。

在线体验

LAS 为您提供了“在线体验”的能力,并为您提供了一定的免费体验额度,您无需任何配置,即可在线体验 LAS 算子的数据处理效果。

注意

当前算子在线体验可免费解析 50 页的 PDF 文档,超出部分会依据算子的计费项进行计费,各算子的计费项及计费逻辑请参见大模型调用计费

在线体验入口

登录并进入LAS 控制台 后,查找到当前算子卡片,鼠标悬浮于算子卡片上,单击“在线体验”按钮。
Image

在线体验操作演示

  • LAS 为您提供了多个示例数据文档,您也可以删除示例文档,手动上传文档。
  • 在线体验时,可灵活设置算子的处理参数。

API 调用

API 调用说明

  • 本算子的 API 为异步任务接口,您需要通过 Submit 接口提交任务获得任务的 task_id,再通过 Poll 接口获取对应任务(task_id)运行状态,并获取算子处理结果。
  • 注意,任务提交后,任务的 task_id 有效期为 3 天,超过 3 天后即无法通过此 task_id 来获取算子处理结果。

Submit

接口说明

调用 PDF 文档解析(豆包) 进行内容解析,支持对公网、火山内网或 TOS 的 PDF 或图片源文件进行视觉模型解析,得到 Markdown 或结构化输出。

请求参数

参数
类型
是否必填
示例值
描述
operator_id
string
las_pdf_parse_doubao
算子 ID
operator_version
string
v1
算子版本
data
PdfParseUserReqParams
PDF 解析请求参数
url
string
https://example.com/file.pdf
文件的可下载地址,支持 PDF 和图片(PNG、JPEG、BMP、WebP)格式。系统会通过文件头自动检测输入类型,无需手动指定。支持 http/https、火山 TOS(tos://bucket/key)。系统会通过文件头自动检测输入类型,无需手动指定。
start_page
integer
1
起始页(1 为第一页)。默认值 1。
num_pages
integer
-
解析的页数。未设置则默认解析 200 页;设置则最多支持 400 页。
parse_mode
string
normal
文档解析功能基于视觉理解大模型,能够对多语言、复杂版面、复杂公式、复杂表格以及页面模糊等多种场景下的文档实现高质量解析。解析模式分为 normal 和 detail 两种:
  • normal 模式:默认开启,不进行深度思考。该模式解析速度更快,适用于绝大多数文档场景。
  • detail 模式:代表开启深度思考。该模式在 normal 模式基础上进行更细致的分析,但耗时相对更长。
output_tos_path
string
tos://user-bucket/path/to/output/
将解析结果的相关产物保存在指定的 TOS 目录中。默认为空,则不保存到 TOS 目录中;如果指定了的话,将把解析结果保存到指定的 TOS 目录中。指定 TOS 目录时,仅支持指定同主账号(算子调用的 LAS API Key 与 TOS Bucket 的账号为同一个账号)、同地域的 TOS Bucket 路径目录。
适用于批量处理保存的场景。包括以下各个文件:
  • result.md:保存完整解析的 markdown 结果,其中的图片链接为 images 下图片的相对路径;
  • result_preview.md:保存完整解析的 markdown 结果,其中的图片链接使用临时可访问的预签名 https 链接;
  • images/:保存解析的图片结果;
  • detail.json:保存按页解析的结果。
目录结构如下:
tos://user-bucket/path/to/output/{task_id}/
├── result.md
├── result_preview.md
├── images/
│ ├── xxxx.png
│ └── xxxx.png
└── detail.json
full_result
boolean
true
是否返回完整结果。默认为 true,返回的 markdown 和 detail 字段有值;设为 false 时,markdown 为空字符串,detail 为空列表,适用于仅需获取产物 TOS 路径的场景。
aspect_ratio_threshold
float
0.334
长页面智能分段的宽高比阈值。当输入图片或 PDF 页面的宽/高比值低于此阈值时,系统会自动识别为长页面并触发智能分段。默认值 0.334。

返回数据

参数
类型
示例值
说明
metadata
metadata
请求元信息
task_id
string
task-xxx
异步模式下的任务 ID,用于作业状态查询。
task_status
string
PENDING
异步模式下的任务状态。
  • PENDING, 接收请求
  • FAILED, 失败
business_code
string
业务码。
error_msg
string
如有异常,会返回详细的异常信息。

示例

请求示例

curl --location "https://operator.las.cn-beijing.volces.com/api/v1/submit" \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $LAS_API_KEY" \
--data '{
    "operator_id": "las_pdf_parse_doubao",
    "operator_version": "v1",
    "data": {
        "url": "https://las-ai-cn-beijing-baseline.tos-cn-beijing.volces.com/operator_cards_serving/public/baseline/las_pdf_parse_doubao/v1/pdf-sample.pdf"
    }
}'

返回示例

{
    "metadata": {
        "task_id": "task-20251125163544-abc123",
        "task_status": "PENDING",
        "business_code": "200",
        "error_msg": ""
    }
}

错误码

HttpCode

错误码

错误信息

说明

400

Model.InvalidName

The model name is invalid.

模型名称不合法

401

Authorization.Missing

Missing Authorization.

缺少鉴权

401

ApiKey.InValid

The api key is invalid.

API不合法

Poll

接口说明

查询 PDF 解析任务的执行状态和结果。

请求参数

参数

类型

必填

示例值

说明

operator_id

string

las_pdf_parse_doubao

算子 ID

operator_version

string

v1

算子版本

task_id

string

task-xxx

任务 ID

返回数据

参数
类型
示例值
描述
metadata
metadata
请求元信息
task_id
string
task-xxx
异步模式下的任务 ID。
task_status
string
COMPLETED
异步模式下的任务状态。
  • PENDING, 提交任务排队
  • RUNNING, 正在运行
  • COMPLETED, 已经完成
  • FAILED, 失败
  • TIMEOUT, 超时
submit_time
string
2026-07-21T16:04:06+08:00
任务提交时间,格式为 ISO 8601 时间戳。
end_time
string
2026-07-21T16:04:06+08:00
任务结束时间,格式为 ISO 8601 时间戳。
business_code
string
200
业务码。
error_msg
string
如有异常,会返回详细的异常信息。
data
PdfParseResponse
返回的数据
markdown
string
所有页面的最终 Markdown 合并内容。当 full_result 为 false 时,返回空字符串。其中图片链接为预签名 https 链接(有效期 3 天)。
detail
list of page_detail
逐页解析详情,含页面 Markdown、尺寸信息与结构化文本块。当 full_result 为 false 时,返回空列表。其中图片链接为预签名 https 链接(有效期 3 天)。
page_id
integer
1
页编号(1 开始)。
page_md
string
当前页的最终 Markdown(包含 bbox->图片替换)。
page_image_hw
object
{"h":3508,"w":2480}
页渲染图片的高度与宽度(像素)。
text_blocks
list of text_block
文本块序列(按阅读顺序,包含图片占位的结构化信息)。
text
string
文本内容(当 label 为 text 时)。
label
string
"text" 或 "image"
块类型。
box
object
{"x0":100,"y0":200,"x1":400,"y1":650}
在原页面中的坐标(0 - 1000 的数值按页宽高等比映射)。
norm_box
list of float
[0.1,0.2,0.4,0.65]
归一化 bbox(如有)。
url
string
图片裁剪的预签名 URL(有效期为 3 天)。
page_split
page_split
长页面分段信息。仅当该页面触发了智能分段时返回,否则为空对象。
num_pieces
integer
3
该页面分段后的段数。
piece_bboxes
list of object
每段在原页面中的位置信息列表,按顺序对应各段。
box
object
{"x0":0,"y0":0,"x1":1000,"y1":333}
该段在原页面中的归一化坐标(0-1000)。
artifacts
Artifacts
产物路径信息,包含各产物的 TOS 路径或预签名 URL。
markdown_tos_path
string
tos://user-bucket/path/to/output/{task_id}/result.md
result.md 的 TOS 路径。仅当指定 output_tos_path 时有值。
detail_tos_path
string
tos://user-bucket/path/to/output/{task_id}/detail.json
detail.json 的 TOS 路径。仅当指定 output_tos_path 时有值。
image_tos_path
string
tos://user-bucket/path/to/output/{task_id}/images/
images/ 目录的 TOS 路径。仅当指定 output_tos_path 时有值。
result_preview_url
string
result_preview.md 的预签名链接(有效期三天)。
num_pages
integer
输入文档实际页数(对于图片输入该值为 1)。
billable_pages
integer
按拆分后计费的总页数。当输入的文档中包含过长的页面(宽高比低于阈值)时,系统会自动分段分别解析,此字段为分段后的总段数。对于普通 PDF 或无需分段的图片,与 num_pages 一致。
error
string
当发生异常时返回错误信息。

示例

请求示例

curl --location "https://operator.las.cn-beijing.volces.com/api/v1/poll" \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $LAS_API_KEY" \
--data '{
    "operator_id": "las_pdf_parse_doubao",
    "operator_version": "v1",
    "task_id": "task-20251125163544-abc123"
}'

返回示例

{
    "metadata": {
        "task_id": "task-20251125163544-abc123",
        "task_status": "COMPLETED",
        "submit_time": "2026-07-21T16:04:06+08:00",
        "end_time": "2026-07-21T16:04:06+08:00",
        "business_code": "200",
        "error_msg": ""
    },
    "data": {
        "markdown": "我的小狗 \n我家有一只可爱的小狗,它的名字叫小白。小白是一只白色的泰迪犬,它有一双圆圆的大眼睛,像两 颗黑珍珠一样闪闪发光...",
        "detail": [
            {
                "page_id": 1,
                "page_md": "我的小狗 \n我家有一只可爱的小狗,它的名字叫小白。小白是一只白色的泰迪犬,它有一双圆圆的大眼睛,像两 颗黑珍珠一样闪闪发光。...",
                "page_image_hw": {
                    "h": 3508,
                    "w": 2480
                },
                "text_blocks": [
                    {
                        "text": "我的小狗 \n我家有一只可爱的小狗,它的名字叫小白。小白是一只白色的泰迪犬,它有一双圆圆的大眼睛,像两 颗黑珍珠一样闪闪发光。...",
                        "label": "text",
                        "box": {
                            "x0": 100,
                            "y0": 200,
                            "x1": 400,
                            "y1": 650
                        },
                        "norm_box": [
                            0.1,
                            0.2,
                            0.4,
                            0.65
                        ]
                    }
                ],
                "page_split": {}
            }
        ],
        "artifacts": {
            "markdown_tos_path": "",
            "image_tos_path": "",
            "detail_tos_path": "",
            "result_preview_url": "https://las-bucket.tos-cn-beijing.volces.com/path/to/result_preview.md?X-Amz-Expires=259200&..."
        },
        "num_pages": 1,
        "billable_pages": 1
    }
}

错误码

HttpCode

错误码

错误信息

说明

400

Model.InvalidName

The model name is invalid.

模型名称不合法

401

Authorization.Missing

Missing Authorization.

缺少鉴权

401

ApiKey.InValid

The api key is invalid.

API不合法

400

Url.Invalid

The url is invalid.

文档链接不合法

400

Pdf.Invalid

The pdf file is invalid.

PDF 文件不合法

400

Pdf.RenderFailed

PDF render failed.

PDF 渲染失败

400

Pdf.ModelFailed

VLM call failed.

视觉模型调用失败

400

Pdf.Timeout

Pdf parse timeout.

PDF 解析超时

400

Pdf.PagesExceeded

PDF pages exceeded maximum limit of 400.

PDF页数超出最大限制

400

Pdf.PageRangeInvalid

Requested page range is out of bounds.

请求的页码范围超出文档总页数

400

Pdf.FileTooLarge

PDF file size exceeds maximum limit of 1GB.

PDF文件大小超出限制

403

Tos.AccessFailed

Failed to access TOS path.

TOS 路径访问失败,请检查 access_key 和 secret_key 权限

最近更新时间:2026.08.18 10:35:47
这个页面对您有帮助吗?
有用
有用
无用
无用