You need to enable JavaScript to run this app.
文档中心
AI 数据湖服务

AI 数据湖服务

复制全文
下载 pdf
音频识别
语音转文字(Doubao-Seed-2.0-lite)增强版
复制全文
下载 pdf
语音转文字(Doubao-Seed-2.0-lite)增强版

LAS语音转文字(Doubao-Seed-2.0-lite)增强版算子在基础 ASR 识别结果之上提供多模态精修能力:先完成输入下载、音频抽取、时长探测与基础 ASR 识别;当路由、语种和基础 ASR 结果满足精修条件时,将音频切片、基础 ASR 识别草稿以及从热词上下文中抽取的参考热词发送给多模态模型,用于修正专有名词、数字、标点和部分识别错误,并在模型判断存在漏识别时尝试补全内容。

算子介绍

算子 ID : las_asr_seed-2-0-lite

应用场景

  • 会议访谈转写:将会议、访谈音频异步识别为文字并精修,提升专有名词与术语的准确率,自动分段,提升记录效率。
  • 播客与课程转写:对长音频进行高质量转写与精修,适合内容沉淀与二次创作。
  • 音视频字幕:自动将音/视频中的语音识别转换为带时间戳的字幕,并通过精修提升可读性。
  • 内容审核质检:将录音识别为文字并精修后,结合质检规则进行分析。

核心能力

  • 多模态精修:
    • 在基础识别结果之上,调用 Doubao-Seed-2.0-lite 多模态模型,对专有名词、数字、标点、语义连贯性进行纠正与补全,显著提升转写文本质量。
    • 精修失败时可回退基础 ASR 结果,保证可用性。
  • 多格式音频/视频输入识别:
    • 支持音频与视频文件输入,自动提取视频音轨进行识别。
  • 丰富的识别能力:
    • 支持文本规范化(ITN)、自动标点、语义顺滑(DDC)、说话人分离。
  • 热词与敏感词:
    • 支持热词直传与热词表增强,热词同时进入底层 ASR 与精修 Prompt。
    • 支持敏感词保护:系统脱敏内容可不送精修模型,并支持自定义置空/星号替换。

支持的地域

地域

region id

Base URL

华北 2 (北京)

cn-beijing

https://operator.las.cn-beijing.volcesbytepluses.com

华东 2 (上海)

cn-shanghai

https://operator.las.cn-shanghai.volces.com

华南1(广州)

cn-guangzhou

https://operator.las.cn-guangzhou.volces.com

支持的语种

说明

建议显式传入 audio.language。若未传语种,代码默认走 SeedASR 资源;精修阶段会优先使用显式语种,其次使用 SeedASR 返回的 lid_lang,仍未知时默认回退为 zh 进行精修。若语种不受精修模型支持,则跳过精修,仅返回基础识别结果。

语种

是否支持精修

阿拉伯语(ar)

德语(de)

俄语(ru)

法语(fr)

菲律宾语(fil)

韩语(ko)

荷兰语(nl)

马来语(ms)

葡萄牙语(pt)

日语(ja)

泰语(th)

土耳其语(tr)

西班牙语(es)

英语(en)

印尼语(id)

意大利语(it)

越南语(vi)

粤语(yue)

中文(zh)

算子性能

细分项
性能影响说明

最大 RPM

600

最大并发度

10

耗时

  • 总耗时与音频时长正相关。

输入与输出要求

输入要求

细分
详细说明

支持的输入数据模态

  • 音频
  • 视频

输入格式:音频/视频

  • 音频格式:raw、wav、mp3、ogg、flac 等常见格式
  • 视频格式:mp4、mov、mkv 等常见格式
  • 其他:只支持单个语音/视频文件传入;输入的音频统一采用 ffmpeg 转成16K 单声道wav格式。

输入路径要求

通过请求参数 url提供给算子输入数据,当前支持公网 URL、TOS 路径这两种方式。

  • 公网 URL:公网可访问的视频 URL,格式为 http/https
  • TOS 路径:将待处理数据上传至与当前 LAS 服务同主账号、同地域的 TOS Bucket后,可提供 TOS 路径,格式为tos://bucket_name/demo

输出要求

细分
详细说明

输出数据模态

  • 文本

输出路径:API 返回

算子处理完成输入的音频文件后,会将转换好的文字直接通过算子 Poll 接口的返回参数将结果返回。

计费说明
  • 计费标准

    细分项
    计费标准说明

    计费项

    使用当前算子时,会默认使用精修模型对语言识别结果进行精修,因此,计费项包含语音识别结果精修两部分:

    • 语音识别:基于输入音频/视频的时长统计用量进行计费,单位:元/小时
    • 结果精修:按精修模型(Doubao-Seed-2.0-lite)的 token 用量计费,单位:元/百万tokens

    最终费用为两部分费用之和。

    计费类型

    按量计费,按实际的计费用量每小时出账。计费精度:毫秒级精度,去尾

    单价

    与使用的模型有关。

  • 计费详情
    计费公式:总费用 = 语音识别费用 + 精修费用 = (语音识别单价 * 音频时长)+(精修的梯度单价 * 模型用量)

    • 语音识别单价:

      语音识别模型
      单价

      Seed-ASR 2.0 增强版

      1.6 元/小时

    • 精修单价:

      精修模型

      模型输入长度
      (千 token)

      缓存存储

      文本输入

      音频输入

      文本缓存命中

      音频缓存命中

      输出

      单位

      Seed-2.0 Lite

      [0, 32]

      0.017

      0.6

      9

      0.12

      1.8

      3.6

      元/百万 tokens

      (32, 128]

      0.017

      0.9

      13.5

      0.18

      2.7

      5.4

      元/百万 tokens

      (128, 256]

      0.017

      1.8

      27

      0.36

      5.4

      10.8

      元/百万 tokens

  • 计费示例

    • 示例场景:输入了一个 3 分钟的视频,使用当前算子对语音进转文字,处理结果中显示模型用量结果如下。

      "token_usages": [
            {
              "task_info": "refine_chunk_001",
              "model_name": "doubao-seed-2-0-lite-260428",
              "token_usage": {
                "prompt_tokens": 2015,
                "completion_tokens": 6429,
                "total_tokens": 8444,
                "cached_tokens": 0,
                "audio_tokens": 814,
                "audio_cached_tokens": 0,
                "reasoning_tokens": 5599
              }
            }
            ]
      
    • 费用详情:

      • 语音识别费用:
        语音识别费用 = 1.6 元/小时 * (3/60)小时 = 0.08 元
      • 精修费用:
        • 模型输入 Token 用量(prompt_tokens)为:2015,在[0, 32] 千 token 阶梯内。
        • 缓存相关 Token 均为 0,因此,不涉及缓存相关费用。
        • 文本输入 Token 用量(prompt_tokens - audio_tokens)为:2015 - 814 = 1198
        • 音频输入 Token 用量(audio_tokens):814
        • 输出 Token 用量(completion_tokens):6429
          因此:
        精修费用 = 文本输入费用 +音频输入费用 + 输出费用 
                = 0.6 元/百万 tokens * (1198/1000,000) +9 元/百万 tokens * (814/1000,000) + 3.6 元/百万 tokens * (6429/1000,000)
                ≈ 0.0007 + 0.0073 + 0.231
                ≈ 0.239 元
        

      总费用 = 语音识别费用 + 精修费用 = 0.08 元 + 0.239 元 = 0.319 元

注意与前提

细分项

注意与前提

开通 LAS

  • 如果您是一个全新的火山引擎用户,此前未开通过 LAS 产品,您可先开通 LAS,不使用 LAS 的计费功能仅开通 LAS 产品不会产生费用。开通操作请参见准备工作
  • 开通完成后可查看算子介绍文档,了解算子能力、上手引导等,详情可参见:LAS 智能数据处理算子

费用

调用算子前,您需先了解使用算子时的模型调用费用,详情请参见大模型调用计费

鉴权(API Key)

调用算子前,您需要先生成算子调用的API Key,并建议将API Key配置为环境变量,便于更安全地调用算子,详情请参见获取 API Key 并配置

BaseURL

调用算子前,您需要先根据您当前使用的LAS服务所在地域,了解算子调用的BaseURL,用于配置算子调用路径参数取值。
详情请参见获取 Base URL,下文中的调用示例仅作为参考,实际调用时需替换为您对应地域的路径取值。

在线体验

LAS 为您提供了“在线体验”的能力,并为您提供了一定的免费体验额度,您无需任何配置,即可在在线体验 LAS 算子的数据处理效果。

注意

当前算子在线体验可免费解析 5 分钟的音频文件,超出部分会依据算子的计费项进行计费。

在线体验入口

登录并进入 LAS 控制台LAS 控制台 后,查找到当前算子卡片,鼠标悬浮于算子卡片上,单击“在线体验”按钮。
Image

在线体验操作演示

  • LAS 为您提供了多个示例音频文件,您也可以删除示例文件,手动上传。
  • 在线体验时,可灵活设置算子的处理参数。

Rest API 调用

语音转文字(Doubao-Seed-2.0-lite)增强版算子调用为异步接口,处理流程分为 提交任务 和 查询结果 两个阶段。您需要先创建语音识别任务,再通过任务 ID 查询识别结果。

API 调用说明

  • 本算子的 API 为异步任务接口,您需要通过 提交任务 接口提交任务获得任务的 task_id,再通过 查询结果 接口获取对应任务(task_id)运行状态,并获取算子处理结果。
  • 注意,任务提交后,任务的 task_id 有效期为 3 天,超过 3 天后即无法通过此 task_id 来获取算子处理结果。

提交任务

接口说明

提交音频链接,并获取服务端分配的任务 ID。本算子默认开启 Doubao-Seed-2.0-lite 多模态精修,底层固定使用 seedasr 资源。

请求参数

参数
类型
是否必填
示例值
描述
operator_id
string
las_asr_seed-2-0-lite
算子Id
operator_version
string
v1
算子版本
data
SpeechRecognition
请求数据

返回数据

参数
类型
示例值
描述
metadata
Metadata
请求元信息
task_id
string
异步模式下的任务id。
task_status
string
异步模式下的任务状态。
business_code
string
业务码
error_msg
string
如有异常,会返回详细的异常信息。
request_id
string
请求requestid

示例

请求示例

curl --location "https://operator.las.cn-beijing.volces.com/api/v1/submit" \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $LAS_API_KEY" \
--data '
{
    "operator_id": "las_asr_seed-2-0-lite",
    "operator_version": "v1",
    "data": {
        "audio": {
            "url": "https://${LAS_TOS_BUCKET}.tos-${LAS_REGION}.volces.com/operator_cards_serving/public/${LAS_ENVIRONMENT}/las_asr/badaling.wav",
            "language": "zh",
            "format": "wav"
        },
        "request": {
            "enable_punc": true,
            "enable_speaker_info": true,
            "corpus": {
                "context": "{\"hotwords\":[{\"word\":\"火山引擎\"}]}"
            }
        }
    }
}'

返回示例

{
  "metadata": {
    "task_id": "xxxxx123ef24ea40546c",
    "task_status": "PENDING",
    "business_code": "0",
    "error_msg": "",
    "request_id": "494022a8a0fc3eadb758cf8b0e8b20ef"
  }
}

错误码

HttpStatusCode

错误码

错误信息

描述

400

Parameter.Invalid

The parameter is invalid.

参数不合法

401

Authorization.Missing

Missing Authorization.

缺少鉴权

401

ApiKey.Invalid

The api key is invalid.

API不合法

429

Server.Busy

Server is Busy, please try again later.

服务端繁忙限流

500

Server.InternalError

根据具体异常而定

业务异常

查询结果

接口说明

通过任务 ID 查询语音转写与精修结果。

请求参数

名称

类型

是否必选

示例值

描述

operator_id

string

las_asr_seed-2-0-lite

算子Id

operator_version

string

v1

算子版本

task_id

string

异步任务Id

返回数据

参数
类型
示例值
描述
metadata
Metadata
请求的元信息,异步任务的id在其中的task_id字段下。
data
AudioResponse
返回的音频识别与精修结果。

示例

请求示例

curl --location "https://operator.las.cn-beijing.volces.com/api/v1/poll" \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $LAS_API_KEY" \
--data '
{
    "operator_id": "las_asr_seed-2-0-lite",
    "operator_version": "v1",
    "task_id": "xxxxx123ef24ea40546c"
}'

返回示例

{
    "metadata": {
        "task_id": "xxxxx123ef24ea40546c",
        "task_status": "COMPLETED",
        "submit_time": "2026-07-21T16:04:06+08:00",
        "end_time": "2026-07-21T16:04:06+08:00",
        "business_code": "0",
        "error_msg": "",
        "request_id": "d204c21f5c7c8f8cfeb85d211b9c20ac"
    },
    "data": {
        "audio_info": {
            "duration": 3575,
            "language": "zh"
        },
        "result": {
            "text": "参观八达岭长城。",
            "utterances": [
                {
                    "additions": {
                        "speaker": "1"
                    },
                    "end_time": 2320,
                    "start_time": 640,
                    "text": "参观八达岭长城。"
                }
            ],
            "segments": []
        },
        "metrics": [
            {
                "name": "DURATION_MS",
                "value": 3575
            }
        ],
        "token_usages": [
            {
                "task_info": "refine_chunk_001",
                "model_name": "doubao-seed-2-0-lite-260428",
                "token_usage": {
                    "prompt_tokens": 1200,
                    "completion_tokens": 80,
                    "total_tokens": 1280,
                    "cached_tokens": 0,
                    "audio_tokens": 64,
                    "audio_cached_tokens": 0,
                    "reasoning_tokens": 30
                }
            }
        ],
        "refine_info": {
            "mode": "on",
            "enabled": true,
            "status": "SUCCESS",
            "model_name": "doubao-seed-2-0-lite-260428",
            "strategy": "utterance_dynamic_chunk",
            "chunk_count": 1,
            "warnings": []
        },
        "resource": "seedasr"
    }
}

错误码

HttpStatusCode

错误码

错误信息

描述

400

Parameter.Invalid

The parameter is invalid.

参数不合法

401

Authorization.Missing

Missing Authorization.

缺少鉴权

401

ApiKey.Invalid

The api key is invalid.

API不合法

429

Server.Busy

Server is Busy, please try again later.

服务端繁忙限流

500

Server.InternalError

根据具体异常而定

业务异常

最近更新时间:2026.08.18 10:35:48
这个页面对您有帮助吗?
有用
有用
无用
无用