You need to enable JavaScript to run this app.
文档中心
火山方舟

火山方舟

复制全文
下载 pdf
推理
在线推理(常规)
复制全文
下载 pdf
在线推理(常规)
在线推理(常规)部署在公共资源池,按Token付费,成本灵活可控,是个人开发者或小型业务的首选。本文介绍常规在线推理的主要优势、支持模型、使用流程等内容。
主要特点
  • 按模型推理时消耗的Token数量进行后付费,不调用不计费
  • 延迟和并发一般,与账号下该模型所有接入点共享模型限流
  • 部署在公共资源池,业务的延迟和并发性能受平台资源水位影响
适用场景
  • 新手使用火山方舟平台
  • 个人开发者或小型业务
  • 追求高性价比,对延迟和并发要求相对较低
  • 可接受偶发资源紧张报错或无法预估准确流量的业务
支持模型
接入点类型
调用方式
支持模型
预置推理接入点
直接通过 Model ID 调用,无需创建接入点
方舟平台所有基础模型
自定义推理接入点
仅支持 Endpoint ID(EP)调用,需提前创建接入点
方舟平台所有基础模型、Lora精调后模型
使用流程
1 (可选)创建推理接入点
在目标项目下创建一个自定义推理接入点。使用预置推理接入点请跳至步骤2。
  1. 访问 创建推理接入点 ,按页面引导填写。注意选择接入模式为 按Token付费
  1. 勾选协议,并单击 创建并接入。创建完成后进入 调度中 状态,当状态变成 健康 后,可正常调用。
说明
推理接入点默认会创建在 default 项目下,如果您希望在其他项目下创建,请在导航栏左下角切换项目。
2 获取 Model
  • 使用自定义推理接入点,在 在线推理 查看并复制接入点 ID(Endpoint ID)。
  • 使用预置推理接入点,在 模型列表 获取 Model ID。
3 通过 Endpoint ID / Model ID 调用模型
典型示例代码如下,更多示例代码可参见调用章节。
运行代码前请确保已将 API Key 配置为环境变量 ARK_API_KEY(详情参见 环境变量配置指南),并已安装 SDK:python -m pip install --upgrade arkruntime
# 安装 sdk 参见 https://www.volcengine.com/docs/82379/1541595
import os
from arkruntime import Ark
client = Ark(
base_url='https://ark.cn-beijing.volces.com/api/v3',
api_key=os.getenv('ARK_API_KEY'),
)
response = client.responses.create(
model="doubao-seed-2-1-pro-260628", #自定义推理接入点需配置为 Endpoint ID
input="hello"
)
print(response)
最近更新时间:2026.09.08 16:10:57
这个页面对您有帮助吗?
有用
有用
无用
无用