- 文档首页
火山方舟
推理
在线推理(模型单元)
模型单元概述
模型单元概述
模型单元是方舟提供的高级推理方式,独占算力资源,特别适用于精调后模型的大规模推理。本文介绍模型单元的主要优势、适用场景、支持模型等内容。
- 专属独占算力:更低延迟,更高并发,性能更稳定可靠
- 全托管免运维:无需关注底层资源,平台将自动完成资源的管理和维护
- 按需部署和预留容量:可叠加按购买时长后付费和包月预付费,既可满足业务实时按需的资源使用需求,又可为固定业务预留确定的算力资源
- 规模化业务更具成本效益:高利用率下成本低于按Token付费
- 更丰富的模型选择:支持平台基础模型,精调后模型,以及上传您自己的模型(适用于支持的架构)
- 没有硬性速率限制:平台不设置 RPM/TPM 上限,流量仅受模型单元实际承载力限制
- 弹性伸缩:后付费模型单元支持弹性伸缩策略,可根据业务负载动态调整资源
- 预置部署模板:预置小、中、大三种规格的基础部署模板及更多个性化模板,组合方舟不同机型和算力, 用户只需根据实际需求选择对应的模板和模型单元个数即可完成部署。
- 本地透明化缓存:命中缓存后增加单个模型单元的承载力,降低总购买资源数
- 部署基于 Doubao 模型全量/LoRA精调后的模型
- 生产级高SLA要求的场景,希望获得更高并发、更低延迟和更高的成本效益
注意:对流量较小的场景,由于需要占满起步资源量,优势不明显
- 自定义模型:基于 Doubao 模型全量/LoRA精调后的模型或外部上传的开源模型,使用流程请参见 使用自定义模型进行推理
模型单元按照您选择的机型和使用时长进行收费,支持按购买时长后付费和包月预付费,两种方式可叠加购买,单价请参见模型单元。 - 计费特点:按照实际购买时长收费,计费粒度精确到秒。购买后持续计费,如需停止计费可在接入点详情页进行退订。
举例:假设您在16:00下单成功,在18:20:31退订成功。则计费时长为 2 小时 20 分钟 31 秒,计费单价会换算成每秒钟单价进行计算。
- 出账周期:按小时结算,账单出账时间通常在当前计费周期结束后1-2小时左右,具体以系统实际出账时间为准。例如:16:00-17:00 的账单约在 18:00-19:00 出账。
- 欠费说明:为保证您的业务连续稳定,账户欠费后资源不会立即回收,保留大约2小时(具体时间以通知为准),在此期间,您的模型单元可继续使用,并会持续产生资源使用费;关停后,停止计费,同时资源不可使用。
注意
如需继续使用,请及时续费,避免业务中断;如不使用,请及时释放模型单元,避免产生额外计费。
- 到期时间:从购买日算起,到期时间为到期自然日+1 天的中午 12 点。7 天内到期的模型单元会出现到期提醒。
- 到期回收:资源到期后将被回收,您可以在资源被回收前在方舟产品控制台或 订单管理页面 进行续费,回收时间为到期时间+ 24 小时。即如您在4月13日上午9点购买一个月的模型单元,到期时间为 5月14日中午12点,到期回收时间为5月15日中午12点。 在 5月15日中午12 点之前都可以进行续费。在回收期结束后,模型单元无法续费,您需要重新创建一个推理接入点来满足继续使用的需求。
- 续费说明:强烈推荐您为资源配置自动续费,以避免由于未配置自动续费导致的业务中断。
最近更新时间:2026.09.08 01:17:52