AI 加速网关是基于全站加速(DCDN)边缘网络构建的模型服务网关,为大模型服务(MaaS)的 API 调用提供统一入口与加速能力。您可以将火山引擎方舟、第三方模型服务商及自部署的大模型 API 统一接入网关,通过全球加速节点就近转发请求以降低跨地域调用延迟,并借助模型路由、语义缓存、限流、预算管理和用量监控等能力,简化大模型应用的开发与运维。
在业务中集成多个大模型时,开发者通常会遇到几类共性问题,而 AI 加速网关正是围绕这些问题设计的:
常见问题 | 网关对应能力 |
|---|---|
各家模型服务商的 API 格式和认证方式互不兼容,逐一适配会带来重复的接入与维护成本。 | 将多家模型收敛到一个入口,客户端通过统一的 OpenAI 兼容协议即可调用任意后端模型。 |
模型通常部署在特定地域,跨地域直连容易出现高延迟和连接不稳定。 | 依托加速节点就近接入并优化回源链路,降低调用延迟与丢包。 |
仅依赖单一模型或服务商时,一旦服务故障业务就会中断。 | 支持在实例内配置多个同类模型,通过主备容灾与负载均衡策略保障高可用。 |
大模型调用成本容易随流量失控,且难以跨平台统一统计。 | 通过语义缓存、工具精选降低单位请求开销,并以预算管理为用量设置上限、主动控制成本。 |
概括来说,AI 加速网关提供一个统一的流量入口,让“接入多家模型、就近加速、容灾高可用、成本可控”这些原本需要自行拼接和维护的能力,收敛为一处配置即可获得。
AI 加速网关作为客户端与后端大模型之间的中间层,一次完整的调用会经过以下环节:
BaseUrl,由实例的加速域名构成)。请求经 DCDN 全球加速节点就近接入,并通过优化的回源链路转发,降低跨地域传输延迟。其中,模型路由、语义缓存、限流、预算管理、工具精选等能力均依赖网关的协议转换,仅在 OpenAI 兼容协议下可用;协议透传方式仅提供请求加速。两种方式的差异详见调用方式说明。
了解 AI 加速网关的核心概念、产品定位、能力与费用,可参考以下文档:
按使用阶段,可参考以下文档完成从上手到进阶的操作: