You need to enable JavaScript to run this app.
文档中心
容器服务

容器服务

复制全文
下载 pdf
DeepSeek 模型部署
通过 LLM 通用模板快速部署 DeepSeek-V4-Pro 模型
复制全文
下载 pdf
通过 LLM 通用模板快速部署 DeepSeek-V4-Pro 模型
本文主要介绍通过 ServingKit LLM 通用模板,在容器服务(VKE)集群中快速部署 DeepSeek-V4-Pro 模型。
背景信息
DeepSeek-V4-Pro 是 DeepSeek-V4 预览版系列中的旗舰级大语言模型,采用稀疏混合专家(Mixture-of-Experts, MoE)架构,总参数量达 1.6 万亿(1.6T),每次前向推理动态激活约 49B 参数,在保持高性能的同时显著降低单 Token 推理成本。其最大推理强度模式 DeepSeek-V4-Pro-Max 在数学、理工科、竞赛级编程等评测上超越此前全部公开的开源模型,并与主流闭源前沿模型处于同一性能区间,适用于复杂推理、长文档深度分析、多步 Agent 编排等前沿任务。
本文介绍如何通过 LLM 通用模板,在 Kubernetes 集群上快速部署 DeepSeek-V4-Pro 模型。
使用说明
  • 本实践涉及较多组件,相互间有依赖,配置复杂,为了获得符合预期的结果,请务必根据本文指引操作。
  • 为了获得符合预期的结果,同时符合容器服务的 使用限制,请按照本文方案(或在本文推荐的资源上)操作。如需替换方案,您可以联系对应的火山引擎客户经理咨询。
  • 请勿使用 mGPU 对 GPU 进行切分。
准备工作
  • 部署 AI 业务,依赖火山引擎邀测资源,请联系客户经理申请如下资源的邀测试用:
  • 邀测资源
    涉及产品
    说明
    高性能计算 GPU 型 hpcpni3ln 规格
    高性能计算实例,提供计算能力。部署 DeepSeek-V4-Pro 模型时,推荐申请 2 台ecs.hpcpni3ln.45xlarge规格的 GPU 实例。
  • 示例通过 API 网关对外暴露服务,需要准备 API 网关实例。您可以提前创建 API 网关实例或使用已有 API 网关实例,也可以在 ServingKit 上部署应用时同步自动创建实例。
说明
提前创建 API 网关实例或使用已有 API 网关实例时请确保实例的 地域 需要与 VKE 集群的 地域 一致,且建议 网络类型 同时开启 公网私网。创建 API 网关实例相关操作,请参见 创建实例
  • 需要创建高性能计算集群,用于实现高性能计算 GPU 实例(计算节点)的逻辑隔离,实现同一集群内实例间 RDMA 网络互联互通。详情请参见 创建高性能计算集群
说明
高性能计算集群所在的 地域和可用区 需要与 VKE 集群的 地域和可用区 一致。
操作步骤
步骤一:创建 VKE 异构计算集群
使用 VKE 的集群模板,快速创建异构计算集群,需要注意以下列举的参数配置。其余参数说明和详细的操作步骤,请参见 使用集群模板创建异构计算托管集群
配置项
说明
集群及节点池配置
地域
地域可用区,需要与前期准备的高性能计算集群的地域和可用区一致。
您可以通过顶部导航栏切换地域。
可用区
计算规格
选择 高性能计算 GPU 型ecs.hpcpni3ln.45xlarge规格。
节点数量
设置为 2
高级配置
数据盘
配置如下两个数据盘:
  • 极速型 SSD:规格选 1024 GiB,性能级别选择默认值 PL0
  • 本地盘 SSD:指定挂载目录为/data01
注意
  • data01目录后续有相关依赖,不能修改和自定义。
  • 如果物理机宕机或本地盘损坏,将存在数据丢失的风险,因此请勿在本地盘上存储需要长期保存的数据,同时做好 数据备份
步骤二:部署 DeepSeek-V4-Pro
  1. 通过 ServingKit 提供的 LLM 通用部署模板 下载并部署模型。部署过程中,需要注意以下列举的参数配置,其余参数说明和详细的操作步骤,请参见 部署 LLM 通用模板应用
  • 参数
    说明
    选择框架及编排
    镜像
    选择 自定义 并根据您业务所在地域,从如下镜像地址中选择合适的镜像:
    • 华北2(北京):ai-containers-cn-beijing.cr.volces.com/deeplearning/sglang:deepseek-v4-community-enhancements
    • 华东2(上海):ai-containers-cn-shanghai.cr.volces.com/deeplearning/sglang:deepseek-v4-community-enhancements
    • 亚太东南(柔佛):ai-containers-ap-southeast-1.cr.volces.com/deeplearning/sglang:deepseek-v4-community-enhancements
    模型配置
    • 存储类型:选择 数据盘
    • 模型选择:单击 添加预置模型,选择 DeepSeek-V4-Pro 模型并配置 挂载路径/data01容器挂载路径/data/models,表示将模型数据下载至/data01目录。
    推理模式
    选择 PD 共置
    实例规格
    • 实例数: 设置为 1
    • 单实例 GPU 数:设置为 16
    资源配置
    选择 步骤一 中创建的 VKE 异构计算集群,以及该集群下ecs.hpcpni3ln.45xlarge规格节点所在的节点池。
    启动命令
    添加如下启动命令。启动命令中各字段的详细说明,请参见下方“启动命令详细说明”表格。
    source /workspace/nccl_env.sh && SGLANG_ENABLE_THINKING=1 SGLANG_DSV4_FP4_EXPERTS=1 SGLANG_JIT_DEEPGEMM_PRECOMPILE=0 GLOO_SOCKET_IFNAME=eth0 NCCL_MIN_NCHANNELS=24 NCCL_IB_QPS_PER_CONNECTION=8 sglang serve --trust-remote-code --model-path /data/models/DeepSeek-V4-Pro --tp 16 --dp-size 2 --enable-dp-attention --cuda-graph-max-bs 8 --max-running-requests 16 --enable-metrics --host 0.0.0.0 --port 8080 --mem-fraction-static 0.9 --moe-runner-backend marlin --dist-init-addr ${ROLESET_NAME}-${ROLE_NAME}-${ROLE_TEMPLATE_HASH}-${ROLE_REPLICA_INDEX}-0.${STORM_SERVICE_NAME}:30300 --nnodes 2 --node-rank $POD_GROUP_INDEX --tool-call-parser deepseekv4 --reasoning-parser deepseek-v4 --chunked-prefill-size 4096
    端口号 设置为 8080。
    API 网关
    勾选 开启,绑定前期准备的 API 网关实例。
    说明
    您也可以在此处选择 自动创建,新建一个由 ServingKit 固定了实例规格以及配置的 API 网关实例。新建 API 网关实例会产生计费,详情请参见 API 网关产品计费
  • 启动命令详细说明
  • 参数
    类型
    说明
    取值示例
    --trust-remote-code
    指令
    允许加载并执行模型仓库中的自定义代码。
    --nnodes
    整型
    分布式集群的总节点数,即物理机或 Pod 的数量。
    2
    --node-rank
    整型
    当前节点在集群中的序号,从 0 开始计数,0 号一般为 Master 节点。
    0
    --dist-init-addr
    字符串
    多节点分布式集群的初始化通信地址,所有节点都会连接到该地址来组建通信网络。格式为 IP 地址:端口
    • IP 地址:Master 节点的私网 IP 地址。
    • 端口:节点间通信的端口号。
    192.168.0.1:30300
    --dp-size
    整型
    数据并行度(Data Parallelism)。
    16
    --tp
    整型
    张量并行度(Tensor Parallelism)。
    16
    --mem-fraction-static
    浮点数
    节点显存使用率上限,取值范围为:0~1。过高可能导致 OOM(Out Of Memory)或碎片化,过低则导致吞吐下降。
    0.95
    --max-running-requests
    整型
    同时在推理引擎内并行的最大请求数。
    16
  1. 应用部署成功后,因模型大小不同,模型启动时间会有差异。请在应用状态变更为 运行中 后在 应用详情 页面查看应用对应实例的 日志。日志中显示The server is fired up and ready to roll!信息,则表示应用中的模型启动成功,您可以访问模型服务。
步骤三:访问服务
成功部署 DeepSeek-V4-Pro 模型服务后,获取服务域名,访问服务。
  1. 获取 DeepSeek-V4-Pro 模型服务域名。
  1. 容器服务控制台推理套件 > AI 应用列表,找到已部署的 DeepSeek-V4-Pro 模型应用。
  1. 单击应用上的 图标,进入应用详情页,在 服务概览 页签下查看 服务域名 地址。
  1. 在可以使用curl命令的终端上,执行如下命令,访问 DeepSeek-V4-Pro 模型服务。
说明
  • 请将${your_service_domain_name}替换为上一步获取的 服务域名 地址。
  • 若无可用终端,可通过 ECS Terminal 方式,登录到部署模型的节点上,使用curl命令访问服务。详细操作,请参见 ECS Terminal
  • curl -X POST http://${your_service_domain_name}/v1/chat/completions \
    -H "Content-Type: application/json" \
    -d '{
    "model": "/data/models/DeepSeek-V4-Pro",
    "messages": [
    {
    "role": "user",
    "content": "Who won the world series in 2020?"
    }
    ],
    "max_tokens": 500,
    "temperature": 0.7
    }'
  • 命令中的参数说明如下:
  • 参数
    说明
    取值示例
    model
    使用的实际模型。
    /data/models/DeepSeek-V4-Pro
    messages
    对话的消息列表。
    • role:该消息的发起角色。
    • content:消息的内容。
    max_tokens
    指定一次请求中模型生成 Completion 的最大 tokens 数:
    • 取值范围:1~8192 之间的整数。
    • 默认值:4096。
    500
    temperature
    采样温度。
    • 取值范围: 0~2。
    • 值越高(例如 1)会使输出更随机。
    • 值越低(例如 0.2)会使其更加集中和确定。
    0.7
  • 调用成功后预期返回结果如下图所示。
后续操作
增强服务安全
您可以通过 API 网关的 API Key,增强 DeepSeek-V4-Pro 服务安全能力。
  1. 为 API 网关实例创建消费者。详细操作,请参见 创建消费者
  1. 基于消费者生成 Key Auth 插件认证信息。详细操作,请参见 生成认证信息
  1. 启用 Key Auth 插件:在左侧导航栏选择 插件中心 > Key Auth插件,单击 创建插件,配置插件参数。
  1. 生效级别:选择 路由级别,并配置插件所属实例、服务和路由。
  1. 认证配置:选择 header,并配置来源为 Authorization,表示在请求头中的 Authorization 附带 API Key 认证信息。
  1. 消费者:选择步骤 1 中创建的消费者或选择全部,后续新创建的消费者也生效。
  1. 其他配置保持缺省。
  1. 开启 Key Auth 插件认证后执行访问服务的命令时,必须携带鉴权信息,未携带时会返回无权限调用的提示信息。
  • curl http://${your_service_domain_name}/v1/chat/completions -X POST \
    -H "Content-Type: application/json" \
    -H "Authorization: Bearer ${your_api_key}" \
    -d '{
    "model": "/data/models/DeepSeek-V4-Pro",
    "messages": [
    {
    "role": "user",
    "content": "Who won the world series in 2020?"
    }
    ],
    "max_tokens": 500,
    "temperature": 0.7
    }'
开启观测
ServingKit AI 应用默认支持云原生基础观测能力,您可以在 AI 应用详情页查看应用监控看板。
  1. 容器服务控制台推理套件 > AI 应用列表,找到已部署的 DeepSeek-V4-Pro 模型应用。
  1. 单击应用上的 图标,进入应用详情页,查看 监控观测 页签下的看板信息。
说明
若您未开启过相关集群的观测能力,可根据控制台提示开启观测。云原生观测能力相关操作,请参见 开启观测容器服务观测
最近更新时间:2026.07.27 15:46:14
这个页面对您有帮助吗?
有用
有用
无用
无用