配置项 | 说明 |
集群及节点池配置 | |
地域 | 地域 和 可用区,需要与前期准备的高性能计算集群的地域和可用区一致。 您可以通过顶部导航栏切换地域。 |
可用区 | |
计算规格 | 选择 高性能计算 GPU 型 的ecs.hpcpni3ln.45xlarge规格。 |
节点数量 | 设置为 2。 |
高级配置 | |
数据盘 | 配置如下两个数据盘:
|
参数 | 说明 |
选择框架及编排 | |
镜像 | 选择 自定义 并根据您业务所在地域,从如下镜像地址中选择合适的镜像:
|
模型配置 |
|
推理模式 | 选择 PD 共置。 |
实例规格 |
|
资源配置 | 选择 步骤一 中创建的 VKE 异构计算集群,以及该集群下ecs.hpcpni3ln.45xlarge规格节点所在的节点池。 |
启动命令 | 添加如下启动命令。启动命令中各字段的详细说明,请参见下方“启动命令详细说明”表格。 source /workspace/nccl_env.sh && SGLANG_ENABLE_THINKING=1 SGLANG_DSV4_FP4_EXPERTS=1 SGLANG_JIT_DEEPGEMM_PRECOMPILE=0 GLOO_SOCKET_IFNAME=eth0 NCCL_MIN_NCHANNELS=24 NCCL_IB_QPS_PER_CONNECTION=8 sglang serve --trust-remote-code --model-path /data/models/DeepSeek-V4-Pro --tp 16 --dp-size 2 --enable-dp-attention --cuda-graph-max-bs 8 --max-running-requests 16 --enable-metrics --host 0.0.0.0 --port 8080 --mem-fraction-static 0.9 --moe-runner-backend marlin --dist-init-addr ${ROLESET_NAME}-${ROLE_NAME}-${ROLE_TEMPLATE_HASH}-${ROLE_REPLICA_INDEX}-0.${STORM_SERVICE_NAME}:30300 --nnodes 2 --node-rank $POD_GROUP_INDEX --tool-call-parser deepseekv4 --reasoning-parser deepseek-v4 --chunked-prefill-size 4096 端口号 设置为 8080。 |
API 网关 | 勾选 开启,绑定前期准备的 API 网关实例。 说明 |
参数 | 类型 | 说明 | 取值示例 |
--trust-remote-code | 指令 | 允许加载并执行模型仓库中的自定义代码。 | 无 |
--nnodes | 整型 | 分布式集群的总节点数,即物理机或 Pod 的数量。 | 2 |
--node-rank | 整型 | 当前节点在集群中的序号,从 0 开始计数,0 号一般为 Master 节点。 | 0 |
--dist-init-addr | 字符串 | 多节点分布式集群的初始化通信地址,所有节点都会连接到该地址来组建通信网络。格式为 IP 地址:端口。
| 192.168.0.1:30300 |
--dp-size | 整型 | 数据并行度(Data Parallelism)。 | 16 |
--tp | 整型 | 张量并行度(Tensor Parallelism)。 | 16 |
--mem-fraction-static | 浮点数 | 节点显存使用率上限,取值范围为:0~1。过高可能导致 OOM(Out Of Memory)或碎片化,过低则导致吞吐下降。 | 0.95 |
--max-running-requests | 整型 | 同时在推理引擎内并行的最大请求数。 | 16 |