配置项 | 说明 |
集群及节点池配置 | |
地域 | 地域 和 可用区,需要与前期准备的高性能计算集群的地域和可用区一致。 您可以通过顶部导航栏切换地域。 |
可用区 | |
计算规格 | 选择 高性能计算 GPU 型 的ecs.hpcpni3ln.45xlarge规格。 |
节点数量 | 设置为 2。 |
高级配置 | |
数据盘 | 配置如下两个数据盘:
|
参数 | 说明 |
选择框架及编排 | |
镜像 | 选择 自定义 并根据您业务所在地域,从如下镜像地址中选择合适的镜像:
|
模型配置 |
|
推理模式 | 选择 PD 共置。 |
实例规格 |
|
资源配置 | 选择 步骤一 中创建的 VKE 异构计算集群,以及该集群下ecs.hpcpni3ln.45xlarge规格节点所在的节点池。 |
启动命令 | 添加如下启动命令。启动命令中各字段的详细说明,请参见下方“启动命令详细说明”表格。 source /workspace/nccl_env.sh && cd /sgl-workspace/sglang && GLOO_SOCKET_IFNAME=eth0 NCCL_MIN_NCHANNELS=24 NCCL_IB_QPS_PER_CONNECTION=8 python -m sglang.launch_server --model-path /data/models/Qwen3.5-397B-A17B --port 8000 --tp-size 16 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --speculative-algo EAGLE --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 --dist-init-addr ${ROLESET_NAME}-${ROLE_NAME}-${ROLE_TEMPLATE_HASH}-${ROLE_REPLICA_INDEX}-0.${STORM_SERVICE_NAME}:20000 --nnodes 2 --node-rank $POD_GROUP_INDEX --enable-metrics --trust-remote-code --host 0.0.0.0 端口号 设置为 8000。 |
API 网关 | 勾选 开启,绑定前期准备的 API 网关实例。 说明 |
参数名称 | 参数类型 | 说明 | 取值示例 |
python -m sglang.launch_server | 启动指令 | 通过 Python 模块方式启动 SGLang 的模型服务端。 说明 该字段属于命令入口,非参数。 | - |
--model-path | 路径/模型 ID | 指定加载的 LLM 模型,取值:
| /data/models/Qwen3.5-397B-A17B |
--tp-size | 整数 | 配置张量并行度(Tensor Parallelism),默认值为 16。 | 16 |
--host | IP地址 | 指定服务绑定的主机地址。 | 0.0.0.0 |
--port | 整数 | 指定服务监听的端口号,用于客户端连接。 | 8000 |
--dist-init-addr | IP: 端口 | 分布式集群的初始化地址(主节点地址),用于多节点通信同步。 | 变量注入 |
--nnodes | 整数 | 指定分布式集群的总节点数,即参与服务的服务器数量。 | 2 |
--enable-metrics | 指令 | - |