项目 | 要求 |
Kubernetes 版本 | 不低于 v1.20.15-vke.4 版本。 |
操作系统 | 创建集群时,操作系统 选择使用容器服务提供的 公共镜像,系统会自动为您配置该版本的操作系统。目前支持的操作系统包括:veLinux 1.0、veLinux 1.0 CentOS 兼容版、velinux 2.0、Ubuntu 20.04、Ubuntu 22.04。 |
内核版本 | 创建集群时,操作系统 选择使用容器服务提供的 公共镜像,系统会自动为您配置该版本的操作系统内核。 目前支持 5.4 版本的内核。 |
Nvidia 驱动版本 | 创建 GPU 计算型节点池时,系统会自动为您配置该版本的 Nvidia 驱动。 |
GPU 卡 | VKE 产品支持 Turing、Volta、Ampere、Hopper、Ada Lovelace 等主流 NVIDIA 架构的 GPU 卡型,更多卡型需求请咨询官方售前或技术支持。 |
mGPU 个数(对应 Container 个数) | 一个 GPU 上最多可创建 16 个 mGPU。 计算性能会随 mGPU 的创建数量衰减,建议按照容器申请的资源大小,规划单张 GPU 卡可共享部署的 mGPU 个数。 |
容器个数 | 使用 mGPU 时,单个 Pod 内的容器数建议不超过 5 个。 |
GPU 节点调度策略 | GPU 卡调度策略 | 调度方式 | 适用场景 |
Spread | Binpack |
| 节点故障隔离性较强,碎片资源相对较少。 |
指标名称 | 指标含义 |
compute_free_weight_online | 设备未分配的算力百分比,本例中为 70%。 |
compute_load_balance_mode | 容器使用该设备时的负载均衡模式。 |
compute_policy | 算力调度策略:
|
compute_timeslice | 算力时间片百分比。 |
device_major | /dev/mgpuX主设备号。 |
instance_major | /dev/mgpuXinstY、/dev/mgpuXctl-$(container_id)主设备号。 |
vmem_free_bytes | 该设备剩余的显存容量,单位: byte。 |
指标名称 | 指标含义 |
container_id | 容器 ID。 |
device_id | 实例对应的设备 ID。 |
instance_id | 实例 ID。 |
compute_weight | 该实例分配的离线算力百分比。 |
compute_weight_native_burst | 该实例在native burst策略下分配的算力百分比。 |
compute_weight_online | 该实例分配的在线算力百分比。 |
online | 是否为在线容器。 |
vmem_info | 容器申请的显存信息,包含:空闲、PID、已使用。 |
vmem_limit | 容器申请的容器显存限制。 |