- 文档首页
容器服务
容器服务 VKE
用户指南
组件管理
GPU 组件
mgpu
mgpu
mgpu 组件为共享 GPU 组件。本文介绍该组件的作用、核心资源以及安装与升级说明。
mgpu 组件(multi-container GPU)是容器服务提供的共享 GPU 方案。它基于内核虚拟化技术隔离 GPU 的算力和显存,在保障性能与隔离性的前提下,支持多个容器共享同一张物理 GPU 卡。
在集群中安装 mgpu 组件后,系统会在 kube-system 命名空间下创建如下 Kubernetes 资源。
说明
上表中仅罗列出了该组件的主要资源,以及配置组件或对应功能时可能使用到的资源,方便您了解该组件的主要组成。其他的组件相关资源(例如 ConfigMap、Secret 等)不多做介绍,请以集群中的实际为准。
关于组件的历史发布记录、各版本新增特性及优化说明等信息,详情请参见 组件发布记录。 - 在左侧导航栏中,选择 集群,单击目标集群名称,进入集群管理页面。
- 在左侧导航栏中,选择 组件管理,并选择 GPU 页签。
- 将鼠标移动到组件卡片上,单击 部署,配置组件相关参数。
-
组件会不定期发布新版本以提供新特性或修复已知问题。当组件卡片提示有可用更新时,建议您及时进行升级。为确保业务平稳过渡,升级前请尽量安排在业务低峰期执行操作。关于升级的操作步骤和注意事项,请参见 升级组件。 注意
如果组件升级完成后,组件卡片仍然显示 可升级,说明该组件支持升级串行版本。如需继续升级,请首先确认组件当前升级已成功,再进行二次升级。组件升级成功的确认方式,请参见下文。
组件安装/升级完成后,您可以通过控制台或 kubectl 命令行,确认组件工作是否正常。
- 在集群管理页面的左侧导航栏中,选择 组件管理,并选择 gpu 页签。
- 选择 vpc-cni 组件卡片,单击卡片右上角的 ->,查看组件部署详情。
- 检查kube-system 命名空间中的守护进程ek8s-gpu-agent是否均处于Running状态,且 已更新 数量是否等于 Pod 总数。若所有 Pod 均处于Running状态,且所有 Pod 已更新,则代表升级成功。
-
- 检查kube-system 命名空间中的无状态负载ek8s-gpu-exporter的 已更新 数量是否等于 Pod 总数。若所有 Pod 已更新,则代表升级成功。
- 执行以下命令,检查 kube-system 命名空间中的守护进程ek8s-gpu-agent是否均处于就绪状态,且UP-TO-DATE数量是否等于 Pod 总数。
kubectl get daemonset ek8s-gpu-agent -n kube-system
- 预期结果如下,当所有 Pod 均处于READY状态,且UP-TO-DATE数量等于 Pod 总数时,代表组件升级成功。
-
- 执行以下命令,检查 kube-system 命名空间中的守护进程ek8s-gpu-exporter的UP-TO-DATE数量是否等于 Pod 总数。
kubectl get deployment ek8s-gpu-exporter -n kube-system
- 预期结果如下,当UP-TO-DATE数量等于 Pod 总数时,代表组件升级成功。
-
mgpu 组件稳定性和性能直接影响组件功能正常使用和效果,建议您在集群中开启组件观测,帮助您实时掌握组件的健康度。详情请参见 AI 资源观测。 容器服务基于 托管 Prometheus(VMP)提供完善的集群监控告警能力,您可以直接使用系统预置模板快速创建告警规则组,也可以基于业务实际需求自定义基于 PromQL 语句的告警规则,或在导出预置模板 YAML 后调整规则并沉淀为自定义告警模板,统一复用于多个集群。详情请参见: 预置告警模板由系统根据常见运维场景预置,适合首次建设告警体系或快速补充基础监控项,帮助您及时发现组件资源不足或运行异常。预置告警模板告警规则详情,请参见 预置告警模板。 最近更新时间:2026.08.19 11:38:06