You need to enable JavaScript to run this app.
文档中心
容器服务

容器服务

复制全文
下载 pdf
GPU 组件
mgpu
复制全文
下载 pdf
mgpu
mgpu 组件为共享 GPU 组件。本文介绍该组件的作用、核心资源以及安装与升级说明。
组件概述
mgpu 组件(multi-container GPU)是容器服务提供的共享 GPU 方案。它基于内核虚拟化技术隔离 GPU 的算力和显存,在保障性能与隔离性的前提下,支持多个容器共享同一张物理 GPU 卡。
在集群中安装 mgpu 组件后,系统会在 kube-system 命名空间下创建如下 Kubernetes 资源。
资源名称
资源类型
资源说明
ek8s-gpu-agent
DaemonSet
组件核心工作负载,负责收集并上报本节点的物理 GPU 显存与算力信息,同时在底层执行共享 GPU 资源的硬隔离与切分。
ek8s-gpu-exporter
DaemonSet
mGPU 监控采集器,负责实时采集 mGPU 的各项运行状态(如显存使用率、算力利用率)等。
说明
上表中仅罗列出了该组件的主要资源,以及配置组件或对应功能时可能使用到的资源,方便您了解该组件的主要组成。其他的组件相关资源(例如 ConfigMap、Secret 等)不多做介绍,请以集群中的实际为准。
组件版本
关于组件的历史发布记录、各版本新增特性及优化说明等信息,详情请参见 组件发布记录
安装组件
  1. 在左侧导航栏中,选择 集群,单击目标集群名称,进入集群管理页面。
  1. 在左侧导航栏中,选择 组件管理,并选择 GPU 页签。
  1. 将鼠标移动到组件卡片上,单击 部署,配置组件相关参数。
  • 参数
    描述
    部署插件
    选择是否安装实现容器共享 GPU 的资源监控插件 mgpu-exporter。默认安装该插件。
    说明
    推荐您保持默认值。若不安装 mgpu-exporter,则无法使用云原生观测功能监控 mGPU 相关的指标。
    采集间隔
    配置 mgpu-exporter 采集间隔。您可以根据业务实时性要求,自定义指标的采集间隔。
    健康检查
    勾选 开启 Pod 存活探针,开启健康检查。开启后,组件在检测到资源上报异常时会自动触发重启并恢复资源上报。
    健康检查超时时间
    配置健康检查超时时间,当超过该时间未收到响应时,系统认为健康检查失败。
  1. 单击 确认,完成配置。
升级组件
组件会不定期发布新版本以提供新特性或修复已知问题。当组件卡片提示有可用更新时,建议您及时进行升级。为确保业务平稳过渡,升级前请尽量安排在业务低峰期执行操作。关于升级的操作步骤和注意事项,请参见 升级组件
注意
如果组件升级完成后,组件卡片仍然显示 可升级,说明该组件支持升级串行版本。如需继续升级,请首先确认组件当前升级已成功,再进行二次升级。组件升级成功的确认方式,请参见下文。
检查组件状态
组件安装/升级完成后,您可以通过控制台或 kubectl 命令行,确认组件工作是否正常。
通过控制台验证
通过 kubectl 命令行验证
  1. 在集群管理页面的左侧导航栏中,选择 组件管理,并选择 gpu 页签。
  1. 选择 vpc-cni 组件卡片,单击卡片右上角的 ->,查看组件部署详情。
  1. 检查kube-system 命名空间中的守护进程ek8s-gpu-agent是否均处于Running状态,且 已更新 数量是否等于 Pod 总数。若所有 Pod 均处于Running状态,且所有 Pod 已更新,则代表升级成功。
  1. 检查kube-system 命名空间中的无状态负载ek8s-gpu-exporter已更新 数量是否等于 Pod 总数。若所有 Pod 已更新,则代表升级成功。
观测与告警
组件观测
mgpu 组件稳定性和性能直接影响组件功能正常使用和效果,建议您在集群中开启组件观测,帮助您实时掌握组件的健康度。详情请参见 AI 资源观测
配置告警
容器服务基于 托管 Prometheus(VMP)提供完善的集群监控告警能力,您可以直接使用系统预置模板快速创建告警规则组,也可以基于业务实际需求自定义基于 PromQL 语句的告警规则,或在导出预置模板 YAML 后调整规则并沉淀为自定义告警模板,统一复用于多个集群。详情请参见:
预置告警模板由系统根据常见运维场景预置,适合首次建设告警体系或快速补充基础监控项,帮助您及时发现组件资源不足或运行异常。预置告警模板告警规则详情,请参见 预置告警模板
相关文档
最近更新时间:2026.08.19 11:38:06
这个页面对您有帮助吗?
有用
有用
无用
无用