You need to enable JavaScript to run this app.
文档中心
容器服务

容器服务

复制全文
下载 pdf
GPU 组件
nvidia-device-plugin
复制全文
下载 pdf
nvidia-device-plugin
nvidia-device-plugin 组件为容器服务集群中的 NVIDIA GPU 管理组件。本文介绍该组件的作用、核心资源以及安装与升级说明。
组件概述
nvidia-device-plugin 组件是容器服务提供的 GPU 设备管理组件,提供 NVIDIA 设备驱动,支持在容器里使用 GPU 显卡设备。
在集群中安装 nvidia-device-plugin 组件后,系统会在 kube-system 命名空间下创建如下 Kubernetes 资源。
资源名称
资源类型
资源说明
nvidia-device-plugin
DaemonSet
组件核心工作负载,负责该节点上的 GPU 发现、注册与健康检查。
dcgm-exporter
DaemonSet
NVIDIA GPU 监控采集器,负责实时采集底层 GPU 显卡的各项运行状态(如显存使用率、算力利用率)等。
说明
上表中仅罗列出了该组件的主要资源,以及配置组件或对应功能时可能使用到的资源,方便您了解该组件的主要组成。其他的组件相关资源(例如 ConfigMap、Secret 等)不多做介绍,请以集群中的实际为准。
组件版本
关于组件的历史发布记录、各版本新增特性及优化说明等信息,详情请参见 组件发布记录
安装组件
  1. 在左侧导航栏中,选择 集群,单击目标集群名称,进入集群管理页面。
  1. 在左侧导航栏中,选择 组件管理,并选择 GPU 页签。
  1. 将鼠标移动到组件卡片上,单击 部署,配置组件相关参数。
  • 参数
    描述
    部署插件
    选择是否安装 NVIDIA GPU 资源监控插件 dcgm-exporter。默认安装该插件。
    说明
    推荐您保持默认值。若不安装 dcgm-exporter,则无法使用云原生观测功能监控 NVIDIA GPU 相关的指标。
    采集间隔
    配置 dcgm-exporter 采集间隔。您可以根据业务实时性要求,自定义指标的采集间隔。
    关闭 XID 健康检查
    选择是否关闭 NVIDIA GPU 的 XID 健康检查功能。关闭后,系统不会再基于 XID 异常,自动隔离异常的 GPU 设备。
    说明
    • 当 nvidia-device-plugin 组件版本为 v2.2.0 及以上版本时,默认开启(即关闭 XID 健康检查功能)。
    • 当 nvidia-device-plugin 组件版本为 v2.2.0 以下版本时,默认关闭(即开启 XID 健康检查功能)。
  1. 单击 确认,完成配置。
升级组件
组件会不定期发布新版本以提供新特性或修复已知问题。当组件卡片提示有可用更新时,建议您及时进行升级。为确保业务平稳过渡,升级前请尽量安排在业务低峰期执行操作。关于升级的操作步骤和注意事项,请参见 升级组件
相关文档
最近更新时间:2026.08.19 11:38:06
这个页面对您有帮助吗?
有用
有用
无用
无用