- 文档首页
托管 Prometheus
最佳实践
资源与业务监控
监控自定义 Kubernetes 集群中的 GPU
资源与业务监控
监控自定义 Kubernetes 集群中的 GPU
监控自定义 Kubernetes 集群中的 GPU
您可以使用托管 Prometheus 服务来监控自建集群集群节点中的 GPU,本文为您介绍配置的步骤和注意事项。
背景信息
Kubernetes 集群中,允许使用 dcgm-exporter 组件暴露 GPU 的 metrics。因此,您可以使用托管 Prometheus 来监控自建集群内节点中的 GPU 显卡的状态信息。
前提条件
- 已创建托管 Prometheus 工作区,详情请参见 创建工作区。
- 已创建自建 Kubernetes 集群,且集群中存在 GPU 节点。同时:
- 自建集群的 Kubernetes 版本为 v1.20~v1.24,其他版本的集群可能存在兼容性问题。
- 在本地环境中使用 kubectl 正确连接自建集群。
- 在本地环境中正确安装 wget、echo、curl 和 sed 等命令行工具。
操作步骤
步骤一:在集群中安装 dcgm-exporter
在自建集群中安装 dcgm-exporter 组件,详情请参见 官网文档。 步骤二:部署采集器
- 执行以下命令,在自建集群中部署 VM Agent 采集器。
--namespace volcano-metrics \
--remote-write-url http://vmp-test.com/workspaces/b762e1a3-37***/api/v1/write \
--basic-auth-username username-demo \
--basic-auth-password password-demo
步骤三:配置采集规则
在自建集群中使用 ServiceMonitor 或 PodMonitor 配置采集规则,本文以 ServiceMonitor 为例,配置示例如下。
apiVersion: monitoring.coreos.com/v1
- targetLabel: environment
app.kubernetes.io/name: dcgm-exporter
说明
更多集群中服务发现的配置方式,请参见 服务发现。 结果验证
登录 Grafana ,使用 GPU 相关的 PromQL 语句创建 GPU 相关大盘,可以正常看到 GPU 监控信息。
最近更新时间:2025.09.03 15:13:00