You need to enable JavaScript to run this app.
文档中心
容器服务

容器服务

复制全文
下载 pdf
可观测性
使用自建 Grafana 搭建集群观测看板
复制全文
下载 pdf
使用自建 Grafana 搭建集群观测看板
集群监控是集群运维的重要组成部分。通过监控,您可以了解集群中各种资源的使用情况和工作状态,及时发现异常并处理,保障业务的正常运行。本文为您介绍如何使用自定义 Grafana 搭建集群看板。
前提条件
  • 已开启云原生观测。详情请参见 开启观测
  • 已在集群中,开启目标资源的观测功能。详情请参见 基础观测
说明
建议将集群中的 Prometheus-agent 组件升级到最新版本。详情请参见 prometheus-agent
操作步骤
步骤一:搭建 Grafana
您可以在不同的环境中搭建自定义 Grafana 环境,例如:
  • 在其他环境中搭建自定义 Grafana,并使用公网地址接入托管 Prometheus 工作区。详情请参见 创建通用工作区
步骤二:获取集群看板
  1. 在左侧导航栏选择 自定义看板,并选择 预置看板 页签,查看系统预置看板列表。
  • VKE 中的监控看板与全栈可观测平台中预置看板的对应关系,如下表所示。
  • VKE 看板分类
    VKE 看板名称
    全栈可观测平台中的看板名称
    集群监控
    集群监控概览
    vke-cluster-dashboard
    集群 Namespace 监控
    vke-namespace-dashboard
    核心组件监控
    kube-apiserver 监控
    vke-apiserver-dashboard
    etcd 监控
    vke-etcd-dashboard
    kube-scheduler 监控
    vke-scheduler-dashboard
    cluster-autoscaler 监控
    vke-ca-dashboard
    kube-controller-manager 监控
    vke-kcm-dashboard
    metrics-server 监控
    vke-metrics-server-dashboard
    节点监控
    节点概览
    vke-nodes-dashboard
    节点详情监控
    vke-node-dashboard
    虚拟节点监控
    vci-virtual-node-dashboard
    工作负载监控
    无状态负载监控
    vke-deployment-dashboard
    有状态负载监控
    vke-statefulset-dashboard
    守护进程监控
    vke-daemonset-dashboard
    容器组监控
    vke-pod-dashboard
    容器监控
    vke-container-dashboard
    弹性伸缩监控
    vke-hpa-dashboard
    智能伸缩监控
    vke-katalyst-dashboard
    网络服务监控
    core-dns 监控
    vke-core-dns-dashboard
    node-local-dns 监控
    vke-local-dns-dashboard
    vpc-cni 监控
    vke-cni-dashboard
    存储服务监控
    存储卷声明监控
    vke-pvc-dashboard
    FSX 监控
    vke-csi-fsx-dashboard
    GPU 监控
    集群 GPU 监控
    vke-cluster-gpu-dashboard
    GPU 实例监控
    • 当 nvidia-device-plugin 组件为 v2.0.0 以下版本时,使用 vke-instance-gpu-dashboard
    • 当 nvidia-device-plugin 组件为 v2.0.0 及以上版本时,使用 vke-instance-gpu-v2-dashboard
    说明
    组件版本详情,请参见 nvidia-device-plugin
    容器组 GPU 监控
    vke-pod-gpu-dashboard
    节点 GPU 监控
    • 当 nvidia-device-plugin 组件为 v2.0.0 以下版本时,使用 vke-node-gpu-dashboard
    • 当 nvidia-device-plugin 组件为 v2.0.0 及以上版本时,使用 vke-node-gpu-v2-dashboard
    说明
    组件版本详情,请参见 nvidia-device-plugin
    用户 GPU 监控
    vke-user-gpu-dashboard
    镜像加速服务监控
    p2p 镜像加速监控
    vke-p2p-dashboard
    镜像懒加载(Nydus)监控
    vke-nydus-dashboard
    资源管理监控
    CPU Burst功能监控
    vke-katalyst-cpu-burst-dashboard
    katalyst 监控
    vke-katalyst-dashboard
    智能运维
    检测自愈
    vke-aiops-remediation-dashboard
  1. 单击目标看板名称,进入看板详情。在页面右上角单击 导出,并在弹出的菜单中选择 Grafana JSON,将看板导出到本地。
  1. 在本地环境中打开导出的看板文件,删除templating.list[0].current字段。如下面代码中的删除部分所示:
说明
templating.list[0].current字段保存的是导出 Grafana JSON 文件时选中的集群 ID,为原平台环境的残留内容,因此该值在自建环境中不适用。删除该参数后,导入 Grafana 时会从空状态开始,并允许您从下拉框重新选择集群 ID。
  • "templating": {
    "list": [
    {
    "id": "3",
    "type": "query",
    "name": "ClusterId",
    "label": "集群 ID",
    "datasource": {
    "type": "prometheus",
    "uid": "${DS_PROMETHEUS}"
    },
    "query": "kube_node_info",
    "regex": "/.*cluster=\"(.*?)\".*/",
    "includeAll": false,
    "multi": false,
    "current": {
    "selected": true,
    "text": [
    "cd8jut6fm1pqj***"
    ],
    "value": [
    "cd8jut6fm1pqjl***"
    ]
    },
    "definition": "kube_node_info"
    }
    ]
    },
  1. 修改完成后,保存文件。
步骤三:导入监控看板
  1. 登录自建 Grafana 环境。
  1. 在左侧导航栏中,选择 Dashboards,进入监控大盘配置页面。
  • alt
  1. 单击 New ,在下拉菜单中选择 import,进入导入大盘页面。
  • alt
  1. 单击 Upload dashboard JSON file,并选择保存在本地的监控大盘 JSON 文件。
  • alt
  1. 配置监控大盘的基本信息并选择数据源。
  • 配置项
    说明
    Name
    (可选)根据需要修改监控大盘的名称。
    Folder
    (可选)选择大盘保存的文件夹。
    prometheus
    选择已配置好的数据源。
  1. 单击 import,完成导入,即可查看监控大盘。
最近更新时间:2026.07.13 15:09:38
这个页面对您有帮助吗?
有用
有用
无用
无用