- 文档首页
容器服务
容器服务 VKE
用户指南
可观测性
基础观测
其他观测
检查自愈观测
检查自愈观测
检查自愈观测允许您监控集群中节点池检查自愈功能,基于指标对节点常见的 Kubelet、Runtime 和 GPU 故障进行观测和告警。本文为您介绍如何配置检查自愈观测。
前提条件
操作步骤
步骤一:开启观测
- 在左侧导航栏单击 集群,找到目标集群,单击集群名称。
- 在集群管理页面的左侧导航栏中,单击 观测配置,并选择 基础观测 页签。
- 选择 检查自愈 卡片,单击 启用,开启集群检查自愈观测。
-
-
步骤二:配置告警
为方便用户及时发现检查自愈规则事件,系统支持基于检查规则自愈的行为和节点的常见故障进行告警,如下表所示。
配置检查自愈告警的操作步骤如下:
- 选择 检查自愈 卡片,单击 编辑配置,并选择 告警 页签。
- 在 告警 页签中,单击开关,开启检查自愈告警,并配置告警相关参数。
-
说明
- 除了直接使用预置告警模板配置告警规则,您可以自定义模板中的配置,或直接使用 PromQL 语句配置告警规则。详情请参见 配置告警。
- 预置告警规则模板的详情,包括规则说明、PromQL 配置和常见告警处理流程。请参见 预置告警模板。
观测看板
说明
预置看板中为您提供监控数据同比对照、复制看板语句等功能,详情请参见 使用看板。 您可以查看检查自愈的监控信息,包括:异常节点数、GPU 异常节点数、自愈操作数、自愈操作成功数等。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
- 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板。
- 在左侧看板列表中选择 智能运维 > 检查自愈,即可查看监控大盘。
-
查看指标
- 如需查询集群中的已接入/未接入指标,或查询指标的具体含义,请参见 指标查询。
- 支持使用托管 Prometheus 的 Explore 功能来快速查询和展示指标数据。详情请参见 指标查询。
最近更新时间:2026.07.29 11:09:46