You need to enable JavaScript to run this app.
文档中心
容器服务

容器服务

复制全文
下载 pdf
其他观测
检查自愈观测
复制全文
下载 pdf
检查自愈观测
检查自愈观测允许您监控集群中节点池检查自愈功能,基于指标对节点常见的 Kubelet、Runtime 和 GPU 故障进行观测和告警。本文为您介绍如何配置检查自愈观测。
说明
检查自愈的详情,请参见 配置节点检查自愈
前提条件
  • 已开启云原生观测功能,详情请参见 开启观测
操作步骤
步骤一:开启观测
  1. 在左侧导航栏单击 集群,找到目标集群,单击集群名称。
  1. 在集群管理页面的左侧导航栏中,单击 观测配置,并选择 基础观测 页签。
  1. 选择 检查自愈 卡片,单击 启用,开启集群检查自愈观测。
  • alt
  1. 系统自动检查开启观测所需的必要条件。
  • alt
  1. 单击 开启,开启检查自愈观测。
步骤二:配置告警
为方便用户及时发现检查自愈规则事件,系统支持基于检查规则自愈的行为和节点的常见故障进行告警,如下表所示。
告警分类
告警规则
检查自愈行为
自愈开始执行。
自愈执行失败。
自愈执行完成但未能修复问题。
节点常见故障
节点出现 GPU 相关异常。
节点出现 NTP 相关异常。
节点出现 ContainerRuntime 异常。
节点检测到 Kubelet 异常。
配置检查自愈告警的操作步骤如下:
  1. 选择 检查自愈 卡片,单击 编辑配置,并选择 告警 页签。
  1. 告警 页签中,单击开关,开启检查自愈告警,并配置告警相关参数。
  • alt
  • 配置项
    说明
    告警聚合策略
    在下拉菜单中选择告警聚合策略。详情请参见 创建告警聚合策略
    告警通知策略
    在下拉菜单中选择告警通知策略。系统会使用通知策略中配置的告警等级和联系人组,将告警发送给指定的联系人。详情请参见 创建告警通知策略
说明
  • 除了直接使用预置告警模板配置告警规则,您可以自定义模板中的配置,或直接使用 PromQL 语句配置告警规则。详情请参见 配置告警
  • 预置告警规则模板的详情,包括规则说明、PromQL 配置和常见告警处理流程。请参见 预置告警模板
  1. 单击 确定,完成配置。
观测看板
说明
预置看板中为您提供监控数据同比对照、复制看板语句等功能,详情请参见 使用看板
您可以查看检查自愈的监控信息,包括:异常节点数、GPU 异常节点数、自愈操作数、自愈操作成功数等。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 智能运维 > 检查自愈,即可查看监控大盘。
  • alt
查看指标
  • 如需查询集群中的已接入/未接入指标,或查询指标的具体含义,请参见 指标查询
  • 支持使用托管 Prometheus 的 Explore 功能来快速查询和展示指标数据。详情请参见 指标查询
最近更新时间:2026.07.29 11:09:46
这个页面对您有帮助吗?
有用
有用
无用
无用