You need to enable JavaScript to run this app.
文档中心
全栈可观测平台

全栈可观测平台

复制全文
下载 pdf
托管 Prometheus 告警配置
创建托管 Prometheus 告警模板
复制全文
下载 pdf
创建托管 Prometheus 告警模板
除系统提供的预置告警模版外,您也可以根据需求,自定义告警规则模板,快速完成云产品的告警规则配置。本文为您介绍如何创建自定义告警模版。
操作步骤
方式一:创建告警模板
方式二:通过 JSON 导入/导出告警模板
通过控制台从零创建一条告警模板,依次配置查询语句、匹配表达式、PromQL 等信息,保存后可反复用于快速生成告警规则。适用于个性化配置需求、需要沉淀标准模版的场景。
  1. 在左侧导航栏选择 告警中心 -> 告警配置,进入告警配置管理页面。
  1. 在左侧告警配置中选择 托管 Prometheus ,并前往 告警模板 页签。
  1. 单击 创建告警模板,根据实际情况配置托管 Prometheus 告警模板相关参数,完成后单击 提交
  • 分类
    配置项
    说明
    图例
    基础信息
    名称
    自定义告警模板名称,不允许重名。
    -
    Label
    告警规则的全局 Label,主要用于告警身份识别、分组、去重、路由匹配等。Label 由 Key 和 Value 组成。其中:
    • Key:字符串形式,支持以字母或_开头,但不能以__开头。支持字母、数字和_,取值范围为 1~256 个字符。
    • Value:字符串形式,支持支持中英文、数字和特殊字符,取值范围为 1~512 个字符。
    说明
    当您在多个位置配置 Label 时,Label 的优先级为:规则 Label > 全局 Label > PromQL Label。
    变量配置
    变量类型
    选择变量类型,包括:
    • Query:PromQL 动态变量,该类型的变量仅能定义变量名称,无法直接定义变量值。例如:在集群的监控指标中,集群 ID、命名空间名称等,均为动态值。动态变量的值可以通过指定 PromQL 语句和正则表达式来获取。
    • Custom:固定值变量,用于匹配固定的变量值。例如:在集群的监控指标中,工作负载的类型是固定的,包括 Depolyment、StatefulSet、DaemonSet 等,可以直接指定。
    变量名称
    配置变量的变量名称和 PromQL Label。
    • 变量名称:匹配 PromQL 语句中的特定 Label,支持英文大小写字母、数字,取值范围为 1~32。
    • Label:描述该变量的含义和作用,并在控制台上展现,方便用户理解。支持中文、英文大小写字母、数字、特殊字符,取值范围为 1~20。
    说明
    • 变量用于对监控数据中的云产品资源对象进行更细粒度的筛选,例如:在 VKE 产品中,您可以通过变量选择 VKE 集群或命名空间。
    • 变量名称首字母必须大写,采用驼峰格式。例如ClusterNode
    查询语句
    变量类型 选择 Query 时,需要配置获取变量取值的 PromQL 查询语句。例如kube_node_info
    匹配表达式
    变量类型 选择 Query 时,需要配置获取变量取值的正则表达式,系统会基于 查询语句匹配表达式 获取变量的值。
    例如:您可以使用/.*cluster="(.*?)".*/表达式,匹配 PromQL 语句中任意包含cluster="任意文本"形式的字符串,并将 cluster=" 和闭合的"之间的文本捕获下来作为一个变量组。
    变量
    变量类型 选择 Custom 时,在文本框内配置变量的固定值,允许使用空格分割不同的值。
    变量值多选
    默认关闭。启用后,选择变量时允许选择多个变量值。
    添加全选
    默认关闭。启用后,变量中包括 All 选项,即允许选择所有的变量值。
    规则配置
    规则名称
    自定义告警规则名称,作为唯一标识,不允许重名。
    PromQL
    使用标准 PromQL 语句,配置监控对象或指标。
    说明
    您可以在 PromQL 语句中以$变量名称的形式引用全局变量。例如,如果您定义了集群变量为Cluster,则可以通过node_cpu_seconds_total{cluster="$Cluster"}的形式引用该变量。
    触发策略
    配置告警触发的策略。支持指定告警等级、条件、阈值和条件持续时间。
    • 告警等级:勾选 P0、P1 或 P2,表示设定不同的告警等级。取消勾选,则表示不设定该等级的告警。
    • 比较条件:指定 PromQL 语句和阈值之间的比较条件。支持多个比较条件,包括: 大于、大于等于、小于、小于等于、等于 和 不等于。
    • 阈值:配置指标的阈值。
    • 条件持续时间:配置指标符合条件的持续时间,包括:
    • 立即触发:满足告警条件后,立即触发告警。
    • 自定义持续时间:选择告警触发的时间,支持 1 分钟、2 分钟、5 分钟、10 分钟、20 分钟、30 分钟、1 小时、3 小时、6 小时、12 小时。例如:1 分钟表示满足告警条件,并持续 1 分钟后,再触发告警。
    Label
    配置告警规则的 Label,主要用于告警身份识别、分组、去重、路由匹配等。Label 由 Key 和 Value 组成。其中:
    • Key:字符串形式,支持以字母或_开头,但不能以__开头。支持字母、数字和_,取值范围为 1~256 个字符。
    • Value:字符串形式,支持支持中英文、数字和特殊字符,取值范围为 1~512 个字符。
    说明
    当您在多个位置配置 Label 时,Label 的优先级为:规则 Label > 全局 Label > PromQL Label。
    常见配置示例:
    labels:
    severity: critical # 告警级别
    business: pay # 业务线
    alert_type: resource # 告警类型
    Annotation
    配置告警规则的 Annotation,主要用于关键信息展示。Annotation 由 Key 和 Value 组成。其中:
    • Key:字符串形式,支持以字母或_开头,但不能以__开头。支持字母、数字和_,取值范围为 1~256 个字符。
    • Value:字符串形式,支持支持中英文、数字和特殊字符,取值范围为 1~512 个字符。
    常见配置示例:
    annotations:
    summary: "High CPU usage on instance {{ $labels.instance }}"
    description: "Current CPU usage is {{ $value | humanizePercentage }}, threshold is 80%"
    runbook_url: "https://xxx/docs/cpu-alert"
    dashboard_url: "https://grafana/xxx"
后续操作
配置工作区、通知策略和聚合策略,并应用当前告警模板,将基于此模版自动生成告警规则和告警规则组,进行资源监控。更多详细说明参见:创建托管 Prometheus 告警规则组
最近更新时间:2026.08.21 14:04:45
这个页面对您有帮助吗?
有用
有用
无用
无用