- 文档首页
托管 Prometheus
用户指南
告警中心
告警概述
告警概述
托管 Prometheus 提供功能强大的告警中心,方便您快速实现面向监控对象的告警配置。本文介绍告警中心的常见概念。
- 创建通知消息模板:自定义消息通知的类型、渠道、样式等信息,提升通知消息的规范化和可读性。
- 创建告警通知策略:指定不同等级告警发生以及告警恢复时需要接收通知的方式、对象、模板等信息。
- 创建告警聚合策略:配置告警的聚合周期,将一批告警聚合到一起进行通知,避免因告警频繁触发导致短时间内产生大量告警消息,造成告警风暴。
- 创建告警静默策略:屏蔽一些频繁但并不重要的告警,避免淹没更重要的告警通知,以便更好关注真正重要的问题。
- 创建告警规则:配置告警触发规则和通知策略,告警触发时,即可为指定联系人发送通知消息。
- 查看告警事件:被监控资源达到告警规则中配置的阈值时,将触发告警并收到通知消息。系统同时会记录告警事件和通知历史,方便回溯和故障排查。
托管 Prometheus 配置多等级的告警规则,通过不同等级,您可以使用不同的持续时间和阈值来表示不同的紧急程度。系统会周期性(1m)执行告警 PromQL 计算,然后根据不同时刻的结果以及告警规则指定的不同等级配置,计算生成告警事件。多等级告警流转示意图如下图所示。
说明
告警事件: 告警规则中配置的 PromQL 语句可以计算出很多的时序,在告警评估时刻达到告警阈值&告警持续时间的时序称为告警事件。
生成告警事件后,托管 Prometheus 会根据在告警规则中绑定的告警聚合策略进行判断是否应该发送告警通知。当确定发送告警通知后,如果有命中告警静默策略则对应的告警事件不会进行告警发送,在发送阶段我们将通过您配置的告警通知策略将告警发送到不同的渠道中。
用于复用一组变量和告警规则配置,并批量应用到工作区,当 VMP 提供的预置模版不满足您的要求时,系统支持自定义告警规则模版,详情请参见 自定义告警规则模板。 告警通知策略用来指定不同等级的告警发生时,需要接收告警的告警联系人组。详情请参见 创建告警通知策略。 当托管 Prometheus 提供的默认通知消息模版不满足您的要求时,系统支持自定义告警通知模版,详情请参见 创建通知消息模板。 - 聚合维度:目前仅支持告警规则维度的聚合,表示发告警通知时,单条通知内的告警是来源于同一个告警规则。
-
- 聚合周期:告警规则产生第一个告警事件时,按告警聚合周期检查是否有新增的告警事件/恢复事件。如果有新增,则在周期时间到后发送告警通知。
-
- 通知周期:告警规则内无告警事件的变化时,达到告警通知周期,会再次发告警通知。
-
- 首次发送告警通知的时间:为首个告警事件产生时间 + 托管 Prometheus 维护的等待时间。
当部分资源存在已知问题,不想被告警通知打扰时,可以通过告警静默策略来禁止该资源的在指定时间范围内不发送告警通知。例如:假设您希望在 namespace: doc 下的 pod: doc 产生的告警均不要通知,可以通过下述方法来创建告警静默策略。
最近更新时间:2026.09.04 14:36:40