配置集群监控告警便于用户实时掌握集群运行状态和资源状态,及时发现并处理异常,保障业务稳定。本文为您几种类型的基础监控告警配置,建议应用这些基础配置。
说明
关闭告警模板后,所有由预置告警模板生成的告警策略将被随之删除。
在 告警中心>告警模版>预置告警模版 页面 资源类型 中,选择 数据中台>E-MapReduce,筛选模版。参考配置云服务器资源告警配置步骤,启用 E-MapReduce预置告警模版。
说明
数据中台>E-MapReduce 类还有其他预置告警模版,可按需启用。
服务核心指标直接影响业务稳定性,建议针对核心指标配置告警策略,以便及时发现并处理异常。
登录 EMR 控制台,进入 EMR 集群详情页面>告警中心>订阅事件告警,跳转 云监控告警策略页面。
在 云监控告警策略页面 中,点击 创建告警策略,进入创建页面。
配置 资源类型 为 数据中台>E-MapReduce。
配置告警维度、指标类型和触发条件等告警策略详细信息。详细参数说明请参见创建告警策略。
下表列出需要重点关注的服务指标及建议设置的告警策略,请参考以下策略进行配置。
告警维度 | 告警指标及说明 | 指标级别 | 触发条件 |
|---|---|---|---|
HDFS | HDFS已使用的DFS空间 | 严重 | 超出总量的90%则告警 说明 处理建议:提高 NameNode 节点的 JVM 堆大小清理包含大量小文件目录 |
HDFS存储使用率 | 严重 | 高于80%告警 | |
HDFS丢块数量 | 严重 | 按需配置,若不允许丢块,可以配置Missing block>0 告警 | |
NameNode堆空间使用比例 | 严重 | 高于80%告警 | |
DataNode老年代区空间使用率 | 严重 | 高于95%告警 说明 告警发送周期建议:一段周期分钟内持续一段时间。 | |
Yarn | ResourceManager老年代区空间 | 严重 | 高于95%告警 |
NodeManager老年代区空间 | 严重 | 高于95%告警 | |
Hive | hiveserver2打开的连接数 | 严重 | 按需设置 |
HiveMetaStore堆内存使用率 | 严重 | 高于95%告警 | |
HiveServer2堆内存使用率 | 高于95%告警 | ||
HiveServer2查询失败数 | 按需设置 | ||
Hbase | HRegion full gc | P2 | 关注,频繁出现排查 |
HRegion读取速率 | P2 | 按需设置 | |
HRegion写入速率 | P2 | 按需设置 | |
Presto/Trino Coordinator | JVM当前已经使用的HeapMemory的数量 | P1 | 超过堆内存的95%告警 |
Presto/Trino Worker | JVM当前已经使用的HeapMemory的数量 | P1 | 超过堆内存的95%告警 |
ZooKeeper | Zookeeper znode数目 | P2 | 按需设置 |
ZookeeperOverview | Zookeeper集群总连接数 | P2 | 按需设置 |
Kafka(KafkaConsumerGroup) | Kafka Consumer Group Lag | P1 | 按需设置 |