You need to enable JavaScript to run this app.
文档中心
E-MapReduce

E-MapReduce

复制全文
下载 pdf
日志、监控与告警
集群监控告警配置实践
复制全文
下载 pdf
集群监控告警配置实践

配置集群监控告警便于用户实时掌握集群运行状态和资源状态,及时发现并处理异常,保障业务稳定。本文为您几种类型的基础监控告警配置,建议应用这些基础配置。

配置云服务器资源告警
  1. 登录云监控控制台,在 告警中心>告警模版>预置告警模版 页面 资源类型 中,选择 弹性计算>云服务器,筛选模版。关于告警模板的创建和使用详细操作,请参见创建告警模板
    Image
  2. 单击 云服务器预置告警模版 名称进入模板详情页,查看告警触发条件、告警级别和关联告警策略等信息。
    Image
  3. 点击 云服务器预置告警模版 详情页面右侧 启用,​或回到 预置告警模版 页面,点击 一键应用 按钮后,系统将自动生成并启用告警策略,应用于该火山引擎账号下云服务器的全部资源。

    说明

    关闭告警模板后,所有由预置告警模板生成的告警策略将被随之删除。

配置EMR服务资源告警

告警中心>告警模版>预置告警模版 页面 资源类型 中,选择 数据中台>E-MapReduce,筛选模版。参考配置云服务器资源告警配置步骤,启用 E-MapReduce预置告警模版
Image

说明

数据中台>E-MapReduce 类还有其他预置告警模版,可按需启用。

配置服务状态/操作异常类事件告警
  1. 登录云监控控制台,进入 事件中心>事件规则>创建事件规则 页面。
  2. 创建服务状态/操作异常类事件告警规则,
    1. 资源类型 下拉框中选择 E-MapReduce。
    2. 事件名称 下拉框中输入关键词“状态”,筛选服务状态类事件勾选事件名称。推荐勾选所有用到的服务的状态事件。
    3. 事件名称 下拉框中输入关键词“成功”或“失败”等操作类事件关键词,勾选事件名称。可根据高频操作配置。
      创建事件规则的详细操作指导请参见创建事件规则
      Image

配置服务核心指标告警

服务核心指标直接影响业务稳定性,建议针对核心指标配置告警策略,以便及时发现并处理异常。

  1. 登录 EMR 控制台,进入 EMR 集群详情页面>告警中心>订阅事件告警,跳转 云监控告警策略页面
    Image

  2. 云监控告警策略页面 中,点击 创建告警策略,进入创建页面。

  3. 配置 资源类型数据中台>E-MapReduce
    Image

  4. 配置告警维度、指标类型和触发条件等告警策略详细信息。详细参数说明请参见创建告警策略
    下表列出需要重点关注的服务指标及建议设置的告警策略,请参考以下策略进行配置。

    告警维度

    告警指标及说明

    指标级别

    触发条件

    HDFS

    HDFS已使用的DFS空间

    严重

    超出总量的90%则告警
    总量查询入口:EMR 控制台>集群详情>集群监控>HDFS>Overview>存储状态。
    Image

    说明

    处理建议:提高 NameNode 节点的 JVM 堆大小清理包含大量小文件目录
    告警发送周期建议:5分钟检查一次,30分钟内发生2次则告警。

    HDFS存储使用率

    严重

    高于80%告警

    HDFS丢块数量

    严重

    按需配置,若不允许丢块,可以配置Missing block>0 告警

    NameNode堆空间使用比例

    严重

    高于80%告警

    DataNode老年代区空间使用率

    严重

    高于95%告警

    说明

    告警发送周期建议:一段周期分钟内持续一段时间。

    Yarn

    ResourceManager老年代区空间

    严重

    高于95%告警

    NodeManager老年代区空间

    严重

    高于95%告警

    Hive

    hiveserver2打开的连接数

    严重

    按需设置

    HiveMetaStore堆内存使用率

    严重

    高于95%告警

    HiveServer2堆内存使用率

    高于95%告警

    HiveServer2查询失败数

    按需设置

    Hbase

    HRegion full gc

    P2

    关注,频繁出现排查

    HRegion读取速率

    P2

    按需设置

    HRegion写入速率

    P2

    按需设置

    Presto/Trino Coordinator

    JVM当前已经使用的HeapMemory的数量

    P1

    超过堆内存的95%告警

    Presto/Trino Worker

    JVM当前已经使用的HeapMemory的数量

    P1

    超过堆内存的95%告警

    ZooKeeper

    Zookeeper znode数目

    P2

    按需设置

    ZookeeperOverview

    Zookeeper集群总连接数

    P2

    按需设置

    Kafka(KafkaConsumerGroup)

    Kafka Consumer Group Lag

    P1

    按需设置

最近更新时间:2026.07.08 11:51:40
这个页面对您有帮助吗?
有用
有用
无用
无用