云搜索服务
监控指标 | 统计方式 | 说明 |
节点 CPU 使用率 | 每单位统计周期内(1分钟),Logstash 实例各个节点的 CPU 使用率的平均值。 | 当实例各节点处理的读写任务超出节点 CPU 的负载能力时,该指标就会过高,节点 CPU 使用率过高会导致节点处理能力下降,甚至宕机。您可观察该指标是持续性较高,还是临时飙升。若是临时飙升,确定是否有临时性复杂任务正在执行。 |
节点JVM 内存使用率 | 每单位统计周期内(1分钟),实例各个节点的 JVM 内存使用率的平均值。 | 该值过高会导致节点频繁触发垃圾回收(GC),甚至出现内存溢出(OOM)。导致该值过高的原因,一般是节点上管道处理任务超出节点 JVM 的负载能力。您需要注意观察 Logstash 实例正在执行的任务,或调整 Logstash 实例的配置。 |
节点 1 分钟负载 | Logstash 实例所有节点 1 分钟的平均负载。指标数据来源:Logstash 节点监控 API _node/stats/process?pretty。 | |
节点磁盘使用率 | 每单位统计周期内(1分钟),Logstash 实例各个节点的磁盘使用率的平均值。 | 磁盘使用率过高会导致 Logstash 无法正常工作。可对实例进行扩容,增加单节点的磁盘容量。 |
Events 接收速率(条/秒) | Logstash 实例在统计周期(1秒)内各节点 Events 接收速率的总和。 | Logstash 实例各个节点上的所有管道每秒接收 Events 数量的总和。 |
Events 发送速率(条/秒) | Logstash 实例在统计周期(1秒)内各节点 Events 发送速率的总和。 | Logstash 实例各个节点上的所有管道每秒发送 Events 数量的总和。 |
Events 处理延迟 | Logstash 实例在统计周期内各节点 Events 处理延迟的平均值。 | Logstash 节点 Events 处理延迟的平均值。 |