序号 | 筛选项 | 说明 |
1 | 产品筛选 | 按产品进行数据筛选,目前支持查看告警概览的产品包括:云监控、托管 Prometheus、应用性能监控。 |
2 | 看板切换 | 按告警类型进行数据筛选,目前提供告警中和历史大盘两个看板。
|
3 | 地域筛选 | 按地域进行数据筛选。 |
指标 | 说明 | 图例 |
正在告警总数 | 正在进行的告警总数,以及未恢复的告警总数。直观掌握故障体量,快速判断整体系统是否处于异常高危状态。 | |
各产品正在告警数 | 以产品维度统计正在进行的告警数量。快速区分受故障影响的业务产品,实现故障按业务维度拆分认领。 | |
近 24h 新增告警数趋势 | 最近 24 小时内新增告警数量的趋势图。通过告警增长走势判断故障是突发爆发还是缓慢恶化,验证故障处置效果。 | |
近 24h 告警区域 TOP 10 | 最近 24 小时内告警数量排名前 10 的地域。迅速识别机房、地域级地域性故障,区分局部故障与全网故障。 | |
近 24h 告警策略 TOP 10 | 最近 24 小时内告警数量排名前 10 的告警规则。定位高频告警规则,区分真实故障与告警风暴,辅助优化告警规则实现降噪。 说明
| |
近 24h 云产品告警 TOP 10 | 最近 24 小时内告警数量排名前 10 的云产品。精准锁定故障对应的底层云组件,帮助运维快速定位故障根因所在资源。 说明 单击目标云产品名称或右侧操作列中的 查看 按钮,可跳转到告警事件页面,查看当前云产品相关告警历史。 | |
近 24h 云产品事件 TOP 10 | 最近 24 小时内事件数量排名前 10 的云产品。结合事件与告警数据,判断告警是否由运维变更操作引发,规避变更故障。 说明 单击目标云产品名称或右侧操作列中的 查看 按钮,可跳转到告警事件页面,查看当前云产品相关事件历史。 | |
告警总数 | 指定时间范围内的告警总数,以及未恢复的告警总数。统计周期内整体告警体量,用于故障量级统计、运维健康度考核。 | |
各产品告警数 | 指定时间范围内各个产品触发的告警数量。统计各业务周期告警频次,量化各产品稳定性,针对性优化薄弱产品。 | |
告警数趋势 | 指定时间范围内触发告警的数量趋势图。复盘历史告警波动规律,挖掘周期性故障、业务高峰期故障隐患。 | |
告警区域 TOP 10 | 指定时间范围内告警数量排名前 10 的地域。统计各地域长期故障高发情况,为机房扩容、地域运维资源调配提供依据。 | |