You need to enable JavaScript to run this app.
文档中心
文档控制台
注册
流式计算 Flink版

流式计算 Flink版

复制全文
下载 pdf
告警管理
配置告警策略
复制全文
下载 pdf
配置告警策略

流式计算 Flink 版已经接入云监控服务,您可以在云监控平台配置告警策略,以及时识别资源异常状态并发送告警通知,提升运维效率。本文为您介绍在云监控平台如何配置告警策略,以及流式计算 Flink 版支持配置告警的 Metric 详情。

Metric介绍

下表为您介绍流式计算 Flink 版支持配置告警的监控指标。

维度

指标名

支持的聚合维度

指标含义及计算方式

对应开源 Flink 指标(Scope:MetricName)

使用说明

作业运行状态

作业 failed 或者是 recover 的时间长度

最大值

已废弃, Failover 时作业从故障到 Running 的时间

job:downtime

仅支持 1.11,不推荐使用

过去 30s 作业 Failover 次数

最大值、最小值、平均值

过去 30s 作业 Failover 的次数

job:fullRestarts

不推荐使用,由于 Flink Failover 间隔比较长,建议使用后续过去 5/10/15 分钟的 Failover 次数指标

作业失败状态(值为 1 表示失败)

最大值

作业以失败状态结束

此报警只通知一次,并且不支持报警恢复功能

作业 Failover QPS

最大值

作业发生 Failover 的 QPS

job:fullRestarts

不推荐使用,由于 Flink Failover 间隔比较长,QPS 计算不够直观,建议使用后续过去 5/10/15 分钟的 Failover 次数指标

作业成功结束状态(值为 1 表示成功结束)

最大值

作业以成功状态结束

此报警只通知一次,并且不支持报警恢复功能

作业失败退出后被自动拉起次数

最大值

作业失败后被自动拉起的次数

仅当开启任务失败重试拉起配置后生效

业务延迟

最大值

Source 处理数据的时间减去数据写入上游存储的时间,当前只支持新的 KafkaSource

operator:currentEmitEventTimeLag

仅支持 1.16 版本且使用新的 KafkaSource

过去 5 分钟内作业 Failover 次数

总和

过去 5 分钟作业 Failover 次数

job:fullRestarts

建议配置连续 3/5 个周期都大于阈值才触发报警,防止误报警

过去 10 分钟内作业 Failover 次数

总和

过去 10 分钟作业 Failover 次数

job:fullRestarts

建议配置连续 3/5 个周期都大于阈值才触发报警,防止误报警

过去 15 分钟内作业 Failover 次数

总和

过去 15 分钟作业 Failover 次数

job:fullRestarts

建议配置连续 3/5 个周期都大于阈值才触发报警,防止误报警

checkpoint

最近一次 checkpoint 用时

最大值、最小值、平均值

最近一次 checkpoint 用时

job:lastCheckpointDuration

由于Checkpoint 时间过长会触发超时,该报警难以配置阈值,不推荐使用。建议配置合理的 checkpoint 超时时间后配合checkpoint 失败次数配置报警

checkPoint 连续失败次数

最大值、最小值、平均值

连续失败次数,checkpoint 成功后会清零。不计算触发 checkpoint 失败的次数(例如作业处于 Failover 中)

过去 5 分钟内作业 Checkpoint 失败次数

总和

过去 5 分钟作业 Failover 次数

job:numberOfFailedCheckpoints

建议配置连续 3/5 个周期都大于阈值才触发报警,防止误报警

过去 10 分钟内作业 Checkpoint 失败次数

总和

过去 10 分钟作业 Failover 次数

job:numberOfFailedCheckpoints

建议配置连续 3/5 个周期都大于阈值才触发报警,防止误报警

过去 15 分钟内作业 Checkpoint 失败次数

总和

过去 15 分钟作业 Failover 次数

job:numberOfFailedCheckpoints

建议配置连续 3/5 个周期都大于阈值才触发报警,防止误报警

Kafka

Max KafkaConsumer Records Lag V11

最大值、最小值、平均值

Kafka 中积压待消费的数据条数,指标值多个 partition 求最大值,该值比较大表明消费能力不足

仅使用 OldKafkaSource 生效,且作业异常时该指标不打点

Max KafkaConsumer Records Lag V16

最大值、最小值、平均值

Kafka 中积压待消费的数据条数,指标值多个 partition 求最大值,该值比较大表明消费能力不足

仅使用 NewKafkaSource 生效,且作业异常时该指标不打点

flinkFiveMinsCounter

过去 5 分钟内作业 Failover 次数

总和

过去 5 分钟作业 Failover 次数

job:fullRestarts

不推荐,该报警指标为重复指标,后续会下线。
推荐使用作业运行状态维度的 Failover 次数报警

前提条件

  • 您在前往云监控服务侧创建告警策略前,需要先明确资源对象,请提前获取 Flink 任务的 ID。
  • 在创建告警策略时,选择邮箱电话或者短信作为通知方式时,需要提前创建告警联系人和联系组,请参见创建告警联系人和联系组

创建告警策略

  1. 登录云监控控制台

  2. 在左侧导航栏选择告警中心 > 告警策略,然后单击创建告警策略

  3. 基本信息区域,设置告警策略名称和描述。
    Image

    配置

    说明

    名词

    自定义告警策略名称,用于标识告警策略。
    要求长度范围在1~128字符,且不得以数字、短横线(-)开头。

    描述

    告警策略的描述。

  4. 告警对象区域,选择资源类型为数据中台 > 流式计算 Flink 版,然后根据实际情况选择地域、维度和资源。
    Image

    配置

    说明

    资源类型

    选择数据中台 > 流式计算 Flink 版

    维度

    创建告警策略的维度,目前支持作业运行状态checkpointKafkaflinkFiveMinsCounter资源池Operator 六个维度。

    选择方式

    • 手动选择:手动选择资源。
    • 资源名称:根据资源名称匹配资源。
    • 对象分组:根据对象分组锁定资源。具体操作,请参见 创建对象分组
    • 项目:根据项目锁定资源。具体操作,请参见 项目管理
    • 标签:根据标签锁定资源。具体操作,请参见 管理标签和资源

    地域

    选择方式 配置为 手动选择资源名称项目标签 时,您可以选择被监控资源所属的地域。

    资源

    确定设置告警策略的资源(作业)范围,支持以下两种设置方式:

    • 全部:表示对当前账号下所有作业设置告警策略。注意,全部指针对当前作业生效,后续新建作业需要手动配置。
    • 部分:需手动选择一个或多个作业,表示仅对所选作业设置告警策略。
  5. 告警规则区域,选择指标类型,设置告警规则触发条件,告警级别、策略生效时间、告警发送周期等。
    Image

    配置

    说明

    使用预置触发条件

    按照告警维度预先配置的触发条件,便于您快速填写告警策略。但 Flink 的维维度均没有预置触发条件,无需关注该参数。

    指标类型

    支持选择单指标多指标。如果您需要监控资源的多个指标,可直接配置多指标类型。

    触发条件

    设置告警的监控指标、持续周期、统计类型、比较关系以及阈值。当被监控的资源指标达到触发条件时,系统会推送告警通知。
    触发报警的计算方法是连续 N 个周期获取当前周期指标的统计值,如果都满足报警阈值,则触发报警。
    以《过去 5 分钟作业 Failover 次数为例》,如果配置连续 3 个周期(1周期=1分钟),总和,>=5。 则会在每分钟计算过去 5 分钟 Failover 次数的和,如果连续 3 分钟计算的值都 >=5 ,则触发报警。

    告警发送周期

    触发告警策略后,如果被监控的资源仍然持续触发告警,为避免打扰,系统会周期性发送告警通知。

    • 支持配置为 5 分钟、10 分钟、15 分钟、30 分钟、60 分钟、3 小时、6 小时、12 小时、24 小时。
    • 默认为 5 分钟。

    发送聚合策略

    • 规则和资源:告警规则中的不同资源在告警发送周期内持续超过告警阈值,在告警发送周期内均会分别发送告警通知;如果监控指标在告警发送周期后仍未恢复正常,则云监控再次发送告警通知。

    Image

    • 规则:告警规则中的任意资源在告警发送周期内持续超过告警阈值,在告警发送周期内只发送 1 次告警通知。

    Image

    告警恢复通知

    告警恢复后向用户发送 1 条恢复通知,默认为打开。

    注意

    • 阈值告警场景中,资源连续 5 分钟不产生告警,视为恢复。
    • 无数据告警场景中,资源连续 5 分钟有数据上报,视为恢复。
    • 发送聚合策略选择 规则 时,所有资源的告警都恢复后,发送 1 条告警恢复通知。
    • 发送聚合策略选择 规则和资源 时,每个资源的告警恢复后,都会发送 1 条告警恢复通知。

    无数据告警

    配置无数据告警,包括:

    • 指定资源连续指定 n 个周期,无数据上报,则会触发无数据告警。
    • 配置无数据告警级别,支持配置为 严重警告通知

    注意

    • 支持配置 3~20 个周期,默认为 10 个周期。
    • 不是所有的云产品指标都支持无数据告警。目前只有告警对象里 维度实例,且资源只涉及一个层级的云产品指标可以配置无数据告警,以控制台显示为准。
    • 一条规则同时触发阈值告警和无数据告警,则会分别发送 2 条通知。
    • 资源被删除不发送无数据告警通知。
    • 例如,告警对象中配置了全部资源。资源 A被删除,连续 n 个周期没有上报数据,不发送无数据告警。
  6. 告警方式区域,选择告警通知方式和告警通知组。
    Image

    配置

    说明

    通知方式

    选择告警通知渠道。包括:

    • 通知策略:指定已配置的通知策略,详情请参见 创建通知策略
    • 手动选择:手工配置该告警策略的通知方式。

    告警渠道

    选择一个或多个渠道。支持 邮箱电话短信、告警回调运维编排
    其中,电话和短信通知的接收限制,请参见 使用限制

    告警联系组

    告警渠道 选择 邮箱电话 或者 短信 中的一个或多个渠道时,页面将展示 告警联系组

    • 必须配置至少 1 个联系组作为告警通知的接收方。
    • 最多配置 5 个联系组作为告警通知的接收方。

    告警回调

    告警渠道 选择 告警回调 时,页面将展示 告警回调 文本框。

    • 必须指定一个公网可用的 URL。
      • 支持选择已创建的回调地址,最多选择 8 个。
      • 支持填写回调地址,只能填写 1 个。
    • 云监控通过 HTTP 协议或 HTTPS 协议的 POST 请求推送告警通知到您指定的 URL 地址,请将 IP 地址 221.194.189.0/24、101.126.49.32、101.126.49.33、101.126.49.34 加入防火墙的白名单。当您接收到告警通知后,可以根据通知内容做进一步处理。
    • 关于告警回调的更多信息,请参见 告警回调使用说明
    • 告警回调支持关联飞书、钉钉、企业微信中的群机器人,以实现自动推送告警通知。具体操作,请参见 通过飞书群接收告警通知通过钉钉群接收告警通知通过微信群接收告警通知

    编排计划

    告警渠道 选择 运维编排 时,页面将展示 编排计划 下拉框。
    配置需要执行的运维编排任务。
    说明
    运维编排是平台提供的云产品流程化自动运维服务,可以根据您的需求编排任务流程并自动执行。详情请参见 运维编排

    通知模版配置

    选择指定告警渠道的通知模版,详情请参见 创建通知模版。当未配置时,系统使用默认通知模版发送告警。

    生效时间

    配置告警策略的生效时间。仅在生效时间内,系统会按照告警策略的配置产生告警。

  7. 告警策略配置完成后,单击页面右下角的确定
    告警策略创建成功后,即自动启动。

最近更新时间:2026.07.14 16:25:20
这个页面对您有帮助吗?
有用
有用
无用
无用