You need to enable JavaScript to run this app.
文档中心
容器服务

容器服务

复制全文
下载 pdf
告警管理
告警概述
复制全文
下载 pdf
告警概述
容器服务提供多种类型的集群告警能力,帮助您从指标、日志和事件三个维度及时发现集群异常。本文介绍 VKE 中不同告警方式的适用场景、配置入口和生产环境中的配置建议。
告警类型
在云原生体系中,告警是保障集群稳定运行的重要手段。不同于传统以 CPU、内存资源使用量为主的告警,云原生场景下的告警来源更多样:从基础设施层的资源监控指标,到应用层的日志内容,再到 Kubernetes 原生的集群事件,覆盖面更广、感知粒度更细。VKE 支持多种告警配置方式,适应不同的监控需求和运维场景,如下表所示:
告警类型
数据来源
相关产品
适用场景
指标告警
集群资源(集群、节点、组件、容器、网络、存储等)监控指标。
适用于指标判断资源使用率、性能趋势或业务状态的场景,通常用于发现持续性异常和容量风险。例如:
  • 节点 CPU、内存、磁盘等资源使用率持续过高。
  • Pod 重启次数异常增加、工作负载副本不可用。
  • 集群核心组件、网络组件或存储组件的可用性指标异常。
集群日志/事件告警
集群中多种类型资源的日志或事件,并支持基于日志关键字、事件内容或检索分析结果发现集群异常。包括:
  • 集群 Kubernetes 原生事件。
  • 容器日志和事件。
  • 集群审计日志。
  • 控制面组件日志。
适用于异常信息直接体现在应用日志、容器运行日志或已持久化事件中的场景,通常用于快速定位具体错误原因。例如:
  • 应用日志中出现 Error、Exception、请求失败等关键错误。
  • Pod 调度失败、容器启动失败、镜像拉取失败等事件需要长期保存和检索。
  • 需要基于日志关键字、字段或事件内容触发告警,并在通知中携带错误上下文。
核心资源事件告警
集群核心资源异常事件信息,包括:集群、节点池、节点、组件等集群核心资源异常。
适用于关注集群核心资源(集群、节点池、节点、组件等)异常直接产生的事件,通常用于发现集群状态异常、节点扩缩容、组件异常等。
指标告警
指标告警基于托管 Prometheus(VMP)提供的监控指标进行配置,适合发现资源利用率异常、组件状态异常和服务性能波动等问题。VKE 已预置多种告警规则模板,覆盖控制面、节点、网络、工作负载和 AI 训练任务等典型场景,适合直接作为集群告警基线使用。
配置方式
VMP 中已预置了多种类型的 VKE 告警规则模板,您可以直接使用系统预置模板快速创建告警规则组,也可以基于业务实际需求自定义基于 PromQL 语句的告警规则,或在导出预置模板 YAML 后调整规则并沉淀为自定义告警模板,统一复用于多个集群。不同配置方式的定义和应用场景,如下表所示。
配置方式
应用场景
参考文档
使用预置模板配置
系统预置常见场景的告警规则模板,适合首次建设或快速补齐集群告警基线。
说明
VKE 预置告警模板的详细介绍,请参见 预置告警模板
使用自定义模板配置
  • 需要统一修改默认阈值或持续时间。
  • 需要删除不适用于当前集群的规则。
  • 需要补充特定业务标签、路由策略、变量范围。
  • 需要将标准化告警方案复用于多个集群或多个环境。
自定义告警规则
  • 监控特定命名空间、业务 Pod、关键接口或租户。
  • 结合业务 SLI/SLO 定义延迟、错误率、饱和度等指标。
  • 补充企业内部 SOP、值班分级和专属通知路由。
告警级别
VMP 告警模板中定义了不同的告警级别,建议结合业务场景将告警级别映射到企业内部的值班或升级制度。
告警级别
说明
P0
高优先级故障,通常表示组件不可用、严重错误或强烈建议立即处理。
P1
重要异常,通常表示性能明显下降、错误率上升或关键资源逼近上限。
P2
一般告警,通常用于风险提示、异常趋势发现或预警。
配置建议
  • 生产环境通用集群:建议启用 VKE 控制面组件、VKE 工作负载、VKE 节点、VKE DNS 服务、VKE CNI 组件、VKE CSI 组件、VKE Ingress-Nginx 组件模板,覆盖集群的核心组件、节点和网络。
  • GPU / RDMA 训练集群:在通用模板基础上,额外启用 VKE AI 训练任务、VKE AIOps 服务模板,重点观测 GPU 利用率、RDMA 链路质量和训练任务异常。
  • 告警治理通用建议
  • 按环境(开发 / 预发 / 生产)拆分通知路由。
  • 对 P0 告警配置电话、短信或 IM 升级通知。
  • 定期导出模板 YAML 做版本留档,并基于实际告警噪音优化阈值和持续时间。
集群日志/事件告警
指标告警能发现资源层的异常,但当应用报错、Pod 崩溃或集群调度出现问题时,异常往往先体现在日志或事件中,而不是监控曲线上。单靠指标告警,容易出现“指标正常、业务已故障”的漏报窗口期。
配置集群日志和事件告警后,系统可以在关键错误日志出现或重要事件触发时发送通知,帮助您把问题感知从“事后发现”提前到“实时感知”,缩短排障响应时间。相比纯指标告警,集群日志/事件告警的优势在于:告警信息本身已携带上下文(如具体错误信息、涉及的容器/节点),无需二次查询即可快速定位问题。更多详情,请参见 集群日志/事件告警
核心资源事件告警
集群在运行过程中会持续产生事件(Event),记录集群状态异常、节点池状态变更、组件状态异常等关键信息。这些事件是判断集群健康状态的重要信号,但集群核心资源事件默认只短期保留,不适合作为长期排障依据。将核心资源事件接入云监控后,您可以在关键事件发生时及时收到通知,并减少事后排查时事件已过期的问题。
将集群核心资源事件接入云监控并配置告警规则后,关键事件一旦触发即可实时通知,不再依赖人工定期巡检或事后查日志。相比日志告警,核心资源事件告警的优势在于:事件由 Kubernetes 控制面直接产生,能捕获应用日志无法反映的集群基础设施层问题,是指标告警和日志告警的有效补充。更多详情,请参见 核心资源事件告警
最近更新时间:2026.08.25 11:37:05
这个页面对您有帮助吗?
有用
有用
无用
无用