- 文档首页
容器服务
容器服务 VKE
用户指南
可观测性
告警管理
告警概述
告警概述
容器服务提供多种类型的集群告警能力,帮助您从指标、日志和事件三个维度及时发现集群异常。本文介绍 VKE 中不同告警方式的适用场景、配置入口和生产环境中的配置建议。
在云原生体系中,告警是保障集群稳定运行的重要手段。不同于传统以 CPU、内存资源使用量为主的告警,云原生场景下的告警来源更多样:从基础设施层的资源监控指标,到应用层的日志内容,再到 Kubernetes 原生的集群事件,覆盖面更广、感知粒度更细。VKE 支持多种告警配置方式,适应不同的监控需求和运维场景,如下表所示:
指标告警基于托管 Prometheus(VMP)提供的监控指标进行配置,适合发现资源利用率异常、组件状态异常和服务性能波动等问题。VKE 已预置多种告警规则模板,覆盖控制面、节点、网络、工作负载和 AI 训练任务等典型场景,适合直接作为集群告警基线使用。
VMP 中已预置了多种类型的 VKE 告警规则模板,您可以直接使用系统预置模板快速创建告警规则组,也可以基于业务实际需求自定义基于 PromQL 语句的告警规则,或在导出预置模板 YAML 后调整规则并沉淀为自定义告警模板,统一复用于多个集群。不同配置方式的定义和应用场景,如下表所示。
VMP 告警模板中定义了不同的告警级别,建议结合业务场景将告警级别映射到企业内部的值班或升级制度。
- 生产环境通用集群:建议启用 VKE 控制面组件、VKE 工作负载、VKE 节点、VKE DNS 服务、VKE CNI 组件、VKE CSI 组件、VKE Ingress-Nginx 组件模板,覆盖集群的核心组件、节点和网络。
- GPU / RDMA 训练集群:在通用模板基础上,额外启用 VKE AI 训练任务、VKE AIOps 服务模板,重点观测 GPU 利用率、RDMA 链路质量和训练任务异常。
- 按环境(开发 / 预发 / 生产)拆分通知路由。
- 对 P0 告警配置电话、短信或 IM 升级通知。
- 定期导出模板 YAML 做版本留档,并基于实际告警噪音优化阈值和持续时间。
指标告警能发现资源层的异常,但当应用报错、Pod 崩溃或集群调度出现问题时,异常往往先体现在日志或事件中,而不是监控曲线上。单靠指标告警,容易出现“指标正常、业务已故障”的漏报窗口期。
配置集群日志和事件告警后,系统可以在关键错误日志出现或重要事件触发时发送通知,帮助您把问题感知从“事后发现”提前到“实时感知”,缩短排障响应时间。相比纯指标告警,集群日志/事件告警的优势在于:告警信息本身已携带上下文(如具体错误信息、涉及的容器/节点),无需二次查询即可快速定位问题。更多详情,请参见 集群日志/事件告警。 集群在运行过程中会持续产生事件(Event),记录集群状态异常、节点池状态变更、组件状态异常等关键信息。这些事件是判断集群健康状态的重要信号,但集群核心资源事件默认只短期保留,不适合作为长期排障依据。将核心资源事件接入云监控后,您可以在关键事件发生时及时收到通知,并减少事后排查时事件已过期的问题。
将集群核心资源事件接入云监控并配置告警规则后,关键事件一旦触发即可实时通知,不再依赖人工定期巡检或事后查日志。相比日志告警,核心资源事件告警的优势在于:事件由 Kubernetes 控制面直接产生,能捕获应用日志无法反映的集群基础设施层问题,是指标告警和日志告警的有效补充。更多详情,请参见 核心资源事件告警。 最近更新时间:2026.08.25 11:37:05