- 文档首页
容器服务
容器服务 VKE
用户指南
组件管理
监控组件
node-problem-detector
监控组件
node-problem-detector
node-problem-detector
node-problem-detector 组件为集群节点健康监测组件,用于监测和上报节点的异常状态。本文介绍该组件的作用、核心资源以及安装与升级说明。
node-problem-detector(简称为 NPD)组件是容器服务提供的节点健康监测组件,其核心功能如下:
- 采集节点问题:持续监控节点自身的各种潜在问题,例如硬件故障、内核死锁、文件系统只读、容器运行时无响应等。
- 上报异常状态:将底层节点的异常状态暴露给 Kubernetes 上层控制平面,为自动化运维和问题诊断提供了关键的数据来源。包括:
- Node Condition(节点状态):对于影响较为严重的永久性或长期故障(如文件系统损坏),NPD 会更新节点的 Condition,这可能影响 Pod 的调度决策。
- Event(事件):对于临时性或信息性的问题(如内核 OOM),NPD 会创建 Kubernetes 事件,方便管理员追踪问题,但通常不直接影响调度。
在集群中安装组件后,系统会在 kube-system 命名空间下创建如下 Kubernetes 资源。
说明
上表中仅罗列出了该组件的主要资源,以及配置组件或对应功能时可能使用到的资源,方便您了解该组件的主要组成。其他的组件相关资源(例如 ConfigMap、Secret 等)不多做介绍,请以集群中的实际为准。
关于组件的历史发布记录、各版本新增特性及优化说明等信息,详情请参见 组件发布记录。 - 在左侧导航栏中,选择 集群,单击目标集群名称,进入集群管理页面。
- 在左侧导航栏中,选择 组件管理,并选择 监控 页签。
- 将鼠标移动到组件卡片上,单击 部署,配置组件相关参数。
-
组件会不定期发布新版本以提供新特性或修复已知问题。当组件卡片提示有可用更新时,建议您及时进行升级。为确保业务平稳过渡,升级前请尽量安排在业务低峰期执行操作。关于升级的操作步骤和注意事项,请参见 升级组件。 node-problem-detector 组件稳定性和性能直接影响组件功能正常使用和效果,建议您在集群中开启组件观测,帮助您实时掌握组件的健康度。详情请参见 容器服务观测。 容器服务基于 托管 Prometheus(VMP)提供完善的集群监控告警能力,您可以直接使用系统预置模板快速创建告警规则组,也可以基于业务实际需求自定义基于 PromQL 语句的告警规则,或在导出预置模板 YAML 后调整规则并沉淀为自定义告警模板,统一复用于多个集群。详情请参见: 预置告警模板由系统根据常见运维场景预置,适合首次建设告警体系或快速补充基础监控项,帮助您及时发现组件资源不足或运行异常。预置告警模板告警规则详情,请参见 预置告警模板。
最近更新时间:2026.08.19 11:38:05