You need to enable JavaScript to run this app.
文档中心
容器服务

容器服务

复制全文
下载 pdf
诊断与巡检
诊断与巡检概述
复制全文
下载 pdf
诊断与巡检概述
诊断与巡检功能是容器服务提供的集群运维管理保障能力,沉淀了火山引擎内部丰富的 Kubernetes 容器集群运维经验和解决方案,为您带来便捷易用的集群运维管理体验。
功能概述
在原生 Kubernetes 集群中,由于架构复杂且链路长,涵盖了计算节点、网络、存储及各类系统组件。随着业务规模的不断增长,运维团队往往会面临业务突发中断时故障定位困难、底层节点硬件异常人工介入修复慢,以及潜在的集群配置风险难以被及时察觉等痛点。
集群诊断与巡检功能就是为解决上述痛点而提供的一站式解决方案。它将零散的排障动作标准化,打造了涵盖“事前预防、事中自愈、事后定位”的全链路保障体系,帮助您在复杂的集群环境中快速定位问题、自动修复故障并提前规避风险。
诊断与巡检功能可以帮助您解决以下问题:
  • 业务突发故障排查:当业务应用突然无法访问或出现网络延迟时,您可以通过故障诊断功能,快速下钻分析,明确问题究竟出在节点层、容器组(Pod)层还是入口网关(Ingress)层,精准锁定异常来源。
  • 底层基础设施自愈:当节点遭遇 GPU 硬件故障、内核死锁或系统宿主机异常时,系统可以通过检查自愈功能,实现无人值守的自动化隔离与恢复,防止问题节点持续影响业务实例。
  • 集群周期性体检:在业务上线部署前、重大活动保障前或日常例行维护中,您可以通过风险巡检功能,主动排查集群的安全配置规范、资源配额水位等潜在隐患,将问题消灭在发生之前。
故障诊断
故障诊断提供了面向集群资源的快速故障诊断能力,帮助您定位集群资源的常见问题,并给出解决建议。主要包含如下功能。
诊断对象
诊断内容
覆盖了节点池的常见问题。包括:节点池状态、节点池和相关产品配额、节点池弹性伸缩等。
覆盖了节点的常见问题。包括:节点资源、节点内核、节点版本、节点状态、节点网络等。
覆盖了 Pod 的常见问题,包括:Pod 资源、Pod 状态、Pod 镜像等。
帮助用户发现容器服务集群中 Ingress 资源可能存在的风险。包括:Ingress 实例诊断、组件诊断、CLB 诊断等。
检查自愈
在容器集群中,节点作为承载业务的底层基础设施,其运行状态直接决定了应用是否稳定。然而,在实际运维过程中,节点可能会因为底层硬件故障、内核死锁、系统组件异常或 GPU 掉卡等多种原因陷入不可用状态。
如果完全依赖人工排查和处理,不仅响应速度慢,还可能导致业务长时间中断。节点检查与自愈 能够很好地解决这些痛点。它通过“自动化监控 + 自动化修复”的模式,实现对节点问题的早发现、早止血、早修复,将原本需要分钟级的受损时间缩短至秒级,大幅提升系统的鲁棒性。
风险巡检
风险巡检可以帮助用户发现容器服务集群中可能存在的潜在风险和安全性问题,并提供解决建议。方便用户及时发现和修复集群中存在的问题,保障用户业务稳定、安全地运行。主要包含如下功能。
功能分类
巡检对象
巡检内容
集群
检查集群正常、稳定运行所需的必要配置,例如:删除保护、高可用性、审计日志、安全组、CoreDNS 组件等。
节点
检查集群节点状态,及时发现状态异常的节点,保证集群资源可用。
资源水位
检查集群各资源的水位情况,包括:集群水位、节点水位和 Pod 水位等。
资源配额
检查集群各类资源的配额使用情况,包括:CLB 配额、节点配额、节点池配额等。
节点
基于安全要求规范,提供集群节点的安全性巡检,及时发现集群节点中的不安全配置。
Workload、Pod、ConfigMap 等集群资源
基于安全要求规范,结合容器安全最佳实践,及时发现并阻止用户部署的不安全配置,以免应用被攻击或利用,保障用户业务稳定、安全地运行。
检查结果状态说明
集群巡检或诊断后,系统会生成检查报告。报告中检查结果的状态,如下表所示。
状态
说明
通过
通过检查,无需处理。
未通过
存在问题,需尽快处理。防止由于问题引起集群或业务故障。
警告
存在问题,可选择处理。一般需要与集群或业务实际结合分析。
报错
检查异常。可能是服务异常,建议您重试。
最近更新时间:2026.05.26 16:52:26
这个页面对您有帮助吗?
有用
有用
无用
无用