You need to enable JavaScript to run this app.
文档中心
容器服务

容器服务

复制全文
下载 pdf
集群观测
容器服务观测
复制全文
下载 pdf
容器服务观测
容器服务观测允许您监控容器服务集群的基础资源和工作状态。本文为您介绍如何配置容器服务观测功能。
前提条件
已开启云原生观测功能,详情请参见 开启观测
操作步骤
步骤一:开启观测
  1. 在左侧导航栏单击 集群,找到目标集群,单击集群名称。
  1. 在集群管理页面的左侧导航栏中,单击 观测配置
  1. 选择 容器服务 卡片,单击 启用,开启容器服务集群观测。
  • alt
  1. 系统自动检查开启集群观测所需的必要条件。包括:工作区配置、组件状态等。
  • alt
  1. 单击 开启,开启容器服务集群观测。
步骤二:配置采集规则
容器服务集群监控开启后,您可以配置采集规则,选择需要采集的目标组件、具体指标项及采集间隔。可以根据实际需求丢弃一些不用的指标。
  1. 在集群管理页面的左侧导航栏中,单击 观测配置
  1. 选择 容器服务 卡片,单击 编辑配置 并选择 指标 页签,配置采集规则,并选择具体的采集指标。
  • 在组件列表 操作 列,单击开关,开启或关闭组件的采集规则。当关闭组件的采集规则时,系统不会采该集组件的所有指标。
  • alt
说明
仅支持管理系统默认的采集规则和指标项。不支持管理使用 ServiceMonitor/PodMonitor 等方式配置的自定义采集规则和指标项。
  • 单击组件列表 操作 栏中的 alt,支持选择或丢弃组件的具体指标、面向该组件的采集间隔和指标 Relabel。
  • 采集间隔 中,选择该组件指标的采集间隔。不同组件支持的采集间隔不同。
  • 指标列表 中,勾选指标,则采集该指标。取消勾选,则丢弃该指标。单击 全部基础指标其他指标 页签,允许基于指标类型对指标项进行筛选。
说明
  • 调整指标采集间隔的影响如下,请按需调整:
  • 减小采集间隔:增加单位时间内上报的指标数量,提升监控精度,但 VMP 标准版工作区的费用会增加。
  • 增加采集间隔:减少单位时间内上报的指标数量,降低 VMP 标准版工作区的费用,但监控精度会降低。
  • 云产品的指标类型分为 基础指标其他指标,不同类型指标的计费方式不同,详情请参见 托管 Prometheus 计费方式
  • metricRelabelings 中,单击 添加规则,配置指标 Relabel 规则。允许在指标完成采集后、写入存储前,对每条指标的标签执行改写操作。常见用途包括修改标签值、新增标签或重命名标签,便于在查询时统一标签口径。更多详情介绍,请参见 指标 Relabel
  • 序号
    功能
    对应 YAML 字段
    说明
    操作类型
    action
    对指标执行的操作类型,当前仅支持 replace,字面意思为“替换”,实际生效逻辑如下:
    • 如果target_labelsource_labels的值一致,则表示覆盖source_label
    • 如果target_label定义的 key 不存在,则会默认创建新的 label。
    源标签
    sourceLabels
    指定一个或多个来源标签,多个标签之间用|分隔。系统将读取这些标签的值进行匹配或提取。
    正则表达式
    regex
    用于匹配源标签值的正则表达式。
    • 默认为(.*),表示匹配任意值。
    • 支持使用捕获组,如(.+)提取部分内容。
    替换值
    replacement
    匹配成功后写入目标标签的值。
    • 默认为$1,表示取正则第一个捕获组的内容。
    • 支持填入固定字符串。
    目标标签
    targetLabel
    将处理结果写入的目标标签名称。
    • 若目标标签已存在,则覆盖其原有值。
    • 若目标标签不存在,则新增该标签。
  1. 单击 确定,完成配置。
步骤三:配置告警
您可以基于预置的告警模板,快速完成容器服务集群观测的告警配置。
  1. 在集群管理页面的左侧导航栏中,单击 观测配置
  1. 选择 容器服务 卡片,单击 编辑配置 并选择 告警 页签,配置告警的相关参数。
  • alt
  • 配置项
    说明
    告警模板
    单击开启需要的告警模板。
    告警聚合策略
    在下拉菜单中选择告警聚合策略。详情请参见 创建告警聚合策略
    告警通知策略
    在下拉菜单中选择告警通知策略。系统会使用通知策略中配置的告警等级和联系人组,将告警发送给指定的联系人。详情请参见 创建告警通知策略
说明
  • 除了直接使用预置告警模板配置告警规则,您可以自定义模板中的配置,或直接使用 PromQL 语句配置告警规则。详情请参见 告警配置概述
  • 预置告警规则模板的详情,包括规则说明、PromQL 配置和常见告警处理流程。请参见 预置告警模板
  1. 单击 确定,完成配置。
集群观测看板
说明
预置看板中为您提供监控数据同比对照、复制看板语句等功能,详情请参见 使用看板
集群监控
该看板用于查看集群整体的监控信息,包括:集群节点信息(节点数量、未就绪节点数)、集群内存信息(内存使用量、内存使用率)、集群 CPU 信息(CPU 使用量、CPU 使用率)等。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 集群监控 > 集群监控概览,即可查看监控看板。
alt
集群 Namespace 监控
该看板用于查看集群命名空间维度的监控信息,包括:命名空间内 NotReady 状态的 Deploment、Statefulset、DaemonSet 数量,命名空间内的内存使用、CPU 使用和 PVC 使用信息。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 集群监控 > 集群 Namespace 监控,即可查看监控看板。
alt
节点观测看板
节点概览
该看板用于查看节点的概览信息,包括:节点内存使用率、节点 CPU 使用率、节点磁盘使用率等。支持同时选择多个节点,满足节点资源使用情况对比。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 节点监控 > 节点概览,即可查看监控大盘。
alt
节点详情监控
该看板用于查看指定节点的监控信息,包括:节点内存信息(内存使用量、内存使用率)、节点 CPU 信息(CPU 使用量、CPU 使用率、CPU 负载)、磁盘信息(磁盘使用率、磁盘读写 IOPS)等。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 节点监控 > 节点详情监控,即可查看监控看板。
alt
虚拟节点监控
该看板用于查看集群虚拟节点的监控信息,包括:虚拟节点内存信息(内存总量、内存使用率)、虚拟节点 CPU 信息(CPU 总数、CPU 使用率)、虚拟节点 GPU 信息(GPU 总数、GPU 使用率)等。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 节点监控 > 虚拟节点监控,即可查看监控看板。
alt
工作负载观测看板
无状态负载监控
该看板用于查看指定命名空间下无状态负载的监控信息,包括:实例信息(期望实例数、就绪实例数、就绪比例)、CPU 信息(CPU Request、CPU Limits)、内存信息(内存 Request、内存 Limits)、网络信息、磁盘信息等。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 工作负载监控 > 无状态负载监控,即可查看监控大盘。
alt
有状态负载监控
该看板用于查看指定命名空间下有状态负载的监控信息,包括:实例信息(期望实例数、就绪实例数、就绪比例)、CPU 信息(CPU Request、CPU Limits)、内存信息(内存 Request、内存 Limits)、网络信息、磁盘信息等。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 工作负载监控 > 有状态负载监控,即可查看监控大盘。
alt
守护进程监控
该看板用于查看指定命名空间下守护进程的监控信息,包括:CPU 信息(CPU Request、CPU Limits)、内存信息(内存 Request、内存 Limits)、网络信息、磁盘信息等。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 工作负载监控 > 守护进程监控,即可查看监控大盘。
alt
容器组监控
该看板用于查看指定命名空间下容器组(Pod)的监控信息,包括:Pod 内存信息(内存使用量、内存使用率)、Pod CPU 信息(CPU 使用量、CPU 使用率)、Pod 网络信息(流入速率、流出速率)等。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 工作负载监控 > 容器组监控,即可查看监控看板。
alt
说明
您可以查看单个容器组的监控信息,也可以选择 All,查看全部容器组的监控信息。
容器监控
该看板用于查看指定命名空间下容器(Container)的监控信息,包括:Container 内存信息(内存使用量、内存使用率)、Container CPU 信息(CPU 使用量、CPU 使用率)等。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 工作负载监控 > 容器监控,即可查看监控看板。
alt
说明
您可以查看单个 Container 的监控信息,也可以选择 All,查看所有 Container 的监控信息。
弹性伸缩监控
该看板用于查看命名空间下所有或指定 Pod 的 HPA 监控信息,包括:HPA 预期副本数、HPA 当前副本数等。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 工作负载监控 > 弹性伸缩监控,即可查看监控大盘。
alt
智能伸缩监控
该看板用于查看命名空间下 IHPA 的监控信息,包括:副本数、CPU 使用量、内存使用量等。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 工作负载监控 > 智能伸缩监控,即可查看监控大盘。
alt
存储观测看板
存储卷声明监控
该看板用于查看命名空间下所有或指定 PVC 的监控信息,包括:容量使用率和 inode 使用率。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 存储服务监控 > 存储卷声明监控,即可查看监控大盘。
alt
核心组件观测看板
metrics-server 监控
该看板用于查看核心组件 metrics-server 的观测指标。支持设置查询的时间段,并指定刷新方式(手动刷新、自动刷新)。
  1. 在集群管理页面的左侧导航栏中,选择 监控中心 > 监控看板
  1. 在左侧看板列表中选择 核心组件监控 > metrics-server 监控,即可查看监控看板。
  • metrics-server 监控看板详细的图表说明,如下表所示。
说明
图表对应 PromQL 语句的获取方式,请参见 使用看板
  • 图表名称
    单位
    图表说明
    Overview / 一屏总览
    节点数
    集群当前纳入 metrics-server 监控的节点数量,反映节点指标的采集覆盖情况。
    • 正常情况下,节点数应与集群实际节点数保持一致,并随节点增减变化。
    • 如果节点数明显少于实际节点数或突然下降,通常代表部分节点指标未被正常采集,建议检查节点状态、Kubelet 可用性及组件抓取日志。
    容器数
    集群当前纳入 metrics-server 监控的容器数量,反映容器指标的采集覆盖情况。
    • 正常情况下,容器数应随工作负载规模变化,并与集群实际运行的容器数量基本一致。
    • 如果容器数异常下降或与实际规模明显不符,通常代表部分容器指标未被正常采集,建议检查相关节点、Pod 状态及组件抓取日志。
    Kubelet QPS
    次/秒
    metrics-server 每秒向 kubelet 发起的请求数(基于过去 5 分钟数据计算),反映组件的抓取请求负载。
    • 正常情况下,请求数应随节点规模和抓取频率平稳变化。
    • 如果请求数持续异常升高,通常代表抓取频率过高、节点规模快速增长或发生重复请求;如果异常下降,可能存在抓取中断,建议检查组件配置、节点规模及抓取日志。
    抓取成功率
    %
    kubelet 抓取成功率(基于过去 5 分钟数据计算),反映节点指标采集的可靠性。
    • 正常情况下,抓取成功率应接近 100%。
    • 如果成功率持续下降,通常代表部分 kubelet 请求失败,可能导致节点或容器指标缺失,建议检查 kubelet 状态、网络连通性、证书及权限配置。
    抓取 P99 耗时
    s
    metrics-server 向 kubelet 发起一轮抓取与写入流程的 P99 分位值,反映单轮指标抓取的尾部延迟。
    • 正常情况下,抓取 P99 耗时应保持平稳,且低于组件的抓取周期。
    • 如果 P99 持续升高,通常代表部分节点抓取变慢,可能导致指标更新延迟,建议检查 kubelet 响应耗时、网络质量及组件资源使用情况。
    指标新鲜度
    s
    已采集指标与当前时间之间的平均间隔,反映指标数据的新鲜程度。
    • 正常情况下,指标新鲜度应小于抓取周期。
    • 如果该值持续升高,并大于抓取周期。通常代表指标更新不及时,可能由抓取延迟或失败引起,建议结合抓取成功率、抓取耗时及 kubelet 状态进一步排查。
    Storage & API / 资源与核心状态
    存储点数趋势
    按节点和容器类型展示纳入 metrics-server 监控的资源变化趋势,反映组件当前保存的指标数据规模。
    • 正常情况下,节点和容器存储点数应随集群规模平稳变化,并分别与实际节点数和容器数基本一致。
    • 如果某类存储点数突然下降或长时间不更新,通常代表对应指标采集或存储异常,建议检查节点、容器状态及组件日志。
    抓取耗时
    s
    平均抓取耗时和 P99 耗时(基于过去 5 分钟数据计算),反映整体抓取效率及尾部延迟。
    • 正常情况下,平均耗时和 P99 应保持平稳,且 P99 通常高于平均值。
    • 如果平均耗时或 P99 持续升高,通常代表指标抓取整体或部分节点变慢,建议检查 kubelet 响应耗时、网络质量及组件资源使用情况。
    指标新鲜度趋势
    s
    指标新鲜度的变化趋势,并以 15 秒作为参考线,反映指标更新是否及时。
    • 正常情况下,指标新鲜度应保持平稳,并尽量低于 15 秒参考线。
    • 如果指标新鲜度持续高于参考线或不断升高,通常代表指标更新出现延迟,建议结合抓取成功率、抓取耗时及 kubelet 状态进一步排查。
    Kubelet / 外部依赖
    Kubelet 请求量
    次/秒
    按成功和失败结果展示每秒 kubelet 请求数(基于过去 5 分钟数据计算),反映抓取请求量及结果分布。
    • 正常情况下,请求量应随节点规模平稳变化,且成功请求应占主要部分。
    • 如果失败请求持续增加或总请求量异常波动,通常代表 kubelet 访问异常或抓取负载发生变化,建议检查网络连通性、kubelet 状态及组件抓取日志。
    Kubelet 请求延迟
    s
    kubelet 请求耗时样本展示平均值和 P99 分位值(基于过去 5 分钟数据计算),反映请求处理效率及尾部延迟。
    • 正常情况下,平均延迟和 P99 应保持平稳,且 P99 通常高于平均值。
    • 如果平均延迟或 P99 持续升高,通常代表部分 kubelet 响应变慢,可能影响指标采集时效,建议检查节点负载、kubelet 状态及网络质量。
    最近一次抓取延迟
    s
    按节点展示距最近一次 kubelet 抓取请求的时间间隔,反映各节点抓取任务是否持续运行。
    • 正常情况下,各节点的最近一次抓取延迟应接近配置的抓取周期,并保持平稳。
    • 如果某个节点的延迟持续升高,通常代表该节点长时间未被成功抓取,建议检查节点状态、kubelet 可用性及网络连通性。
    Kubelet 请求成功率趋势
    %
    kubelet 请求成功率变化趋势(基于过去 5 分钟数据计算),反映节点指标抓取的稳定性。
    • 正常情况下,请求成功率应长期接近 100%,且曲线保持平稳。
    • 如果成功率持续下降或频繁波动,通常代表 Kubelet 请求出现异常,可能导致指标缺失或延迟,建议检查 kubelet 状态、网络连通性、证书及权限配置。
查看指标
  • 如需查询集群中的已接入/未接入指标,或查询指标的具体含义,请参见 指标查询
  • 支持使用托管 Prometheus 的 Explore 功能来快速查询和展示指标数据。详情请参见 指标查询
最近更新时间:2026.09.09 15:43:57
这个页面对您有帮助吗?
有用
有用
无用
无用