| | |
| | |
| | 统计当前时刻按版本汇总的 Seed Peer 实例数量,反映各版本实例的存活与部署规模。 - 正常情况下,实例数量保持稳定,并与预期部署规模及版本分布一致。
- 如果实例数量异常降低或降为 0,通常代表部分或全部实例不可用,或监控采集异常;建议检查 Pod 运行状态、组件部署副本、版本变更和指标采集目标。
|
| | 统计 Seed Peer 在过去 1 小时按下载类型汇总的流量累计增量,反映不同来源或传输类型的流量分布。 - 正常情况下,累计流量随实际下载负载平稳变化,各类型占比与业务访问模式相符。
- 如果累计流量或类型分布异常突增、突降或偏斜,通常代表下载负载突变、P2P 命中路径变化或回源流量异常;建议检查业务发布节奏、下载类型标签、P2P 链路和源站访问情况。
|
| | 统计当前时刻按 Pod 汇总的 Seed Peer 磁盘总空间及由总空间减已用空间得到的可用空间,反映本地缓存存储容量与使用压力。 - 正常情况下,磁盘总空间保持稳定,可用空间充足且随缓存写入和回收平稳变化。
- 如果可用空间异常降低或磁盘总空间异常变化,通常代表缓存持续增长、回收不及时或挂载容量发生变化;建议检查缓存目录占用、清理策略、磁盘挂载和 Pod 日志。
|
| | 基于过去 5 分钟采样计算 Seed Peer 按 Pod 和下载类型汇总的瞬时下载速率并换算为 bit/s,反映下载链路带宽负载。 - 正常情况下,下载带宽随业务负载平稳变化,不同下载类型的变化与实际任务量相符。
- 如果下载带宽异常升高、降低或剧烈波动,通常代表下载负载突变、链路拥塞、P2P 传输异常或指标采集不连续;建议检查下载任务量、网络带宽、对端连接和组件日志。
|
| | 基于过去 5 分钟采样计算 Seed Peer 按 Pod 汇总的瞬时上传速率并换算为 bit/s,反映对外提供数据的带宽负载。 - 正常情况下,上传带宽随下游请求量平稳变化,并与节点承担的分发任务相符。
- 如果上传带宽异常升高、降低或剧烈波动,通常代表下游请求突变、链路拥塞、数据分发异常或指标采集不连续;建议检查分发任务量、网络带宽、对端连接和组件日志。
|
| | 统计当前时刻按 Pod 汇总的 Seed Peer 并行下载任务数量,反映实时下载并发压力。 - 正常情况下,并行任务数量随业务负载平稳变化,且不会持续累积。
- 如果并行任务数量异常升高或长时间不回落,通常代表请求突增、下载变慢或任务阻塞;建议检查下载队列、网络与磁盘性能、上游服务和组件日志。
|
| | 基于过去 5 分钟采样,统计 Seed Peer 对 0~64 MiB 文件按任务大小分级的下载耗时 P50、P95 和 P99 分位值,反映小文件下载时延分布。 - 正常情况下,各分位耗时保持平稳,高分位与中位数之间无持续扩大。
- 如果下载耗时异常升高或高分位持续恶化,通常代表网络拥塞、对端响应变慢、磁盘 I/O 瓶颈或任务排队;建议检查分位曲线、任务大小分级、网络与磁盘性能和组件日志。
|
| | 基于过去 5 分钟采样,统计 Seed Peer 对 0~64 MiB 文件按任务大小分级的回源请求耗时 P50、P95 和 P99 分位值,反映源站下载时延分布。 - 正常情况下,各分位回源耗时保持平稳,高分位与中位数之间无持续扩大。
- 如果回源耗时异常升高或高分位持续恶化,通常代表源站响应变慢、回源网络拥塞、磁盘 I/O 瓶颈或请求排队;建议检查源站健康状态、回源链路、任务大小分级和组件日志。
|
| | 统计 Seed Peer 在过去 1 分钟按 Pod 汇总的下载任务累计增量,反映短周期下载任务负载。 - 正常情况下,任务增量随业务下载量平稳变化,并与实际镜像拉取活动相符。
- 如果任务增量异常升高、降低或中断,通常代表业务负载突变、下载入口异常或指标采集异常;建议检查镜像拉取事件、Pod 请求分布、组件状态和采集链路。
|
| | 统计 Seed Peer 在过去 1 分钟按 Pod 汇总的下载任务失败累计增量,反映短周期下载失败情况。 - 正常情况下,失败增量保持为 0 或处于较低且稳定的水平。
- 如果失败增量异常升高,通常代表网络、源站、对端节点、磁盘或任务处理链路出现故障;建议检查失败任务日志、网络连通性、源站与对端健康状态和磁盘空间。
|
| | 统计 Seed Peer 在过去 1 分钟按 Pod 汇总的代理请求任务累计增量,反映短周期代理请求负载。 - 正常情况下,请求增量随业务访问量平稳变化,并与实际代理流量相符。
- 如果请求增量异常升高、降低或中断,通常代表业务访问突变、代理入口异常或指标采集异常;建议检查代理请求日志、客户端访问、Pod 状态和采集链路。
|
| | 统计 Seed Peer 在过去 1 分钟按 Pod 汇总的代理请求任务失败累计增量,反映短周期代理请求失败情况。 - 正常情况下,失败增量保持为 0 或处于较低且稳定的水平。
- 如果失败增量异常升高,通常代表代理链路、上游服务、鉴权配置或网络连接出现故障;建议检查失败请求日志、上游可用性、代理配置和网络连通性。
|
| | 统计 Seed Peer 在过去 1 分钟按 Pod 汇总的预取任务累计增量,反映短周期预取负载。 - 正常情况下,任务增量随预取计划平稳变化,并与实际预取活动相符。
- 如果任务增量异常升高、降低或中断,通常代表预取计划突变、任务下发异常或指标采集异常;建议检查预取配置、任务下发记录、Pod 状态和采集链路。
|
| | 统计 Seed Peer 在过去 1 分钟按 Pod 汇总的回源下载请求累计增量,反映短周期源站访问负载。 - 正常情况下,请求增量随业务负载平稳变化,且与 P2P 未命中及回源策略相符。
- 如果请求增量异常升高、降低或中断,通常代表 P2P 命中率变化、业务请求突变、回源策略异常或指标采集异常;建议检查 P2P 命中情况、回源配置、源站访问日志和采集链路。
|
| | 统计 Seed Peer 在过去 1 分钟按 Pod 汇总的回源下载请求失败累计增量,反映短周期源站访问失败情况。 - 正常情况下,失败增量保持为 0 或处于较低且稳定的水平。
- 如果失败增量异常升高,通常代表源站不可用、回源网络故障、鉴权失败或请求超时;建议检查源站健康状态、网络连通性、鉴权配置和失败请求日志。
|
| | 统计当前时刻 Seed Peer 各进程的线程数量,反映进程线程资源使用情况。 - 正常情况下,线程数量保持稳定,并随并发负载在合理范围内平稳变化。
- 如果线程数量异常升高、降低或持续增长,通常代表并发压力突增、线程泄漏、任务阻塞或进程异常;建议检查进程状态、线程栈、任务队列和组件日志。
|
| | 基于过去 1 分钟采样计算 Seed Peer 各 Pod 的平均 CPU 使用率,反映组件计算资源负载。 - 正常情况下,CPU 使用率随业务负载平稳变化,无持续高位或无故突变。
- 如果CPU 使用率异常升高、降低或剧烈波动,通常代表请求突增、计算热点、进程阻塞或实例异常;建议检查 Pod 负载、CPU 限额与节流、热点操作和组件日志。
|
| | 统计当前时刻 Seed Peer 各进程的常驻内存用量,反映组件实际占用的物理内存规模。 - 正常情况下,内存用量保持稳定,并随业务负载在可控范围内变化。
- 如果内存用量异常升高或持续增长,通常代表缓存堆积、内存泄漏、任务积压或负载突增;建议检查 Pod 内存限额、进程内存分析、缓存与任务队列和 OOM 事件。
|
| | 统计当前时刻 Seed Peer 各进程已打开的文件描述符数量,反映文件与网络连接资源占用情况。 - 正常情况下,文件描述符数量保持稳定,并随连接和文件访问量平稳变化。
- 如果文件描述符数量异常升高或持续增长,通常代表连接泄漏、文件句柄未释放或请求积压;建议检查进程 FD 上限、网络连接、文件访问和组件日志。
|
| | |
| | 统计当前时刻按版本汇总的 Peer 实例数量,反映各版本实例的存活与部署规模。 - 正常情况下,实例数量保持稳定,并与预期部署规模及版本分布一致。
- 如果实例数量异常降低或降为 0,通常代表部分或全部实例不可用,或监控采集异常;建议检查 Pod 运行状态、组件部署副本、版本变更和指标采集目标。
|
| | 统计 Peer 在过去 1 小时按下载类型汇总的流量累计增量,反映不同来源或传输类型的流量分布。 - 正常情况下,累计流量随实际下载负载平稳变化,各类型占比与业务访问模式相符。
- 如果累计流量或类型分布异常突增、突降或偏斜,通常代表下载负载突变、P2P 命中路径变化或回源流量异常;建议检查业务发布节奏、下载类型标签、P2P 链路和源站访问情况。
|
| | 统计当前时刻按 Pod 汇总的 Peer 磁盘总空间及由总空间减已用空间得到的可用空间,反映本地缓存存储容量与使用压力。 - 正常情况下,磁盘总空间保持稳定,可用空间充足且随缓存写入和回收平稳变化。
- 如果可用空间异常降低或磁盘总空间异常变化,通常代表缓存持续增长、回收不及时或挂载容量发生变化;建议检查缓存目录占用、清理策略、磁盘挂载和 Pod 日志。
|
| | 基于过去 5 分钟采样计算 Peer 按 Pod 和下载类型汇总的瞬时下载速率并换算为 bit/s,反映下载链路带宽负载。 - 正常情况下,下载带宽随业务负载平稳变化,不同下载类型的变化与实际任务量相符。
- 如果下载带宽异常升高、降低或剧烈波动,通常代表下载负载突变、链路拥塞、P2P 传输异常或指标采集不连续;建议检查下载任务量、网络带宽、对端连接和组件日志。
|
| | 基于过去 5 分钟采样计算 Peer 按 Pod 汇总的瞬时上传速率并换算为 bit/s,反映对外提供数据的带宽负载。 - 正常情况下,上传带宽随下游请求量平稳变化,并与节点承担的分发任务相符。
- 如果上传带宽异常升高、降低或剧烈波动,通常代表下游请求突变、链路拥塞、数据分发异常或指标采集不连续;建议检查分发任务量、网络带宽、对端连接和组件日志。
|
| | 统计当前时刻按 Pod 汇总的 Peer 并行下载任务数量,反映实时下载并发压力。 - 正常情况下,并行任务数量随业务负载平稳变化,且不会持续累积。
- 如果并行任务数量异常升高或长时间不回落,通常代表请求突增、下载变慢或任务阻塞;建议检查下载队列、网络与磁盘性能、上游服务和组件日志。
|
| | 基于过去 5 分钟采样,统计 Peer 对 0~64 MiB 文件按任务大小分级的下载耗时 P50、P95 和 P99 分位值,反映小文件下载时延分布。 - 正常情况下,各分位耗时保持平稳,高分位与中位数之间无持续扩大。
- 如果下载耗时异常升高或高分位持续恶化,通常代表网络拥塞、对端响应变慢、磁盘 I/O 瓶颈或任务排队;建议检查分位曲线、任务大小分级、网络与磁盘性能和组件日志。
|
| | 基于过去 5 分钟采样,统计 Peer 对 0~64 MiB 文件按任务大小分级的回源请求耗时 P50、P95 和 P99 分位值,反映源站下载时延分布。 - 正常情况下,各分位回源耗时保持平稳,高分位与中位数之间无持续扩大。
- 如果回源耗时异常升高或高分位持续恶化,通常代表源站响应变慢、回源网络拥塞、磁盘 I/O 瓶颈或请求排队;建议检查源站健康状态、回源链路、任务大小分级和组件日志。
|
| | 统计 Peer 在过去 1 分钟按 Pod 汇总的下载任务累计增量,反映短周期下载任务负载。 - 正常情况下,任务增量随业务下载量平稳变化,并与实际镜像拉取活动相符。
- 如果任务增量异常升高、降低或中断,通常代表业务负载突变、下载入口异常或指标采集异常;建议检查镜像拉取事件、Pod 请求分布、组件状态和采集链路。
|
| | 统计 Peer 在过去 1 分钟按 Pod 汇总的下载任务失败累计增量,反映短周期下载失败情况。 - 正常情况下,失败增量保持为 0 或处于较低且稳定的水平。
- 如果失败增量异常升高,通常代表网络、源站、对端节点、磁盘或任务处理链路出现故障;建议检查失败任务日志、网络连通性、源站与对端健康状态和磁盘空间。
|
| | 统计 Peer 在过去 1 分钟按 Pod 汇总的代理请求任务累计增量,反映短周期代理请求负载。 - 正常情况下,请求增量随业务访问量平稳变化,并与实际代理流量相符。
- 如果请求增量异常升高、降低或中断,通常代表业务访问突变、代理入口异常或指标采集异常;建议检查代理请求日志、客户端访问、Pod 状态和采集链路。
|
| | 统计 Peer 在过去 1 分钟按 Pod 汇总的代理请求任务失败累计增量,反映短周期代理请求失败情况。 - 正常情况下,失败增量保持为 0 或处于较低且稳定的水平。
- 如果失败增量异常升高,通常代表代理链路、上游服务、鉴权配置或网络连接出现故障;建议检查失败请求日志、上游可用性、代理配置和网络连通性。
|
| | 统计 Peer 在过去 1 分钟按 Pod 汇总的预取任务累计增量,反映短周期预取负载。 - 正常情况下,任务增量随预取计划平稳变化,并与实际预取活动相符。
- 如果任务增量异常升高、降低或中断,通常代表预取计划突变、任务下发异常或指标采集异常;建议检查预取配置、任务下发记录、Pod 状态和采集链路。
|
| | 统计 Peer 在过去 1 分钟按 Pod 汇总的预取任务失败累计增量,反映短周期预取失败情况。 - 正常情况下,失败增量保持为 0 或处于较低且稳定的水平。
- 如果失败增量异常升高,通常代表预取源不可用、网络或磁盘异常、任务参数错误或处理链路故障;建议检查预取任务日志、源站与网络连通性、磁盘空间和预取配置。
|
| | 统计 Peer 在过去 1 分钟按 Pod 汇总的回源下载请求累计增量,反映短周期源站访问负载。 - 正常情况下,请求增量随业务负载平稳变化,且与 P2P 未命中及回源策略相符。
- 如果请求增量异常升高、降低或中断,通常代表 P2P 命中率变化、业务请求突变、回源策略异常或指标采集异常;建议检查 P2P 命中情况、回源配置、源站访问日志和采集链路。
|
| | 统计 Peer 在过去 1 分钟按 Pod 汇总的回源下载请求失败累计增量,反映短周期源站访问失败情况。 - 正常情况下,失败增量保持为 0 或处于较低且稳定的水平。
- 如果失败增量异常升高,通常代表源站不可用、回源网络故障、鉴权失败或请求超时;建议检查源站健康状态、网络连通性、鉴权配置和失败请求日志。
|
| | 统计当前时刻 Peer 各进程的线程数量,反映进程线程资源使用情况。 - 正常情况下,线程数量保持稳定,并随并发负载在合理范围内平稳变化。
- 如果线程数量异常升高、降低或持续增长,通常代表并发压力突增、线程泄漏、任务阻塞或进程异常;建议检查进程状态、线程栈、任务队列和组件日志。
|
| | 基于过去 1 分钟采样计算 Peer 各 Pod 的平均 CPU 使用率,反映组件计算资源负载。 - 正常情况下,CPU 使用率随业务负载平稳变化,无持续高位或无故突变。
- 如果CPU 使用率异常升高、降低或剧烈波动,通常代表请求突增、计算热点、进程阻塞或实例异常;建议检查 Pod 负载、CPU 限额与节流、热点操作和组件日志。
|
| | 统计当前时刻 Peer 各进程的常驻内存用量,反映组件实际占用的物理内存规模。 - 正常情况下,内存用量保持稳定,并随业务负载在可控范围内变化。
- 如果内存用量异常升高或持续增长,通常代表缓存堆积、内存泄漏、任务积压或负载突增;建议检查 Pod 内存限额、进程内存分析、缓存与任务队列和 OOM 事件。
|
| | 统计当前时刻 Peer 各进程已打开的文件描述符数量,反映文件与网络连接资源占用情况。 - 正常情况下,文件描述符数量保持稳定,并随连接和文件访问量平稳变化。
- 如果文件描述符数量异常升高或持续增长,通常代表连接泄漏、文件句柄未释放或请求积压;建议检查进程 FD 上限、网络连接、文件访问和组件日志。
|
| | |
| | 统计当前时刻按版本汇总的 Scheduler 实例数量,反映各版本实例的存活与部署规模。 - 正常情况下,实例数量保持稳定,并与预期部署规模及版本分布一致。
- 如果实例数量异常降低或降为 0,通常代表部分或全部实例不可用,或监控采集异常;建议检查 Pod 运行状态、组件部署副本、版本变更和指标采集目标。
|
| | 统计 Scheduler 在过去 1 分钟按 Pod 和 gRPC 状态码汇总的已处理请求累计增量,反映短周期 gRPC 请求负载与结果分布。 - 正常情况下,请求增量随调度负载平稳变化,成功状态码占主要部分。
- 如果请求增量或错误状态码数量异常升高,通常代表调用量突增、服务处理失败、超时或依赖异常;建议检查 gRPC 状态码分布、调用方请求、Scheduler 日志和依赖服务。
|
| | 统计当前时刻按 Pod 汇总的 Scheduler 并行调度任务数量,反映实时调度并发压力。 - 正常情况下,并行任务数量随业务负载平稳变化,且不会持续累积。
- 如果并行任务数量异常升高或长时间不回落,通常代表调度请求突增、处理变慢或任务阻塞;建议检查调度队列、CPU 与内存资源、下游交互和 Scheduler 日志。
|
| | 统计 Scheduler 在过去 1 分钟按 Pod 汇总的调度注册任务累计增量,反映短周期节点注册负载。 - 正常情况下,任务增量随节点注册活动平稳变化,并与实际节点上线或注册行为相符。
- 如果任务增量异常升高、降低或中断,通常代表节点注册活动突变、注册链路异常或指标采集异常;建议检查节点上线事件、注册请求日志、Scheduler 状态和采集链路。
|
| | 统计 Scheduler 在过去 1 分钟按 Pod 汇总的调度注册任务失败累计增量,反映短周期节点注册失败情况。 - 正常情况下,失败增量保持为 0 或处于较低且稳定的水平。
- 如果失败增量异常升高,通常代表节点信息无效、网络异常、服务处理失败或依赖故障;建议检查注册失败日志、节点参数、网络连通性和依赖服务。
|
| | 统计 Scheduler 在过去 1 分钟按 Pod 汇总的调度任务累计增量,反映短周期任务调度负载。 - 正常情况下,任务增量随下载请求平稳变化,并与实际调度活动相符。
- 如果任务增量异常升高、降低或中断,通常代表调度请求突变、服务处理异常或指标采集异常;建议检查调度请求日志、客户端活动、Scheduler 状态和采集链路。
|
| | 统计 Scheduler 在过去 1 分钟按 Pod 汇总的调度任务失败累计增量,反映短周期任务调度失败情况。 - 正常情况下,失败增量保持为 0 或处于较低且稳定的水平。
- 如果失败增量异常升高,通常代表可用对端不足、调度策略异常、依赖故障或请求参数无效;建议检查调度失败日志、对端节点状态、调度配置和依赖服务。
|
| | 统计 Scheduler 在过去 1 分钟按 Pod 汇总的节点信息上报累计增量,反映短周期节点状态上报负载。 - 正常情况下,上报增量随节点规模和上报周期平稳变化。
- 如果上报增量异常升高、降低或中断,通常代表节点规模突变、上报重试、网络异常或采集异常;建议检查节点状态、上报周期、网络连通性和 Scheduler 日志。
|
| | 统计 Scheduler 在过去 1 分钟按 Pod 汇总的节点信息上报失败累计增量,反映短周期节点状态上报失败情况。 - 正常情况下,失败增量保持为 0 或处于较低且稳定的水平。
- 如果失败增量异常升高,通常代表节点信息无效、网络异常、服务处理失败或依赖故障;建议检查上报失败日志、节点状态、网络连通性和依赖服务。
|
| | 统计 Scheduler 在过去 1 分钟按 Pod 汇总的节点释放信息累计增量,反映短周期节点离开或释放事件负载。 - 正常情况下,事件增量与实际节点下线或释放活动相符,不存在无故突增。
- 如果事件增量异常升高、降低或中断,通常代表节点频繁上下线、释放流程异常或指标采集异常;建议检查节点生命周期事件、释放请求日志、Scheduler 状态和采集链路。
|
| | 统计 Scheduler 在过去 1 分钟按 Pod 汇总的节点释放信息失败累计增量,反映短周期节点离开或释放失败情况。 - 正常情况下,失败增量保持为 0 或处于较低且稳定的水平。
- 如果失败增量异常升高,通常代表节点状态不一致、网络异常、服务处理失败或依赖故障;建议检查释放失败日志、节点状态、网络连通性和依赖服务。
|
| | 统计当前时刻 Scheduler 各进程的 Goroutine 数量,反映 Go 运行时并发任务规模。 - 正常情况下,Goroutine 数量保持稳定,并随调度负载在合理范围内平稳变化。
- 如果Goroutine 数量异常升高、降低或持续增长,通常代表并发压力突增、Goroutine 泄漏、任务阻塞或进程异常;建议检查 Goroutine 堆栈、任务队列、依赖调用和 Scheduler 日志。
|
| | 基于过去 1 分钟采样计算 Scheduler 各 Pod 的平均 CPU 使用率,反映组件计算资源负载。 - 正常情况下,CPU 使用率随调度负载平稳变化,无持续高位或无故突变。
- 如果CPU 使用率异常升高、降低或剧烈波动,通常代表调度请求突增、计算热点、进程阻塞或实例异常;建议检查 Pod 负载、CPU 限额与节流、热点操作和 Scheduler 日志。
|
| | 统计当前时刻 Scheduler 各进程的常驻内存用量,反映组件实际占用的物理内存规模。 - 正常情况下,内存用量保持稳定,并随调度负载在可控范围内变化。
- 如果内存用量异常升高或持续增长,通常代表缓存堆积、内存泄漏、任务积压或负载突增;建议检查 Pod 内存限额、进程内存分析、缓存与任务队列和 OOM 事件。
|
| | 统计当前时刻 Scheduler 各进程已打开的文件描述符数量,反映文件与网络连接资源占用情况。 - 正常情况下,文件描述符数量保持稳定,并随连接和文件访问量平稳变化。
- 如果文件描述符数量异常升高或持续增长,通常代表连接泄漏、文件句柄未释放或请求积压;建议检查进程 FD 上限、网络连接、文件访问和 Scheduler 日志。
|