You need to enable JavaScript to run this app.
文档中心
应用性能监控全链路版

应用性能监控全链路版

复制全文
下载 pdf
使用指南
服务监控
复制全文
下载 pdf
服务监控
服务监控整合了Trace、Metrics、日志、基础监控等和服务有关联的信息,提供了服务列表、全局服务拓扑、服务总览、实例分析等便捷的监控能力。
前提条件
服务指标和链路追踪功能需要应用接入Trace能力。具体请参见 应用接入
全局服务拓扑
全局拓扑可以帮助您快速梳理整体服务架构、上下游调用关系,并且可以实时看到各个服务间调用的成功率,快速发现问题服务。
服务拓扑页面说明:
  • 服务拓扑默认展示树状图,您可以根据需求切换为星状图。
  • 树状图:展示层级的关系,更清晰的查看服务之间的调用顺序和链路。
  • 星状图:展示分组的关系,更直观的了解有几条服务链路。
  • 服务用点
  • 点的大小:服务被调用次数关联,次数越多越大。
  • 点的颜色:服务成功率关联,根据用户在配置中配置的阈值,分别展示为:
  • 绿色:满意
  • 黄色:一般
  • 红色:较差
  • 调用关系用线
  • 红色(较差):用于标记失败率高于50%的调用
  • 单击拓扑图中的节点,右侧将弹出 服务指标详情 面板,展示了该节点的调用 QPS、错误率、延迟等核心指标,并提供以下快捷跳转入口:
服务列表
  • 接入监控的服务,启动后会自动添加到服务列表,也可以在服务启动前手动创建服务信息。
  • 列表展示服务名称、服务类型、运行状态、错误率、QPS、延时、CPU使用率、内存使用率、最近查看时间等信息。所有指标均支持排序。
  • 支持根据服务名称进行关键字搜索。
  • 支持订阅、配置和删除服务。通过配置服务,可以修改采样配置和接口配置,配置相关详细说明参见:参数管理
注意
  • 服务自定义配置的优先级高于参数管理中工作区维度的参数配置,例如:参数管理和服务均配置采样规则时,实际以服务自定义配置的采样规则为准。
  • 服务级别的采样配置仅对当前服务所生成的根跨度(root span)有效。
服务详情
服务详情页面涉及的指标说明:
指标名称
指标
说明
单位
QPS
apminsight.service.trace.called.throughput.rate
服务每秒被调用的次数。
Count/s
请求数
apminsight.service.trace.called.throughput
服务被调用次数。
Count
错误数
apminsight.service.trace.called.error_throughput
服务被调用时的错误次数。
Count
错误率
apminsight.service.trace.called.error_ratio
服务被调用时的错误率。错误率 = 调用下游服务的错误次数 / 调用下游服务的次数。
Ratio
每秒错误数
apminsight.service.trace.called.error_throughput.rate
服务被调用时的每秒错误次数。
Count/s
平均延时
apminsight.service.trace.called.latency.us.avg
服务被调用的延时平均值。
μs
延时 PCT50
apminsight.service.trace.called.latency.us.pct50
服务被调用的延时 PCT50。
μs
延时 PCT90
apminsight.service.trace.called.latency.us.pct90
服务被调用的延时 PCT90。
μs
延时 PCT99
apminsight.service.trace.called.latency.us.pct99
服务被调用的延时 PCT99。
μs
错误日志数
apminsight.service.log.error
服务产生的错误日志数。其中,错误日志指日志级别为"错误"的日志。
Count
每秒错误日志数
apminsight.service.log.error.rate
服务产生的每秒错误日志数。
Count/s
调用下游 QPS
apminsight.service.trace.call.throughput.rate
服务对下游服务的每秒调用次数。
Count/s
调用下游请求数
apminsight.service.trace.call.throughput
服务对下游服务的调用次数。
Count
调用下游错误数
apminsight.service.trace.call.error_throughput
服务调用下游服务的错误次数。
Count
调用下游错误率
apminsight.service.trace.call.error_ratio
服务调用下游服务的错误率。错误率 = 服务被调用时的错误次数 / 服务被调用次数。
Ratio
调用下游每秒错误数
apminsight.service.trace.call.error_throughput.rate
服务调用下游服务的每秒错误次数。
Count/s
调用下游平均延时
apminsight.service.trace.call.latency.us.avg
服务调用下游服务延时的平均值。
μs
调用下游延时 PCT50
apminsight.service.trace.call.latency.us.pct50
服务调用下游服务延时的 PCT50。
μs
调用下游延时 PCT90
apminsight.service.trace.call.latency.us.pct90
服务调用下游服务延时的 PCT90。
μs
调用下游延时 PCT99
apminsight.service.trace.call.latency.us.pct99
服务调用下游服务延时的 PCT99。
μs
服务总览
通过服务总览可以快速获取当前服务最关键的监控指标,帮助您确定是否存在调用过多、失败率过高、延迟过高等问题。包括如下指标:
说明
大模型相关指标仅在 AI 应用的服务总览中展示。
  • 调用概览:请求数、错误数、响应耗时、大模型调用次数、Token 消耗总数、大模型调用平均延时。其中,单击图表左上角跳转按钮,支持跳转到当前服务相关 Trace 分析页面,时间范围与当前看板范围一致。
  • 大模型指标:大模型调用 QPS、大模型调用次数、Token 数、大模型调用延时、TTFT、TPOT。
  • 请求指标:请求 QPS、请求数、HTTP 状态码分布、HTTP 状态码请求数。其中,单击图表中的数据链接,支持跳转到当前服务相关 Trace 分析页面,时间范围与当前看板范围一致。
  • 延迟指标:平均延时、延时 PCT50、延时 PCT90、延时 PCT99。其中,单击图表中的数据链接,支持跳转到当前服务相关 Trace 分析页面,时间范围与当前看板范围一致。
  • 错误指标:错误数、错误率、每秒错误数。其中,单击图表中的数据链接,支持跳转到当前服务相关 Trace 分析页面,时间范围与当前看板范围一致。
  • 日志指标:错误日志数、每秒错误日志数。其中,单击图表左上角跳转按钮,支持跳转到当前服务相关 Trace 分析页面,时间范围与当前看板范围一致。
  • 容器指标:服务 CPU 使用比例、CPU 使用量、服务内存使用比例、内存使用量。
  • 接口排行:接口请求 Top5、接口错误数 Top5、接口耗时 Top5。
拓扑分析
服务拓扑
接口拓扑
通过服务拓扑可以查看当前服务的全链路调用情况,支持按全拓扑(默认)、上游拓扑、下游拓扑或固定层级方式查看。
  • 单击拓扑图中的节点,右侧将弹出 服务指标详情 面板,展示了该节点的调用 QPS、错误率、延迟等核心指标,并提供以下快捷跳转入口:
  • 支持根据节点错误率展示对应颜色,帮助快速识别服务健康状态。颜色与错误率阈值的对应关系如下:
  • 颜色
    健康状态
    错误率区间(默认)
    绿色
    满意
    小于 10%
    黄色
    一般
    10%~50%
    红色
    红色
    大于 50%
  • 支持自定义调整,配置步骤如下:
  1. 单击右上角的 配置 > 修改设置
  1. 拖动阈值控制项,调整不同错误率区间对应的颜色范围。
  1. 保存配置后,查看节点颜色和图例是否同步更新。
说明
服务详情页中的错误阈值配置优先级高于工作区的配置,仅对当前服务生效。如需统一调整,请前往 参数管理 修改。
  • 支持按指标配置节点的颜色映射规则,帮助快速识别异常节点,缩短服务巡检与故障定位路径。配置项主要包括展示指标、区间模式、阈值区间和颜色样式。
  • 配置项
    说明
    展示指标
    支持选择 QPS、错误率、平均延迟、PCT50 延迟、PCT90 延迟、PCT9 延迟等指标。拓扑节点颜色按当前所选指标计算。
    区间模式
    支持 自动自定义 两种模式。自动模式由系统划分区间,自定义模式由用户手动输入临界值。
    阈值区间
    定义不同颜色对应的数值范围。各区间须保持连续且递增,系统会进行校验。
    颜色设置
    支持单击区间色块修改颜色,也可以通过 HEX 值输入精确配置。
  • 配置步骤如下:
  1. 在页面左下角选择指标。
  1. 单击页面右下角的 配置
  1. 选择区间模式为 自定义,输入各区间临界值,并按需调整对应颜色。
实例分析
说明
若未采集到进程启动时间,将显示为 -
实例分析统计实例所归属的服务 Pod、主机、容器等信息并进行监控。资源排行展示 实例 CPU 资源 Top 5 以及 实例内存资源 Top 5;实例列表支持查看当前运行中的实例,提供实例所属主机、实例状态、实例错误率、实例平均 QPS、实例延迟 PCT90 等核心指标。
  • 单击主机名称,可查看详细的主机监控看板,提供 CPU、内存、磁盘、负载等多个监控指标,例如:CPU 使用率、CPU 监控、过去 15 分钟平均负载、内存可用、内存使用、磁盘空间使用比例、IO 延迟、进程内存占用分布等。
  • 单击目标实例操作列中的 查看详情,可查看实例的基础信息以及监控指标。包含概览、容器指标、进程指标、RED 指标、运行时监控、连接池监控、线程池监控。
  • 概览:包含数据概览、实例概览以及 Container 列表,数据概览展示请求数、错误数、平均耗时等指标。单击 Container 列表操作列的 容器监控,可进入 容器指标 页查看该实例所属容器的指标数据。
  • 容器指标:包含数据概览、Container 列表以及容器看板。容器看板展示容器的 CPU 使用率、内存使用率、写 IO 吞吐量、写 IO QPS 以及 FD 线程数量等指标。
  • 进程指标:展示 CPU、内存、文件数、上下文切换等指标。
  • RED 指标:展示请求数、响应耗时、请求 QPS、状态码分布、错误数、错误率、平均延时、延时PCT90、接口请求 TOP5、接口耗时 TOP5 等指标。
  • 运行时监控:展示 JVM 监控指标、Go Runtime 监控指标、Python Runtime 监控相关指标,例如:GC 次数、GC 耗时、内存使用率、堆内存使用详情、堆内存提交详情、缓冲区使用详情、cgo 调用次数、HeapAlloc等。
  • 连接池监控:展示最大连接数、活跃连接数、空闲连接数、最小空闲连接数、最大空闲连接数、阻塞连接数等指标。
  • 线程池监控:展示最大线程数、核心线程数、活跃线程数、线程池大小、线程池任务数、拒绝任务数等指标。
接口监控
Image
通过接口监控,可以看到服务所有接口列表,并支持在所选时间段内根据QPS、总体错误率、时延PCT90进行排序,并且可以看到所选接口核心指标趋势图。
  • 调用指标:QPS、请求数
  • 错误指标:错误率、错误数、每秒错误数
  • 耗时指标:响应耗时均值和分位值
单击接口列表中的接口,可以快速下钻到接口调用详情检索页面,同时可以针对耗时进行排序过滤快速定位慢查询,针对状态码进行过滤快速定位错误查询。
Image
单击TraceID可以查看Trace详情,并高亮显示所选Span信息。
Image
上下游调用
Image
通过上下游监控,可以看到服务所有上下游调用服务和接口列表,并展示所选时间段内平均QPS、总体错误率、时延PCT90,并且可以看到所选调用核心指标趋势图。
  • 调用指标:QPS、请求数
  • 错误指标:错误率、错误数、每秒错误数
  • 耗时指标:响应耗时均值和分位值
单击调用接口和调用服务,可以快速下钻到接口调用详情检索页面。
日志分析
Image
日志分析为服务日志提供了聚类和列表两种分析方式查找相应的日志。通过日志过滤和搜索日志功能,可以更好的查询日志。
运行时监控
Java 运行时指标
针对Java应用服务提供了服务视角的运行时核心指标监控,包括指标:已使用堆内存、已使用非堆内存、已使用堆内存-Top10进程、已使用非堆内存-Top10进程、NewGen Size、NewGen Size Top10进程、OldGen Size、OldGenSize-Top10进程、GC次数、GC时间、类加载数量、线程数量、线程数量Top10进程。
Image
Java线程池的指标说明:
指标名
指标
说明
单位
Java线程池-空闲线程数量
apminsight.service.pool.idle.count
空闲线程数量。由PoolSize-ActiveCount获得。
-
Java线程池-最大线程数
apminsight.service.pool.max.size
线程池允许的最大线程数。
-
Java线程池-等待任务数
apminsight.service.pool.queue.size
线程池中的等待任务队列长度。
-
Java线程池-活跃线程数
apminsight.service.pool.active.count
正在执行任务的线程数量。
-
Java线程池-线程核心数
apminsight.service.pool.core.size
线程核心数。
-
Java线程池-执行任务数
apminsight.service.pool.task.count
线程池运行的任务数数量总和。
-
Java线程池-当前大小
apminsight.service.pool.size
当前线程池中的线程数。
-
JVM的指标说明:
指标名
指标
说明
单位
JVM最大非堆内存
apminsight.service.performance.jvm.max_noheap
JVM最大非堆内存。
Byte
JVM内存池-已使用OldGen
apminsight.service.performance.jvm.used_oldgen
JVM内存池-已使用OldGen。
Byte
JVM内存池-最大MetaSpace
apminsight.service.performance.jvm.max_meta_space
JVM内存池-最大MetaSpace。
Byte
JVM内存池-初始PermGen
apminsight.service.performance.jvm.init_perm_gen
JVM内存池-初始PermGen。
Byte
JVM内存池-已提交PermGen
apminsight.service.performance.jvm.committed_perm_gen
JVM内存池-已提交PermGen。
Byte
JVM峰值线程数
apminsight.service.performance.jvm.peak_count
JVM峰值线程数。
-
JVM总计加载类数量
apminsight.service.performance.jvm.total_loaded_class_count
JVM总计加载类数量。
-
JVM已提交堆内存
apminsight.service.performance.jvm.committed_heap
JVM已提交堆内存。
Byte
JVM内存池-已使用CodeCache
apminsight.service.performance.jvm.used_code_cache
JVM内存池-已使用CodeCache。
Byte
JVM内存池-已提交MetaSpace
apminsight.service.performance.jvm.committed_meta_space
JVM内存池-已提交MetaSpace。
Byte
JVM守护线程数
apminsight.service.performance.jvm.daemon_count
JVM守护线程数。
-
JVM当前加载类数量
apminsight.service.performance.jvm.loaded_class_count
JVM当前加载类数量。
-
JVM GC次数-OldGen
apminsight.service.performance.jvm.gc_count_old
JVM GC次数-OldGen。
-
JVM已使用堆内存
apminsight.service.performance.jvm.used_heap
JVM已使用堆内存。
Byte
JVM内存池-最大NewGen
apminsight.service.performance.jvm.max_newgen
JVM内存池-最大NewGen。
Byte
JVM可运行线程数
apminsight.service.performance.jvm.runnable_state_thread_count
JVM可运行线程数。
-
JVM内存池-初始MetaSpace
apminsight.service.performance.jvm.init_meta_space
JVM内存池-初始MetaSpace。
Byte
JVM GC时间-NewGen
apminsight.service.performance.jvm.gc_time_new
JVM GC时间-NewGen。
ms
JVM初始非堆内存
apminsight.service.performance.jvm.init_noheap
JVM初始非堆内存。
Byte
JVM已提交非堆内存
apminsight.service.performance.jvm.committed_noheap
JVM已提交非堆内存。
Byte
JVM内存池-最大CodeCache
apminsight.service.performance.jvm.max_code_cache
JVM内存池-最大CodeCache。
Byte
JVM内存池-初始NewGen
apminsight.service.performance.jvm.init_newgen
JVM内存池-初始NewGen。
Byte
JVM内存池-已使用NewGen
apminsight.service.performance.jvm.used_newgen
JVM内存池-已使用NewGen。
Byte
JVM内存池-已提交NewGen
apminsight.service.performance.jvm.committed_newgen
JVM内存池-已提交NewGen。
Byte
JVM存活线程数
apminsight.service.performance.jvm.live_count
JVM存活线程数。
-
JVM阻塞线程数
apminsight.service.performance.jvm.blocked_state_thread_count
JVM阻塞线程数。
-
JVM总计已卸载类数量
apminsight.service.performance.jvm.total_unloaded_class_count
JVM总计已卸载类数量。
-
JVM初始堆内存
apminsight.service.performance.jvm.init_heap
JVM初始堆内存。
Byte
JVM内存池-初始CodeCache
apminsight.service.performance.jvm.init_code_cache
JVM内存池-初始CodeCache。
Byte
JVM内存池-最大OldGen
apminsight.service.performance.jvm.max_oldgen
JVM内存池-最大OldGen。
Byte
JVM内存池-已提交Survivor
apminsight.service.performance.jvm.committed_survivor
JVM内存池-已提交Survivor。
Byte
JVM等待线程数
apminsight.service.performance.jvm.waiting_state_thread_count
JVM等待线程数。
-
JVM已使用非堆内存
apminsight.service.performance.jvm.used_noheap
JVM已使用非堆内存。
Byte
JVM内存池-已提交OldGen
apminsight.service.performance.jvm.committed_oldgen
JVM内存池-已提交OldGen。
Byte
JVM内存池-已使用Survivor
apminsight.service.performance.jvm.used_survivor
JVM内存池-已使用Survivor。
Byte
JVM内存池-已使用MetaSpace
apminsight.service.performance.jvm.used_meta_space
JVM内存池-已使用MetaSpace。
Byte
JVM内存池-已使用PermGen
apminsight.service.performance.jvm.used_perm_gen
JVM内存池-已使用PermGen。
Byte
JVM内存池-初始OldGen
apminsight.service.performance.jvm.init_oldgen
JVM内存池-初始OldGen。
Byte
JVM内存池-初始Survivor
apminsight.service.performance.jvm.init_survivor
JVM内存池-初始Survivor。
Byte
JVM内存池-最大Survivor
apminsight.service.performance.jvm.max_survivor
JVM内存池-最大Survivor。
Byte
JVM内存池-最大PermGen
apminsight.service.performance.jvm.max_perm_gen
JVM内存池-最大PermGen。
Byte
JVM GC时间-OldGen
apminsight.service.performance.jvm.gc_time_old
JVM GC时间-OldGen。
ms
JVM GC次数-NewGen
apminsight.service.performance.jvm.gc_count_new
JVM GC次数-NewGen。
-
JVM最大堆内存
apminsight.service.performance.jvm.max_heap
JVM最大堆内存。
Byte
JVM内存池-最大CodeCache
apminsight.service.performance.jvm.committed_code_cache
JVM内存池-最大CodeCache。
Byte
JVM定时等待线程数
apminsight.service.performance.jvm.timed_waiting_state_thread_count
JVM定时等待线程数。
-
Golang 运行时指标
针对Go应用服务提供了指标:goRoutine数量、goRoutine数量-Top10进程、GC次数、GC次数-Top10进程、GC总耗时、GC总耗时-Top10进程、单次GC耗时-MAX/AVG/MIN、单次耗时-PCT、cgo调用次数、cgo调用次数-Top10进程、HeapAlloc、HeapAlloc-Top10进程、HeapSys、HeapSys-Top10进程、HeapIdle、HeapIdle-Top10进程、HeapInuse、HeapInuse-Top10进程、HeapReleased、HeapReleased-Top10进程、HeapObject、HeapObject-Top10进程。
Image
goruntime的指标说明:
指标名
指标
说明
单位
goroutine数量
apminsight.runtime.go.routine.num
goroutine的数量。
-
cgo调用次数
apminsight.runtime.go.cgo.call_count
调用cgo的次数。
-
GC次数
apminsight.runtime.go.gc.count
GC次数。
-
两次采样之间的GC耗时
apminsight.runtime.go.gc.cost_total.us
两次采样之间一次或多次GC占用的时间之和,采样间隔30s。
μs
单次GC耗时
apminsight.runtime.go.gc.cost_distribute.us
单次GC的耗时。
μs
HeapAlloc
apminsight.runtime.go.mem_stats.heap_alloc
分配在Heap上的对象占用的内存大小。
Byte
HeapSys
apminsight.runtime.go.mem_stats.heap_sys
Heap的虚拟内存空间大小。
Byte
HeapIdle
apminsight.runtime.go.mem_stats.heap_idle
空闲的heap spans的内存大小。空闲span是指span中不包含对象。
Byte
HeapInuse
apminsight.runtime.go.mem_stats.heap_inuse
使用中的heap spans的内存大小。使用中的span是指span其中至少包含有一个对象。
Byte
HeapReleased
apminsight.runtime.go.mem_stats.heap_released
归还给操作系统的物理内存大小。
Byte
HeapObjets
apminsight.runtime.go.mem_stats.heap_objects
Heap中的对象个数。
-
runtime指针查找数
apminsight.runtime.go.mem_stats.lookups.count
runtime指针查找数。
-
StackInuse
apminsight.runtime.go.mem_stats.stack_inuse
使用中的stack spans的内存大小。使用中的span是指span其中至少包含有一个对象。
Byte
StackSys
apminsight.runtime.go.mem_stats.stack_sys
stack从OS获得的内存大小。
Byte
MSpanInuse
apminsight.runtime.go.mem_stats.m_span_inuse
使用中的MSpans的内存大小。MSpan存放runtime与内存管理相关的对象。
Byte
MSpanSys
apminsight.runtime.go.mem_stats.m_span_sys
MSpans从OS获得的内存大小。MSpan存放runtime与内存管理相关的对象。
Byte
MCacheInuse
apminsight.runtime.go.mem_stats.m_cache_inuse
使用中的MCache的内存大小。MCache存放runtime与内存管理相关的对象。
Byte
MCacheSys
apminsight.runtime.go.mem_stats.m_cache_sys
MCache从OS获得的内存大小。MCache存放runtime与内存管理相关的对象。
Byte
BuckHashSys
apminsight.runtime.go.mem_stats.buck_hash_sys
BucketHash占用的内存大小。BucketHash存放profiling相关的数据结构。
Byte
GcSys
apminsight.runtime.go.mem_stats.gc_sys
GC相关的元数据占用的内存大小。
Byte
OtherSys
apminsight.runtime.go.mem_stats.other_sys
其他runtime内部数据结构占用的内存大小。
Byte
GC后期望的堆大小
apminsight.runtime.go.mem_stats.next_gc
GC后期望的heap大小。
Byte
强制GC数量
apminsight.runtime.go.mem_stats.forced_gc.num
应用程序调用GC方法发起的GC次数。
-
GC占用的CPU比例
apminsight.runtime.go.mem_stats.gc_cpu_fraction
从程序启动至今,GC使用的CPU时间占比。
%
存活的对象数
apminsight.runtime.go.mem_stats.live_objects
heap中存活的对象数。
-
HeapRetained
apminsight.runtime.go.mem_stats.heap_retained
可以归还给OS但是runtime保留的内存大小,再次分配内存时可以避免从OS申请。计算方式为HeapIdle-HeapReleased。
Byte
HeapFragment
apminsight.runtime.go.mem_stats.heap_fragment
内存碎片大小,计算方式为HeapInuse-HeapAlloc。
Byte
Python 运行时指标
针对 Python 应用服务提供了指标:CPU耗时、CPU使用率、内存使用、GC对象数量、线程数量、上下文切换数量。
Python runtime的指标说明:
指标名
指标
说明
单位
CPU耗时
process_runtime_cpython_cpu_time
应用程序消耗的 CPU 时间,分用户态和内核态统计。
s
CPU使用率
process_runtime_cpython_cpu_utilization
应用程序 CPU 使用率,可能大于 100%
%
内存使用
process_runtime_cpython_memory
应用程序内存占用,分 RSS(Resident Set Size)和 VMS(Virtual Memory Size) 统计。
Byte
GC对象数量
process_runtime_cpython_gc_count
垃圾计数器每一代自上次垃圾回收后新增的对象数量,分第 0、1、2 代统计
-
线程数量
process_runtime_cpython_thread_count
应用程序的线程数量。
-
上下文切换数量
process_runtime_cpython_context_switches
上下文切换的次数,分 Involuntary 和 Voluntary 统计。
-
错误分析Image
通过错误分析,可以直观的看出系统中存在的各类型的接口错误及其在各维度的分布,同时也可以查看系统中存在的各类异常,并且数据与Trace链路数据打通,便于查看错误和异常的上下文,分析、解决系统中存在的接口错误和异常。
SQL分析
Image
SQL分析展示该服务产生的所有SQL查询,可以查看SQL请求趋势,去掉参数后的SQLPattern列表,以及每种pattern的上报量、失败占比和平均响应耗时。
单击SQLPattern可以查看所有符合该pattern的经过脱敏的原始sql。
最近更新时间:2026.09.15 11:34:48
这个页面对您有帮助吗?
有用
有用
无用
无用