指标 | 说明 |
请求数 | 指定时间范围内所选 ArkClaw 发起的完整端到端请求次数。用于反映负载规模、流量波动趋势,是评估系统承载能力的基础指标。 |
请求数趋势 | 指定时间范围内所选 ArkClaw 发起的完整端到端请求次数趋势分布。通过图表形式可视化展示请求流量随时间的演变规律,直观反映业务负载波动情况,可用于识别业务高峰与低谷、监控流量异常波动,提前规划资源扩容或缩容。 |
请求平均耗时 | 指定时间范围内所选 ArkClaw 发起的请求平均耗时。用于衡量端到端请求的整体响应效率,反映从请求发起到结果返回的全链路性能表现。 |
请求平均耗时趋势 | 指定时间范围内所选 ArkClaw 发起的请求平均耗时趋势分布。通过图表形式可视化展示端到端响应时间随时间的变化趋势,反映全链路性能的长期演变,可用于定位性能退化问题、验证性能优化效果、预警性能风险等。 |
请求 P99 耗时 | 指定时间范围内所选 ArkClaw 发起的请求 P99 耗时。用于衡量系统在高负载下的尾部性能与用户体验下限,是评估服务稳定性和响应质量的关键指标,反映极端场景下的全链路性能表现。 |
请求 P99 耗时趋势 | 指定时间范围内所选 ArkClaw 发起的请求 P99 耗时趋势。通过图表形式可视化展示请求尾部耗时随时间的变化规律,反映系统长期稳定性与极端性能演变趋势,可用于定位性能退化、评估压测效果、预警高延迟风险,保障用户体验的一致性。 |
网关启动次数 | 指定时间范围内所选 ArkClaw 的启动次数总数。用于反映网关实例的稳定性和自愈能力,评估运维操作对服务可用性的影响。 |
网关启动分布 | 指定时间范围内所选 ArkClaw 的启动次数分布情况。通过图表形式可视化展示网关重启、启动的频率与分布特征,反映系统稳定性与运维操作节奏,可用于评估系统稳定性、分析运维影响、优化自愈策略等。 |
指标 | 说明 |
CPU 使用率 Top 50 | 指定时间范围内所选 ArkClaw 中平均 CPU 使用率排名前 50 的 ArkClaw 实例。用于识别计算资源消耗最高的实例,精准定位算力瓶颈,保障核心业务算力供给,预防 CPU 过载引发的响应延迟与服务中断。 |
内存使用率 Top 50 | 指定时间范围内所选 ArkClaw 中平均内存使用率排名前 50 的 ArkClaw 实例。可用于优化内存资源结构,深度剖析内存泄漏与资源耗尽风险,从根源上规避 OOM 导致的实例崩溃,保障实例运行的稳定性与效率。 |
磁盘 IOPS (读) Top 50 | 指定时间范围内所选 ArkClaw 中磁盘 IOPS 排名前 50 的 ArkClaw 实例。呈现磁盘读取请求最密集的实例,定位存储 IO 处理能力上限,可用于预警磁盘 IOPS 资源耗尽风险,保障数据时效性。 |
磁盘 IO 带宽 (读) Top 50 | 指定时间范围内所选 ArkClaw 中磁盘 IO 带宽排名前 50 的 ArkClaw 实例。洞察磁盘读取流量最高的实例,评估存储链路带宽承载压力,确保存储网络传输链路的健康运行,可用于优化网络架构配置,提升数据访问的速度与可靠性。 |
指标 | 说明 |
工具执行次数 | 指定时间范围内所选 ArkClaw 实际调用工具执行总次数。用于体现工具层调用规模和业务依赖度,可用于评估工具层对整体业务的支撑强度。 |
工具执行 Top50 | 指定时间范围内所选 ArkClaw 实际调用工具执行次数排行前 50 的工具。不仅可用于定位高频调用的核心工具,直观体现工具层的业务依赖结构、核心生产力工具与流量分布,而且可用于评估工具业务价值,优先保障核心工具的稳定性与性能优化。 |
工具执行错误次数 | 指定时间范围内所选 ArkClaw 实际调用工具执行报错次数。用于衡量工具执行环节的可靠性,反映工具服务本身、网络通信或参数传递等环节的异常情况。 |
工具执行错误次数 Top50 | 指定时间范围内所选 ArkClaw 实际调用工具执行报错次数排行前 50 的工具。不仅可用于定位错误高发的问题工具,快速锁定故障核心源头,衡量工具执行环节的可靠性与健康度,而且可用于快速缩小故障排查范围,提升排障效率,保障工具层服务可用性。 |
工具执行平均耗时 | 指定时间范围内所选 ArkClaw 实际调用工具执行的平均耗时。用于衡量工具执行环节的性能效率,是拆解端到端请求耗时的关键子指标。 |
工具执行平均耗时趋势 | 指定时间范围内所选 ArkClaw 实际调用工具执行的平均耗时趋势。展示工具执行性能随时间的演变规律,反映工具层的长期性能健康度与负载变化,可用于定位性能退化与瓶颈,验证性能优化效果,预警性能风险,拆解端到端请求耗时以精准定位问题层级,同时为工具层容量规划、资源调度、限流策略提供数据支撑,保障工具层响应效率与使用体验。 |
指标 | 说明 |
Agent 数量 | 指定时间范围内所选 ArkClaw 产生数据交互的 Agent 总数。反映 ArkClaw 服务覆盖的 Agent 生态规模,体现接入 Agent 实例的活跃程度,可用于评估业务覆盖范围与生态活跃度,衡量 ArkClaw 的业务渗透力。 |
Agent 调用次数 | 指定时间范围内所选 ArkClaw 调用总次数。反映 ArkClaw 对 Agent 的调度强度,可用于分析业务流量,为资源扩容、限流策略提供数据支撑。 |
Agent 调用平均耗时 | 指定时间范围内所选 ArkClaw 调用平均耗时。衡量 Agent 调用环节的响应效率,反映从发起调用到 Agent 返回结果的全链路性能表现。 |
Agent 调用次数渠道分布 | 指定时间范围内所选 ArkClaw 调用的渠道分布情况。展示不同渠道的调用占比,反映流量来源结构,可用于分析各渠道流量贡献度,识别核心渠道与边缘渠道,为渠道运营、资源分配提供依据。 |
Agent 调用次数渠道排行 Top 5 | 指定时间范围内所选 ArkClaw 调用排行前 5 的渠道。聚焦流量占比最高的核心渠道,不仅可以用于定位核心业务入口,保障高占比渠道的稳定性与性能优先级,而且能够针对性优化核心渠道的体验与资源配置,提升整体业务可用性。 |
Agent 调用平均耗时趋势 | 指定时间范围内所选 ArkClaw 调用平均耗时趋势情况。展示耗时随时间的变化规律,反映性能波动与长期演进趋势,不仅可以用于识别耗时突增 / 突降的时间点,关联版本发布、运维操作或外部事件,定位性能变化根因,而且能够预测未来性能走向,提前规划资源扩容或性能优化方案,避免性能恶化。 |
LLM 调用成功率 | 指定时间范围内所选 ArkClaw 调用大模型的成功率。用于衡量大模型调用环节的服务可靠性与链路稳定性,反映从发起请求到模型返回有效结果的整体健康度。 |
LLM 调用成功率趋势 | 指定时间范围内所选 ArkClaw 调用大模型成功率的趋势。通过图表形式可视化展示大模型调用成功率随时间的波动情况,反映模型服务稳定性与链路健康度的长期演变,可用于识别服务故障、版本变更影响或网络异常。 |
指标 | 说明 |
消息数量 | 指定时间范围内所选 ArkClaw 产生对话的消息总数。用于反映对话业务的整体负载规模,是评估消息处理能力的基础计数指标。 |
消息处理成功率 | 指定时间范围内所选 ArkClaw 的消息处理成功率,用于衡量 ArkClaw 实例的服务可用性和稳定性,配合消息排队平均长度、消息处理平均时长等指标,能够快速排障定位。其中,消息处理成功率 = 消息处理成功数 / 消息处理总数 * 100%。 |
消息处理平均耗时 | 指定时间范围内所选 ArkClaw 的消息处理平均时长,用于衡量消息从接收至完成的平均处理时间,直接反映等待时间和使用体验。此外,作为服务可用性指标,可用于考核是否满足约定响应时间,例如:P95/P99 延迟。 |
消息排队平均长度 | 指定时间范围内所选 ArkClaw 内等待处理的消息数量,用于衡量消息处理拥堵程度,反映服务处理能力与请求量的匹配度。 |
消息来源分布 | 指定时间范围内所选 ArkClaw 的消息发送来源分布情况。用于展示不同消息发送来源的占比结构,反映消息发起主体的分布特征,可以识别核心消息来源群体,而且能够评估不同来源的业务贡献度,指导产品运营策略、优先级排序。 |
消息渠道分布 | 指定时间范围内所选 ArkClaw 的消息发送渠道分布情况。用于展示不同消息发送渠道的占比结构,反映消息流量的入口分布。 |
指标 | 说明 |
卡顿会话数 | 指定时间范围内所选 ArkClaw 出现卡顿的会话数量。反映会话体验中卡顿异常的发生规模,可用于量化使用体验质量,是衡量使用体验受损程度的基础计数指标。 |
卡顿会话平均耗时 | 指定时间范围内所选 ArkClaw 出现卡顿会话平均耗时情况。衡量单次卡顿会话的持续时长,反映卡顿对使用体验的影响。 |
会话状态分布趋势 | 指定时间范围内所选 ArkClaw 的会话状态分布情况。展示会话的状态流转,反映系统整体健康度与异常波动,不仅可以快速识别异常状态占比突变,而且能够评估运维操作、流量波动对会话状态的影响。 |