全栈可观测平台
功能模块 | 功能名称 | 功能说明 | 发布地域 | 相关文档 |
AI 应用监控 | AI 应用洞察 | 面向会话数据提供智能分析能力,通过系统预置的洞察规则对指定范围内的会话进行批量分析。适用于会话满意度分析、任务完成度判断、异常会话筛查等场景。 | 全部 | |
集成中心 | 集成 AI 应用 | 提供多种 AI 应用接入方案,支持基于基础参数一键生成安装命令,简化 AI 应用接入流程,方便快速构建 AI 应用全链路可观测体系。 目前支持的 AI 应用包括:Codex、Claude、Cursor、OpenCode、OpenClaw、DeepSeek Harness、Hermes。 | 全部 | |
集成中心 | 主机探针 | 探针管理新增支持安装和管理主机探针。 | 全部 | 探针管理 |
集成中心 | 探针管理 | 独立提供探针安装页面,方便快速安装火山引擎 VKE 探针、三方云容器探针和主机探针。 | 全部 | 探针管理 |
集成中心 | 集成三方云中的服务端应用 | 多云集成新增支持将 AWS 和自建 Kubernetes 中的服务端应用接入到应用性能监控,进行数据采集和探针管理。 | 全部 |
功能模块 | 功能名称 | 功能说明 | 发布地域 | 相关文档 |
AI 应用监控 | LLM Trace 分析 | 针对 AI 应用中的大模型调用链路,提供用户反馈和筛选功能。支持用户对单链路进行点赞或点踩标注,实现基于用户反馈的模型效果持续评估与问题归因。 | 全部 | |
AI 应用监控 | Playground | Playground 支持构造多轮对话、调整 Prompt 与模型参数、模拟工具调用及约束输出格式,并即时运行查看结果。适用于线上 Badcase 复盘、Prompt 调优、模型选型、参数调优、工具调用调试及结构化输出验证等场景。 | 全部 | |
集成中心 | 多云集成任务和探针管理 | 提供多云集成能力,支持将腾讯云、华为云或阿里云中的服务端应用接入到应用性能监控中,进行数据采集和探针管理。 | 全部 | |
集成中心 | 探针配置修改 | 容器 VKE 环境中的探针支持部署配置修改,包括:部署方式、实例个数、CPU 请求/上限、内存请求/上限。 | 全部 | 探针管理 |
告警中心 | 告警配置统一管理 | 全栈可观测平台的告警中心将所有可观测产品的告警配置收敛,进行统一管理,有助于平台侧持续建设告警治理、规则审计、策略优化和告警运营能力,提升整体可观测体系的可维护性和扩展性。
| 全部 | |
告警中心 | 导入/导出告警规则 | 针对云监控、云产品事件、托管 Prometheus、应用性能监控产品的告警规则提供导入/导出功能,主要用于告警配置跨账号、地域、项目或工作区快速同步,实现高效复用。 | 全部 | |
告警中心 | 导入/导出告警模板 | 针对云监控、托管 Prometheus、应用性能监控产品的告警模板提供导入/导出功能,主要用于告警配置跨账号、地域、项目或工作区快速同步,实现高效复用。 | 全部 | |
告警中心 | 告警概览 | 告警概览汇聚云监控、托管 Prometheus、应用性能监控全产品线告警数据,既能直观掌握整体故障风险水平与告警来源,又能通过告警趋势识别告警爆发节点与变化规律。 | 全部 | 告警概览 |
告警中心 | 告警事件 | 告警成功触发后,系统将记录告警状态、触发条件、告警时间等告警事件信息,方便回溯和故障排查。 | 全部 | 告警事件 |
告警中心 | 通知历史 | 告警成功触发后,系统不仅会记录通知消息内容、通知时间、通知结果等通知历史信息,而且会记录告警屏蔽信息,方便回溯和故障排查。 | 全部 | 通知历史 |
告警中心 | 按联系人聚合告警事件 | 通知策略支持将告警事件按照联系人聚合并统一发送通知消息,可大幅减少通知数量,适用于不重要但数量多的告警事件。 | 全部 |
功能模块 | 功能名称 | 功能说明 | 发布地域 | 相关文档 |
智能运维 | 自动化 | 新增自动化任务,支持配置定时执行的观测任务,适用于日常巡检、资源健康状况检查等周期性场景。 | 全部 | |
智能运维 | 专家 Agent 和技能 | 允许将观测经验中沉淀的技能和 Agent 配置到智能运维助手,进行能力扩充。 | 全部 | |
集成中心 | 集成中心正式发布 | 集成中心是全栈可观测平台面向多源异构指标、日志、链路数据采集的管控中心,旨在提供可视化开箱即用的数据采集配置、采集任务管理、采集探针管理等功能,大幅度降低数据采集和可观测入门门槛。 首次发布提供服务端应用集成、集成任务管理和探针管理功能。 | 全部 | |
指标中心 | 指标管理 | 指标管理是全栈可观测平台提供的可视化指标检索页面,支持根据产品、时间,以及指标类型、属性分类等条件快速查找指标。 | 全部 | 指标管理 |
智能运维 | VeOps CLI 可观测排障助手 | VeOps CLI 是一套面向 AI Agent 的可观测排障工具,将应用性能监控、托管 Prometheus、云监控、日志服务、容器服务,以及本地日志、指标分析功能整理成通用 Agent 可以稳定调用的命令行。 | 全部 | |
自定义看板 | 数据转换 | 新增从计算添加字段(Add field from calculation)、归约(Reduce)、按正则重命名字段(Rename fields by regex)、分组聚合(Group by)、时间序列转行(Series to rows) 5 种数据转换策略。 | 全部 | 数据转换 |
自定义看板 | 版本管理 | 新增版本管理功能,允许创建、对比和回退自定义看板的版本,记录每一次改动并规范自定义看板的更新流程,避免多人协作时相互覆盖的情况。 | 全部 | 版本管理 |
告警中心 | 告警中心正式发布 | 告警中心是全栈可观测平台针对所有可观测产品提供的统一告警管理模块,不仅将告警和通知相关配置数据进行归一化处理,而且提供统一的告警规则管理入口。打破各可观测产品之间的告警配置孤岛,同时为提升整体可观测体系的规范性和可维护性奠定基础。 | 全部 |
功能模块 | 功能名称 | 功能说明 | 发布地域 | 相关文档 |
智能运维助手 | 智能运维助手公测发布 | 【公测】智能运维助手首次公测发布,针对 AI 运维提供的全栈监控数据智能运维中枢,主要面向可观测场景,拥有深度领域知识,具备数据查询、基础分析和跨服务综合排查能力。 | 全部 | |
AgentKit 应用观测 | 洞察看板 | 优化 AgentKit 洞察看板,新增用量分析和性能分析相关关键指标的监控看板。 | 全部 | 洞察大盘 |
AI 应用监控 | 会话诊断 | 针对 AI 应用提供会话诊断,支持临时使用当前会话的 Trace 和 Session 数据进行诊断分析,并给出详细的诊断报告。 | 全部 | |
AgentKit 应用观测 | 会话诊断 | 针对 AgentKit 应用提供会话诊断,支持临时使用当前会话的 Trace 和 Session 数据进行诊断分析,并给出详细的诊断报告。 | 全部 | |
应用性能监控 | AI Agent 应用接入 | 通过插件方式将 OpenClaw、Hermes、Claude Code 接入到 APMPlus,进行链路监控。 | 全部 | |
AI 应用监控 | 会话调用链数据导出 | LLM 会话分析和 AgentKit 会话分析支持导出目标会话的调用链详细信息。 | 全部 | |
自定义看板 | 新增柱状图和文本图表 | 自定义看板新增柱状图、文本类型的图表,满足不同场景的使用需求。 | 全部 | 图表设置 |
自定义看板 | 时序图支持配置展示名 | 时序图的 Overrides 配置中,支持为指标配置展示名。 | 全部 | 图表设置 |
AI 应用监控 | 会话数据导出 | LLM 会话分析和 AgentKit 会话分析支持根据实际需求导出会话数据。 | 全部 |
功能模块 | 功能名称 | 功能说明 | 发布地域 | 相关文档 |
通用 | Root Span 列表展示 | Trace 分析新增 Root Span 列表,主要展示当前筛选范围内所有 Root Span 相关 Trace,并展示 Trace 相关详细信息。 | 全部 |
模块 | 功能名称 | 描述 | 发布地域 | 相关文档 |
AI 应用监控 | Trace 诊断 | 使用 AgentLens 对单个 AI Trace 进行智能分析,并提供详细的诊断报告,报告内容涵盖:核心运行数据统计、问题摘要、输入输出概览、执行流程分析、深度诊断结果。 | 全部 | |
AI 应用监控 | 在线 Trace 导出 | 将 Trace 数据批量导出至智能体平台的评测集,并基于评测集中的 Trace 样本直接发起评测实验,实现从线上真实数据到评测验证的闭环,提升可观测平台诊断能力的准确性与可靠性。 | 华北 2 (北京) 华东 2 (上海) | |
AgentKit 应用监控 | 洞察大盘新增会话看板 | 针对 AgentKit 中所有会话提供的分析看板,可视化展示会话相关数据和趋势。目前提供活跃会话数量趋势、平均会话 Event 数趋势、平均会话 Token 消耗数趋势。 | 全部 | 洞察大盘 |
模块 | 功能名称 | 描述 | 发布地域 | 相关文档 |
应用性能监控 | OpenClaw 观测 | APMPlus 率先支持接收 diagnostics-otel 插件上报的数据,并提供开箱即用的 OpenClaw 监控看板。 | 全部 | |
自定义看板 | 饼图和条形计量图 | 图表设置新增支持饼图和条形计量图,以满足不同场景的使用需求。 | 全部 | 图表设置 |
自定义看板 | Metrics 数据源 | 数据查询新增支持 Metrics 数据源,使用 Metrics 数据源时,支持查询 OpenTSDB 和 InfulxDB 两种协议的指标数据。 | 全部 | 数据查询 |
自定义看板 | 数据链接 | 时序图支持配置数据链接,方便快速跳转到指定页面。 | 全部 | 链接配置 |
模块 | 功能名称 | 描述 | 发布地域 | 相关文档 |
AgentKit 应用监控 | 预置告警模板 | 系统为 AgentKit 中的智能体运行时、工具等资源提供预置告警模板,方便快速创建告警任务,实时关注服务的健康状况。 | 全部 | 告警管理 |
AI 应用监控 | 多模态内容展示 | 针对多模态场景,前往单链路详情的 LLM 数据页签,Input 和 Output 中支持 Markdown 和多模态信息展示。 | 全部 | |
AgentKit 应用监控 | 工具分析 | 针对沙箱工具提供详细数据监控,支持查看工具调用数、错误率、平均响应时间等关键指标。 | 全部 | 工具分析 |
AgentKit 应用监控 | 运行时监控 | 运行时详情提供运行时监控看板,可查看指定时间内当前运行时的资源消耗情况。包括:CPU 耗时、CPU 使用率、内存使用、GC 对象数量、线程数量、上下文切换数量。 | 全部 |
模块 | 功能名称 | 描述 | 发布地域 | 相关文档 |
自定义看板 | 预置看板 | 针对特定场景预置的观测看板,提供开箱即用的可观测能力。 | 全部 | 预置看板 |
AI 应用监控 | Trace 分析中展示 tool 信息 | AI 相关 Trace 分析页面的 LLM 数据中,支持支持展示 tool 相关信息。 | 全部 | |
AgentKit 应用监控 | 洞察大盘 | 针对 AgentKit 提供单独的洞察大盘,支持 AgentKit 总览和 Agent 相关数据的统计和趋势分析,方便健康度检查、性能优化和异常检测等。 | 全部 | 洞察大盘 |
AgentKit 应用监控 | 知识库分析 | 新增知识库分析,支持监控 API 调用次数、平均延时、总错误率等知识检测数据。 | 全部 | |
AgentKit 应用监控 | 记忆库分析 | 新增支持 Viking 类型记忆库的 Memory 分析。 | 全部 |
模块 | 功能名称 | 描述 | 发布地域 | 相关文档 |
AI 应用监控 | LLM Trace 分析 | 针对 AI 通用应用监控提供独立 Trace 分析页面,有助于故障排查、性能优化和系统监控,提高运维效率。 | 全部 | |
AI 应用监控 | 分位数图表展示优化 | 针对模型请求耗时分位数、TTFT 分位数、TPOT 分位数图表,增加 P99/P90/P75/P50 指标筛选。 | 全部 | |
通用 | 全栈可观测平台首次发布 | 全栈可观测平台首次发布,聚合 AI 应用监控、应用性能监控、托管 Prometheus、云监控、客户端监控和云拨测在内的多个独立产品,并整合自定义看板、告警中心、集成中心等通用模块,提供一个便捷可观测门户。 | 全部 | 无 |