You need to enable JavaScript to run this app.
文档中心
全栈可观测平台

全栈可观测平台

复制全文
下载 pdf
智能运维
智能运维助手概述
复制全文
下载 pdf
智能运维助手概述
智能运维助手是针对 AI 运维提供的全栈监控数据智能运维中枢,主要面向可观测场景,拥有深度领域知识,具备数据查询、基础分析和跨服务综合排查能力。愿景是将顶尖专家智慧沉淀为平台能力,打造一个持续进化的“AI SRE 队友”,最终实现 7x24 小时的自主事件响应与根因分析。
智能运维助手主要承担 AI 原生的智能编排与决策层,通过构建 “连接-诊断-行动-扩展-治理” (Connect -> Diagnose -> Act -> Extend -> Govern) 的完整闭环,系统性解决大规模分布式系统运维的根本痛点。将与企业现有的可观测性平台、事件中心、发布系统和 ChatOps 工具无缝协同,成为驱动整个技术体系可靠性持续提升的核心引擎。
说明
【公测】该功能目前处于公测状态。
功能概述
功能
说明
直接使用自然语言对话方式,描述问题、告警现象和排查目标,调用 Agent 发起一次智能运维任务。
根据自定义提示词、Agent 和执行时间,定期执行的智能运维任务,适用于日常巡检、资源健康状况检查等周期性场景。
将观测经验中沉淀的 Agent 配置到智能运维助手,进行能力扩充,满足按需定制 Agent 的需求。
技能(Skill)是面向特定业务场景封装的标准化能力包,为 Agent 配置技能,能够赋予 Agent 完整作业规范,使其自主识别意图、按流程完成专业任务,具备落地执行能力。
适用范围
目前,AI 应用监控应用性能监控托管 Prometheus云监控 4 款可观测产品已经成功对接智能运维助手,客户端监控云拨测 暂不支持使用智能运维助手。
核心能力
智能运维助手定位为 AI 原生智能编排与决策中枢,不替代存量监控、日志系统,而是作为上层运维大脑,依托连接全域数据(Connect Everything)、理解业务上下文(Understand Context)、自主执行处置(Act Autonomously)动作三大核心能力,覆盖可观测和运维的全流程。
目前提供的工具清单和能力说明如下:
产品
工具
说明
云监控
cloudmonitor__get_metric_data
查询指定指标的时序数据。
cloudmonitor__list_o11y_agent_vpc_endpoints
查询采集插件的终端节点。
cloudmonitor__list_o11y_agent_ecs_process_configs
查询 ECS 进程监控配置。
cloudmonitor__get_o11y_agent_ecs_auto_install
获取 ECS 采集插件自动安装配置。
cloudmonitor__list_o11y_agent_ecs_instances
查询 ECS 采集插件状态。
cloudmonitor__list_o11y_agent_ecs_instance_metadata
查询 ECS 采集插件元信息。
cloudmonitor__cloudmonitor_list_rules
列出告警规则。
cloudmonitor__cloudmonitor_list_rules_by_ids
根据 ID 查询告警规则。
cloudmonitor__cloudmonitor_list_alert_group
查询告警历史。
cloudmonitor__cloudmonitor_list_resource
查询实例元信息。
cloudmonitor__cloudmonitor_list_metric_docs
获取指标文档。
cloudmonitor__cloudmonitor_list_namespaces
获取产品的命名空间列表。
应用性能监控
apmplus__apmplus_server_list_alert_rule
列出告警规则。
apmplus__apmplus_server_list_notify_group
列出通知组。
apmplus__apmplus_server_list_logs
查询服务日志。
apmplus__apmplus_server_query_metrics
PromQL 查询指标。
apmplus__apmplus_server_get_trace_detail
获取 Trace 详情。
apmplus__apmplus_server_list_span
列出 Span。
apmplus__apmplus_server_get_service_topo
查询服务拓扑。
apmplus__apm_server_list_alert_history
列出告警历史。
apmplus__apm_server_list_aggregated_alert_history
聚合告警历史概览。
apmplus__apmplus_server_list_metrics
列出可用指标。
apmplus__apmplus_server_list_genai_sessions
列出 GenAI 会话。
托管 Prometheus
vmp__list_workspaces
列出工作区。
vmp__list_workspace_instance_types
列出实例类型。
vmp__query_metrics
即时查询 PromQL。
vmp__query_range_metrics
范围查询 PromQL。
vmp__query_metric_names
列出指标名称。
vmp__query_metric_labels
列出指标标签。
vmp__query_series
查询时间序列。
容器服务
vke__guide
查看 VKE 使用指南。
vke__get_note
获取参数说明。
vke__list_clusters
列出集群。
vke__list_supported_resource_types
列出支持的资源类型。
vke__list_supported_addons
列出支持的组件。
vke__list_addons
列出已安装组件。
vke__list_node_pools
列出节点池。
vke__list_nodes
列出节点。
vke__list_virtual_nodes
列出虚拟节点。
常用示例
智能运维助支持提供可观测数据查询、产品基础分析和跨服务综合排查等 DevOps 服务,常用示例和执行动作如下:
场景
Prompt 示例
观测数据查询
  • 过去 1 小时 CPU 使用率最高的 5 个实例。
  • 展示 order-service 的 P99 延迟趋势。
  • 帮我查询昨天 23:00 左右的错误日志。
告警排障分析
  • 分析当前告警:order-service 延迟突增。
  • 帮我排查 payment-api 的错误率飙升。
  • 当前告警可能是什么原因?
拓扑分析诊断
  • order-service 依赖哪些下游服务?哪个服务响应最慢?
  • 分析 order-service 服务的调用链路瓶颈。
  • 当前超时问题发生在哪一层?
使用流程
预置 Agent 使用场景
无需进行任务额外配置,直接使用系统预置的 VeOps Agent 进行任务处理。
自定义 Agent 使用场景
  1. 配置技能:将历史观测经验中沉淀的 Skill 上传到智能运维助手。
  1. 配置专家 Agent:自定义 Agent 提示词并添加 Skill。
  1. 使用自定义 Agent:选择自定义配置的专家 Agent 进行任务处理。
最近更新时间:2026.07.24 14:08:26
这个页面对您有帮助吗?
有用
有用
无用
无用