数据源 | 覆盖能力 | 适合解决的问题 |
应用性能监控 | 服务、指标、Trace、Span、日志、告警、通知组、GenAI 会话 | 服务错误率升高、接口变慢、下游依赖异常、AI 应用调用链分析 |
托管 Prometheus | 即时查询、范围查询、指标名、标签、series、告警、workspace | PromQL 查询、自定义指标分析、Prometheus 告警排查 |
云监控 | namespace、metric、resource、alarm、event | ECS、CLB、RDS 等云资源指标和云监控告警排查 |
日志服务 | project、topic、index、日志搜索、日志直方图 | 错误日志检索、日志趋势分析、高频报错归类 |
容器服务 | Cluster、NodePool、Node、Add-on、Kubeconfig、Namespace、Pod、Deployment、StatefulSet、Service、Event、Pod logs | 集群巡检、Pod 异常、调度失败、镜像拉取失败、容器日志查看 |
角色 | 原来的痛点 | 使用 VeOps CLI 后 |
值班工程师 | 告警后需要在多个系统之间切换,手动拼证据 | 直接描述告警或现象,让 AI 输出时间线、证据和建议动作 |
应用研发 | 定位慢请求和错误链路需要翻指标、日志、Trace | AI 自动把指标、日志、Span、拓扑串起来,缩短定位路径 |
SRE / 运维 | 巡检集群、云资源和告警需要大量重复查询 | 用自然语言触发巡检,生成结构化报告和风险项 |
平台团队 | 用户不熟悉各产品查询入口,排障效率依赖经验 | 把可观测能力统一暴露给通用 Agent,降低使用门槛 |
新同学 | 不知道先查哪个产品、用什么过滤条件 | 通过 Agent 的查询路径学习排障方法,减少上手成本 |
对比维度 | 截图 / 复制粘贴给 AI | VeOps CLI |
数据获取 | 依靠截图和网页文本,字段和格式不可控 | 结构化 JSON envelope,Schema 保证字段名和类型稳定 |
大规模结果 | 上下文窗口溢出,信息被截断或遗漏 | --save-as 落盘,再用 jq 或 python 按字段定向提取,不因上下文溢出丢失关键证据 |
跨产品关联 | 人工在应用性能监控、日志服务、托管 Prometheus 等页面间切换,证据分散 | 统一 operation id 接口,跨 5+ 产品调用,按时间线串联 |
安全性 | Agent 可能误操作或误改云资源配置 | 只读模式,Agent 只能查询,不能修改任何云资源 |
排障质量 | 依赖个人经验和 Agent 的不稳定性 | 固定 Schema 约束查询路径,结果可预期、可复现 |
配置步骤 | Agent 执行动作 |
| 自动识别操作系统和架构,将二进制文件下载到 PATH 内的可写目录中,例如 /usr/local/bin 或 ~/.local/bin。 |
| 探测本地已经安装的 Agent,并向每个 skills 目录中写入 veops-cli Skill。 |
| 提示您使用 veops-cli login 登录,或配置 AK/SK 环境变量。具体操作如下:
说明 其中,凭证存放在 ~/.volcengine/config.json 中,~/.veops-cli/config.yaml 只存放业务偏好。 |
| 自动执行 veops-cli version、veops-cli schema、veops-cli doctor,确认安装结果。 |
命令 | 功能 |
vmp.query | 即时 PromQL 查询 |
vmp.query-range | 区间 PromQL 查询 |
vmp.metric-names | 查询指标名 |
vmp.metric-labels | 查询指标标签 |
vmp.series | 查询时序 |
vmp.alert.rule-list | 查询告警规则列表 |
vmp.alert.rule-get | 查询告警规则详情 |
vmp.alert.history-list | 查询告警历史 |
vmp.workspace.list | 查询工作区列表 |
vmp.workspace.get | 查询工作区详情 |
vmp.workspace.instance-types | 查询工作区规格 |
命令 | 功能 |
apmplus-server.metrics.query-semantic | 查询语义指标 |
apmplus-server.metrics.list | 查询可用指标 |
apmplus-server.metrics.category-list | 查询指标分类 |
apmplus-server.metrics.filter-keys / apmplus-server.metrics.filter-values | 查询指标过滤维度和值 |
apmplus-server.trace.detail | 查询 Trace 详情 |
apmplus-server.trace.log | 查询 Trace 相关日志 |
apmplus-server.span.list | 查询 Span 列表 |
apmplus-server.log.list | 查询应用性能监控的日志 |
apmplus-server.service.list | 查询服务列表 |
apmplus-server.service.topo | 查询服务拓扑 |
apmplus-server.alert.rule-list | 查询告警规则 |
apmplus-server.alert.history-list | 查询告警历史明细 |
apmplus-server.alert.aggregated-history-list | 查询聚合告警历史 |
apmplus-server.notify-group.list | 查询通知组 |
apmplus-server.genai.session-list | 查询 GenAI 会话 |
命令 | 功能 |
cm.namespace.list | 查询云监控命名空间 |
cm.metric.query | 查询云产品指标 |
cm.metric.docs-list | 查询指标文档 |
cm.resource.list | 查询资源元数据 |
cm.resource.filter-fields | 查询资源过滤字段 |
cm.alarm.list | 查询告警规则列表 |
cm.alarm.get | 按 ID 查询告警规则 |
cm.alarm.history-list | 查询告警历史 |
cm.event.list | 查询事件历史 |
cm.event.types-list | 查询事件类型和来源 |
命令 | 功能 |
tls.project.list | 查询日志项目 |
tls.topic.list | 查询日志主题 |
tls.topic.get | 查询 Topic 详情 |
tls.index.get | 查询索引配置 |
tls.search | 搜索日志 |
tls.histogram | 查询日志量直方图 |
命令 | 功能 |
vke.cluster.list | 查询集群列表 |
vke.cluster.get | 查询集群详情 |
vke.nodepool.list | 查询节点池列表 |
vke.nodepool.get | 查询节点池详情 |
vke.node.list | 查询节点列表 |
vke.addon.list | 查询集群插件 |
vke.addon.supported-list | 查询支持的插件列表 |
vke.kubeconfig.list | 查询 kubeconfig |
vke.ns.list | 查询 Kubernetes namespace |
vke.pod.list / vke.pod.get / vke.pod.logs | 查询 Pod 列表、详情和日志 |
vke.deployment.list / vke.deployment.get | 查询 Deployment |
vke.statefulset.list / vke.statefulset.get | 查询 StatefulSet |
vke.service.list / vke.service.get | 查询 Service |
vke.event.list | 查询 Kubernetes 事件 |
命令 | 功能 |
login | 控制台 OAuth 登录(写入临时 STS profile) |
login start / login finish | 两步式远程登录。Agent / SSH / 容器场景首选 |
logout | 清理登录状态 |
doctor | 体检凭证、配置和网络 |
schema --index | 查看全产品 operation 摘要 |
schema <product> | 查看产品级 JSON Schema bundle |
list [product] | 查看 read-only operation 清单 |
config show | 查看本地偏好配置 |
config set | 设置本地偏好配置 |
version | 查看 CLI 版本 |
update --check --json / update --yes | 检查和应用内置发布源更新 |
completion | 生成 Shell 补全脚本 |
目标 | 你能看到什么 |
判断服务是否异常 | 错误率、延迟、吞吐、可用性 |
分析资源瓶颈 | CPU、内存、磁盘、网络、实例维度指标 |
对比发布前后 | 指标是否突增、突降或趋势变差 |
定位异常时间点 | 开始异常的具体时间点(精确到分钟)、是否已经恢复 |
目标 | 你能看到什么 |
搜索错误日志 | error、exception、timeout、panic 等关键词 |
找代表样本 | 高频错误模式、典型堆栈、请求 ID |
看错误趋势 | 某类日志在时间上的分布(日志直方图) |
看上下文 | 某条错误日志前后的请求过程 |
目标 | 你能看到什么 |
了解告警为什么触发 | 规则表达式、阈值、级别、触发对象 |
还原告警时间线 | 开始时间、恢复时间、当前状态 |
查询影响范围 | 关联服务、实例、workspace 或云资源 |
辅助判断严重度 | P0/P1、是否持续触发、是否恢复 |
目标 | 你能看到什么 |
定位慢请求 | 慢 Span、耗时最高的调用环节 |
分析错误链路 | 哪个节点报错、错误是否来自下游 |
查看依赖关系 | 上游、下游、调用方向和影响范围 |
分析 AI 应用链路 | GenAI 会话失败原因,模型调用、工具调用还是业务异常 |
验证根因 | 指标、日志和链路是否指向同一个依赖 |
目标 | 你能看到什么 |
集群巡检 | 集群状态、节点池状态、插件状态 |
节点排查 | 节点和实例关系、节点池归属 |
工作负载与事件 | Pod / Deployment / StatefulSet / Service 状态、重启、Warning Event |
容器日志 | 异常 Pod 的容器日志 |