托管 Prometheus 支持通过工作区的 Federate 端点抓取指定的时间序列,实现多 Prometheus 服务的数据聚合。本文介绍如何获取工作区的 Federate 端点并抓取时间序列。
Federate 端点允许 Prometheus 服务从另一个 Prometheus 服务中抓取选定的时间序列,以此来实现多 Prometheus 服务的数据聚合。实现可扩展的 Prometheus 监控系统。
分层联合允许 Prometheus 扩展到具有数十个数据中心和数百万个节点的环境。在此场景下,联合拓扑类似于一棵树结构,较高级别的 Prometheus 服务器从大量下属 Prometheus 服务中收集聚合的时间序列数据。
例如,用户可能包含许多每个数据中心,每个数据中心均配备单独 Prometheus 服务。它们会非常详细地收集本地数据中心的数据(细化到实例级别)。还有一组全局的 Promethues 服务,这些全局服务仅从那些本地服务中收集并存储聚合数据(细化到任务级别)。这样便提供了一个聚合的全局视角以及详细的本地视角。
在跨服务联邦场景中,一个 Prometheus 服务被配置为从另一个 Prometheus 服务抓取选定的数据,以便在统一的服务中针对两个数据集进行查询和报警。
例如,运行多个服务的容器服务集群可能会公开集群上基础资源的使用情况信息(如内存和 CPU 使用情况)。另一方面,在该集群上运行的服务将仅公开应用程序的特定服务指标。通常,这两组指标由单独的 Prometheus 服务抓取。使用跨服务联邦后,将集群指标的数据和应用程序的指标进行聚合,方便用户通过这两组指标来共同衡量基础设施和应用的健康情况。
- 已创建托管 Prometheus 工作区。详情请参见 创建工作区。
- 已获取其他 Prometheus 实例的 Federate API 地址。
使用 Federate 端点导出指标时,不支持导出存储时长 15 天工作区中的 云产品基础指标(即免费指标)。详情请参见 按量计费。 - 在左侧导航栏中选择 接入中心 > 组件,单击 Prometheus Federation,配置接入任务。
-
- 配置采集器的部署环境。选择 VKE 环境,并选择关联集群。
-
-
配置完成后,您可以查看任务状态和任务详情。确定目标任务是否正常。
- 选择 VKE 环境 页签。在任务列表中,可以查看接入任务的状态。
接入任务创建完成后,支持以下运维操作:
- 单击 任务名称,进入任务详情页面,支持查看接入任务详情。
- 单击 操作 列的 编辑,支持编辑指定的接入任务。
- 单击 操作 列的 暂停任务,支持暂停指定的接入任务。
- 单击 操作 列的 删除,支持删除指定的接入任务。
在左侧导航栏中选择 Explore,可以使用up查看接入任务中采集 Job 的状态。本例中为up{job="staticScrape/vmp-system/federation-ead***"}。当该指标的值为 1 时,表示采集器已创建完成并工作正常。
您可以使用托管 Prometheus 的 Explore 功能来快速查询和展示指标数据。详情请参见 指标查询。
您可以在容器服务集群或 ECS 主机中自建 Grafana,并通过 Grafana 查看指标和创建大盘。
您可以在托管 Prometheus 的告警中心配置监控对象的相关告警。详情请参见 创建告警规则。