You need to enable JavaScript to run this app.
文档中心
托管 Prometheus

托管 Prometheus

复制全文
下载 pdf
接入指南
Ray 接入
复制全文
下载 pdf
Ray 接入
托管 Prometheus 支持监控部署在容器服务(VKE)集群中的 Ray 实例。
背景信息
分布式计算框架 Ray,由加州大学伯克利分校 RISELab 开发。它为机器学习和大数据处理相关程序提供了用户并行处理的计算层,降低了大规模端到端机器学习工作流的开发难度。
您可以使用托管 Prometheus 对部署在容器服务(VKE)集群中的 Ray 实例进行监控,监控其集群节点资源使用(CPU/GPU/内存)、任务执行延迟与成功率、Actor 状态、分布式存储性能等指标,优化分布式训练、强化学习等任务的运行效率与可靠性。并能够实现关键指标的预警与优化。
前提条件
  • 托管 Prometheus
  • 已创建托管 Prometheus 工作区,详情请参见 创建工作区
  • 容器服务
  • 已注册并开通容器服务。
  • 已在集群中部署 Ray 实例。
  • 已在集群中开启云原生观测功能,并安装 prometheus-agent 组件,详情请参见 开启观测
说明
托管 Prometheus 工作区和 VKE 集群必须处于相同地域。
操作步骤
配置接入任务
  1. 登录 VMP 服务控制台
  1. 在顶部导航栏,选择目标地域。
  1. 在左侧导航栏中选择 接入中心 > 组件,单击 Ray,配置接入任务。
  1. 配置采集器的部署环境。选择 VKE 环境,并选择关联集群。
  1. 单击 创建接入任务,配置接入任务的详情。
  • 配置项
    说明
    基础信息
    任务名称
    配置接入任务的名称。支持中文、英文大小写、数字和下划线_,取值范围为 1~40 个字符。
    采集配置
    指标采集间隔
    配置采集器的采集间隔。
    JobLabel
    支持从 Kubernetes Pod 对象中选取标签,该标签值将作为所有指标的 job 标签。例如,若 jobLabel 设为foo,且 Pod 标签为foo: bar,则系统会为所有采集到的指标指标添加job="bar"标签。 若该字段为空,则指标的 job 标签默认为 PodMonitor 对象的命名空间和名称,格式为<namespace>/<name>
    命名空间
    配置采集目标在集群中部署的命名空间。取值:
    • 任意:表示可以采集集群中任意命名空间中的资源指标。
    • 自定义:选择该选项时,允许配置集群中的命名空间。表示仅支持采集指定命名空间中的资源指标。例如:配置为default时,表示只能采集 default 命名空间中的资源指标。
    LabelSelector
    使用 Kubernetes Pod 对象的标签进行采集目标选择。
  1. 单击 确认,完成配置。
获取监控大盘
选择 效果预览 页签,支持查看监控大盘示例。单击 获取 Grafana 模版,即可下载 JSON 格式的 Grafana 监控大盘模版。
查询监控指标
选择 采集指标 页签,即可查看采集目标的指标列表。
查看预置告警
选择 告警模版 页签,即可查看系统针对 Ray 预置的告警模版。单击 开启告警,将跳转到告警组创建页面,基于当前告警模版快速创建和开启告警。
结果验证
配置完成后,您可以查看任务状态和任务详情,确定接入任务是否正常。
  1. 在左侧导航栏中选择 接入中心 > 接入任务
  1. 选择 VKE 环境 页签在任务列表中,可以查看接入任务的状态。
接入任务创建完成后,支持以下运维操作:
  • 单击 任务名称,进入任务详情页面,支持查看接入任务详情。
  • 单击 操作 列的 编辑,支持编辑指定的接入任务。
  • 单击 操作 列的 暂停任务,支持暂停指定的接入任务。
  • 单击 操作 列的 删除,支持删除指定的接入任务。
监控信息
查询指标
您可以使用托管 Prometheus 的 Explore 功能来快速查询和展示指标数据。详情请参见 指标查询
搭建大盘
您可以在容器服务集群或 ECS 主机中自建 Grafana,并通过 Grafana 查看指标和创建大盘。
配置告警
您可以在托管 Prometheus 的告警中心配置相关告警。详情请参见 创建告警规则
最近更新时间:2025.10.21 10:45:06
这个页面对您有帮助吗?
有用
有用
无用
无用