You need to enable JavaScript to run this app.
文档中心
托管 Prometheus

托管 Prometheus

复制全文
下载 pdf
云服务接入
GPU/RDMA 毫秒级监控接入
复制全文
下载 pdf
GPU/RDMA 毫秒级监控接入
托管 Prometheus 支持接入高性能计算 GPU 型云服务器,提供 GPU/RDMA 毫秒级监控,满足用户对云上 GPU/RDMA 资源和自定义业务的统一监控需求。本文为您介绍 GPU/RDMA 毫秒级监控接入的流程和步骤。
背景信息
高性能计算 GPU 型规格在原有 GPU 型规格的基础上加入 RDMA 网络,可大幅提升网络性能,提高大规模集群加速比,适用于高性能计算、人工智能、机器学习等业务场景。更多详细说明参见:高性能计算GPU型
前提条件
  • 已开通 VMP 服务,并创建托管 Prometheus 工作区,更多详细说明参见:创建工作区
  • 已开通 ECS 服务,并创建高性能计算 GPU 型 ECS 实例,更多详细说明参见:购买云服务器
  • 确保 ECS 已配置安全组,更多详细说明参见:创建安全组
  • 创建托管采集器使用的安全组,并在 出规则 中放行 ECS 实例所在网段和端口。
  • 配置 ECS 所属安全组,并在 入规则 中允许托管采集器使用的安全组访问对应端口。
使用限制
托管 Prometheus 工作区和目标 ECS 实例必须处于相同地域。
操作步骤
配置接入任务
  1. 登录 VMP 服务控制台
  1. 在顶部导航栏,选择目标地域。
  1. 在左侧导航栏中选择 接入中心 > 组件,单击 GPU/RDMA 毫秒级监控
  1. (可选)服务授权。
  1. 当第一次配置 ECS 集成任务时,需要对 VMP 服务面向 ECS 服务和 VPC 服务进行跨服务访问授权。单击 去授权,配置服务授权。
  • alt
  1. 单击 立刻授权,为 VMP 跨服务访问请求进行授权。
  • alt
  1. 配置采集器部署环境,选择 ECS 环境,并选择关联的云服务器。
说明
本场景仅支持选择已安装云助手,且未被其他 GPU/RDMA 毫秒级监控接入任务绑定的高性能计算 GPU 型云服务器。
  1. 单击 创建接入任务,在 开始接入 页签配置接入任务详情,完成后单击 确定
分类
配置项
说明
基础信息
任务名称
自定义接入任务的名称。
工作区
选择已创建的托管 Prometheus 工作区,与接入任务关联。
项目
实例所属项目。项目管理是火山引擎提供的一种资源管理方式,可以对不同业务或项目使用的云资源进行分组管理。基于项目进行 IAM 授权,有利于维护资源独立、数据安全,同时可从项目维度查看资源消费账单,便于计算云资源使用成本。更多详细介绍参见:项目管理
标签
实例附带的资源标签。资源标签由一组 KV 键值对组成,可以通过资源标签从不同维度对云资源进行分类和聚合管理,并且使用于标签制授权和资源分账等场景。更多详细介绍参见:标签管理
说明
最多添加 50 个标签。
采集配置
指标采集间隔
自定义 RDMA 和 GPM 的指标采集间隔,支持毫秒级监控,默认 100ms。
指标选择
根据实际需求勾选需要采集的指标。
获取监控大盘
选择 效果预览 页签,支持查看监控大盘示例。单击 获取 Grafana 模版,即可下载 JSON 格式的 Grafana 监控大盘模版。
结果验证
配置完成后,您可以查看任务状态和任务详情。确定接入任务是否正常。
  1. 在左侧导航栏中选择 接入中心 > 接入任务
  1. 选择 ECS 环境 页签在任务列表中,可以查看接入任务的状态。
  1. 单击任务名称,可前往任务详情页,查看任务详细信息,以及云服务器的云助手状态和采集状态。
最近更新时间:2025.12.04 15:57:26
这个页面对您有帮助吗?
有用
有用
无用
无用