You need to enable JavaScript to run this app.
文档中心
云服务器

云服务器

复制全文
下载 pdf
指标监控
查看实例GPU/RDMA监控数据
复制全文
下载 pdf
查看实例GPU/RDMA监控数据
针对GPU云服务器,火山引擎为您提供了其特有的GPU监控及RDMA监控,可帮助您快速了解实例显卡、RDMA网络信息。
前提条件
请根据云服务器监控指引查看实例是否已安装O11yAgent采集插件,若未安装请参考白屏化安装指引手动安装插件指引完成安装。
使用说明
  • 暂仅支持GPU云服务器使用,规格详情可查看异构计算
  • 您还可根据创建告警策略指引,配置GPU卡、RDMA卡指标数据异常告警。
说明
  • “告警对象”请选择“弹性计算 > 云服务器”。
  • “维度”请选择“GPU卡”或“RDMA网卡”。
  • 实例GPU/RDMA监控指标采集频率为60s,即每隔60s,对GPU/RDMA监控指标进行一次统计。
操作步骤
  1. 在顶部导航栏选择目标实例所属的项目和地域。
  1. 在左侧导航树,选择“实例与镜像 > 实例”。
  1. 单击目标实例名称,进入该实例的详情页面。
  1. 选择“监控”页签,您可以在“GPU监控”、“RDMA监控”两个数据页签查看实例数据。
  • GPU监控
  • 您可以在本页面查看显存使用量、GPU使用率、GPU温度、GPU编码器使用率、GPU解码器使用率和GPU显存使用率等指标信息。
说明
仅显卡类型为A100/A800且显卡数量≥2的规格实例,可查看“NVLINK出/入方向总带宽”指标。
  • RDMA监控
  • 您可以在本页面查看“RDMA网络流入/流出速率”、“接收/发送的RDMA数据包数量”、“RDMA网络出/入方向暂停包数量”等指标信息。
说明
仅高性能计算GPU型及显卡类型为A100/A800的规格实例,可查看“RDMA网络发送/接收包数量”、“RDMA网络出/入方向暂停包数量”、“RDMA网络出/入方向流量暂停时间”指标。
相关操作
您还可以进行如下操作:
  • 为GPU监控和RDMA监控创建告警策略,以便及时获取实例异常状态,确保其正常运行。
  • 将高性能计算GPU型云服务器接入托管Prometheus,并实现GPU/RDMA指标毫秒级监控,可在故障排查、资源优化、成本管控等多个维度,为HPC业务的稳定运行与效能提升提供技术保障。了解更多
常见问题
最近更新时间:2025.12.05 10:06:45
这个页面对您有帮助吗?
有用
有用
无用
无用