- 文档首页
云服务器
云服务器ECS
用户指南
监控
指标监控
查看实例GPU/RDMA监控数据
查看实例GPU/RDMA监控数据
针对GPU云服务器,火山引擎为您提供了其特有的GPU监控及RDMA监控,可帮助您快速了解实例显卡、RDMA网络信息。
使用说明
- 暂仅支持GPU云服务器使用,规格详情可查看异构计算。
- 您还可根据创建告警策略指引,配置GPU卡、RDMA卡指标数据异常告警。
- 实例GPU/RDMA监控指标采集频率为60s,即每隔60s,对GPU/RDMA监控指标进行一次统计。
操作步骤
- 选择“监控”页签,您可以在“GPU监控”、“RDMA监控”两个数据页签查看实例数据。
- 您可以在本页面查看显存使用量、GPU使用率、GPU温度、GPU编码器使用率、GPU解码器使用率和GPU显存使用率等指标信息。
说明
仅显卡类型为A100/A800且显卡数量≥2的规格实例,可查看“NVLINK出/入方向总带宽”指标。
-
- 您可以在本页面查看“RDMA网络流入/流出速率”、“接收/发送的RDMA数据包数量”、“RDMA网络出/入方向暂停包数量”等指标信息。
说明
仅高性能计算GPU型及显卡类型为A100/A800的规格实例,可查看“RDMA网络发送/接收包数量”、“RDMA网络出/入方向暂停包数量”、“RDMA网络出/入方向流量暂停时间”指标。
相关操作
您还可以进行如下操作:
- 为GPU监控和RDMA监控创建告警策略,以便及时获取实例异常状态,确保其正常运行。
- 将高性能计算GPU型云服务器接入托管Prometheus,并实现GPU/RDMA指标毫秒级监控,可在故障排查、资源优化、成本管控等多个维度,为HPC业务的稳定运行与效能提升提供技术保障。了解更多。
最近更新时间:2025.12.05 10:06:45