You need to enable JavaScript to run this app.
文档中心
全栈可观测平台

全栈可观测平台

复制全文
下载 pdf
AI 应用监控实践
vLLM 推理引擎链路监控
复制全文
下载 pdf
vLLM 推理引擎链路监控
应用性能监控提供多种平台的全链路监控能力,本文为您介绍如何使用应用性能监控在 vLLM 推理引擎中埋点,查看 vLLM 相关链路监控的 Trace 和 Metric 信息。
背景信息
vLLM 是专为大型语言模型(LLM)推理和部署设计的开源框架,旨在优化和加速大型语言模型的使用,特别是针对此类模型的高效推理。vLLM 处理的数据量往往非常庞大,这使得对其观测的数据收集工作极具挑战性,而且,为了更好地观测 vLLM,可能需要对数据进行标注。此时,可以使用应用性能监控无缝监控 vLLM 推理引擎,将 vLLM 中的观测数据上报到应用性能监控,分析对话并深入了解 LLM。
前提条件
  • 已经准备基础环境,并获取 service name 等信息。
操作步骤
步骤一:观测数据上报
支持通过 apmplus-opentelemetry-collector 将观测数据上报到应用性能监控,或直接将观测数据上报到应用性能监控后台,可根据实际情况按需选择。
Otel Collector 方式上报
直接上报
  1. 登录 容器服务控制台,在左侧导航栏选择 集群,在集群列表页面,单击目标集群名称,前往集群管理页面。
  1. 组件管理 监控 页签,安装 apmplus-opentelemetry-collector 组件。此外,如需实现主机、进程维度的指标数据采集,推荐同时安装 apmplus-server-agent 组件。
  1. 在环境中配置以下环境变量,使用 apmplus-opentelemetry-collector 将观测数据上报到应用性能监控。
export OTEL_EXPORTER_OTLP_ENDPOINT="http://<apmplus-otel-collector>:4317"
export OTEL_EXPORTER_OTLP_INSECURE=true
export OTEL_SERVICE_NAME="<your-service-name>"
export OTEL_RESOURCE_ATTRIBUTES="apmplus.business_type=gen_ai"
步骤二:vLLM 埋点接入
  1. 在环境中执行以下命令,安装 vLLM。
pip install vllm
  1. 在环境中执行以下命令,安装 OpenTelemetry 软件包。
pip install \
'opentelemetry-sdk' \
'opentelemetry-api' \
'opentelemetry-exporter-otlp' \
'opentelemetry-semantic-conventions-ai' \
'opentelemetry-distro' \
'opentelemetry-instrumentation-fastapi'
opentelemetry-bootstrap -a install
  1. 在环境中执行以下命令,启动 vLLM。
  • 默认配置的示例命令
vllm serve /deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B --otlp-traces-endpoint="$OTEL_EXPORTER_OTLP_ENDPOINT"
  • 可选配置的示例命令
启动命令中增加 collect-detailed-traces 参数,用于指定模块,收集详细跟踪信息,例如:time_in_model_executetime_in_model_forward 信息。
注意
此参数涉及到较高成本和阻塞性操作,因此,可能会对性能产生影响,建议根据实际需求选用。
vllm serve /deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B --otlp-traces-endpoint="$OTEL_EXPORTER_OTLP_ENDPOINT" --collect-detailed-traces=all
--collect-detailed-traces COLLECT_DETAILED_TRACES
# Valid choices are model,worker,all. It makes sense to set this only if ``--otlp-traces-endpoint`` is set. If set, it will collect detailed traces for the specified modules. This involves use of possibly costly and or blocking operations and hence might have a performance impact.
步骤三:vLLM 链路监控
  1. 登录 应用性能监控,并在顶部导航栏选择项目和地域。
  1. 在左侧导航栏选择 服务监控 > 服务列表,前往服务列表页面。
  1. 根据服务名称筛选目标 vLLM 关联的服务,单击服务名称,跳转到服务详情页,在 服务总览 页签查看 vLLM 相关黄金指标的监控信息,例如:QPS、请求数、错误率、错误数、每秒错误数、响应耗时。
  1. Trace 分析 页签,单击目标 Trace ID,前往单链路详情页面。在列表视图中查看 vLLM 埋点信息。
  1. (可选)若步骤二的启动命令中增加 collect-detailed-traces 参数,此时,推理 Span 里将新增两个 Attributes 信息。
最近更新时间:2026.01.27 20:58:19
这个页面对您有帮助吗?
有用
有用
无用
无用