You need to enable JavaScript to run this app.
文档中心
全栈可观测平台

全栈可观测平台

复制全文
下载 pdf
通用 AI 应用监控
LLM Trace 分析
复制全文
下载 pdf
LLM Trace 分析
Trace 分析通过 Trace 上报的 Span 信息和关联日志信息,提供链路分析、单链路检索等能力,有助于故障排查、性能优化和系统监控,提高运维效率。本文针对通用 AI 应用监控为您详细介绍如何使用 LLM Trace 分析。
背景信息
  • Span 是分布式跟踪中的基本工作单元,代表系统中执行的一个操作,例如:一次数据库查询、一个函数执行、一次远程服务调用等。每个 Span 拥有唯一标识,附带操作名称、开始时间、结束时间、标签、日志等关键属性。
  • Trace 是由多个 Span 组成的有向无环图,代表一个请求在分布式系统中的完整调用链。每个 Trace 拥有全局唯一的标识符,所有属于同一请求的 Span 都将被关联到此 Trace。Trace 和 Span 之间存在父子关系,这种关系有助于理解请求在系统中的执行链路,方便链路追踪。
前提条件
已经将 LLM 相关应用接入 AI 应用监控,并正常上报观测数据。不同语言的接入方式各不相同,更多详细说明参见:接入方式
操作步骤
步骤一:Trace 数据筛选
  1. 登录 AI 应用监控,并在顶部导航栏选择项目和地域。
  1. 在左侧导航栏选择 Trace 分析,前往 LLM Trace 分析页面。
  1. 根据实际情况筛选需要分析的 Trace 数据,目前提供多种数据筛选方式。
说明
所有筛选项和筛选规则均按“与”逻辑生效,即满足所有条件的数据才会被筛选并用数据分析。
  • 目前支持 6 类筛选项,不同类型筛选项按“与”逻辑生效,即满足所有筛选项条件的数据才会被筛选出来。
  • 部分筛选项支持配置多条筛选规则,例如:标签筛选、Span 属性筛选。相同筛选项中多个筛选规则按“与”逻辑生效,即满足所有筛选规则的数据才会被筛选出来。
  • 序号
    筛选项
    说明
    1
    聚合方式
    图表中数据展示的聚合方式。
    • 自动聚合:动态聚合方式,根据筛选的数据量,自动选择合适的聚合时间进行数据展示。
    • 指定聚合时间:静态聚合方式,根据指定的聚合时间进行数据展示。最少支持按 30 秒聚合,最多支持按 1 天聚合。
    2
    时间范围
    数据筛选的时间范围。支持手动刷新数据或自动刷新数据,可根据实际需求配置。
    • 按最近筛选:根据当前时间,动态筛选最近时间段内的 Trace 数据,例如:筛选最近 1 小时的数据。
    • 指定时间范围:指定时间范围,静态筛选某个时间段内的 Trace 数据,例如:筛选 2025-11-08 00:00:00 到 2025-11-10 00:00:00 时间段内的数据。
    3
    标签筛选
    根据标签键值对进行数据筛选。最多支持配置 20 个标签,多个标签按“与”逻辑生效,即命中所有标签的数据才会被筛选出来。
    4
    工作区
    筛选指定工作区中的数据。
    5
    Input、Output 内容关键字
    根据 Input、Output 内容关键字进行数据筛选。
    6
    Span 属性筛选
    根据 Span 键值对进行数据筛选。支持配置多条 Span 属性,多个 Span 属性规则按“与”逻辑生效,即匹配到所有 Span 属性的数据才会被筛选出来。
    7
    用户反馈
    用于过滤列表数据的显示范围。
    • 关闭:展示全部 Trace 数据。
    • 开启:展示有用户反馈的 Trace 数据。
    8
    其他属性筛选
    多个 Trace 关联信息的筛选项,用于精细化筛选,例如:Trace ID、AI Span 类型、服务名、模型名称、操作、状态码等。多个筛选项按“与”逻辑生效,即匹配到所有筛选规则的数据才会被筛选出来。
步骤二:Trace 数据分析
数据筛选完成后,即可对数据进行分析和链路追踪,目前提供 Span 列表、性能分析、错误传播链分析。
Root Span 列表
Span 列表
Root Span 列表主要展示当前筛选范围内所有 Root Span 相关 Trace,并展示 Trace 相关详细信息,例如:TraceID、Span 类型、服务名、AI Span 类型、Input/Output模型名称、Total Tokens开始时间、耗时、服务名、操作、会话 ID 等。此外,支持按照 Total Tokens、Input Tokens、Output Tokens、开始时间和耗时进行排序,用于快速定位错误和慢查询。
说明
分布式链路追踪中,Root Span 是一条完整 Trace 的根节点 Span。每个 Trace 有且仅有一个 Root Span,所有子 Span 都以它为起点,构成完整的请求链路树。
步骤三:查看单链路详情
Trace 详情
Trace 完整日志
用户反馈记录
单击 Trace ID,可跳转到单链路详情页面。切换到 Trace 详情页签,支持查看完整请求链路和 Span 相关详细信息,方便精细化数据分析。
序号
模块
说明
1
Trace 信息
显示当前 Trace 相关详细信息,例如:Trace ID、SESSION ID、开始时间、总耗时、应用数、Span 数、状态码以及当前 Trace 的用户点赞/点踩数等。
  • SESSION ID:会话 ID,可单击 SESSION ID 跳转至 LLM 会话分析 页面查看详情。
  • 点赞、点踩图标:展示当前 Trace 的用户点赞数与点踩数,可单击图标跳转至 用户反馈记录 页签查看详情。
2
视图切换
提供列表、拓扑图、火焰图 3 种视图,可根据实际场景选择合适的视图,查看 Span 详情。
  • 列表:信息全面,方便快速筛选和 Span 查找。
  • 拓扑图:直观展示链路关系,快速定位问题的上下游关键节点。
  • 火焰图:可视化性能分析,有利于深入分析函数调用关系。
3
Span 筛选
快捷筛选按钮,提供组件标签、大模型组件标签、查看异常 Span、按关键字搜索。
4
Span 视图
Span 详细视图,可选用合适视图进行故障分析或性能分析等。
5
Span 详情
单击目标 Span,支持查看 Span 相关详细信息,包括:基本信息、LLM 数据、属性、资源、事件等 Span 相关详细信息,以及进程、容器、LLM 等 Span 相关指标详情。
说明
当前链路追踪相关的服务存在大模型数据时,才会展示 LLM 数据和 LLM 指标相关信息。
更多操作
  • 针对 AI 应用相关 Trace 列表提供 Span 导出 功能,可将 Span 信息导出用于其他深度分析。更多详细说明参见:Span 导出
  • 针对模型中存在工具调用场景,单链路详情右下角详细信息页签的 LLM 数据Input 信息中支持展示工具调用信息。单击工具右侧下拉按钮,可查看工具调用的详细信息。
  • 在定位到异常的大模型调用后,若该调用已上报了可解析的数据,可单击 前往 Playground,系统将自动回填该次调用的完整上下文还原真实调用现场。您可以直接在 Playground 中修改提示词或调整参数,重新运行并验证修复效果。更多信息请参考 Playgroud
说明
仅大模型类型的 Span 才提供此入口。
  • 针对多模态场景,单链路详情右下角详细信息页签的 LLM 数据Input 和 Output 中支持 Markdown 和多模态信息展示。
最近更新时间:2026.08.20 16:02:48
这个页面对您有帮助吗?
有用
有用
无用
无用