- 文档首页
全栈可观测平台
全景观测
通用 AI 应用监控
LLM Trace 分析
LLM Trace 分析
Trace 分析通过 Trace 上报的 Span 信息和关联日志信息,提供链路分析、单链路检索等能力,有助于故障排查、性能优化和系统监控,提高运维效率。本文针对通用 AI 应用监控为您详细介绍如何使用 LLM Trace 分析。
- Span 是分布式跟踪中的基本工作单元,代表系统中执行的一个操作,例如:一次数据库查询、一个函数执行、一次远程服务调用等。每个 Span 拥有唯一标识,附带操作名称、开始时间、结束时间、标签、日志等关键属性。
- Trace 是由多个 Span 组成的有向无环图,代表一个请求在分布式系统中的完整调用链。每个 Trace 拥有全局唯一的标识符,所有属于同一请求的 Span 都将被关联到此 Trace。Trace 和 Span 之间存在父子关系,这种关系有助于理解请求在系统中的执行链路,方便链路追踪。
已经将 LLM 相关应用接入 AI 应用监控,并正常上报观测数据。不同语言的接入方式各不相同,更多详细说明参见:接入方式。 - 在左侧导航栏选择 Trace 分析,前往 LLM Trace 分析页面。
- 根据实际情况筛选需要分析的 Trace 数据,目前提供多种数据筛选方式。
-
说明
所有筛选项和筛选规则均按“与”逻辑生效,即满足所有条件的数据才会被筛选并用数据分析。
- 目前支持 6 类筛选项,不同类型筛选项按“与”逻辑生效,即满足所有筛选项条件的数据才会被筛选出来。
- 部分筛选项支持配置多条筛选规则,例如:标签筛选、Span 属性筛选。相同筛选项中多个筛选规则按“与”逻辑生效,即满足所有筛选规则的数据才会被筛选出来。
数据筛选完成后,即可对数据进行分析和链路追踪,目前提供 Span 列表、性能分析、错误传播链分析。
Root Span 列表主要展示当前筛选范围内所有 Root Span 相关 Trace,并展示 Trace 相关详细信息,例如:TraceID、Span 类型、服务名、AI Span 类型、Input/Output、模型名称、Total Tokens、开始时间、耗时、服务名、操作、会话 ID 等。此外,支持按照 Total Tokens、Input Tokens、Output Tokens、开始时间和耗时进行排序,用于快速定位错误和慢查询。
说明
分布式链路追踪中,Root Span 是一条完整 Trace 的根节点 Span。每个 Trace 有且仅有一个 Root Span,所有子 Span 都以它为起点,构成完整的请求链路树。
Span 列表主要展示当前筛选数据的 Trace 上报量趋势和 Trace 列表。
展示当前筛选数据的 Trace 上报量趋势,可视化直观查看 Trace 上报量的健康状况,有助于故障排查定位、性能评估、容量规划等。例如:某个时间点 Trace 上报量突然大幅增加,可能意味着系统出现异常活动,可结合时间点和其他观测指标,快速定位问题发生的具体服务。
Trace 列表将列举当前筛选范围内的所有 Trace,并展示 Trace 相关详细信息,例如:TraceID、Span 类型、服务名、AI Span 类型、Input/Output、模型名称、Total Tokens、开始时间、耗时、服务名、操作、会话 ID 等。
- Trace 列表支持按照 Total Tokens、Input Tokens、Output Tokens、开始时间和耗时进行排序,用于快速定位错误和慢查询。其中, Total Tokens、Input Tokens、Output Tokens 和耗时仅支持对时间跨度不超过 24 小时的数据进行耗时排序。
- 单击 Trace 列表右上角设置按钮,支持自定义配置需要展示的信息及其信息展示顺序。
- 单击 Trace 列表右上角刷新按钮,支持手动刷新 Trace 列表中的数据。
单击 Trace ID,可跳转到单链路详情页面。切换到 Trace 详情页签,支持查看完整请求链路和 Span 相关详细信息,方便精细化数据分析。
切换到 Trace 完整日志页签,可以按照时间线查看请求路径上所有服务的相关日志,包括正常日志和错误日志,帮助问题排查具体问题。
切换到用户反馈记录页签,可查看当前 Trace 的反馈汇总与明细,包括反馈总数、点赞数与点踩数,以及各条反馈的时间、记录 ID、用户、反馈结果、反馈内容和来源等。
- 针对 AI 应用相关 Trace 列表提供 Span 导出 功能,可将 Span 信息导出用于其他深度分析。更多详细说明参见:Span 导出。
-
- 针对模型中存在工具调用场景,单链路详情右下角详细信息页签的 LLM 数据 栏,Input 信息中支持展示工具调用信息。单击工具右侧下拉按钮,可查看工具调用的详细信息。
-
- 在定位到异常的大模型调用后,若该调用已上报了可解析的数据,可单击 前往 Playground,系统将自动回填该次调用的完整上下文还原真实调用现场。您可以直接在 Playground 中修改提示词或调整参数,重新运行并验证修复效果。更多信息请参考 Playgroud。
-
- 针对多模态场景,单链路详情右下角详细信息页签的 LLM 数据 栏,Input 和 Output 中支持 Markdown 和多模态信息展示。
-
-
最近更新时间:2026.08.20 16:02:48