这是我们在 Langfuse Academy 上发布的系列文章之一,该系列将带你完整走一遍 AI 工程的全生命周期。如果你刚接触这个系列,建议从 AI 工程循环 开始阅读。
AI 工程循环快速回顾
AI 工程循环是团队持续改进 AI 系统的方法。它将生产环境中发生的情况(追踪、监控)与开发阶段的结构化迭代(数据集、实验、评估)连接起来。每次上线的改进都会产生新数据,团队会持续循环这一过程。

你可以在此了解更多。
追踪如何融入循环
传统软件在很大程度上是确定性的,执行遵循预定义的格式。但对于 LLM 应用来说并非如此。Agent 的执行可能很混乱,我们面对的是涌现行为,输入、输出和执行顺序都丰富且不可预测。你需要其他工具来追踪 Agent 的行为:追踪。
追踪是整个改进循环的核心。其他每一步(审查、构建数据集、运行实验、评估)都基于追踪数据。
如果你已经熟悉传统的可观测性概念,下面的一些内容可能会感觉重复。可以随意浏览或跳过。
追踪的结构
追踪可以像你的应用需求那样复杂或简单,但所有追踪都共享相同的基本结构。它由一组观测组成,这些观测描绘了你的 Agent 所走的路径。
观测是过程中的一个步骤。它包含输入、输出、开始/结束时间,以及该步骤中发生的元数据。
层级结构
追踪具有层级树状结构。嵌套在内部的是观测,这些观测可以包含其他观测,形成父子结构,反映 AI 应用的实际执行过程。

你可以看到发生了什么、顺序如何,以及哪些步骤属于哪个更大的步骤。
观测数据
输入和输出。每个观测都可以有输入和输出。大多数情况下两者都有;在某些特定情况下可能只有其中之一。为了便于解释,重要的是为观测中发生的操作类型设置合理的输入和/或输出。
观测类型。为了便于区分操作,你会看到不同类型的观测。每种观测类型用于捕获 Agent 的不同交互。

观测类型使读取追踪和过滤变得更加容易。在一个包含 20 个观测的追踪中,能够快速定位 LLM 调用可以节省时间。
成本、延迟、Token 使用量
除了输入和输出之外,观测上还有一些属性是任何 LLM 应用的基本要素:成本、延迟和 Token 使用量。这些数据按观测记录,并在追踪级别汇总。
追踪与会话
大多数情况下,你不会在一个追踪中看到 Agent 的整个生命周期执行。追踪可以分组为会话。但追踪和会话之间的界限在哪里?

一个通用的经验法则是:一个追踪对应系统的一次调用,通常是一次 API 调用或一次 Agent 执行。而会话则将多个追踪分组在一起,例如多轮对话中的所有轮次。
从何处开始
如果你刚开始,建议先专注于为一个真实的工作流进行端到端检测,然后再尝试覆盖所有可能的路径。
- 为应用中的一个重要请求路径设置追踪。
- 确保每个观测都捕获了该步骤有用的输入、输出和元数据。
- 手动审查几个真实的追踪,确认结构易于理解且对调试有用。
下一步
一旦你看到了追踪,就可以进入下一步:监控。监控是将追踪与改进和迭代 Agent 的循环连接起来的关键。





