이 글은 Langfuse Academy에서 AI 엔지니어링 전체 라이프사이클을 다루는 시리즈의 일부입니다. 시리즈를 처음 접하신다면 The AI Engineering Loop부터 시작하는 것이 가장 좋습니다.
AI Engineering Loop 간단 요약
AI Engineering Loop는 팀이 AI 시스템을 지속적으로 개선하는 방법입니다. 프로덕션에서 발생하는 일(추적, 모니터링)을 개발 중 구조화된 반복(데이터셋, 실험, 평가)과 연결합니다. 개선 사항이 배포될 때마다 새로운 데이터가 생성되고, 팀은 이 프로세스를 지속적으로 반복합니다.

자세한 내용은 여기에서 확인할 수 있습니다.
추적이 루프에 포함되는 방식
전통적인 소프트웨어는 대부분 결정론적이며, 실행이 미리 정의된 형식을 따릅니다. 하지만 LLM 애플리케이션은 그렇지 않습니다. 에이전트 실행은 복잡할 수 있으며, 풍부하고 예측 불가능한 입력과 출력, 실행 순서를 가진 창발적 행동을 다루게 됩니다. 에이전트의 행동을 따라가려면 다른 도구가 필요합니다: 추적(traces).
추적은 전체 개선 루프의 핵심입니다. 다른 모든 단계(검토, 데이터셋 구축, 실험 실행, 평가)는 추적을 기반으로 작동합니다.
이미 전통적인 관찰 가능성 개념에 익숙하다면, 다음 내용 중 일부가 반복적으로 느껴질 수 있습니다. 가볍게 훑어보거나 건너뛰어도 좋습니다.
추적의 구조
추적은 애플리케이션 요구사항에 따라 복잡할 수도 있고 간단할 수도 있지만, 모든 추적은 동일한 기본 구조를 공유합니다. 추적은 에이전트가 거친 경로를 매핑하는 관측(observations) 집합으로 구성됩니다.
관측은 프로세스의 단일 단계입니다. 입력, 출력, 시작/종료 시간, 그리고 해당 단계에서 발생한 일에 대한 메타데이터를 포함합니다.
계층 구조
추적은 계층적 트리 구조를 가집니다. 내부에는 다른 관측을 포함할 수 있는 관측들이 중첩되어 있어, AI 애플리케이션의 실제 실행을 반영하는 부모-자식 구조를 형성합니다.

어떤 순서로 어떤 일이 발생했는지, 그리고 어떤 단계가 더 큰 단계의 일부였는지 확인할 수 있습니다.
관측 데이터
입력과 출력. 모든 관측은 입력과 출력을 가질 수 있습니다. 대부분의 경우 둘 다 가지지만, 특정 상황에서는 둘 중 하나만 가질 수도 있습니다. 관측에서 발생하는 작업 유형에 적합한 입력 및/또는 출력을 설정하는 것이 해석 가능성을 위해 중요합니다.
관측 유형. 작업을 쉽게 구분할 수 있도록 다양한 관측 유형이 사용됩니다. 각 관측 유형은 에이전트의 다양한 상호작용을 캡처하는 데 사용됩니다.

관측 유형을 사용하면 추적을 더 쉽게 읽고 필터링할 수 있습니다. 20개의 관측이 있는 추적에서 LLM 호출을 빠르게 찾아내면 시간이 절약됩니다.
비용, 지연 시간, 토큰 사용량
입력과 출력 외에도 모든 LLM 애플리케이션에서 기본적으로 필요한 몇 가지 관측 속성이 있습니다: 비용, 지연 시간, 토큰 사용량입니다. 이들은 관측별로 기록되고 추적 수준에서 집계됩니다.
추적 vs 세션
대부분의 경우 하나의 추적에서 에이전트의 전체 라이프사이클 실행을 볼 수는 없습니다. 추적은 세션(sessions)으로 그룹화될 수 있습니다. 그렇다면 추적과 세션의 경계는 어디일까요?

일반적인 기준은 다음과 같습니다: 하나의 추적은 시스템의 한 번 호출, 일반적으로 한 번의 API 호출 또는 한 번의 에이전트 실행에 해당합니다. 세션은 여러 추적을 그룹화합니다. 예를 들어, 다중 턴 대화의 모든 턴이 여기에 해당합니다.
시작하기
이제 막 시작했다면, 모든 가능한 경로를 다루기 전에 하나의 실제 워크플로우를 처음부터 끝까지 계측하는 데 집중하세요.
- 애플리케이션에서 중요한 요청 경로 하나에 대해 추적을 설정하세요.
- 각 관측이 해당 단계를 나타내는 유용한 입력, 출력 및 메타데이터를 캡처하는지 확인하세요.
- 몇 개의 실제 추적을 수동으로 검토하여 구조를 쉽게 따라갈 수 있고 디버깅에 유용한지 확인하세요.
다음 단계
추적을 확인했다면 다음 단계인 모니터링으로 넘어갈 수 있습니다. 모니터링은 추적을 에이전트 개선 및 반복 루프에 연결하는 역할을 합니다.





