루프 엔지니어링의 기술

@sydneyrunkle
영어2026년 6월 16일
243K
1.6K
249
30
3.9K

TL;DR

이 글에서는 에이전트 루프, 검증 루프, 이벤트 기반 루프, 힐 클라이밍 루프를 결합하여 업무를 자동화하고 품질을 보장하며 지속적으로 개선되는 AI 에이전트를 구축하기 위한 프레임워크인 '루프크래프트(loopcraft)'를 살펴봅니다.

에이전트는 실제 세계에서 작업을 자동화하는 데 유용합니다. 하지만 가치 있는 작업을 안정적으로 수행하도록 만들려면 좋은 모델만으로는 부족합니다. 특정 작업 세트에 맞게 신중하게 설계된 하네스(harness)가 필요합니다.

핵심 에이전트 알고리즘은 간단합니다. LLM에 컨텍스트를 제공하고 작업이 완료될 때까지 도구를 호출하는 루프를 실행하는 것입니다. 이것이 가장 기본적인 루프입니다. 하지만 에이전트를 구동하는 루프는 이것만이 아닙니다. @swyx는 최근 "loopcraft: 루프를 쌓는 기술"이라는 훌륭한 글에서 루프를 쌓고 확장하여 더 효과적인 에이전트를 구축할 수 있다는 아이디어를 제시했습니다.

이번 글에서는 이 스택이 무엇이며, 각 레벨을 LangChain 프리미티브로 어떻게 구현하는지 살펴보겠습니다.

루프 1: 에이전트

핵심적으로 에이전트는 작업이 완료될 때까지 루프에서 도구를 호출하는 모델에 불과합니다.

Sydney Runkle - inline image

이것이 바로 LangChain의 create_agent가 제공하는 기능입니다. 모델을 선택하고 도구를 연결하면 작동하는 에이전트 루프가 완성됩니다. 도구는 에이전트가 실제 세계에서 작업을 수행할 수 있는 능력을 부여합니다.

내부 문서 에이전트를 예로 들어 보겠습니다. (이것은 이 블로그 전체에서 동기 부여 예시로 사용할 것입니다.) 첫 번째 루프 레벨에서, 문서 개선 요청을 받으면 모델이 계획을 세우고 변경 초안을 작성하며, 리포지토리 복제, 파일 읽기, 문서 작성, 풀 리퀘스트 열기 등의 도구를 사용합니다.

Sydney Runkle - inline image

레벨 2: 검증 루프

에이전트 루프는 작업을 수행하지만, 첫 번째 시도에서 항상 정확하거나 일관된 결과를 내지는 않습니다. 일관성이 중요할 때는 출력을 확인하고 기준에 미치지 못할 경우 모델에 피드백을 보내는 검증 루프로 감싸는 것이 유용합니다.

Sydney Runkle - inline image

검증 루프는 그레이더(grader)를 추가합니다. 그레이더는 에이전트의 출력을 평가 기준(rubric)에 따라 검사하고, 기준에 미치지 못하면 결과를 피드백과 함께 다시 보냅니다. 그레이더는 결정론적(deterministic)일 수도 있고 에이전트 기반(LLM을 심판으로 사용하는 것이 전형적인 예)일 수도 있습니다.

RubricMiddleware가 이 패턴을 처리하거나, create_agentafter_agent 훅을 사용하여 직접 구성할 수 있습니다.

문서 작성 에이전트 예시에서 그레이더는 각 시도 후 테스트를 실행하여 모든 링크가 제대로 연결되는지, 모든 CI 검사가 통과하는지, diff가 요청된 범위로 제한되었는지 확인합니다. 이러한 오류를 잡기 위해 수동 검토가 필요하지 않습니다.

Sydney Runkle - inline image

한 가지 절충점: 검증을 추가하면 실행당 지연 시간과 비용이 증가합니다. 속도보다 품질이 더 중요한 경우, 즉 대부분의 프로덕션 사용 사례에서 이는 가치가 있습니다.

레벨 3: 이벤트 기반 루프

에이전트 개발에서 가장 중요한 부분 중 하나는 통합 레이어입니다. 에이전트를 생태계에 연결하여 백그라운드에서 실행할 수 있도록 하는 것입니다.

이벤트 기반 루프는 에이전트를 생태계에 연결합니다. 이벤트가 발생하면(새 문서가 도착하거나, 스케줄이 트리거되거나, 웹훅이 도착하는 등) 에이전트가 실행됩니다. 에이전트는 수동으로 호출하는 것이 아니라 더 큰 시스템 내에서 지속적으로 실행되는 구성 요소입니다.

Sydney Runkle - inline image

LangSmith Deployment는 크론 스케줄과 웹훅 지원을 포함한 트리거 인프라를 지원합니다. openclaw의 "heartbeats"는 크론 작업의 인기 있는 예시로, 에이전트를 항상 켜져 있는 능동적인 어시스턴트로 전환합니다.

문서 에이전트는 코드 없는 에이전트 빌더인 Fleet을 기반으로 구동됩니다. Fleet의 채널스케줄은 이벤트 기반 및 크론 스타일 트리거를 처리합니다. #docs-plz Slack 채널에 메시지가 전송될 때마다 문서 에이전트를 실행하도록 채널을 사용합니다.

Sydney Runkle - inline image

레벨 4: 힐 클라이밍 루프

처음 세 개의 루프는 작업을 자동화합니다. 네 번째(그리고 가장 중요한) 루프는 개선을 자동화합니다!

Sydney Runkle - inline image

모든 에이전트 실행은 추적(trace)을 생성합니다. 즉, 모델이 무엇을 했는지, 호출한 도구, 그레이더 피드백 등에 대한 기록입니다. 이러한 추적에는 무엇이 작동하고 무엇이 작동하지 않는지에 대한 높은 가치의 신호가 포함되어 있습니다. 힐 클라이밍 루프는 이러한 추적을 분석 에이전트가 실행하고, 그 결과를 사용하여 개선된 구성으로 하네스를 다시 작성합니다. 여기에는 프롬프트/도구 조정 또는 그레이더 조정이 포함될 수 있습니다.

LangSmith에서는 추적 분석 에이전트인 Engine을 사용하여 이 네 번째 루프를 구현할 수 있습니다.

문서 에이전트 비유를 마무리하자면, Engine을 문서 에이전트 추적에 대해 실행하여 문제를 감지합니다. 여러 추적이 잠재적 문제를 암시하면, 문제가 있는 프롬프트나 도구에 대한 변경을 요청하는 이슈가 제출됩니다.

Sydney Runkle - inline image

여기서 핵심은 반환 화살표가 단순히 맨 위로 돌아가는 것이 아니라 내부에 도달하여 에이전트 루프를 직접 업데이트한다는 것입니다. 외부 루프의 각 주기는 내부 루프를 더 효과적으로 만듭니다.

미리보기:

프롬프트 및 도구 구성은 개선하기 가장 간단한 것이지만, 유일한 옵션은 아닙니다. 오픈 가중치 모델을 사용하는 팀의 경우, 힐 클라이밍 루프는 추적 또는 평가 결과를 훈련 신호로 사용하여 모델 자체를 개선하는 RL 미세 조정에 연결될 수 있습니다. 메모리 및 검색된 스킬과 같은 보조 컨텍스트도 같은 방식으로 개선할 수 있습니다. 루프는 패턴이며, 그것이 최적화하는 것은 여러분에게 달려 있습니다.

인간의 감독과 전문성

자동화가 인간을 루프에서 제거하는 것을 의미하지는 않습니다. 모든 레벨에서 인간의 감독이 가치를 더할 수 있는 자연스러운 지점이 있습니다. 자동화된 그레이더는 링크가 제대로 연결되는지 확인할 수 있지만, 프레이밍이 대상 청중에게 적절하지 않다는 것을 알아차리는 것은 인간의 몫입니다. 맥락, 경험, 안목에서 얻어지는 이런 종류의 판단이 바로 인간의 검토가 필요한 이유입니다.

일부 전문 지식은 프롬프트/도구 자체에 코드화되어야 하지만, 민감한 작업(금융 거래, 데이터베이스 작업 등)의 경우 실시간 인간 검토가 필수적입니다. LangChain은 모든 루프에서 이러한 접점을 쉽게 구현할 수 있도록 지원합니다.

  1. 에이전트 루프에서 민감한 작업/도구 호출 전에 인간의 입력을 요구합니다.
  2. 검증 루프에서 인간은 민감한 워크플로우에 대한 그레이더 역할을 할 수 있습니다.
  3. 애플리케이션 루프에서 인간은 최종 사용자에게 반환되기 전에 출력을 승인할 수 있습니다.
  4. 힐 클라이밍 루프에서 하네스 개선 사항은 배포 전에 인간 검토를 거칠 수 있습니다.

LangChain의 모든 오픈 소스 프레임워크는 "인간 개입 루프"를 일급 프리미티브로 제공합니다.

모든 것을 종합하면

표 형태로 보는 것을 선호한다면, 네 가지 루프가 어떻게 함께 쌓이는지는 다음과 같습니다.

루프

하는 일

영향

LangChain 프리미티브

1: 에이전트 루프

(모델 + 도구)

모델이 작업이 완료될 때까지 반복적으로 도구를 호출함

작업 자동화

create_agent, LangChain 지원 모델

2: 검증 루프

(에이전트 + 그레이더)

에이전트 실행, 평가 기준에 따라 출력 점수 매기기, 실패 시 피드백과 함께 재시도

품질 보장

RubricMiddleware

3: 이벤트 루프

(검증 + 시스템)

이벤트가 에이전트 실행을 트리거하여 실제 시스템 업데이트

대규모 작업

LangSmith Deployment / Fleet channels

4: 힐 클라이밍 루프

(시스템 + 엔진)

프로덕션 추적이 분석 에이전트에 공급되어 하네스 구성 개선

지속적 개선

LangSmith Engine

이것이 실제로 루프 엔지니어링, 즉 @swyx가 말하는 loopcraft가 실제로 어떻게 보이는지입니다. Steipete, Boris, Andrej와 같은 AI 리더들은 모두 같은 결론에 도달했습니다. 에이전트의 잠재력은 그 주위에 구축하는 루프에 있다는 것입니다.

우리는 루프 1과 2에 대해 한동안 고민해 왔습니다. 그러나 초점은 루프 3과 4로 전환되어야 합니다. 여기서 가치는 에이전트를 생태계에 내장하고, 여러분의 기준에 따라 지속적으로 개선함으로써 복리 효과를 얻을 수 있습니다.

Satya는 조직적 중요성을 다음과 같이 설명합니다: 인간의 판단과 토큰 자본이 함께 복리 효과를 내는 학습 루프를早期에 구축하는 기업은 따라하기 어려운 우위를 확보할 것입니다.

감사의 말

@Vtrivedy10, @masondrxy, @hwchase17, @huntlovell님의 세심한 검토에 감사드립니다.

참고 자료

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기