당신의 추론 서버는 사실 학습 중입니다: 스스로 개선하는 에이전트를 위한 오픈 소스 Reef 공개

@ao_qu18465
영어2026년 9월 01일
121K
216
46
9
262

TL;DR

Reef는 AI 에이전트의 지속적인 자기 개선을 위해 설계된 오픈 소스 인프라로, 실시간 추론 경험과 피드백을 바탕으로 모델 가중치와 하니스 로직을 모두 발전시킬 수 있습니다.

Reef는 완전히 오픈소스입니다: https://github.com/Human-Agent-Society/reef

1. 모든 "RSI" 과대광고가 현실이 되기 전에

오늘날 RSI에 대한 관심이 완전히 실현되기 전에, 우리는 동일한 광범위한 문제, 즉 에이전트(하네스 + 모델)가 경험을 통해 지속적으로 진화할 수 있도록 하는 인프라인 Reef를 오픈소스로 공개하고자 합니다.

목표는 오픈소스 커뮤니티가 지속적인 자기 개선을 실험하고 이를 위한 프로덕션급 인프라에 쉽게 접근할 수 있도록 하는 것입니다. 여기서는 RSI가 동일한 아이디어의 더 완전한 재귀적 형태를 나타내는 반면, 지속적인 자기 개선을 더 광범위하고 실용적인 프레임워크로 사용합니다.¹

2. 지속적인 자기 개선에 왜 새로운 인프라가 필요한가?

Ao Qu - inline image

GIF

대부분의 LLM 인프라는 비교적 단순한 라이프사이클을 가정합니다. 모델을 훈련하고, 평가하고, 배포한 다음, 추론에 사용합니다. 지속적으로 자기 개선하는 에이전트의 경우, 이 설정의 두 가지 가정이 깨지기 시작한다고 생각합니다.

첫째, 추론은 더 이상 파이프라인의 끝이 아닙니다. 에이전트는 작업하는 동안 궤적, 실행 결과, 사용자 피드백 및 향후 개선을 주도할 수 있는 기타 신호를 포함한 유용한 경험을 생성합니다. 추론 시간에 발생하는 일은 더 이상 단순히 제공하고 폐기하는 것이 아닙니다. 그것은 학습 과정 자체의 일부가 됩니다.

둘째, 모델만 진화하는 것이 아닙니다. 에이전트는 모델 그 이상이며, 지속적인 자기 개선은 모델 가중치에 국한되어서는 안 됩니다. 프롬프트, 메모리, 스킬, 도구 및 오케스트레이션 로직은 모두 경험을 통해 잠재적으로 개선될 수 있습니다. 더 강력한 모델은 에이전트의 기능을 확장하는 반면, 더 나은 하네스는 이러한 기능을 더 효과적으로 이끌어내고 복잡한 작업에서 더 안정적으로 실행하는 데 도움이 됩니다.

함께, 이러한 변화는 한때 대부분 순차적이었던 파이프라인을 지속적인 진화 루프로 바꿉니다. 에이전트는 상호 작용하고, 경험을 생성하고, 자신의 다른 부분을 개선하고, 이러한 변경 사항을 유지할 가치가 있는지 평가하고, 시스템의 새 버전으로 서비스를 재개합니다.

이것이 바로 우리가 Reef를 단순한 훈련 인프라로 생각하지 않는 이유이기도 합니다. 훈련은 루프의 한 부분일 뿐입니다. 지속적인 자기 개선을 위한 인프라는 라이브 추론에서 시작하여 전체 에이전트의 진화를 지원해야 한다고 생각합니다.

Ao Qu - inline image

GIF

3. 이러한 인프라에는 무엇이 필요하며, Reef는 어떻게 구현하는가?

Ao Qu - inline image

Reef 아키텍처

지속적인 자기 개선을 위한 인프라는 경험, 에이전트, 업데이트라는 세 가지를 종단 간 소유해야 합니다. 즉, (1) 라이브 트래픽에서 학습하고, (2) 모델과 하네스를 모두 업데이트하며, (3) 업데이트가 출시되는 방식을 적절히 평가, 버전 관리 및 제어해야 합니다.

경험 소유 — 학습은 라이브 서빙 위에 구축되어야 함

추론과 훈련은 역사적으로 분리되어 왔습니다. 일부 RL 인프라(예: Slime, veRL)는 데이터 생성을 위한 추론 엔진을 통합하지만, 이러한 시스템은 모델 서빙보다는 모델 훈련을 위해 설계되었습니다. 우리는 지속적인 자기 개선 인프라는 먼저 추론 인프라여야 하며 라이브 추론을 중심으로 훈련 기능을 구축해야 한다고 가정합니다. 즉, 시스템은 실제 애플리케이션을 제공하고, 테스트 시간 경험을 수집하며, 학습 레시피가 이를 지속적으로 소비하도록 합니다. 이 믿음은 훈련 신호 생성 및 훈련 샘플 선택을 포함한 많은 설계 선택의 재고로 이어집니다.

추론은 Reef에 기본적으로 내장되어 있습니다. Reef는 표준 추론 엔드포인트를 노출하여 기존 애플리케이션에 쉽게 통합하고 자체 진화 시스템으로 전환할 수 있도록 합니다.

python
1# client = xxx # Reef의 서빙 엔드포인트에 대한 httpx 클라이언트 초기화
2
3# Reef를 통한 표준 추론 호출, Open-AI 형식
4response = client.post(
5 "/v1/chat/completions",
6 json={"model": xxx, "messages": xxx},
7)
8
9# Reef가 저장한 추론 레코드에 대한 참조
10receipt = response.headers["x-reef-agent-record-id"]

애플리케이션은 다음을 통해 특정 추론 호출과 관련된 보상, 평가자 피드백 또는 기타 신호를 보고할 수도 있습니다:

python
1# 해당 추론 레코드에 피드백 첨부
2client.post(
3 "/reef/report",
4 json={"feedback": "wrong answer", "references": [receipt]},
5)

라이프사이클 내내 정적인 기존 추론 엔진과 달리, Reef는 상태 저장 추론을 제공합니다. Reef는 추론 추적 및 피드백을 구조화된 경험 스트림으로 저장하여 오프-폴리시 부실, 세션 병합 및 중복 제거와 같은 문제를 처리합니다. 학습 레시피는 이 스트림이 처리되는 방식, 사용되는 학습 알고리즘, 업데이트가 평가 및 배포되는 시점을 정의합니다. 이를 통해 다양한 애플리케이션이 동일한 인프라 위에서 자체 학습 전략으로 진화할 수 있습니다.

전체 에이전트 소유 — 모델과 하네스 모두 상태 저장 추론을 통해 진화

종단 간 결과를 제공할 수 있는 AI 에이전트는 모델뿐만 아니라 하네스로도 구성됩니다. 모델은 작업을 해결하는 데 필요한 기본 기능을 제공하는 반면, 하네스는 도구, 컨텍스트, 메모리, 피드백 및 오케스트레이션을 관리하여 복잡하고 장기적인 궤적에서 안정적인 실행을 가능하게 합니다. 이 둘은 밀접하게 결합되어 있습니다. 하네스는 모델의 기능이 어떻게 이끌어지고, 근거를 확보하며, 실행되는지를 결정하는 반면, 모델은 하네스가 안정적으로 지원할 수 있는 실행 형태를 결정합니다. 따라서 어느 한쪽의 발전은 다른 쪽의 최적 설계를 변경할 수 있습니다. 지속적인 자기 개선 인프라는 모델 가중치뿐만 아니라 프롬프트, 메모리, 스킬, 도구 및 오케스트레이션 로직을 포함한 전체 에이전트 스택의 공동 진화를 지원해야 합니다.

Reef는 모델과 하네스 모두에 대한 업데이트를 지원합니다.

하네스 측면에서 Reef는 Cordis를 "훈련 백엔드"로 사용합니다. 하네스 진화 레시피는 일반적으로 에이전트 궤적과 피드백을 분석한 다음 하네스에 대한 편집을 제안합니다. 이 프로세스는 Reef 내에서 완전히 발생하며, 각 진화된 하네스 버전은 설치 가능한 업데이트로 사용자에게 출시됩니다(Reef가 localhost:8900에서 제공된다고 가정):

bash
1curl -fsS -H "Authorization: Bearer $REEF_TOKEN" \
2 'http://localhost:8900/reef/harness/install?adapter=pi' | bash

위 명령은 Reef로 래핑된 Pi 하네스를 일반 코딩 에이전트와 매우 유사한 방식으로 설치합니다. 하네스는 Reef의 상태 저장 추론 엔드포인트를 사용하도록 구성되므로 추론 트래픽이 Reef를 통해 흐릅니다. 사용자가 작업하는 동안 Cordis는 구성된 하네스 진화 레시피에 따라 하네스를 진화시키고 새 버전은 Reef를 통해 제공됩니다. 사용자가 다음에 하네스를 열면 다음과 같은 화면을 볼 수 있습니다:

Ao Qu - inline image

모델 측면에서 학습 레시피는 Reef 레코드를 사용하여 모델 가중치를 업데이트합니다. 훈련은 분산 훈련 백엔드를 사용하여 라이브 서빙과 비동기적으로 실행되며, 현재 Slime에서 채택되었으며 체크포인트 또는 LoRA 어댑터와 같은 후보 가중치 업데이트를 생성합니다.

후보가 평가를 통과하고 배포 승인을 받으면, Reef는 이를 시나리오의 모델 아티팩트 새 버전으로 게시하고 서비스를 다시 시작하지 않고 NCCL 기반 가중치 동기화를 사용하여 서빙 엔진을 핫 업데이트합니다.

업데이트 소유 — 진화된 릴리스는 평가되고 버전 관리됨

지속적으로 진화하는 에이전트는 특히 진화가 성능 향상을 보장하지 않기 때문에 서비스 품질 저하의 대상이 됩니다. 따라서 각 진화된 후보는 출시 전에 평가되어야 합니다. Reef는 진화된 후보가 현재 시나리오를 제공하는 아티팩트를 대체하도록 허용할지 여부를 제어합니다. 후보가 거부되면 서빙은 변경되지 않습니다. 그렇지 않으면 Reef는 이를 새롭고 감사 가능한 릴리스로 게시합니다.

Reef가 진화할 수 있는 모든 것(예: 모델 체크포인트, LoRA 어댑터, 하네스 트리 또는 라우팅 정책)은 버전 컨트롤러가 관리하는 아티팩트로 표현됩니다. Reef는 아티팩트, 특히 모델 가중치와 같이 많은 디스크 공간을 차지하는 아티팩트를 관리하기 위해 Git LFS를 채택합니다. 릴리스 경로는 다음과 같습니다:

Ao Qu - inline image

각 시나리오에는 추가 전용 릴리스 체인이 있습니다. Reef는 비교-후-교체를 사용하여 시나리오의 릴리스 헤드를 진행하므로, 오래된 게시자가 최신 릴리스를 덮어쓸 수 없습니다. 릴리스 파이프라인을 통해 Reef는 지속적인 버전 변경 및 릴리스 프로세스를 효율적으로 추적할 수 있습니다.

4. Reef의 지속적인 자기 개선 방법

위의 인프라는 지속적인 자기 개선을 위한 공통 추상화를 제공합니다. 에이전트가 개선되는 실제 로직은 모듈식 학습 레시피를 통해 구현됩니다.

테스트 시간에 생성된 신호를 더 나은 에이전트로 전환하는 방법(온라인 강화 학습, 테스트 시간 훈련, 스킬 진화, 하네스 진화, 자기 대결 등)이 점점 늘어나고 있습니다. 이름과 메커니즘은 다르지만, 모두 동일한 기본 패턴을 공유합니다. 테스트 시간에 생성된 신호는 다음 상호 작용을 생성하는 시스템에 대한 업데이트로 전환됩니다.

이러한 레시피는 주로 세 가지 차원에서 다릅니다:

학습 신호: 개선을 주도하는 신호의 형태는 무엇이며, 어디에서 오는가?

경험 획득: 학습 경험은 어떻게 생성되는가? 에이전트가 능동적으로 찾는가, 아니면 외부 작업이나 상호 작용에서 반응적으로 생성되는가?

진화 대상: 실제로 변경되는 것은 무엇인가: 모델, 하네스, 아니면 둘 다?

Ao Qu - inline image

Reef에서 이미 지원되거나 곧 지원될 레시피

Reef는 이러한 방법이 동일한 인프라 위에서 다양한 학습 레시피를 통해 대부분 표현될 수 있도록 설계되었습니다. 레시피 사용은 간단합니다. 하나를 선택하고 Reef 서비스를 시작할 때 구성하면 됩니다.

yaml
1# serve.yaml
2reef:
3 recipe: recipes.sao.recipe:SAORecipe # 진화 레시피 연결
4 batch_size: 1 # 레시피별 구성
5 max_staleness: 18

그런 다음 구성으로 Reef를 시작합니다:

bash
1reef serve -c recipes/sao/examples/sao/serve.yaml

아래에서는 매우 다른 진화 전략을 따르지만 Reef에서 모두 구현할 수 있는 두 가지 예, OpenClaw-RL 및 TTT-Discover를 보여줍니다.

Ao Qu - inline image

GIF

이 시각 자료는 Reef에서 OpenClaw-RL의 통합을 보여줍니다. 사용자는 Reef가 사용자를 방해하지 않고 비동기적으로 지속적으로 진화시키는 모델을 가진 에이전트와 상호 작용합니다. 더 많은 라운드가 축적됨에 따라 에이전트는 점차 사용자의 선호도를 올바르게 해석하고 만족스러운 답변을 제공하는 방법을 학습합니다.

Ao Qu - inline image

GIF

이 시각 자료는 TTT가 Packing 32 솔루션을 반복적으로 개선하는 방법을 보여줍니다. 최적화가 진행됨에 따라 점점 더 효과적인 솔루션이 발견되고 유지되어 점진적으로 더 높은 패킹 점수를 얻습니다.

5. 결론

Reef는 지속적인 자기 개선이라는 광범위한 아이디어를 구체적인 시스템 문제로 전환하려는 우리의 시도입니다. Reef를 오픈소스화함으로써 이 문제를 더 쉽게 연구할 수 있게 하고, 커뮤니티에 단순히 서비스를 제공하는 것이 아니라 경험을 통해 지속적으로 학습하고 진화하는 에이전트를 구축하기 위한 실용적인 기반을 제공하고자 합니다.

Reef를 사용해 보고, 자신만의 학습 레시피를 만들고, 에이전트와 통합해 보시기 바랍니다. 코드, 문서 및 예제 레시피는 https://github.com/Human-Agent-Society/reef에서 확인하세요. Reef가 유용하다면 저장소에 별표를 눌러 주시면 감사하겠습니다. 함께 구축하거나 지속적인 자기 개선에 대해 더 폭넓게 논의하고 싶다면 Discord에 참여해 주세요: https://discord.gg/5y8e5f937k.

  1. 우리는 RSI보다 더 광범위하고 실용적인 프레임워크로 지속적인 자기 개선을 사용합니다. 이는 AI 자체가 다음 버전을 생성하는 시스템을 구축하고 개선하는 데 참여하는 RSI와 종종 관련된 완전히 폐쇄된 루프를 요구하지 않고 경험을 통해 반복적으로 개선되는 시스템을 포괄합니다. Reef는 이 광범위한 문제를 위해 설계되었으며, 그 위에 더 재귀적인 형태의 자기 개선이 등장할 여지를 남깁니다.

성장하는 기여자 목록 (가나다순): Chai Wenhao (@wenhaocha1), Ding Shuangrui (@ShuangruiDing), He Hao, He Haoze, Jiang Chonhe (@JiangChonghe), Jiang Nan (@nanjiangwill), Jiang Xuan, Li Xiaochen (@jacobli99), Liang Paul (@pliang279), Liu Bo (@Benjamin_eecs), Long Boyuan, Mang Qiuyang (@MangQiuyang), Qi Zhenting (@ZhentingQi), Qu Ao (@ao_qu18465), Qu Mingruo, Wang Zhaokai, Yan Xuezhi, Yu Hanfei (@yhfchitanda), Yu Haofei (@haofeiyu44), Yu Simon (@simon_ycl), Zheng Han (@hanzheng_7), Zhou Kaichen (@alex_kai2020), Zhou Zijian (@BobbyZhouZijian), Zhu Jiacheng (@JiachengZhu_ML), Zhuang Dingyi

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기