YouMind
로그인

모델의 자유를 해방하다: 프론티어에서의 하네스 설계

@pirroh
영어2026년 9월 29일
237K
511
79
21
1.2K

TL;DR

Replit은 경직된 모델 라우터가 성능을 제한한다고 주장하며, 프론티어 모델이 서브 에이전트와 작업 강도를 동적으로 선택하도록 허용하는 것이 더 효과적이라고 설명합니다. 새로운 하네스 설계는 모델의 자율성을 활용하여 코딩 벤치마크에서 파레토 효율성을 달성합니다.

모델 라우터는 지금 어디에나 있지만, 근본적인 한계가 있습니다. 고도화된 휴리스틱에 기반하든, 각 턴을 읽고 어떤 LLM 을 사용할지 결정하는 소형 모델에 기반하든, 라우터는 결국 자신이 선택해 주는 모델보다 능력이 떨어질 수밖에 없습니다. Replit Agent 는 대신 모델이 직접 결정하도록 내버려 둡니다.

메인 에이전트, 즉 코어 루프는 서브에이전트의 티어와 노력 수준(effort)을 선택하고, 작업이 진행되는 동안 자신의 설정도 조정합니다. 이러한 자유가 주어지면 GPT-6 Astra 는 일상적인 구현 작업을 비용이 덜 드는 서브에이전트에게 넘기고, 자신의 토큰을 어디에 쓸 가치가 있는지 스스로 판단합니다. DeepSWE 와 Terminal-Bench 모두에서 Replit Agent 는 Astra 단독 사용 대비 파레토 효율(Pareto-efficient)을 달성했습니다. 공개된 Astra 베이스라인 중 더 저렴하면서 점수가 높은 것은 없습니다. 또한 하나의 장시간 실행 워커를 사용하는 동일한 구성인 사이드킥 아키텍처보다 11 점, 16 점 더 높은 성과를 냈습니다.

Michele Catasta - inline image

애니메이션과 각주가 포함된 전체 글은 https://replit.com/blog/free-the-models 에서 확인하세요.

스캐폴딩을 줄이는 이유

새로운 모델이 출시될 때마다 하니스(harness)에 녹아 있던 전제들은 무효화됩니다.

모델이 장기 과제(long-horizon task) 처리에 강해질수록, 하니스 계층의 스캐폴딩(보조 구조)은 덜 필요해집니다. 실제로 우리는 모델들이 스스로 위임에 더 의존하는 경향을 관찰했습니다. 컨텍스트 관리와 병렬 처리를 위해 서브에이전트를 활용하는 식입니다. 나비에-스토크스 방정식을 비롯한 최근의 돌파구들 역시 프런티어 모델로 구동되는 에이전트 군집을 조율한 결과였습니다 [[1]](https://openai.com/index/navier-stokes-solution/).

하지만 프런티어의 지형은 들쭉날쭉합니다. 가장 뛰어난 코딩 모델이 UI 설계나 Slides 제작에도 반드시 가장 뛰어나거나, 이메일 작성에 최고인 것은 아닙니다.

그래서 우리는 각 모델이 자신만의 방식으로 작동할 수 있도록 하니스를 설계합니다. 여전히 필요한 가드레일은 유지하고, 최소 비용으로 최대 품질을 내는 것을 목표로 삼습니다.

새로운 모델이 나올 때마다 우리는 굳게 믿고 있던 것들을 다시 검증하고, 창발적 행동(emergent behavior)을 기반으로 하는 기법들을 빠르게 실험해야 합니다. 결국 모델을 자유롭게 한다는 것은, 얼마나 깊이 생각할지, 언제 작업을 넘길지, 누구에게 넘길지를 모델이 스스로 결정하게 두는 것을 의미합니다.

Michele Catasta - inline image

그림 1: 코어 루프가 매 단계마다 내리는 세 가지 결정.

위임을 위한 조합 가능한 프리미티브

GPT-6 Astra 로 실험을 시작했을 때 [[2]](https://openai.com/index/gpt-6-astra), 이 모델이 위임을 아주 잘한다는 사실을 발견했습니다. GPT-6 패밀리는 캐시를 깨뜨리지 않고 턴 중간에 노력 수준을 변경할 수 있도록 지원하는 OpenAI 의 첫 번째 모델이기도 합니다.

이러한 기능을 활용하기 위해 우리는 네 가지 하니스 프리미티브를 다듬었습니다. 이를 통해 코어 루프는 각 단계에서 몇 가지 선택지를 갖게 됩니다. 어떤 종류의 서브에이전트를 보낼지, 크기와 노력 수준은 어떻게 할지, 이미 브리핑한 에이전트로 돌아갈지, 그리고 얼마나 깊이 생각할지입니다.

  • 도메인 인식 서브에이전트. 범용 워커와 함께, 하니스는 읽기 전용 탐색기, 브라우저 테스터, 리뷰어, 그리고 Slides 및 UI 를 위한 디자인 서브에이전트 등 전문가들을 제공합니다. 각각 고유한 모델과 도구를 갖추고 있습니다. 현재로서는 어떤 전문가가 존재할지는 하니스가 결정하지만, 언제 어떻게 사용할지는 코어 루프가 결정합니다.
  • 서브에이전트 티어와 노력 수준. Small, Standard, Large 로 나뉘며 각각 비용과 성능이 한 단계씩 올라가고, 해당 티어 내에서 노력 수준을 조절할 수 있습니다. 둘 다 모든 서브에이전트에 적용되며, 코어 루프가 파견할 때마다 선택합니다. 예를 들어 기계적인 이름 변경은 low effort 의 small 로 보내고, 좀처럼 잡히지 않는 버그에 대한 가설 생성은 high effort 의 large 로 보냅니다.
  • 재사용 가능한 서브에이전트. 코어 루프는 처음부터 다시 시작하는 대신, 이미 브리핑한 서브에이전트로 되돌아갈 수 있습니다. 세션 내내 유지되는 단일 사이드킥은 없습니다. 다양한 종류와 티어의 서브에이전트가 대기 상태를 유지하며, 코어 루프가 누구를 깨울지 선택합니다. OpenAI 의 최신 모델에서 캐시 수명이 길어져 이를 유지하는 비용도 낮아졌습니다.
  • 동적 노력 튜닝. 이제 일부 모델에서는 턴 중간에 노력 수준을 바꿔도 캐시가 유지되므로, 우리는 매 단계마다 진행 궤적을 확인하고 작업 난이도에 맞게 노력 수준을 맞추는 에스컬레이션 시스템을 훈련시켰습니다. 라우터와 달리 요청 시점에 한 번만 작동하는 것이 아니라, 진행 중인 작업에 대해 턴 중간에 개입합니다.

Astra 와 Fable 5.1 의 코드 품질 덕분에 [[3]](https://www.anthropic.com/claude-fable-and-mythos-5-1), 평가 점수 하락 없이 코드 리뷰 서브에이전트 사용을 줄일 수 있었습니다. 이전까지 어떤 모델에서도 이런 수준의 엔지니어링 품질은 본 적이 없습니다.

최신 모델은 스스로 위임한다

Astra 나 Fable 같은 프런티어 모델은 토큰당 비용이 더 비싸서, 작은 모델들에 비해 비경제적으로 보일 수 있습니다. 하지만 우리는 이 모델들이 자연스럽게 비용이 덜 드는 서브에이전트에게 작업을 위임하고, 정작 자신들의 토큰은 꼭 필요한 결정에 남겨두는 모습을 관찰했습니다.

Replit Agent 는 코어 루프가 서브에이전트를 생성하도록 강제하지 않습니다. 표 1 은 프로덕션 환경에서 세 가지 모델이 이 결정을 어떻게 처리하는지 보여줍니다.

Michele Catasta - inline image

표 1: Replit Agent 프로덕션에서의 위임 양상 (각 모델의 추론 노력 수준은 medium 기준).

세 모델 모두 위임을 수행하지만, 방식은 제각각입니다. Medium 노력 수준에서 Fable 모델은 범용 워커에게 작업을 거의 넘기지 않습니다. 대신 읽기 전용 탐색기와 리뷰어를 파견하고 구현 작업은 스스로 처리합니다. Astra 는 지시받지 않아도 범용 워커에게 일상적으로 위임하는 우리가 목격한 첫 번째 모델이며, 한 번 브리핑을 마치면 새로 시작하기보다 그 워커에게 되돌아가는 경향이 있습니다. 이 복귀율은 모델 세대가 바뀔 때마다 높아졌습니다.

Michele Catasta - inline image

그림 2: 트레이스에서 추출한 2026 년 9 월 17 일의 프로덕션 턴. 코어 루프는 탐색기 1 개, 워커 2 개, 테스터 1 개를 파견했습니다. 총 5 번의 워커 파견 중 3 번은 이미 브리핑했던 워커로의 복귀였습니다.

결과

우리는 Astra 를 코어 루프로 사용하는 최고 품질 설정인 Max 모드에서 Replit Agent 를 두 가지 소프트웨어 엔지니어링 벤치마크인 DeepSWE 와 Terminal-Bench 로 평가했습니다. 비교 대상은 두 가지 베이스라인입니다. 하나는 각 리더보드에 공개된 대로 mini-swe-agent 에서 Astra 만 단독으로 사용한 경우이고, 다른 하나는 서브에이전트 프리미티브를 단일 장시간 실행 워커로 대체한 동일한 구성인 사이드킥 아키텍처입니다. 각 차트는 작업당 비용을 기준으로 점수를 표시하므로, 가장 효율적인 구성이 왼쪽 상단에 위치합니다.

활성 오픈소스 저장소에 대한 장기 과제를 테스트하는 DeepSWE v1.1 [[4]](https://deepswe.datacurve.ai/) 에서 Replit Agent 는 작업당 $2.11 의 비용으로 72% 를 기록했습니다. Mini-swe-agent 의 Astra 는 low effort 에서 $1.60 에 67%, xhigh effort 에서 $4.43 에 74% 를 기록했고, 사이드킥 아키텍처는 $1.34 에 61% 를 기록했습니다. Terminal-Bench 4.0 [[5]](https://www.tbench.ai/) 은 전적으로 셸에서 수행되는 다단계 작업을 테스트합니다. Replit Agent 는 작업당 $2.53 으로 49% 에 도달했으며, 이는 low effort Astra 의 $2.25 / 42%, xhigh 의 $5.86 / 60% 와 비교됩니다. 사이드킥 아키텍처는 $1.84 로 33% 에 그쳤습니다.

Michele Catasta - inline image

Replit Agent 는 두 벤치마크 모두에서 사이드킥 아키텍처를 11 점, 16 점 차이로 앞섰습니다. 사이드킥은 비용이 적게 들지만, 그 대가로 점수의 6 분의 1 에서 3 분의 1 을 포기합니다. Astra 단독 사용은 비용을 더 써야만 더 높은 점수를 얻습니다. Astra 의 최적 설정은 Replit Agent 보다 2 점, 11 점 높지만 비용은 두 배 이상 듭니다. 두 베이스라인 모두 비용과 점수를 동시에 만족시키지 못합니다. 우리는 Replit Agent 를 사용자에게 제공되는 그대로 실행했으며, 프롬프트나 하니스에 아무런 변경을 가하지 않았습니다.

하니스 설계의 쓴 교훈

우리는 이번 결과를 Sutton 의 쓴 교훈(Bitter Lesson) [[6]](http://www.incompleteideas.net/IncIdeas/BitterLesson.html) 의 한 사례로 해석합니다. 인간의 지식을 에이전트에 녹여 넣는 것은 단기적으로는 도움이 되지만 장기적으로는 정체기에 접어들며, 결국 컴퓨팅 파워에 따라 확장되는 범용적인 방법론에 추월당합니다. 경직된 하니스는 모델을 하나의 작업 방식으로 강제하지만, 조합 가능한 하니스는 모델이 스스로 선택하게 둡니다. 모델이 똑똑해질수록, 하니스가 대신 결정해 주어야 할 일은 줄어듭니다.

더 엄격하게 규정된 아키텍처와 비교할 때, 이 접근법은 우리에게 세 가지 이점을 줍니다.

  • 모델 스케일링 법칙에 베팅합니다. 모델의 안목에 의존하는 위임은 새로운 버전이 출시될 때마다 개선됩니다. 차세대 모델의 초기 프리뷰에서도 이 추세는 계속되고 있습니다.
  • 작업에 딱 맞춥니다. 작은 작업에는 아무것도 생성하지 않고, 검색에는 탐색기 하나를, 빌드가 독립적인 조각으로 나뉠 때는 팀을 소환합니다.
  • 유지하지 않고 재사용합니다. 모델이 다시 호출할 경우에 대비해 서브에이전트는 컨텍스트를 유지하지만, 호출되지 않으면 아무것도 남지 않습니다.

Sutton 의 표현을 빌리자면, 하니스는 우리가 어떻게 했을지를 지시하는 것이 아니라 모델이 작업을 실행할 방법을 스스로 발견하도록 두어야 합니다. 모델을 자유롭게 하십시오.

감사의 말

Daniel Furman, Jacky Zhao, Vaibhav Kumar, Ed Sioufi, Michele Catasta 가 작성했습니다. 이 작업에 기여해 준 James Austin, Toby Ho, Preeya Kirani, Zhen Li, Robin Newhouse, Devanshu Sen Pandey, Ibrahim Sheikh, Samuel Spitz, Peter Zhong 및 Replit AI 팀의 나머지 멤버들에게 감사드립니다. Replit 에서 AI 관련 업무를 하고 싶다면 우리 팀이 채용 중입니다. pirroh@repl.it 으로 연락해 주세요.

참고 문헌

  1. 나비에-스토크스 밀레니엄 문제 해결에 대하여
  2. GPT-6 Astra 소개
  3. Claude Fable 5.1 및 Claude Mythos 5.1 소개
  4. DeepSWE v1.1
  5. Terminal-Bench 4.0
  6. 쓴 교훈(The Bitter Lesson)
  7. 대규모 언어 모델의 특이성
  8. Design Arena
  9. Terminal-Bench 4.0 결과, Artificial Analysis
원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기