에이전트 엔지니어링(Agentic Engineering) 설정 (2,000시간 이상의 경험)

@DavidOndrej1
영어2026년 8월 31일
270K
1.4K
121
46
3.9K

TL;DR

전문적인 AI 코딩 스택에 대한 심층 분석으로, 복잡한 소프트웨어 개발 작업을 자동화하기 위한 클라우드 기반 에이전트, VPS 환경 및 맞춤형 스킬 활용법을 상세히 다룹니다.

지난 3년 동안 저는 AI와 함께 코딩하는 데 2,000시간 이상을 투자했으며, 에이전틱 엔지니어링 분야에서 가장 생산적인 사람들을 직접 인터뷰했습니다.

아래는 2026년 3분기 기준, 현재 제 에이전틱 엔지니어링 설정의 전체 내용입니다.

인터페이스

이는 에이전트와 상호작용하는 UI/CLI를 의미합니다. 제 메인 인터페이스는 bb입니다.

오픈 소스이며 완전 무료이고, 단일 GUI 내에서 모든 구독, 모든 에이전트, 모든 모델을 사용할 수 있습니다. Codex, Claude Code, Pi, Cursor CLI, OpenCode, Grok Build, Hermes 등 모든 것을 동일한 UI에서 사용할 수 있습니다.

Codex나 Cursor 같은 앱의 문제점은 자체 모델과 자체 구독만 허용한다는 것입니다. 목표는 가장 적은 비용으로 가장 많은 토큰을 확보하는 것입니다.

Codex나 Cursor 앱에서 좋아하는 모든 기능이 bb에 있으며, 매주 개선되고 있습니다 (게다가 완전 오픈 소스이며 100% 무료로 사용할 수 있습니다).

또한 자주 사용하는 것은 cmux입니다.

새로운 cmux 워크스페이스를 시작하면 tmux에서처럼 화면을 분할하고, 각 창에서 다른 터미널을 실행할 수 있으며, 내장 브라우저도 있습니다.

cmux의 단점은 에이전트와 워크스페이스가 많아지면 드러납니다. 왼쪽 사이드바는 적절한 기본 요소가 아닙니다. 몇 가지 작업을 처리하기에는 괜찮지만, 규모가 큰 진지한 에이전틱 엔지니어링 작업에는 최적이 아닙니다.

터미널로는 Ghostty를 사용합니다. 매우 빠르고 네이티브이기 때문입니다.

Ghostty 내에서 Herdr을 실행할 수 있습니다. 기본적으로 tmux와 비슷하지만 에이전트용이며, 에이전트를 위한 백엔드 런타임입니다. 매우 미니멀하고 가벼우며 터미널에서 실행됩니다. 에이전트가 작업을 마치면 그 상태가 왼쪽에 표시됩니다: 완료, 대기, 차단, 실행 중.

AI 에이전트의 상태를 추적하는 것은 필수적입니다. 제 예측으로는 3~6개월 내에 이 "에이전트 상태 추적"이 점점 더 중요해질 것입니다. 단일 에이전트와 대화하는 것이 아니라, 많은 작업 에이전트를 관리하는 관리자 에이전트와 대화하게 될 것이기 때문입니다.

마지막으로 언급해야 할 인터페이스는 제가 직접 개발한 Corral입니다.

에이전트가 완료될 때마다 무작위로 전환하는 대신 (Herdr에는 실제 순서가 없음), 모든 에이전트에는 우선순위가 있습니다. 작업에 다양한 우선순위/중요도 수준이 있는 것과 같습니다. P1 에이전트가 완료되면 맨 위로 올라갑니다. P1 에이전트가 실행을 마쳤는데 P4 에이전트에 응답해서는 안 됩니다. (네... Corral을 오픈 소스로 만들어야 합니다. 아직 하지 못했습니다.)

모델 및 구독

가장 적은 비용으로 가능한 한 많은 토큰을 원할 것입니다. 이것은 모든 에이전틱 엔지니어의 주요 목표 중 하나여야 합니다 (일을 끝내는 것 다음으로).

현재 4가지 주요 구독이 있으며, 네... 2개월 후에는 완전히 달라질 수 있습니다.

현재 최고의 "가성비" 딜은 OpenCode Go입니다. 단 $10에 Kimi K3, Grok 4.6, GLM 5.3, DeepSeek V4 Pro 및 기타 여러 모델을 제공합니다... 하지만 Fable 5 및 GPT-5.6 Sol과 같은 최고 모델은 포함되지 않습니다 (게다가 사용량 제한이 상당히 작습니다).

따라서 예산이 조금 더 있다면 다음과 같이 하는 것이 좋습니다:

  • $30 -- OpenCode Go + ChatGPT Plus ($20) 구매
  • $50 -- 여기에 Claude Code 구독 ($20) 추가
  • $70 -- Cursor 월 $20 추가, 모든 구독의 최하위 티어 확보
  • $110 -- OpenCode + 대형 플랜 중 하나. ChatGPT $100 플랜이 Claude보다 더 나은 혜택을 제공합니다. 그렇습니다. OpenAI는 더 많은 컴퓨팅 파워를 보유하고 있으며, 더 많은 보조금을 지급할 의향이 있습니다.
  • $210 -- 두 $100 플랜 모두 구매
  • 그리고 정말 진지하다면 (저처럼) 모든 $200 플랜 (Codex, Claude, Cursor)을 구매하세요. 사용량이 20배이며, 이 플랜이 최고의 혜택을 제공합니다.

참고로... Cursor 플랜은 매우 과소평가되어 있습니다. Cursor, 일명 Grok은 SpaceX 인수로 인해 훌륭한 구독이 될 것입니다. SpaceXAI는 엄청난 컴퓨팅 파워를 보유하고 있어 보조금을 지급하는 게임을 할 수 있습니다. 그리고 -- 제 생각에는 -- Cursor/Grok 플랜은 Cursor + Grok Bot에 대해 별도의 한도를 제공하는데, 이는 정말 놀랍습니다.

Grok Bot은 빠르게 사람들이 에이전트와 상호작용하는 새로운 방식이 되고 있으므로, Cursor 구독을 갖는 것이 그 어느 때보다 중요해졌습니다 (협찬 아님 ㅋㅋ, 그냥 사실입니다). 게다가 새로운 모델인 Grok 4.7이 곧 출시됩니다.

무슨 일이 있어도, API 요금을 지불하지 마십시오. 최악의 딜입니다. 그냥 구독하세요.

클라우드 에이전트

클라우드 에이전트가 미래라는 것은 명백합니다. Cursor, Amp, Devin, Codex... 이 모든 회사들은 클라우드 에이전트에 모든 것을 걸고 있습니다.

클라우드 에이전트가 미래라는 증거는 아래 그래프입니다.

[이미지]

이는 Cursor의 클라우드 에이전트에서 병합된 PR의 내부 점유율입니다: 올해 초 약 10-15%에서 현재 60%에 가까워지고 있습니다. 그리고 이것은 실제로 사용되는 병합된 PR입니다. 곧 70%, 80%, 90%가 될 것입니다.

모든 에이전트를 로컬, 즉 자신의 머신에서 실행하는 문제는 확장성이 없다는 것입니다. 한 번에 수백 개의 에이전트를 실행할 수 없습니다. 몇몇 에이전트가 동시에 전체 테스트 스위트를 실행하기로 결정하면 컴퓨터가 이상한 소음을 내기 시작할 것입니다 (제 $7,000 맥북 프로도 어려움을 겪습니다).

클라우드 에이전트는 격리된 환경, 지속적인 세션, 안정적인 인터넷 및 전원 액세스를 제공합니다. 노트북을 닫으면 세션이 손실됩니다. 인터넷이 몇 분만 끊겨도 하네스는 자체 복구할 수 없습니다.

기존 클라우드 에이전트 솔루션의 문제는 엄청난 수준의 에코시스템 종속성입니다. 환경과 모든 비밀을 설정하는 데 많은 시간이 소요되며, 그렇게 되면 종속됩니다: 세션이 거기에 있고, 그들의 가격 정책에 따르며, 모든 데이터를 제공합니다. 모델을 훈련시키지 않더라도 데이터를 사용할 수 있는 다른 많은 방법이 있습니다.

해결책은 자체 서버를 보유하는 것입니다. 그리고 AI 덕분에 설정하는 데 약 10분밖에 걸리지 않습니다 (진심입니다). VPS를 하나 구하고, 그 위에서 Herdr을 실행하고, SSH로 접속하면 됩니다.

Herdr은 지속적인 에이전트 세션을 제공하고, SSH를 사용하면 휴대폰, 노트북 등 모든 기기에서 연결할 수 있습니다. 말 그대로 클라우드 에이전트의 80/20을 몇 달러로, 종속성 없이 달성할 수 있습니다.

자체 클라우드 환경 구축

VPS로 Hostinger를 사용하며, KVM2 플랜이면 충분합니다. 여기서 전달하고 싶은 핵심은... VPS, DevOps, Linux 등에 전문가가 될 필요가 없다는 것입니다.

에이전트에게 평범한 영어로 말하세요!!!

다가오는 비디오에서 전체 설정을 라이브로 진행합니다. cmux 워크스페이스, 왼쪽 창의 코딩 에이전트 (Grok 4.6을 실행하는 Cursor CLI), 오른쪽의 빈 터미널 창.

제 cmux 스킬을 통해 에이전트가 다른 창을 찾아 그 안에서 명령을 실행할 수 있습니다. 제가 직접 새 VPS에 SSH로 접속한 다음 에이전트에게 "해당 서버에 대해 모든 것을 배우고 개발 환경을 설정하세요. Herdr, Node.js, Python 3, Git"이라고 말했습니다.

에이전트는 몇 초 만에 VPS를 분석하고, 모든 것을 설치하고, Herdr을 시작한 다음 Pi Agent를 설치하고, 제 맥북에서 OpenRouter 키를 찾아 전체 설정을 스스로 진행했습니다. 몇 번의 짧은 프롬프트 후에, 저는 Pi가 GPT-5.6 Sol을 실행하고 있고 두 번째 세션이 Fable을 실행하고 있는 것을 확인했습니다. 둘 다 클라우드에, 제 VPS에서, 전체 루트 액세스 권한으로 말입니다.

제 컴퓨터나 Wi-Fi에 문제가 발생하더라도... 제 맥북이 폭발하더라도, 그 에이전트들은 계속 실행됩니다. 전체 워크스루는 비디오에 있습니다. 여기 제 YouTube 링크

속도에 관한 또 하나... 저는 SuperWhisper로 받아쓰기를 합니다. 이 글을 읽는 대부분의 사람들은 아마 분당 40~50단어를 타이핑할 것입니다. 매우 느립니다.

하지만! 분당 250단어 이상으로 말할 수 있습니다. 음성 AI 도구 (Superwhisper, Glaido, Whispr Flow 등)를 사용하면 프롬프트 전송 속도가 즉시 3~4배 빨라집니다. 사용하세요. 바보처럼 굴지 마세요.

하네스

먼저 언급해야 할 하네스는 Pi Agent, 최고입니다.

가장 미니멀한 하네스: 단 4개의 도구, 항상 YOLO 모드로 실행, 모든 모델, 모든 제공자 지원. 매우 우아하고, 매우 구성 가능하며, 그래서 많은 사람들이 Pi 위에 구축하는 이유입니다. 오픈 소스이며 완전 무료입니다. pi.dev에 방문하여 받으세요. 논쟁의 여지가 없습니다. 제가 VPS에 가장 먼저 설치하는 하네스입니다.

Cursor CLI. 매우 과소평가되었습니다. 모든 모델을 사용할 수 있기 때문입니다: Grok, GPT 모델, Anthropic 모델, Kimi. 스킬에 태그를 지정할 수 있고, 메시지를 미리 보낼 수 있습니다. 전반적으로 훌륭한 하네스입니다.

다음 하네스 범주는 제가 "자기 개선" 하네스라고 부르는 것입니다.

가장 인기 있는 두 가지는 Hermes Agent와 Prime Agent입니다. 이는 무엇을 해야 할지 모를 때 사용합니다. 작업에 불확실성이 많고, 알아내야 할 것이 많다면 자기 개선 하네스를 사용하세요. 스킬을 생성하고 시간이 지남에 따라 함께 개선되기 때문입니다.

마지막으로, 고전인 Claude Code와 Codex입니다. 저는 이들을 별칭으로 사용합니다. 많은 사람들이 매일 claude --dangerously-skip-permissions를 입력합니다. 매우 느리고, 매우 비효율적입니다. 저는 cc를 입력하면 권한을 우회하여 Claude Code를 실행하고, cx를 입력하면 YOLO 모드로 Codex를 실행합니다.

자주 실행하는 긴 명령어에 대해 전역 별칭을 반드시 만들어야 합니다. 이것이 에이전틱 엔지니어링의 법칙 중 하나입니다: 같은 시간에 어떻게 더 많은 일을 할 수 있을까?

스킬

제 스킬 저장소는 지난 달에 입소문을 탔습니다. (github.com/davidondrej/skills 참조) 또한 완전 무료, 오픈 소스입니다.

에이전틱 엔지니어링과 가장 관련 있는 스킬은 다음과 같습니다:

(1) /total-review

  • 두 가지 다른 스킬인 /gpt-review와 /fable-review를 실행하여 방금 수행한 코드 변경 사항을 GPT-5.6 Sol과 Fable 5로 검토한 다음, 두 목록을 중복 제거하여 실제로 중요한 문제만 단일 목록으로 만듭니다. 가장 똑똑한 친구 모두에게 입사 지원서를 검토해 달라고 요청하고, 그들이 가장 큰 문제만 알려주는 것과 같습니다. 중대형 변경 사항, 특히 다른 모델이 빌드한 경우에 실행하세요. Grok 4.6이 작업을 수행했다면 완전히 다른 모델이 검토하도록 해야 합니다.

중요: 자주 반복하는 모든 것은 프리셋이 되어야 합니다.

단일 단계라면 텍스트 대체를 사용하세요. 저는 Raycast 스니펫으로 가지고 있습니다. "평범한 영어로 짧게 답변하세요." "이전 답변을 더 간단하고 짧게 만드세요." "모든 파일을 스테이징하고, 명확한 커밋을 작성하고, GitHub에 푸시하세요."

다단계 워크플로우라면 스킬로 전환하세요.

(2) /ask-then-build

  • 저는 이 스킬을 매일, 어떤 빌드를 하기 전에 사용합니다. "이것을 Windows 호환으로 만들어"라고 말하고 모델이 나중에 후회할 중요한 아키텍처 결정을 조용히 내리도록 하는 대신, 주요 결정 사항을 하나씩 옵션과 함께 안내합니다. AI 모델은 코딩과 구현에 뛰어납니다. 하지만 취향은 없습니다. 좋은 판단력도 없습니다. 인간인 여러분이 그 부분을 책임져야 합니다.

(3) /deepapi

  • 이 스킬은 심층 조사, 스크래핑, 웹 관련 작업에 사용합니다. Codex와 Claude Code는 기본 웹 검색 기능을 제공하지만 스크래핑이나 심층 조사 기능은 없으며 쉽게 차단됩니다. 빠른 웹 검색 8개를 실행하고 상위 3개 옵션을 제공하고, Twitter를 스크래핑하고, GitHub를 스크래핑하고, 사람에게 연락할 수 있는 3가지 방법을 찾으세요. 제 팀의 모든 사람이 사용합니다. 필수입니다.

(4) 가드레일 및 푸시 잠금

  • 더 지루하지만 절대적으로 필수적이며, 한 번만 설정하면 됩니다. 전역 에이전트 가드레일은 사전 도구 호출 훅으로, 에이전트가 디스크를 지우거나, Git 기록을 덮어쓰거나, 비밀번호 관리자를 건드리지 않도록 보장합니다. 그리고 푸시 잠금은 15개 이상의 에이전트를 병렬로 실행할 때 사용합니다: 전체 시스템에 대한 하나의 OS 수준 커널 잠금입니다. 병합, 확인, 푸시, CI, 배포, 상태 확인.

제 스킬을 모두 설치하지 마세요. 필요한 것만 가져가세요.

워크트리

워크트리는 기본적으로 기본 체크아웃의 복사본을 별도의 폴더에 만들고 거기에 새 Git 브랜치를 생성하여 에이전트가 완전히 격리된 상태에서 병렬로 작업할 수 있도록 합니다.

소규모 프로젝트에서는 완전히 과잉입니다. 단일 브랜치를 유지하고 더 빠르게 작업하세요.

항상 20~30개 이상의 에이전트를 실행하는 중대형 프로젝트에서는 이를 피할 방법이 없습니다. 워크트리가 없으면 에이전트가 충돌하고, 서로의 변경 사항을 되돌리고, 서로 싸울 것입니다. BB의 또 다른 좋은 점: 내장 워크트리가 있습니다. 제 대규모 저장소에서는 항상 origin/main을 기반으로 새 워크트리를 원한다는 것을 기억합니다.

기타 에이전틱 엔지니어링 팁

각 모델을 사용할 시기를 알아야 합니다.

  • 계획을 설계하거나 새 프로젝트를 시작합니까? Fable. 가장 많은 천재적인 아이디어를 제공합니다. 깊고 심각한 버그를 수정합니까? GPT-5.6 Sol, 최대 추론 노력. 기본 채팅? 높음 설정의 Grok 4.6. 거의 동일한 지능이지만 2배 저렴하고 2배 빠릅니다. 프론트엔드? Kimi K3.
  • 그리고 주요 새 모델이 출시되면, 그 모델만 사용하는 하루를 할애하세요. Twitter 말을 듣지 마세요. 직접 시도해보세요.

검토 시기를 알아야 합니다.

  • 모든 변경 사항에 대해 total review를 실행하지는 않습니다. 작은 프론트엔드 조정은 바로 프로덕션으로 갑니다.
  • 그리고 절대 재귀적 검토를 하지 마세요. 모델에게 "가장 큰 문제 5가지를 찾아봐"라고 말하면, 코드베이스가 완벽하게 괜찮더라도 5가지 문제를 찾아냅니다. 이 모델들은 가상의 버그를 만들어냅니다.

사전 전송.

  • 보통 저는 에이전트가 다음에 무엇을 할지 알고 있으므로 미리 메시지를 큐에 넣습니다: "계획 실행", "이것에 대해 Fable 검토 실행", "이제 그 문제들을 수정".
  • 때로는 2개의 메시지, 때로는 6개입니다.
  • 사전 전송을 허용하지 않는 하네스는 절대 사용하지 마세요.

하위 에이전트는 과도하게 사용됩니다.

  • 많은 사람들이 그냥 한도를 소진합니다. 저는 제가 통제할 수 있을 때 사용합니다. 하위 에이전트에서 어떤 모델을 실행할지 선택하고 싶습니다. 제가 어떤 구독과 한도를 가지고 있는지 알기 때문입니다.
  • 미래는 관리자 에이전트가 작업자를 실행하는 것이지만, 여전히 그 시스템을 설계해야 합니다: 규칙, 권한, 하위 에이전트가 실행되는 조건. Anthropic이나 OpenAI의 어떤 사람이 저를 위해 그것을 결정하도록 하고 싶지 않습니다.

ADR.

  • 이것이 결정 사항을 코드베이스에 넣는 방법입니다. /docs/adr는 제가 모든 프로젝트에서 가장 먼저 만드는 폴더 중 하나입니다.
  • 모든 핵심 아키텍처 결정 사항은 짧은 파일을 얻습니다: 무엇이 결정되었는지, 왜, 그리고 그 당시 프로젝트의 상태는 어땠는지. 일부는 코드에서 읽을 수 있지만, 모든 것이 그런 것은 아닙니다.
  • 읽을 수 없는 것은 문서화되어야 미래의 에이전트와 인간이 왜 이런 방식으로 구축되었는지 즉시 이해할 수 있습니다.

테스트.

  • 현재 모델은 저장소를 테스트로 부풀립니다: 단위 테스트, 통합 테스트, 데이터베이스 테스트, 심지어 말이 안 되는 가장 작은 저장소에서도.
  • 모델에게 테스트를 추가하라고 말하면 엄청난 양을 추가합니다. "테스트를 추가하지 마"라고 말해도 여전히 약간 추가하며, 적절한 양에 도달합니다.

프로덕션 DB 액세스.

  • 실제 사용량이 있는 모든 제품은 이것을 해야 합니다... 읽기 전용 Postgres 역할을 만들고 에이전트에게 그것을 제공하세요.
  • 쓰기 액세스 권한을 주지 마세요. 되돌릴 수 없는 변경 하나면 후회하게 될 것입니다.
  • 하지만 액세스 권한이 없는 것도 실수입니다. 읽기 전용 액세스 권한으로 모든 기능을 현실적으로 확인할 수 있습니다. 이것이 프로덕션에서 실제로 발생합니까? 사람들이 이것을 실제로 사용하고 있습니까? 더 일찍 이렇게 했더라면 좋았을 텐데요.

에이전트 생산성 추적.

  • Vectal Labs에서 agentic-productivity라는 새 오픈 소스 저장소를 방금 출시했습니다. 커밋, 에이전트 세션 및 사용자 프롬프트를 추적합니다.
  • 각각은 그 자체로는 나쁜 지표이지만, 3가지를 결합하고 장기적인 추세를 살펴보면 실제로 더 나은 에이전틱 엔지니어가 되고 있는지 확인할 수 있습니다.

이것이 현재 설정입니다. 한 달 후에는 아마 달라질 것입니다. 이것은 항상 변합니다.

David Ondrej 작성 (YouTube용으로 구술 후 기사 형식으로 재작성됨)

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기