YouMind
로그인

Grok Bot + Opus 5.5: 10단계로 완성하는 궁극의 에이전트 하네스

@0xMorlex
영어2026년 10월 08일
102K
664
64
31
1.2K

TL;DR

Grok Bot과 Claude Opus 5.5의 새로운 통합 기능을 활용하여 비즈니스 자동화를 위한 강력하고 자율적인 AI 에이전트 시스템을 구축하는 종합 튜토리얼입니다.

지금까지 사용해 온 모든 에이전트는 하나의 패키지로 제공되었습니다. 컴퓨터, 로그인, 메모리, 루틴을 아우르는 하니스(harness)와 이를 구동하는 두뇌가 같은 회사에서 만들어져 함께 판매되었죠.

10 월 7 일, Grok Bot 이 이 둘을 분리했습니다:

https://x.com/elonmusk/status/2107724314451878104

이제부터 SpaceX 는 모든 작업을 최고의 백엔드 모델로 라우팅하며, 그 첫 번째 이름은 Claude Opus 5.5 입니다. SpaceX 는 하니스를 유지했고, 두뇌는 이제 Anthropic 의 것이 되었습니다.

이 조합은 지금까지 나온 제품 중 가장 강력한 버전입니다. 자신만의 컴퓨터를 가지고 여러분이 잠든 사이에도 일하는 에이전트, 그리고 다단계 에이전트 작업 독립 벤치마크에서 선두를 달리는 모델이 이를 구동합니다.

이것이 10 단계 튜토리얼입니다

무엇이 바뀌었는지 이해하는 것부터, 서로에게 작업을 넘기고 사람의 판단이 필요한 경우에만 여러분을 호출하는 Opus 기반 전문가 팀을 운영하는 것까지 모두 다룹니다.

01. 방금 무엇이 바뀌었는지 이해하기

모든 것은 게시물 하나로 시작되었습니다. 미국 시간 10 월 6 일 늦은 밤, Musk 는 X 에 SpaceX 가 주어진 작업에 가장 적합한 백엔드 모델을 사용할 것이라고 적으며 Claude Opus 5.5, Midjourney, Suno 를 언급했습니다. 그의 마지막 문장은 이랬습니다. "최고의 결과를 줄 가능성이 가장 높은 것이라면 무엇이든."

몇 시간 후, Grok Bot 팀의 Lauren(@poteto)이 이를 구체화했습니다. 모든 봇이 Opus 5.5 로 구동되며, Cursor 의 모델을 실행하는 클라우드 에이전트를 생성할 수 있게 된다는 것이었습니다. 9to5Mac 은 10 월 7 일 기준으로 이것이 실시간 적용되었다고 보도했습니다.

https://x.com/claudeai/status/2107894039626277339

왜 경쟁사의 모델일까요? 에이전트가 실제로 수행하는 작업에서 두 모델 간의 격차가 크기 때문입니다. Artificial Analysis 는 동일한 하니스에서 두 연구소를 측정했습니다.

Morlex - inline image

한 가지 주의할 점: 이는 9 월의 Grok 4.7 이 아닌 Grok 4.6 이며, 두 측정은 한 달 간격으로 이루어졌습니다. 하지만 Terminal-Bench 는 모델에 단순한 질문이 아닌 '일'을 맡길 수 있을지를 예측하는 지표이며, 여기서 격차는 거의 3 배에 달합니다.

https://x.com/zhuokaiz/status/2102825912471527738

언론보다 먼저 X 가 반응했습니다.

10 월 7 일, Grok Bot 이 이 둘을 분리했습니다 최고의 백엔드 모델로 라우팅하며, 그 첫 번째 이름은 Claude Opus 5.5 입니다. SpaceX 는 하니스를 유지했고, 두뇌는 이제 Anthropic 의 것이 되었습니다.

누구

무엇을 말했는가

Theo - t3.gg (@theo)

"여러분 나쁜 소식: Grok Bot 은 실제로 정말 훌륭합니다" - 뉴스가 나오기 몇 시간 전에 게시되어 440 만 조회수를 기록했습니다. Lauren 은 다음 날 그것이 방금 더 좋아졌다고 답글을 달았습니다.

Lauren (@poteto)

Musk 의 글을 인용 리포스트하며 Grok Bot 이 업그레이드된다고 발표했습니다.

Iorel (@Iorel_X)

하나의 모델에 갇혀 있지 않고 외부 모델로 문을 열었다는 관점으로 해석했습니다.

02. 설치하고 치프(Chief) 만나기

Grok Bot 은 브라우저 탭이 아니라 앱입니다. Mac, iPhone, iPad 에서 실행됩니다. Grok 또는 Cursor 계정으로 로그인합니다. 단독으로 판매되지 않으며 대부분의 SuperGrok 및 유료 Cursor 플랜에 번들로 제공됩니다.

챗봇보다는 메신저 클라이언트에 가까운 화면이 나타납니다. 왼쪽에는 이름이 지정된 봇들이, 오른쪽에는 대화창이 있습니다. 각 봇은 클라우드에 자신만의 컴퓨터를 갖게 됩니다.

Morlex - inline image

Opus 5.5 를 사용하기 위해 무언가를 전환할 필요는 없습니다. Grok Bot 팀에 따르면 이는 모든 봇의 기본값입니다. 별도의 Claude 구독도 없습니다.

범용 봇 하나부터 시작해 보세요. 이를 '치프(Chief)'라고 부르겠습니다. 어떤 전문가가 해당 작업을 맡아야 할지 아직 모를 때 메시지를 보내는 대상이 되는 것이 이 봇의 역할입니다.

30 초 안에 결과를 확인할 수 있는 실제 심부름을 맡겨보세요. 이후의 모든 단계는 더 큰 작업을 신뢰하고 맡기는 과정이므로, 처음에는 검증할 수 있는 일부터 시작해야 합니다.

03. 더 강력한 두뇌를 위한 헌장 작성하기

프롬프트는 요청입니다. 봇은 역할입니다. 지속되고, 기억을 쌓으며, 특정 영역을 소유합니다. 따라서 인박스 매니저, 리서치 리드, 세일즈 아웃바운드처럼 직무 이름을 붙여주세요.

Morlex - inline image

그런 다음 신입 사원에게 브리핑하듯 지시하세요. 무엇을 담당하는지, 잘했다는 기준이 무엇인지, 어디서 멈추고 물어봐야 하는지를 말이죠.

Opus 5.5 로 달라지는 점은 다음과 같습니다. 이전 기본 모델을 위해 작성된 헌장은 방어적이었습니다. 짧은 체인, 잦은 확인 절차가 필요했죠. 모델이 몇 단계만 진행해도 멈춰 섰기 때문입니다. 다단계 작업에서 거의 3 배 높은 점수를 받는 두뇌가 있다면, 첫 단계만이 아니라 업무 전체를 통째로 넘길 수 있습니다.

Opus 5.5 는 API 에서 100 만 토큰 컨텍스트 창과 최대 128K 출력 토큰도 지원합니다. Grok Bot 이 이 중 얼마나 노출하는지는 공개되지 않았지만, 이제 핵심은 더 긴 작업입니다.

python
1Opus 5.5 용으로 작성된 헌장 프롬프트
2당신은 나의 리서치 리드입니다.
3
4// 당신이 담당하는 것
5주제가 주어지면 처음부터 끝까지 모든 작업을 수행하세요. 1 차 자료를 찾고,
6인용하는 모든 페이지를 열어보고, 최소 두 개의 출처에서 숫자를 교차 검증한 뒤,
71,500 단어 분량의 요약 보고서를 작성하세요.
8
9// 잘했다는 기준
10모든 숫자 옆에는 링크가 있어야 합니다. 상충되는 출처는 평균을 내지 말고 표시하세요.
11초안은 채팅이 아닌 내 Drive 폴더에 저장되어야 합니다.
12
13// 멈춰야 할 곳
14절대 게시하지 마세요. 누구에게도 이메일을 보내지 마세요. 초안만 작성하세요.
15두 출처가 일치하지 않고 해결할 수 없다면, 보류하고 저에게 물어보세요.

규칙은 이렇습니다. 더 똑똑한 두뇌에게는 더 많은 권한이 아니라 더 많은 단계를 줍니다. "멈춰야 할 곳" 블록은 이전과 똑같이 엄격하게 유지됩니다.

04. 도구를 한 번만 연결하고 데이터 경계선 긋기

Morlex - inline image

Grok Bot 은 원클릭 연결을 지원하는 플러그인 패널을 제공합니다. Notion, Slack, Google Drive, AWS Agents, AWS SageMaker, Browserbase, Composio, Context7 및 사용자 지정 연결이 가능합니다.

연결은 계정 수준입니다. Gmail 을 한 번 연결하면 생성하는 모든 봇이 이를 사용할 수 있습니다. 다섯 번째 봇도 몇 초 만에 생산성을 갖추게 됩니다.

새로운 부분: 이제 여러분의 데이터에는 두 번째 목적지가 생겼습니다. 봇이 Opus 5.5 로 사고할 때, 읽는 내용은 해당 단계를 위해 Anthropic 으로 전송됩니다. Musk 의 게시물 아래 Tom 이 남긴 옵트아웃(거부) 관련 질문에는 아직 답변이 없으며, SpaceXAI 는 무엇이 공유되는지에 대한 약관을 발표하지 않았습니다.

모델이 어디서 실행될지는 선택할 수 없습니다. 하지만 봇이 무엇을 건드릴지는 선택할 수 있습니다. 모든 헌장에 다음을 추가하세요.

python
1// 데이터 경계선 — 모든 헌장에 추가하세요
2다음은 열거나, 읽거나, 요약하지 마세요:
3 - 내 /Legal 또는 /Finance Drive 폴더에 있는 모든 항목
4 - 변호사, 회계사, 은행에서 온 이메일
5 - 비밀번호, 시드 구문, 2FA 코드가 포함된 모든 메시지
6
7작업에 이러한 항목이 필요하다면 멈추고 먼저 저에게 물어보세요.
8문서로 작업할 때는 해당 작업에 필요한 내용만 사용하세요.

실제로 필요한 것만 연결하고 나머지는 건드리지 마세요. 베타 기간 동안 모든 연결은 모든 봇에 도달하며, 이제는 둘 이상의 기업에 도달합니다.

05. 비밀번호가 아닌 로그인 세션만 넘기기

실제 기업 내부 소프트웨어 대부분에는 API 나 MCP 서버가 없습니다. 그럼에도 Grok Bot 이 작동하게 만드는 메커니즘이 바로 이것입니다.

봇은 자신의 클라우드 브라우저를 탐색하다가 로그인 장벽에 부딪히면 화면을 여러분에게 넘깁니다. 여러분이 로그인하고 완료를 클릭하면, 봇은 중단했던 동일한 브라우저 세션에서 다시 작업을 이어갑니다.

봇은 비밀 정보가 아닌 세션을 받습니다. 채팅창에 자격 증명을 입력할 일이 전혀 없으며, 이제 서드파티 모델이 개입하므로 이는 그 어느 때보다 중요합니다. 대화창에 붙여넣은 비밀번호는 모델이 읽는 텍스트가 되지만, 넘겨받은 화면에서 진행된 로그인은 그렇지 않습니다.

반드시 지켜야 할 규칙: 어떤 도구든 메시지에 비밀번호를 붙여넣으라고 요구한다면, 그것은 잘못된 경로입니다.

06. 한 번 보여주고 루틴으로 만들기

봇이 지켜보는 가운데 워크플로를 한 번 직접 수행하여 가르칠 수 있습니다. 봇은 단계를 저장하고 다음번에는 스스로 실행합니다.

Morlex - inline image

처음 녹화하기 가장 좋은 작업은 반복적이고, 여러 도구를 사용하며, 안정적인 것입니다. 매주 수행하고, 두 개 이상의 앱을 오가며, 단계가 거의 변하지 않는 작업이죠. 설명하려면 지루하지만 보여주는 데는 40 초면 충분합니다.

그런 다음 루틴이 실행될 트리거를 부여하세요. 노드 캔버스나 워크플로 빌더 없이 자연어로 설정하는 두 가지 옵션이 있습니다.

python
1// 스케줄 — 아침 브리핑
2매 평일 오전 7 시에 내 캘린더, 받은 편지함,
3#launches Slack 채널을 확인하세요. 오늘의 일정,
4답장이 필요한 사항, 밤사이 변경된 사항을 담은 짧은 브리핑 하나를 작성하세요.
5
6// 트리거 — 수신 메일 캐처
7내 연락처에 없는 도메인에서 이메일이 도착하고
8가격(pricing)이 언급되면, 템플릿을 바탕으로 답장을 작성해 보류하세요.
9
10// 대부분의 루틴을 만드는 단축 명령어
11이걸 매주 실행해.
12 ^ 마음에 든 작업 직후에 이렇게 말하세요.

Opus 5.5 가 진가를 발휘하는 곳: 사이트 레이아웃이 바뀌거나 입력값이 약간 달라지면 루틴은 깨집니다. 다단계 작업에 더 강한 모델은 소리 없이 실패하는 대신 변경된 페이지에서 복구할 가능성이 훨씬 높습니다.

07. Cursor 에이전트를 생성하는 전문가 고용하기

여러 봇을 병렬로 실행하고 각각이 하나의 영역을 담당하게 하세요. 봇을 분리하면 메모리와 컨텍스트도 분리되며, 문제가 발생했을 때 확인할 깔끔한 스레드가 생깁니다. SpaceXAI 는 자사 팀이 영업 아웃리치, 마케팅, 사무 운영, 버그 수정을 위한 봇을 운영한다고 밝혔습니다.

작업 규모가 아닌 영역별로 나누세요. 영수증만 생각하는 경비 관리자는 여러분의 영수증 처리에 능숙해집니다.

새로운 레이어는 Grok Bot 팀 발표에서 덜 주목받은 절반입니다. 봇이 Cursor 의 어떤 모델이든 실행하는 클라우드 에이전트를 생성할 수 있게 되었습니다. 이는 소유권 구조와 맞아떨어집니다. SpaceX 는 8 월에 600 억 달러 규모의 거래로 Cursor 를 인수했습니다.

따라서 코딩 봇은 관리자가 됩니다. Opus 기반 봇이 작업을 계획하고 컨텍스트를 유지합니다. Cursor 에이전트가 병렬로 힘든 작업을 처리합니다. 봇은 돌아온 결과를 검토합니다.

python
1// Repo Maintainer — 에이전트를 관리하는 봇
2당신은 나의 Repo Maintainer 입니다.
3
4GitHub 에서 이슈에 "bug" 라벨이 지정되면:
51. 당신의 컴퓨터에서 재현하고 실패하는 테스트를 작성하세요.
62. Cursor 클라우드 에이전트를 생성해 새 브랜치에서 수정하게 하세요.
73. 결과물에 대해 전체 테스트 스위트를 실행하세요.
84. 테스트, 수정 사항, 3 줄 요약을 포함해 Draft PR 을 여세요.
9
10절대 병합하지 마세요. 절대 main 에 푸시하지 마세요.
11수정 사항이 인증, 결제, 마이그레이션에 영향을 준다면 나를 위해 보류하세요.

X 사용자들은 발표 전부터 이미 이와 유사한 방식을 사용하고 있었습니다. 9 월 말에 Grok Bot 에서 Cursor 클라우드 에이전트를 가동하는 것에 대해 게시물이 올라왔습니다.

https://x.com/mikepat711/status/2103551603102126149

08. 그룹 채팅에 넣기

봇은 서로 메시지를 주고받고 스레드에서 컨텍스트를 공유할 수 있습니다. 여러 봇을 하나의 그룹 채팅에 넣으면 스스로 조율합니다. 작업을 넘기고, 담당자를 지정하며, 판단이 필요한 경우에만 여러분을 끌어들입니다.

SpaceXAI 의 자체 예시: 엔지니어링 봇이 버그를 재현하고 티켓을 등록한 뒤, 두 번째 봇에게 디버깅을 넘깁니다. 한 봇이 다른 봇이 더 적합하다고 판단해 소유권을 넘기는 것은 단일 채팅 도구에서는 불가능한 일입니다.

9 월 말부터 팀은 동료들이 앱이나 Slack 에서 사용할 수 있는 공유 봇을 게시할 수도 있습니다.

비결은 그룹에 작업 목록이 아닌 목표를 주는 것입니다. 작업 목록은 여러분이 이미 분해를 끝냈다는 뜻입니다. 목표는 봇들이 스스로 작업을 나누게 하며, 작업 분해는 정확히 Opus 5.5 가 가장 뛰어난 다단계 추론 영역입니다.

python
1// 작업이 아닌 목표
2목표: 금요일 오후 5 시까지 10 월 뉴스레터를 발행한다.
3
4리서치 리드는 사실과 출처를 담당한다.
5인박스 매니저는 구독자 답장을 담당한다.
6치프는 타임라인을 관리하고 막힌 부분을 나에게 알린다.
7
8스스로 작업을 나누어라. 외부에 공개되는 모든 것은 나를 위해 보류하라.

09. 승인 경계선 긋기

Grok Bot 의 전제는 봇이 처음부터 끝까지 작업을 완료하고, 승인이 필요한 경우에만 돌아온다는 것입니다. 이는 "승인이 필요한 것"을 정의하는 부담을 여러분에게 지웁니다. 봇의 기본값이 여러분의 기준과 다를 수 있기 때문이죠.

Morlex - inline image

효과적인 경계선은 작업의 크기와 무관합니다. 되돌릴 수 있는지와 관련이 있습니다. 봇이 취소할 수 있는 모든 것은 혼자 마무리합니다. 외부에 노출되거나, 돈이 이동하거나, 되돌릴 수 없는 모든 것은 여러분을 위해 보류됩니다.

이는 이제 덜 중요한 것이 아니라 더 중요해졌습니다. 더 강력한 두뇌는 여러분이 그은 선에 닿기 전까지 작업을 훨씬 더 깊이 파고들기 때문에, 그 선을 명확히 해야 합니다.

python
1// 항상 혼자 마무리할 것
2초안 작성 · 파일 정리 · 태그 지정 · 요약 · 조사 · 준비 · 대조
3 모두 되돌릴 수 있는 작업입니다. 묻지 말고 실행한 뒤 기록하세요.
4
5// 항상 나를 위해 보류할 것
6회사 외부 사람에게 무언가를 보내는 행위
7돈을 쓰거나 이동시키거나 가격을 확정하는 행위
8공개적으로 무언가를 게시하는 행위
9명백한 쓰레기가 아닌 것을 삭제하는 행위
10약관에 동의하거나 무언가에 가입하는 행위
11
12// 확신이 없을 때
131 분 안에 되돌릴 수 없다면 보류하고 물어보세요.

모든 봇에 대해 목표로 삼아야 할 형태: 대기 중인 초안 36 개, 발송 0 건. 되돌릴 수 있는 모든 단계를 완료하고, 첫 번째 되돌릴 수 없는 단계에서 완전히 멈추는 것입니다.

10. 비용 주시하고 매주 검토하기

Opus 5.5 는 저렴한 두뇌가 아닙니다. API 기준 Grok 보다 훨씬 비쌉니다.

Morlex - inline image

소규모 작업(입력 30K 토큰, 출력 8K 토큰)의 경우 약 28 센트 대 11 센트입니다. 매우 긴 컨텍스트에서는 순서가 뒤집힙니다. Grok 의 요금은 200K 토큰 이상에서 두 배가 되지만 Opus 는 그대로 유지되기 때문입니다.

Grok Bot 에서는 토큰당 비용을 지불하지 않습니다. 플랜에 포함되어 있습니다. Adam Hincu 가 X 에서 제기한 미해결 질문은, Opus 기반 작업이 플랜 한도를 더 빨리 소진하는지 여부입니다. SpaceXAI 는 이에 대해 언급하지 않았습니다. 따라서 루틴을 추가하기 전 첫 주 동안 사용량을 주시하세요.

Morlex - inline image

또한 발표된 모든 것이 라이브 상태는 아닙니다. Midjourney 와 Suno 는 날짜가 정해지지 않았으며, 출시 첫날 적어도 한 사용자의 봇은 Suno 를 사용할 수 없다고 답했습니다. 확인된 Opus 5.5 를 기반으로 구축하고, 나머지는 기다리세요.

그리고 매주 15 분씩 캘린더에 잡아 봇들이 스스로 보고하게 하세요.

python
1이번 주에 실행한 모든 루틴을 나열하세요. 각 루틴에 대해:
2
3 - 몇 번 실행되었는지
4 - 무엇을 생성했는지
5 - 건너뛰었거나, 실패했거나, 추측해야 했던 부분
6 - 나를 위해 보류했지만 내가 답하지 않은 항목
7
8그런 다음 어떤 것이 가장 쓸모없었는지, 왜 그런지 말해주세요.
9어떤 모델이 특정 단계를 처리했는지 알 수 없다면 그렇게 말하세요.

각 루틴당 하나의 결과물을 직접 샘플 검사하세요. 봇이 자기 작업을 스스로 평가하는 것은 여러분이 가진 것과 동일한 사각지대를 갖습니다.

결론: 하니스가 곧 제품이다

3 년간 질문은 "어떤 모델이 최고인가"였습니다. 이번 주, 시장에서 가장 공격적인 모델 빌더는 다른 질문에 답했습니다. "어떤 하니스가 최고인가"라는 질문에 답한 뒤, 그 안에 경쟁사의 두뇌를 집어넣었죠.

이것이 바로 변화입니다. 하니스가 컴퓨터, 로그인, 메모리, 루틴을 소유합니다. 두뇌는 그 아래에서 교체 가능하며, 지금 당장 에이전트 작업에 가장 적합한 두뇌는 Opus 5.5 입니다.

여러분의 역할은 변하지 않습니다. 무엇을 위임할지, 봇의 권한이 어디서 끝나는지, 어떤 데이터를 건드릴 수 있는지 결정하는 것은 여러분입니다. 이 세 가지를 모두 헌장에 적어두고, 시장에서 가장 강력한 두뇌가 클릭하게 하세요.

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기