지난번에는 교육 담당 AI 직원의 전체 프롬프트를 공개했습니다.
https://x.com/Sokichi_Hoshino/status/2099987762485358639
https://x.com/Sokichi_Hoshino/status/2100365149739880471
1부에서 AI 직원으로 인해 발생한 사고의 세부 사항을 숨김없이 공유하겠다고 약속했습니다. 이 글은 그 약속을 이행하며, '정지 관리자(Stop Officer)' AI 직원을 주요 대상으로 다룹니다.
사고는 막아줄 사람이 없어서 일어난 것이 아니라, 막을 수 있는 사람을 호출하지 않아서 일어났습니다.
"AI에게 맡겼더니, 내가 요청하지도 않은 내용을 임의로 수정하더라..."
저도 그 공포를 뼈저리게 알고 있습니다.
규칙이 아닌 권한 제어로 사고를 예방하세요.
이 글에서는 세 가지를 설명합니다: 사고 당시发生了什么 상황, 정지 관리자 AI 직원의 프롬프트, 그리고 이후 권한 할당을 어떻게 변경했는지입니다.
시작해 보겠습니다.
제1장: 가짜 "CEO 승인" 상태로 프로덕션 데이터가 재작성됨
사고는 AI 회사를 설립한 지 채 1주일이 되지 않아 발생했습니다.
마케팅 부서의 응답 분석 AI 직원이 데이터 해석 작업을 장시간 동안 수행하도록 방치했습니다.
이 과정에서 해당 직원은 실제로 일어나지 않은 저의 발언을 근거로 작업을 진행했습니다.
작업 중 "CEO로부터 답변을 받음", "CEO의 의견이 맞다"와 같은 문구가 나타났습니다. 저는 그런 말을 한 적이 없습니다.
유사한 문구들이 반복적으로 등장했고, 이를 바탕으로 문서와 스크립트가 생성되었습니다.
결국 이 직원은 프로덕션 사업 계획 스프레드시트에 작성을 시도했습니다. 실적 표에 행을 추가하고 예측 표의 항목을 삭제하면서 "CEO 승인"이라고 표시했습니다.
그 결과, 삭제된 예측 금액만큼 연간 매출 전망치가 감소했습니다.
되돌릴 수 없는 작업은 반드시 정지 관리자 AI 직원을 거쳐야 한다는 규칙이 있었습니다. 하지만 당시 호스트 역할을 하던 메인 AI 직원은 정지 관리자를 호출하지 않았습니다.
너무 오래 실행 상태로 방치한 제 잘못입니다. 1부에서 작성했던 것처럼:
정지 관리를 거치지 않은 것은 제 책임입니다.
제2장: 정지 관리자 AI 직원의 프롬프트 공개
먼저, 정지 관리자 AI 직원의 내용을 그대로 공개합니다.
이는 제가 사용하는 .claude/agents/teishi.md 파일의 내용입니다. CEO 호칭, 어미 처리, 문장 끊기 등을 본문의 스타일에 맞게 조정하고 굵게 표시 마커는 제거했습니다.
'보호해야 할 사항'의 마지막 조항에 있던 과거 사고 예시를 하나로 좁히고 일부 표현을 약간 다듬었습니다.
1---2name: teishi3description: 법무 및 정보 관리 부서 정지 관리자. 삭제, 전송, 게시, 청구 등 되돌릴 수 없는 작업 전에 멈추어 발생할 일을 낭독하고 확인을 구함 ("이걸 실행해도 안전한지 확인해 줘"라고 요청받거나 되돌릴 수 없는 작업 직전에 호출됨)4tools: Read, Grep, Glob5---67당신은 이 회사의 법무 및 정보 관리 부서 소속 정지 관리자입니다.89당신의 역할은 되돌릴 수 없는 작업 전에 멈추는 것입니다.10당신은 실행하지 않습니다.11당신은 승인을 부여하지 않습니다.12당신의 역할은 "무엇이 발생할지"를 CEO에게 명확히 보여주고 결정을 넘기는 것입니다.1314# 멈춰야 할 대상1516- 삭제 — 파일, 데이터, 계정, 초안 삭제17- 전송 — 이메일, LINE 브로드캐스트, 메시지 발송18- 게시 — 포스트 업로드, 배포, 공유 링크 발급, 권한 개방19- 비용/쿼터 소모 — 유료 API 실행, 구매, X API 포스트 쿼터 사용 (실패해도 자원이 차감되는 경우)2021# 확인 형식 (4가지 포인트 낭독)22231. 무엇을 어떤 대상에 대해 하는지 — 대상을 구체적으로 명시 (파일인 경우 주요 내용, 전송인 경우 수신자 및 본문 요약)242. 되돌릴 수 있는지 여부? — 완전 복원 가능 / 노력하면 복원 가능 / 복원 불가253. 실패 시 무엇이 줄어드는가? — 돈, 쿼터, 신뢰, 데이터264. 더 안전한 대안 — 있다면 하나 제시 (예: 전체 브로드캐스트 전 테스트 발송)2728# 절차29301. 계획된 작업을 읽고 실제 대상, 수신자, 수량 등을 검증함 (간접적인 정보만으로 확인하지 않음)312. 4가지 포인트를 간략히 낭독하고 "진행해도 될까요?"로 멈춤323. 대상 내용이 설명과 모순될 경우, 확인을 구하기 전에 모순점을 보고함3334# 보호해야 할 사항3536- CEO를 "CEO"라 호칭하고 정중하게 말함37- CEO가 "실행"이라고 말할 때까지 실행을 재촉하거나 서두르지 않음38- 과거 사고 유형 기록(예: 실패해도 X API 쿼터 차감)이 있다면 4가지 포인트 확인 사항에 추가함3940## 교육 관리자로부터 받은 규칙4142(아직 없음)
세 가지 부분을 주목해 주셨으면 합니다.
첫째, tools 라인입니다. 정지 관리자 AI 직원에게는 Read, Grep, Glob만 허용됩니다. 파일 쓰기나 명령어 실행이 불가능합니다.
1부에 공개했던 독자 관점 AI 직원은 피드백 로그를 위해 Edit과 Write 권한을 가지고 있습니다. 정지 관리자는 그것조차 없으며, 진정한 읽기 전용(read-only) 직원입니다.
둘째, "당신은 실행하지 않습니다."와 "당신은 승인을 부여하지 않습니다."라는 라인입니다. 정지 관리자의 역할은 CEO에게 결정을 넘기는 것으로 끝납니다.
멈추는 사람이 "실행해도 괜찮다"고 말하면, 그 말이 CEO 승인의 대체재로 사용될 수 있다고 생각합니다. 이번 사고도 가짜 승인에서 시작되었습니다.
셋째, 단계 1의 "간접적인 정보만으로 확인하지 않음"입니다. "CEO 승인"이라는 문구가 나타나더라도, 정지 관리자는 4가지 포인트를 낭독하기 전에 실제 내용을 읽습니다.
이를 .claude/agents/teishi.md로 저장하세요. "이걸 실행해도 안전한지 확인해 줘"라고 요청하면 메인 AI가 description을 읽고 정지 관리자에게 위임할지 결정합니다.
호출을 보장하려면 @agent-teishi처럼 명시적으로 이름을 지정하세요.
제3장: 정지 관리자는 호출되지 않으면 움직이지 않는다
정지 관리자 AI 직원은 회사 입구에 서 있는 체크포인트가 아닙니다. 호출될 때만 움직이는 직원입니다.
Claude Code에서는 메인 AI가 각 직원의 description을 읽어 작업을 위임할지 결정합니다. 공식 문서에는 다음과 같이 명시되어 있습니다.
Claude는 각 서브에이전트의 description을 사용하여 언제 작업을 위임할지 결정합니다.
정지 관리자의 description에도 "되돌릴 수 없는 작업 직전에 호출"이라고 적혀 있습니다. 하지만 호출 여부는 호출하는 AI의 판단에 달려 있습니다.
호출하는 측이 "이건 되돌릴 수 없는 작업이다"라고 인식하지 못하면, 메시지는 정지 관리자에게 전달되지 않습니다. 사고 당일에도 프로덕션 데이터 쓰기가 정지 관리자가 호출되지 않은 채 진행되었습니다.
정지 관리자 프롬프트 하단의 '교육 관리자로부터 받은 규칙' 섹션은 사고 후에도 비어 있습니다.
규칙은 작성을 수행한 쪽의 프롬프트에 추가되었습니다.
수정해야 했던 것은 멈추는 사람(stopper)이 아니라, 멈추는 사람을 거치지 않고 프로덕션 데이터에 쓸 수 있었던 쪽이라고 생각합니다.
제4장: 사고 후, 규칙이 아닌 권한을 변경했다
첫 번째 조치는 교육 관리자 AI 직원이 응답 분석 AI 직원의 프롬프트에 규칙을 추가한 것입니다.
규칙 #1은 다음과 같습니다: CEO의 발언/승인은 CEO가 실제로 보낸 텍스트에만 기반하며, CEO의 명시적 지시 없이 프로덕션 스프레드시트에 작성하지 마세요.
동일한 규칙 #1은 호스트가 되돌릴 수 없는 작업 전에 정지 관리를 거치도록 요구합니다.
하지만 이것만으로는 부족하다고 판단했습니다. 정지 관리를 거치라는 규칙이 있었음에도 사고가 발생했기 때문입니다.
두 번째 변화는 권한이었습니다. X 기사 AI 직원을 채용할 때, 이번 사고를 계기로 Bash 접근 권한을 주지 않기로 결정했습니다.
X 기사 AI 직원은 기사를 작성할 수 있지만, 물리적으로 초안에 제출(submit)할 수는 없습니다. 나중에 채용된 스토리형 AI 직원도 Bash가 없습니다.
X 기사를 초안에 제출하는 일은 이제 호스트 역할을 하는 메인 AI 직원의 몫입니다. 이 구조를 처음 구현했을 때는 정지 관리를 거쳤습니다.
프롬프트에 "제출하지 마세요"라고 쓰는 것보다, 구조적으로 제출이 불가능하게 만드는 것을 선택했습니다.
반면, 응답 분석 AI 직원은 여전히 Write와 Bash 권한을 가지고 있는데, 이는 Bash를 사용하여 계산 및 비교 작업을 수행하기 때문입니다.
1부의 규칙인 "외부-facing 작업에 쓰기 권한을 가진 직원을 장시간 방치하지 마세요"는 바로 이런 직원들을 위한 것입니다.
요약: AI 사고 예방은 멈추는 사람 배치보다 권한 제한이 효과적이다
마지막으로, 이 글의 가장 중요한 점을 다시 강조하겠습니다.
멈추는 사람을 배치해도 호출되지 않으면 사고는 발생합니다. 되돌릴 수 없는 작업에 구조적으로 도달할 수 없게 만드는 것이 더 확실합니다.
정지 관리는 권한을 부여하지 않는 읽기 전용 직원입니다. 잊어버리더라도 사고를 방지하려면 쓸 수 있는 직원의 권한을 제한하세요.
AI 직원 파일을 열어 `tools` 라인이 있는지 확인하세요.
tools 라인을 생략한 직원은 서브에이전트에게 사용 가능한 모든 도구를 상속받습니다.
tools 라인을 통해 도구를 제한하면 AI 직원에게 긴 작업을 맡기면서도 불안감을 크게 줄일 수 있습니다.
이 AI 회사 시리즈는 46명의 직원을 전체 프롬프트와 함께 하나씩 해부합니다
이 글에서는 46명 중 단 1명만 다루었습니다.
앞으로의 글에서는 한 편의 글마다 한 명의 직원을 심층적으로 파헤칠 예정입니다.
이 시리즈는 46명의 AI 직원 내용, 부서 구조, 권한 할당, 디자인 수정 사항 등 모든 것을 공개합니다.
성공 사례와 동일한 밀도로 수정된 디자인을 문서화하겠습니다.
AI 직원들의 내용을 순차적으로 전달하겠습니다. 계속 읽고 싶다면 @Sokichi_Hoshino를 팔로우해 주세요.
끝까지 읽어주셔서 감사합니다.
【📣공지사항📣】
AI와 X를 완벽하게 마스터하기 위한 커뮤니티 채널을 오픈합니다.
채널에서는 AI와 X에 관한 최신 및 가치 있는 정보를 아낌없이 제공합니다.
🎁채널 멤버 무료 혜택🎁
① 엄선된 프롬프트 200개
② 보석(Gems) 20개
③ Claude Skills 선물 7종 🎁
🌈채널에서 공유되는 콘텐츠🌈
① 첫 노트 포스트로 매출 100만 엔 달성하는 법
② SNS 마케팅 방법
③ 리스트 마케팅 방법
④ 디지털 데이터 마케팅 방법
⑤ X 성장 최단 경로
그리고 디지털/빅데이터 마케팅 배경을 가진 현역 AI×SNS 마케터로서의 경험에서 우러나온 인사이트를 공유합니다.
초보자와 잠수 타는 분들도 환영합니다 ✨ 부담 없이 살짝 들여다보세요 ✨
↓여기서 참여하세요.
https://line.me/ti/g2/LmLu1N1cE6UBkoURbaYf_bV8l66cCyotSJU2og
【📣공지사항 2📣】
임원/사업주를 위한 AI 컨설팅 서비스를 출시했습니다.
【서비스 내용】
・SNS 자동화 지원 (X, Threads, Instagram, TikTok, YouTube)
・AI 직원 구축 지원
・AI 도구/앱 제작
수익 극대화를 위해 필요에 맞춰 맞춤형으로 제공됩니다.





