AI가 10일 만에 200만 줄의 코드를 작성했다. 진짜 어려운 점은 따로 있었다.

@FranzUndFranz
영어1일 전 · 2026년 7월 25일
634K
235
15
24
52

TL;DR

고처리량 AI 코딩을 위해서는 세션 불안정성, 미묘한 버그, 확장 비용을 효과적으로 관리하기 위한 인간의 철저한 준비와 오케스트레이션이 필수적입니다.

지난 3주는 AI 기반 소프트웨어 개발에서 제가 경험한 가장 많은 것을 깨닫게 해준 시간이었습니다.

Claude Fable이 다시 등장했고, 같은 기간에 OpenAI는 Sol, Terra, Luna와 함께 GPT-5.6을 출시했습니다. 시장 신호는 분명했습니다. 최첨단 연구소들은 더 이상 단독적인 혁신을 출시하는 것이 아니라, 성능, 가격 계층, 배포 주기 사이의 격차를 압축하고 있습니다. Anthropic은 이제 Fable 5를 최고급 장기 모델로 Opus 5의 정가 대비 약 두 배 가격에 판매하고 있으며, OpenAI는 GPT-5.6을 플래그십 성능에서 더 비용 민감한 작업까지 확장되는 제품군으로 포지셔닝하고 있습니다. 한편 xAI는 Grok 4.5의 가격을 공격적으로 책정하여 비용 대비 성능 논의에서 진지하게 고려해야 할 수준으로 만들었습니다.

하지만 그 몇 주 동안 내가 배운 가장 중요한 것은 출시 페이지나 벤치마크 슬라이드와는 거의 관련이 없었습니다.

내 환경에서 진정한 돌파구는 준비에 있었습니다.

우리는 스토리를 준비했습니다. 작업을 에이전트 코딩 시스템이 실제로 실행할 수 있는 조각으로 나누었습니다. 그 대기열이 생기자 처리량이 엄청나게 증가했습니다. Codex, Claude, Cursor, Grok 및 워크플로의 다른 도구들을 통해 약 10일 동안 200만 줄 이상의 코드가 작성되었습니다. 이 숫자는 가능하게 만든 요소를 보기 전까지는 과장처럼 들릴 수 있습니다. 마법이나 추상적인 자율성이 아니라, 모델이 계속 움직일 수 있도록 충분한 구조를 가진 제한된 작업의 꾸준한 흐름이었습니다.

이것이 여전히 많은 사람들이 놓치고 있는 첫 번째 사실입니다. 출력 폭발은 모델이 갑자기 자기 주도적인 엔지니어가 되었기 때문에 일어나는 것이 아닙니다. 인간이 전장을 준비했기 때문에 일어납니다.

두 번째로 배운 점은 버그가 마케팅에서 인정하는 것보다 훨씬 빠르게 규모에 따라 나타난다는 것입니다.

Codex가 좋은 예입니다. 장기 실행 작업에 대한 OpenAI의 자료는 지속적인 스레드에 트레이드오프가 있음을 분명히 합니다. 연속성은 유용하지만, 장기 실행 스레드는 새로 시작하는 것보다 더 비싸고 관리하기 어려워질 수 있습니다. Goals 기능은 모든 어려운 작업을 계속 커지는 프롬프트로 만드는 대신, 스레드를 제한된 목표에 고정시키도록 설계되었습니다. 실제로 이는 제가 본 것과 일치합니다. 프로세스가 너무 오래 실행되면 중지하고, 깔끔한 인계를 요청하고, 세션을 다시 시작하고, 새로운 목표로 계속하는 것이 더 나은 패턴인 경우가 많습니다. 이는 단순한 편의가 아닙니다. 종종 운영 위생입니다.

또한 더 구체적인 Codex 문제가 있으며, 이제 공개적으로 문서화된 흔적이 있습니다: 서브 에이전트 및 로컬 상태 폭발입니다.

공개 이슈 #34061은 재개된 부모 스레드가 수천 개의 자식 JSONL 로그와 수백 기가바이트의 지속된 세션 기록을 생성한 사례를 문서화합니다. 다른 이슈는 fork_context=true가 큰 부모 기록을 자식 에이전트에 스냅샷하여 정확성 위험과 토큰 소모를 증폭시킬 수 있다고 명시적으로 경고합니다. 또 다른 공개 보고서는 ~/.codex에 대규모 SQLite 로그와 세션 상태가 축적되면 Codex 콜드 스타트가 1~5분 대기로 저하됨을 보여줍니다. 종합하면, 이러한 보고서는 많은 고급 사용자가 즉시 인식할 수 있는 실패 모드를 설명합니다: on. 일단 로컬 메타데이터 레이어가 충분히 커지면 세션 지속성이 제품 경험의 심각한 부분이 됩니다.

이것이 중요한 이유는 멀티 에이전트 코딩이 항상 데모에서는 스트레스가 많은 개발 머신에서보다 더 좋아 보이기 때문입니다.

약속은 분명합니다. OpenAI의 멀티 에이전트 문서는 병렬 서브 에이전트가 독립적인 작업 흐름을 가속화할 수 있는 이유를 설명하며, 그 약속은 현실적입니다. 하지만 동일한 문서는 서브 에이전트가 토큰 사용량을 증가시키고 공유 가변 상태에 대한 빈번한 쓰기가 포함된 작업에는 적합하지 않을 수 있다고 경고합니다. ChatGPT Learn의 병렬 에이전트 가이드는 더욱 명확합니다. 탐색, 테스트, 분류, 요약과 같은 읽기 중심 작업으로 시작하고, 충돌과 조정 오버헤드가 빠르게 증가하기 때문에 쓰기 중심 흐름에는 더 신중해야 합니다. 그 경고는 이론적이지 않습니다. 여러 에이전트가 동시에 전체 테스트 스위트로 돌진하는 것을 본 사람이라면 그 의미를 정확히 알 것입니다.

내 설정에서 이것은 이제 전체 카테고리의 정의적인 운영 문제 중 하나입니다.

문제는 모델이 병렬화할 만큼 똑똑한지 여부가 아닙니다. 그들은 분명히 그렇습니다. 문제는 그들이 훨씬 더 나은 오케스트레이션 경계를 여전히 필요로 한다는 것입니다. 왜냐하면 '위임할 만큼 똑똑한 것'은 '경쟁 상황에서 머신 건강, 로컬 우선순위 및 비용 규율을 유지할 만큼 똑똑한 것'과 같지 않기 때문입니다.

동일한 불일치가 가격 책정에서 나타납니다.

Cursor가 이 문제를 깔끔하게 보여줍니다. 현재 가격 책정은 투명합니다. 두 개의 월별 사용 풀이 있으며, 하나는 Cursor 자체 모델용이고 다른 하나는 타사 'Other Models'용입니다. 또한 Auto가 단일한 것이 아님을 보여줍니다. Auto Cost는 고정 토큰 가격을 사용하지만, Balance와 Intelligence는 라우팅된 모델의 요율로 청구되며, 라우터는 Composer, GPT-5.6, Claude 또는 Grok과 같은 모델 중에서 선택할 수 있습니다. 가끔 대화형 작업을 하는 사람들에게는 그 유연성이 매력적입니다. 폭발적인 산업용 워크로드의 경우 함정이 될 수 있습니다. 한 달의 프리미엄 예산이 며칠의 생산적인 작업으로 사라질 수 있습니다.

나는 한 리뷰가 많은 시나리오에서 정확히 그 실패 모드를 테스트했습니다.

한 프로젝트에서 약 50만 줄의 새로운 코드가 추가되었습니다. 리뷰 시스템은 중복 및 오탐지를 포함하여 해당 변경 사항에서 약 1,500개의 문제를 플래그했습니다. Cursor CLI가 이를 처리하는 작업을 맡았습니다. 원시 토큰 양은 엄청났습니다. 출력은 유용했습니다. 하지만 경제성은 제 사용 사례에 맞지 않았습니다. 집중적인 리뷰 및 수정 작업이 한 달 할당량을 일주일 만에 소모할 수 있다면, 도구는 여전히 좋을 수 있지만 구독은 의미가 없어집니다.

그 긴장감은 이제 어디에나 있습니다.

Claude는 여전히 제가 가장 즐겨 사용하는 시스템입니다. 하지만 동시에 비용을 가장 의식하게 만드는 시스템이기도 합니다. Codex, 특히 더 넓은 GPT-5.6 생태계에서는 비판론자들이 인정하는 것보다 훨씬 더 많은 처리량을 제공할 수 있습니다. Grok 4.5는 농담이 아닙니다. 공개 가격과 포지셔닝으로 인해 합법적인 경쟁자가 되었습니다. Anthropic의 자체 가격 책정은 Fable 대 Opus의 트레이드오프를 거의 사설을 써줄 정도로 명확하게 만듭니다. 최첨단 성능은 있지만, 청구서도 함께 있습니다.

그리고 가장 어려운 문제가 있습니다. 어떤 출시 이벤트도 실제로 해결하지 못하는 문제입니다.

제가 사용하는 거의 모든 최첨단 코딩 모델에서 성능 부족과 과도한 엔지니어링 사이에 여전히 실망스러운 간격이 있습니다.

선택은 종종 충분히 생각하지 않는 모델과 당면한 작업에 대해 너무 많이 생각하는 모델 사이에서 이루어집니다. Anthropic의 Fable 5 가이드는 이를 효과적으로 인정합니다. 더 높은 노력은 과도하게 계획할 수 있으며, 일상적인 작업은 낮은 노력의 혜택을 볼 수 있고, 간결한 지침이 비대한 스캐폴딩보다 더 나은 성과를 낼 수 있다고 말합니다. OpenAI도 GPT-5.6 가이드에서 비슷한 내용을 말합니다. 이전 모델에서 마이그레이션할 때 동일한 추론 수준으로 시작한 다음 한 단계 낮은 수준을 테스트하십시오. 새로운 모델이 더 적은 토큰으로 품질을 유지하거나 개선할 수 있는 경우가 많기 때문입니다. 이는 우리 중 많은 사람들이 경험적으로 발견하고 있는 동일한 사실을 기술적으로 표현한 것입니다. 노력 다이얼은 여전히 너무 쉽게 초과 설정됩니다.

아마도 그 일부는 여전히 우리에게 달려 있을 수 있습니다.

아마도 지침 파일이 너무 길 수 있습니다. 아마도 일부 스캐폴딩이 이제 모델을 돕는 대신 방해하고 있을 수 있습니다. 그 이론은 적어도 Anthropic의 컨텍스트 엔지니어링 가이드와 일치합니다. 이 가이드는 컨텍스트가 정보를 제공하지만 간결해야 한다고 말합니다. 우리가 모델 탓으로 돌리는 과도한 복잡성 중 일부가 지나치게 성장한 프롬프트 인프라에 의해 증폭되고 있을 가능성이 있습니다.

하지만 그 점을 고려하더라도 더 넓은 결론은 변하지 않습니다.

모델은 이전보다 명백한 실수를 덜 하고 있습니다. 하지만 여전히 저지르는 실수는 정확히 발견하기 어렵기 때문에 더 위험한 경우가 많습니다. 그 실수는 그 외에는 세련되고 신중하며 전문적으로 보이는 코드 안에 숨어 있습니다. 구현이 멀리서 볼수록 더 좋아 보일수록, 저는 더 의심스러워지는 법을 배웠습니다.

그래서 저는 현재의 AI 코딩 승리주의 물결에 대해 회의적입니다.

과대광고가 어디서 오는지 이해합니다. 매일 이러한 시스템 안에서 살지 않았다면 처리량만으로도 기적처럼 느껴질 수 있습니다. 그리고 일부는 진정으로 그렇습니다. 하지만 매일 직접 사용하면 다른 면도 드러납니다. 청구 불확실성, 오케스트레이션 실패, 장기 세션의 취약성, 얕은 단순화나 정교한 과잉 설계 중 하나로 치우치는 경향, 그리고 인간의 포장, 검토 및 판단에 대한 지속적인 필요성입니다.

우리는 여전히 이상적인 LLM 코딩 세계에서 매우 멀리 떨어져 있습니다.

과대광고가 완전히 틀린 것은 아닙니다. 하지만 운영 현실보다는 훨씬 덜 정직합니다.

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기