AI 검색을 활용해 Claude Code 비용을 5배 절감하는 방법

@d0znpp
영어2026년 8월 19일
535K
351
130
47
148

TL;DR

이 글에서는 AI 에이전트에게 단순한 프롬프트 대신 기존 코드 레퍼런스를 제공함으로써 Claude Code 토큰 비용을 획기적으로 줄이고 정확도를 높이는 방법을 살펴봅니다.

기다릴 수 없고 이 게시물을 바로 읽고 싶다면, 지금 바로 이 프롬프트를 Claude Code / Codex / Grok에 복사해서 붙여넣으세요:

XERJ를 설치하고 (문서:

https://xerj.org/llms.txt ), 이 프로젝트의 소스를 인덱싱한 다음, 참조 코딩을 설정하세요: 우리가 구축하는 것과 가장 가까운 오픈소스 저장소를 클론하고 인덱싱한 후, 코드를 작성하기 전에 그들이 문제를 어떻게 해결했는지 검색하세요.

대부분의 사람들은 Claude Code를 비싼 인턴처럼 사용합니다. 여기서는 매 턴마다 진짜로 더 똑똑하게 만드는 방법을 알려드립니다.

당신이 작업을 건네면, Claude가 몇 가지 질문을 합니다. 저장소를 뒤지고, 코드가 어떻게 동작하는지 추측하고, 구현을 작성합니다. 그러면 뭔가가 깨집니다. 에러를 붙여넣으면, 다시 작성합니다. 또 다른 뭔가가 깨집니다.

이 모든 턴은 당신이 지불한 토큰입니다.

그리고 Claude가 막히는 이유는 보통 문제가 어려워서가 아닙니다. 이미 어딘가에 존재하는 답을 다시 찾아내도록 만들었기 때문입니다. 그 답은 당신의 저장소나, 이미 수천 명의 개발자가 엣지 케이스를 찾아낸 오픈소스 프로젝트에 있을 수도 있습니다.

XERJ가 이걸 제대로 테스트했습니다. 8개의 코딩 작업, 4개의 언어, 설정별 16회 실행, 토큰 수는 Claude -p에서 직접 가져왔습니다.

메모리에서: 260,916 출력 토큰 참조에서: 9,982 출력 토큰

Ivan Novikov - inline image

메모리는 16개 중 11개를 해결했습니다. 참조는 16개 모두 해결했습니다.

그러니 집중해서 아래 내용을 꼭 읽어보세요 ↓↓↓

당신이 비용을 지불하는 루프

Ivan Novikov - inline image

일반적인 세션은 이렇게 진행됩니다.

당신이 원하는 것을 설명합니다. Claude가 탐색합니다. 당신의 패턴, 에러 처리, 데이터 형태에 대해 가정을 합니다. 그 가정을 바탕으로 코드를 작성합니다. 어딘가에서 가정이 틀려서 문제가 생기고, 당신이 에러를 설명하면 다시 작성합니다. 그리고 당신이 처음에 머릿속에 그렸던 결과물이 나올 때까지 이 과정을 반복합니다.

사람들은 이 루프를 보고 Claude가 코딩을 못한다고 생각합니다. 하지만 그 반대입니다. Claude는 작동하는 예제를 가져와 새로운 상황에 적용하는 데 매우 능숙합니다. 루프가 발생하는 이유는 방 안에 예제가 없기 때문입니다. 그래서 세션의 전반부를 예제를 재구성하는 데 사용합니다.

출력 토큰은 비싼 편이며, Claude 모델에서 입력보다 약 5배 높은 가격이 책정됩니다. 따라서 이 루프의 각 순환은 최고 요금으로 청구됩니다.

프롬프트와 참조는 같은 것이 아닙니다

Ivan Novikov - inline image

프롬프트는 명령입니다. 참조는 증거입니다.

Ivan Novikov - inline image

당신이 그 결과물이 어떻게 동작해야 하는지에 대해 2,000단어를 써도, Claude는 그 설명을 구현으로 번역한 다음, 당신이 빠뜨린 모든 것을 추측해야 합니다.

작동하는 구현에는 당신이 절대 적어두지 않을 부분들이 이미 포함되어 있습니다.

아키텍처, 에러 처리, 재시도 로직, 2년 전 프로덕션에서 누군가가 마주친 엣지 케이스, 함수가 그렇게 나뉘어진 이유

당신이 프롬프트에서 그것들을 언급하지 않은 것은 그것들이 중요하다는 것을 몰랐기 때문입니다.

가장 극명한 예시가 있습니다. 컴파일러는 결국 메서드 이름을 알려줄 것입니다. 함수가 push가 아니라 absorb라고 불린다는 것을 알려주고, 거기까지 가는 데 20~25배의 토큰을 소모할 것입니다. 하지만 컴파일러는 계약(contract)을 절대 알려주지 않습니다. 당신의 툴체인 중 어느 것도 이 구조체를 읽기 전에 봉인(seal)해야 한다고 알려주지 않습니다. 그 규칙은 라이브러리를 작성한 사람의 머리와 함수 본문 안에 존재하며, 아무리 많은 프롬프트를 작성해도 복구할 수 없습니다. 왜냐하면 당신이 그 존재 자체를 모르기 때문입니다.

Ivan Novikov - inline image

이것이 바로 토큰을 줄이면서 동시에 품질을 높이는 이유입니다. 더 유용한 컨텍스트가 들어가고, 추측이 줄어들며, 재시도 횟수가 감소합니다.

테스트 결과

grep 기반 설정과 비교했을 때, 참조 코딩은 동일한 8개 작업에서 2.7배 적은 출력 토큰을 사용했습니다. 전체 비용은 메모리 사용 시 $11.18, grep 사용 시 $3.27, 참조 사용 시 $1.58이었습니다.

Ivan Novikov - inline image

grep이 해결책처럼 보이지만 대부분 그렇지 않습니다. grep은 에이전트에게 어디를 봐야 하는지 알려주지만, 에이전트는 여전히 컨텍스트를 이해하기 위해 파일을 읽어 들여야 합니다. 이 연구의 한 코퍼스(corpus)는 정확히 그 작업을 수행하는 데 106만 개의 입력 토큰을 가져왔습니다. 더 저렴한 토큰이지만 엄청난 양이며, 당신이 기다려야 했던 모든 에이전트 턴이 포함됩니다.

그리고 더 큰 규모의 실행이 있습니다. 이 연구를 위해 5개 언어로 처음부터 작성된 13개의 라이브러리로, 각각 컴파일되고 자체 테스트를 통과하며, 각각 컴파일러가 경고할 수 없는 런타임 규칙을 가지고 있습니다. 의도적으로 그렇게 만들었습니다. 모델이 이미 기억하고 있는 코드에 대해 검색을 테스트할 수 없기 때문입니다.

Ivan Novikov - inline image

메모리만으로: 21개 중 1개 성공 검색 사용: 21개 중 21개 성공

$21.90 대 $3.38.

단순히 더 저렴한 결과가 아니라 완전히 다른 결과입니다.

가장 명확한 예시는 Java 작업입니다. 추가 전용 원장(append-only ledger)을 만들고, 재생(replay) 전에 봉인(seal)하며, 체크포인트로 잘라내기(truncate)하는 것입니다. 메모리만으로는 전체를 재발명하여 503줄, 약 36,000 토큰을 사용했지만, 잘라내기 의미론(truncation semantics)이 틀려서 테스트에 실패했습니다. 참조를 제공하자 4줄, 103 토큰만 작성했고 통과했습니다.

언어별 차이는 가치가 어디에 있는지 보여줍니다. Python: 14,752에서 214로 감소. C: 18,792에서 988로 감소. Java: 27,108에서 98로 감소. JavaScript는 4,300에서 646으로만 감소했는데, 접두사 트라이(prefix trie)는 잘 알려진 구조이고 모델이 이미 답을 절반쯤 알고 있었기 때문입니다.

Ivan Novikov - inline image

일상적인 작업에서 XERJ를 실행하는 개발자들은 대략 5배 적은 토큰을 사용한다고 보고합니다. 이는 벤치마크보다는 자체 보고된 수치이므로, 최고 기록이 아닌 최소 기준으로 보는 것이 좋습니다.

더 긴 프롬프트가 이 문제를 해결하지 못하는 이유

한동안 나쁜 출력에 대한 해결책은 항상 같았습니다. 더 나은 프롬프트를 작성하세요. 더 많은 컨텍스트를 추가하세요. 아키텍처를 설명하세요.

그리고 때로는 효과가 있습니다.

하지만 프롬프트는 당신이 아직 작성하지 않은 솔루션을 설명하는 것입니다. 참조는 누군가가 이미 출시하고 디버깅한 솔루션입니다. 새벽 3시에 유지보수 담당자가 속도 제한에 걸려 급하게 패치한 재시도 로직을 설명만으로 만들어낼 수는 없습니다.

코드는 이미 거기에 있습니다. 그 코드에 담긴 결정 사항을 설명할 필요가 없습니다.

참조를 찾는 것이 실제 작업입니다

Ivan Novikov - inline image

바로 여기서 문제가 발생합니다.

수동으로 하려면 GitHub을 열고, 절반쯤 일치하는 저장소를 읽어보고, 오래된 풀 리퀘스트를 뒤지고, 8개월 전의 자신의 코드베이스를 열어 파일 이름을 기억해내려고 애써야 합니다. 사용 가능한 무언가를 찾을 때쯤이면 이미 기능을 직접 작성할 수 있었을 것입니다.

따라서 검색은 저렴해야 합니다. 그렇지 않으면 아무도 두 번 하지 않습니다.

바로 이것이 XERJ의 목적입니다. 코드를 인덱싱하고 파일 이름이나 키워드 대신 해결하려는 문제로 검색할 수 있게 한 다음, 일치하는 구현을 꺼내 Claude에 바로 전달할 수 있는 참조로 제공합니다. https://xerj.org

실행 방법

Ivan Novikov - inline image

1) 설치 프롬프트를 Claude Code 세션에 복사/붙여넣기

XERJ를 설치하고 (문서:

https://xerj.org/llms.txt ), 이 프로젝트의 소스를 인덱싱한 다음, 참조 코딩을 설정하세요: 우리가 구축하는 것과 가장 가까운 오픈소스 저장소를 클론하고 인덱싱한 후, 코드를 작성하기 전에 그들이 문제를 어떻게 해결했는지 검색하세요.

2) 코딩 에이전트의 응답을 확인하고 참조용으로 클론할 프로젝트를 제안하세요

당신이 무엇을 구축하든, 같은 일을 하는 다른 사람이 누구인지 항상 알고 있습니다. 이 단계에서 Claude Code가 이미 일부 프로젝트를 찾을 것이며, 당신이 선택하여 더 추가할 수 있습니다. 보통 5~10개면 충분하지만, 코딩하는 내용에 따라 다릅니다.

3) 다음 제품 기능을 만들고 결과를 확인하세요

그냥 진행하고 새로운 결과를 즐기십시오(또는 그렇지 않을 수도 있습니다). 언제든지 낭비적인 코딩으로 돌아갈 수 있지만, 차이점을 즉시 확인할 수 있을 것이라고 확신합니다.

4) 계속 작동하게 하고 피드백으로 커뮤니티를 도우세요

이 방식으로 완료하는 모든 작업은 다음 작업의 참조가 됩니다. 라이브러리는 축적됩니다. 언제든지

건너뛰어야 할 때

모델이 이미 코드를 알고 있다면, 이것은 세금일 뿐입니다. 하지만 자주 있는 경우는 아닙니다.

Ivan Novikov - inline image

그들도 그것을 측정했습니다. Valkey와 Memcached에서, Claude가 분명히 학습한 실제 공개 코드로 말입니다. 메모리만으로는 $1.49에 6개 중 6개를 성공시켰습니다. 검색은 $4.40에 6개 중 5개를 성공시켰습니다. 더 비싸고 아무것도 안 한 것보다 세 배나 많은 비용이 들었습니다.

따라서 기준선은 한쪽에는 비공개, 독점 또는 진정으로 낯선 코드가 있고, 다른 쪽에는 모델이 이미 학습한 모든 것이 있습니다.

Ivan Novikov - inline image

당신이 구축하는 것이 이전에 한 번도 구축된 적이 없다면, 가리킬 것이 없으므로 다시 설명하는 방식으로 돌아가야 합니다.

참조가 당신이 사용하지 않는 프레임워크 버전에 대해 작성되었다면, 절약하는 것보다 더 많은 비용이 듭니다.

그리고 작업이 네 줄짜리라면, 그냥 작성하세요.

여전히 열려 있는 과제

13개의 라이브러리는 연구를 위해 구축되었기 때문에, 구조상 낯설고 또한 규모가 작습니다. 아직 아무도 진정으로 큰 비공개 코드베이스에 대해 이것을 실행하지 않았습니다. 예상되는 바는 grep 비용이 트리 크기에 따라 증가하는 반면 검색 비용은 일정하게 유지되므로 그 차이가 더 벌어질 것이라는 점이지만, 누군가 측정하기 전까지는 추측일 뿐입니다.

위의 모든 수치는 XERJ 자체의 공개된 벤치마크에서 나왔으며, 원시 실행 데이터는 저장소에 있습니다. https://xerj.org/case-studies/reference-coding

결론

다른 모델이 필요하지 않으며 Claude Code를 떠날 필요도 없습니다.

매 작업을 제로에서 시작하는 것을 멈춰야 합니다. 당신이 구축하는 것은 아마도 당신의 저장소 어딘가나 2년 전에 이미 문제를 해결한 오픈소스 프로젝트에 이미 존재할 가능성이 높기 때문입니다.

누군가 이미 해결했다면, Claude에게 그들의 코드를 건네주고 그것을 기반으로 작업하게 하세요. 그리고 그것은 당신에게 아무런 비용도 들지 않습니다. 단 하나의 프롬프트만 있으면 됩니다.

https://xerj.org

Ivan Novikov - inline image
원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기