Fable 5.1 의 토큰 낭비를 막는 방법

@dr_cintas
영어2026년 9월 02일
180K
68
6
1
210

TL;DR

Alvaro Cintas 가 추론 노력 수준, 프롬프트 위생, 특수 압축 도구에 중점을 둔 Fable 5.1 토큰 소비 최적화 워크플로우를 공유합니다.

Fable 5.1은 정말 대단한 모델입니다. 그리고 그만큼 토큰도 엄청 소모하죠.

여기 네 가지 명령어와, 이를 더욱 개선해주는 무료 오픈소스 저장소를 사용해 토큰 낭비를 줄이는 방법을 소개합니다.

이 모든 방법은 출력 품질에는 전혀 영향을 주지 않습니다. 동일한 결과에 대해 지불하는 비용만 바뀝니다.

그리고 Fable 5.1을 사용하든 그렇지 않든 모두 적용할 수 있습니다. 토큰 비용은 어떤 모델을 실행하든 동일한 방식으로 계산되기 때문입니다.

그럼 시작해보겠습니다.

1단계: 노력 수준을 낮추세요.

이것은 가장 큰 효과를 볼 수 있는 방법이며, 모든 요청에서 제어할 수 있는 설정입니다.

low, medium, high, xhigh, max의 다섯 가지 수준이 있습니다.

노력 수준은 모델이 답변하기 전에 추론하는 정도를 제어합니다. 노력 수준이 높을수록 응답 전에 더 많은 사고 과정을 거치며, 작업에 그러한 사고가 실제로 필요하지 않더라도 더 많은 토큰을 소비하게 됩니다.

이렇게 생각해보세요. 노력 수준은 누군가에게 답을 허용하기 전에 생각할 시간을 얼마나 주는지와 같습니다. 누구에게 2+2가 무엇인지 물어보면 "4"라고 대답합니다. 하지만 10분 동안 골똘히 생각하게 한 후에 답을 들으려면, 동일한 "4"라는 답을 얻기 위해 10분 동안의 사고 비용을 지불해야 합니다.

음... 대부분의 작업은 2+2와 같습니다.

Anthropic의 Fable 5.1 가이드라인은 다음과 같습니다: 기본값인 high부터 시작하세요. 가장 능력에 민감한 코딩 및 에이전트 작업에만 xhigh 또는 max로 올리세요. 일상적이거나 지연 시간에 민감한 작업의 경우, 낮은 수준에서도 품질이 유지된다는 것이 확인되면 medium 또는 low로 낮추세요.

Alvaro Cintas - inline image

수치는 놀랍습니다. CursorBench에서 Fable 5.1의 low 노력 수준 점수는 Fable 5의 high 노력 수준 점수보다 높았으며, 비용은 3분의 1에 불과했습니다.

믿기 전에 테스트해보세요. 정답을 이미 알고 있는 작업을 선택한 다음, low로 실행해보세요.

"이 요청을 낮은 노력 수준으로 실행하고 응답에서 무엇이 바뀌었는지 알려줘"

실제 작업 중 하나를 사용하세요. low 노력 수준이 더 나쁜 결과를 의미한다고 가정하기 전에 출력을 직접 비교하세요. 복잡한 작업, 다단계 추론, 실제 디버깅 등 잘못된 답변이 나중에 시간을 낭비할 수 있는 작업은 high 이상으로 유지하세요.

2단계: 비용 최적화를 실행하세요.

이 기능은 claude-api 스킬의 일부로 8월 26일에 출시되었습니다. 최근 사용량을 분석하여 특정 프로젝트에 중요한 비용 절감 요소의 순위를 매깁니다.

bash
1/claude-api cost-optimize

캐싱, 토큰 위생, 배치 처리, 노력 수준, 모델 선택 순서로 확인합니다. 캐싱과 토큰 위생은 일반적으로 가장 저렴한 수정 사항이며, 모델 전환과 같은 구조적인 변경을 제안하기 전에 가장 빠르게 효과를 봅니다.

Alvaro Cintas - inline image

각 제안은 하나씩 승인되거나 건너뜁니다. 확인 없이는 아무것도 변경되지 않으므로 설정이 다시 작성될 위험이 없습니다.

3단계: 프롬프트 감사를 실행하세요.

프롬프트와 스킬은 시간이 지남에 따라 잡동사니가 쌓입니다.

서랍을 생각해보세요. 편집할 때마다 하나씩 더 넣지만, 치우지는 않습니다. 하지만 이 "서랍"은 잡동사니가 제거될 때까지 모든 요청에 대해 토큰을 계속 청구합니다.

bash
1/claude-api prompt-audit
Alvaro Cintas - inline image

가지고 있는 모든 Skills 폴더에서 실행하세요. 반복해서 편집했을 법한 오래된 스킬들이 가장 많은 낭비를 발견하는 곳입니다. 모든 편집은 대체된 것을 제거하지 않고 새로운 것을 추가했습니다. 이것을 실행하면 차이점을 느낄 수 있을 것입니다.

4단계: 이전 API 구성을 마이그레이션하세요.

프로젝트가 이전 모델용으로 구축된 구성을 여전히 사용하고 있다면, 이 명령어는 코드베이스 전체에서 모델 ID 교체와 주요 매개변수 변경 사항을 처리합니다.

bash
1/claude-api migrate this project to claude-fable-5-1

실제 대상 모델 이름을 지정하세요. 먼저 범위(전체 작업 디렉토리, 하위 디렉토리 하나, 또는 특정 파일 목록)를 확인한 후에 편집을 시작합니다. 그런 다음 수동으로 확인해야 할 항목의 체크리스트를 반환합니다.

낭비를 더욱 줄여주는 네 가지 저장소

이것들은 Fable 5.1에만 국한되지 않습니다. 어떤 모델에서든 동일한 토큰 절약 효과가 적용되므로, 어떤 것들이 있고 각각 실제로 무엇을 하는지 아는 것이 좋습니다.

Caveman

Alvaro Cintas - inline image

모델 자체의 응답을 장황한 대신 짧고 전보 스타일의 응답으로 압축합니다.

설정:

bash
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash

RTK

Alvaro Cintas - inline image

셸 명령 출력이 모델의 컨텍스트에 도달하기 전에 압축하는 Rust 프록시입니다.

설정:

bash
1brew install rtk
2rtk init -g

Ponytail

Alvaro Cintas - inline image

에이전트가 처음부터 더 적은 코드를 작성하도록 만듭니다. 하나의 라인을 50개보다 선택하는 시니어 개발자 관점입니다.

설정:

bash
1/plugin marketplace add DietrichGebert/ponytail
2/plugin install ponytail@ponytail

CodeGraph

Alvaro Cintas - inline image

이것은 완전히 다르게 작동합니다. 텍스트를 압축하는 대신 코드베이스의 지식 그래프를 구축하여, 에이전트가 grep과 read로 파일을 스캔하는 대신 기호 관계와 호출 그래프를 직접 쿼리할 수 있도록 합니다.

설정:

bash
1npx @colbymchenry/codegraph
2cd your-project
3codegraph init -i

어디서부터 시작해야 할까요.

다른 것을 하지 않더라도 1단계를 수행하세요. 다음 일상적인 작업의 노력 수준을 낮추고 출력을 비교해보세요. 이 하나의 설정이 어떤 저장소보다 크레딧에 더 큰 영향을 미치며, 시도하는 데 비용이 전혀 들지 않습니다.

그런 다음 프로젝트에서 cost-optimizeprompt-audit을 실행하세요.

Anthropic 자체 팀의 네 가지 확인된 설정은 저장소에서 설치하는 어떤 것보다 뛰어납니다. 그 후에 제가 알려드린 네 가지 저장소와 함께 더 넓은 생태계를 살펴보세요.

이 글이 토큰/비용을 절약하는 데 도움이 되었다면, 좋아요를 누르고 네트워크와 공유해주세요.

다음 글에서 뵙겠습니다 :)

YouMind에서 다시 만들기

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기