Fable 5.1 — це звір. І спалює токени він теж як звір.
Ось як скоротити витрати токенів за допомогою чотирьох команд та безкоштовних відкритих репозиторіїв, які зменшують їх ще більше.
Усе це не впливає на якість результату. Це змінює те, за що ви платите, отримуючи той самий результат.
І все це працює незалежно від того, чи використовуєте ви Fable 5.1, тому що вартість токенів накопичується однаково, яку б модель ви не запускали.
Почнемо.
Крок 1: Знизьте рівень зусиль.
Це найбільший секрет, і це налаштування, яке ви можете контролювати в кожному запиті.
Існує п'ять рівнів: low, medium, high, xhigh та max.
Рівень зусиль контролює, скільки модель міркує перед тим, як відповісти. Вищий рівень означає більше обдумування перед відповіддю, що коштує більше токенів, незалежно від того, чи потребувало завдання такого обдумування.
Ось як про це думати. Рівень зусиль — це скільки часу ви даєте комусь подумати перед відповіддю. Запитайте будь-кого, скільки буде 2+2, і вони скажуть «4». Попросіть їх спочатку напружено думати десять хвилин, і ви заплатите за десять хвилин роздумів, щоб отримати те саме «4».
Ну... більшість завдань — це 2+2.
Рекомендації Anthropic для Fable 5.1 такі: починайте з high, що є стандартним. Підвищуйте до xhigh або max лише для найчутливіших до можливостей завдань з кодування та агентної роботи. Знижуйте до medium або low для рутинних або чутливих до затримок завдань, після того, як підтверджено, що нижчий рівень все ще зберігає якість.

Цифри вражають. На CursorBench Fable 5.1 з низьким рівнем зусиль показав вищий результат, ніж Fable 5 з високим рівнем зусиль, при цьому коштуючи втричі дешевше.
Перевірте це, перш ніж довіряти. Виберіть завдання, правильна відповідь на яке вже відома, а потім запустіть його на низькому рівні.
"Виконай цей запит з низьким рівнем зусиль і скажи, що змінилося у відповіді"
Використовуйте одне зі своїх реальних завдань. Порівняйте результати безпосередньо, перш ніж припускати, що низький рівень зусиль означає гірші результати. Залишайте складні речі, багатокрокові міркування, справжнє налагодження, все, де неправильна відповідь коштуватиме часу пізніше, на рівні high або вище.
Крок 2: Запустіть cost-optimize.
Ця функція з'явилася 26 серпня як частина навички claude-api. Вона аналізує недавнє використання та ранжує важелі вартості, які мають значення для конкретного проєкту.
1/claude-api cost-optimize
Вона перевіряє кешування, гігієну токенів, пакетну обробку, рівень зусиль та вибір моделі, саме в такому порядку. Кешування та гігієна токенів зазвичай є найдешевшими виправленнями і окупаються найшвидше, перш ніж вона запропонує щось структурне, як-от зміна моделі.

Кожна пропозиція затверджується або пропускається по одній. Нічого не змінюється без підтвердження, тому ризику переписати вашу конфігурацію немає.
Крок 3: Запустіть prompt-audit.
Промпти та навички з часом накопичують сміття.
Думайте про це як про шухляду для мотлоху. Кожне редагування додає туди щось нове, і ви ніколи її не чистите. Тільки ця «шухляда» бере з вас токени за кожен запит, назавжди, поки сміття не буде видалено.
1/claude-api prompt-audit

Запустіть це в будь-якій папці з навичками, яка у вас є. Старі навички, ті, які ви, ймовірно, редагували знову і знову, саме там він знаходить найбільше відходів. Кожне редагування додавало щось, не видаляючи те, що воно замінило. Запустіть це, і ви помітите різницю.
Крок 4: Мігруйте старі API-конфігурації.
Якщо проєкт все ще використовує конфігурацію, створену для старішої моделі, ця команда виконує заміну ідентифікатора моделі, а також будь-які критичні зміни параметрів у всій кодовій базі.
1/claude-api migrate this project to claude-fable-5-1
Назвіть цільову модель. Спочатку вона підтверджує обсяг — всю робочу директорію, одну піддиректорію або конкретний список файлів — перш ніж щось редагувати. Потім вона повертає вам контрольний список того, що залишилося перевірити вручну.
Чотири репозиторії для ще більшого скорочення витрат.
Вони не є специфічними для Fable 5.1. На будь-якій моделі застосовується та сама економія токенів, тому корисно знати, що існує і що кожен з них насправді робить.
Caveman

Стискає власні відповіді моделі в короткі, телеграфні відповіді замість багатослівних.
Встановлення:
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
RTK

Проксі на Rust, який стискає вивід команд оболонки, перш ніж він потрапить у контекст моделі.
Встановлення:
1brew install rtk2rtk init -g
Ponytail

Змушує агента писати менше коду з самого початку. Погляд старшого розробника, який обирає один рядок замість п'ятдесяти.
Встановлення:
1/plugin marketplace add DietrichGebert/ponytail2/plugin install ponytail@ponytail
CodeGraph

Цей працює зовсім інакше. Замість стиснення тексту він будує граф знань кодової бази, тому агент може запитувати зв'язки символів та графи викликів безпосередньо, а не сканувати файли за допомогою grep та read.
Встановлення:
1npx @colbymchenry/codegraph2cd your-project3codegraph init -i
З чого почати.
Якщо більше нічого не робити, виконайте Крок 1. Знизьте рівень зусиль для наступного рутинного завдання та порівняйте результат. Це одне налаштування робить для ваших кредитів більше, ніж будь-який репозиторій, і спробувати його нічого не коштує.
Потім запустіть cost-optimize та prompt-audit для будь-якого з ваших проєктів.
Чотири підтверджені налаштування від власної команди Anthropic перевершують все, що встановлено з репозиторію. Після цього вивчайте ширшу екосистему за допомогою чотирьох репозиторіїв, які я вам надав.
Якщо це заощадило вам токени/гроші, поставте лайк і поділіться цим зі своєю мережею.
Побачимось у наступному :)





