Як витрачати у 5 разів менше на Claude Code за допомогою AI-пошуку

@d0znpp
АНГЛІЙСЬКА19 серп. 2026 р.
535K
351
130
47
148

Коротко

У цій статті розглядається, як значно зменшити витрати на токени Claude Code та підвищити точність роботи, надаючи AI-агентам посилання на існуючий код замість простих запитів.

Якщо ви не можете дочекатися і читаєте цей пост, просто скопіюйте/вставте цей запит у свій claude code / codex / grok прямо зараз, щоб отримати його негайно:

Встанови XERJ (документація:

https://xerj.org/llms.txt ), проіндексуй джерела цього проєкту та налаштуй референсне кодування: клонуй та проіндексуй найближчі до нашого проєкту open-source репозиторії та шукай, як вони вирішували проблему, перш ніж писати код.

більшість людей запускають claude code як дорогого стажера, а ось як зробити його розумнішим з кожним кроком (насправді)

ви даєте йому завдання. він ставить кілька запитань. він грепає репозиторій, здогадується, як працює ваш код, пише реалізацію, щось ламається. ви вставляєте помилку. він переписує. щось інше ламається.

кожен такий крок — це токени, за які ви заплатили.

і claude зазвичай застрягає не тому, що проблема складна. він застрягає, тому що ви змушуєте його заново відкривати відповідь, яка вже десь існує, або у вашому власному репозиторії, або в open-source проєкті, де кілька тисяч розробників вже знайшли крайові випадки.

XERJ ретельно це перевірив. 8 завдань з кодування, 4 мови, 16 запусків на кожну конфігурацію, кількість токенів взята безпосередньо з claude -p.

з пам'яті: 260 916 вихідних токенів з референсу: 9 982 вихідних токенів

Ivan Novikov - inline image

пам'ять вирішила 11 з 16 завдань. референс вирішив усі 16.

тому зосередьтеся і прочитайте це ↓↓↓

цикл, за який ви платите

Ivan Novikov - inline image

звичайна сесія виглядає так.

ви описуєте, що хочете. claude досліджує. він робить припущення щодо ваших шаблонів, обробки помилок, структури ваших даних. він пише код на основі цього припущення. припущення десь виявляється хибним, тому щось ламається, ви пояснюєте помилку, він переписує, і ви знову проходите коло, доки результат не збігатиметься з тим, що було у вас в голові на початку.

люди сприймають цей цикл як те, що claude погано кодує. це навпаки. claude дуже добре вміє брати робочий приклад і адаптувати його до нової ситуації. Цикл виникає, коли в кімнаті немає прикладу, тому він витрачає першу половину сесії на його відтворення.

вихідні токени є найдорожчими, їх ціна приблизно в 5 разів вища за вхідні на моделях claude. Тож кожне коло цього циклу оплачується за найвищим тарифом.

запит і референс — це не одне й те саме

Ivan Novikov - inline image

запит — це інструкція. референс — це доказ.

Ivan Novikov - inline image

ви можете написати дві тисячі слів, точно описуючи, як має поводитися річ, але claude все одно доведеться перекласти цей опис у реалізацію, а потім гадати про все, що ви пропустили.

робоча реалізація вже містить частини, які ви ніколи б не записали

архітектуру, обробку помилок, логіку повторних спроб, крайовий випадок, на який хтось натрапив у продакшені два роки тому, причину, чому функція розділена саме так

ви не згадували про це в запиті, тому що не знали, що це важливо.

ось найгостріша версія цього. компілятор з часом видасть назву методу. Він скаже вам, що функція називається absorb, а не push, і візьме за це в 20-25 разів більше токенів. Компілятор ніколи не видасть контракт. Жоден інструмент у вашому наборі не скаже вам, що цю структуру потрібно запечатати, перш ніж її можна буде читати. Це правило живе в голові того, хто написав бібліотеку, і в тілі функції, і жодна кількість написання запитів його не відновить, тому що ви не знаєте, що воно існує.

Ivan Novikov - inline image

Ось чому це одночасно скорочує токени та підвищує якість. Більше корисного контексту всередину, менше здогадок, менше повторних спроб.

що показали тести

Порівняно з конфігурацією на основі grep, референсне кодування використало у 2,7 рази менше вихідних токенів на тих самих 8 завданнях. Загальна вартість у різних сценаріях склала: $11,18 з пам'яті, $3,27 з grep, $1,58 з референсом.

Ivan Novikov - inline image

grep виглядає як рішення, але здебільшого ним не є. grep каже агенту, куди дивитися, а потім агенту все одно потрібно прочитати файл у контексті, щоб його зрозуміти. Один корпус у цьому дослідженні використав 1,06 мільйона вхідних токенів саме для цього. Дешевші токени, але величезна їх кількість, плюс кожен крок агента, який ви чекали.

Потім був більший запуск. 13 бібліотек, написаних з нуля для дослідження, 5 мовами, кожна компілюється та проходить власні тести, кожна містить правило часу виконання, про яке компілятор не може вас попередити. Побудовано так навмисно, тому що ви не можете перевірити пошук на коді, який модель вже запам'ятала.

Ivan Novikov - inline image

без нічого, з пам'яті: 1 з 21 з пошуком: 21 з 21

$21,90 проти $3,38.

Це інший результат, а не дешевший.

Найчистіший приклад у цьому — завдання на Java. Побудувати реєстр лише з додаванням, запечатати перед відтворенням, скоротити до контрольної точки. З пам'яті він перевинайшов усе, 503 рядки, приблизно 36 000 токенів, неправильна семантика скорочення, не пройшов тест. Отримавши референс, він написав чотири рядки. 103 токени. Пройшов.

Розподіл за мовами показує, де знаходиться цінність. Python з 14 752 до 214. C з 18 792 до 988. Java з 27 108 до 98. JavaScript лише з 4 300 до 646, тому що префіксне дерево — це відома структура, і модель вже наполовину знала відповідь.

Ivan Novikov - inline image

Розробники, які використовують XERJ у звичайній щоденній роботі, повідомляють приблизно про в 5 разів менше токенів. Це самозвітні дані, а не бенчмарк, тому сприймайте це як мінімум, а не як основний показник.

чому довший запит не вирішує цього

Деякий час відповіддю на поганий результат завжди було одне й те саме. Напишіть кращий запит. Додайте більше контексту. Поясніть архітектуру.

І іноді це працює.

Але запит — це ви описуєте рішення, яке ще не написали. Референс — це рішення, яке хтось уже запустив і налагодив. Ви не можете описати логіку повторних спроб, яка існує лише тому, що супроводжувач отримав обмеження швидкості о 3-й ночі та нашвидкуруч виправив це.

Код вже є. Вам не потрібно пояснювати рішення, які в нього були закладені.

пошук референсу — це власне і є робота

Ivan Novikov - inline image

Ось де все розвалюється.

Робити це вручну означає відкривати GitHub, читати репозиторії, які лише частково підходять, копатися в старих pull request, потім відкривати власну кодову базу восьмимісячної давнини та намагатися згадати, як ви назвали файл. До того часу, як ви знайдете щось корисне, ви могли б вже написати функціонал.

Тому пошук має бути дешевим, інакше ніхто не робитиме це двічі.

Саме для цього існує XERJ. Він індексує код і дозволяє шукати за проблемою, яку ви вирішуєте, а не за іменем файлу чи ключовим словом, а потім витягує відповідну реалізацію як референс, який ви можете передати безпосередньо claude. https://xerj.org

як це запустити

Ivan Novikov - inline image

1) скопіюйте/вставте запит на встановлення в сесію claude code

Встанови XERJ (документація:

https://xerj.org/llms.txt ), проіндексуй джерела цього проєкту та налаштуй референсне кодування: клонуй та проіндексуй найближчі до нашого проєкту open-source репозиторії та шукай, як вони вирішували проблему, перш ніж писати код.

2) перевірте відповідь вашого кодувального агента та запропонуйте проєкти для клонування як референси

Незалежно від того, що ви будуєте, ви завжди знаєте, хто ще робить те саме. Деякі проєкти вже будуть знайдені claude code на цьому етапі, і ви можете додати більше на свій вибір. 5-10 зазвичай достатньо, але це залежить від того, що ви кодуєте.

3) створіть наступну функцію продукту та перевірте результати

Просто дозвольте цьому працювати та насолоджуйтеся (або ні) новими результатами. Ви завжди можете повернутися до марнотратного кодування, але я впевнений, що ви побачите різницю миттєво.

4) підтримуйте це в роботі та допомагайте спільноті своїми відгуками

Кожне завдання, виконане таким чином, стає референсом для наступного. Бібліотека накопичується. Будь-коли, коли

коли це пропустити

Якщо модель вже знає код, це лише податок і нічого більше. Однак це нечастий випадок.

Ivan Novikov - inline image

Вони виміряли це також на valkey та memcached, реальному публічному коді, на якому claude точно навчався. З пам'яті отримано 6 з 6 за $1,49. Пошук отримав 5 з 6 за $4,40. Він прийшов останнім і коштував утричі дорожче, ніж нічого не робити.

Отже, межа проходить між закритим, власницьким або справді незнайомим кодом з одного боку, та всім іншим, що модель вже «з'їла», з іншого.

Ivan Novikov - inline image

Якщо те, що ви будуєте, ніколи раніше не було побудовано, нема на що вказувати, і ви повертаєтеся до його опису.

Якщо референс написаний для версії фреймворку, яку ви не використовуєте, це коштує більше, ніж економить.

І якщо завдання складається з чотирьох рядків, просто напишіть його.

що ще залишається відкритим

13 бібліотек були створені для дослідження, що робить їх незнайомими за конструкцією, а також невеликими. Ніхто ще не запускав це на справді великій закритій кодовій базі. Очікується, що розрив там збільшиться, оскільки вартість grep зростає з розміром дерева, тоді як пошук залишається стабільним, але це лише припущення, поки хтось це не виміряє.

Кожне число вище взято з опублікованого бенчмарку XERJ, необроблені дані кожного запуску в їхньому репозиторії. https://xerj.org/case-studies/reference-coding

висновок

Вам не потрібна інша модель, і вам не потрібно залишати claude code.

Вам потрібно перестати починати кожне завдання з нуля, тому що те, що ви будуєте, ймовірно, вже існує десь у вашому репозиторії або в open-source проєкті, який вирішив це два роки тому.

Якщо хтось уже вирішив це, передайте claude їхній код і дозвольте йому працювати з цього. І це нічого вам не коштує, лише один запит

https://xerj.org

Ivan Novikov - inline image
Збереження в один клік

Використовуйте YouMind для AI-глибокого читання віральних статей

Зберігайте джерела, ставте цілеспрямовані запитання, підсумовуйте аргументи та перетворюйте віральні статті на корисні нотатки в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей