Що насправді міститься у рахунку від OpenAI чи Anthropic, які знижки вони публікують, але які неможливо отримати через чат-вікно, і чому шар, що має до них доступ, щойно став тим, чим ви можете володіти.
Запитайте більшість людей, скільки коштує їм ШІ, і вони назвуть суму місячної підписки.
Запитайте, скільки коштує одна розмова, і в кімнаті запанує тиша, що цілком справедливо, адже чесна відповідь є складною. І OpenAI, і Anthropic нараховують оплату за одиницю, яку ви не бачите, цінують її за чотирма окремими параметрами та публікують у своїй документації набір знижок, які майже повністю недоступні, якщо ви сидите перед текстовим полем.
Нічого з цього не приховано. Усе це вже зараз доступно на їхніх сторінках цін та в документації для розробників. Просто потрібно бути на один рівень нижче, ніж перебуває більшість людей.
Цей розрив між опублікованим прайсом і ціною, яку платить звичайна людина, — не скандал. Це бізнес, і до недавнього часу у вас не було способу опинитися по інший бік цього процесу.
Ця стаття пояснює, що насправді містить рахунок, чому реальні важелі впливу знаходяться саме там, де вони знаходяться, і що змінюється, коли шар, який тягне за ці важелі, стає чимось, чим можна володіти, а не лише за що можна платити. Якщо хочете більше подібних матеріалів про ШІ та власність, підпишіться на @MossAI_Official.
7 речей у вашому рахунку, прямо з їхньої документації
Усе наведене нижче опубліковано OpenAI або Anthropic. Майже нічого з цього не є загальновідомим поза межами інженерних команд. Ставки постійно змінюються, тому сприймайте цифри як ілюстрацію структури, а не як точні котирування.
- Вартість виведення (output) у кілька разів перевищує вартість введення (input) на обох платформах
Кожна модель в обох прайс-листах тарифікує введення та виведення окремо, причому виведення завжди дорожче. Співвідношення зазвичай становить від чотирьох до шести разів.

Практичне переосмислення — найважливіша частина. Те, що ви вводите, майже безкоштовне. Те, що модель повертає у відповідь, — це і є ваш рахунок. Обмеження довжини відповіді економить значно більше коштів, ніж скорочення питання, що суперечить поведінці майже всіх користувачів.
2. Вам нараховують плату за міркування, які вам не дозволено читати
Це той пункт, який справді повинен вас здивувати.
У власній документації OpenAI зазначено, що токени міркувань не відображаються як текст відповіді, але враховуються у використанні виведення та тарифікуються як токени виведення. Тому коротка видима відповідь може використовувати більше токенів, ніж здається з тексту на екрані. Їхнє керівництво щодо моделей міркування підтверджує, що сирі токени міркування не надаються, лише їх необов’язкове резюме.
Ви платите ставки за виведення за текст, який структурно не можете побачити.
3. Ваш ліміт на виведення не обмежує приховану частину
Тут стає ще гостріше. Документація щодо запуску цих моделей зазначає, що параметр максимальної кількості токенів виведення обмежує лише видимий вихід, тоді як приховані токени міркування не підлягають цьому обмеженню.
Звідси випливає документований наслідок. Запит може витратити весь бюджет на етапі міркування і повернути порожню відповідь, при цьому токени вже списані. Керівництво OpenAI щодо міркування безпосередньо визнає цей результат, зазначаючи, що ви можете понести витрати на вхідні токени та токени міркування, не отримавши видимої відповіді.
Лічильник працює, екран залишається порожнім, і це задокументована поведінка системи, а не помилка.
4. Повторний контекст отримує знижку 90%, і обидва провайдери про це повідомляють
Кешування запитів (prompt caching) — найбільший одиночний важіль впливу у всьому стеку, про який більшість людей навіть не чула.
Документація Anthropic щодо кешування встановлює, що читання з кешу коштує 0,1 базової ціни за вхідні дані, запис у кеш на 5 хвилин — 1,25 рази, а запис на 1 годину — 2 рази. OpenAI застосовує аналогічну схему для поточного сімейства GPT-5, оцінюючи кешовані вхідні дані приблизно в 10% стандартної ставки за вхід, причому запис у кеш має свою надбавку.
Арифметика тут найкорисніша. При читанні за ціною 0,1 і записі за 1,25, промах кешу коштує приблизно в дванадцять з половиною разів дорожче, ніж влучання для того ж префікса, а точка беззбитковості настає приблизно після двох читань. Для будь-якого додатку, який повторно надсилає однаковий системний запит, схему інструментів або референсний документ при кожному виклику, це і є вся різниця між малим і великим рахунком.

Це також крихка система, про що варто знати. Обидва провайдери кешують за точним збігом префікса, тому зміна одного байта високо в запиті робить недійсним усе, що нижче, і ціна мовчки повертається до повної ставки.
5. Обидва провайдери зменшать рахунок удвічі для роботи, яка може почекати
OpenAI та Anthropic мають асинхронний пакетний режим (batch tier) зі знижкою 50% на вхідні та вихідні дані. У документації з цін Anthropic явно зазначено, що множники кешування накладаються на пакетну знижку.
Якщо поєднати їх, кешований вхідний токен у пакетному режимі коштуватиме крихітну частку від стандартної ціни. Це не працює для інтерактивних завдань, саме тому жоден споживчий продукт не надає вам до цього доступу.
6. Знижка залежить від того, на якому ID моделі ви закріплені, а не від того, якою моделлю ви думаєте, що користуєтесь
Ось деталь, яку майже ніхто не перевіряє.
Знижка за кешування не є однорідною у всьому каталозі провайдера. В OpenAI поточні сімейства GPT-5 отримують приблизно 90% знижки на кешовані вхідні дані, тоді як моделі попередніх поколінь мають значно меншу знижку. В Anthropic стандартний множник читання з кешу становить 0,1 базової вхідної ціни, причому деякі новіші моделі йдуть ще далі.
Той самий провайдер, та сама назва функції, але суттєво різна економіка залежно від рядка у вашій конфігурації. ID застарілих моделей гірші, ніж здається. Моделі Anthropic, які вже вийшли з використання, але все ще доступні через хмарних партнерів, несуть свої оригінальні ставки, які можуть бути в кілька разів вищими за поточну ціну за менш потужну модель.
Хтось встановив цей рядок один раз, і ніхто до нього не повертався. Саме там ховається несподівана переплата.
7. Перетин порогу контексту може переглянути ціну всього запиту
Найтонша деталь із найнеприємнішою формою.
OpenAI публікує окремі ставки для довгого контексту на деяких моделях, і механізм діє не так, як люди припускають. Вище порогу переоцінюється весь запит, а не лише токени, що перевищують ліміт. Один токен понад межу — і весь виклик коштує приблизно вдвічі дорожче.
Anthropic зайняла іншу позицію. На останніх моделях Claude повне вікно контексту тарифікується за стандартними ставками за токен, а знижки за кешування та пакетний режим застосовуються до всього вікна.
Це справжня структурна відмінність між двома платформами, і вона невидима з будь-якого споживчого інтерфейсу. Якщо ваше навантаження використовує довгі контексти, це може переважити всі інші міркування щодо ціни.

Важелі є публічними. Але ви все одно не можете до них дістатися.
Ось головний структурний момент.
Кожен важіль, згаданий вище, живе на рівні API. Щоб досягти їх, потрібен контроль над структурою запиту, щоб кеш дійсно спрацьовував; маршрутизація моделей, щоб правильне завдання потрапляло на правильний ціновий рівень; пакетна обробка для роботи, яка терпить затримки; контроль зусиль на міркування та усвідомлення, на якому рівні контексту опиняється запит.
Зі споживчого чат-інтерфейсу у вас є текстове поле і щомісячна плата. Ви не можете налаштувати маршрутизацію, пакетну обробку, структурувати префікс кешу і не бачите, скільки коштує ваш поточний рівень зусиль на міркування.
Тому існує розрив. З одного боку — те, чого досягає компетентний оператор, комбінуючи ці можливості. З іншого — те, що платить звичайний користувач. Нікого не обманюють. Ці знижки — це інженерні поверхні, а не споживчі функції, і споживчі продукти не створені для їх розкриття.
Бізнеси, які живуть у цьому розриві, — це ретранслятори (relays), шлюзи (gateways) та агрегатори. Вони сидять між користувачами та провайдерами, направляють запити на найдешевшу достатню модель, тримають кеш теплим, щоб повторний контекст не купувався повторно за повною ціною, пакетують те, що можна пакетувати, і дають користувачеві щось простіше, ніж сирий API.
Їхній дохід — це цей розрив. І ось тут починається цікаве.

Ретранслятор — це бізнес пропускної здатності, і це рідкість у цій сфері
Більшість речей на цьому ринку — це ставки. Ви маєте думку, ви праві або ні, і результат коливається.
Ретранслятор — це платний пункт. Потік проходить, маржа накопичується за одиницю, і економіка масштабується разом із використанням, а не залежно від того, чи хтось був правий.
З цього випливають три властивості, і всі три є незвичними.
Дохід є одиничним і безперервним. Не нерівномірним, не прив’язаним до подій, не залежним від того, піде рішення в правильному напрямку. Токени течуть, маржа накопичується, година за годиною.
Попит не корельований з криптою. Люди, які пишуть код, генерують відео та запускають помічників, не перевіряють ринок перед початком роботи. Драйвером споживання є впровадження ШІ, яке є однією з дуже небагатьох речей у цій індустрії, що не рухається в такт з усіма іншими.
Активність — це підрахунок, а не інтерпретація. Пропускну здатність можна виміряти без дискусій про атрибуцію. Немає питання про те, чи був успішний місяць результатом навички чи удачі. Запити або пройшли через систему, або ні.
Останній пункт важливіший, ніж здається. Найскладнішим аспектом зробити щось таким, що можна володіти, є доказ того, що воно зробило. Бізнес пропускної здатності має надзвичайно коротку дистанцію між тим, що сталося, і тим, що можна показати.

Model Max: володіти платним пунктом, а не просто платити на ньому
Model Max — це ретранслятор токен-API, і він уже працює як агент погашення (redemption agent) на Moss Agent Marketplace.
Продуктова частина проста. Доступ до моделей через один маршрут, де маршрутизація, кешування та пакетна обробка відбуваються на тому рівні, де ці рішення дійсно доступні, а не на рівні, де ви обмежені текстовим полем.
Інша частина варта уваги. Як агент на Marketplace, ретранслятор — це не лише те, чим ви користуєтесь. Це те, у чому ви можете мати частку.
Така форма відрізняється від більшості в цій категорії. Активність ретранслятора близька до ідеального входу для верифікованого твердження, тому що пропускна здатність — це факт, а не наратив. Немає історії для інтерпретації, немає історії ефективності, яку треба приймати на віру. Використання мало місце, або його не було, і це читається чітко.
Це також другий агент погашення, який ми запустили, де річ, якою користуються, і річ, якою володіють, є одним і тим самим об'єктом. Ви можете бути клієнтом ретранслятора і його власником одночасно, і друга роль — це не рівень лояльності. Це частка.
Ми почали з торгових агентів, тому що торгівля — найжорсткіше випробування. Число або реальне, або це історія, і блокчейн не дозволить вам брехати про те, що це таке. Агенти погашення переносять цей же стандарт на людей, які ніколи не відкриють перпетуальний контракт. Те, що буде після цих інструментів, просунеться ще далі, до систем, які не просто працюють на блокчейні, а видають та керують ним самостійно.
Про це більше, коли це буде випущено, а не раніше.
4 речі, які можна зробити цього тижня, незалежно від того, чим ви користуєтесь
Жодна з цих порад не вимагає використання Moss.
Перестаньте оптимізувати довжину запиту і почніть обмежувати виведення. Ви платите за відповідь, а не за питання. Просити 50 слів замість 500 економить приблизно в десять разів більше на рахунку, ніж редагування вашого запиту.
Перевірте, що вам дає налаштування зусиль на міркування. Для завдань, які не потребують глибокого аналізу, високі зусилля — це гроші, витрачені на приховані токени, які не покращують нічого, що ви фактично отримуєте. Це найпоширеніший спосіб переплатити, навіть не помічаючи цього.
Відкрийте свою конфігурацію і прочитайте ID моделі. Не назву моделі, якою ви думаєте, що користуєтесь, а фактичний рядок. Потім звірте його з актуальним прайс-листом. Старі ID тихо несуть стару економіку, а іноді й значно гірші знижки за кешування, для менш потужної моделі.
Якщо ви щось будуєте, виміряйте коефіцієнт влучань у кеш (cache hit rate), перш ніж оптимізувати щось інше. Поля використання у відповіді дають вам розбивку між свіжими вхідними даними, записом у кеш та читанням з кешу. Нуль читань при повторних викликах означає, що щось високо у вашому запиті змінюється і робить недійсним усе, що нижче. Це дванадцятиразова різниця у вартості, що ховається за одним байтом.
Звичка, що лежить в основі всіх чотирьох порад, є головним висновком. Сприймайте витрати на ШІ як рахунок зі структурою, а не як підписку з числом. Коли структура стає видимою, стає видимим і питання про те, хто де розташований всередині неї.
Що робити зараз
Перейдіть на moss.site і подивіться на Model Max. Використовуйте його як ретранслятор, якщо це те, що вам потрібно. Подивіться, що означає володіння часткою в ньому, якщо це вас цікавить. Обидва варіанти доступні, і це той самий об'єкт, що, на нашу думку, є новим.
Кожна економіка врешті-решт вирішує, кому належить її інфраструктура. Економіка ШІ зараз перебуває на етапі, коли всі платять на платному пункті, і ніхто не подумав запитати, кому він належить.
Це питання залишатиметься відкритим ще трохи.
Джерела
- Центр допомоги OpenAI, «Understanding and counting tokens», про те, що токени міркування тарифікуються як виведення, будучи невидимими як текст відповіді: https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them
- Керівництво OpenAI щодо моделей міркування, про те, що сирі токени міркування не надаються та про виникнення витрат без видимої відповіді: https://developers.openai.com/api/docs/guides/reasoning
- Сторінка цін OpenAI API, для поточних ставок за вхід, кешований вхід та виведення для кожної моделі, пакетні та гнучкі рівні, а також ставки для довгого контексту: https://openai.com/api/pricing/
- Microsoft Learn Q&A щодо виставлення рахунків Azure OpenAI, про включення прихованих токенів міркування у виставлення рахунків та про те, що параметр максимальної кількості токенів виведення не обмежує їх: https://learn.microsoft.com/en-us/answers/questions/5542366/why-did-azure-report-more-completion-tokens-than-m
- Документація Anthropic щодо кешування запитів, про читання з кешу за 0,1 базової вхідної ціни, множники запису та накладання зі знижкою Batch API: https://platform.claude.com/docs/en/build-with-claude/prompt-caching
- Сторінка цін Anthropic, для поточних ставок за модель та знижки Batch API: https://claude.com/pricing





