Вы платите за токены, которые никогда не увидите

@MossAI_Official
АНГЛИЙСКИЙ17 сент. 2026 г.
119K
169
87
26
97

Суть

Анализ структуры тарификации ИИ выявляет скрытые издержки, такие как невидимые токены рассуждений и сложные скидки за кэширование. В статье представлен сервис-ретранслятор, позволяющий пользователям оптимизировать эти параметры или самостоятельно управлять инфраструктурными позициями.

Что на самом деле входит в счёт от OpenAI или Anthropic, какие скидки они публикуют, но которые недоступны из обычного чата, и почему уровень доступа к этим скидкам только что стал тем, чем можно владеть.

Спросите большинство людей, сколько им обходится ИИ, и они назовут стоимость ежемесячной подписки.

Спросите, сколько стоит один разговор, и в комнате повиснет тишина. Это справедливо, потому что честный ответ сложен. И OpenAI, и Anthropic выставляют счета в единицах, которые вы не видите, ценообразование зависит от четырех разных параметров, а набор скидок, опубликованный в их документации, практически недостижим, если вы сидите перед текстовым полем ввода.

Ничто из этого не скрыто. Вся информация есть на их страницах с ценами и в документации для разработчиков прямо сейчас. Просто нужно находиться на уровень ниже того места, где обычно стоят большинство пользователей.

Разрыв между опубликованным прайс-листом и ценой, которую платит обычный человек, — это не скандал. Это бизнес, и до недавнего времени у вас не было возможности оказаться по другую сторону этого разрыва.

В этой статье мы разберем, что именно входит в счет, почему реальные рычаги управления находятся там, где они находятся, и что меняется, когда уровень, управляющий этими рычагами, становится объектом владения, а не просто услугой за деньги. Если вам интересны подобные материалы об ИИ и правах собственности, подпишитесь на @MossAI_Official.

7 пунктов в вашем счете, взятых напрямую из их документации

Все перечисленное ниже опубликовано OpenAI или Anthropic. Почти ничего из этого не является общеизвестным фактом за пределами инженерных команд. Ставки постоянно меняются, поэтому воспринимайте цифры как иллюстрацию структуры, а не как точные котировки.

  1. Стоимость вывода (output) в несколько раз выше стоимости ввода (input) на обеих платформах

Каждая модель в обоих прайс-листах тарифицирует ввод и вывод отдельно, причем вывод всегда дороже. Соотношение обычно составляет от 4:1 до 6:1.

MOSS - inline image

Практический пересмотр подхода здесь важнее всего. То, что вы печатаете, почти бесплатно. То, что модель отвечает, — это и есть ваш счет. Ограничение длины ответа снижает ваши расходы гораздо сильнее, чем сокращение вопроса, что противоречит тому, как поступает почти каждый пользователь.

2. Вам выставляют счет за рассуждения, которые вам запрещено читать

Это тот пункт, который должен вас действительно удивить.

В официальной справочной документации OpenAI указано, что токены рассуждений (reasoning tokens) не отображаются как текст ответа, но учитываются в использовании вывода и тарифицируются как выходные токены. Следовательно, короткий видимый ответ может использовать больше токенов, чем предполагает его отображаемый текст. В руководстве по моделям рассуждений подтверждается, что сырые токены рассуждений не раскрываются; доступен только необязательный краткий обзор.

Вы платите по ставке за вывод за текст, который структурно не можете увидеть.

3. Ваш лимит на вывод не ограничивает скрытую часть

Становится еще острее. Документация по запуску этих моделей отмечает, что параметр максимального количества выходных токенов ограничивает только видимый вывод, тогда как скрытые токены рассуждений этому лимиту не подчиняются.

Из этого следует документированный результат. Запрос может исчерпать свой бюджет на этапе рассуждений и вернуть пустой ответ, при этом токены уже будут списаны. Руководство OpenAI по моделям рассуждений прямо признает этот исход, отмечая, что вы можете понести расходы на входные токены и токены рассуждений, не получив видимого ответа.

Счетчик работает, экран остается пустым, и это задокументированное поведение, а не ошибка.

4. Повторяющийся контекст дешевле на 90%, и обе компании об этом говорят

Кэширование промптов (prompt caching) — самый мощный рычаг во всей цепочке, о котором большинство людей никогда не слышали.

Документация Anthropic по кэшированию устанавливает стоимость чтения из кэша на уровне 0,1 базовой цены за ввод, запись в кэш на 5 минут стоит в 1,25 раза дороже, а запись на 1 час — в 2 раза дороже. OpenAI применяет аналогичную схему для текущих семейств GPT-5, оценивая кэшированный ввод примерно в 10% стандартной ставки за ввод, при этом запись в кэш имеет свою надбавку.

Арифметика показывает пользу. При чтении за 0,1 и записи за 1,25 промах кэша обходится примерно в 12,5 раз дороже попадания для того же префикса, а точка безубыточности наступает примерно после двух попаданий. Для любых задач, которые повторно отправляют один и тот же системный промпт, схему инструментов или справочный документ при каждом вызове, это вся разница между маленьким и большим счетом.

MOSS - inline image

Эта система также хрупкая, и об этом стоит знать. Оба провайдера кэшируют на основе точного совпадения префиксов, поэтому изменение одного байта в начале промпта аннулирует все последующие данные, и цена молча возвращается к полной ставке.

5. Обе компании снижают счет вдвое для работы, которая может подождать

OpenAI и Anthropic предлагают асинхронный пакетный режим (batch tier) со скидкой 50% на ввод и вывод. В документации по ценам Anthropic явно указано, что множители кэширования суммируются со скидкой за пакетную обработку.

Если сложить эти факторы, то кэшированный входной токен внутри пакета обойдется в ничтожную долю от стандартной цены. Это не работает для интерактивных задач, и именно поэтому ни один потребительский продукт не предоставляет вам этот доступ.

6. Скидка зависит от того, какой ID модели вы используете, а не от того, какую модель вы думаете, что используете

Вот деталь, которую почти никто не проверяет.

Скидка на кэширование неодинакова во всем каталоге провайдера. У OpenAI текущие семейства GPT-5 получают скидку около 90% на кэшированный ввод, тогда как модели предыдущих поколений дисконтируются значительно меньше. У Anthropic стандартный множитель чтения из кэша составляет 0,1 базовой цены за ввод, а некоторые новые модели идут еще дальше.

Один и тот же провайдер, одно и то же название функции, но существенно разная экономика в зависимости от строки в вашей конфигурации. Устаревшие ID моделей хуже, чем кажется. Модели Anthropic, снятые с производства, но все еще доступные через облачных партнеров, сохраняют свои первоначальные ставки, которые могут быть в несколько раз выше текущей цены за менее способную модель.

Кто-то установил эту строку однажды, и никто к ней не возвращался. Именно здесь скрывается значительная часть переплат.

7. Переход порога контекста может изменить цену всего запроса

Самый тонкий момент с самой неприятной механикой.

OpenAI публикует отдельные ставки для длинного контекста на некоторых моделях, и механизм работает не так, как предполагают люди. Выше порога переоценивается весь запрос, а не только токены сверх лимита. Одно лишнее слово — и весь вызов становится примерно вдвое дороже.

Anthropic заняла другую позицию. На последних моделях Claude полное окно контекста тарифицируется по стандартным ставкам за токен, а скидки за кэширование и пакетную обработку применяются ко всему окну.

Это реальное структурное различие между двумя платформами, и оно невидимо из любого потребительского интерфейса. Если ваша нагрузка связана с длинным контекстом, этот фактор может перевесить все остальные соображения по ценообразованию.

MOSS - inline image

Рычаги публичны. Но вы все равно не можете их достать.

Вот ключевой структурный момент.

Каждый рычаг, описанный выше, находится на уровне API. Доступ к ним требует контроля над структурой промпта (чтобы кэш реально срабатывал), маршрутизации моделей (чтобы правильная задача уходила в правильный ценовой сегмент), пакетной обработки для задач, терпимых к задержкам, управления интенсивностью рассуждений и понимания того, в какой уровень контекста попадает запрос.

Из потребительского чата у вас есть только текстовое поле и ежемесячный платеж. Вы не можете маршрутизировать запросы, не можете использовать пакетную обработку, не можете структурировать префикс кэша и не видите, во сколько обходится настройка интенсивности рассуждений.

Поэтому существует разрыв. С одной стороны — результаты, которых достигает компетентный оператор, комбинируя эти методы. С другой — то, что платит обычный пользователь. Никого не обманывают. Скидки — это инженерные поверхности, а не потребительские функции, и потребительские продукты не созданы для их раскрытия.

Бизнесы, живущие внутри этого разрыва, — это ретрансляторы, шлюзы и агрегаторы. Они сидят между пользователями и провайдерами, направляют трафик на самую дешевую достаточную модель, поддерживают кэш теплым, чтобы повторяющийся контекст не покупался по полной цене, пакетируют то, что можно упаковать, и предоставляют пользователю интерфейс проще, чем сырой API.

Их доход — это этот самый разрыв. И вот тут начинается самое интересное.

MOSS - inline image

Ретранслятор — это бизнес пропускной способности, и это редкость на этом рынке

Большинство вещей на этом рынке — это ставки. Вы занимаете позицию, вы правы или ошибаетесь, и результат резко колеблется.

Ретранслятор — это пункт сбора платы. Объем проходит, маржа накапливается за единицу, и экономика масштабируется вместе с использованием, а не зависит от того, кто был прав.

Отсюда следуют три свойства, и все три встречаются редко.

Доход начисляется за единицу и непрерывно. Не скачкообразно, не привязано к событиям, не зависит от того, пойдет ли ставка в нужном направлении. Токены проходят, маржа накапливается, час за часом.

Спрос не коррелирует с криптой. Люди, пишущие код, генерирующие видео и запускающие ассистентов, сначала не смотрят на рынок. Драйвер потребления — внедрение ИИ, которое является одной из немногих вещей в этой индустрии, движущейся независимо от остального рынка.

Активность — это подсчет, а не интерпретация. Пропускную способность можно измерить без споров об атрибуции. Нет вопросов о том, был хороший месяц результатом навыков или удачи. Запросы либо прошли через систему, либо нет.

Последний пункт важнее, чем звучит. Самая сложная часть создания чего-либо, чем можно владеть, — это доказать, что это сделало. Бизнес пропускной способности имеет необычно короткое расстояние между тем, что произошло, и тем, что можно показать.

MOSS - inline image

Model Max и владение пунктом сбора вместо оплаты проезда

Model Max — это ретранслятор API токенов, и он уже запущен как агент обмена (redemption agent) на Moss Agent Marketplace.

Продуктовая часть проста. Доступ к моделям через один маршрут, где маршрутизация, кэширование и пакетная обработка выполняются на том уровне, где эти решения действительно доступны, а не на том уровне, где вы застряли с текстовым полем.

Другая половина заслуживает внимания. Как агент на Маркетплейсе, ретранслятор — это не только то, чем вы пользуетесь. Это то, позицией в чем вы можете владеть.

Такая форма отличается от большинства в этой категории. Активность ретранслятора близка к идеальному входному данным для верифицируемого утверждения, потому что пропускная способность — это факт, а не нарратив. Нет истории результатов для интерпретации, нет рассказа о производительности, которому нужно верить на слово. Использование произошло или нет, и это очевидно.

Это также второй агент обмена, который мы запустили, где объект использования и объект владения — это одна и та же вещь. Вы можете быть клиентом ретранслятора и одновременно владельцем позиции в нем, и вторая связь — это не уровень лояльности. Это позиция.

Мы начали с торговых агентов, потому что торговля — самая суровая проверка реальности. Число либо реальное, либо это история, и блокчейн не позволяет лгать о том, что это такое. Агенты обмена переносят этот же стандарт на людей, которые никогда не откроют бессрочный контракт (perp). То, что идет после этих проектов, продвигается еще дальше, к системам, которые не просто работают в блокчейне, а выпускают активы и оперируют ими самостоятельно.

Подробнее об этом, когда проект будет запущен, а не раньше.

4 вещи, которые нужно сделать на этой неделе, чем бы вы ни пользовались

Ни одно из этих действий не требует использования Moss.

Перестаньте оптимизировать длину промпта и начните ограничивать вывод. Вы платите за ответ, а не за вопрос. Просьба ответить в 50 слов вместо 500 экономит примерно в 10 раз больше денег, чем редактирование вашего промпта.

Проверьте, что вам дает настройка интенсивности рассуждений. Для задач, не требующих глубокого анализа, высокая интенсивность — это деньги, потраченные на скрытые токены, которые никак не улучшают то, что вы фактически получаете. Это самый распространенный способ переплачивать, даже не замечая этого.

Откройте вашу конфигурацию и прочитайте ID модели. Не название модели, которую вы думаете, что используете, а фактическую строку. Затем сверьте её с текущим прайс-листом. Старые ID тихо несут старую экономику, а иногда и значительно худшие скидки на кэширование, за менее способную модель.

Если вы что-то разрабатываете, измеряйте коэффициент попадания в кэш (cache hit rate) прежде чем оптимизировать что-либо другое. Поля использования в ответе дают вам разбивку между свежим вводом, записью в кэш и чтением из кэша. Нулевые чтения при повторяющихся вызовах означают, что что-то в начале вашего промпта меняется и аннулирует всё остальное. Это разница в стоимости в 12 раз, скрытая за одним байтом.

Привычка, лежащая в основе всех четырех пунктов, — это главный вывод. Относитесь к расходам на ИИ как к счету со структурой, а не как к подписке с фиксированной цифрой. Как только структура видна, становится виден и вопрос о том, кто и где находится внутри неё.

Что делать сейчас

Зайдите на moss.site и посмотрите на Model Max. Используйте его как ретранслятор, если вам это нужно. Посмотрите, что означает владение позицией в нем, если вам это интересно. Оба варианта доступны, и это один и тот же объект, что, по нашему мнению, является новым подходом.

Любая экономика в конечном итоге определяет, кому принадлежит её инфраструктура. Экономика ИИ сейчас находится в фазе, когда все платят на пункте сбора, и никто не подумал спросить, кому этот пункт принадлежит.

Этот вопрос останется открытым еще какое-то время.

👉 moss.site

Источники

Сохранение в один клик

Используйте YouMind для глубокого чтения вирусных статей с помощью ИИ

Сохраняйте источники, задавайте точные вопросы, обобщайте аргументы и превращайте вирусные статьи в полезные заметки в одном рабочем пространстве ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи