Você Está Pagando por Tokens Que Nunca Verá

119K
169
87
26
97

TL;DR

Uma análise das estruturas de cobrança de IA revela custos ocultos, como tokens de raciocínio invisíveis e descontos complexos de cache, apresentando um serviço de retransmissão que permite aos usuários otimizar esses fatores ou assumir o controle da infraestrutura.

O que realmente está na conta da OpenAI ou da Anthropic, os descontos que ambas publicam mas que você não consegue acessar por uma caixa de chat, e por que a camada que pode acessá-los acabou de se tornar algo que você pode possuir.

Pergunte à maioria das pessoas quanto custa a IA para elas e elas citarão uma assinatura mensal.

Pergunte quanto custa uma conversa e o silêncio toma conta, o que é justo, porque a resposta honesta é complicada. Tanto a OpenAI quanto a Anthropic cobram em uma unidade que você não vê, precificam em quatro eixos separados e publicam um conjunto de descontos em sua própria documentação que são quase completamente inalcançáveis se você estiver sentado diante de uma caixa de texto.

Nada disso está oculto. Tudo isso está nas páginas de preços delas e nos documentos de desenvolvedor agora mesmo. Simplesmente exige estar uma camada abaixo de onde a maioria das pessoas está parada.

Essa lacuna entre o cartão de preço publicado e o preço que uma pessoa comum paga não é um escândalo. É um negócio, e até recentemente você não tinha como estar do outro lado dele.

Este artigo é sobre o que realmente está na conta, por que as alavancas reais estão onde estão, e o que muda quando a camada que as puxa se torna algo que você pode segurar, em vez de apenas pagar. Se você quiser mais conteúdo assim sobre IA e propriedade, siga @MossAI_Official.

7 coisas na sua conta, direto dos documentos delas

Tudo abaixo é publicado pela OpenAI ou Anthropic. Quase nada disso é conhecimento comum fora das equipes de engenharia. As taxas mudam constantemente, então trate os números como ilustrações da estrutura, não como cotações fixas.

  1. A saída custa várias vezes mais que a entrada, em ambas as plataformas

Cada modelo nas duas tabelas de preços cobra entrada e saída separadamente, e a saída é sempre muito mais cara. A razão geralmente fica entre quatro e seis para um.

MOSS - inline image

A reformulação prática é a parte importante. O que você digita é quase gratuito. O que o modelo diz de volta é a conta. Restringir a resposta faz muito mais pela sua custo do que aparar a pergunta, o oposto do comportamento de quase todo mundo.

2. Você é cobrado pelo raciocínio que não tem permissão para ler

Esta é a que deveria genuinamente te surpreender.

A própria documentação de ajuda da OpenAI afirma que os tokens de raciocínio não são visíveis como texto de resposta, mas contam para o uso de saída e são cobrados como tokens de saída, e que uma resposta curta visível pode, portanto, usar mais tokens do que seu texto exibido sugere. Seu guia de raciocínio confirma que os tokens brutos de raciocínio não são expostos, apenas um resumo opcional.

Você está pagando taxas de saída por texto que estruturalmente não tem permissão para ver.

3. Seu limite de saída não limita a parte oculta

Fica ainda mais claro. A documentação para executar esses modelos observa que o parâmetro máximo de tokens de saída limita a saída visível, enquanto os tokens de raciocínio ocultos não são restringidos por esse limite.

Uma consequência documentada segue-se. Uma solicitação pode gastar seu orçamento dentro da fase de raciocínio e não retornar nada, com os tokens já consumidos. O guia de raciocínio da OpenAI reconhece diretamente esse resultado, observando que você pode incorrer em custos para tokens de entrada e raciocínio sem receber uma resposta visível.

O medidor roda, a tela permanece em branco, e este é um comportamento documentado, não um bug.

4. Contexto repetido tem 90% de desconto, e ambas dizem isso

O cache de prompt é a maior alavanca única na pilha e a maioria das pessoas nunca ouviu falar nele.

A documentação de cache da Anthropic coloca as leituras de cache a 0,1 vezes o preço base de entrada, com uma escrita de cache de cinco minutos a 1,25 vezes e uma escrita de uma hora a 2 vezes. A OpenAI aplica a mesma forma nas famílias GPT-5 atuais, precificando a entrada em cache a aproximadamente dez por cento da taxa padrão de entrada, com escritas de cache carregando seu próprio prêmio.

A aritmética é onde fica útil. Com uma leitura a um décimo e uma escrita a 1,25 vezes, um erro de cache custa cerca de doze vezes e meia o que um acerto custa para o mesmo prefixo, e o ponto de equilíbrio chega a aproximadamente duas leituras. Para qualquer coisa que reenvie o mesmo prompt de sistema, esquema de ferramenta ou documento de referência em cada chamada, essa é a diferença inteira entre uma conta pequena e uma grande.

MOSS - inline image

É também frágil de uma maneira que vale a pena conhecer. Ambos os provedores fazem cache no correspondência exata de prefixo, então um byte alterado alto no prompt invalida tudo abaixo dele e o preço silenciosamente reverte para a taxa cheia.

5. Ambas vão cortar a conta pela metade para trabalhos que podem esperar

OpenAI e Anthropic cada uma executa um nível assíncrono em lote com cinquenta por cento de desconto na entrada e saída. A documentação de preços da Anthropic declara explicitamente que os multiplicadores de cache acumulam com o desconto em lote.

Empilhe-os e um token de entrada em cache dentro de um lote chega a uma pequena fração do padrão. Não funciona para nada interativo, que é precisamente por que nenhum produto de consumo expõe isso a você.

6. O desconto depende de qual ID de modelo você está vinculado, não de qual modelo você acha que está usando

Aqui está uma que quase ninguém verifica.

O desconto de cache não é uniforme através do catálogo de um provedor. Na OpenAI, as famílias GPT-5 atuais obtêm aproximadamente noventa por cento de desconto na entrada em cache, enquanto modelos de geração anterior descontam consideravelmente menos. Na Anthropic, o multiplicador padrão de leitura de cache é 0,1 vezes a entrada base, com certos modelos novos indo ainda mais longe.

Mesmo provedor, mesmo nome de recurso, economia materialmente diferente dependendo de uma string na sua configuração. IDs de modelos legados são piores do que isso sugere. Modelos Anthropic aposentados ainda alcançáveis através de parceiros de nuvem carregam suas taxas originais, que podem ser várias vezes o preço atual para um modelo menos capaz.

Alguém definiu essa string uma vez e ninguém revisitou. É aí que mora uma quantidade surpreendente de gastos excessivos.

7. Cruzar um limiar de contexto pode repricing toda a solicitação

O mais sutil, e o com a forma mais desagradável.

A OpenAI publica taxas separadas de contexto longo em alguns modelos, e a mecânica não é o que as pessoas assumem. Acima do limiar, toda a solicitação é repricing, não apenas os tokens acima da linha. Um token a mais e toda a chamada custa aproximadamente o dobro.

A Anthropic tomou uma posição diferente nisso. Nos modelos Claude recentes, toda a janela de contexto é cobrada a taxas padrão por token, com descontos de cache e em lote aplicando-se através de toda a janela.

Isso é uma diferença estrutural genuína entre as duas plataformas e é invisível de qualquer interface de consumidor. Se sua carga de trabalho executa contextos longos, ela pode dominar todas as outras considerações de preço.

MOSS - inline image

As alavancas são públicas. Você ainda não consegue alcançá-las.

Aqui está o ponto estrutural.

Cada alavanca acima vive na camada de API. Alcançá-las requer controle sobre a estrutura do prompt para que o cache realmente acerte, roteamento de modelo para que o trabalho certo vá para a faixa de preço certa, processamento em lote para trabalhos que podem tolerar latência, controle de esforço de raciocínio e consciência de em qual faixa de contexto uma solicitação cai.

De uma interface de chat de consumidor, você tem uma caixa de texto e uma cobrança mensal. Você não pode rotear, não pode fazer em lote, não pode estruturar um prefixo de cache e não pode ver o que sua configuração de esforço de raciocínio está custando.

Então existe uma margem. De um lado está o que um operador competente alcança combinando essas coisas. Do outro está o que um usuário comum paga. Ninguém está sendo enganado. Os descontos são superfícies de engenharia, não recursos de consumidor, e produtos de consumidor não são construídos para expô-los.

Negócios que vivem dentro dessa margem são relés, gateways e agregadores. Eles sentam entre usuários e provedores, roteiam para o modelo suficiente mais barato, mantêm caches quentes para que o contexto repetido não seja recomprado a preço cheio, fazem em lote o que pode ser feito em lote, e entregam ao usuário algo mais simples que uma API bruta.

Sua receita é a margem. É onde isso fica interessante.

MOSS - inline image

Um relé é um negócio de throughput, e isso é raro aqui

A maioria das coisas neste mercado são apostas. Você assume uma visão, você está certo ou errado, o resultado oscila.

Um relé é uma cabine de pedágio. Volume passa, margem acumula por unidade, e a economia escala com o uso, não com alguém estando correto.

Três propriedades seguem, e todas as três são incomuns.

A receita é por unidade e contínua. Não irregular, não dirigida por eventos, não contingente em uma chamada indo na direção certa. Tokens fluem, margem acumula, hora após hora.

A demanda é não correlacionada com cripto. Pessoas escrevendo código, gerando vídeo e executando assistentes não verificam o mercado primeiro. O driver de consumo é a adoção de IA, que é uma das poucas coisas nesta indústria não movendo junto com tudo o mais.

A atividade é uma contagem, não uma interpretação. Throughput é mensurável sem um argumento de atribuição. Nenhuma questão de se um bom mês foi habilidade ou sorte. Solicitações passaram ou não passaram.

Esse último importa mais do que parece. A parte difícil de tornar qualquer coisa possuível é provar o que ela fez. Um negócio de throughput tem uma distância invulgarmente curta entre o que aconteceu e o que pode ser mostrado.

MOSS - inline image

Model Max, e possuindo a cabine de pedágio em vez de apenas pagar nela

Model Max é um relé de API de tokens, e está ativo agora como um agente de resgate no Moss Agent Marketplace.

A metade do produto é direta. Acesso a modelos através de uma rota, com roteamento, cache e processamento em lote tratados na camada onde essas decisões estão realmente disponíveis, em vez da camada onde você está preso com uma caixa de texto.

A outra metade é a parte que merece atenção. Como um agente no Marketplace, o relé não é apenas algo que você usa. É algo em que você pode manter uma posição.

Essa forma é diferente da maioria desta categoria. A atividade de um relé está próxima da entrada ideal para uma reivindicação verificável, porque throughput é um fato, não uma narrativa. Sem histórico para interpretar, sem história de desempenho para aceitar na confiança. O uso aconteceu ou não aconteceu, e isso é legível.

É também o segundo agente de resgate que lançamos onde a coisa sendo usada e a coisa sendo possuída são o mesmo objeto. Você pode ser um cliente do relé e um detentor dele ao mesmo tempo, e o segundo relacionamento não é um nível de fidelidade. É uma posição.

Começamos com agentes de negociação porque negociação é o campo de prova mais severo que existe. Um número é real ou é uma história, e a blockchain não deixa você mentir sobre qual. Agentes de resgate levam esse mesmo padrão para pessoas que nunca abrirão uma perp. O que vem depois desses empurra ainda mais longe, em direção a sistemas que não meramente rodam na blockchain, mas emitem e operam nela eles mesmos.

Mais sobre isso quando lançar, em vez de antes.

4 coisas para fazer esta semana, independentemente do que você use

Nenhuma dessas requer Moss.

Pare de otimizar o comprimento do prompt e comece a restringir a saída. Você está pagando pela resposta, não pela pergunta. Pedir cinquenta palavras em vez de quinhentas faz aproximadamente dez vezes mais pela sua conta do que editar seu prompt para baixo.

Verifique o que sua configuração de esforço de raciocínio está comprando para você. Em tarefas que não precisam de deliberação, alto esforço é dinheiro gasto em tokens ocultos que melhoram nada do que você realmente recebe. Esta é a maneira mais comum das pessoas pagarem demais sem nunca perceber.

Abra sua configuração e leia o ID do modelo. Não o nome do modelo que você acha que está usando, a string real. Então verifique contra a tabela de preços atual. IDs antigos carregam silenciosamente economias antigas, e às vezes descontos de cache consideravelmente piores, para um modelo menos capaz.

Se você construir qualquer coisa, meça a taxa de acerto de cache antes de otimizar qualquer outra coisa. Os campos de uso na resposta dão a divisão entre entrada fresca, escritas de cache e leituras de cache. Zero leituras em chamadas repetidas significa que algo alto no seu prompt está mudando e invalidando tudo abaixo. Isso é uma diferença de custo de doze vezes escondida atrás de um byte.

O hábito por trás de todos os quatro é a verdadeira lição. Trate gastos com IA como uma conta com uma estrutura, em vez de uma assinatura com um número. Uma vez que a estrutura é visível, a questão de quem está posicionado onde dentro dela também é.

O que fazer agora

Vá para moss.site e olhe para Model Max. Use-o como um relé se for o que você precisa. Olhe o que manter uma posição em um significa se isso for o que te interessa. Ambos estão ativos, e são o mesmo objeto, que é a parte que achamos nova.

Toda economia eventualmente resolve quem possui sua infraestrutura. A economia de IA está atualmente na fase onde todos pagam na cabine de pedágio e ninguém pensou em perguntar quem a possui.

Essa questão permanece aberta por um pouco mais de tempo.

👉 moss.site

Fontes

Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais