Você Está Pagando por Tokens Que Nunca Vai Ver

@MossAI_Official
INGLÊS17 de set. de 2026
119K
169
87
26
97

TL;DR

Uma análise das estruturas de cobrança de IA revela custos ocultos, como tokens de raciocínio invisíveis e descontos complexos de cache, apresentando um serviço de retransmissão que permite aos usuários otimizar esses fatores ou assumir o controle da infraestrutura.

O que realmente está na conta da OpenAI ou da Anthropic, os descontos que ambas publicam e que você não consegue acessar por uma caixa de chat, e por que a camada que pode acessá-los acabou de se tornar algo que você pode possuir.

Pergunte à maioria das pessoas quanto a IA custa para elas e elas citarão uma assinatura mensal.

Pergunte quanto custa uma conversa e o silêncio toma conta, o que é justo, porque a resposta honesta é complicada. Tanto a OpenAI quanto a Anthropic cobram em uma unidade que você não vê, precificam em quatro eixos separados e publicam um conjunto de descontos em sua própria documentação que são quase completamente inalcançáveis se você estiver sentado diante de uma caixa de texto.

Nada disso está escondido. Tudo está nas páginas de preços e nos documentos para desenvolvedores delas agora mesmo. Simplesmente exige estar uma camada abaixo de onde a maioria das pessoas está posicionada.

Essa lacuna entre a tabela de preços publicada e o preço que uma pessoa comum paga não é um escândalo. É um negócio, e até recentemente você não tinha como estar do outro lado dele.

Este artigo mostra o que realmente está na conta, por que as alavancas reais estão onde estão, e o que muda quando a camada que as aciona se torna algo que você pode segurar, em vez de apenas pagar. Se você quiser mais conteúdo assim sobre IA e propriedade, siga @MossAI_Official.

7 coisas na sua conta, direto da documentação delas

Tudo abaixo é publicado pela OpenAI ou Anthropic. Quase nada disso é conhecimento comum fora das equipes de engenharia. As taxas mudam constantemente, então trate os números como ilustrações da estrutura, não como cotações fixas.

  1. A saída custa várias vezes mais que a entrada, em ambas as plataformas

Cada modelo nas duas tabelas de preços cobra entrada e saída separadamente, e a saída é sempre muito mais cara. A razão geralmente fica entre quatro e seis para um.

MOSS - inline image

A reformulação prática é a parte importante. O que você digita é quase gratuito. O que o modelo responde é a conta. Restringir a resposta faz muito mais pela sua economia do que cortar a pergunta, o oposto do comportamento da quase totalidade das pessoas.

2. Você é cobrado pelo raciocínio que não tem permissão para ler

Esta é a que deveria genuinamente te surpreender.

A própria documentação de ajuda da OpenAI afirma que os tokens de raciocínio não são visíveis como texto de resposta, mas contam para o uso de saída e são cobrados como tokens de saída, e que uma resposta curta visível pode, portanto, usar mais tokens do que seu texto exibido sugere. Seu guia de raciocínio confirma que os tokens brutos de raciocínio não são expostos, apenas um resumo opcional.

Você está pagando taxas de saída por texto que estruturalmente não tem permissão para ver.

3. Seu limite de saída não limita a parte oculta

Fica ainda mais crítico. A documentação para executar esses modelos observa que o parâmetro de tokens máximos de saída limita a saída visível, enquanto os tokens de raciocínio ocultos não são restringidos por esse limite.

Uma consequência documentada segue-se. Uma solicitação pode gastar todo o orçamento dentro da fase de raciocínio e não retornar nada, com os tokens já consumidos. O guia de raciocínio da OpenAI reconhece diretamente esse resultado, observando que você pode incorrer em custos de tokens de entrada e raciocínio sem receber uma resposta visível.

O medidor roda, a tela permanece em branco, e isso é um comportamento documentado, não um bug.

4. Contexto repetido tem 90% de desconto, e ambas dizem isso explicitamente

O cache de prompt é a maior alavanca única na pilha tecnológica e a maioria das pessoas nunca ouviu falar nele.

A documentação de cache da Anthropic coloca as leituras de cache a 0,1 vezes o preço base de entrada, com uma escrita de cache de cinco minutos a 1,25 vezes e uma escrita de uma hora a 2 vezes. A OpenAI aplica a mesma forma nas famílias GPT-5 atuais, precificando a entrada em cache em aproximadamente dez por cento da taxa padrão de entrada, com escritas de cache carregando seu próprio prêmio.

A aritmética é onde fica útil. Com uma leitura a um décimo e uma escrita a 1,25 vezes, um erro de cache custa cerca de doze vezes e meia o que um acerto custa para o mesmo prefixo, e o ponto de equilíbrio ocorre em aproximadamente duas leituras. Para qualquer coisa que reenvie o mesmo prompt de sistema, esquema de ferramentas ou documento de referência em cada chamada, essa é toda a diferença entre uma conta pequena e uma grande.

MOSS - inline image

É também frágil de uma maneira que vale a pena conhecer. Ambos os provedores fazem cache com correspondência exata de prefixo, então um byte alterado no topo do prompt invalida tudo abaixo dele e o preço silenciosamente reverte para a taxa cheia.

5. Ambas vão reduzir a conta pela metade para trabalhos que podem esperar

OpenAI e Anthropic operam cada uma um nível assíncrono de lote (batch) com cinquenta por cento de desconto na entrada e saída. A documentação de preços da Anthropic declara explicitamente que os multiplicadores de cache acumulam com o desconto de lote.

Acumule-os e um token de entrada em cache dentro de um lote chega a uma fração pequena do padrão. Não funciona para nada interativo, que é exatamente por que nenhum produto de consumo expõe isso a você.

6. O desconto depende de qual ID de modelo você está vinculado, não de qual modelo você acha que está usando

Aqui está uma que quase ninguém verifica.

O desconto de cache não é uniforme em todo o catálogo de um provedor. Na OpenAI, as famílias GPT-5 atuais obtêm aproximadamente noventa por cento de desconto na entrada em cache, enquanto modelos de gerações anteriores têm descontos consideravelmente menores. Na Anthropic, o multiplicador padrão de leitura de cache é 0,1 vezes a entrada base, com certos modelos mais novos indo ainda mais longe.

Mesmo provedor, mesmo nome de recurso, economias materialmente diferentes dependendo de uma string na sua configuração. IDs de modelos legados são piores do que isso sugere. Modelos Anthropic aposentados ainda acessíveis através de parceiros de nuvem carregam suas taxas originais, que podem ser várias vezes o preço atual por um modelo menos capaz.

Alguém definiu essa string uma vez e ninguém revisitou. É aí que mora uma quantidade surpreendente de gastos excessivos.

7. Cruzar um limiar de contexto pode repriciar toda a solicitação

O mais sutil, e o com a forma mais traiçoeira.

A OpenAI publica taxas separadas para contexto longo em alguns modelos, e a mecânica não é o que as pessoas assumem. Acima do limiar, toda a solicitação é repriciada, não apenas os tokens acima da linha. Um token a mais e toda a chamada custa aproximadamente o dobro.

A Anthropic tomou uma posição diferente nisso. Nos modelos Claude recentes, toda a janela de contexto é cobrada às taxas padrão por token, com descontos de cache e lote aplicados em toda a janela.

Essa é uma diferença estrutural genuína entre as duas plataformas e é invisível de qualquer interface de consumidor. Se sua carga de trabalho executa contextos longos, isso pode dominar todas as outras considerações de preço.

MOSS - inline image

As alavancas são públicas. Você ainda não consegue alcançá-las.

Aqui está o ponto estrutural.

Cada alavanca acima vive na camada de API. Alcançá-las requer controle sobre a estrutura do prompt para que o cache realmente acerte, roteamento de modelos para que o trabalho certo vá para o nível de preço certo, processamento em lote para trabalhos que toleram latência, controle de esforço de raciocínio e consciência de em qual nível de contexto uma solicitação cai.

De uma interface de chat de consumidor, você tem uma caixa de texto e uma cobrança mensal. Você não pode rotear, não pode fazer batch, não pode estruturar um prefixo de cache e não pode ver quanto seu ajuste de esforço de raciocínio está custando.

Então existe um spread. De um lado está o que um operador competente alcança combinando essas técnicas. Do outro está o que um usuário comum paga. Ninguém está sendo enganado. Os descontos são superfícies de engenharia, não recursos de consumo, e produtos de consumo não são construídos para expô-los.

Negócios que vivem dentro desse spread são relés, gateways e agregadores. Eles ficam entre usuários e provedores, roteiam para o modelo suficiente mais barato, mantêm caches quentes para que o contexto repetido não seja recomprado a preço cheio, fazem batch do que pode ser feito em batch, e entregam ao usuário algo mais simples do que uma API bruta.

A receita deles é o spread. É aqui que isso fica interessante.

MOSS - inline image

Um relé é um negócio de throughput, e isso é raro aqui

A maioria das coisas neste mercado são apostas. Você toma uma decisão, acerta ou erra, e o resultado oscila.

Um relé é uma cabine de pedágio. O volume passa, a margem acumula por unidade, e a economia escala com o uso, não com alguém estar correto.

Três propriedades seguem, e todas as três são incomuns.

A receita é por unidade e contínua. Não irregular, não orientada a eventos, não contingente a uma chamada dar certo. Tokens fluem, margem acumula, hora após hora.

A demanda não está correlacionada com cripto. Pessoas escrevendo código, gerando vídeo e executando assistentes não verificam o mercado primeiro. O motor do consumo é a adoção de IA, que é uma das poucas coisas nesta indústria que não se move junto com tudo o mais.

A atividade é uma contagem, não uma interpretação. O throughput é mensurável sem um argumento de atribuição. Nenhuma questão sobre se um bom mês foi habilidade ou sorte. As solicitações passaram ou não passaram.

Esse último importa mais do que parece. A parte difícil de tornar qualquer coisa possessível é provar o que ela fez. Um negócio de throughput tem uma distância excepcionalmente curta entre o que aconteceu e o que pode ser mostrado.

MOSS - inline image

Model Max, e possuir a cabine de pedágio em vez de apenas pagar nela

Model Max é um relé de API de tokens, e está ativo agora como um agente de resgate no Moss Agent Marketplace.

A metade do produto é direta. Acesso a modelos através de uma rota, com roteamento, cache e batch tratados na camada onde essas decisões estão realmente disponíveis, em vez da camada onde você está preso com uma caixa de texto.

A outra metade é a parte que merece atenção. Como um agente no Marketplace, o relé não é apenas algo que você usa. É algo em que você pode manter uma posição.

Essa forma é diferente da maioria desta categoria. A atividade de um relé está próxima do ideal para uma reivindicação verificável, porque throughput é um fato, não uma narrativa. Sem histórico para interpretar, sem história de desempenho para aceitar na confiança. O uso aconteceu ou não aconteceu, e isso é legível.

É também o segundo agente de resgate que lançamos onde a coisa sendo usada e a coisa sendo possuída são o mesmo objeto. Você pode ser um cliente do relé e um detentor dele ao mesmo tempo, e o segundo relacionamento não é um nível de fidelidade. É uma posição.

Começamos com agentes de trading porque trading é o campo de prova mais rigoroso que existe. Um número é real ou é uma história, e a blockchain não deixa você mentir sobre qual. Agentes de resgate levam esse mesmo padrão para pessoas que nunca abrirão uma perp. O que vem depois desses vai ainda mais longe, rumo a sistemas que não apenas rodam na blockchain, mas emitem e operam nela por si mesmos.

Mais sobre isso quando for lançado, não antes.

4 coisas para fazer esta semana, independentemente do que você use

Nenhuma dessas requer Moss.

Pare de otimizar o comprimento do prompt e comece a restringir a saída. Você está pagando pela resposta, não pela pergunta. Pedir cinquenta palavras em vez de quinhentas faz aproximadamente dez vezes mais pela sua conta do que editar seu prompt para baixo.

Verifique o que seu ajuste de esforço de raciocínio está comprando para você. Em tarefas que não precisam de deliberação, alto esforço é dinheiro gasto em tokens ocultos que melhoram nada do que você realmente recebe. Esta é a maneira mais comum das pessoas pagarem demais sem nunca perceber.

Abra sua configuração e leia o ID do modelo. Não o nome do modelo que você acha que está usando, a string real. Então verifique-a contra a tabela de preços atual. IDs antigos carregam silenciosamente economias antigas, e às vezes descontos de cache consideravelmente piores, por um modelo menos capaz.

Se você construir qualquer coisa, meça a taxa de acerto de cache antes de otimizar qualquer outra coisa. Os campos de uso na resposta dão a divisão entre entrada fresca, escritas de cache e leituras de cache. Zero leituras em chamadas repetidas significa que algo no topo do seu prompt está mudando e invalidando tudo abaixo. Essa é uma diferença de custo de doze vezes escondida atrás de um byte.

O hábito subjacente a todos os quatro é a verdadeira lição. Trate os gastos com IA como uma conta com uma estrutura, não como uma assinatura com um número. Uma vez que a estrutura é visível, também é a questão de quem está posicionado onde dentro dela.

O que fazer agora

Vá para moss.site e olhe o Model Max. Use-o como um relé se for isso que você precisa. Olhe o que manter uma posição em um significa se for isso que te interessa. Ambos estão ativos, e são o mesmo objeto, que é a parte que achamos nova.

Toda economia eventualmente decide quem possui sua infraestrutura. A economia de IA está atualmente na fase onde todos pagam na cabine de pedágio e ninguém pensou em perguntar quem a possui.

Essa pergunta permanece aberta por mais um pouco.

👉 moss.site

Fontes

Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais