Hoje, discutimos como a fase de "Token Maxing"—maximizar o uso de tokens de IA—completou um ciclo, e a tendência está mudando para "Token Management", que questiona o ROI da IA. O gerenciamento de tokens agora é uma questão de gestão tão crítica quanto o planejamento de pessoal ou as decisões de investimento em marketing.
No exterior, esse conceito de "Token Management" é frequentemente discutido de forma mais técnica como "Token Optimization". Para maior clareza, usarei o termo Token Management aqui, mas considere-o como sinônimo de Token Optimization.
Token Maxing e sua Reação Adversa

No último ano, o uso da IA generativa esteve em uma fase que poderíamos chamar de "Token Maxing". Tratava-se de inundar as tarefas com tokens, usar os modelos mais fortes repetidamente e alimentar o contexto até o limite absoluto. Os fornecedores de IA também adotaram a expansão do uso como métrica de sucesso, efetivamente subsidiando o uso por meio de assinaturas de taxa fixa. Do lado do usuário, usar o modelo mais forte sem se preocupar com os custos era mencionado como uma vantagem competitiva.
No entanto, ao entrarmos em 2026, uma clara reação adversa a essa estrutura começou a surgir.
A Uber é um exemplo simbólico. A empresa estabeleceu internamente um ranking do Claude Code para que os engenheiros competissem no uso e, como resultado, esgotaram seu orçamento de IA para codificação de 2026 em apenas quatro meses. O COO da Uber, Andrew Macdonald, mencionou em um podcast:
"De agora em diante, devemos discutir o consumo de tokens e seus custos associados juntamente com os custos de mão de obra. Se não conseguirmos traçar uma linha direta mostrando que as funcionalidades que chegam aos clientes aumentam tanto quanto gastamos, essa troca é difícil de justificar."
Preocupações semelhantes estão sendo expressas por aqueles que vendem IA. Satya Nadella, da Microsoft, declarou na Conferência TMT do Morgan Stanley em março de 2026:
"Por que estamos usando tantos tokens? Em muitos casos, estamos fazendo as piores coisas em termos de eficiência de tokens. No que todos trabalharão no próximo ano é no uso de ferramentas e software para tornar a IA eficiente."
Na verdade, a Microsoft reduziu significativamente as licenças diretas do Claude Code que havia introduzido internamente.
A partir de agora, a IA não será mais uma ferramenta onde você pode simplesmente "usar o quanto quiser", mas sim um assunto onde o ROI será questionado, assim como os custos de mão de obra ou marketing. O ponto para a gestão mudará de quantos tokens foram usados para o que esses tokens produziram e onde alocá-los a seguir.
O Uso de Tokens em Grande Escala é um Pré-requisito para a Competição
Embora isso soe um pouco negativo, a premissa é que a evolução da IA é extremamente poderosa. No campo do desenvolvimento, não há opção de não usar agentes de codificação. Empresas que não podem arcar com um certo nível de custos de tokens estão, essencialmente, se retirando da competição. Além disso, a barreira para esse "certo nível" de custo de token é bastante alta. Devemos enfrentar a dura realidade de que você não pode acelerar sem capacidade de investimento.
Na verdade, não é incomum que os custos de tokens consumidos por engenheiros atinjam dezenas de por cento ou até metade de seu salário. Está se tornando necessário pensar no "custo de contratar um engenheiro" não apenas como "salário", mas como um conjunto de "salário mais custos de tokens de IA". Para a gestão, este é o surgimento de uma categoria de custo completamente nova.
O Token Maxing não foi um movimento sem sentido; ao usar a IA em potência máxima, acredito que o aprendizado progrediu rapidamente sobre onde pisar no acelerador e onde exercer mais controle. Daqui para frente, as empresas que conseguirem realizar o Token Management—pisando onde devem e controlando onde devem—se destacarão.
O Token Management tornou-se uma questão de gestão em si. O Token Maxing foi um primeiro passo importante para a transformação estrutural das empresas.
Em nossa empresa, a fase de apenas usar tokens por usá-los terminou, e estamos em uma fase de como produzir resultados. Dentro do "Compass" (princípios orientadores) da LayerX, existem diretrizes como "Faça da IA um motor de crescimento" e "Não construa coisas que não serão usadas. Não caia na armadilha de construir por construir na IA."

De https://speakerdeck.com/layerx/compass_202209?slide=34

De https://speakerdeck.com/layerx/compass_202209?slide=36
Como resultado dessas diretrizes, otimizamos os tokens internamente. Nós os usamos onde deveriam ser usados e otimizamos onde deveriam ser otimizados, mas o número de tokens usados não mudou significativamente desde quando estávamos fazendo Token Maxing na LayerX. Sinto que o uso de tokens em grande escala acima de um certo nível se tornou um pré-requisito para a competição.
Agentes de Codificação são Meramente um "Precedente"
O que é importante aqui é que esse consumo explosivo de tokens não se limita ao campo especializado da codificação.
Atualmente, todos os tipos de operações de negócios, além da codificação, estão sendo resolvidos da mesma forma que os agentes de codificação. Coleta de sinais e criação de propostas para vendas, consultas de suporte ao cliente, relatórios e aprovações de despesas automáticas, revisões de contratos legais, operações de anúncios de marketing, triagem de recrutamento de RH—estes estão sendo redesenhados um após o outro como agentes de execução autônoma.
Agentes autônomos consomem tokens em quantidades incomparáveis ao modo anterior "uma pergunta, uma resposta" de uso humano. À medida que os agentes fazem mais trabalho, todo o uso de IA convergirá para o mesmo padrão que vemos agora com agentes de codificação. Os agentes de codificação apenas aconteceram de ser o primeiro precedente a atingir esse padrão.

O desafio de gerenciamento de custos de tokens de IA, que atualmente parece um "problema só de engenheiros", em breve se tornará uma questão de gestão em toda a empresa. Isso porque cada área de negócios dentro de uma empresa terá o mesmo perfil de consumo de tokens nos próximos anos.
Os Custos de Tokens São uma Bomba-Relógio

Há outro fato que devemos reconhecer aqui. As taxas de assinatura de IA que estamos pagando atualmente são significativamente mais baixas do que os custos reais.
Atualmente, é comum que provedores de modelos de base ofereçam assinaturas de IA com prejuízo, e há uma enorme diferença entre as taxas fixas que pagamos e os custos reais incorridos. Se você recalcular o mesmo uso com o modelo de pagamento por uso da API, o custo salta ordens de grandeza. O formato de assinatura torna o custo real invisível para o usuário.
O problema é que as empresas de modelos de base podem tornar essa diferença no custo real aparente a qualquer momento. No momento em que a parte subsidiada começa a ser repassada aos clientes na forma de uma mudança de cobrança de taxa fixa para baseada em tokens, orientação para planos mais altos ou aumentos de preços, a sensação de "dezenas de milhares de ienes por ID por mês, custando a uma empresa de 100 funcionários dezenas de milhões de ienes anualmente" pode saltar para a ordem de "centenas de milhões ou bilhões de ienes anuais para toda a empresa" em um curto período. A diferença no custo real ocultada pelas assinaturas se torna o poder da bomba-relógio.
A primeira coisa necessária é tornar visível o que está acontecendo dentro da empresa antes que a explosão venha à tona.
(Este artigo é útil para detalhes: https://www.thestateofbrand.com/news/ai-subscription-time-bombhttps://www.thestateofbrand.com/news/ai-subscription-time-bomb))
Primeiro, a Visualização
A primeira coisa necessária para este problema é algo extremamente básico: tornar visível "quem está usando qual modelo e quantos tokens." Só isso.
Para pessoas, já temos vastas bases de gestão como avaliações de desempenho, gestão de metas, sistemas salariais e design organizacional. Para despesas de marketing, é natural otimizar enquanto se mede o CAC e o payback. Compras têm equipes e fluxos de trabalho especializados.
No entanto, para a IA, mesmo essa visualização mais básica ainda não está implementada. Para CEOs e departamentos de TI, o fato de não conseguirem ver "quem está gastando quanto com IA agora" já é um grande fator de estresse. O valor é criado apenas colocando números em um painel.
O "AI Token Advisor" que estamos fornecendo atualmente é um produto exatamente projetado para preencher essa lacuna. É uma ferramenta simples para visualizar quem usou qual modelo para qual tarefa e quantos tokens. (Usuários do Bakuraku podem usar um ID gratuitamente!)

De https://bakuraku.jp/resources/product/pre-registration-ai-token-advisor/
No entanto, a visualização é apenas a entrada. O que é verdadeiramente importante é a pergunta que inevitavelmente surge além disso.
"Aquela tarefa realmente deveria ter usado aquele modelo?"
À medida que a visualização avança, a próxima pergunta que sempre surge é: "Aquela tarefa realmente deveria ter usado aquele modelo?"
Por exemplo, usar um modelo de raciocínio de ponta (como Claude Opus 4.8 ou GPT-5.5; os modelos mais recentes em maio de 2026) para uma pergunta como "Como está o tempo hoje?" é claramente excessivo. O modelo mais leve é suficiente, e pode nem precisar ser um modelo de raciocínio. Da mesma forma, existem casos massivos dentro das empresas onde modelos caros continuam sendo usados para tarefas maduras, como a criação de e-mails de rotina.
As tendências também variam por pessoa. Pessoas que não estão acostumadas a usar IA tendem a escolher o modelo mais forte por enquanto. Por outro lado, aqueles que usam IA profundamente alternam modelos dependendo da natureza da tarefa. Essa diferença, tanto em termos de custo quanto de qualidade, torna-se grande demais para uma organização ignorar.
O que é importante aqui é o fato de que toda entrada para a IA é, em última análise, convertida na forma de um "prompt". Perguntas de chat e contexto passados para agentes são todos inseridos internamente no modelo como prompts. Em outras palavras, se você olhar para o prompt, você pode basicamente dizer o que aquela pessoa está fazendo a IA fazer.
Partindo deste prompt, podemos detectar incompatibilidades entre tarefas e modelos e fornecer orientação como: "Para esta tarefa, um modelo mais leve é suficiente." Indo além, em vez de as pessoas escolherem modelos toda vez, o sistema alocará automaticamente o modelo ideal. Estamos nos movendo em direção a esse mundo.

Na era dos agentes, isso se torna ainda mais importante. Como os agentes executam de forma autônoma, não há espaço para um humano pensar toda vez: "É um luxo usar o Opus agora?" Desde o início, não haverá escolha a não ser deixar a seleção do modelo ideal com base na natureza da tarefa para o sistema.
Os serviços que fornecemos no Bakuraku serão oferecidos como serviços gerenciados, incluindo a implementação de backend que seleciona o modelo ideal sem que o usuário tenha que estar consciente disso. O AI Token Advisor é meramente a entrada.
Resumo
Os custos de tokens de IA já estão excedendo a escala onde podem ser tratados com uma abordagem de "apenas jogue dinheiro no problema". Para algumas empresas, eles estão se tornando despesas equivalentes aos custos de mão de obra e marketing.
Os custos de marketing são estritamente gerenciados pelo CAC, e ninguém opera dizendo: "Apenas veicule anúncios independentemente do CAC." O mesmo vale para os custos de mão de obra; salário, contratação e colocação são todos gerenciados. Você não contrata pessoas com qualquer salário.
Neste mesmo nível, os custos de IA entrarão no escopo da gestão. A primeira coisa necessária então é visualizar "quanto está sendo gasto." E a próxima é verificar "se o modelo apropriado está sendo escolhido para a tarefa e para a pessoa."
Pode parecer sem glamour, mas dominar esses dois pontos se tornará uma questão de gestão crítica nos próximos anos.
Para aqueles que desejam implementar esse futuro juntos, a LayerX está recrutando ativamente AI Builders!

Estamos contratando ativamente! https://jobs.layerx.co.jp/





