Hoje, discutimos como a fase de "Token Maxing"—maximizar o uso de tokens de IA—completou um ciclo, e a tendência agora está se voltando para o "Token Management", que questiona o ROI da IA. O gerenciamento de tokens é hoje uma questão de gestão tão crítica quanto o planejamento de pessoal ou as decisões de investimento em marketing.
No exterior, esse conceito de "Token Management" é frequentemente discutido de forma mais técnica como "Token Optimization". Para fins de clareza, usarei aqui o termo Token Management, mas considere-o como sinônimo de Token Optimization.
Token Maxing e sua Reação Adversa

No último ano, o uso de IA generativa esteve em uma fase que poderíamos chamar de "Token Maxing". Tratava-se de saturar as tarefas com tokens, usar repetidamente os modelos mais potentes e alimentar o contexto até o limite absoluto. Os fornecedores de IA também adotaram a expansão do uso como métrica de sucesso, efetivamente oferecendo subsídios por meio de assinaturas de taxa fixa. Do lado do usuário, usar o modelo mais forte sem se preocupar com o custo era visto como uma vantagem competitiva.
No entanto, entrando em 2026, uma clara reação adversa a essa estrutura começou a surgir.
A Uber é um exemplo simbólico. A empresa criou internamente um ranking de Claude Code para que os engenheiros competissem no uso e, como resultado, esgotou seu orçamento de IA para codificação de 2026 em apenas quatro meses. O COO da Uber, Andrew Macdonald, mencionou em um podcast:
"De agora em diante, devemos discutir o consumo de tokens e seus custos associados juntamente com os custos trabalhistas. Se não conseguirmos traçar uma linha reta mostrando que as funcionalidades que chegam aos clientes aumentam na mesma proporção do que gastamos, essa troca é difícil de justificar."
Preocupações semelhantes estão sendo expressas por aqueles que vendem IA. Satya Nadella, da Microsoft, afirmou na Conferência TMT do Morgan Stanley em março de 2026:
"Por que estamos usando tantos tokens? Em muitos casos, estamos fazendo as piores coisas em termos de eficiência de tokens. Em que todos trabalharão no próximo ano é no uso de ferramentas e software para tornar a IA eficiente."
Na verdade, a Microsoft reduziu significativamente as licenças diretas do Claude Code que havia introduzido internamente.
A partir de agora, a IA não será mais uma ferramenta onde você pode simplesmente "usar o quanto quiser", mas sim um tópico onde o ROI é questionado, assim como os custos trabalhistas ou de marketing. O ponto para a gestão mudará de quantos tokens foram usados para o que esses tokens produziram e onde alocá-los em seguida.
O Uso de Tokens em Grande Escala é um Pré-requisito para a Competição
Embora isso soe um pouco negativo, a premissa é que a evolução da IA é extremamente poderosa. No campo do desenvolvimento, não há opção de não usar agentes de codificação. Empresas que não podem arcar com um certo nível de custos de tokens estão, essencialmente, se retirando da competição. Além disso, a barreira para esse "certo nível" de custo de token é bastante alta. Devemos enfrentar a dura realidade de que não é possível acelerar sem capacidade de investimento.
Na verdade, não é incomum que os custos de token consumidos por engenheiros atinjam dezenas de porcento ou até metade de seus salários. Está se tornando necessário pensar no "custo de contratar um engenheiro" não apenas como "salário", mas como um conjunto de "salário mais custos de token de IA". Para a gestão, isso é o surgimento de uma categoria de custo completamente nova.
O Token Maxing não foi um movimento sem sentido; ao usar a IA em ritmo acelerado, acredito que o aprendizado progrediu rapidamente sobre onde pisar no acelerador e onde exercer mais controle. Daqui para frente, as empresas que conseguirem realizar o Token Management—pisar onde devem e controlar onde devem—se destacarão.
O Token Management tornou-se uma questão de gestão em si. O Token Maxing foi um primeiro passo importante para a transformação estrutural das empresas.
Na nossa empresa, a fase de apenas usar tokens por usá-los terminou, e estamos em uma fase de como produzir resultados. Dentro do "Compass" (princípios orientadores) da LayerX, há diretrizes como "Tornar a IA um motor de crescimento" e "Não construir coisas que não serão usadas. Não caia na armadilha de construir IA."

De https://speakerdeck.com/layerx/compass_202209?slide=34

De https://speakerdeck.com/layerx/compass_202209?slide=36
Como resultado dessas diretrizes, otimizamos os tokens internamente. Nós os usamos onde deveriam ser usados e os otimizamos onde deveriam ser otimizados, mas o número de tokens usados não mudou significativamente desde quando estávamos fazendo Token Maxing na LayerX. Sinto que o uso de tokens em grande escala acima de um certo nível tornou-se um pré-requisito para a competição.
Agentes de Codificação São Meramente um "Precedente"
O que é importante aqui é que esse consumo explosivo de tokens não se limita ao campo especializado da codificação.
Atualmente, todos os tipos de operações de negócios além da codificação estão sendo resolvidos da mesma forma que os agentes de codificação. Coleta de sinais e criação de propostas para vendas, consultas de suporte ao cliente, relatórios e aprovações automáticas de despesas, revisões de contratos legais, operações de anúncios de marketing, triagem de recrutamento de RH—estes estão sendo redesenhados um após o outro como agentes de execução autônoma.
Agentes autônomos consomem tokens em quantidades incomparáveis à forma anterior de "uma pergunta, uma resposta" como os humanos os usavam. À medida que os agentes fazem mais trabalho, todo o uso de IA convergirá para o mesmo padrão que vemos agora com agentes de codificação. Agentes de codificação foram apenas o primeiro precedente a alcançar esse padrão.

O desafio de gerenciamento de custos de tokens de IA, que atualmente parece um "problema apenas de engenheiros", em breve se tornará uma questão de gestão em toda a empresa. Isso porque todas as áreas de negócio dentro de uma empresa terão o mesmo perfil de consumo de tokens nos próximos anos.
Custos de Token São uma Bomba-Relógio

Há outro fato que devemos reconhecer aqui. As taxas de assinatura de IA que estamos pagando atualmente são significativamente mais baixas do que os custos reais.
Atualmente, é comum que provedores de modelos de base ofereçam assinaturas de IA com prejuízo, e há uma enorme diferença entre as taxas fixas que pagamos e os custos reais incorridos. Se você recalcular o mesmo uso com o preço de API conforme o uso, o custo aumenta em ordens de grandeza. O formato de assinatura torna o custo real invisível para o usuário.
O problema é que as empresas de modelos de base podem tornar essa diferença no custo real aparente a qualquer momento. No momento em que a parte subsidiada começar a ser repassada aos clientes na forma de uma mudança de faturamento de taxa fixa para baseado em tokens, orientação para planos superiores ou aumentos de preço, a sensação de "dezenas de milhares de ienes por ID por mês, custando a uma empresa de 100 funcionários dezenas de milhões de ienes anualmente" pode saltar para a ordem de "centenas de milhões ou bilhões de ienes anualmente para toda a empresa" em um curto período. A diferença no custo real oculta pelas assinaturas se torna o poder da bomba-relógio.
A primeira coisa necessária é tornar visível o que está acontecendo dentro da empresa antes que a explosão venha à tona.
(Este artigo é útil para detalhes: https://www.thestateofbrand.com/news/ai-subscription-time-bombhttps://www.thestateofbrand.com/news/ai-subscription-time-bomb))
Primeiro, a Visualização
A primeira coisa necessária para este problema é algo extremamente básico: tornar visível "quem está usando qual modelo e quantos tokens." Só isso.
Para pessoas, já temos vastas bases de gestão como avaliações de desempenho, gestão de metas, sistemas salariais e design organizacional. Para despesas de marketing, é natural otimizar enquanto se mede o CAC e o payback. Compras têm equipes e fluxos de trabalho especializados.
No entanto, para a IA, mesmo essa visualização mais básica ainda não está implementada. Para CEOs e departamentos de TI, o fato de não conseguirem ver "quem está gastando quanto com IA agora" já é um grande fator de estresse. O valor é criado apenas colocando números em um painel.
O "AI Token Advisor" que estamos fornecendo atualmente é um produto projetado exatamente para preencher essa lacuna. É uma ferramenta simples para visualizar quem usou qual modelo para qual tarefa e quantos tokens. (Usuários do Bakuraku podem usar um ID gratuitamente!)

De https://bakuraku.jp/resources/product/pre-registration-ai-token-advisor/
No entanto, a visualização é apenas a entrada. O que é verdadeiramente importante é a questão que inevitavelmente surge além disso.
"Essa tarefa realmente deveria ter usado aquele modelo?"
À medida que a visualização avança, a próxima pergunta que sempre surge é: "Essa tarefa realmente deveria ter usado aquele modelo?"
Por exemplo, usar um modelo de raciocínio de primeira linha (como Claude Opus 4.8 ou GPT-5.5; os modelos mais recentes em maio de 2026) para uma pergunta como "Como está o tempo hoje?" é claramente excessivo. O modelo mais leve é suficiente, e pode nem precisar ser um modelo de raciocínio. Da mesma forma, existem casos massivos dentro das empresas onde modelos caros continuam sendo usados para tarefas maduras, como a criação rotineira de e-mails.
As tendências também variam por pessoa. Pessoas que não estão acostumadas a usar IA tendem a escolher o modelo mais forte por enquanto. Por outro lado, aqueles que usam IA profundamente trocam de modelo dependendo da natureza da tarefa. Essa diferença, tanto em termos de custo quanto de qualidade, torna-se grande demais para uma organização ignorar.
O que é importante aqui é o fato de que toda entrada para a IA é, em última análise, convertida na forma de um "prompt". Perguntas de chat e contexto passados para agentes são todos internamente inseridos no modelo como prompts. Em outras palavras, se você olhar para o prompt, pode basicamente dizer o que aquela pessoa está fazendo a IA fazer.
Partindo deste prompt, podemos detectar incompatibilidades entre tarefas e modelos e fornecer orientação como, "Para esta tarefa, um modelo mais leve é suficiente." Indo além, em vez de as pessoas escolherem modelos toda vez, o sistema alocará automaticamente o modelo ideal. Estamos caminhando para um mundo assim.

Na era dos agentes, isso se torna ainda mais importante. Como os agentes executam de forma autônoma, não há espaço para um humano pensar toda vez, "É um luxo usar o Opus agora?" Desde o início, não haverá outra escolha senão deixar a seleção do modelo ideal com base na natureza da tarefa para o sistema.
Os serviços que fornecemos na Bakuraku serão oferecidos como serviços gerenciados, incluindo a implementação de backend que seleciona o modelo ideal sem que o usuário tenha que estar ciente disso. O AI Token Advisor é meramente a entrada.
Resumo
Os custos de tokens de IA já estão excedendo a escala onde podem ser tratados com uma abordagem de "apenas jogue dinheiro no problema." Para algumas empresas, eles estão se tornando despesas no mesmo nível dos custos trabalhistas e de marketing.
Os custos de marketing são estritamente gerenciados pelo CAC, e ninguém opera dizendo: "Apenas veicule anúncios, independentemente do CAC." O mesmo vale para os custos trabalhistas; salário, contratação e alocação são todos gerenciados. Você não contrata pessoas com qualquer salário.
Neste mesmo nível, os custos de IA entrarão no escopo da gestão. A primeira coisa necessária então é visualizar "quanto está sendo gasto." E a seguir é verificar "se o modelo apropriado está sendo escolhido para a tarefa e a pessoa."
Pode parecer sem glamour, mas dominar esses dois pontos se tornará uma questão crítica de gestão nos próximos anos.
Para aqueles que desejam implementar tal futuro juntos, a LayerX está recrutando ativamente AI Builders!

Estamos contratando ativamente! https://jobs.layerx.co.jp/





