Oggi parliamo di come la fase del "Token Maxing" – ovvero massimizzare l'uso dei token AI – abbia chiuso il suo ciclo, e la tendenza si stia spostando verso il "Token Management", che mette in discussione il ROI dell'AI. La gestione dei token è oggi un problema gestionale tanto critico quanto la pianificazione del personale o le decisioni sugli investimenti di marketing.
All'estero, questo concetto di "Token Management" viene spesso discusso in modo più tecnico come "Token Optimization". Per chiarezza, qui userò il termine Token Management, ma consideratelo sinonimo di Token Optimization.
Token Maxing e la sua reazione

Nell'ultimo anno, l'uso dell'AI generativa è stato in una fase che potremmo chiamare "Token Maxing". Si trattava di inondare i compiti di token, colpire ripetutamente i modelli più potenti e inserire contesto fino al limite assoluto. Anche i fornitori di AI hanno spinto per l'espansione dell'utilizzo come metrica di successo, sovvenzionando di fatto l'uso attraverso abbonamenti a prezzo fisso. Dal lato dell'utente, usare il modello più potente senza preoccuparsi del costo veniva considerato un vantaggio competitivo.
Tuttavia, entrando nel 2026, è emersa una chiara reazione a questa struttura.
Uber è un esempio emblematico. L'azienda ha istituito internamente una classifica di Claude Code per far competere gli ingegneri sull'utilizzo e, di conseguenza, ha esaurito il budget AI per la programmazione del 2026 in soli quattro mesi. Andrew Macdonald, COO di Uber, ha dichiarato in un podcast:
"D'ora in poi, dobbiamo discutere il consumo di token e i relativi costi insieme ai costi del lavoro. Se non riusciamo a tracciare una linea diretta che dimostri che le funzionalità che raggiungono i clienti aumentano tanto quanto spendiamo, questo compromesso è difficile da giustificare."
Preoccupazioni simili vengono espresse anche da chi vende AI. Satya Nadella di Microsoft ha affermato alla Morgan Stanley TMT Conference del marzo 2026:
"Perché stiamo usando così tanti token? In molti casi, stiamo facendo le cose peggiori in termini di efficienza dei token. Ciò su cui tutti lavoreranno nel prossimo anno è l'uso di strumenti e software per rendere l'AI efficiente."
In effetti, Microsoft ha ridotto significativamente le licenze dirette di Claude Code che aveva appena introdotto internamente.
Da qui in avanti, l'AI non sarà più uno strumento da "usare quanto vuoi", ma un argomento di cui si mette in discussione il ROI, proprio come i costi del lavoro o del marketing. Il punto centrale per la gestione passerà da quanti token sono stati usati a cosa quei token hanno prodotto e dove allocarli successivamente.
L'uso su larga scala dei token è un prerequisito per competere
Sebbene ciò suoni un po' negativo, la premessa è che l'evoluzione dell'AI sia estremamente potente. Nel campo dello sviluppo, non c'è opzione di non usare agenti di codifica. Le aziende che non possono permettersi un certo livello di costi di token si stanno essenzialmente ritirando dalla competizione. Inoltre, la soglia per quel "certo livello" di costo dei token è piuttosto alta. Dobbiamo affrontare la dura realtà che non si può accelerare senza capacità di investimento.
Infatti, non è raro che i costi dei token consumati dagli ingegneri raggiungano decine di percentuali o addirittura la metà del loro stipendio. Sta diventando necessario pensare al "costo di assumere un ingegnere" non solo come "stipendio", ma come un insieme di "stipendio più costi dei token AI". Per il management, questa è l'emergere di una categoria di costo completamente nuova.
Il Token Maxing non è stato un movimento privo di senso; usando l'AI a pieno regime, credo che l'apprendimento sia progredito rapidamente su dove accelerare e dove esercitare maggiore controllo. Andando avanti, le aziende che sapranno fare Token Management – accelerare dove dovuto e controllare dove necessario – si distingueranno.
Il Token Management è diventato esso stesso un problema gestionale. Il Token Maxing è stato un importante primo passo per la trasformazione strutturale delle aziende.
Nella nostra azienda, la fase di usare i token fine a se stessi è finita, e siamo in una fase di come produrre risultati. All'interno del "Compass" (principi guida) di LayerX, ci sono direttive come "Fai dell'AI un motore di crescita" e "Non costruire cose che non verranno usate. Non cadere nella trappola del costruire AI."

Da https://speakerdeck.com/layerx/compass_202209?slide=34

Da https://speakerdeck.com/layerx/compass_202209?slide=36
Come risultato di queste linee guida, abbiamo ottimizzato i token internamente. Li abbiamo usati dove dovevano essere usati e ottimizzati dove dovevano essere ottimizzati, eppure il numero di token utilizzati non è cambiato significativamente rispetto a quando facevamo Token Maxing in LayerX. Sento che l'uso su larga scala dei token al di sopra di un certo livello è diventato un prerequisito per competere.
Gli Agenti di Codifica sono solo un "Precedente"
Ciò che è importante qui è che questo consumo esplosivo di token non è limitato al campo specializzato della codifica.
Attualmente, tutti i tipi di operazioni aziendali oltre la codifica vengono risolti nello stesso modo degli agenti di codifica. Raccolta di segnali e creazione di proposte per le vendite, richieste di assistenza clienti, rendicontazione e approvazione automatica delle spese, revisioni di contratti legali, operazioni pubblicitarie di marketing, screening delle assunzioni HR – queste vengono ridisegnate una dopo l'altra come agenti di esecuzione autonoma.
Gli agenti autonomi consumano token in quantità incomparabili rispetto al precedente modo "una domanda, una risposta" in cui gli umani li usavano. Man mano che gli agenti fanno più lavoro, tutto l'uso dell'AI convergerà nello stesso schema che vediamo ora con gli agenti di codifica. Gli agenti di codifica sono stati solo il primo precedente a raggiungere quel modello.

La sfida della gestione dei costi dei token AI, che attualmente sembra un "problema solo per ingegneri", diventerà presto un problema gestionale a livello aziendale. Questo perché ogni area aziendale all'interno di un'azienda avrà lo stesso profilo di consumo di token entro i prossimi anni.
I Costi dei Token sono una Bomba a Orologeria

C'è un altro fatto che dobbiamo riconoscere qui. Le tariffe di abbonamento AI che stiamo attualmente pagando sono significativamente inferiori ai costi reali.
Attualmente, è comune che i fornitori di modelli di base offrano abbonamenti AI in perdita, e c'è un enorme divario tra le tariffe fisse che paghiamo e i costi effettivamente sostenuti. Se ricalcolate lo stesso utilizzo con i prezzi API a consumo, il costo aumenta di ordini di grandezza. Il formato dell'abbonamento rende il costo effettivo invisibile all'utente.
Il problema è che le aziende di modelli di base potrebbero rendere evidente questa differenza di costo effettivo in qualsiasi momento. Nel momento in cui la parte sovvenzionata inizierà a essere trasferita ai clienti sotto forma di passaggio dalla fatturazione flat-rate a quella basata sui token, indicazioni verso piani superiori o aumenti di prezzo, la sensazione di "decine di migliaia di yen per ID al mese, che costa a un'azienda di 100 dipendenti decine di milioni di yen all'anno" potrebbe passare all'ordine di "centinaia di milioni o miliardi di yen all'anno per l'intera azienda" in un breve periodo. La differenza di costo effettivo nascosta dagli abbonamenti diventa la potenza della bomba a orologeria.
La prima cosa necessaria è rendere visibile ciò che sta accadendo all'interno dell'azienda prima che l'esplosione venga a galla.
(Questo articolo è utile per i dettagli: https://www.thestateofbrand.com/news/ai-subscription-time-bombhttps://www.thestateofbrand.com/news/ai-subscription-time-bomb))
Prima di tutto, la Visualizzazione
La prima cosa necessaria per questo problema è qualcosa di estremamente basilare: rendere visibile "chi sta usando quale modello e quanti token." Tutto qui.
Per le persone, abbiamo già vaste basi di gestione come valutazioni del personale, gestione degli obiettivi, sistemi retributivi e progettazione organizzativa. Per le spese di marketing, è naturale ottimizzare misurando CAC e payback. Gli acquisti hanno team e flussi di lavoro specializzati.
Tuttavia, per l'AI, anche questa visualizzazione più basilare non è ancora in atto. Per CEO e dipartimenti IT, il fatto che non possano vedere "chi sta spendendo quanto per l'AI in questo momento" è già un importante fattore di stress. Il valore viene creato semplicemente mettendo i numeri su una dashboard.
Il "AI Token Advisor" che stiamo attualmente fornendo è un prodotto progettato esattamente per colmare questa lacuna. È uno strumento semplice per visualizzare chi ha usato quale modello per quale compito e quanti token. (Gli utenti di Bakuraku possono usare un ID gratuitamente!)

Da https://bakuraku.jp/resources/product/pre-registration-ai-token-advisor/
Tuttavia, la visualizzazione è solo l'ingresso. Ciò che è veramente importante è la domanda che inevitabilmente sorge oltre.
"Quel compito avrebbe davvero dovuto usare quel modello?"
Con il progredire della visualizzazione, la prossima domanda che sorge sempre è: "Quel compito avrebbe davvero dovuto usare quel modello?"
Ad esempio, usare un modello di ragionamento di alto livello (come Claude Opus 4.8 o GPT-5.5; i modelli più recenti a maggio 2026) per una domanda come "Che tempo fa oggi?" è chiaramente eccessivo. Il modello più leggero è sufficiente, e potrebbe nemmeno aver bisogno di essere un modello di ragionamento. Allo stesso modo, ci sono casi massicci all'interno delle aziende in cui modelli costosi continuano ad essere utilizzati per compiti maturi come la creazione di email di routine.
Anche le tendenze variano da persona a persona. Le persone che non sono abituate a usare l'AI tendono a scegliere semplicemente il modello più potente per il momento. Al contrario, chi usa l'AI in modo approfondito cambia modello in base alla natura del compito. Questa differenza, in termini sia di costo che di qualità, diventa troppo grande per essere ignorata da un'organizzazione.
Ciò che è importante qui è il fatto che tutto l'input all'AI viene infine convertito nella forma di un "prompt". Le domande in chat e il contesto passato agli agenti vengono tutti inseriti internamente nel modello come prompt. In altre parole, se guardi il prompt, puoi capire abbastanza bene cosa quella persona sta facendo fare all'AI.
Partendo da questo prompt, possiamo rilevare discrepanze tra compiti e modelli e fornire indicazioni come: "Per questo compito, un modello più leggero è sufficiente." Andando oltre, invece di far scegliere i modelli ogni volta alle persone, il sistema allocherà automaticamente il modello ottimale. Ci stiamo muovendo verso un mondo del genere.

Nell'era degli agenti, questo diventa ancora più importante. Poiché gli agenti eseguono in modo autonomo, non c'è spazio per un umano per pensare ogni volta: "È uno spreco usare Opus adesso?" Fin dall'inizio, non ci sarà altra scelta che lasciare al sistema la selezione del modello ottimale basata sulla natura del compito.
I servizi che forniamo in Bakuraku saranno offerti come servizi gestiti, inclusa l'implementazione backend che seleziona il modello ottimale senza che l'utente debba esserne consapevole. AI Token Advisor è solo l'ingresso.
Riepilogo
I costi dei token AI hanno già superato la scala in cui possono essere gestiti con un approccio del tipo "buttaci semplicemente soldi". Per alcune aziende, stanno diventando spese pari ai costi del lavoro e del marketing.
I costi di marketing sono strettamente gestiti dal CAC, e nessuno opera dicendo: "Fai pubblicità indipendentemente dal CAC." Lo stesso vale per i costi del lavoro; stipendi, assunzioni e collocamento sono tutti gestiti. Non assumi persone a qualsiasi stipendio.
A questo stesso livello, i costi dell'AI entreranno nell'ambito della gestione. La prima cosa necessaria allora è visualizzare "quanto si sta spendendo". E la successiva è verificare "se il modello appropriato viene scelto per il compito e la persona."
Può sembrare poco affascinante, ma padroneggiare questi due punti diventerà una questione gestionale critica nei prossimi anni.
Per coloro che vogliono implementare insieme un tale futuro, LayerX sta attivamente assumendo AI Builder!

Stiamo assumendo attivamente! https://jobs.layerx.co.jp/





