YouMind
Iniciar sesión

De la maximización de tokens a la gestión de tokens

@fukkyy
JAPONÉS01 jun 2026
293K
606
108
0
726

TL;DR

A medida que termina la era del uso ilimitado de la IA, las empresas deben pasar de la maximización de tokens a la gestión de tokens para garantizar el retorno de la inversión. Este artículo explora cómo los costes de la IA se están convirtiendo en un problema de gestión crítico comparable a los gastos laborales y de marketing.

Hoy hablamos sobre cómo la fase de "Token Maxing", la maximización del uso de tokens de IA, ha cerrado el círculo y la tendencia se está desplazando hacia la "Gestión de Tokens", que cuestiona el retorno de inversión de la IA. La gestión de tokens se ha convertido en un problema directivo tan crítico como la planificación de personal o las decisiones de inversión en marketing.

En el extranjero, este concepto de "Gestión de Tokens" a menudo se discute de manera más técnica como "Optimización de Tokens". Para mayor claridad, usaré el término Gestión de Tokens aquí, pero considérenlo sinónimo de Optimización de Tokens.

El auge de Token Maxing y su reacción adversa

福島良典 | LayerX - inline image

Durante el último año, el uso de la IA generativa ha estado en una fase que podríamos llamar "Token Maxing". Consistía en inundar las tareas con tokens, usar repetidamente los modelos más potentes y alimentar el contexto hasta el límite absoluto. Los proveedores de IA también impulsaban la expansión del uso como métrica de éxito, ofreciendo subvenciones mediante suscripciones a precio fijo. Del lado del usuario, usar el modelo más potente sin preocuparse por el coste se consideraba una ventaja competitiva.

Sin embargo, al entrar en 2026, ha comenzado a surgir una clara reacción adversa a esta estructura.

Uber es un ejemplo simbólico. La compañía estableció una tabla de clasificación interna de Claude Code para que los ingenieros compitieran en uso, y como resultado, agotaron su presupuesto de IA para codificación de 2026 en solo cuatro meses. Andrew Macdonald, COO de Uber, mencionó en un podcast:

"De ahora en adelante, debemos discutir el consumo de tokens y sus costes asociados junto con los costes laborales. Si no podemos trazar una línea directa que demuestre que las funciones que llegan a los clientes aumentan tanto como lo que gastamos, esta compensación es difícil de justificar."

https://www.youtube.com/watch?v=y_mQ6xLcKyc&t=1776s

Preocupaciones similares están siendo expresadas por quienes venden IA. Satya Nadella de Microsoft declaró en la Conferencia TMT de Morgan Stanley en marzo de 2026:

"¿Por qué estamos usando tantos tokens? En muchos casos, estamos haciendo lo peor en términos de eficiencia de tokens. En lo que todos trabajarán durante el próximo año es en el uso de herramientas y software para hacer que la IA sea eficiente."

https://www.investing.com/news/transcripts/microsoft-at-morgan-stanley-conference-ais-transformative-role-93CH-4542000

De hecho, Microsoft ha reducido significativamente las licencias directas de Claude Code que acababa de introducir internamente.

A partir de ahora, la IA no será una herramienta de la que puedas "usar todo lo que quieras", sino un tema del que se cuestione el ROI, al igual que los costes laborales o de marketing. El punto clave para la dirección pasará de cuántos tokens se usaron a qué produjeron esos tokens y dónde asignarlos a continuación.

El uso de tokens a gran escala es un requisito previo para la competencia

Aunque esto suene un poco negativo, la premisa es que la evolución de la IA es extremadamente poderosa. En el ámbito del desarrollo, no hay opción de no usar agentes de codificación. Las empresas que no pueden permitirse un cierto nivel de costes de tokens están, esencialmente, retirándose de la competencia. Además, el listón para ese "cierto nivel" de coste de tokens es bastante alto. Debemos enfrentar la dura realidad de que no se puede acelerar sin capacidad de inversión.

De hecho, no es raro que los costes de tokens consumidos por los ingenieros alcancen decenas de porcentaje, o incluso la mitad, de su salario. Se está volviendo necesario pensar en el "coste de contratar a un ingeniero" no solo como "salario", sino como un conjunto de "salario más costes de tokens de IA". Para la dirección, esto es la aparición de una categoría de coste completamente nueva.

Token Maxing no fue un movimiento sin sentido; al usar la IA a toda máquina, creo que el aprendizaje progresó rápidamente sobre dónde pisar el acelerador y dónde ejercer más control. De cara al futuro, las empresas que puedan realizar una Gestión de Tokens—acelerando donde deben y controlando donde deben—se destacarán.

La Gestión de Tokens se ha convertido en un problema de gestión en sí mismo. Token Maxing fue un primer paso importante para la transformación estructural de las empresas.

En nuestra empresa, la fase de usar tokens solo por usarlos ha terminado, y estamos en una fase de cómo producir resultados. Dentro de la "Brújula" (principios rectores) de LayerX, hay directivas como "Hacer de la IA un motor de crecimiento" y "No construir cosas que no se usarán. No caer en la trampa de construir IA."

福島良典 | LayerX - inline image

De https://speakerdeck.com/layerx/compass_202209?slide=34

福島良典 | LayerX - inline image

De https://speakerdeck.com/layerx/compass_202209?slide=36

Como resultado de estas directrices, optimizamos los tokens internamente. Los usamos donde debían usarse y los optimizamos donde debían optimizarse, sin embargo, la cantidad de tokens utilizados no ha cambiado significativamente desde que hacíamos Token Maxing en LayerX. Siento que el uso de tokens a gran escala por encima de un cierto nivel se ha convertido en un requisito previo para la competencia.

Los Agentes de Codificación son Meramente un "Precedente"

Lo importante aquí es que este consumo explosivo de tokens no se limita al campo especializado de la codificación.

Actualmente, todo tipo de operaciones comerciales, además de la codificación, se están resolviendo de la misma manera que los agentes de codificación. La recopilación de señales y la creación de propuestas para ventas, las consultas de atención al cliente, la generación y aprobación automática de informes de gastos, las revisiones de contratos legales, las operaciones de anuncios de marketing, el reclutamiento y selección de RRHH—todo esto se está rediseñando uno tras otro como agentes de ejecución autónoma.

Los agentes autónomos consumen tokens en cantidades incomparables a la forma anterior de "una pregunta, una respuesta" en que los humanos los usaban. A medida que los agentes hacen más trabajo, todo el uso de IA convergerá en el mismo patrón que vemos ahora con los agentes de codificación. Los agentes de codificación resultaron ser simplemente el primer precedente en alcanzar ese patrón.

福島良典 | LayerX - inline image

El desafío de la gestión de costes de tokens de IA, que actualmente parece un "problema solo de ingenieros", pronto se convertirá en un problema de gestión para toda la empresa. Esto se debe a que todas las áreas de negocio dentro de una empresa tendrán el mismo perfil de consumo de tokens en los próximos años.

Los Costes de Tokens son una Bomba de Tiempo

福島良典 | LayerX - inline image

Hay otro hecho que debemos reconocer aquí. Las tarifas de suscripción de IA que estamos pagando actualmente son significativamente más bajas que los costes reales.

Actualmente, es común que los proveedores de modelos fundacionales ofrezcan suscripciones de IA con pérdidas, y existe una gran brecha entre las tarifas fijas que pagamos y los costes reales incurridos. Si se recalcula el mismo uso con la tarifa de pago por uso de la API, el costo aumenta en órdenes de magnitud. El formato de suscripción hace que el coste real sea invisible para el usuario.

El problema es que las empresas de modelos fundacionales podrían hacer evidente esta diferencia en el coste real en cualquier momento. En el momento en que la parte subvencionada comience a trasladarse a los clientes en forma de un cambio de facturación a precio fijo a facturación basada en tokens, migración a planes superiores o aumentos de precio, la sensación de "decenas de miles de yenes por ID al mes, que cuesta a una empresa de 100 empleados decenas de millones de yenes al año" podría saltar al orden de "cientos de millones o miles de millones de yenes al año para toda la empresa" en un corto período. La diferencia en el coste real oculta por las suscripciones se convierte en el poder de la bomba de tiempo.

Lo primero que se necesita es hacer visible lo que está sucediendo dentro de la empresa antes de que la explosión salga a la superficie.

(Este artículo es útil para más detalles: https://www.thestateofbrand.com/news/ai-subscription-time-bombhttps://www.thestateofbrand.com/news/ai-subscription-time-bomb))

Primero, la Visualización

Lo primero que se necesita para este problema es algo extremadamente básico: hacer visible "quién está usando qué modelo y cuántos tokens". Eso es todo.

Para las personas, ya tenemos vastos fundamentos de gestión como evaluaciones de personal, gestión de objetivos, sistemas salariales y diseño organizacional. Para los gastos de marketing, es natural optimizar mientras se miden el CAC y el retorno. Las adquisiciones tienen equipos y flujos de trabajo especializados.

Sin embargo, para la IA, ni siquiera esta visualización tan básica está implementada todavía. Para los CEOs y los departamentos de TI, el hecho de que no puedan ver "quién está gastando cuánto en IA ahora mismo" ya es un factor de estrés importante. El valor se crea simplemente poniendo números en un panel de control.

El "AI Token Advisor" que estamos proporcionando actualmente es un producto diseñado precisamente para llenar este vacío. Es una herramienta simple para visualizar quién usó qué modelo, para qué tarea y cuántos tokens. (¡Los usuarios de Bakuraku pueden usar una ID de forma gratuita!)

福島良典 | LayerX - inline image

De https://bakuraku.jp/resources/product/pre-registration-ai-token-advisor/

Sin embargo, la visualización es solo la entrada. Lo verdaderamente importante es la pregunta que surge inevitablemente más allá de eso.

"¿Esa tarea realmente debería haber usado ese modelo?"

A medida que avanza la visualización, la siguiente pregunta que siempre surge es: "¿Esa tarea realmente debería haber usado ese modelo?"

Por ejemplo, usar un modelo de razonamiento de primer nivel (como Claude Opus 4.8 o GPT-5.5; los modelos más recientes a partir de mayo de 2026) para una pregunta como "¿Qué tiempo hace hoy?" es claramente excesivo. El modelo más ligero es suficiente, y quizás ni siquiera necesitaría ser un modelo de razonamiento. De manera similar, hay numerosos casos dentro de las empresas donde se siguen usando modelos caros para tareas maduras como la creación rutinaria de correos electrónicos.

Las tendencias también varían según la persona. Las personas que no están acostumbradas a usar IA tienden a elegir el modelo más potente por ahora. Por el contrario, aquellos que usan IA en profundidad cambian de modelo según la naturaleza de la tarea. Esta diferencia, tanto en términos de coste como de calidad, se vuelve demasiado grande para que una organización la ignore.

Lo importante aquí es el hecho de que toda la entrada a la IA se convierte finalmente en forma de "prompt". Las preguntas de chat y el contexto pasado a los agentes se ingresan internamente al modelo como prompts. En otras palabras, si miras el prompt, puedes saber bastante bien qué está haciendo esa persona con la IA.

Partiendo de este prompt, podemos detectar desajustes entre tareas y modelos y proporcionar orientación como: "Para esta tarea, un modelo más ligero es suficiente". Yendo más allá, en lugar de que las personas elijan modelos cada vez, el sistema asignará automáticamente el modelo óptimo. Nos estamos moviendo hacia un mundo así.

福島良典 | LayerX - inline image

En la era de los agentes, esto se vuelve aún más importante. Dado que los agentes ejecutan de forma autónoma, no hay espacio para que un humano piense cada vez: "¿Es un lujo usar Opus ahora?" Desde el principio, no habrá más opción que dejar la selección del modelo óptimo basada en la naturaleza de la tarea al sistema.

Los servicios que proporcionamos en Bakuraku se ofrecerán como servicios gestionados, incluyendo la implementación backend que selecciona el modelo óptimo sin que el usuario tenga que ser consciente de ello. AI Token Advisor es meramente la entrada.

Resumen

Los costes de tokens de IA ya están superando la escala en la que se pueden manejar con un enfoque de "solo tirar dinero". Para algunas empresas, se están convirtiendo en gastos a la par de los costes laborales y de marketing.

Los costes de marketing se gestionan estrictamente por CAC, y nadie opera diciendo: "Solo ejecuta anuncios sin importar el CAC". Lo mismo ocurre con los costes laborales; el salario, la contratación y la colocación se gestionan todos. No contratas personas a cualquier salario.

En este mismo nivel, los costes de IA entrarán en el ámbito de la gestión. Lo primero que se necesita entonces es visualizar "cuánto se está gastando". Y lo siguiente es verificar "si se está eligiendo el modelo apropiado para la tarea y la persona".

Puede parecer poco glamuroso, pero dominar estos dos puntos se convertirá en un problema de gestión crítico en los próximos años.

¡Para aquellos que quieran implementar ese futuro juntos, LayerX está reclutando activamente AI Builders!

福島良典 | LayerX - inline image

¡Estamos contratando activamente! https://jobs.layerx.co.jp/

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales