YouMind
Iniciar sesión

De la maximización de tokens a la gestión de tokens

@fukkyy
JAPONÉS01 jun 2026
293K
606
108
0
726

TL;DR

A medida que termina la era del uso ilimitado de IA, las empresas deben pasar de la maximización de tokens a la gestión de tokens para garantizar el retorno de inversión. Este artículo explora cómo los costos de IA se están convirtiendo en un problema de gestión crítico, comparable a los gastos de mano de obra y marketing.

Hoy, hablamos sobre cómo la fase de "Token Maxing" —maximizar el uso de tokens de IA— ha completado el ciclo, y la tendencia se está desplazando hacia la "Gestión de Tokens", que cuestiona el ROI de la IA. La gestión de tokens es ahora un problema de gestión tan crítico como la planificación de personal o las decisiones de inversión en marketing.

En el extranjero, este concepto de "Gestión de Tokens" a menudo se discute de manera más técnica como "Optimización de Tokens". Para mayor claridad, usaré el término Gestión de Tokens aquí, pero considérenlo sinónimo de Optimización de Tokens.

Token Maxing y su reacción adversa

福島良典 | LayerX - inline image

Durante el último año, el uso de la IA generativa ha estado en una fase que podría llamarse "Token Maxing". Se trataba de inundar las tareas con tokens, utilizar los modelos más potentes repetidamente y alimentar el contexto al límite absoluto. Los proveedores de IA también promovieron la expansión del uso como métrica de éxito, subvencionando efectivamente a través de suscripciones de tarifa plana. Del lado del usuario, usar el modelo más potente sin preocuparse por el costo se promocionaba como una ventaja competitiva.

Sin embargo, al entrar en 2026, ha comenzado a surgir una clara reacción adversa a esta estructura.

Uber es un ejemplo simbólico. La empresa estableció internamente un ranking de Claude Code para que los ingenieros compitieran en uso, y como resultado, agotaron su presupuesto de programación con IA para 2026 en solo cuatro meses. Andrew Macdonald, COO de Uber, mencionó en un podcast:

"De ahora en adelante, debemos discutir el consumo de tokens y sus costos asociados junto con los costos laborales. Si no podemos trazar una línea recta que muestre que las funciones que llegan a los clientes aumentan tanto como gastamos, es difícil justificar esta compensación."

https://www.youtube.com/watch?v=y_mQ6xLcKyc&t=1776s

Preocupaciones similares están siendo expresadas por quienes venden IA. Satya Nadella, de Microsoft, declaró en la Conferencia TMT de Morgan Stanley en marzo de 2026:

"¿Por qué estamos usando tantos tokens? En muchos casos, estamos haciendo lo peor en términos de eficiencia de tokens. En lo que todos trabajarán durante el próximo año es en el uso de herramientas y software para hacer que la IA sea eficiente."

https://www.investing.com/news/transcripts/microsoft-at-morgan-stanley-conference-ais-transformative-role-93CH-4542000

De hecho, Microsoft ha reducido significativamente las licencias directas de Claude Code que acababa de introducir internamente.

De aquí en adelante, la IA no será una herramienta que puedas simplemente "usar tanto como quieras", sino un tema del que se cuestione el ROI, al igual que los costos laborales o de marketing. El punto clave para la gestión pasará de cuántos tokens se usaron a qué produjeron esos tokens y dónde asignarlos a continuación.

El uso de tokens a gran escala es un requisito previo para la competencia

Si bien esto suena un poco negativo, la premisa es que la evolución de la IA es extremadamente poderosa. En el campo del desarrollo, no existe la opción de no usar agentes de codificación. Las empresas que no pueden permitirse un cierto nivel de costos de tokens están esencialmente retirándose de la competencia. Además, el umbral para ese "cierto nivel" de costo de tokens es bastante alto. Debemos enfrentar la dura realidad de que no se puede acelerar sin capacidad de inversión.

De hecho, no es raro que los costos de tokens consumidos por los ingenieros alcancen decenas de por ciento o incluso la mitad de su salario. Se está volviendo necesario pensar en el "costo de contratar a un ingeniero" no solo como "salario", sino como un conjunto de "salario más costos de tokens de IA". Para la dirección, esto es la aparición de una categoría de costos completamente nueva.

Token Maxing no fue un movimiento sin sentido; al usar la IA a toda máquina, creo que el aprendizaje progresó rápidamente en cuanto a dónde pisar el acelerador y dónde ejercer más control. En el futuro, las empresas que puedan realizar una Gestión de Tokens —acelerar donde se debe y controlar donde se debe— se destacarán.

La Gestión de Tokens se ha convertido en un problema de gestión en sí mismo. Token Maxing fue un primer paso importante para la transformación estructural de las empresas.

En nuestra empresa, la fase de solo usar tokens por usarlos ha terminado, y estamos en una fase de cómo producir resultados. Dentro de la "Brújula" (principios rectores) de LayerX, hay directivas como "Hacer de la IA un motor de crecimiento" y "No construir cosas que no se usarán. No caer en la trampa de construir IA."

福島良典 | LayerX - inline image

De https://speakerdeck.com/layerx/compass_202209?slide=34

福島良典 | LayerX - inline image

De https://speakerdeck.com/layerx/compass_202209?slide=36

Como resultado de estas directrices, optimizamos los tokens internamente. Los usamos donde debían usarse y optimizamos donde debían optimizarse, sin embargo, la cantidad de tokens utilizados no ha cambiado significativamente desde que hacíamos Token Maxing en LayerX. Siento que el uso de tokens a gran escala por encima de un cierto nivel se ha convertido en un requisito previo para la competencia.

Los Agentes de Codificación son Meramente un "Precedente"

Lo importante aquí es que este consumo explosivo de tokens no se limita al campo especializado de la codificación.

Actualmente, todo tipo de operaciones comerciales además de la codificación se están resolviendo de la misma manera que los agentes de codificación. La recopilación de señales y la creación de propuestas para ventas, las consultas de atención al cliente, la generación y aprobación automática de informes de gastos, las revisiones de contratos legales, las operaciones de anuncios de marketing, la selección de candidatos de RRHH —todo esto se está rediseñando uno tras otro como agentes de ejecución autónoma.

Los agentes autónomos consumen tokens en cantidades incomparables con la forma anterior de "una pregunta, una respuesta" en que los humanos los usaban. A medida que los agentes hacen más trabajo, todo el uso de IA convergerá en el mismo patrón que vemos ahora con los agentes de codificación. Los agentes de codificación simplemente resultaron ser el primer precedente en alcanzar ese patrón.

福島良典 | LayerX - inline image

El desafío de la gestión de costos de tokens de IA, que actualmente parece un "problema solo de ingenieros", pronto se convertirá en un problema de gestión a nivel de toda la empresa. Esto se debe a que cada área de negocio dentro de una empresa tendrá el mismo perfil de consumo de tokens en los próximos años.

Los Costos de Tokens son una Bomba de Tiempo

福島良典 | LayerX - inline image

Hay otro hecho que debemos reconocer aquí. Las tarifas de suscripción de IA que estamos pagando actualmente son significativamente más bajas que los costos reales.

Actualmente, es común que los proveedores de modelos fundacionales ofrezcan suscripciones de IA con pérdidas, y existe una gran brecha entre las tarifas planas que pagamos y los costos reales incurridos. Si recalcula el mismo uso con el precio de pago por uso de la API, el costo aumenta en órdenes de magnitud. El formato de suscripción hace que el costo real sea invisible para el usuario.

El problema es que las empresas de modelos fundacionales podrían hacer evidente esta diferencia en el costo real en cualquier momento. En el momento en que la parte subvencionada comience a trasladarse a los clientes en forma de un cambio de tarifa plana a facturación basada en tokens, una guía hacia planes superiores o aumentos de precios, la sensación de "decenas de miles de yenes por ID al mes, que le cuesta a una empresa de 100 empleados decenas de millones de yenes al año" podría saltar al orden de "cientos de millones o miles de millones de yenes al año para toda la empresa" en un corto período de tiempo. La diferencia en el costo real oculta por las suscripciones se convierte en el poder de la bomba de tiempo.

Lo primero que se necesita es hacer visible lo que está sucediendo dentro de la empresa antes de que la explosión salga a la superficie.

(Este artículo es útil para más detalles: https://www.thestateofbrand.com/news/ai-subscription-time-bombhttps://www.thestateofbrand.com/news/ai-subscription-time-bomb))

Primero, la Visualización

Lo primero que se necesita para este problema es algo extremadamente básico: hacer visible "quién está usando qué modelo y cuántos tokens". Eso es todo.

Para las personas, ya tenemos vastas bases de gestión como evaluaciones de personal, gestión de objetivos, sistemas salariales y diseño organizacional. Para los gastos de marketing, es natural optimizar mientras se miden el CAC y el payback. Las adquisiciones tienen equipos y flujos de trabajo especializados.

Sin embargo, para la IA, ni siquiera esta visualización más básica está implementada. Para los CEOs y los departamentos de TI, el hecho de que no puedan ver "quién está gastando cuánto en IA ahora mismo" ya es un factor de estrés importante. El valor se crea simplemente poniendo números en un tablero.

El "AI Token Advisor" que actualmente proporcionamos es un producto diseñado exactamente para llenar este vacío. Es una herramienta simple para visualizar quién usó qué modelo para qué tarea y cuántos tokens. (¡Los usuarios de Bakuraku pueden usar una ID gratis!)

福島良典 | LayerX - inline image

De https://bakuraku.jp/resources/product/pre-registration-ai-token-advisor/

Sin embargo, la visualización es solo la entrada. Lo que es verdaderamente importante es la pregunta que inevitablemente surge más allá de eso.

"¿Esa tarea realmente debería haber usado ese modelo?"

A medida que avanza la visualización, la siguiente pregunta que siempre surge es: "¿Esa tarea realmente debería haber usado ese modelo?"

Por ejemplo, usar un modelo de razonamiento de primer nivel (como Claude Opus 4.8 o GPT-5.5; los modelos más recientes a mayo de 2026) para una pregunta como "¿Qué clima hace hoy?" es claramente excesivo. El modelo más ligero es suficiente, y posiblemente ni siquiera necesitaría ser un modelo de razonamiento. De manera similar, hay innumerables casos dentro de las empresas donde se siguen utilizando modelos costosos para tareas maduras como la creación rutinaria de correos electrónicos.

Las tendencias también varían según la persona. Las personas que no están acostumbradas a usar IA tienden a elegir el modelo más potente por ahora. Por el contrario, aquellos que usan IA profundamente cambian de modelo según la naturaleza de la tarea. Esta diferencia, tanto en términos de costo como de calidad, se vuelve demasiado grande para que una organización la ignore.

Lo importante aquí es el hecho de que toda entrada a la IA se convierte finalmente en la forma de un "prompt". Las preguntas de chat y el contexto pasado a los agentes se introducen internamente como prompts en el modelo. En otras palabras, si observas el prompt, puedes saber bastante bien qué está haciendo esa persona con la IA.

A partir de este prompt, podemos detectar desajustes entre tareas y modelos y proporcionar orientación como: "Para esta tarea, un modelo más ligero es suficiente". Yendo más allá, en lugar de que las personas elijan modelos cada vez, el sistema asignará automáticamente el modelo óptimo. Nos estamos moviendo hacia ese mundo.

福島良典 | LayerX - inline image

En la era de los agentes, esto se vuelve aún más importante. Dado que los agentes ejecutan de forma autónoma, no hay espacio para que un humano piense cada vez: "¿Es un lujo usar Opus ahora?" Desde el principio, no habrá más opción que dejar la selección del modelo óptimo basada en la naturaleza de la tarea al sistema.

Los servicios que proporcionamos en Bakuraku se ofrecerán como servicios gestionados, incluida la implementación backend que selecciona el modelo óptimo sin que el usuario tenga que ser consciente de ello. AI Token Advisor es meramente la entrada.

Resumen

Los costos de tokens de IA ya están superando la escala en la que se pueden manejar con un enfoque de "solo tirar dinero". Para algunas empresas, se están convirtiendo en gastos a la par de los costos laborales y de marketing.

Los costos de marketing se gestionan estrictamente por CAC, y nadie opera diciendo: "Solo publica anuncios sin importar el CAC". Lo mismo ocurre con los costos laborales; el salario, la contratación y la colocación se gestionan. No contratas personas a cualquier salario.

En este mismo nivel, los costos de IA entrarán en el ámbito de la gestión. Lo primero que se necesita entonces es visualizar "cuánto se está gastando". Y lo siguiente es verificar "si se está eligiendo el modelo apropiado para la tarea y la persona".

Puede parecer poco glamoroso, pero dominar estos dos puntos se convertirá en un problema crítico de gestión en los próximos años.

¡Para aquellos que quieran implementar ese futuro juntos, LayerX está reclutando activamente AI Builders!

福島良典 | LayerX - inline image

¡Estamos contratando activamente! https://jobs.layerx.co.jp/

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales