
La economía de los tokens
Cuando hablamos de IA hoy en día, los tokens son los reyes. Específicamente, los tokens de inferencia han surgido como el principal indicador para rastrear el crecimiento del ecosistema de IA. Las empresas públicas reportan mensualmente los tokens procesados para mostrar su crecimiento en IA, los analistas comparan el éxito de los modelos según sus volúmenes relativos de tokens, y los equipos directivos miden su compromiso e inversión en IA observando su uso de tokens a lo largo del tiempo.
Esta popularidad generalizada tiene sentido; los tokens son una unidad fundamental de inteligencia y computación de IA, y el crecimiento en tokens es una buena representación del crecimiento general de la IA en el mundo. Los tokens también abstraen las complejidades de la inferencia en una sola unidad de medida, lo que hace que sea tanto simple de entender (¡solo toma 2 minutos!) como fácil de rastrear de manera consistente a lo largo del tiempo. Como una especie de lingua franca, los tokens permiten que una amplia audiencia comprenda el rápido y complejo progreso de la IA, independientemente de su fluidez técnica.
¿Más personas usan IA? Los tokens suben. ¿Pasamos de modelos no razonadores a modelos razonadores? Los tokens suben. ¿Pasamos de consultas a agentes? Los tokens suben. ¿Los agentes ahora pueden trabajar en segundo plano o en tareas de largo plazo? ¡Los tokens suben!

En general, los tokens absolutos procesados aumentan tanto en función del aumento/adopción de la IA, como también debido a evoluciones en la infraestructura que hacen que los modelos y factores de forma de la IA sean más "hambrientos de tokens", por ejemplo, un agente que trabaja durante una hora en lugar de 1 minuto.
Esta simplicidad también crea una sólida tesis de inversión de crecimiento para los inversores de capital de crecimiento. Todos estos cambios — tanto en la adopción como en la intensidad de tokens de los modelos — se acumulan unos sobre otros para crear un crecimiento explosivo y exponencial en los volúmenes totales de tokens. Es fácil de trazar, y fácil de creer que continúa en esta dirección con agentes de largo plazo y agentes en segundo plano en el horizonte. No es de extrañar que la inferencia se haya convertido en una categoría de inversión muy candente y que muchas empresas estén buscando ingresar al negocio de la inferencia.
La desventaja de tener un ícono de la IA tan legible y popular como la inferencia es que puede acaparar el campo de visión, haciendo que tendencias mega-tendencias emergentes similares pasen relativamente desapercibidas porque son más difíciles de ver y entender para una audiencia amplia.
Una tendencia en particular es similar a la inferencia en muchos aspectos y está destinada a convertirse en una parte mucho más grande de la discusión sobre IA a medida que se vuelve más ubicua y ampliamente comprendida. Este es el mercado para mejorar las capacidades de los modelos a través de datos, que llamamos la Economía de las Tareas.
La Economía de las Tareas
En los últimos tres años, los LLM pasaron de responder consultas básicas, a razonar problemas complejos, a convertirse en agentes que pueden completar trabajo del mundo real en horizontes de tiempo cada vez más largos. Al principio de este viaje, las mejoras de los modelos se lograban entrenando modelos con los datos disponibles en internet con cantidades crecientes de cómputo. A medida que 1) nos quedamos sin más datos en internet para entrenar y 2) saturamos capacidades simples/generales cada vez más, ha surgido un claro cuello de botella para futuras mejoras de los modelos: datos incrementales de alta calidad. Estos datos serán generados y servidos por la Economía de las Tareas.
Las tareas son la "unidad de práctica" en el aprendizaje por refuerzo: se le da a un modelo un estado inicial y un entorno en el que actuar, y su comportamiento es calificado por una señal de recompensa/verificador. A través de muchas tareas, esas puntuaciones se agregan en una señal de entrenamiento que desplaza el comportamiento del modelo hacia lo que obtuvo una buena puntuación. Estrictamente hablando, "tarea" se refiere a este sustrato de post-entrenamiento de RL. Pero lo usaré de manera más amplia para representar la unidad de mejora impulsada por datos en general, ya que la industria está inventando rápidamente nuevas formas que toman los datos al servicio de mejorar los modelos, y francamente porque "Economía de las Tareas" suena muy bien. También quiero distinguir esta categoría del apelativo anticuado de "etiquetado de datos", que trae a la mente bounding boxes y pulgar arriba/abajo para respuestas de LLM — el mercado ha evolucionado mucho más allá de estos primitivos en los últimos años hacia tareas mucho más complejas y de alto valor.
Tomemos la industria legal como un ejemplo real rápido. Los modelos de IA entrenados en internet abierto pueden obtener una comprensión de alto nivel del derecho, conocer precedentes de jurisprudencia pública, etc. Pero producir el trabajo real de un abogado talentoso requiere datos que no están disponibles en internet. Para que un modelo pueda replicar flujos de trabajo legales de alta calidad, debemos darle al modelo indicaciones (revisar un contrato, redactar un argumento), colocarlo en entornos relevantes (una sala de datos legal), y luego calificar/verificar la calidad del trabajo (mediante una rúbrica, un ejemplo de la cual puedes ver aquí). Estas tareas enseñan al modelo no solo qué hacer, sino cómo hacerlo. Y cuantas más tareas de alta calidad expongas al modelo, mejor se vuelve.
De esta manera, lo que los tokens son para la inferencia/uso del modelo, las tareas son para los esfuerzos de mejora del modelo. Los tokens son una unidad fundamental de inteligencia y cómputo de IA; deberíamos pensar en las tareas como una unidad fundamental de mejora de la IA. Y al igual que los tokens, las tareas crecen tanto en función de la adopción de IA, como a medida que la inteligencia de frontera en desarrollo se vuelve cada vez más "hambrienta de tareas".

Esto no es preciso ni exhaustivo, pero da algunos ejemplos de cada aumento escalonado en la inteligencia del modelo que requiere tareas mucho más numerosas y de mayor complejidad.
¿Pasamos de etiquetas de preferencia básicas a expertos calificados que usan rúbricas? Las tareas suben. ¿Introdujimos agentes verticales que replican trabajo de dominio a nivel experto? Las tareas suben. ¿Los agentes necesitan trabajar en horizontes más largos? Las tareas suben. ¿Las empresas están adoptando evaluaciones en masa? ¡Las tareas suben!
Al igual que el mercado de la inferencia, estas entradas de crecimiento apiladas han producido un crecimiento igualmente sin precedentes para la Economía de las Tareas:
- OpenAI y Anthropic están escalando su gasto en datos 10 veces año tras año, gastando miles de millones de dólares movilizando expertos en todos los dominios para crear datos y entrenar agentes.
- Las principales empresas de aplicaciones de IA y empresas de nuestra red están escalando su gasto individual relacionado con tareas a $100m+ en el corto plazo, ya que reconocen que los datos son su foso, y que la IA Aplicada con una estrategia de datos diferenciada puede vencer a los modelos estándar.
- Mercor, empresa del portafolio de Benchmark y plataforma líder de la Economía de las Tareas, alcanzó $1 mil millones en ARR este febrero y luego alcanzó $2 mil millones en ARR solo 4 meses después.

La cantidad de tareas brutas, la duración y complejidad de esas tareas, y el costo por hora de los expertos que completan las tareas, todo está creciendo, apilándose para crear un crecimiento exponencial del gasto total en tareas.
Y por impresionantes que hayan sido las señales de crecimiento reciente en este mercado, estamos claramente solo en el primer inning del crecimiento e impacto general de este mercado. Apenas estamos empezando a ver agentes que pueden replicar trabajo de alta calidad en cualquier dominio avanzado, y las empresas solo están comenzando a escalar el gasto este año a medida que se dan cuenta de la importancia de los datos como un diferenciador frente a los laboratorios. Comparemos eso con el hecho de que el 99% del conocimiento humano relevante para las capacidades futuras que queremos que la IA cubra está en la cabeza de las personas. *Si creemos que las empresas de IA aplicada de todo tipo (laboratorios, empresas de aplicaciones de IA, empresas) van a querer transmitir ese conocimiento tácito a modelos y agentes, nos esperan muchos más años de rápido crecimiento de la Economía de las Tareas en un conjunto mucho más amplio de compradores/participantes de los que hemos tenido en el pasado.
Haciendo la Mega-Tendencia de las Tareas más Legible
Los tokens y las tareas son barómetros importantes del progreso y la evolución de la IA, y ambos están acelerándose rápidamente. Sin embargo, a pesar de este crecimiento igualmente explosivo, hoy en día hay muchas menos conversaciones sobre tareas que sobre tokens en línea. Creo que esto se debe principalmente a:
1) históricamente, el gasto en este mercado se ha concentrado en los laboratorios de frontera, que son muy reservados sobre sus estrategias de mejora de modelos, lo que incluye su gasto en datos/tareas. Esto está cambiando rápidamente a partir de este año, a medida que las empresas de aplicaciones de IA y las empresas abrazan la Economía de las Tareas para construir diferenciación frente a los modelos estándar. Estas empresas tienen más probabilidades de comercializar sus esfuerzos en este dominio y llevar la categoría a la conversación habitual sobre IA.
2) el mercado no ha tenido una unidad de abstracción de valor tan limpia como la inferencia tiene con los tokens. Parte del propósito de este artículo es cambiar esto y unificar la conversación en torno a las tareas como una unidad de valor que podamos estandarizar. Los tokens son una lingua franca que permite a una amplia audiencia comprender el progreso de la IA independientemente de su fluidez técnica; las tareas deberían actuar de la misma manera para permitir que una amplia audiencia comprenda la inversión de la industria en el avance de las capacidades de IA.
Dados estos cuellos de botella, la industria no tiene hoy un "OpenRouter para el volumen de tareas" ni nada similar que nos pueda dar una visión proxy en vivo de la escala y el crecimiento de la Economía de las Tareas a lo largo del tiempo. Si bien sería tremendamente valioso que una empresa publicara algo así en el futuro, por ahora el equipo de Mercor fue tan amable de proporcionar un gráfico de las horas de trabajo de expertos por trimestre en su plataforma como una ventana al crecimiento exponencial del mercado. Como pueden ver, los datos reales coinciden con la magnitud/velocidad de crecimiento que discutimos en la sección anterior:

Fuente: Mercor
En muchos sentidos, la Economía de las Tareas es el mercado definitorio para el futuro de la IA: la barrera para automatizar cada tarea que podemos hacer en nuestras laptops con agentes es cubrir la distribución completa de todas las aplicaciones, todos los entornos y todas las tareas que corresponden a todo en la economía. Esto requerirá una construcción masiva de datos en todos los dominios profesionales, disciplinas académicas y casos de uso de consumo. Legal, medicina, finanzas, software, ciencia y más allá requerirán cada uno sus propios conjuntos de datos generados por expertos, evaluaciones y entornos de RL. Los laboratorios, las empresas de aplicaciones de IA y las empresas lucharán para escalar rápidamente esta infraestructura de datos en toda la superficie del trabajo económicamente útil y aquellos que tengan éxito continuarán mejorando las capacidades de frontera y ganando participación de mercado.
Comenzaremos a rastrear estos esfuerzos mucho más de cerca como comunidad a medida que la Economía de las Tareas se vuelva más visible y ubicua en los próximos años. Y en algún momento pronto, cuando hablemos de IA, las tareas serán los reyes.
Nota al pie: Otro lugar obvio donde veremos mejoras en la capacidad general de la IA es en las mejoras algorítmicas a los modelos. Las he excluido para mantener el enfoque de este artículo en los datos, pero es una elección de enfoque/estilística, no porque piense que no obtendremos mejoras algorítmicas en el futuro también.





