Estamos construyendo sistemas de IA que se mejoran a sí mismos para el software que sustenta la IA moderna. Nuestro primer producto genera y optimiza software para GPU de bajo nivel, y luego verifica su trabajo con pruebas y benchmarks.
Hoy lanzamos INT21: la primera empresa en lograr enjambres de agentes de IA que se auto-mejoran, aplicados a la infraestructura de IA.
La capa que la mayoría no ve
La mayoría de las conversaciones sobre el progreso de la IA se centran en los modelos. Pero cada modelo depende de una capa menos visible: el software que les dice a las GPU cómo ejecutar cada operación.
Ese software tiene un efecto descomunal en la velocidad y el costo. También es difícil de construir. Alcanzar el máximo rendimiento en una nueva GPU a menudo requiere especialistas que entiendan tanto el algoritmo como el hardware con una profundidad extraordinaria.
INT21 existe para hacer que ese trabajo sea más escalable. A esta nueva categoría la llamamos Infraestructura de Cómputo que se Auto-Mejora.
Nuestro primer producto: PTX Kernel Factory
PTX Kernel Factory es un sistema de IA que genera y mejora software para GPU NVIDIA. Un equipo define la operación, los requisitos y la medida del éxito. La fábrica escribe una implementación, la prueba, la mide en el hardware objetivo, aprende del resultado y repite.
Las primeras cuatro implementaciones producidas por PTX Kernel Factory son de código abierto hoy. El producto también está entrando en beta, con acceso anticipado disponible en int21.ai.
Para las cargas de trabajo de IA que se ejecutan en GPU NVIDIA, cada operación del modelo eventualmente se convierte en instrucciones ejecutadas por el hardware. Un kernel de GPU es el programa pequeño y especializado responsable de una de esas operaciones, como normalización, atención o movimiento de datos a través de la memoria. Miles de estos kernels se ejecutan debajo de cada trabajo de entrenamiento y aplicación de IA.
PTX es el lenguaje de GPU de bajo nivel, similar a ensamblador, de NVIDIA. Se encuentra entre el software de GPU de alto nivel y las instrucciones finales de máquina ejecutadas por el hardware, lo que lo convierte en una de las capas programables más cercanas en el stack de NVIDIA.
Trabajar en este nivel proporciona un control preciso sobre cómo se mueven los datos a través de la memoria, cómo cooperan los hilos, cuándo se sincroniza el trabajo y qué instrucciones especializadas de GPU se utilizan. Esas decisiones pueden determinar si una GPU costosa pasa su tiempo trabajando o esperando.
Muy pocos ingenieros pueden escribir y optimizar PTX correctamente. El trabajo requiere una combinación poco común de conocimiento de algoritmos, experiencia en arquitectura de GPU, rigor numérico e intuición de rendimiento. Las herramientas, bibliotecas y compiladores de más alto nivel hacen que el desarrollo de GPU sea accesible para muchas más personas, pero cuando una nueva operación de IA no tiene una implementación madura, o cuando las abstracciones existentes no pueden alcanzar el rendimiento requerido, esta escasa experiencia de bajo nivel se convierte en un cuello de botella.
También es excepcionalmente difícil. Un kernel puede parecer correcto mientras falla en una entrada rara. Puede ser rápido para una forma y lento para otra. Puede usar demasiados registros, mover demasiados datos, o rendir bien en Hopper y retroceder en Blackwell. Incluso los ingenieros expertos deben probar muchas ideas, y la mayoría de esas ideas no funcionan. Cada generación de hardware cambia parte del problema.
Esa combinación hace de PTX un campo de pruebas ideal para INT21: es técnicamente exigente, económicamente importante y objetivamente medible. Un kernel generado es correcto o no lo es. Es más rápido o no lo es.
PTX Kernel Factory convierte el ciclo experto de escribir, probar, perfilar y revisar código de GPU de bajo nivel en un proceso que puede ejecutarse continuamente y aprender de sus resultados.
Cómo funciona PTX Kernel Factory
La interfaz es intencionalmente simple:
- Describe la operación. Define lo que el kernel necesita hacer y las entradas que debe soportar.
- Establece los requisitos. Proporciona pruebas de corrección, hardware objetivo y cualquier restricción de integración.
- Define el éxito. Elige la métrica de rendimiento que el sistema debe optimizar.
A partir de ahí, la fábrica ejecuta un proceso de ingeniería de largo horizonte. Genera implementaciones candidatas, las compila, rechaza resultados incorrectos, compara las candidatas válidas y usa la evidencia para guiar la siguiente ronda.
Las implementaciones publicadas combinan CUDA C++ con PTX en línea, dándole al sistema control sobre detalles del hardware que las herramientas de alto nivel pueden ocultar intencionalmente. En lugar de depender de un solo agente para producir una respuesta única, PTX Kernel Factory coordina múltiples agentes de IA a lo largo de este ciclo.
Los ingenieros humanos aún definen el objetivo, las restricciones y los criterios de aceptación. PTX Kernel Factory automatiza la búsqueda costosa entre una especificación clara y una implementación sólida.
Qué entendemos por auto-mejora
Un agente de codificación puede producir una respuesta. Un sistema de ingeniería confiable también necesita determinar si la respuesta funciona, entender por qué falló un intento y llevar conocimiento útil al siguiente intento.
Eso es lo que entendemos por auto-mejora.
La mayoría de los esfuerzos en este espacio se centran en la auto-mejora de la propia IA. Nosotros estamos tomando un camino fundamentalmente diferente, donde los enjambres de agentes auto-mejoran la infraestructura en la que se ejecutan, preservando el control humano mientras siguen acumulando rendimiento con cada ciclo de producción.
El desafío es menos producir un kernel plausible, y más construir un sistema que pueda rechazar miles de intentos incorrectos, frágiles o engañosos, preservar las pocas lecciones que importan y seguir mejorando sin desviarse de la corrección.
PTX Kernel Factory no trata cada generación como un nuevo prompt. Preserva descubrimientos útiles de experimentos exitosos y fallidos, permitiendo que el trabajo posterior se base en evidencia anterior. El objetivo es mejorar el proceso que produce el código.
Así es como el rendimiento de la fábrica se acumula con el tiempo. Cada generación comienza con más evidencia sobre qué funciona, qué falla y qué direcciones vale la pena explorar.
Nuestra tesis más amplia es:
Usar cómputo para mejorar el cómputo.
La inteligencia no es solo lo que un modelo sabe. Es la capacidad de buscar, probar, recordar, corregir y mejorar. Creemos que los sistemas que hacen que esas habilidades sean acumulativas se convertirán en una parte importante de la futura infraestructura de cómputo y de la evolución más amplia de auto-mejora en IA.
Nuestra primera prueba: dos cargas de trabajo de IA muy diferentes
Para el primer lanzamiento público, elegimos dos cargas de trabajo que ponen a prueba diferentes habilidades.
RMSNorm es una operación común utilizada en los modelos de lenguaje modernos. Es madura, ampliamente comprendida y ya cuenta con implementaciones humanas sólidas. Prueba si la fábrica puede competir en trabajo establecido.
Kimi Delta Attention (KDA) es un mecanismo de atención más nuevo. Es más especializado y tiene menos patrones de implementación establecidos. Prueba si la fábrica puede adaptarse rápidamente a una carga de trabajo de investigación más reciente.
Comparamos las implementaciones generadas con líneas base humanas bien optimizadas: QuACK para RMSNorm y la implementación FlashKDA basada en CUTLASS para KDA. Las comparaciones se ejecutaron en el mismo hardware con verificaciones de corrección antes de medir tiempos.
Aspectos destacados de los benchmarks
Carga de trabajo
Hardware
Resultado frente a la línea base experta
KDA
NVIDIA GH200, Hopper
1.24x a 1.59x más rápido en seis escenarios de longitud fija y variable
KDA
NVIDIA B200, Blackwell
1.42x más rápido a través de la interfaz pública estándar, y 1.52x más rápido en una integración optimizada
RMSNorm
NVIDIA GH200, Hopper
8.17% más rápido en media geométrica en 11 casos forward usando un formato de IA común de 16 bits; 15% a 34% más rápido en comparaciones backward seleccionadas
RMSNorm
NVIDIA B200, Blackwell
Más rápido en los 126 casos comparables en toda la matriz de benchmarks predeterminada
Estos son resultados de benchmarks a nivel de operador, no afirmaciones sobre aceleraciones de modelos completos. El efecto en una aplicación depende de su modelo, carga de trabajo, formas, stack de software y cuánto tiempo total dedica a la operación optimizada.
También reportamos los resultados menos favorables. En la matriz de RMSNorm en Hopper, dos otros formatos numéricos incluyeron pequeñas regresiones; los casos más lentos estuvieron un 0.42% y un 0.84% por detrás de QuACK. Preferimos publicar el límite del resultado que ocultarlo detrás de un único número favorable.
La corrección va antes que la velocidad
Un kernel rápido es inútil si cambia el resultado o falla en entradas reales.
Por lo tanto, cada comparación de rendimiento comienza con la corrección:
- La implementación de KDA en B200 pasó las 580 pruebas del repositorio upstream.
- La implementación de KDA en Hopper pasó 584 pruebas upstream y 235 pruebas de paquete en el sistema GH200 validado.
- Las implementaciones de RMSNorm pasaron sus suites completas de paquetes en el hardware validado: 48 pruebas más 65 subpruebas en GH200 y 66 pruebas en B200.
Las suites cubren diferentes tipos de datos, tamaños de entrada, secuencias de longitud fija y variable, estado opcional, caminos forward y backward cuando se admiten, y casos límite difíciles.
Los benchmarks aún pueden depender del entorno, por lo que cada repositorio incluye el código fuente, los comandos de prueba, el método de medición, las versiones de software y los informes sin procesar o generados necesarios para inspeccionar y reproducir los resultados.
Por qué empezar aquí
Los kernels de GPU son una primera prueba útil para nuestro enfoque porque la retroalimentación es implacable.
La salida es correcta o no lo es. La implementación es más rápida o no lo es. Un cambio puede compilarse, probarse y medirse. El progreso se basa en evidencia, no en lo convincente que suene el texto generado.
La optimización de kernels también se sitúa en un cuello de botella importante. Los modelos de IA evolucionan rápidamente, el hardware cambia cada generación y la oferta de experiencia en optimización de bajo nivel no puede crecer al mismo ritmo.
Convertir más de este trabajo en un sistema repetible podría ayudar a los equipos a:
- Llevar nuevas operaciones de modelo a producción más rápido.
- Aprovechar mejor las nuevas generaciones de GPU.
- Explorar ideas de optimización que serían demasiado costosas de probar manualmente.
- Reservar el tiempo de los expertos para decisiones de arquitectura, requisitos y nivel de sistema.
No se trata de eliminar ingenieros. Se trata de darle a un pequeño número de expertos más apalancamiento.
Publicación de código abierto de los primeros cuatro artefactos de la fábrica
Hoy lanzamos:
- Int21-AI/KDA-B200: Kimi Delta Attention para Blackwell, validado en NVIDIA B200.
- Int21-AI/KDA-H100: Kimi Delta Attention para Hopper, validado en NVIDIA GH200.
- Int21-AI/RMSNorm-B200: RMSNorm para Blackwell, validado en NVIDIA B200.
- Int21-AI/RMSNorm-H100: RMSNorm para Hopper, validado en NVIDIA GH200.
Publicamos el código porque las afirmaciones de rendimiento deben ser inspeccionables. Los desarrolladores deberían poder leer la implementación, ejecutar las pruebas, reproducir los benchmarks y desafiar los resultados.
Estos lanzamientos no son el producto final. Son la primera evidencia pública de que la fábrica puede producir software de bajo nivel útil en cargas de trabajo establecidas y emergentes, y en dos generaciones de hardware NVIDIA.
Sobre nosotros
INT21 fue fundada por Bing Xu en abril de 2026 como una empresa nativa de IA, construida sobre una idea simple: la capacidad de ingeniería de la empresa debería escalar con el cómputo.
Bing fue coautor del artículo original de Redes Generativas Antagónicas, creador original del paquete de Python de XGBoost y cocreador de MXNet y AITemplate.
En febrero de 2025, coautor del trabajo inicial de NVIDIA sobre generación de kernels de GPU basada en agentes, utilizando un modelo de razonamiento y escalado de tiempo de inferencia para generar y optimizar kernels de atención. Antes de INT21, Bing fue Ingeniero Distinguido en NVIDIA. Se unió a NVIDIA después de que adquiriera HippoML, la startup de inferencia en GPU que cofundó y dirigió como CEO.
Una nueva era del cómputo
PTX Kernel Factory ahora está en beta para equipos que construyen modelos de IA, sistemas de inferencia, plataformas de entrenamiento y otros productos intensivos en GPU.
El punto de partida puede ser una operación que es demasiado lenta, una nueva arquitectura sin un kernel maduro, o una carga de trabajo importante que no ha justificado semanas de tiempo de especialistas. El equipo proporciona el problema y la definición de éxito. La fábrica se encarga de la búsqueda.
PTX Kernel Factory es también el primer paso en una dirección más amplia para INT21, y para la industria en general.
La mayor parte de la infraestructura de cómputo actual es estática: la gente la escribe, la optimiza y la revisita cuando los requisitos o el hardware cambian. Los sistemas de IA pueden generar resultados impresionantes, pero desplegarlos de manera confiable en producción, a escala, sigue siendo un problema no resuelto en gran medida.
Creemos que más de esa infraestructura se volverá adaptativa. Probará su propio trabajo, preservará lo que aprende y mejorará la forma en que resuelve el siguiente problema.
Estamos empezando con una de las capas más difíciles y medibles del stack. El conocimiento humano no escala, pero los enjambres de agentes pueden seguir mejorando con cada ejecución. La infraestructura de cómputo que se auto-mejora es un cambio fundamental en cómo se construye la IA.
Describe el kernel. Define el éxito. Deja que la fábrica mejore la implementación.





