Presentamos INT21 y PTX Kernel Factory

@int21_ai
INGLÉS16 jun 2026
110K
8
0
0
5

TL;DR

INT21 ha lanzado PTX Kernel Factory, un sistema de IA que automatiza la creación y optimización de kernels de GPU NVIDIA, ofreciendo mejoras de rendimiento significativas en comparación con los estándares escritos por expertos humanos.

Estamos construyendo sistemas de IA que se mejoran a sí mismos para el software que sustenta la IA moderna. Nuestro primer producto genera y optimiza software de GPU de bajo nivel, y luego valida su trabajo con pruebas y benchmarks.

Hoy lanzamos INT21: la primera empresa en lograr enjambres de agentes de IA que se mejoran a sí mismos, aplicados a la infraestructura de IA.

La capa que la mayoría no ve

La mayoría de las conversaciones sobre el progreso de la IA se centran en los modelos. Pero cada modelo depende de una capa menos visible: el software que le indica a las GPU cómo ejecutar cada operación.

Ese software tiene un efecto desproporcionado en la velocidad y el costo. También es difícil de construir. Alcanzar el mejor rendimiento en una GPU nueva a menudo requiere especialistas que comprendan tanto el algoritmo como el hardware con una profundidad extraordinaria.

INT21 existe para hacer que ese trabajo sea más escalable. A esta nueva categoría la llamamos Infraestructura de Cómputo Auto-Mejorable.

Nuestro primer producto: PTX Kernel Factory

PTX Kernel Factory es un sistema de IA que genera y mejora software para GPU NVIDIA. Un equipo define la operación, los requisitos y la medida del éxito. La fábrica escribe una implementación, la prueba, la mide en el hardware objetivo, aprende del resultado y repite.

Las primeras cuatro implementaciones producidas por PTX Kernel Factory son de código abierto desde hoy. El producto también está entrando en beta, con acceso anticipado disponible en int21.ai.

Para cargas de trabajo de IA que se ejecutan en GPU NVIDIA, cada operación del modelo eventualmente se convierte en instrucciones ejecutadas por el hardware. Un kernel de GPU es el pequeño programa especializado responsable de una de esas operaciones, como normalización, atención o mover datos a través de la memoria. Miles de estos kernels se ejecutan debajo de cada trabajo de entrenamiento y aplicación de IA.

PTX es el lenguaje de GPU de bajo nivel tipo ensamblador de NVIDIA. Se sitúa entre el software de GPU de alto nivel y las instrucciones finales de la máquina ejecutadas por el hardware, lo que lo convierte en una de las capas programables más cercanas en el stack de NVIDIA.

Trabajar en este nivel otorga un control preciso sobre cómo los datos se mueven a través de la memoria, cómo cooperan los hilos, cuándo se sincroniza el trabajo y qué instrucciones especializadas de GPU se utilizan. Esas decisiones pueden determinar si una GPU costosa pasa su tiempo trabajando o esperando.

Muy pocos ingenieros pueden escribir y optimizar PTX correctamente. El trabajo requiere una combinación poco común de conocimiento de algoritmos, experiencia en arquitectura de GPU, rigor numérico e intuición de rendimiento. Las herramientas, bibliotecas y compiladores de alto nivel hacen que el desarrollo de GPU sea accesible para muchas más personas, pero cuando una nueva operación de IA no tiene una implementación madura, o cuando las abstracciones existentes no alcanzan el rendimiento requerido, esta escasa experiencia de bajo nivel se convierte en un cuello de botella.

También es excepcionalmente difícil. Un kernel puede parecer correcto pero fallar en una entrada rara. Puede ser rápido para una forma y lento para otra. Puede usar demasiados registros, mover demasiados datos, o funcionar bien en Hopper y empeorar en Blackwell. Incluso los ingenieros expertos deben probar muchas ideas, y la mayoría de esas ideas no funcionan. Cada generación de hardware cambia parte del problema.

Esa combinación convierte a PTX en un campo de pruebas ideal para INT21: es técnicamente exigente, económicamente importante y objetivamente medible. Un kernel generado es correcto o no lo es. Es más rápido o no lo es.

PTX Kernel Factory convierte el ciclo experto de escribir, probar, perfilar y revisar código de GPU de bajo nivel en un proceso que puede ejecutarse continuamente y aprender de sus resultados.

Cómo funciona PTX Kernel Factory

La interfaz es intencionalmente simple:

  1. Describe la operación. Define lo que el kernel debe hacer y las entradas que debe soportar.
  2. Establece los requisitos. Proporciona pruebas de corrección, hardware objetivo y cualquier restricción de integración.
  3. Define el éxito. Elige la métrica de rendimiento que el sistema debe optimizar.

A partir de ahí, la fábrica ejecuta un proceso de ingeniería de largo horizonte. Genera implementaciones candidatas, las compila, rechaza resultados incorrectos, evalúa los candidatos válidos y utiliza la evidencia para guiar la siguiente ronda.

Las implementaciones publicadas combinan CUDA C++ con PTX en línea, lo que le da al sistema control sobre detalles del hardware que las herramientas de alto nivel pueden ocultar intencionalmente. En lugar de depender de un solo agente para producir una respuesta única, PTX Kernel Factory coordina múltiples agentes de IA a lo largo de este ciclo.

Los ingenieros humanos aún definen el objetivo, las restricciones y los criterios de aceptación. PTX Kernel Factory automatiza la costosa búsqueda entre una especificación clara y una implementación sólida.

Qué entendemos por auto-mejora

Un agente de codificación puede producir una respuesta. Un sistema de ingeniería confiable también necesita determinar si la respuesta funciona, entender por qué un intento falló y transferir conocimiento útil al siguiente intento.

Eso es lo que entendemos por auto-mejora.

La mayoría de los esfuerzos en este espacio se centran en mejorar la IA misma. Nosotros tomamos un camino fundamentalmente diferente: los enjambres de agentes mejoran la infraestructura en la que se ejecutan, preservando el control humano mientras se acumula rendimiento con cada ciclo de producción.

El desafío consiste menos en producir un kernel plausible, y más en construir un sistema que pueda rechazar miles de intentos incorrectos, frágiles o engañosos, preservar las pocas lecciones que importan, y seguir mejorando sin desviarse de la corrección.

PTX Kernel Factory no trata cada generación como una instrucción nueva. Preserva descubrimientos útiles de experimentos exitosos y fallidos, permitiendo que el trabajo posterior se base en evidencia anterior. El objetivo es mejorar el proceso que produce el código.

Así es como el rendimiento de la fábrica se acumula con el tiempo. Cada generación comienza con más evidencia sobre qué funciona, qué falla y qué direcciones vale la pena explorar.

Nuestra tesis más amplia es:

Usar cómputo para mejorar el cómputo.

La inteligencia no es solo lo que un modelo sabe. Es la capacidad de buscar, probar, recordar, corregir y mejorar. Creemos que los sistemas que hacen que esas habilidades sean acumulativas se convertirán en una parte importante de la infraestructura de cómputo futura y de la evolución más amplia de la auto-mejora en IA.

Nuestra primera prueba: dos cargas de trabajo de IA muy diferentes

Para el primer lanzamiento público, elegimos dos cargas de trabajo que ponen a prueba diferentes habilidades.

RMSNorm es una operación común utilizada en los modelos de lenguaje modernos. Es madura, ampliamente conocida y ya tiene implementaciones humanas sólidas. Prueba si la fábrica puede competir en trabajo establecido.

Kimi Delta Attention (KDA) es un mecanismo de atención más nuevo. Es más especializado y tiene menos patrones de implementación establecidos. Prueba si la fábrica puede adaptarse rápidamente a una carga de trabajo de investigación más reciente.

Comparamos las implementaciones generadas con líneas base humanas bien optimizadas: QuACK para RMSNorm y la implementación FlashKDA basada en CUTLASS para KDA. Las comparaciones se ejecutaron en el mismo hardware con verificaciones de corrección antes de las mediciones de tiempo.

Aspectos destacados de los benchmarks

Carga de trabajo

Hardware

Resultado frente a la línea base experta

KDA

NVIDIA GH200, Hopper

1,24x a 1,59x más rápido en seis escenarios de longitud fija y variable

KDA

NVIDIA B200, Blackwell

1,42x más rápido a través de la interfaz pública estándar, y 1,52x más rápido en una integración optimizada

RMSNorm

NVIDIA GH200, Hopper

8,17% más rápido en media geométrica en 11 casos forward usando un formato común de IA de 16 bits; 15% a 34% más rápido en comparaciones backward seleccionadas

RMSNorm

NVIDIA B200, Blackwell

Más rápido en los 126 casos comparables en toda la matriz de benchmark predeterminada

Estos son resultados de benchmarks a nivel de operador, no afirmaciones sobre aceleraciones de modelos completos. El efecto en una aplicación depende de su modelo, carga de trabajo, formas, stack de software y cuánto tiempo total dedica a la operación optimizada.

También informamos los resultados menos favorables. En la matriz de RMSNorm en Hopper, dos otros formatos numéricos incluyeron pequeñas regresiones; los casos más lentos estaban 0,42% y 0,84% por detrás de QuACK. Preferimos publicar el límite del resultado que ocultarlo detrás de un número favorable.

La corrección va antes que la velocidad

Un kernel rápido es inútil si cambia el resultado o falla en entradas reales.

Por lo tanto, cada comparación de rendimiento comienza con la verificación de corrección:

  • La implementación de KDA en B200 pasó las 580 pruebas upstream.
  • La implementación de KDA en Hopper pasó 584 pruebas upstream y 235 pruebas del paquete en el sistema GH200 validado.
  • Las implementaciones de RMSNorm pasaron sus suites completas de paquetes en el hardware validado: 48 pruebas más 65 subpruebas en GH200 y 66 pruebas en B200.

Las suites cubren diferentes tipos de datos, tamaños de entrada, secuencias de longitud fija y variable, estado opcional, rutas forward y backward cuando son compatibles, y casos límite difíciles.

Los benchmarks aún pueden depender del entorno, por lo que cada repositorio incluye el código fuente, los comandos de prueba, el método de medición, las versiones de software y los informes sin procesar o generados necesarios para inspeccionar y reproducir los resultados.

Por qué empezar aquí

Los kernels de GPU son una primera prueba útil para nuestro enfoque porque la retroalimentación es implacable.

El resultado es correcto o no lo es. La implementación es más rápida o no lo es. Un cambio puede compilarse, probarse y medirse. El progreso se basa en evidencia, no en lo convincente que suene el texto generado.

La optimización de kernels también se encuentra en un cuello de botella importante. Los modelos de IA evolucionan rápidamente, el hardware cambia cada generación, y la oferta de experiencia en optimización de bajo nivel no puede crecer al mismo ritmo.

Convertir más de este trabajo en un sistema repetible podría ayudar a los equipos a:

  • Llevar nuevas operaciones de modelo a producción más rápido.
  • Aprovechar mejor las nuevas generaciones de GPU.
  • Explorar ideas de optimización que serían demasiado costosas de probar manualmente.
  • Reservar el tiempo de los expertos para la arquitectura, los requisitos y las decisiones a nivel de sistema.

No se trata de eliminar ingenieros. Se trata de darle a un pequeño número de expertos más apalancamiento.

Publicación de código abierto de los primeros cuatro artefactos de la fábrica

Hoy lanzamos:

Publicamos el código porque las afirmaciones de rendimiento deben ser inspeccionables. Los desarrolladores deben poder leer la implementación, ejecutar las pruebas, reproducir los benchmarks y desafiar los resultados.

Estos lanzamientos no son el producto final. Son la primera evidencia pública de que la fábrica puede producir software de bajo nivel útil tanto en cargas de trabajo establecidas como emergentes, y en dos generaciones de hardware NVIDIA.

Acerca de nosotros

INT21 fue fundada por Bing Xu en abril de 2026 como una empresa nativa de IA, construida sobre una idea simple: la capacidad de ingeniería de la propia empresa debe escalar con el cómputo.

Bing fue coautor del artículo original de Generative Adversarial Nets, el creador original del paquete de Python de XGBoost y cocreador de MXNet y AITemplate.

En febrero de 2025, coautor del trabajo temprano de NVIDIA sobre generación de kernels de GPU con agentes, utilizando un modelo de razonamiento y escalado en tiempo de inferencia para generar y optimizar kernels de atención. Antes de INT21, Bing fue Ingeniero Distinguido en NVIDIA. Se unió a NVIDIA después de que esta adquiriera HippoML, la startup de inferencia en GPU que cofundó y dirigió como CEO.

Una nueva era del cómputo

PTX Kernel Factory ya está en beta para equipos que construyen modelos de IA, sistemas de inferencia, plataformas de entrenamiento y otros productos intensivos en GPU.

El punto de partida puede ser una operación que es demasiado lenta, una nueva arquitectura sin un kernel maduro, o una carga de trabajo importante que no ha justificado semanas de tiempo de especialistas. El equipo proporciona el problema y la definición de éxito. La fábrica se encarga de la búsqueda.

PTX Kernel Factory es también el primer paso en una dirección más amplia para INT21, y para la industria en general.

La mayor parte de la infraestructura de cómputo actual es estática: la gente la escribe, la optimiza y la revisa cuando cambian los requisitos o el hardware. Los sistemas de IA pueden generar resultados impresionantes, pero desplegarlos de manera confiable en producción, a escala, sigue siendo un problema no resuelto en gran medida.

Creemos que más de esa infraestructura se volverá adaptativa. Probará su propio trabajo, preservará lo que aprende y mejorará la forma en que resuelve el siguiente problema.

Comenzamos con una de las capas más difíciles y medibles del stack. El conocimiento humano no escala, pero los enjambres de agentes pueden seguir mejorando con cada ejecución. La infraestructura de cómputo auto-mejorable es un cambio fundamental en la forma en que se construye la IA.

Describe el kernel. Define el éxito. Deja que la fábrica mejore la implementación.

Más información y solicita acceso anticipado.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales