우리는 현대 AI의 기반이 되는 소프트웨어를 위해 스스로 개선하는 AI 시스템을 구축하고 있습니다. 첫 번째 제품은 저수준 GPU 소프트웨어를 생성 및 최적화하고, 테스트와 벤치마크로 결과를 검증합니다.
오늘, 우리는 INT21을 공개합니다: AI 인프라에 적용된, 스스로 개선하는 AI 에이전트 집단을 달성한 첫 번째 기업입니다.
대부분이 보지 못하는 계층
AI 발전에 대한 대부분의 논의는 모델에 집중됩니다. 하지만 모든 모델은 덜 눈에 띄는 계층, 즉 GPU에 각 연산을 수행하는 방법을 지시하는 소프트웨어에 의존합니다.
이 소프트웨어는 속도와 비용에 지대한 영향을 미칩니다. 또한 구축하기 어렵습니다. 새로운 GPU에서 최상의 성능을 달성하려면 알고리즘과 하드웨어를 모두 매우 깊이 이해하는 전문가가 필요한 경우가 많습니다.
INT21은 이 작업을 더 확장 가능하게 만들기 위해 존재합니다. 우리는 이 새로운 범주를 자기 개선 컴퓨팅 인프라(Self-Improving Compute Infrastructure) 라고 부릅니다.
첫 번째 제품: PTX Kernel Factory
PTX Kernel Factory는 NVIDIA GPU용 소프트웨어를 생성하고 개선하는 AI 시스템입니다. 팀은 연산, 요구 사항 및 성공 기준을 정의합니다. 팩토리는 구현체를 작성하고, 테스트하고, 대상 하드웨어에서 측정하고, 결과를 학습하여 이 과정을 반복합니다.
PTX Kernel Factory가 처음으로 생성한 4개의 구현체는 오늘 오픈소스로 공개됩니다. 또한 이 제품은 베타 버전에 진입했으며, int21.ai에서 얼리 액세스를 신청할 수 있습니다.
NVIDIA GPU에서 실행되는 AI 워크로드의 경우, 각 모델 연산은 결국 하드웨어가 실행하는 명령어가 됩니다. GPU 커널은 정규화, 어텐션, 또는 메모리를 통한 데이터 이동과 같은 하나의 연산을 담당하는 작고 전문화된 프로그램입니다. 모든 학습 작업과 AI 애플리케이션 아래에는 수천 개의 이러한 커널이 실행됩니다.
PTX는 NVIDIA의 저수준, 어셈블리와 유사한 GPU 언어입니다. 이는 상위 수준 GPU 소프트웨어와 하드웨어가 실행하는 최종 기계 명령어 사이에 위치하여, NVIDIA 스택에서 가장 가까운 프로그래밍 가능 계층 중 하나입니다.
이 수준에서 작업하면 데이터가 메모리를 통해 이동하는 방식, 스레드가 협력하는 방식, 작업이 동기화되는 시점, 그리고 사용되는 전문화된 GPU 명령어를 정밀하게 제어할 수 있습니다. 이러한 선택은 값비싼 GPU가 작업에 시간을 사용하는지, 아니면 대기하는 시간을 보내는지를 결정할 수 있습니다.
PTX를 잘 작성하고 최적화할 수 있는 엔지니어는 매우 드뭅니다. 이 작업은 알고리즘 지식, GPU 아키텍처 전문성, 수치적 엄밀함, 그리고 성능 직관의 드문 조합을 필요로 합니다. 상위 수준 도구, 라이브러리 및 컴파일러는 더 많은 사람들이 GPU 개발에 접근할 수 있게 해주지만, 새로운 AI 연산에 성숙한 구현체가 없거나 기존 추상화가 필요한 성능에 도달하지 못할 때, 이 부족한 저수준 전문성은 병목 현상이 됩니다.
또한 매우 어렵습니다. 커널은 올바르게 보이지만 드문 입력에서 실패할 수 있습니다. 한 형태에서는 빠르지만 다른 형태에서는 느릴 수 있습니다. 너무 많은 레지스터를 사용하거나, 너무 많은 데이터를 이동시키거나, Hopper에서는 잘 작동하지만 Blackwell에서는 성능이 저하될 수 있습니다. 전문 엔지니어조차도 많은 아이디어를 테스트해야 하며, 대부분의 아이디어는 작동하지 않습니다. 각 하드웨어 세대는 문제의 일부를 변경합니다.
이러한 조합은 PTX를 INT21의 이상적인 첫 번째 시험장으로 만듭니다: 기술적으로 까다롭고, 경제적으로 중요하며, 객관적으로 측정 가능합니다. 생성된 커널은 올바르거나 그렇지 않습니다. 더 빠르거나 그렇지 않습니다.
PTX Kernel Factory는 저수준 GPU 코드를 작성, 테스트, 프로파일링 및 수정하는 전문가 루프를 지속적으로 실행되고 결과를 학습할 수 있는 프로세스로 전환합니다.
PTX Kernel Factory 작동 방식
인터페이스는 의도적으로 간단합니다:
- 연산을 설명합니다. 커널이 수행해야 할 작업과 지원해야 할 입력을 정의합니다.
- 요구 사항을 설정합니다. 정확성 테스트, 대상 하드웨어 및 통합 제약 조건을 제공합니다.
- 성공을 정의합니다. 시스템이 최적화해야 할 성능 지표를 선택합니다.
그런 다음, 팩토리는 장기적인 엔지니어링 프로세스를 실행합니다. 후보 구현체를 생성하고, 컴파일하고, 잘못된 결과를 거부하며, 유효한 후보를 벤치마킹하고, 증거를 사용하여 다음 라운드를 안내합니다.
공개된 구현체는 CUDA C++와 인라인 PTX를 결합하여, 상위 수준 도구가 의도적으로 숨길 수 있는 하드웨어 세부 사항을 시스템이 제어할 수 있게 합니다. 단일 에이전트가 원샷 답변을 생성하는 데 의존하는 대신, PTX Kernel Factory는 이 루프 전체에서 여러 AI 에이전트를 조정합니다.
인간 엔지니어는 여전히 목표, 제약 조건 및 승인 기준을 정의합니다. PTX Kernel Factory는 명확한 사양과 강력한 구현체 사이의 값비싼 탐색을 자동화합니다.
자기 개선의 의미
코딩 에이전트는 답변을 생성할 수 있습니다. 신뢰할 수 있는 엔지니어링 시스템은 또한 답변이 작동하는지 여부를 판단하고, 시도가 실패한 이유를 이해하며, 유용한 지식을 다음 시도에 전달할 수 있어야 합니다.
이것이 우리가 자기 개선이라고 의미하는 바입니다.
이 분야의 대부분의 노력은 AI 자체를 개선하는 데 초점을 맞춥니다. 우리는 근본적으로 다른 경로를 택하고 있습니다. 에이전트 집단이 실행되는 인프라를 스스로 개선하여, 인간의 통제를 유지하면서도 모든 생산 주기마다 성능을 누적시키는 것입니다.
과제는 하나의 그럴듯한 커널을 생성하는 것보다는, 수천 개의 잘못되고, 취약하며, 오해의 소지가 있는 시도를 거부하고, 중요한 몇 가지 교훈을 보존하며, 정확성에서 벗어나지 않으면서 계속 개선할 수 있는 시스템을 구축하는 데 더 가깝습니다.
PTX Kernel Factory는 모든 생성을 새로운 프롬프트로 취급하지 않습니다. 성공 및 실패한 실험에서 유용한 발견을 보존하여, 이후 작업이 이전 증거를 기반으로 구축될 수 있도록 합니다. 목표는 코드를 생성하는 프로세스를 개선하는 것입니다.
이것이 바로 팩토리의 성능이 시간이 지남에 따라 누적되는 방식입니다. 각 세대는 무엇이 효과가 있고, 무엇이 실패하며, 어떤 방향이 탐색할 가치가 있는지에 대한 더 많은 증거로 시작합니다.
우리의 더 넓은 테제는 다음과 같습니다:
컴퓨팅을 사용하여 컴퓨팅을 개선하라.
지능은 단지 모델이 알고 있는 것이 아닙니다. 그것은 탐색하고, 테스트하고, 기억하고, 수정하고, 개선하는 능력입니다. 우리는 이러한 능력을 누적적으로 만드는 시스템이 미래 컴퓨팅 인프라와 AI의 더 넓은 자기 개선 진화의 중요한 부분이 될 것이라고 믿습니다.
첫 번째 증명: 매우 다른 두 가지 AI 워크로드
첫 번째 공개 릴리스를 위해, 우리는 서로 다른 능력을 테스트하는 두 가지 워크로드를 선택했습니다.
RMSNorm은 최신 언어 모델 전반에 걸쳐 사용되는 일반적인 연산입니다. 성숙하고, 널리 이해되고 있으며, 이미 강력한 인간 작성 구현체가 존재합니다. 이는 팩토리가 기존 작업에서 경쟁할 수 있는지 테스트합니다.
Kimi Delta Attention (KDA) 은 더 새로운 어텐션 메커니즘입니다. 더 전문화되어 있고 확립된 구현 패턴이 적습니다. 이는 팩토리가 더 새로운 연구 워크로드에 빠르게 적응할 수 있는지 테스트합니다.
우리는 생성된 구현체를 잘 최적화된 인간 구축 기준선과 비교했습니다: RMSNorm의 경우 QuACK, KDA의 경우 CUTLASS 기반 FlashKDA 구현체입니다. 비교는 동일한 하드웨어에서 실행되었으며, 시간 측정 전에 정확성 검사가 수행되었습니다.
벤치마크 하이라이트
워크로드
하드웨어
전문가 기준선 대비 결과
KDA
NVIDIA GH200, Hopper
6가지 고정 및 가변 길이 시나리오에서 1.24배 ~ 1.59배 더 빠름
KDA
NVIDIA B200, Blackwell
표준 공용 인터페이스를 통해 1.42배 더 빠름, 최적화된 통합에서 1.52배 더 빠름
RMSNorm
NVIDIA GH200, Hopper
공통 16비트 AI 형식을 사용한 11개의 포워드 케이스에서 기하 평균 기준 8.17% 더 빠름; 선택된 백워드 비교에서 15% ~ 34% 더 빠름
RMSNorm
NVIDIA B200, Blackwell
전체 기본 벤치마크 매트릭스의 126개 비교 가능한 케이스 모두에서 더 빠름
이는 연산자 수준의 벤치마크 결과이며, 전체 모델 속도 향상에 대한 주장이 아닙니다. 애플리케이션에 미치는 영향은 모델, 워크로드, 형태, 소프트웨어 스택 및 최적화된 연산에 소요되는 총 시간에 따라 다릅니다.
또한 덜 긍정적인 결과도 보고합니다. Hopper RMSNorm 매트릭스에서 두 가지 다른 숫자 형식에 약간의 성능 저하가 포함되었습니다. 가장 느린 경우는 QuACK보다 0.42% 및 0.84% 뒤쳐졌습니다. 우리는 하나의 유리한 숫자 뒤에 결과의 경계를 숨기기보다는 공개하는 것을 선호합니다.
정확성은 속도보다 우선합니다
빠른 커널은 결과를 변경하거나 실제 입력에서 실패하면 쓸모가 없습니다.
따라서 모든 성능 비교는 정확성 검증으로 시작됩니다:
- B200 KDA 구현체는 580개의 업스트림 테스트를 모두 통과했습니다.
- Hopper KDA 구현체는 검증된 GH200 시스템에서 584개의 업스트림 테스트와 235개의 패키지 테스트를 통과했습니다.
- RMSNorm 구현체는 검증된 하드웨어에서 전체 패키지 스위트를 통과했습니다: GH200에서 48개 테스트 + 65개의 하위 테스트, B200에서 66개 테스트.
이 스위트는 다양한 데이터 유형, 입력 크기, 고정 및 가변 길이 시퀀스, 선택적 상태, 지원되는 포워드 및 백워드 경로 및 까다로운 엣지 케이스를 다룹니다.
벤치마크는 여전히 환경에 따라 다를 수 있으므로, 각 리포지토리에는 결과를 검사하고 재현하는 데 필요한 소스, 테스트 명령, 측정 방법, 소프트웨어 버전 및 원시 또는 생성된 보고서가 포함됩니다.
왜 여기서 시작하는가
GPU 커널은 우리 접근 방식에 대한 유용한 첫 번째 테스트입니다. 피드백이 냉혹하기 때문입니다.
출력은 올바르거나 그렇지 않습니다. 구현체는 더 빠르거나 그렇지 않습니다. 변경 사항은 컴파일, 테스트 및 측정될 수 있습니다. 진전은 생성된 텍스트가 얼마나 설득력 있는지에 따라 판단되는 것이 아니라 증거에 기반합니다.
커널 최적화는 또한 중요한 병목 지점에 있습니다. AI 모델은 빠르게 진화하고, 하드웨어는 매 세대마다 변화하며, 저수준 최적화 전문성의 공급은 같은 속도로 증가할 수 없습니다.
이 작업의 더 많은 부분을 반복 가능한 시스템으로 전환하는 것은 팀이 다음과 같은 일을 하는 데 도움이 될 수 있습니다:
- 새로운 모델 연산을 더 빠르게 프로덕션에 도입.
- 새로운 GPU 세대를 더 잘 활용.
- 수동으로 테스트하기에는 너무 비용이 많이 드는 최적화 아이디어 탐색.
- 아키텍처, 요구 사항 및 시스템 수준 결정을 위해 전문가 시간 확보.
이는 엔지니어를 제거하는 것이 아닙니다. 소수의 전문가에게 더 많은 레버리지를 제공하는 것입니다.
최초의 4가지 팩토리 산출물 오픈소스화
오늘, 우리는 다음을 공개합니다:
- Int21-AI/KDA-B200: Blackwell용 Kimi Delta Attention, NVIDIA B200에서 검증됨.
- Int21-AI/KDA-H100: Hopper용 Kimi Delta Attention, NVIDIA GH200에서 검증됨.
- Int21-AI/RMSNorm-B200: Blackwell용 RMSNorm, NVIDIA B200에서 검증됨.
- Int21-AI/RMSNorm-H100: Hopper용 RMSNorm, NVIDIA GH200에서 검증됨.
성능 주장은 검증 가능해야 하므로 코드를 공개합니다. 개발자는 구현체를 읽고, 테스트를 실행하고, 벤치마크를 재현하고, 결과에 이의를 제기할 수 있어야 합니다.
이번 릴리스는 최종 제품이 아닙니다. 이는 팩토리가 기존 및 신규 워크로드와 두 세대의 NVIDIA 하드웨어에 걸쳐 유용한 저수준 소프트웨어를 생산할 수 있다는 첫 번째 공개 증거입니다.
회사 소개
INT21은 2026년 4월 Bing Xu에 의해 AI 네이티브 회사로 설립되었으며, 간단한 아이디어에 기반합니다: 회사의 자체 엔지니어링 역량은 컴퓨팅과 함께 확장되어야 한다는 것입니다.
Bing은 원본 생성적 적대 신경망(Generative Adversarial Nets) 논문의 공동 저자, XGBoost의 Python 패키지 원본 작성자, MXNet 및 AITemplate의 공동 창시자입니다.
2025년 2월, 그는 추론 모델과 추론 시간 스케일링을 사용하여 어텐션 커널을 생성 및 최적화하는 NVIDIA의 초기 에이전트 GPU 커널 생성 연구를 공동 저술했습니다. INT21 이전에 Bing은 NVIDIA의 저명 엔지니어(Distinguished Engineer)였습니다. 그는 자신이 공동 창업하고 CEO로 이끌었던 GPU 추론 스타트업 HippoML을 NVIDIA가 인수한 후 합류했습니다.
컴퓨팅의 새로운 시대
PTX Kernel Factory는 현재 AI 모델, 추론 시스템, 학습 플랫폼 및 기타 GPU 집약적 제품을 구축하는 팀을 위해 베타 버전으로 제공됩니다.
시작점은 너무 느린 연산, 성숙한 커널이 없는 새로운 아키텍처, 또는 전문가의 수 주간 시간을 정당화하지 못한 중요한 워크로드일 수 있습니다. 팀은 문제와 성공 정의를 제공합니다. 팩토리는 탐색을 수행합니다.
PTX Kernel Factory는 또한 INT21과 더 넓은 업계를 위한 더 큰 방향의 첫 걸음입니다.
오늘날 대부분의 컴퓨팅 인프라는 정적입니다. 사람들이 작성하고, 최적화하고, 요구 사항이나 하드웨어가 변경될 때 다시 방문합니다. AI 시스템은 인상적인 출력을 생성할 수 있지만, 프로덕션에서 안정적으로 확장하여 배포하는 것은 여전히 largely 해결되지 않은 문제입니다.
우리는 더 많은 인프라가 적응형이 될 것이라고 믿습니다. 자체 작업을 테스트하고, 배운 것을 보존하며, 다음 문제를 해결하는 방식을 개선할 것입니다.
우리는 스택에서 가장 어렵고 가장 측정 가능한 계층 중 하나에서 시작합니다. 인간의 지식은 확장되지 않지만, 에이전트 집단은 실행할 때마다 계속해서 더 나아질 수 있습니다. 자기 개선 컴퓨팅 인프라는 AI가 구축되는 방식의 근본적인 변화입니다.
커널을 설명하세요. 성공을 정의하세요. 팩토리가 구현체를 개선하도록 하세요.





