Modern yapay zekanın altındaki yazılım için kendini geliştiren yapay zeka sistemleri inşa ediyoruz. İlk ürünümüz, düşük seviyeli GPU yazılımı üretip optimize ediyor ve ardından çalışmasını testler ve kıyaslamalarla kanıtlıyor.
Bugün, yapay zeka altyapısına uygulanan, kendini geliştiren yapay zeka ajan sürülerini başaran ilk şirket olan INT21'i tanıtıyoruz.
Çoğu Kişinin Görmediği Katman
Yapay zeka ilerlemesiyle ilgili çoğu konuşma modellere odaklanır. Ancak her model, daha az görünen bir katmana bağlıdır: GPU'lara her işlemi nasıl gerçekleştireceklerini söyleyen yazılım.
Bu yazılımın hız ve maliyet üzerinde orantısız bir etkisi vardır. Ayrıca oluşturulması da zordur. Yeni bir GPU'da en iyi performansa ulaşmak, genellikle hem algoritmayı hem de donanımı olağanüstü derinlikte anlayan uzmanlar gerektirir.
INT21, bu çalışmayı daha ölçeklenebilir kılmak için var. Biz buna Kendini Geliştiren Hesaplama Altyapısı adını veriyoruz.
İlk Ürünümüz: PTX Kernel Factory
PTX Kernel Factory, NVIDIA GPU'lar için yazılım üreten ve geliştiren bir yapay zeka sistemidir. Bir ekip, işlemi, gereksinimleri ve başarı ölçütünü tanımlar. Fabrika bir uygulama yazar, test eder, hedef donanımda ölçer, sonuçtan öğrenir ve tekrarlar.
PTX Kernel Factory tarafından üretilen ilk dört uygulama bugün açık kaynak olarak yayınlanmıştır. Ürün ayrıca beta aşamasına giriyor ve int21.ai adresinden erken erişim sağlanabiliyor.
NVIDIA GPU'larında çalışan yapay zeka iş yükleri için, her model işlemi eninde sonunda donanım tarafından yürütülen talimatlara dönüşür. Bir GPU çekirdeği (kernel), normalleştirme, dikkat veya bellekte veri taşıma gibi tek bir işlemden sorumlu küçük, özelleşmiş programdır. Her eğitim işinin ve yapay zeka uygulamasının altında binlerce bu tür çekirdek çalışır.
PTX, NVIDIA'nın düşük seviyeli, assembly benzeri GPU dilidir. Daha üst seviye GPU yazılımı ile donanım tarafından yürütülen nihai makine talimatları arasında yer alır ve NVIDIA yığınındaki en yakın programlanabilir katmanlardan biri haline gelir.
Bu seviyede çalışmak, verilerin bellekte nasıl hareket ettiği, iş parçacıklarının nasıl işbirliği yaptığı, işin ne zaman senkronize edildiği ve hangi özelleşmiş GPU talimatlarının kullanıldığı üzerinde hassas kontrol sağlar. Bu seçimler, pahalı bir GPU'nun zamanını çalışarak mı yoksa bekleyerek mi geçireceğini belirleyebilir.
Çok az mühendis PTX'i iyi yazabilir ve optimize edebilir. Bu çalışma, algoritma bilgisi, GPU mimarisi uzmanlığı, sayısal titizlik ve performans sezgisinin nadir bir kombinasyonunu gerektirir. Daha üst seviye araçlar, kütüphaneler ve derleyiciler GPU geliştirmeyi çok daha fazla kişi için erişilebilir kılar, ancak yeni bir yapay zeka işleminin olgun bir uygulaması olmadığında veya mevcut soyutlamalar gerekli performansa ulaşamadığında, bu kıt düşük seviyeli uzmanlık bir darboğaz haline gelir.
Aynı zamanda son derece zordur. Bir çekirdek doğru görünebilir ancak nadir bir girdide başarısız olabilir. Bir şekil için hızlı, başka bir şekil için yavaş olabilir. Çok fazla kayıt kullanabilir, çok fazla veri taşıyabilir veya Hopper'da iyi performans gösterirken Blackwell'de gerileyebilir. Uzman mühendisler bile birçok fikri test etmelidir ve bu fikirlerin çoğu işe yaramaz. Her donanım nesli, sorunun bir kısmını değiştirir.
Bu kombinasyon, PTX'i INT21 için ideal bir ilk deneme alanı haline getirir: teknik olarak zorlu, ekonomik olarak önemli ve objektif olarak ölçülebilirdir. Üretilen bir çekirdek ya doğrudur ya da değildir. Ya daha hızlıdır ya da değildir.
PTX Kernel Factory, düşük seviyeli GPU kodu yazma, test etme, profil oluşturma ve revize etme uzman döngüsünü, sürekli çalışabilen ve sonuçlarından öğrenebilen bir sürece dönüştürür.
PTX Kernel Factory Nasıl Çalışır
Arayüz kasıtlı olarak basittir:
- İşlemi tanımlayın. Çekirdeğin ne yapması gerektiğini ve desteklemesi gereken girdileri tanımlayın.
- Gereksinimleri belirleyin. Doğruluk testleri, hedef donanım ve her türlü entegrasyon kısıtlamasını sağlayın.
- Başarıyı tanımlayın. Sistemin optimize etmesi gereken performans metriğini seçin.
Buradan itibaren fabrika, uzun vadeli bir mühendislik süreci yürütür. Aday uygulamalar üretir, bunları derler, yanlış sonuçları reddeder, geçerli adayları kıyaslar ve bir sonraki tura rehberlik etmesi için kanıtları kullanır.
Yayınlanan uygulamalar, CUDA C++ ile satır içi PTX'i birleştirerek sisteme, üst düzey araçların kasıtlı olarak gizleyebileceği donanım ayrıntıları üzerinde kontrol sağlar. PTX Kernel Factory, tek bir ajana tek seferlik bir cevap üretmesi için güvenmek yerine, bu döngü boyunca birden çok yapay zeka ajanını koordine eder.
İnsan mühendisler hala hedefi, kısıtlamaları ve kabul kriterlerini tanımlar. PTX Kernel Factory, net bir spesifikasyon ile güçlü bir uygulama arasındaki pahalı aramayı otomatikleştirir.
Kendini Geliştirmekten Ne Anlıyoruz
Bir kodlama ajanı bir cevap üretebilir. Güvenilir bir mühendislik sistemi ayrıca cevabın işe yarayıp yaramadığını belirlemeli, bir denemenin neden başarısız olduğunu anlamalı ve bir sonraki denemeye faydalı bilgi taşımalıdır.
Kendini geliştirmekten kastettiğimiz budur.
Bu alandaki çabaların çoğu, yapay zekanın kendisini kendini geliştirmeye odaklanır. Biz temelde farklı bir yol izliyoruz: ajan sürülerinin üzerinde çalıştıkları altyapıyı kendi kendine geliştirmesi, insan kontrolünü korurken her üretim döngüsünde performansı birleştirmesi.
Zorluk, makul bir çekirdek üretmekten çok, binlerce yanlış, kırılgan veya yanıltıcı denemeyi reddedebilen, önemli olan birkaç dersi koruyabilen ve doğruluktan uzaklaşmadan gelişmeye devam eden bir sistem inşa etmektir.
PTX Kernel Factory her nesli yeni bir istem olarak ele almaz. Başarılı ve başarısız deneylerden faydalı keşifleri koruyarak sonraki çalışmaların önceki kanıtlar üzerine inşa edilmesine olanak tanır. Amaç, kodu üreten süreci geliştirmektir.
Fabrikanın performansı zamanla bu şekilde birikir. Her nesil, neyin işe yaradığı, neyin başarısız olduğu ve hangi yönlerin keşfedilmeye değer olduğu hakkında daha fazla kanıtla başlar.
Daha geniş tezimiz şudur:
Hesaplamayı kullanarak hesaplamayı iyileştirin.
Zeka, yalnızca bir modelin bildiği şey değildir. Arama, test etme, hatırlama, düzeltme ve iyileştirme yeteneğidir. Bu yetenekleri kümülatif hale getiren sistemlerin, gelecekteki hesaplama altyapısının ve yapay zekadaki daha geniş kendini geliştirme evriminin önemli bir parçası olacağına inanıyoruz.
İlk Kanıtımız: Çok Farklı İki Yapay Zeka İş Yükü
İlk halka açık sürüm için, farklı yetenekleri test eden iki iş yükü seçtik.
RMSNorm, modern dil modellerinde yaygın olarak kullanılan bir işlemdir. Olgundur, yaygın olarak anlaşılır ve halihazırda güçlü insan yazımı uygulamalara sahiptir. Fabrikanın yerleşik işlerde rekabet edip edemeyeceğini test eder.
Kimi Delta Attention (KDA) daha yeni bir dikkat mekanizmasıdır. Daha özelleşmiştir ve daha az yerleşik uygulama desenine sahiptir. Fabrikanın daha yeni bir araştırma iş yüküne hızlı bir şekilde uyum sağlayıp sağlayamayacağını test eder.
Üretilen uygulamaları iyi optimize edilmiş insan yapımı temel çizgilerle karşılaştırdık: RMSNorm için QuACK ve KDA için CUTLASS tabanlı FlashKDA uygulaması. Karşılaştırmalar aynı donanımda, zamanlamadan önce doğruluk kontrolleri yapılarak gerçekleştirildi.
Kıyaslama Öne Çıkanları
İş Yükü
Donanım
Uzman Temel Çizgisine Karşı Sonuç
KDA
NVIDIA GH200, Hopper
Altı sabit ve değişken uzunluklu senaryoda 1,24x ila 1,59x daha hızlı
KDA
NVIDIA B200, Blackwell
Standart genel arayüzde 1,42x daha hızlı ve optimize edilmiş bir entegrasyonda 1,52x daha hızlı
RMSNorm
NVIDIA GH200, Hopper
Yaygın bir 16 bit AI formatı kullanan 11 ileri yönlü durumda geometrik ortalama üzerinden %8,17 daha hızlı; seçilen geriye dönük karşılaştırmalarda %15 ila %34 daha hızlı
RMSNorm
NVIDIA B200, Blackwell
Tam varsayılan kıyaslama matrisi genelindeki 126 karşılaştırılabilir durumun tamamında daha hızlı
Bunlar, tam model hızlanmalarıyla ilgili iddialar değil, operatör düzeyinde kıyaslama sonuçlarıdır. Bir uygulama üzerindeki etkisi, modeline, iş yüküne, şekillere, yazılım yığınına ve optimize edilmiş işlemde ne kadar toplam zaman harcadığına bağlıdır.
Ayrıca daha az gurur verici sonuçları da rapor ediyoruz. Hopper RMSNorm matrisinde, diğer iki sayı formatı küçük gerilemeler içeriyordu; en yavaş durumlar QuACK'in %0,42 ve %0,84 gerisindeydi. Sonucun sınırını tek bir olumlu rakamın arkasına saklamaktansa yayınlamayı tercih ederiz.
Doğruluk Hızdan Önce Gelir
Sonucu değiştiriyorsa veya gerçek girdilerde başarısız oluyorsa hızlı bir çekirdek işe yaramaz.
Bu nedenle her performans karşılaştırması doğrulukla başlar:
- B200 KDA uygulaması, 580 ana akış testinin tamamını geçti.
- Hopper KDA uygulaması, doğrulanmış GH200 sisteminde 584 ana akış testini ve 235 paket testini geçti.
- RMSNorm uygulamaları, doğrulanmış donanımda eksiksiz paket süitlerini geçti: GH200'de 48 test artı 65 alt test ve B200'de 66 test.
Süitler farklı veri türlerini, girdi boyutlarını, sabit ve değişken uzunluklu dizileri, isteğe bağlı durumu, desteklenen ileri ve geri yönlü yolları ve zorlu uç durumları kapsar.
Kıyaslamalar yine de ortama özgü olabilir, bu nedenle her depo, sonuçları incelemek ve yeniden üretmek için gereken kaynağı, test komutlarını, ölçüm yöntemini, yazılım sürümlerini ve ham veya oluşturulmuş raporları içerir.
Neden Buradan Başlıyoruz
GPU çekirdekleri, yaklaşımımız için kullanışlı bir ilk testtir çünkü geri bildirim affetmez.
Çıktı ya doğrudur ya da değildir. Uygulama ya daha hızlıdır ya da değildir. Bir değişiklik derlenebilir, test edilebilir ve ölçülebilir. İlerleme, üretilen metnin ne kadar ikna edici göründüğüyle değil, kanıtlarla temellendirilir.
Çekirdek optimizasyonu ayrıca önemli bir darboğazda yer alır. Yapay zeka modelleri hızla gelişiyor, donanım her nesilde değişiyor ve düşük seviyeli optimizasyon uzmanlığı arzı aynı oranda büyüyemiyor.
Bu çalışmanın daha fazlasını tekrarlanabilir bir sisteme dönüştürmek, ekiplerin şunları yapmasına yardımcı olabilir:
- Yeni model işlemlerini daha hızlı üretime geçirmek.
- Yeni GPU nesillerinden daha iyi yararlanmak.
- Manuel olarak test edilmesi çok pahalı olacak optimizasyon fikirlerini keşfetmek.
- Uzman zamanını mimari, gereksinimler ve sistem düzeyindeki kararlar için ayırmak.
Bu, mühendisleri ortadan kaldırmakla ilgili değil. Az sayıda uzmana daha fazla etki gücü vermekle ilgilidir.
İlk Dört Fabrika Ürününü Açık Kaynak Olarak Yayınlamak
Bugün yayınlıyoruz:
- Int21-AI/KDA-B200: Blackwell için Kimi Delta Attention, NVIDIA B200'de doğrulandı.
- Int21-AI/KDA-H100: Hopper için Kimi Delta Attention, NVIDIA GH200'de doğrulandı.
- Int21-AI/RMSNorm-B200: Blackwell için RMSNorm, NVIDIA B200'de doğrulandı.
- Int21-AI/RMSNorm-H100: Hopper için RMSNorm, NVIDIA GH200'de doğrulandı.
Kodu yayınlıyoruz çünkü performans iddiaları incelenebilir olmalıdır. Geliştiriciler uygulamayı okuyabilmeli, testleri çalıştırabilmeli, kıyaslamaları yeniden üretebilmeli ve sonuçlara meydan okuyabilmelidir.
Bu sürümler nihai ürün değildir. Bunlar, fabrikanın yerleşik ve gelişmekte olan iş yüklerinde ve iki nesil NVIDIA donanımında faydalı düşük seviyeli yazılım üretebileceğine dair ilk kamuya açık kanıtlardır.
Hakkımızda
INT21, Nisan 2026'da Bing Xu tarafından yapay zeka odaklı bir şirket olarak basit bir fikir üzerine kuruldu: şirketin kendi mühendislik kapasitesi, hesaplama gücüyle birlikte ölçeklenmelidir.
Bing, orijinal Generative Adversarial Nets makalesinin ortak yazarı, XGBoost'un Python paketinin orijinal yaratıcısı ve MXNet ile AITemplate'in ortak yaratıcısıydı.
Şubat 2025'te, bir akıl yürütme modeli ve çıkarım zamanı ölçeklendirmesi kullanarak dikkat çekirdekleri oluşturmak ve optimize etmek için NVIDIA'nın aracılı GPU çekirdeği oluşturma konusundaki erken çalışmasına ortak yazarlık yaptı. INT21'den önce Bing, NVIDIA'da Seçkin Mühendisti. NVIDIA, kurucu ortağı olduğu ve CEO'su olarak yönettiği GPU çıkarım girişimi HippoML'yi satın aldıktan sonra şirkete katıldı.
Yeni Bir Hesaplama Çağı
PTX Kernel Factory, artık yapay zeka modelleri, çıkarım sistemleri, eğitim platformları ve diğer GPU yoğun ürünler üreten ekipler için beta aşamasındadır.
Başlangıç noktası, çok yavaş bir işlem, olgun bir çekirdeği olmayan yeni bir mimari veya haftalarca uzman zamanını haklı çıkarmamış önemli bir iş yükü olabilir. Ekip, sorunu ve başarı tanımını sağlar. Fabrika aramayı üstlenir.
PTX Kernel Factory aynı zamanda INT21 ve daha geniş anlamda endüstri için daha büyük bir yönün ilk adımıdır.
Günümüzde çoğu hesaplama altyapısı statiktir: insanlar onu yazar, optimize eder ve gereksinimler veya donanım değiştiğinde tekrar ziyaret eder. Yapay zeka sistemleri etkileyici çıktılar üretebilir, ancak bunları üretimde güvenilir bir şekilde, ölçekte dağıtmak büyük ölçüde çözülmemiş durumdadır.
Bu altyapının daha fazlasının uyarlanabilir hale geleceğine inanıyoruz. Kendi işini test edecek, öğrendiklerini koruyacak ve bir sonraki sorunu çözme şeklini geliştirecek.
Yığının en zor, en ölçülebilir katmanlarından biriyle başlıyoruz. İnsan bilgisi ölçeklenmez, ancak ajan sürüleri her çalıştırmada daha iyi hale gelmeye devam edebilir. Kendini geliştiren hesaplama altyapısı, yapay zekanın nasıl inşa edildiğinde temel bir değişimdir.
Çekirdeği tanımlayın. Başarıyı tanımlayın. Fabrikanın uygulamayı iyileştirmesine izin verin.





