我們正在為現代 AI 底層的軟體打造能自我改進的 AI 系統。我們的第一個產品能生成並優化低階 GPU 軟體,再透過測試與基準測試來驗證其成果。
今天,我們正式推出 INT21:第一家實現能自我改進的 AI Agent 群組,並將其應用於 AI 基礎設施的公司。
多數人看不見的那一層
多數關於 AI 進展的討論都聚焦在模型上。但每個模型都依賴一個較不顯眼的層級:告訴 GPU 如何執行每個運算的軟體。
這層軟體對速度與成本有著巨大的影響,也相當難以建構。要在新 GPU 上達到最佳效能,通常需要同時深入理解演算法與硬體的專家。
INT21 的存在,就是為了讓這項工作更具可擴展性。我們稱這個全新類別為自我改進的運算基礎設施。
我們的第一個產品:PTX Kernel Factory
PTX Kernel Factory 是一個 AI 系統,用於生成並改進 NVIDIA GPU 的軟體。團隊定義運算、需求與成功衡量標準。工廠會撰寫實作、測試、在目標硬體上測量、從結果學習,然後重複執行。
PTX Kernel Factory 最初產出的四個實作,如今已開源。該產品也正進入 beta 階段,可透過 int21.ai 取得早期存取權限。
對於在 NVIDIA GPU 上運行的 AI 工作負載,每個模型運算最終都會轉換為硬體執行的指令。GPU Kernel 就是負責這類運算(如正規化、注意力機制、或資料在記憶體中的移動)的小型專用程式。成千上萬個這類 Kernel 運行在每個訓練任務與 AI 應用之下。
PTX 是 NVIDIA 的低階、類似組合語言的 GPU 語言。它位於較高階的 GPU 軟體與最終硬體執行的機器指令之間,是 NVIDIA 堆疊中最接近可程式化的層級之一。
在這個層級工作,能精準控制資料如何在記憶體中移動、執行緒如何協作、何時同步工作,以及使用哪些專屬的 GPU 指令。這些選擇決定了昂貴的 GPU 是在工作還是等待。
很少有工程師能熟練地撰寫與優化 PTX。這項工作需要罕見的演算法知識、GPU 架構專業、數值嚴謹性,以及效能直覺的結合。更高階的工具、函式庫與編譯器讓更多人能進行 GPU 開發,但當全新的 AI 運算缺乏成熟的實作,或現有抽象化無法達到所需效能時,這種稀缺的低階專業知識便成了瓶頸。
這項工作也極度困難。一個 Kernel 看起來可能正確,卻在某個罕見輸入上失敗;對某種形狀很快,對另一種卻很慢;可能使用太多暫存器、移動太多資料,或在 Hopper 上表現良好,卻在 Blackwell 上退步。即使是專家工程師也必須測試許多想法,而其中大多數都行不通。每一代硬體都會改變部分問題。
這項組合使 PTX 成為 INT21 理想的第一個驗證場域:技術要求高、經濟重要性大,且可客觀衡量。生成的 Kernel 不是正確就是錯誤,不是更快就是更慢。
PTX Kernel Factory 將撰寫、測試、分析與修訂低階 GPU 程式碼的專家循環,轉變為一個能持續運行並從結果中學習的流程。
PTX Kernel Factory 的運作方式
介面刻意保持簡單:
- 描述運算。 定義 Kernel 需要做什麼,以及必須支援的輸入。
- 設定需求。 提供正確性測試、目標硬體,以及任何整合限制。
- 定義成功。 選擇系統應優化的效能指標。
從那裡開始,工廠會執行一個長期的工程流程。它會生成候選實作、編譯、拒絕錯誤結果、基準測試有效的候選方案,並利用證據引導下一輪。
已發布的實作結合了 CUDA C++ 與內聯 PTX,讓系統能控制更高階工具可能刻意隱藏的硬體細節。PTX Kernel Factory 並非依賴單一 Agent 一次性給出答案,而是協調多個 AI Agent 在整個循環中運作。
人類工程師仍然定義目標、限制與驗收標準。PTX Kernel Factory 則自動化從明確規格到強效實作之間昂貴的搜尋過程。
我們所謂的自我改進
一個寫程式 Agent 可以產出答案。但一個可靠的工程系統還需要判斷答案是否有效、理解嘗試為何失敗,並將有用的知識帶入下一次嘗試。
這就是我們所謂的自我改進。
這個領域多數的努力都專注於自我改進 AI 本身。我們走的是截然不同的路徑:Agent 群組自我改進它們所運行的基礎設施,同時保留人類的控制權,並在每個生產週期中持續疊加效能。
挑戰不在於產生一個看似合理的 Kernel,而在於建立一個能夠拒絕數千個錯誤、脆弱或誤導性的嘗試、保留少數重要教訓,並在不偏離正確性的情況下持續改進的系統。
PTX Kernel Factory 不會將每次生成視為全新的提示。它會保留成功與失敗實驗中的有用發現,讓後續工作能建立在先前的證據之上。目標是改生產生程式碼的流程。
這就是工廠效能如何隨時間疊加。每一次生成都始於更多關於什麼有效、什麼失敗、哪些方向值得探索的證據。
我們更廣泛的論點是:
用運算來改進運算。
智慧不僅在於模型知道什麼,更在於搜尋、測試、記憶、修正與改進的能力。我們相信,讓這些能力得以累積的系統,將成為未來運算基礎設施以及 AI 更廣泛的自我改進演進中的重要部分。
我們的第一個證明:兩種截然不同的 AI 工作負載
在首次公開發布中,我們選擇了兩種測試不同能力的負載。
RMSNorm 是現代語言模型中常用的運算。它很成熟、廣為人知,且已有強大的人工撰寫實作。它測試工廠能否在已成熟的領域中競爭。
Kimi Delta Attention(KDA) 是一種較新的注意力機制。它更為專用,且較少既有的實作模式。它測試工廠能否快速適應較新的研究工作負載。
我們將生成的實作與經過良好優化的人工基準進行比較:RMSNorm 使用 QuACK,KDA 使用基於 CUTLASS 的 FlashKDA 實作。比較在同一硬體上進行,並在計時前先通過正確性檢查。
基準測試亮點
工作負載
硬體
對專家基準的結果
KDA
NVIDIA GH200, Hopper
在六種固定與可變長度情境中,速度為 1.24 倍至 1.59 倍
KDA
NVIDIA B200, Blackwell
透過標準公開介面快 1.42 倍,在優化整合中快 1.52 倍
RMSNorm
NVIDIA GH200, Hopper
在 11 個前向案例(使用常見的 16 位元 AI 格式)的幾何平均數上快 8.17%;在選定的反向比較中快 15% 至 34%
RMSNorm
NVIDIA B200, Blackwell
在完整預設基準矩陣的所有 126 個可比較案例中皆更快
這些是運算子層級的基準測試結果,並非全模型加速的宣稱。對應用程式的影響取決於其模型、工作負載、形狀、軟體堆疊,以及在優化運算上花費的總時間。
我們也報告較不亮眼的結果。在 Hopper RMSNorm 矩陣中,另外兩種數值格式包含小幅退步;最慢的案例分別落後 QuACK 0.42% 與 0.84%。我們寧可公布結果的邊界,也不將其藏在單一有利數字之後。
正確性優先於速度
一個快的 Kernel 如果改變結果或在真實輸入上失敗,就毫無用處。
因此,每個效能比較都始於正確性:
- B200 KDA 實作通過了所有 580 個上游測試。
- Hopper KDA 實作在驗證過的 GH200 系統上通過了 584 個上游測試與 235 個套件測試。
- RMSNorm 實作在驗證過的硬體上通過了完整的套件組合:GH200 上 48 個測試加 65 個子測試,B200 上 66 個測試。
這些測試涵蓋不同資料類型、輸入大小、固定與可變長度序列、可選狀態、前向與反向(在支援的情況下),以及困難的邊界案例。
基準測試仍可能因環境而異,因此每個儲存庫都包含原始碼、測試命令、測量方法、軟體版本,以及用於檢查和重現結果的原始或生成報告。
為何從這裡開始
GPU Kernel 是我們方法一個有用的初步測試,因為回饋是毫不寬容的。
輸出不是正確就是錯誤。實作不是更快就是更慢。變更可以被編譯、測試和測量。進展建立在證據之上,而非被生成的文字聽起來多具說服力所評斷。
Kernel 優化也處於一個重要的瓶頸。AI 模型快速演進,硬體每一代都在改變,而低階優化專業知識的供應無法以同樣速度增長。
將更多這類工作轉變為可重複的系統,可以幫助團隊:
- 更快地將新的模型運算導入生產。
- 更好地利用新一代 GPU。
- 探索手動測試成本過高的優化想法。
- 將專家時間保留給架構、需求與系統層級的決策。
這不是要取代工程師,而是要讓少數專家擁有更大的槓桿效應。
開源首批四個工廠產出
今天,我們釋出:
- Int21-AI/KDA-B200:適用於 Blackwell 的 Kimi Delta Attention,在 NVIDIA B200 上驗證。
- Int21-AI/KDA-H100:適用於 Hopper 的 Kimi Delta Attention,在 NVIDIA GH200 上驗證。
- Int21-AI/RMSNorm-B200:適用於 Blackwell 的 RMSNorm,在 NVIDIA B200 上驗證。
- Int21-AI/RMSNorm-H100:適用於 Hopper 的 RMSNorm,在 NVIDIA GH200 上驗證。
我們發布程式碼,是因為效能宣稱應能被檢視。開發者應能閱讀實作、執行測試、重現基準測試,並對結果提出質疑。
這些釋出並非最終產品。它們是首批公開證據,證明工廠能在既有的與新興的工作負載上,以及兩代 NVIDIA 硬體上,產出有用的低階軟體。
關於我們
INT21 由 Bing Xu 於 2026 年 4 月創立,是一家 AI 原生公司,建立在一個簡單的理念之上:公司自身的工程能力應與運算規模一起擴展。
Bing 是原始生成對抗網路論文的共同作者、XGBoost Python 套件的原始創作者,也是 MXNet 與 AITemplate 的共同創造者。
2025 年 2 月,他共同撰寫了 NVIDIA 關於 Agentic GPU 核心生成的早期研究,使用推理模型與推論時擴展來生成並優化注意力核心。在 INT21 之前,Bing 是 NVIDIA 的傑出工程師。他在 NVIDIA 收購其共同創立並擔任 CEO 的 GPU 推理新創公司 HippoML 後加入。
運算的新時代
PTX Kernel Factory 現已對正在建構 AI 模型、推理系統、訓練平台及其他 GPU 密集型產品的團隊開放 beta。
起點可以是某個太慢的運算、一個沒有成熟核心的新型架構,或一個重要但尚未投入數週專家時間的工作負載。團隊提供問題與成功的定義。工廠則承擔搜尋的工作。
PTX Kernel Factory 也是 INT21 以及整個產業更廣泛方向的第一步。
目前多數的運算基礎設施是靜態的:人們撰寫、優化,然後在需求或硬體改變時重新審視。AI 系統可以產出令人印象深刻的輸出,但要可靠地大規模部署到生產環境中,基本上仍是未解的問題。
我們相信,更多這類基礎設施將會變得具有適應性。它會測試自己的工作、保留所學,並改進解決下一個問題的方式。
我們從堆疊中最困難、最可衡量的層開始。人類知識無法擴展,但 Agent 群組可以在每次運行中變得更好。自我改進的運算基礎設施是 AI 建構方式的一項根本轉變。
描述核心。定義成功。讓工廠改進實作。





