隆重介紹 INT21 與 PTX Kernel Factory

@int21_ai
英語1 個月前 · 2026年6月16日
110K
8
0
0
5

TL;DR

INT21 推出了 PTX Kernel Factory,這是一個能自動化建立與優化 NVIDIA GPU kernel 的 AI 系統,相較於專家編寫的基準測試,能帶來顯著的效能提升。

我們正在為現代 AI 底層的軟體打造能自我改進的 AI 系統。我們的第一個產品能生成並優化低階 GPU 軟體,再透過測試與基準測試來驗證其成果。

今天,我們正式推出 INT21:第一家實現能自我改進的 AI Agent 群組,並將其應用於 AI 基礎設施的公司。

多數人看不見的那一層

多數關於 AI 進展的討論都聚焦在模型上。但每個模型都依賴一個較不顯眼的層級:告訴 GPU 如何執行每個運算的軟體。

這層軟體對速度與成本有著巨大的影響,也相當難以建構。要在新 GPU 上達到最佳效能,通常需要同時深入理解演算法與硬體的專家。

INT21 的存在,就是為了讓這項工作更具可擴展性。我們稱這個全新類別為自我改進的運算基礎設施

我們的第一個產品:PTX Kernel Factory

PTX Kernel Factory 是一個 AI 系統,用於生成並改進 NVIDIA GPU 的軟體。團隊定義運算、需求與成功衡量標準。工廠會撰寫實作、測試、在目標硬體上測量、從結果學習,然後重複執行。

PTX Kernel Factory 最初產出的四個實作,如今已開源。該產品也正進入 beta 階段,可透過 int21.ai 取得早期存取權限。

對於在 NVIDIA GPU 上運行的 AI 工作負載,每個模型運算最終都會轉換為硬體執行的指令。GPU Kernel 就是負責這類運算(如正規化、注意力機制、或資料在記憶體中的移動)的小型專用程式。成千上萬個這類 Kernel 運行在每個訓練任務與 AI 應用之下。

PTX 是 NVIDIA 的低階、類似組合語言的 GPU 語言。它位於較高階的 GPU 軟體與最終硬體執行的機器指令之間,是 NVIDIA 堆疊中最接近可程式化的層級之一。

在這個層級工作,能精準控制資料如何在記憶體中移動、執行緒如何協作、何時同步工作,以及使用哪些專屬的 GPU 指令。這些選擇決定了昂貴的 GPU 是在工作還是等待。

很少有工程師能熟練地撰寫與優化 PTX。這項工作需要罕見的演算法知識、GPU 架構專業、數值嚴謹性,以及效能直覺的結合。更高階的工具、函式庫與編譯器讓更多人能進行 GPU 開發,但當全新的 AI 運算缺乏成熟的實作,或現有抽象化無法達到所需效能時,這種稀缺的低階專業知識便成了瓶頸。

這項工作也極度困難。一個 Kernel 看起來可能正確,卻在某個罕見輸入上失敗;對某種形狀很快,對另一種卻很慢;可能使用太多暫存器、移動太多資料,或在 Hopper 上表現良好,卻在 Blackwell 上退步。即使是專家工程師也必須測試許多想法,而其中大多數都行不通。每一代硬體都會改變部分問題。

這項組合使 PTX 成為 INT21 理想的第一個驗證場域:技術要求高、經濟重要性大,且可客觀衡量。生成的 Kernel 不是正確就是錯誤,不是更快就是更慢。

PTX Kernel Factory 將撰寫、測試、分析與修訂低階 GPU 程式碼的專家循環,轉變為一個能持續運行並從結果中學習的流程。

PTX Kernel Factory 的運作方式

介面刻意保持簡單:

  1. 描述運算。 定義 Kernel 需要做什麼,以及必須支援的輸入。
  2. 設定需求。 提供正確性測試、目標硬體,以及任何整合限制。
  3. 定義成功。 選擇系統應優化的效能指標。

從那裡開始,工廠會執行一個長期的工程流程。它會生成候選實作、編譯、拒絕錯誤結果、基準測試有效的候選方案,並利用證據引導下一輪。

已發布的實作結合了 CUDA C++ 與內聯 PTX,讓系統能控制更高階工具可能刻意隱藏的硬體細節。PTX Kernel Factory 並非依賴單一 Agent 一次性給出答案,而是協調多個 AI Agent 在整個循環中運作。

人類工程師仍然定義目標、限制與驗收標準。PTX Kernel Factory 則自動化從明確規格到強效實作之間昂貴的搜尋過程。

我們所謂的自我改進

一個寫程式 Agent 可以產出答案。但一個可靠的工程系統還需要判斷答案是否有效、理解嘗試為何失敗,並將有用的知識帶入下一次嘗試。

這就是我們所謂的自我改進。

這個領域多數的努力都專注於自我改進 AI 本身。我們走的是截然不同的路徑:Agent 群組自我改進它們所運行的基礎設施,同時保留人類的控制權,並在每個生產週期中持續疊加效能。

挑戰不在於產生一個看似合理的 Kernel,而在於建立一個能夠拒絕數千個錯誤、脆弱或誤導性的嘗試、保留少數重要教訓,並在不偏離正確性的情況下持續改進的系統。

PTX Kernel Factory 不會將每次生成視為全新的提示。它會保留成功與失敗實驗中的有用發現,讓後續工作能建立在先前的證據之上。目標是改生產生程式碼的流程。

這就是工廠效能如何隨時間疊加。每一次生成都始於更多關於什麼有效、什麼失敗、哪些方向值得探索的證據。

我們更廣泛的論點是:

用運算來改進運算。

智慧不僅在於模型知道什麼,更在於搜尋、測試、記憶、修正與改進的能力。我們相信,讓這些能力得以累積的系統,將成為未來運算基礎設施以及 AI 更廣泛的自我改進演進中的重要部分。

我們的第一個證明:兩種截然不同的 AI 工作負載

在首次公開發布中,我們選擇了兩種測試不同能力的負載。

RMSNorm 是現代語言模型中常用的運算。它很成熟、廣為人知,且已有強大的人工撰寫實作。它測試工廠能否在已成熟的領域中競爭。

Kimi Delta Attention(KDA) 是一種較新的注意力機制。它更為專用,且較少既有的實作模式。它測試工廠能否快速適應較新的研究工作負載。

我們將生成的實作與經過良好優化的人工基準進行比較:RMSNorm 使用 QuACK,KDA 使用基於 CUTLASS 的 FlashKDA 實作。比較在同一硬體上進行,並在計時前先通過正確性檢查。

基準測試亮點

工作負載

硬體

對專家基準的結果

KDA

NVIDIA GH200, Hopper

在六種固定與可變長度情境中,速度為 1.24 倍至 1.59 倍

KDA

NVIDIA B200, Blackwell

透過標準公開介面快 1.42 倍,在優化整合中快 1.52 倍

RMSNorm

NVIDIA GH200, Hopper

在 11 個前向案例(使用常見的 16 位元 AI 格式)的幾何平均數上快 8.17%;在選定的反向比較中快 15% 至 34%

RMSNorm

NVIDIA B200, Blackwell

在完整預設基準矩陣的所有 126 個可比較案例中皆更快

這些是運算子層級的基準測試結果,並非全模型加速的宣稱。對應用程式的影響取決於其模型、工作負載、形狀、軟體堆疊,以及在優化運算上花費的總時間。

我們也報告較不亮眼的結果。在 Hopper RMSNorm 矩陣中,另外兩種數值格式包含小幅退步;最慢的案例分別落後 QuACK 0.42% 與 0.84%。我們寧可公布結果的邊界,也不將其藏在單一有利數字之後。

正確性優先於速度

一個快的 Kernel 如果改變結果或在真實輸入上失敗,就毫無用處。

因此,每個效能比較都始於正確性:

  • B200 KDA 實作通過了所有 580 個上游測試。
  • Hopper KDA 實作在驗證過的 GH200 系統上通過了 584 個上游測試與 235 個套件測試。
  • RMSNorm 實作在驗證過的硬體上通過了完整的套件組合:GH200 上 48 個測試加 65 個子測試,B200 上 66 個測試。

這些測試涵蓋不同資料類型、輸入大小、固定與可變長度序列、可選狀態、前向與反向(在支援的情況下),以及困難的邊界案例。

基準測試仍可能因環境而異,因此每個儲存庫都包含原始碼、測試命令、測量方法、軟體版本,以及用於檢查和重現結果的原始或生成報告。

為何從這裡開始

GPU Kernel 是我們方法一個有用的初步測試,因為回饋是毫不寬容的。

輸出不是正確就是錯誤。實作不是更快就是更慢。變更可以被編譯、測試和測量。進展建立在證據之上,而非被生成的文字聽起來多具說服力所評斷。

Kernel 優化也處於一個重要的瓶頸。AI 模型快速演進,硬體每一代都在改變,而低階優化專業知識的供應無法以同樣速度增長。

將更多這類工作轉變為可重複的系統,可以幫助團隊:

  • 更快地將新的模型運算導入生產。
  • 更好地利用新一代 GPU。
  • 探索手動測試成本過高的優化想法。
  • 將專家時間保留給架構、需求與系統層級的決策。

這不是要取代工程師,而是要讓少數專家擁有更大的槓桿效應。

開源首批四個工廠產出

今天,我們釋出:

我們發布程式碼,是因為效能宣稱應能被檢視。開發者應能閱讀實作、執行測試、重現基準測試,並對結果提出質疑。

這些釋出並非最終產品。它們是首批公開證據,證明工廠能在既有的與新興的工作負載上,以及兩代 NVIDIA 硬體上,產出有用的低階軟體。

關於我們

INT21 由 Bing Xu 於 2026 年 4 月創立,是一家 AI 原生公司,建立在一個簡單的理念之上:公司自身的工程能力應與運算規模一起擴展。

Bing 是原始生成對抗網路論文的共同作者、XGBoost Python 套件的原始創作者,也是 MXNet 與 AITemplate 的共同創造者。

2025 年 2 月,他共同撰寫了 NVIDIA 關於 Agentic GPU 核心生成的早期研究,使用推理模型與推論時擴展來生成並優化注意力核心。在 INT21 之前,Bing 是 NVIDIA 的傑出工程師。他在 NVIDIA 收購其共同創立並擔任 CEO 的 GPU 推理新創公司 HippoML 後加入。

運算的新時代

PTX Kernel Factory 現已對正在建構 AI 模型、推理系統、訓練平台及其他 GPU 密集型產品的團隊開放 beta。

起點可以是某個太慢的運算、一個沒有成熟核心的新型架構,或一個重要但尚未投入數週專家時間的工作負載。團隊提供問題與成功的定義。工廠則承擔搜尋的工作。

PTX Kernel Factory 也是 INT21 以及整個產業更廣泛方向的第一步。

目前多數的運算基礎設施是靜態的:人們撰寫、優化,然後在需求或硬體改變時重新審視。AI 系統可以產出令人印象深刻的輸出,但要可靠地大規模部署到生產環境中,基本上仍是未解的問題。

我們相信,更多這類基礎設施將會變得具有適應性。它會測試自己的工作、保留所學,並改進解決下一個問題的方式。

我們從堆疊中最困難、最可衡量的層開始。人類知識無法擴展,但 Agent 群組可以在每次運行中變得更好。自我改進的運算基礎設施是 AI 建構方式的一項根本轉變。

描述核心。定義成功。讓工廠改進實作。

了解更多並申請早期存取權限。

一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章