隆重介绍 INT21 与 PTX Kernel Factory

@int21_ai
英语2026年6月16日
110K
8
0
0
5

TL;DR

INT21 推出了 PTX Kernel Factory,这是一个能够自动化创建和优化 NVIDIA GPU 内核的 AI 系统,相较于专家编写的基准方案,它带来了显著的性能提升。

我们正在为现代 AI 底层的软件构建自我改进的 AI 系统。我们的第一款产品能够生成并优化底层 GPU 软件,然后通过测试和基准测试来验证其工作成果。

今天,我们正式推出 INT21:这是首家实现自我改进 AI Agent 集群并应用于 AI 基础设施的公司。

大多数人看不到的那个层面

大多数关于 AI 进展的讨论都聚焦在模型上。但每一个模型都依赖一个不那么显眼的层面:即告诉 GPU 如何执行每一步操作的软件。

这个软件对速度和成本有着巨大的影响。同时,它也极难构建。要在新 GPU 上达到最佳性能,通常需要既深刻理解算法又精通硬件的专家。

INT21 的存在就是为了让这项工作更具可扩展性。我们称这个新类别为 自我改进的计算基础设施

我们的第一款产品:PTX Kernel Factory

PTX Kernel Factory 是一个 AI 系统,用于生成和改进 NVIDIA GPU 的软件。团队定义操作、需求以及成功的衡量标准。工厂会编写实现代码、进行测试、在目标硬件上测量性能、从结果中学习,然后重复这一过程。

PTX Kernel Factory 首批生成的四个实现现已开源。该产品也已进入测试阶段,可通过 int21.ai 申请早期访问。

对于在 NVIDIA GPU 上运行的 AI 工作负载,每个模型操作最终都会转化为由硬件执行的指令。GPU kernel 是负责一种操作(如归一化、注意力机制或通过内存移动数据)的小型专用程序。每一次训练任务和 AI 应用背后,都有数千个这样的 kernel 在运行。

PTX 是 NVIDIA 的低级、类似汇编的 GPU 语言。它位于更高级别的 GPU 软件与最终由硬件执行的机器指令之间,是 NVIDIA 技术栈中最接近可编程的层面之一。

在这个层面上工作,可以精确控制数据如何在内存中移动、线程如何协作、何时同步工作以及使用哪些特定的 GPU 指令。这些选择决定了昂贵的 GPU 是在工作还是在等待。

很少有工程师能够熟练地编写和优化 PTX。这项工作需要算法知识、GPU 架构专业知识、数值严谨性以及性能直觉力的罕见结合。更高级别的工具、库和编译器让更多人能够进行 GPU 开发,但是当新的 AI 操作没有成熟的实现,或者现有的抽象层无法达到所需的性能时,这种稀缺的低级专业知识就成为了瓶颈。

同时,这项工作也异常困难。一个 kernel 可能看起来正确,却在某个罕见的输入上失败;可能在一种形状下很快,在另一种形状下却很慢;可能使用了过多的寄存器、移动了过多的数据,或者在 Hopper 上表现良好,但在 Blackwell 上却性能下降。即使是专家工程师也必须测试许多想法,而其中大多数想法并不奏效。每一代硬件都会改变问题的一部分。

正是这种组合使得 PTX 成为 INT21 理想的第一个试验场:它在技术上要求高、在经济上重要,并且可以客观衡量。生成的 kernel 要么正确,要么不正确;要么更快,要么不是。

PTX Kernel Factory 将编写、测试、分析和修改低级 GPU 代码的专家循环,转变为一个可以持续运行并从其结果中学习的过程。

PTX Kernel Factory 的工作原理

其界面设计得很简单:

  1. 描述操作。 定义 kernel 需要做什么以及它必须支持的输入。
  2. 设定需求。 提供正确性测试、目标硬件以及任何集成约束条件。
  3. 定义成功。 选择系统应优化的性能指标。

然后,工厂会运行一个长期工程过程。它生成候选实现、编译它们、拒绝不正确的结果、对有效的候选进行基准测试,并使用这些证据来指导下一轮。

发布的实现结合了 CUDA C++ 和内联 PTX,使系统能够控制更高级别工具可能有意隐藏的硬件细节。PTX Kernel Factory 不是依靠单个 Agent 生成一次性答案,而是在这个循环中协调多个 AI Agent。

人类工程师仍然定义目标、约束和验收标准。PTX Kernel Factory 自动化了从明确规范到强大实现之间的昂贵搜索过程。

我们所说的自我改进是什么意思

一个编码 Agent 可以生成一个答案。但一个可靠的工程系统还需要确定答案是否有效,理解尝试失败的原因,并将有用的知识带入下一次尝试。

这就是我们所说的自我改进。

该领域的大多数努力都侧重于改进 AI 本身。我们走的是完全不同的道路:Agent 集群自我改进它们所运行的基础设施,在保持人类控制的同时,每个生产周期都能叠加性能提升。

挑战与其说是生成一个看似合理的 kernel,不如说是构建一个能够拒绝成千上万个错误、脆弱或误导性尝试的系统,保存少数重要的经验教训,并持续改进而不偏离正确性。

PTX Kernel Factory 并不会把每一次生成都当作全新的提示词来处理。它会保存来自成功和失败实验的有用发现,使后续工作能够建立在先前证据的基础之上。目标是改进生成代码的过程。

这就是工厂的性能如何随时间叠加。每一轮生成都从更多关于什么有效、什么失败以及哪些方向值得探索的证据开始。

我们更广泛的论点如下:

用计算来改进计算。

智能不仅仅是模型所知道的东西。它也是搜索、测试、记忆、纠正和改进的能力。我们相信,使这些能力得以累积的系统,将成为未来计算基础设施以及更广泛的 AI 自我改进演进的重要组成部分。

我们的第一个证明:两种截然不同的 AI 工作负载

在首次公开发布中,我们选择了两种测试不同能力的工作负载。

RMSNorm 是现代语言模型中常用的操作。它已经成熟、被广泛理解,并且已经有很强的人工编写实现。它测试工厂是否能在既有工作上具备竞争力。

Kimi Delta Attention(KDA) 是一种较新的注意力机制。它更具专业性,且建立的实现模式较少。它测试工厂是否能快速适应更新的研究型工作负载。

我们将生成的实现与经过充分优化的人工构建基准线进行了比较:RMSNorm 使用 QuACK,KDA 使用基于 CUTLASS 的 FlashKDA 实现。比较在相同硬件上进行,并在计时前进行了正确性检查。

基准测试亮点

工作负载

硬件

与专家基准线相比的结果

KDA

NVIDIA GH200, Hopper

在六种固定长度和可变长度场景下,速度快 1.24 倍到 1.59 倍

KDA

NVIDIA B200, Blackwell

通过标准公共接口速度快 1.42 倍,在优化集成中速度快 1.52 倍

RMSNorm

NVIDIA GH200, Hopper

在使用常见 16 位 AI 格式的 11 个前向案例的几何平均中,速度快 8.17%;在选定的反向比较中,速度快 15% 到 34%

RMSNorm

NVIDIA B200, Blackwell

在整个默认基准测试矩阵的 126 个可比案例中,全部更快

这些是在算子层面的基准测试结果,并非声称整模型加速。对应用程序的影响取决于其模型、工作负载、形状、软件栈以及在优化操作上所花费的总时间。

我们还报告了不那么辉煌的结果。在 Hopper RMSNorm 矩阵中,另外两种数字格式出现了小幅倒退;最慢的情况比 QuACK 慢 0.42% 和 0.84%。我们宁愿公布结果的边界,也不愿用一个有利的数字来掩盖它。

正确性先于速度

一个快速的 kernel 如果改变了结果或在真实输入上失败,那就毫无用处。

因此,每次性能比较都以正确性为前提:

  • B200 KDA 实现通过了所有 580 项上游测试。
  • Hopper KDA 实现通过了 584 项上游测试和在经过验证的 GH200 系统上的 235 项包测试。
  • RMSNorm 实现在经过验证的硬件上通过了完整的包测试套件:GH200 上 48 项测试加 65 项子测试,B200 上 66 项测试。

这些套件涵盖了不同的数据类型、输入大小、固定和可变长度序列、可选状态、支持的前向和反向路径,以及困难的边界情况。

基准测试仍然可能受限于环境,因此每个仓库都包含源代码、测试命令、测量方法、软件版本以及检查并复现结果所需的原始或生成的报告。

为什么从这里开始

GPU kernel 是我们方法的一个有用初试,因为反馈是无情的。

输出要么正确要么不正确。实现要么更快要么不是。一个更改可以被编译、测试和测量。进步是基于证据的,而不是由生成的文本听起来令人信服的程度来判断。

Kernel 优化也处于一个重要瓶颈上。AI 模型发展迅速,硬件每代都在变化,而低级优化专业知识的供应无法以同样的速度增长。

将更多此类工作转化为可重复的系统,可以帮助团队:

  • 更快地将新的模型操作投入生产。
  • 更好地利用新的 GPU 世代。
  • 探索那些手动测试成本过高的优化思路。
  • 将专家时间保留给架构、需求和系统级决策。

这不是要取代工程师,而是要给予少数专家更大的杠杆作用。

开源首批四个工厂产物

今天,我们发布:

我们发布代码是因为性能声明应当是可检查的。开发者应该能够阅读实现、运行测试、复现基准测试并质疑结果。

这些发布并非最终产品。它们是首批公开证据,表明工厂能够为既有和新兴的工作负载,以及两代 NVIDIA 硬件,生成有用的低级软件。

关于我们

INT21 由 Bing Xu 于 2026 年 4 月创立,是一家原生 AI 公司,建立在一个简单的想法之上:公司自身的工程能力应该随着计算能力的增长而扩展。

Bing 是原始生成对抗网络(GANs)论文的合著者、XGBoost Python 包的原创作者,以及 MXNet 和 AITemplate 的联合创建者。

2025 年 2 月,他合著了 NVIDIA 在 agentic GPU kernel 生成方面的早期工作,利用推理模型和推理时扩展来生成和优化注意力 kernel。在创立 INT21 之前,Bing 是 NVIDIA 的杰出工程师。他在 NVIDIA 收购了他共同创立并担任 CEO 的 GPU 推理初创公司 HippoML 后加入 NVIDIA。

计算的新纪元

PTX Kernel Factory 现已进入测试阶段,面向构建 AI 模型、推理系统、训练平台和其他 GPU 密集型产品的团队。

起点可以是一个太慢的操作、一个没有成熟 kernel 的新架构,或者一个尚未值得花费数周专家时间的重要工作负载。团队提供问题和成功的定义。工厂承担起搜索的任务。

PTX Kernel Factory 也是 INT21 乃至整个行业更宏大方向的第一步。

如今大多数计算基础设施都是静态的:人们编写它、优化它,并在需求或硬件发生变化时重新审视它。AI 系统可以生成令人印象深刻的输出,但可靠地大规模部署到生产环境中,在很大程度上仍未解决。

我们相信,更多的基础设施将变得自适应。它将测试自己的工作,保存学到的知识,并改进解决下一个问题的方式。

我们从技术栈中最困难、最可衡量的层面之一开始。人类知识无法扩展,但 Agent 集群可以在每次运行中不断变得更好。自我改进的计算基础设施是 AI 构建方式的根本性转变。

描述 kernel。定义成功。让工厂改进实现。

了解更多并申请早期访问。

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章