我们正在为现代 AI 底层的软件构建自我改进的 AI 系统。我们的第一个产品能够生成并优化底层 GPU 软件,然后通过测试和基准验证其工作成果。
今天,我们正式推出 INT21:这是首家实现自我改进 AI 智能体群(应用于 AI 基础设施)的公司。
大多数人看不见的层级
大部分关于 AI 进展的讨论都集中在模型上。但每个模型都依赖于一个不那么显眼的层级:告诉 GPU 如何执行每个操作的软件。
这个软件对速度和成本有着巨大的影响。它也很难构建。要在新 GPU 上达到最佳性能,往往需要既深刻理解算法又精通硬件的专家。
INT21 的存在就是为了让这项工作更具可扩展性。我们将这一新类别称为 自我改进的计算基础设施。
我们的第一款产品:PTX 内核工厂
PTX 内核工厂是一个 AI 系统,用于生成并改进 NVIDIA GPU 的软件。团队定义操作、需求以及成功的衡量标准。工厂会编写实现、测试它、在目标硬件上测量、从结果中学习,然后重复这个过程。
PTX 内核工厂生成的前四个实现今天已开源。该产品也进入了测试阶段,早期访问可通过 int21.ai 申请。
对于在 NVIDIA GPU 上运行的 AI 工作负载,每个模型操作最终都会变成由硬件执行的指令。GPU 内核是一个小而专门的程序,负责一个这样的操作,比如归一化、注意力机制或在内存中移动数据。每个训练任务和 AI 应用背后都有成千上万个这样的内核在运行。
PTX 是 NVIDIA 的低层级、类似汇编的 GPU 语言。它位于更高层的 GPU 软件和最终由硬件执行的机器指令之间,是 NVIDIA 堆栈中最可编程的层级之一。
在这个层级上工作,可以精确控制数据如何流经内存、线程如何协作、何时同步工作以及使用哪些专门的 GPU 指令。这些选择决定了昂贵的 GPU 是花时间工作还是等待。
很少有人能熟练编写和优化 PTX。这项工作需要算法知识、GPU 架构专长、数值严谨性和性能直觉的罕见结合。更高级的工具、库和编译器让更多人可以开发 GPU,但当新的 AI 操作没有成熟的实现,或者现有抽象无法达到所需性能时,这种稀缺的低层级专业知识就成了瓶颈。
这也异常困难。一个看似正确的内核可能在某个罕见输入上失败。它可能对于一种形状很快,但对于另一种形状很慢。它可能使用太多寄存器、移动太多数据,或者在 Hopper 上表现良好但在 Blackwell 上出现倒退。即使是专家工程师也必须测试许多想法,而其中大部分想法都不奏效。每一代硬件都会改变部分问题。
这种组合使 PTX 成为 INT21 理想的第一个试验场:它在技术上有挑战性、在经济上至关重要,并且可以客观衡量。生成的内核要么正确,要么不正确。它要么更快,要么不快。
PTX 内核工厂将编写、测试、剖析和修改底层 GPU 代码的专家循环,转变为一个可以持续运行并从结果中学习的过程。
PTX 内核工厂的工作原理
界面设计得极其简单:
- 描述操作。 定义内核需要做什么以及它必须支持哪些输入。
- 设定需求。 提供正确性测试、目标硬件以及任何集成约束。
- 定义成功。 选择系统应优化的性能指标。
从那里开始,工厂运行一个长周期的工程流程。它生成候选实现、编译它们、拒绝不正确的结果、对有效候选进行基准测试,并利用证据指导下一轮迭代。
发布的实现将 CUDA C++ 与内联 PTX 结合在一起,使系统能够控制更高级工具可能有意隐藏的硬件细节。PTX 内核工厂并非依赖单个智能体一次性给出答案,而是协调多个 AI 智能体在这个循环中工作。
人类工程师仍然定义目标、约束和验收标准。PTX 内核工厂自动完成了从清晰规格到强大实现之间的昂贵搜索过程。
我们所说的自我改进的含义
一个编码智能体可以给出答案。一个可靠的工程系统还需要判断答案是否有效、理解尝试失败的原因,并将有用的知识带入下一次尝试。
这就是我们所说的自我改进。
这个领域的大部分努力都集中在让 AI 自身进行自我改进。我们走的是一条根本不同的路径:让智能体群自我改进它们运行的基础设施,在保持人类控制的同时,每个生产周期都让性能不断叠加。
挑战与其说是生成一个看似合理的内核,不如说是构建一个能够拒绝成千上万错误、脆弱或误导性尝试的系统,保留少数重要的教训,并不断改进而不偏离正确性。
PTX 内核工厂并不把每一次生成都当作一次全新的提示。它保留了成功和失败实验中有用的发现,让后续工作可以建立在前期的证据之上。目标是改进产生代码的过程。
这就是工厂性能如何随时间累积的方式。每一代都从关于什么有效、什么失败以及哪些方向值得探索的更多证据开始。
我们更广泛的论点是:
用计算来改进计算。
智能不仅仅在于模型知道什么。它还在于搜索、测试、记忆、纠正和改进的能力。我们相信,让这些能力不断累积的系统,将成为未来计算基础设施以及 AI 更广泛的自我改进演进中的重要组成部分。
我们的第一个证明:两种截然不同的 AI 工作负载
在第一次公开发布中,我们选择了两种测试不同能力的工作负载。
RMSNorm 是现代语言模型中常用的操作。它已经成熟、被广泛理解,并且已经有很强的人工编写实现。它测试工厂能否在成熟的工作上与人类竞争。
Kimi Delta Attention (KDA) 是一种较新的注意力机制。它更专业,且已有的实现模式较少。它测试工厂能否快速适应较新的研究工作负载。
我们将生成的实现与经过良好优化的人工构建基线进行了比较:RMSNorm 使用 QuACK,KDA 使用基于 CUTLASS 的 FlashKDA 实现。比较在同一硬件上进行,并在计时前进行了正确性检查。
基准测试亮点
工作负载
硬件
与专家基线相比的结果
KDA
NVIDIA GH200, Hopper
在六种固定长度和可变长度场景下,速度快 1.24 倍到 1.59 倍
KDA
NVIDIA B200, Blackwell
通过标准公共接口速度快 1.42 倍,在优化集成中速度快 1.52 倍
RMSNorm
NVIDIA GH200, Hopper
使用常见的 16 位 AI 格式,11 个前向案例的几何平均值快 8.17%;选定的反向比较中快 15% 到 34%
RMSNorm
NVIDIA B200, Blackwell
在完整默认基准矩阵的 126 个可比案例中全部更快
这些是算子级别的基准测试结果,并非关于完整模型加速的声明。对应用的影响取决于其模型、工作负载、形状、软件堆栈以及在优化操作上花费的总时间。
我们也报告了不那么令人满意的结果。在 Hopper RMSNorm 矩阵中,另外两种数字格式出现了小幅倒退;最慢的案例比 QuACK 慢了 0.42% 和 0.84%。我们宁愿公布结果的边界,也不愿将其隐藏在一个有利的数字背后。
正确性优先于速度
一个快速但会改变结果或在真实输入上失败的内核毫无用处。
因此,每次性能比较都从正确性开始:
- B200 KDA 实现通过了所有 580 个上游测试。
- Hopper KDA 实现通过了 584 个上游测试和 235 个在已验证的 GH200 系统上的包测试。
- RMSNorm 实现通过了在已验证硬件上的完整包测试套件:GH200 上 48 个测试加 65 个子测试,B200 上 66 个测试。
这些测试套件涵盖不同的数据类型、输入尺寸、固定长度和可变长度序列、可选状态、支持的前向和后向路径以及困难的边缘情况。
基准测试仍然可能因环境而异,因此每个仓库都包含了源代码、测试命令、测量方法、软件版本以及用于检查和复现结果的原始或生成报告。
为什么从这里开始
GPU 内核是我们方法的一个有用初试,因为反馈是无情的。
输出要么正确,要么不正确。实现要么更快,要么不快。每次更改都可以编译、测试和测量。进步是建立在证据之上,而不是根据生成的文本有多令人信服来评判。
内核优化也处于一个重要的瓶颈处。AI 模型发展迅速,硬件每代都在变化,而底层优化专业知识的供应无法以同样速度增长。
将更多这类工作转化为可重复的系统,可以帮助团队:
- 更快地将新的模型操作投入生产。
- 更好地利用新一代 GPU。
- 探索那些手动测试成本过高的优化思路。
- 将专家时间保留给架构、需求和系统层面的决策。
这并非要取代工程师。而是让少数专家获得更大的杠杆作用。
开源前四个工厂产物
今天,我们发布:
- Int21-AI/KDA-B200:面向 Blackwell 的 Kimi Delta Attention,已在 NVIDIA B200 上验证。
- Int21-AI/KDA-H100:面向 Hopper 的 Kimi Delta Attention,已在 NVIDIA GH200 上验证。
- Int21-AI/RMSNorm-B200:面向 Blackwell 的 RMSNorm,已在 NVIDIA B200 上验证。
- Int21-AI/RMSNorm-H100:面向 Hopper 的 RMSNorm,已在 NVIDIA GH200 上验证。
我们发布代码是因为性能声明应该是可检查的。开发者应该能够阅读实现、运行测试、复现基准并质疑结果。
这些发布并非最终产品。它们是首批公开证据,表明工厂能够为成熟和新兴的工作负载、跨越两代 NVIDIA 硬件生成有用的底层软件。
关于我们
INT21 由 徐彬 于 2026 年 4 月创立,是一家 AI 原生公司,建立在一个简单的理念上:公司自身的工程能力应该随计算规模扩展。
徐彬是原始生成对抗网络(GAN)论文的合著者、XGBoost Python 包的原始创建者,以及 MXNet 和 AITemplate 的联合创建者。
2025 年 2 月,他合著了 NVIDIA 在智能体 GPU 内核生成方面的早期工作,利用推理模型和推理时扩展来生成并优化注意力内核。在加入 INT21 之前,徐彬是 NVIDIA 的杰出工程师。他在 NVIDIA 收购 HippoML(他联合创立并担任 CEO 的 GPU 推理初创公司)后加入。
计算的新时代
PTX 内核工厂现已面向构建 AI 模型、推理系统、训练平台以及其他 GPU 密集型产品的团队开放测试。
起点可以是一个太慢的操作、一个没有成熟内核的新架构,或者一个尚未值得投入数周专家时间的重要工作负载。团队提供问题和成功的定义。工厂负责搜索。
PTX 内核工厂也是 INT21 以及更广泛行业更大方向上的第一步。
如今大多数计算基础设施是静态的:人们编写它、优化它,然后在需求或硬件变化时重新审视它。AI 系统可以生成令人印象深刻的输出,但要可靠地将其投入大规模生产,仍然在很大程度上尚未解决。
我们相信更多这样的基础设施将变得自适应。它将测试自己的工作、保留学到的知识,并改进解决下一个问题的方式。
我们从堆栈中最困难、最可衡量的层级之一开始。人类知识无法扩展,但智能体群可以在每次运行中不断变得更好。自我改进的计算基础设施是 AI 构建方式的一个根本性转变。
描述内核。定义成功。让工厂改进实现。





