隆重介绍 INT21 与 PTX Kernel Factory

@int21_ai
الإنجليزية16 يونيو 2026
110K
8
0
0
5

ليرة تركية؛ د

INT21 推出了 PTX Kernel Factory,这是一个能够自动化创建和优化 NVIDIA GPU 内核的 AI 系统,相较于专家编写的基准方案,它实现了显著的性能提升。

我们正在为现代 AI 底层的软件构建自我改进的 AI 系统。我们的第一个产品能够生成并优化底层 GPU 软件,然后通过测试和基准验证其工作成果。

今天,我们正式推出 INT21:这是首家实现自我改进 AI 智能体群(应用于 AI 基础设施)的公司。

大多数人看不见的层级

大部分关于 AI 进展的讨论都集中在模型上。但每个模型都依赖于一个不那么显眼的层级:告诉 GPU 如何执行每个操作的软件。

这个软件对速度和成本有着巨大的影响。它也很难构建。要在新 GPU 上达到最佳性能,往往需要既深刻理解算法又精通硬件的专家。

INT21 的存在就是为了让这项工作更具可扩展性。我们将这一新类别称为 自我改进的计算基础设施

我们的第一款产品:PTX 内核工厂

PTX 内核工厂是一个 AI 系统,用于生成并改进 NVIDIA GPU 的软件。团队定义操作、需求以及成功的衡量标准。工厂会编写实现、测试它、在目标硬件上测量、从结果中学习,然后重复这个过程。

PTX 内核工厂生成的前四个实现今天已开源。该产品也进入了测试阶段,早期访问可通过 int21.ai 申请。

对于在 NVIDIA GPU 上运行的 AI 工作负载,每个模型操作最终都会变成由硬件执行的指令。GPU 内核是一个小而专门的程序,负责一个这样的操作,比如归一化、注意力机制或在内存中移动数据。每个训练任务和 AI 应用背后都有成千上万个这样的内核在运行。

PTX 是 NVIDIA 的低层级、类似汇编的 GPU 语言。它位于更高层的 GPU 软件和最终由硬件执行的机器指令之间,是 NVIDIA 堆栈中最可编程的层级之一。

在这个层级上工作,可以精确控制数据如何流经内存、线程如何协作、何时同步工作以及使用哪些专门的 GPU 指令。这些选择决定了昂贵的 GPU 是花时间工作还是等待。

很少有人能熟练编写和优化 PTX。这项工作需要算法知识、GPU 架构专长、数值严谨性和性能直觉的罕见结合。更高级的工具、库和编译器让更多人可以开发 GPU,但当新的 AI 操作没有成熟的实现,或者现有抽象无法达到所需性能时,这种稀缺的低层级专业知识就成了瓶颈。

这也异常困难。一个看似正确的内核可能在某个罕见输入上失败。它可能对于一种形状很快,但对于另一种形状很慢。它可能使用太多寄存器、移动太多数据,或者在 Hopper 上表现良好但在 Blackwell 上出现倒退。即使是专家工程师也必须测试许多想法,而其中大部分想法都不奏效。每一代硬件都会改变部分问题。

这种组合使 PTX 成为 INT21 理想的第一个试验场:它在技术上有挑战性、在经济上至关重要,并且可以客观衡量。生成的内核要么正确,要么不正确。它要么更快,要么不快。

PTX 内核工厂将编写、测试、剖析和修改底层 GPU 代码的专家循环,转变为一个可以持续运行并从结果中学习的过程。

PTX 内核工厂的工作原理

界面设计得极其简单:

  1. 描述操作。 定义内核需要做什么以及它必须支持哪些输入。
  2. 设定需求。 提供正确性测试、目标硬件以及任何集成约束。
  3. 定义成功。 选择系统应优化的性能指标。

从那里开始,工厂运行一个长周期的工程流程。它生成候选实现、编译它们、拒绝不正确的结果、对有效候选进行基准测试,并利用证据指导下一轮迭代。

发布的实现将 CUDA C++ 与内联 PTX 结合在一起,使系统能够控制更高级工具可能有意隐藏的硬件细节。PTX 内核工厂并非依赖单个智能体一次性给出答案,而是协调多个 AI 智能体在这个循环中工作。

人类工程师仍然定义目标、约束和验收标准。PTX 内核工厂自动完成了从清晰规格到强大实现之间的昂贵搜索过程。

我们所说的自我改进的含义

一个编码智能体可以给出答案。一个可靠的工程系统还需要判断答案是否有效、理解尝试失败的原因,并将有用的知识带入下一次尝试。

这就是我们所说的自我改进。

这个领域的大部分努力都集中在让 AI 自身进行自我改进。我们走的是一条根本不同的路径:让智能体群自我改进它们运行的基础设施,在保持人类控制的同时,每个生产周期都让性能不断叠加。

挑战与其说是生成一个看似合理的内核,不如说是构建一个能够拒绝成千上万错误、脆弱或误导性尝试的系统,保留少数重要的教训,并不断改进而不偏离正确性。

PTX 内核工厂并不把每一次生成都当作一次全新的提示。它保留了成功和失败实验中有用的发现,让后续工作可以建立在前期的证据之上。目标是改进产生代码的过程。

这就是工厂性能如何随时间累积的方式。每一代都从关于什么有效、什么失败以及哪些方向值得探索的更多证据开始。

我们更广泛的论点是:

用计算来改进计算。

智能不仅仅在于模型知道什么。它还在于搜索、测试、记忆、纠正和改进的能力。我们相信,让这些能力不断累积的系统,将成为未来计算基础设施以及 AI 更广泛的自我改进演进中的重要组成部分。

我们的第一个证明:两种截然不同的 AI 工作负载

在第一次公开发布中,我们选择了两种测试不同能力的工作负载。

RMSNorm 是现代语言模型中常用的操作。它已经成熟、被广泛理解,并且已经有很强的人工编写实现。它测试工厂能否在成熟的工作上与人类竞争。

Kimi Delta Attention (KDA) 是一种较新的注意力机制。它更专业,且已有的实现模式较少。它测试工厂能否快速适应较新的研究工作负载。

我们将生成的实现与经过良好优化的人工构建基线进行了比较:RMSNorm 使用 QuACK,KDA 使用基于 CUTLASS 的 FlashKDA 实现。比较在同一硬件上进行,并在计时前进行了正确性检查。

基准测试亮点

工作负载

硬件

与专家基线相比的结果

KDA

NVIDIA GH200, Hopper

在六种固定长度和可变长度场景下,速度快 1.24 倍到 1.59 倍

KDA

NVIDIA B200, Blackwell

通过标准公共接口速度快 1.42 倍,在优化集成中速度快 1.52 倍

RMSNorm

NVIDIA GH200, Hopper

使用常见的 16 位 AI 格式,11 个前向案例的几何平均值快 8.17%;选定的反向比较中快 15% 到 34%

RMSNorm

NVIDIA B200, Blackwell

在完整默认基准矩阵的 126 个可比案例中全部更快

这些是算子级别的基准测试结果,并非关于完整模型加速的声明。对应用的影响取决于其模型、工作负载、形状、软件堆栈以及在优化操作上花费的总时间。

我们也报告了不那么令人满意的结果。在 Hopper RMSNorm 矩阵中,另外两种数字格式出现了小幅倒退;最慢的案例比 QuACK 慢了 0.42% 和 0.84%。我们宁愿公布结果的边界,也不愿将其隐藏在一个有利的数字背后。

正确性优先于速度

一个快速但会改变结果或在真实输入上失败的内核毫无用处。

因此,每次性能比较都从正确性开始:

  • B200 KDA 实现通过了所有 580 个上游测试。
  • Hopper KDA 实现通过了 584 个上游测试和 235 个在已验证的 GH200 系统上的包测试。
  • RMSNorm 实现通过了在已验证硬件上的完整包测试套件:GH200 上 48 个测试加 65 个子测试,B200 上 66 个测试。

这些测试套件涵盖不同的数据类型、输入尺寸、固定长度和可变长度序列、可选状态、支持的前向和后向路径以及困难的边缘情况。

基准测试仍然可能因环境而异,因此每个仓库都包含了源代码、测试命令、测量方法、软件版本以及用于检查和复现结果的原始或生成报告。

为什么从这里开始

GPU 内核是我们方法的一个有用初试,因为反馈是无情的。

输出要么正确,要么不正确。实现要么更快,要么不快。每次更改都可以编译、测试和测量。进步是建立在证据之上,而不是根据生成的文本有多令人信服来评判。

内核优化也处于一个重要的瓶颈处。AI 模型发展迅速,硬件每代都在变化,而底层优化专业知识的供应无法以同样速度增长。

将更多这类工作转化为可重复的系统,可以帮助团队:

  • 更快地将新的模型操作投入生产。
  • 更好地利用新一代 GPU。
  • 探索那些手动测试成本过高的优化思路。
  • 将专家时间保留给架构、需求和系统层面的决策。

这并非要取代工程师。而是让少数专家获得更大的杠杆作用。

开源前四个工厂产物

今天,我们发布:

我们发布代码是因为性能声明应该是可检查的。开发者应该能够阅读实现、运行测试、复现基准并质疑结果。

这些发布并非最终产品。它们是首批公开证据,表明工厂能够为成熟和新兴的工作负载、跨越两代 NVIDIA 硬件生成有用的底层软件。

关于我们

INT21 由 徐彬 于 2026 年 4 月创立,是一家 AI 原生公司,建立在一个简单的理念上:公司自身的工程能力应该随计算规模扩展。

徐彬是原始生成对抗网络(GAN)论文的合著者、XGBoost Python 包的原始创建者,以及 MXNet 和 AITemplate 的联合创建者。

2025 年 2 月,他合著了 NVIDIA 在智能体 GPU 内核生成方面的早期工作,利用推理模型和推理时扩展来生成并优化注意力内核。在加入 INT21 之前,徐彬是 NVIDIA 的杰出工程师。他在 NVIDIA 收购 HippoML(他联合创立并担任 CEO 的 GPU 推理初创公司)后加入。

计算的新时代

PTX 内核工厂现已面向构建 AI 模型、推理系统、训练平台以及其他 GPU 密集型产品的团队开放测试。

起点可以是一个太慢的操作、一个没有成熟内核的新架构,或者一个尚未值得投入数周专家时间的重要工作负载。团队提供问题和成功的定义。工厂负责搜索。

PTX 内核工厂也是 INT21 以及更广泛行业更大方向上的第一步。

如今大多数计算基础设施是静态的:人们编写它、优化它,然后在需求或硬件变化时重新审视它。AI 系统可以生成令人印象深刻的输出,但要可靠地将其投入大规模生产,仍然在很大程度上尚未解决。

我们相信更多这样的基础设施将变得自适应。它将测试自己的工作、保留学到的知识,并改进解决下一个问题的方式。

我们从堆栈中最困难、最可衡量的层级之一开始。人类知识无法扩展,但智能体群可以在每次运行中不断变得更好。自我改进的计算基础设施是 AI 构建方式的一个根本性转变。

描述内核。定义成功。让工厂改进实现。

了解更多并申请早期访问。

بنقرة واحدة حفظ

استخدم YouMind للقراءة العميقة للمقالات سريعة الانتشار بتقنية الذكاء الاصطناعي

احفظ المصدر، واطرح أسئلة مركزة، ولخص الحجة، وحوّل المقالة واسعة الانتشار إلى ملاحظات قابلة لإعادة الاستخدام في مساحة عمل واحدة تعمل بالذكاء الاصطناعي.

اكتشف YouMind
للمبدعين

حول Markdown إلى مقالة 𝕏 نظيفة

عندما تنشر كتاباتك الطويلة، فإن الصور والجداول وكتل التعليمات البرمجية تجعل تنسيق 𝕏 مؤلمًا. YouMind يحول مسودة Markdown كاملة إلى مقالة نظيفة وجاهزة للنشر 𝕏.

حاول Markdown إلى 𝕏

المزيد من الأنماط لفك التشفير

المقالات الفيروسية الأخيرة

استكشاف المزيد من المقالات الفيروسية