Giới thiệu INT21 và PTX Kernel Factory

@int21_ai
TIẾNG ANH16 thg 6, 2026
110K
8
0
0
5

TL;DR

INT21 đã ra mắt PTX Kernel Factory, một hệ thống AI giúp tự động hóa việc tạo và tối ưu hóa các nhân GPU NVIDIA, mang lại hiệu suất vượt trội so với các tiêu chuẩn do chuyên gia con người thực hiện.

Chúng tôi đang xây dựng các hệ thống AI tự cải thiện cho phần mềm nền tảng bên dưới AI hiện đại. Sản phẩm đầu tiên của chúng tôi tạo ra và tối ưu hóa phần mềm GPU cấp thấp, sau đó chứng minh kết quả bằng các bài kiểm tra và điểm chuẩn.

Hôm nay, chúng tôi ra mắt INT21: công ty đầu tiên đạt được các cụm tác nhân AI tự cải thiện, ứng dụng vào hạ tầng AI.

Lớp Mà Hầu Hết Mọi Người Không Thấy

Hầu hết các cuộc thảo luận về tiến bộ AI tập trung vào các mô hình. Nhưng mọi mô hình đều phụ thuộc vào một lớp ít thấy hơn: phần mềm chỉ dẫn cho GPU cách thực hiện từng thao tác.

Phần mềm đó có ảnh hưởng rất lớn đến tốc độ và chi phí. Nó cũng rất khó xây dựng. Để đạt được hiệu suất tốt nhất trên một GPU mới, thường cần các chuyên gia hiểu sâu cả về thuật toán lẫn phần cứng.

INT21 ra đời để giúp công việc đó có khả năng mở rộng hơn. Chúng tôi gọi hạng mục mới này là Cơ sở hạ tầng Tính toán Tự cải thiện.

Sản phẩm Đầu tiên: PTX Kernel Factory

PTX Kernel Factory là một hệ thống AI tạo ra và cải thiện phần mềm cho GPU NVIDIA. Một nhóm xác định thao tác, yêu cầu và thước đo thành công. Nhà máy viết một bản triển khai, kiểm tra nó, đo lường nó trên phần cứng mục tiêu, học hỏi từ kết quả và lặp lại.

Bốn bản triển khai đầu tiên do PTX Kernel Factory tạo ra hiện đã được mã nguồn mở. Sản phẩm cũng đang bước vào giai đoạn beta, với quyền truy cập sớm tại int21.ai.

Đối với các khối lượng công việc AI chạy trên GPU NVIDIA, mỗi thao tác của mô hình cuối cùng trở thành các lệnh được phần cứng thực thi. Một kernel GPU là chương trình nhỏ, chuyên biệt chịu trách nhiệm cho một thao tác như vậy, chẳng hạn như chuẩn hóa, attention hoặc di chuyển dữ liệu qua bộ nhớ. Hàng nghìn kernel như vậy chạy bên dưới mỗi công việc huấn luyện và ứng dụng AI.

PTX là ngôn ngữ GPU cấp thấp, giống assembly của NVIDIA. Nó nằm giữa phần mềm GPU cấp cao hơn và các lệnh máy cuối cùng được phần cứng thực thi, khiến nó trở thành một trong những lớp có thể lập trình gần nhất trong ngăn xếp NVIDIA.

Làm việc ở cấp độ này mang lại khả năng kiểm soát chính xác cách dữ liệu di chuyển qua bộ nhớ, cách các luồng cộng tác, thời điểm đồng bộ hóa công việc và các lệnh GPU chuyên biệt nào được sử dụng. Những lựa chọn đó có thể quyết định liệu một GPU đắt tiền dành thời gian làm việc hay chờ đợi.

Rất ít kỹ sư có thể viết và tối ưu hóa PTX tốt. Công việc đòi hỏi sự kết hợp hiếm có giữa kiến thức thuật toán, chuyên môn kiến trúc GPU, tính chính xác số học và trực giác hiệu suất. Các công cụ, thư viện và trình biên dịch cấp cao hơn giúp việc phát triển GPU dễ tiếp cận hơn với nhiều người hơn, nhưng khi một thao tác AI mới không có bản triển khai trưởng thành hoặc khi các lớp trừu tượng hiện có không thể đạt được hiệu suất yêu cầu, chuyên môn cấp thấp khan hiếm này trở thành nút thắt cổ chai.

Nó cũng cực kỳ khó khăn. Một kernel có thể trông đúng nhưng lại thất bại trên một đầu vào hiếm gặp. Nó có thể nhanh cho một hình dạng và chậm cho hình dạng khác. Nó có thể sử dụng quá nhiều thanh ghi, di chuyển quá nhiều dữ liệu hoặc hoạt động tốt trên Hopper nhưng lại giảm hiệu suất trên Blackwell. Ngay cả các kỹ sư chuyên gia cũng phải thử nghiệm nhiều ý tưởng, và hầu hết các ý tưởng đó không hiệu quả. Mỗi thế hệ phần cứng lại thay đổi một phần của vấn đề.

Sự kết hợp đó khiến PTX trở thành bãi thử nghiệm lý tưởng đầu tiên cho INT21: nó đòi hỏi kỹ thuật cao, quan trọng về mặt kinh tế và có thể đo lường khách quan. Một kernel được tạo ra là đúng hoặc không đúng. Nó nhanh hơn hoặc không nhanh hơn.

PTX Kernel Factory biến vòng lặp chuyên gia về viết, kiểm tra, phân tích và sửa đổi mã GPU cấp thấp thành một quy trình có thể chạy liên tục và học hỏi từ kết quả của nó.

Cách PTX Kernel Factory Hoạt động

Giao diện có chủ đích đơn giản:

  1. Mô tả thao tác. Xác định kernel cần làm gì và các đầu vào nó phải hỗ trợ.
  2. Đặt yêu cầu. Cung cấp các bài kiểm tra tính đúng đắn, phần cứng mục tiêu và mọi ràng buộc tích hợp.
  3. Xác định thành công. Chọn thước đo hiệu suất mà hệ thống nên tối ưu hóa.

Từ đó, nhà máy chạy một quy trình kỹ thuật dài hạn. Nó tạo ra các bản triển khai ứng viên, biên dịch chúng, loại bỏ kết quả sai, đo điểm chuẩn các ứng viên hợp lệ và sử dụng bằng chứng để hướng dẫn vòng tiếp theo.

Các bản triển khai được phát hành kết hợp CUDA C++ với inline PTX, cho phép hệ thống kiểm soát các chi tiết phần cứng mà các công cụ cấp cao hơn có thể cố tình ẩn đi. Thay vì dựa vào một tác nhân duy nhất để tạo ra câu trả lời một lần, PTX Kernel Factory phối hợp nhiều tác nhân AI trong suốt vòng lặp này.

Các kỹ sư con người vẫn xác định mục tiêu, ràng buộc và tiêu chí chấp nhận. PTX Kernel Factory tự động hóa quá trình tìm kiếm tốn kém giữa một đặc tả rõ ràng và một bản triển khai mạnh mẽ.

Ý Nghĩa của Việc Tự Cải thiện

Một tác nhân viết mã có thể tạo ra một câu trả lời. Một hệ thống kỹ thuật đáng tin cậy cũng cần xác định liệu câu trả lời có hoạt động không, hiểu tại sao một lần thử thất bại và mang kiến thức hữu ích vào lần thử tiếp theo.

Đó là ý nghĩa của việc tự cải thiện.

Hầu hết các nỗ lực trong lĩnh vực này tập trung vào việc tự cải thiện bản thân AI. Chúng tôi đang đi theo một con đường hoàn toàn khác, nơi các cụm tác nhân tự cải thiện cơ sở hạ tầng mà chúng chạy trên đó, giữ quyền kiểm soát của con người trong khi vẫn nhân lên hiệu suất qua mỗi chu kỳ sản xuất.

Thách thức ít hơn ở việc tạo ra một kernel khả thi, mà nhiều hơn ở việc xây dựng một hệ thống có thể loại bỏ hàng nghìn nỗ lực sai, mong manh hoặc gây hiểu lầm, bảo tồn một vài bài học quan trọng và tiếp tục cải thiện mà không xa rời tính đúng đắn.

PTX Kernel Factory không coi mọi thế hệ là một lời nhắc mới. Nó bảo tồn các khám phá hữu ích từ các thí nghiệm thành công và thất bại, cho phép công việc sau này dựa trên bằng chứng trước đó. Mục tiêu là cải thiện quy trình tạo ra mã.

Đây là cách hiệu suất của nhà máy được nhân lên theo thời gian. Mỗi thế hệ bắt đầu với nhiều bằng chứng hơn về những gì hiệu quả, những gì thất bại và những hướng đi đáng khám phá.

Luận điểm rộng hơn của chúng tôi là:

Sử dụng tính toán để cải thiện tính toán.

Trí thông minh không chỉ là những gì một mô hình biết. Đó là khả năng tìm kiếm, kiểm tra, ghi nhớ, sửa chữa và cải thiện. Chúng tôi tin rằng các hệ thống làm cho những khả năng đó tích lũy được sẽ trở thành một phần quan trọng của cơ sở hạ tầng tính toán trong tương lai và sự tiến hóa tự cải thiện rộng lớn hơn trong AI.

Bằng Chứng Đầu tiên: Hai Khối Lượng Công Việc AI Rất Khác Nhau

Đối với bản phát hành công khai đầu tiên, chúng tôi chọn hai khối lượng công việc kiểm tra các khả năng khác nhau.

RMSNorm là một thao tác phổ biến được sử dụng trong các mô hình ngôn ngữ hiện đại. Nó đã trưởng thành, được hiểu rộng rãi và đã có các bản triển khai do con người viết mạnh mẽ. Nó kiểm tra xem nhà máy có thể cạnh tranh trên các công việc đã được thiết lập hay không.

Kimi Delta Attention (KDA) là một cơ chế attention mới hơn. Nó chuyên biệt hơn và có ít mẫu triển khai được thiết lập hơn. Nó kiểm tra xem nhà máy có thể thích ứng nhanh với một khối lượng công việc nghiên cứu mới hơn hay không.

Chúng tôi đã so sánh các bản triển khai được tạo ra với các cơ sở tham chiếu do con người tối ưu hóa tốt: QuACK cho RMSNorm và bản triển khai FlashKDA dựa trên CUTLASS cho KDA. Các so sánh được chạy trên cùng phần cứng với các kiểm tra tính đúng đắn trước khi đo thời gian.

Điểm Nổi bật của Điểm chuẩn

Khối lượng công việc

Phần cứng

Kết quả so với cơ sở tham chiếu chuyên gia

KDA

NVIDIA GH200, Hopper

1.24x đến 1.59x nhanh hơn trong sáu kịch bản có độ dài cố định và biến đổi

KDA

NVIDIA B200, Blackwell

1.42x nhanh hơn qua giao diện công khai tiêu chuẩn và 1.52x nhanh hơn trong tích hợp tối ưu hóa

RMSNorm

NVIDIA GH200, Hopper

Nhanh hơn 8.17% về trung bình hình học trong 11 trường hợp xuôi sử dụng định dạng AI 16-bit phổ biến; nhanh hơn 15% đến 34% trong các so sánh ngược được chọn

RMSNorm

NVIDIA B200, Blackwell

Nhanh hơn trong tất cả 126 trường hợp có thể so sánh trên ma trận điểm chuẩn mặc định đầy đủ

Đây là các kết quả điểm chuẩn ở cấp độ thao tác, không phải tuyên bố về tốc độ toàn bộ mô hình. Ảnh hưởng đến một ứng dụng phụ thuộc vào mô hình, khối lượng công việc, hình dạng, ngăn xếp phần mềm và lượng thời gian tổng thể dành cho thao tác được tối ưu hóa.

Chúng tôi cũng báo cáo các kết quả kém thuận lợi hơn. Trong ma trận RMSNorm Hopper, hai định dạng số khác bao gồm các suy giảm nhỏ; các trường hợp chậm nhất chậm hơn QuACK 0.42% và 0.84%. Chúng tôi muốn công bố ranh giới của kết quả hơn là che giấu nó đằng sau một con số thuận lợi duy nhất.

Tính Đúng đắn Đến Trước Tốc độ

Một kernel nhanh là vô ích nếu nó thay đổi kết quả hoặc thất bại trên các đầu vào thực tế.

Do đó, mọi so sánh hiệu suất đều bắt đầu bằng tính đúng đắn:

  • Bản triển khai KDA trên B200 đã vượt qua tất cả 580 bài kiểm tra upstream.
  • Bản triển khai KDA trên Hopper đã vượt qua 584 bài kiểm tra upstream và 235 bài kiểm tra gói trên hệ thống GH200 đã được xác thực.
  • Các bản triển khai RMSNorm đã vượt qua toàn bộ bộ gói của chúng trên phần cứng đã được xác thực: 48 bài kiểm tra cộng 65 bài kiểm tra phụ trên GH200 và 66 bài kiểm tra trên B200.

Các bộ kiểm tra bao gồm các kiểu dữ liệu khác nhau, kích thước đầu vào, chuỗi có độ dài cố định và biến đổi, trạng thái tùy chọn, đường xuôi và ngược nếu được hỗ trợ, và các trường hợp biên khó.

Điểm chuẩn vẫn có thể phụ thuộc vào môi trường, vì vậy mỗi kho lưu trữ bao gồm mã nguồn, lệnh kiểm tra, phương pháp đo lường, phiên bản phần mềm và các báo cáo thô hoặc được tạo ra cần thiết để kiểm tra và tái tạo kết quả.

Tại Sao Bắt đầu Từ Đây

Kernel GPU là một bài kiểm tra đầu tiên hữu ích cho cách tiếp cận của chúng tôi vì phản hồi là không khoan nhượng.

Đầu ra là đúng hoặc không đúng. Bản triển khai nhanh hơn hoặc không nhanh hơn. Một thay đổi có thể được biên dịch, kiểm tra và đo lường. Tiến bộ được dựa trên bằng chứng hơn là được đánh giá bằng cách văn bản được tạo ra nghe có vẻ thuyết phục.

Tối ưu hóa kernel cũng nằm ở một nút thắt cổ chai quan trọng. Các mô hình AI đang phát triển nhanh chóng, phần cứng thay đổi mỗi thế hệ và nguồn cung chuyên môn tối ưu hóa cấp thấp không thể tăng trưởng với cùng tốc độ.

Biến nhiều hơn công việc này thành một hệ thống có thể lặp lại có thể giúp các nhóm:

  • Đưa các thao tác mô hình mới vào sản xuất nhanh hơn.
  • Tận dụng tốt hơn các thế hệ GPU mới.
  • Khám phá các ý tưởng tối ưu hóa quá tốn kém để kiểm tra thủ công.
  • Dành thời gian chuyên gia cho kiến trúc, yêu cầu và các quyết định cấp hệ thống.

Điều này không phải là loại bỏ các kỹ sư. Đó là cho một số lượng nhỏ chuyên gia nhiều đòn bẩy hơn.

Mã nguồn Mở Bốn Tạo Phẩm Nhà Máy Đầu tiên

Hôm nay, chúng tôi phát hành:

Chúng tôi công bố mã vì các tuyên bố về hiệu suất nên có thể kiểm tra được. Các nhà phát triển nên có thể đọc bản triển khai, chạy các bài kiểm tra, tái tạo các điểm chuẩn và thách thức kết quả.

Các bản phát hành này không phải là sản phẩm cuối cùng. Chúng là bằng chứng công khai đầu tiên cho thấy nhà máy có thể tạo ra phần mềm cấp thấp hữu ích trên các khối lượng công việc đã được thiết lập và mới nổi, và qua hai thế hệ phần cứng NVIDIA.

Về Chúng tôi

INT21 được thành lập bởi Bing Xu vào tháng 4 năm 2026 như một công ty AI-bản địa, được xây dựng trên một ý tưởng đơn giản: năng lực kỹ thuật của công ty nên mở rộng quy mô với sức mạnh tính toán.

Bing là đồng tác giả của bài báo Generative Adversarial Nets gốc, người tạo ra gói Python của XGBoost và là đồng sáng tạo của MXNet và AITemplate.

Vào tháng 2 năm 2025, ông đồng tác giả công trình ban đầu của NVIDIA về tạo kernel GPU tác nhân, sử dụng mô hình lý luận và mở rộng quy mô thời gian suy luận để tạo và tối ưu hóa các kernel attention. Trước INT21, Bing là Kỹ sư Xuất sắc tại NVIDIA. Ông gia nhập NVIDIA sau khi công ty mua lại HippoML, startup suy luận GPU mà ông đồng sáng lập và làm CEO.

Kỷ Nguyên Mới của Tính toán

PTX Kernel Factory hiện đang trong giai đoạn beta cho các nhóm xây dựng mô hình AI, hệ thống suy luận, nền tảng huấn luyện và các sản phẩm sử dụng nhiều GPU khác.

Điểm bắt đầu có thể là một thao tác quá chậm, một kiến trúc mới không có kernel trưởng thành hoặc một khối lượng công việc quan trọng chưa có đủ thời gian chuyên gia. Nhóm cung cấp vấn đề và định nghĩa thành công. Nhà máy đảm nhận việc tìm kiếm.

PTX Kernel Factory cũng là bước đầu tiên trong một hướng đi lớn hơn cho INT21 và cho ngành công nghiệp nói chung.

Hầu hết cơ sở hạ tầng tính toán ngày nay là tĩnh: con người viết nó, tối ưu hóa nó và xem xét lại nó khi yêu cầu hoặc phần cứng thay đổi. Các hệ thống AI có thể tạo ra các đầu ra ấn tượng, nhưng việc triển khai chúng một cách đáng tin cậy trong sản xuất, ở quy mô lớn, vẫn phần lớn chưa được giải quyết.

Chúng tôi tin rằng nhiều hơn cơ sở hạ tầng đó sẽ trở nên thích ứng. Nó sẽ kiểm tra công việc của chính nó, bảo tồn những gì nó học được và cải thiện cách nó giải quyết vấn đề tiếp theo.

Chúng tôi bắt đầu với một trong những lớp khó nhất, có thể đo lường nhất của ngăn xếp. Kiến thức con người không mở rộng được, nhưng các cụm tác nhân có thể tiếp tục cải thiện với mỗi lần chạy. Cơ sở hạ tầng tính toán tự cải thiện là một sự thay đổi cơ bản trong cách AI được xây dựng.

Mô tả kernel. Xác định thành công. Để nhà máy cải thiện bản triển khai.

Tìm hiểu thêm và yêu cầu truy cập sớm.

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral