เรากำลังสร้างระบบ AI ที่สามารถปรับปรุงตัวเองได้สำหรับซอฟต์แวร์ที่อยู่ใต้โครงสร้างพื้นฐานของ AI สมัยใหม่ ผลิตภัณฑ์แรกของเราสร้างและปรับซอฟต์แวร์ GPU ระดับต่ำให้เหมาะสมที่สุด จากนั้นพิสูจน์ผลงานด้วยการทดสอบและการวัดประสิทธิภาพ
วันนี้ เรากำลังเปิดตัว INT21: บริษัทแรกที่บรรลุการทำงานของฝูง AI Agent ที่สามารถปรับปรุงตัวเองได้ ซึ่งนำมาใช้กับโครงสร้างพื้นฐานของ AI
เลเยอร์ที่คนส่วนใหญ่ไม่เห็น
การสนทนาส่วนใหญ่เกี่ยวกับความก้าวหน้าของ AI นั้นมุ่งเน้นไปที่โมเดล แต่ทุกโมเดลต่างก็พึ่งพาเลเยอร์ที่มองเห็นได้น้อยกว่านั่นคือซอฟต์แวร์ที่บอก GPU ว่าต้องดำเนินการแต่ละอย่างอย่างไร
ซอฟต์แวร์นั้นมีผลกระทบอย่างมากต่อความเร็วและต้นทุน และยังสร้างได้ยากอีกด้วย การไปถึงประสิทธิภาพสูงสุดบน GPU ใหม่มักต้องอาศัยผู้เชี่ยวชาญที่เข้าใจทั้งอัลกอริทึมและฮาร์ดแวร์ในเชิงลึกเป็นพิเศษ
INT21 ถูกสร้างขึ้นมาเพื่อทำให้งานนั้นขยายขนาดได้มากขึ้น เราเรียกหมวดหมู่ใหม่นี้ว่า โครงสร้างพื้นฐานการประมวลผลที่ปรับปรุงตัวเองได้ (Self-Improving Compute Infrastructure)
ผลิตภัณฑ์แรกของเรา: PTX Kernel Factory
PTX Kernel Factory เป็นระบบ AI ที่สร้างและปรับปรุงซอฟต์แวร์สำหรับ GPU ของ NVIDIA ทีมงานจะกำหนดการทำงาน ข้อกำหนด และเกณฑ์วัดความสำเร็จ โรงงานจะเขียนโค้ดการทำงาน ทดสอบ วัดผลบนฮาร์ดแวร์เป้าหมาย เรียนรู้จากผลลัพธ์ และทำซ้ำอีกครั้ง
การใช้งาน 4 รายการแรกที่ผลิตโดย PTX Kernel Factory เป็นโอเพนซอร์สในวันนี้ ผลิตภัณฑ์ยังอยู่ในช่วงเบต้า โดยสามารถขอสิทธิ์เข้าถึงก่อนใครได้ที่ int21.ai
สำหรับปริมาณงาน AI ที่ทำงานบน GPU ของ NVIDIA แต่ละการทำงานของโมเดลจะกลายเป็นคำสั่งที่ฮาร์ดแวร์ดำเนินการในที่สุด เคอร์เนล GPU เป็นโปรแกรมขนาดเล็กที่เชี่ยวชาญซึ่งรับผิดชอบหนึ่งการทำงานดังกล่าว เช่น การทำให้เป็นมาตรฐาน (normalization) ความสนใจ (attention) หรือการย้ายข้อมูลผ่านหน่วยความจำ เคอร์เนลนับพันตัวทำงานอยู่เบื้องหลังทุกงานฝึกฝนและแอปพลิเคชัน AI
PTX เป็นภาษา GPU ระดับต่ำคล้ายแอสเซมบลีของ NVIDIA มันอยู่ระหว่างซอฟต์แวร์ GPU ระดับสูงกว่าและคำสั่งเครื่องขั้นสุดท้ายที่ฮาร์ดแวร์ดำเนินการ ทำให้มันเป็นหนึ่งในเลเยอร์ที่โปรแกรมได้ใกล้เคียงที่สุดในสแต็กของ NVIDIA
การทำงานในระดับนี้ให้การควบคุมที่แม่นยำว่าข้อมูลเคลื่อนที่ผ่านหน่วยความจำอย่างไร เธรดทำงานร่วมกันอย่างไร งานถูกซิงโครไนซ์เมื่อใด และคำสั่ง GPU เฉพาะใดที่ถูกใช้ ทางเลือกเหล่านั้นสามารถกำหนดได้ว่า GPU ที่มีราคาแพงจะใช้เวลาทำงานหรือรอคอย
วิศวกรน้อยคนนักที่จะสามารถเขียนและปรับ PTX ให้เหมาะสมได้ดี งานนี้ต้องการการผสมผสานที่หาได้ยากของความรู้ด้านอัลกอริทึม ความเชี่ยวชาญด้านสถาปัตยกรรม GPU ความเข้มงวดทางตัวเลข และสัญชาตญาณด้านประสิทธิภาพ เครื่องมือ ไลบรารี และคอมไพเลอร์ระดับสูงทำให้การพัฒนา GPU เข้าถึงได้สำหรับคนจำนวนมากขึ้น แต่เมื่อการทำงาน AI ใหม่ไม่มีโค้ดที่สมบูรณ์แบบ หรือเมื่อสิ่งที่เป็นนามธรรมที่มีอยู่ไม่สามารถไปถึงประสิทธิภาพที่ต้องการ ความเชี่ยวชาญระดับต่ำที่หายากนี้จึงกลายเป็นคอขวด
นอกจากนี้ยังยากเป็นพิเศษอีกด้วย เคอร์เนลอาจดูเหมือนถูกต้องแต่ล้มเหลวกับอินพุตหายากเพียงหนึ่งเดียว มันอาจเร็วสำหรับรูปร่างหนึ่งและช้าสำหรับอีกรูปร่างหนึ่ง มันอาจใช้รีจิสเตอร์มากเกินไป ย้ายข้อมูลมากเกินไป หรือทำงานได้ดีบน Hopper แต่ด้อยลงบน Blackwell แม้แต่วิศวกรผู้เชี่ยวชาญก็ต้องทดสอบหลายแนวคิด และแนวคิดเหล่านั้นส่วนใหญ่ก็ใช้ไม่ได้ผล ฮาร์ดแวร์แต่ละรุ่นเปลี่ยนส่วนหนึ่งของปัญหา
การรวมกันนั้นทำให้ PTX เป็นพื้นที่พิสูจน์แรกที่เหมาะสำหรับ INT21: มันมีความต้องการทางเทคนิคสูง มีความสำคัญทางเศรษฐกิจ และสามารถวัดผลได้อย่างเป็นกลาง เคอร์เนลที่สร้างขึ้นนั้นถูกต้องหรือไม่ มันเร็วกว่าหรือไม่
PTX Kernel Factory เปลี่ยนวงจรของผู้เชี่ยวชาญในการเขียน ทดสอบ วัดประสิทธิภาพ และปรับปรุงโค้ด GPU ระดับต่ำ ให้เป็นกระบวนการที่ทำงานได้อย่างต่อเนื่องและเรียนรู้จากผลลัพธ์ของมัน
PTX Kernel Factory ทำงานอย่างไร
อินเทอร์เฟซนั้นตั้งใจให้เรียบง่าย:
- อธิบายการทำงาน กำหนดว่าเคอร์เนลต้องทำอะไรและอินพุตใดที่ต้องรองรับ
- กำหนดข้อกำหนด จัดเตรียมการทดสอบความถูกต้อง ฮาร์ดแวร์เป้าหมาย และข้อจำกัดในการผสานรวมใดๆ
- กำหนดความสำเร็จ เลือกเมตริกประสิทธิภาพที่ระบบควรปรับให้เหมาะสม
จากนั้น โรงงานจะดำเนินกระบวนการทางวิศวกรรมระยะยาว มันสร้างโค้ดตัวเลือก รวบรวม ปฏิเสธผลลัพธ์ที่ไม่ถูกต้อง วัดประสิทธิภาพตัวเลือกที่ถูกต้อง และใช้หลักฐานเพื่อนำทางการทำงานรอบถัดไป
โค้ดที่เผยแพร่รวม CUDA C++ เข้ากับ inline PTX ทำให้ระบบควบคุมรายละเอียดฮาร์ดแวร์ที่เครื่องมือระดับสูงอาจซ่อนไว้โดยเจตนา แทนที่จะพึ่งพา Agent เพียงตัวเดียวในการผลิตคำตอบครั้งเดียว PTX Kernel Factory จะประสานงาน Agent AI หลายตัวในวงจรนี้
วิศวกรมนุษย์ยังคงกำหนดเป้าหมาย ข้อจำกัด และเกณฑ์การยอมรับ PTX Kernel Factory จะทำให้การค้นหาที่มีต้นทุนสูงระหว่างข้อกำหนดที่ชัดเจนและการใช้งานที่แข็งแกร่งเป็นไปโดยอัตโนมัติ
สิ่งที่เราหมายถึงโดยการปรับปรุงตัวเอง
Agent นักเขียนโค้ดสามารถผลิตคำตอบได้ แต่ระบบวิศวกรรมที่เชื่อถือได้ยังต้องสามารถระบุได้ว่าคำตอบนั้นใช้ได้หรือไม่ เข้าใจว่าทำไมความพยายามล้มเหลว และนำความรู้ที่เป็นประโยชน์ไปใช้ในความพยายามครั้งถัดไป
นั่นคือสิ่งที่เราหมายถึงโดยการปรับปรุงตัวเอง
ความพยายามส่วนใหญ่ในพื้นที่นี้มุ่งเน้นไปที่การปรับปรุง AI เองในลักษณะที่ปรับปรุงตัวเองได้ เรากำลังเดินในเส้นทางที่แตกต่างโดยพื้นฐาน โดยที่ฝูง Agent จะปรับปรุงโครงสร้างพื้นฐานที่พวกมันทำงานอยู่ให้ดีขึ้นเอง รักษาการควบคุมของมนุษย์ไว้ในขณะที่ยังคงเพิ่มประสิทธิภาพในการทำงานในทุก ๆ รอบการผลิต
ความท้าทายนั้นไม่เกี่ยวกับการผลิตเคอร์เนลที่เป็นไปได้สักตัวหนึ่งเท่านั้น แต่เกี่ยวกับการสร้างระบบที่สามารถปฏิเสธความพยายามที่ผิดพลาด เปราะบาง หรือทำให้เข้าใจผิดนับพัน ๆ ครั้ง เก็บรักษาบทเรียนไม่กี่บทที่สำคัญ และปรับปรุงต่อไปโดยไม่เบี่ยงเบนไปจากความถูกต้อง
PTX Kernel Factory ไม่ได้ปฏิบัติกับการสร้างแต่ละครั้งเป็นพรอมต์ใหม่ มันรักษาการค้นพบที่เป็นประโยชน์จากการทดลองที่สำเร็จและล้มเหลว ทำให้งานต่อมาสามารถสร้างจากหลักฐานก่อนหน้านี้ได้ เป้าหมายคือการปรับปรุงกระบวนการที่ผลิตโค้ด
นี่คือวิธีที่ประสิทธิภาพของโรงงานเพิ่มขึ้นแบบทบต้นเมื่อเวลาผ่านไป แต่ละรุ่นเริ่มต้นด้วยหลักฐานมากขึ้นเกี่ยวกับสิ่งที่ได้ผล สิ่งที่ล้มเหลว และทิศทางใดที่ควรค่าแก่การสำรวจ
วิทยานิพนธ์ที่กว้างขึ้นของเราคือ:
ใช้การประมวลผลเพื่อปรับปรุงการประมวลผล
ความฉลาดไม่ใช่แค่สิ่งที่โมเดลรู้เท่านั้น มันคือความสามารถในการค้นหา ทดสอบ จดจำ แก้ไข และปรับปรุง เราเชื่อว่าระบบที่ทำให้ความสามารถเหล่านั้นสะสมกันได้ จะกลายเป็นส่วนสำคัญของโครงสร้างพื้นฐานการประมวลผลในอนาคตและวิวัฒนาการการปรับปรุงตัวเองในวงกว้างของ AI
หลักฐานแรกของเรา: ปริมาณงาน AI ที่แตกต่างกันสองอย่าง
สำหรับการเผยแพร่สู่สาธารณะครั้งแรก เราเลือกปริมาณงานสองอย่างที่ทดสอบความสามารถที่แตกต่างกัน
RMSNorm เป็นการทำงานทั่วไปที่ใช้ในโมเดลภาษาสมัยใหม่ มันเป็นเรื่องที่เติบโตเต็มที่ เป็นที่เข้าใจอย่างกว้างขวาง และมีการใช้งานที่เขียนโดยมนุษย์ที่แข็งแกร่งอยู่แล้ว มันทดสอบว่าโรงงานสามารถแข่งขันกับงานที่กำหนดไว้แล้วได้หรือไม่
Kimi Delta Attention (KDA) เป็นกลไกความสนใจที่ใหม่กว่า มันมีความเฉพาะทางมากขึ้นและมีรูปแบบการทำงานที่กำหนดไว้น้อยกว่า มันทดสอบว่าโรงงานสามารถปรับตัวให้เข้ากับปริมาณงานวิจัยที่ใหม่กว่าได้อย่างรวดเร็วหรือไม่
เราเปรียบเทียบการใช้งานที่สร้างขึ้นกับพื้นฐานที่มนุษย์สร้างขึ้นและปรับให้เหมาะสมที่สุด: QuACK สำหรับ RMSNorm และ FlashKDA ที่ใช้ CUTLASS สำหรับ KDA การเปรียบเทียบดำเนินการบนฮาร์ดแวร์เดียวกันโดยมีการตรวจสอบความถูกต้องก่อนการจับเวลา
ไฮไลท์การวัดประสิทธิภาพ
ปริมาณงาน
ฮาร์ดแวร์
ผลลัพธ์เทียบกับพื้นฐานของผู้เชี่ยวชาญ
KDA
NVIDIA GH200, Hopper
เร็วขึ้น 1.24x ถึง 1.59x ใน 6 สถานการณ์ความยาวคงที่และแปรผัน
KDA
NVIDIA B200, Blackwell
เร็วขึ้น 1.42x ผ่านอินเทอร์เฟซสาธารณะมาตรฐาน และ 1.52x ในการทำงานที่ผสานรวมอย่างเหมาะสม
RMSNorm
NVIDIA GH200, Hopper
เร็วกว่า 8.17% ในค่าเฉลี่ยเรขาคณิตจาก 11 กรณีไปข้างหน้า โดยใช้รูปแบบ AI 16-bit ทั่วไป เร็วกว่า 15% ถึง 34% ในกรณีย้อนกลับที่เลือก
RMSNorm
NVIDIA B200, Blackwell
เร็วขึ้นในทุก 126 กรณีที่เปรียบเทียบได้ทั่วเมทริกซ์การวัดประสิทธิภาพเริ่มต้น
สิ่งเหล่านี้เป็นผลการวัดประสิทธิภาพระดับโอเปอเรเตอร์ ไม่ใช่การอ้างสิทธิ์การเร่งความเร็วทั้งโมเดล ผลกระทบต่อแอปพลิเคชันขึ้นอยู่กับโมเดล ปริมาณงาน รูปร่าง สแต็กซอฟต์แวร์ และเวลาทั้งหมดที่ใช้ในการทำงานที่ปรับให้เหมาะสม
เรายังรายงานผลลัพธ์ที่ไม่ค่อยดีนักด้วย ในเมทริกซ์ RMSNorm ของ Hopper รูปแบบตัวเลขอีกรูปแบบหนึ่งมีการลดลงเล็กน้อย กรณีที่ช้าที่สุดอยู่ต่ำกว่า QuACK 0.42% และ 0.84% เราต้องการเผยแพร่ขอบเขตของผลลัพธ์มากกว่าซ่อนไว้เบื้องหลังตัวเลขที่น่าพอใจเพียงตัวเดียว
ความถูกต้องมาก่อนความเร็ว
เคอร์เนลที่เร็วไม่มีประโยชน์ถ้ามันเปลี่ยนผลลัพธ์หรือล้มเหลวกับอินพุตจริง
ดังนั้นทุกการเปรียบเทียบประสิทธิภาพจึงเริ่มต้นด้วยความถูกต้อง:
- การใช้งาน B200 KDA ผ่านการทดสอบอัปสตรีมทั้งหมด 580 รายการ
- การใช้งาน Hopper KDA ผ่านการทดสอบอัปสตรีม 584 รายการและการทดสอบแพ็คเกจ 235 รายการบนระบบ GH200 ที่ตรวจสอบแล้ว
- การใช้งาน RMSNorm ผ่านชุดแพ็คเกจที่สมบูรณ์บนฮาร์ดแวร์ที่ตรวจสอบแล้ว: 48 การทดสอบบวก 65 การทดสอบย่อยบน GH200 และ 66 การทดสอบบน B200
ชุดทดสอบครอบคลุมประเภทข้อมูลที่แตกต่างกัน ขนาดอินพุต ลำดับความยาวคงที่และแปรผัน สถานะที่ไม่จำเป็น เส้นทางไปข้างหน้าและย้อนกลับที่รองรับ และกรณีขอบที่ยาก
การวัดประสิทธิภาพยังคงขึ้นอยู่กับสภาพแวดล้อมได้ ดังนั้นแต่ละพื้นที่เก็บข้อมูลจึงรวมซอร์สโค้ด คำสั่งทดสอบ วิธีการวัด เวอร์ชันซอฟต์แวร์ และรายงานดิบหรือที่สร้างขึ้นซึ่งจำเป็นในการตรวจสอบและทำซ้ำผลลัพธ์
ทำไมต้องเริ่มที่นี่
เคอร์เนล GPU เป็นการทดสอบครั้งแรกที่มีประโยชน์สำหรับแนวทางของเราเพราะผลตอบรับนั้นไม่มีความปรานี
ผลลัพธ์ถูกต้องหรือไม่ การใช้งานเร็วกว่าหรือไม่ การเปลี่ยนแปลงสามารถคอมไพล์ ทดสอบ และวัดผลได้ ความก้าวหน้าจะยึดหลักฐาน ไม่ใช่ตัดสินจากข้อความที่สร้างขึ้นฟังดูน่าเชื่อถือแค่ไหน
การปรับแต่งเคอร์เนลยังตั้งอยู่ที่คอขวดที่สำคัญ โมเดล AI กำลังพัฒนาอย่างรวดเร็ว ฮาร์ดแวร์เปลี่ยนไปทุกรุ่น และอุปทานของความเชี่ยวชาญในการปรับแต่งระดับต่ำไม่สามารถเติบโตในอัตราเดียวกันได้
การเปลี่ยนงานเหล่านี้ให้เป็นระบบที่ทำซ้ำได้มากขึ้นสามารถช่วยทีมงาน:
- นำการทำงานของโมเดลใหม่มาสู่การผลิตได้เร็วขึ้น
- ใช้ประโยชน์จาก GPU รุ่นใหม่ได้ดีขึ้น
- สำรวจแนวคิดการปรับแต่งที่อาจมีต้นทุนสูงเกินไปที่จะทดสอบด้วยตนเอง
- สงวนเวลาของผู้เชี่ยวชาญสำหรับการตัดสินใจด้านสถาปัตยกรรม ข้อกำหนด และระดับระบบ
นี่ไม่ใช่การกำจัดวิศวกร มันคือการให้ผู้เชี่ยวชาญจำนวนน้อยมีอำนาจมากขึ้น
การเปิดซอร์สสิ่งประดิษฐ์จากโรงงาน 4 รายการแรก
วันนี้ เรากำลังเผยแพร่:
- Int21-AI/KDA-B200: Kimi Delta Attention สำหรับ Blackwell ตรวจสอบบน NVIDIA B200
- Int21-AI/KDA-H100: Kimi Delta Attention สำหรับ Hopper ตรวจสอบบน NVIDIA GH200
- Int21-AI/RMSNorm-B200: RMSNorm สำหรับ Blackwell ตรวจสอบบน NVIDIA B200
- Int21-AI/RMSNorm-H100: RMSNorm สำหรับ Hopper ตรวจสอบบน NVIDIA GH200
เรากำลังเผยแพร่โค้ดเพราะการอ้างสิทธิ์ด้านประสิทธิภาพควรตรวจสอบได้ นักพัฒนาควรสามารถอ่านโค้ด รันการทดสอบ ทำซ้ำการวัดประสิทธิภาพ และท้าทายผลลัพธ์ได้
การเผยแพร่เหล่านี้ไม่ใช่ผลิตภัณฑ์สุดท้าย พวกมันเป็นหลักฐานสาธารณะครั้งแรกว่าโรงงานสามารถผลิตซอฟต์แวร์ระดับต่ำที่มีประโยชน์ในปริมาณงานที่กำหนดไว้และที่เพิ่งเกิดขึ้น และข้ามฮาร์ดแวร์ NVIDIA สองรุ่น
เกี่ยวกับเรา
INT21 ก่อตั้งโดย Bing Xu ในเดือนเมษายน 2026 ในฐานะบริษัทที่เกิดจาก AI สร้างขึ้นบนแนวคิดง่ายๆ: ความสามารถทางวิศวกรรมของบริษัทควรขยายขนาดตามการประมวลผล
Bing เป็นผู้ร่วมเขียนบทความ Generative Adversarial Nets ต้นฉบับ เป็นผู้สร้างดั้งเดิมของแพ็คเกจ Python ของ XGBoost และเป็นผู้ร่วมสร้าง MXNet และ AITemplate
ในเดือนกุมภาพันธ์ 2025 เขาเป็นผู้ร่วมเขียนงาน早期ของ NVIDIA เกี่ยวกับการสร้างเคอร์เนล GPU แบบ Agent โดยใช้โมเดลการให้เหตุผลและการปรับขนาดอนุมานเพื่อสร้างและปรับแต่งเคอร์เนลความสนใจ ก่อน INT21 Bing เป็น Distinguished Engineer ที่ NVIDIA เขาเข้าร่วม NVIDIA หลังจากที่บริษัทซื้อ HippoML ซึ่งเป็นสตาร์ทอัพระบบอนุมาน GPU ที่เขาร่วมก่อตั้งและดำรงตำแหน่ง CEO
ยุคใหม่แห่งการประมวลผล
PTX Kernel Factory อยู่ในช่วงเบต้าสำหรับทีมที่สร้างโมเดล AI ระบบอนุมาน แพลตฟอร์มฝึกฝน และผลิตภัณฑ์ที่ใช้ GPU อื่นๆ
จุดเริ่มต้นอาจเป็นการทำงานที่ช้าเกินไป สถาปัตยกรรมใหม่ที่ไม่มีเคอร์เนลที่สมบูรณ์แบบ หรือปริมาณงานสำคัญที่ยังไม่สมควรได้รับเวลาของผู้เชี่ยวชาญหลายสัปดาห์ ทีมงานจัดหาปัญหาและคำจำกัดความของความสำเร็จ โรงงานจะรับหน้าที่ค้นหา
PTX Kernel Factory ยังเป็นก้าวแรกในทิศทางที่ใหญ่กว่าสำหรับ INT21 และสำหรับอุตสาหกรรมในวงกว้าง
โครงสร้างพื้นฐานการประมวลผลส่วนใหญ่ในปัจจุบันเป็นแบบคงที่: คนเขียนมัน ปรับให้เหมาะสม และกลับมาแก้ไขเมื่อข้อกำหนดหรือฮาร์ดแวร์เปลี่ยนแปลง ระบบ AI สามารถสร้างผลลัพธ์ที่น่าประทับใจ แต่การนำไปใช้ในการผลิตอย่างเชื่อถือได้ในขนาดใหญ่ยังคงเป็นปัญหาที่ยังไม่ได้รับการแก้ไขเป็นส่วนใหญ่
เราเชื่อว่าโครงสร้างพื้นฐานนั้นจะปรับตัวได้มากขึ้น มันจะทดสอบงานของตัวเอง รักษาสิ่งที่เรียนรู้ไว้ และปรับปรุงวิธีแก้ปัญหาต่อไป
เรากำลังเริ่มต้นด้วยหนึ่งในเลเยอร์ที่ยากที่สุดและวัดผลได้มากที่สุดของสแต็ก ความรู้ของมนุษย์ไม่สามารถขยายขนาดได้ แต่ฝูง Agent สามารถเก่งขึ้นเรื่อย ๆ กับทุกการรัน โครงสร้างพื้นฐานการประมวลผลที่ปรับปรุงตัวเองได้คือการเปลี่ยนแปลงพื้นฐานในวิธีการสร้าง AI
อธิบายเคอร์เนล กำหนดความสำเร็จ ปล่อยให้โรงงานปรับปรุงการทำงาน





