"โลกคือทุกสิ่งที่เป็นอยู่จริง" — ลุดวิก วิตเกนสไตน์,
Tractatus Logico-Philosophicus
, ค.ศ. 1921
โลกไม่ได้สร้างมาจากคำพูด
ในบทความก่อนหน้านี้ เราได้โต้แย้งว่าความฉลาดเชิงพื้นที่คือขอบเขตถัดไปของ AI และแบบจำลองโลกคือเส้นทางไปสู่สิ่งนั้น ที่นี่ ทีม World Labs และผมต้องการลงลึกไปอีกขั้น: จากหลายสิ่งที่กำลังถูกสร้างและเรียกว่า "แบบจำลองโลก" นั้น ชิ้นส่วนฟังก์ชันใดบ้างที่ประกอบเป็นความสามารถนั้น — และแต่ละชิ้นมีไว้เพื่ออะไร?
แบบจำลองภาษาได้ให้เครื่องจักรมีความสามารถในการควบคุมแนวคิด คำศัพท์ และการใช้เหตุผลอย่างยอดเยี่ยม แต่โลกทางกายภาพ ไม่ว่าจะเสมือนหรือจริง ทำงานบนรากฐานที่แตกต่าง ในขณะที่แบบจำลองภาษาเรียนรู้โครงสร้างทางสถิติของข้อความ แบบจำลองโลกเรียนรู้โครงสร้างทางสถิติของพื้นที่และเวลา: แสงตกกระทบพื้นผิวอย่างไร สวนดูเป็นอย่างไรจากมุมที่ไม่มีกล้องใดเคยบันทึก วัตถุตอบสนองต่อแรงและปฏิบัติตามกฎฟิสิกส์อย่างไร
นั่นทำให้ "แบบจำลองโลก" เป็นหนึ่งในคำศัพท์ที่สำคัญที่สุดและมีความหมายมากเกินไปใน AI ในปัจจุบัน คอมพิวเตอร์วิทัศน์ หุ่นยนต์ การเรียนรู้แบบเสริมกำลัง และ AI เชิงสร้างสรรค์ต่างก็อ้างว่ากำลังสร้างแบบจำลองโลก และแต่ละสาขาก็มีความหมายที่แตกต่างกัน แบบจำลองวิดีโอที่สร้างเปลวไฟที่สวยงามแต่เป็นไปไม่ได้ในทางฟิสิกส์ แบบจำลองภาษาที่ปรับปรุงเกมที่เล่นได้ และเอนจินฟิสิกส์ที่จำลองการเผาไหม้อย่างเที่ยงตรง ล้วนถูกเรียกว่าชื่อเดียวกัน
ชาวกรีกโบราณไม่เคยตกลงกันได้ว่าโลกประกอบด้วยอะไร ไม่ว่าจะเป็นไฟ น้ำ หรืออะตอมที่แบ่งแยกไม่ได้ เพราะ "โลก" ไม่เคยเป็นสิ่งเดียว มันเป็นเพียงตัวแทนของความสมบูรณ์ที่นักคิดแต่ละคนต้องการใช้ในการใช้เหตุผล AI ได้รับมรดกปัญหาเดียวกันนี้ ในเวลาที่สาขานี้ต้องการความแม่นยำอย่างที่สุด
วงรอบภายใต้การจัดหมวดหมู่
การฝ่าความสับสนนี้เริ่มต้นด้วยแผนภาพที่เก่าแก่กว่าเทคโนโลยีใดๆ ที่เป็นปัญหา ตำราการเรียนรู้แบบเสริมกำลัง รวมถึง Sutton และ Barto ฉบับมาตรฐาน ใช้ภาพเดียวกันในรูปแบบต่างๆ มานานหลายทศวรรษเพื่ออธิบายว่าเอเจนต์โต้ตอบกับโลกอย่างไร ชื่อทางการของภาพนี้คือกระบวนการตัดสินใจของมาร์คอฟที่สังเกตได้บางส่วน หรือ POMDP และคำจำกัดความดั้งเดิมของคำว่า "แบบจำลองโลก" เป็นของขนบธรรมเนียมนั้น
เอเจนต์ ซึ่งอาจเป็นบุคคล หุ่นยนต์ หรือระบบซอฟต์แวร์ กระทำการต่างๆ การกระทำเหล่านั้นส่งผลต่อสถานะของโลก เอเจนต์ไม่เคยเห็นสถานะโดยตรง สิ่งที่ไปถึงเอเจนต์คือการสังเกต: โฟตอนที่ตกกระทบจอตา ค่าที่อ่านได้จากเซนเซอร์ และพิกเซลในเฟรมวิดีโอ การสังเกตใหม่ๆ นำไปสู่การกระทำใหม่ๆ และวงรอบก็ดำเนินต่อไป
คำว่า "สถานะ" ต้องการการอธิบายเพิ่มเติม เพราะความหมายเปลี่ยนไปในแต่ละสาขา นี่ไม่ใช่สถานะของนักเคมี ความแตกต่างระหว่างของแข็ง ของเหลว และแก๊ส นี่คือสถานะของนักฟิสิกส์และนักหุ่นยนต์: คำอธิบายที่สมบูรณ์ของสิ่งที่เกิดขึ้นในโลกในขณะหนึ่ง รวมถึงทุกวัตถุ ทุกตำแหน่ง ทุกความเร็ว ทุกคุณสมบัติ สถานะคือความจริงพื้นฐานของโลก สมบูรณ์ในหลักการ แต่ไม่เคยเห็นโดยตรงจากเอเจนต์ใดๆ ที่อยู่ภายใน การสังเกตคือมุมมองบางส่วนของเอเจนต์ต่อความจริงนั้น การกระทำคือสิ่งที่เอเจนต์ทำตอบสนอง
วงรอบนี้ — จากเอเจนต์ไปสู่การกระทำ ไปสู่สถานะ ไปสู่การสังเกต และกลับมา — คือโครงสร้างที่ให้คำว่า "แบบจำลองโลก" สมัยใหม่มีความหมายทางเทคนิค วลีนี้เก่าแก่กว่านั้น สืบย้อนไปถึงข้อเสนอของ Kenneth Craik ในปี 1943 ที่ว่าจิตใจใช้เหตุผลโดยการรัน "แบบจำลองขนาดเล็ก" ของความเป็นจริง และถูกนำเข้าสู่โครงข่ายประสาทเทียมในช่วงปลายทศวรรษ 1980 และต้นทศวรรษ 1990 และวงรอบนี้ยังอธิบายสิ่งที่ผู้คนหมายถึงโดยคำนี้ในปัจจุบันด้วย สิ่งต่างๆ ที่ถูกเรียกว่าแบบจำลองโลกในตอนนี้ จริงๆ แล้วคือภาพฉายที่แตกต่างกันของวงรอบเดียวกัน แต่ละอย่างส่งออกส่วนที่แตกต่างกันของมัน
สามหน้าที่ของแบบจำลองโลก
แบบจำลองโลกประเภทแรกคือตัวเรนเดอร์ ตัวเรนเดอร์ส่งออกการสังเกตในรูปแบบพิกเซลสำหรับสายตามนุษย์ และคุณภาพที่สำคัญที่สุดคือความเที่ยงตรงทางภาพ แบบจำลองวิดีโอที่เปลี่ยนข้อความแจ้งให้เป็นช็อตโดรนแบบภาพยนตร์คือตัวเรนเดอร์ เช่นเดียวกับระบบโต้ตอบอย่าง Genie 3 ของ Google หรือ RTFM ของ World Labs ที่แบบจำลองสร้างเฟรมแบบเรียลไทม์ตามอินพุตของผู้ใช้ แบบจำลองไม่มีความเข้าใจโครงสร้างสามมิติอย่างชัดเจน มันสร้างสิ่งที่ผู้ชมจะเห็น ไม่ใช่สิ่งที่เป็นจริง ตึกในช็อตโดรนอาจดูสมบูรณ์แบบจากด้านบน แต่ลองขับรถผ่านเมืองด้านล่างแล้วมันจะพังทลาย
ประเภทที่สองคือตัวจำลอง ตัวจำลองส่งออกสถานะ: การนำเสนอที่เที่ยงตรงทางเรขาคณิต ฟิสิกส์ หรือพลศาสตร์ของโลก ที่มนุษย์และโปรแกรมคอมพิวเตอร์สามารถคำนวณและโต้ตอบได้ ในขณะที่สัญญาของตัวเรนเดอร์เป็นเพียงภาพ สัญญาของตัวจำลองคือโครงสร้าง ต้องการเรขาคณิตที่คงทนภายใต้การตรวจสอบ ฟิสิกส์ที่เคารพกฎของนิวตัน และพลศาสตร์ที่ประพฤติตามวิธีที่โลกจำเป็นต้องประพฤติตามกฎฟิสิกส์ ตัวจำลองให้บริการผู้บริโภคสองกลุ่มพร้อมกัน ผู้เชี่ยวชาญที่เป็นมนุษย์ เช่น สถาปนิก นักออกแบบ ผู้สร้างภาพยนตร์ และนักพัฒนาเกม ต้องการความแม่นยำมากกว่าความสมจริงทางภาพ โปรแกรมคอมพิวเตอร์ เช่น เอเจนต์การเรียนรู้แบบเสริมกำลัง ตัวควบคุมหุ่นยนต์ และยานพาหนะไร้คนขับ ใช้ตัวจำลองเป็นพื้นที่ฝึกซ้อมที่พวกเขาสามารถโต้ตอบกับโลกในวงกว้าง ทดสอบสถานการณ์ที่อาจเป็นอันตราย มีค่าใช้จ่ายสูง หรือเป็นไปไม่ได้ที่จะดำเนินการในโลกจริง
ประเภทที่สามคือตัววางแผน ตัววางแผนส่งออกการกระทำ เมื่อได้รับการสังเกตและเป้าหมาย ตัววางแผนจะตอบคำถามว่าตัวแทนควรทำอะไรต่อไป โดยหลายวิธีแล้ว นี่คือสิ่งที่ตรงกันข้ามกับตัวเรนเดอร์ ในขณะที่ตัวเรนเดอร์รับการกระทำเป็นอินพุตและสร้างการสังเกต ตัววางแผนรับการสังเกตเป็นอินพุตและสร้างการกระทำ ปิดวงรอบการรับรู้-การกระทำ แบบจำลองวิทัศน์-ภาษา-การกระทำ ระบบที่ใช้แบบจำลอง และคลื่นลูกใหม่ของ World Action Models ล้วนเป็นความพยายามในการสร้างตัววางแผน: ระบบที่สามารถตัดสินใจว่าหุ่นยนต์ควรทำอะไรในโลกที่ไม่มีโครงสร้าง
สามหมวดหมู่นี้อธิบายสิ่งที่กำลังถูกส่งออกจริงในปัจจุบันเป็นส่วนใหญ่ และความแตกต่างระหว่างหมวดหมู่เหล่านี้มีประโยชน์ในทางปฏิบัติ อย่างไรก็ตาม หมวดหมู่เหล่านี้ไม่ได้แยกจากกันโดยพื้นฐาน ความรู้พื้นฐานเดียวกันเกี่ยวกับการทำงานของโลก—เรขาคณิต ฟิสิกส์ พลศาสตร์—อยู่ภายใต้ทั้งหมด แบบจำลองที่สามารถเรนเดอร์ถ้วยจากทุกมุม ตามหลักการแล้ว ควรจะสามารถจำลองสิ่งที่เกิดขึ้นเมื่อถ้วยถูกผลัก และวางแผนให้มือหยิบถ้วยขึ้นมาได้ งานวิจัยที่น่าสนใจที่สุดในปัจจุบันกำลังทำให้เส้นแบ่งระหว่างทั้งสามเลือนลางลงโดยเจตนา
GIF
เหตุใดการจำลองจึงเป็นกุญแจสำคัญ
ในสามหมวดหมู่ ตัวจำลองได้รับความสนใจจากสาธารณชนน้อยที่สุด และเป็นหมวดหมู่ที่ส่งผลกระทบมากที่สุด บทความนี้กล่าวถึงความไม่สมดุลนี้
ตัวเรนเดอร์เป็นหมวดหมู่ที่เติบโตในเชิงพาณิชย์มากที่สุด ผลิตภัณฑ์สร้างภาพจากข้อความหรือข้อความเป็นวิดีโอจำนวนมากกำลังขยายตัวในตลาดผู้บริโภคหรือองค์กรอย่างรวดเร็ว แบบจำลอง Nano Banana ของ Google ทำให้การสร้างภาพคุณภาพระดับตัวเรนเดอร์อยู่ในมือของผู้ใช้หลายร้อยล้านคน เทคโนโลยีมีจริง และตลาดก็มีจริง อย่างไรก็ตาม ตัวเรนเดอร์ปรับให้เหมาะสมกับความสมจริงทางภาพมากกว่าความแม่นยำทางกายภาพ และข้อจำกัดนั้นมีความสำคัญ ผลลัพธ์ของมันสวยงาม แต่ไม่สามารถไว้วางใจให้ออกแบบอาคารหรือฝึกหุ่นยนต์ได้
ตัววางแผนเป็นหมวดหมู่ที่น่าสนใจที่สุดและยังอยู่ในวัยเริ่มต้นมากที่สุด เชื่อมโยงอย่างใกล้ชิดกับสาขาการเรียนรู้ของหุ่นยนต์ที่กำลังพัฒนาอย่างรวดเร็ว สาขานี้ได้ผลิตการสาธิตหุ่นยนต์ในช่วงสองปีที่ผ่านมาซึ่งดูน่าประทับใจในวิดีโอ แต่จำเป็นต้องมีความตรงไปตรงมาเกี่ยวกับสิ่งที่การสาธิตเหล่านั้นแสดงจริง เกือบทั้งหมดจำกัดอยู่ในการตั้งค่าห้องปฏิบัติการที่มีข้อจำกัดสูง มีชุดวัตถุแคบและกรอบเวลางานสั้น ไม่มีการสาธิตใดที่ได้รับการตรวจสอบความถูกต้องในระดับความซับซ้อน ความแปรปรวน หรือระยะเวลาที่การนำไปใช้ในโลกจริงต้องการ ช่องว่างระหว่างตัวอย่างรีลที่น่าสนใจกับหุ่นยนต์ที่ทำงานได้อย่างน่าเชื่อถือในห้องครัว คลังสินค้า หรือห้องผ่าตัดยังคงกว้างใหญ่ อย่างไรก็ตาม การเดิมพันเชิงพาณิชย์ยังคงมีขนาดใหญ่ คลื่นของผู้เข้าแข่งขันที่ได้รับทุนหนาแน่นกำลังแข่งกันส่งมอบระบบวางแผนทั่วไป ในขณะที่ผู้เล่นโครงสร้างพื้นฐานรายใหญ่ที่สุดกำลังวางตำแหน่งการวางแผนให้อยู่เหนือกองซ้อนการจำลองที่กว้างขึ้น หุ่นยนต์ที่สามารถวางแผนได้คือหุ่นยนต์ที่สามารถทำงานได้ และทั้งอุตสาหกรรมกำลังแข่งกันเป็นรายแรกที่ไปถึงจุดนั้น
การจำลองคือสะพานเชื่อมระหว่างทั้งสอง หากภาษาเป็นนามธรรมของโลก และพิกเซลเป็นภาพฉายของมัน แล้วเรขาคณิต ฟิสิกส์ และพลศาสตร์ก็คือโลกเอง ตัวจำลองต้องทำงานในระดับนั้น: กระดูกสันหลังเชิงโครงสร้างที่ทั้งรูปลักษณ์ทางภาพ (สำหรับตัวเรนเดอร์) และผลที่ตามมาของการกระทำ (สำหรับตัววางแผน) สามารถได้มาจากมัน
แบบจำลองที่เชี่ยวชาญการจำลองสามารถฉายความเข้าใจของมันไปยังพิกเซลสำหรับการบริโภคของมนุษย์ และไปยังการทำนายการกระทำสำหรับเอเจนต์ที่มีร่างกาย แบบจำลองที่เชี่ยวชาญเพียงการเรนเดอร์ หรือเพียงการวางแผน ไม่สามารถทำอย่างใดอย่างหนึ่งได้ พื้นที่ผิวเชิงพาณิชย์นั้นมหาศาล NVIDIA Omniverse เพียงอย่างเดียวกำหนดเป้าหมายตลาดที่บริษัทประเมินว่ามากกว่าหนึ่งล้านล้านดอลลาร์ในโรงงาน คลังสินค้า ห่วงโซ่อุปทาน และดิจิทัลทวิน การฝึกหุ่นยนต์ การทดสอบยานพาหนะไร้คนขับ การสร้างภาพทางสถาปัตยกรรม วิศวกรรม และการค้นพบยา ล้วนขึ้นอยู่กับสิ่งที่อยู่ในรูปร่างของการจำลอง
ปัญหาที่ยากที่สุดที่ยังไม่ได้รับการแก้ไขในสาขานี้ก็อยู่ที่นั่นเช่นกัน ข้อมูลสามมิติที่มีเรขาคณิต คุณสมบัติของวัสดุ และคำอธิบายประกอบทางกายภาพอย่างชัดเจน มีความขาดแคลนมากกว่าวิดีโออินเทอร์เน็ตที่ตัวเรนเดอร์ฝึกด้วยหลายเท่า ช่องว่างระหว่างของจำลองกับของจริง (sim-to-real gap) ซึ่งคือความแตกต่างระหว่างวิธีที่สิ่งต่างๆ ประพฤติในการจำลองกับวิธีที่มันประพฤติในความเป็นจริง ยังคงอยู่ ตัวจำลองเชิงสร้างสรรค์เพิ่มความเสี่ยงใหม่เหนือสิ่งนั้น: เรขาคณิตที่สร้างโดย AI อาจดูถูกต้อง แต่มีจุดตัดในตัวเองหรือสัดส่วนที่ผิดซึ่งก่อให้เกิดฟิสิกส์ที่ไร้เหตุผล การจำลองหลายฟิสิกส์ในวงกว้าง ซึ่งวัตถุแข็ง วัตถุที่เปลี่ยนรูปได้ ของไหล และผ้าล้วนมีปฏิสัมพันธ์กัน ยังคงมีราคาแพงกว่าการจำลองโดเมนเดียวหลายเท่า
ที่ World Labs Marble คือก้าวแรกของเราในดินแดนนี้ มันรับคำสั่งหลายรูปแบบ (ข้อความ ภาพ วิดีโอ หรือภาพร่างเชิงพื้นที่) และสร้างสภาพแวดล้อม 3 มิติที่สามารถสำรวจได้ โดยส่งออก Gaussian splats สำหรับการสำรวจทางภาพควบคู่ไปกับตาข่ายชนที่เอนจินฟิสิกส์สามารถทำงานได้ แต่ Marble เป็นเพียงบทแรกของเส้นทางที่ยาวนานกว่ามากที่กำลังถูกเขียนขึ้นทั่วทั้งสาขา ขณะที่เส้นแบ่งระหว่างการเรนเดอร์ การจำลอง และการวางแผนเริ่มล่มสลาย
จุดที่เส้นแบ่งกำลังล่มสลายและสิ่งที่จะเกิดขึ้นต่อไป
แต่ยังมีอะไรอีกมากมายที่กำลังจะมาถึง รูปแบบที่สำคัญที่สุดในสาขานี้ในตอนนี้คือสามหมวดหมู่กำลังเริ่มผสมผสานเข้าหากัน ข้อมูลเชิงลึกร่วมกันคือความรู้ที่จำเป็นในการเรนเดอร์โลก จำลองมัน และกระทำในมัน ส่วนใหญ่แล้วเป็นสิ่งเดียวกัน จากตัวอย่างก่อนหน้านี้ แบบจำลองที่เข้าใจอย่างแท้จริงว่าถ้วยวางบนโต๊ะอย่างไร (เรขาคณิต คุณสมบัติของวัสดุ การตอบสนองต่อแรง ฯลฯ) ควรจะสามารถเรนเดอร์ถ้วยนั้นจากทุกมุม จำลองสิ่งที่เกิดขึ้นเมื่อถ้วยถูกผลัก และวางแผนให้มือหยิบถ้วยขึ้นมาได้ สามหมวดหมู่คือภาพฉายสามภาพของความเข้าใจพื้นฐานเดียวเดียวกัน
ตัวอย่างเช่น: งานล่าสุดจำนวนเล็กน้อยแต่เพิ่มขึ้นจากห้องปฏิบัติการหุ่นยนต์ต่างๆ ได้แสดงให้เห็นว่า—อย่างน้อยในเชิงแนวคิด—ตัวเรนเดอร์วิดีโอที่ได้รับการฝึกฝนล่วงหน้าสามารถใช้เป็นแกนหลักสำหรับการทำนายโลกร่วมกับการกระทำ ซึ่งชี้ให้เห็นถึงสะพานเชื่อมระหว่างตัวเรนเดอร์และตัววางแผน โดยให้แบบจำลองเดียวจินตนาการว่าจะเกิดอะไรขึ้นและควรทำอะไร Marble ของ World Labs ส่งออก Gaussian splats และตาข่ายชนจากแบบจำลองเดียวอยู่แล้ว ทำให้เส้นแบ่งระหว่างตัวเรนเดอร์และตัวจำลองสลายไป ทุกระดับกำลังเคลื่อนที่จากเอาต์พุตแบบพาสซีฟไปสู่ระบบโต้ตอบ โดยตัวเรนเดอร์กลายเป็นแบบปรับตามการกระทำ ตัวจำลองสร้างโลกที่ควบคุมและแก้ไขได้มากขึ้น และตัววางแผนไตร่ตรองมากกว่าแค่ตอบสนอง
จุดสิ้นสุดเชิงตรรกะคือแบบจำลองโลกรวม: แบบจำลองพื้นฐานเดียวที่สามารถเรนเดอร์มุมมองเหมือนจริง ผลิตโครงสร้างที่แม่นยำทางกายภาพ และวางแผนลำดับการกระทำ สลับระหว่างรูปแบบเอาต์พุตตามความต้องการของผู้บริโภคปลายทาง เรายังคงเผชิญกับความท้าทายที่น่ากังวลหลายประการ ภาพรวมของข้อมูลไม่เท่ากัน โดยตัวเรนเดอร์มีวิดีโออินเทอร์เน็ตมากมาย ในขณะที่ตัวจำลองและตัววางแผนประสบปัญหาการขาดแคลนทรัพย์สิน 3 มิติและการสาธิตหุ่นยนต์อย่างรุนแรง การปรับให้เหมาะสมกับความงามทางภาพสามารถเสียสละความแม่นยำที่หุ่นยนต์หรือการจำลองความเที่ยงตรงสูงต้องการ การประนีประนอมความตึงเครียดเหล่านี้ภายในสถาปัตยกรรมเดียวคือปัญหาที่เปิดกว้างที่สุดในงานวิจัยแบบจำลองโลกในปัจจุบัน และนี่คือสิ่งที่ World Labs ตั้งเป้าที่จะทำในขณะที่เราพัฒนา Marble ต่อไป
GIF
ทิศทางนั้นชัดเจน การเดิมพันเดียวกันที่สาขานี้ทำมาตั้งแต่ปลายทศวรรษ 1980 — ว่าแบบจำลองโลกที่สมบูรณ์เพียงพอคือทุกสิ่งที่เอเจนต์ใดๆ ต้องการเพื่อมองโลก สร้างมัน และกระทำในมัน — คือการเดิมพันที่ขับเคลื่อนงานวิจัยทั้งรุ่นตอนนี้ สิ่งที่ทำให้ "การเดิมพันครั้งใหญ่" นั้นมีน้ำหนักคือการบรรจบกันที่กำลังดำเนินอยู่: สามเส้นด้าย ซึ่งแต่ละเส้นขับเคลื่อนและหล่อหลอมอุตสาหกรรมมูลค่าหลายพันล้านดอลลาร์ด้วยตัวของมันเอง ที่เริ่มต้นเป็นโปรแกรมวิจัยแยกกัน กำลังเริ่มประพฤติตัวเป็นหนึ่งเดียว เมื่อนำมารวมกัน เมื่อเส้นแบ่งระหว่างมันล่มสลาย พวกมันจะปรับเปลี่ยนสิ่งที่ใหญ่กว่า: ความสัมพันธ์ระหว่างความฉลาดของเครื่องจักรกับโลกทางกายภาพที่มันอาศัยอยู่ — เส้นทางยาวไกลของความฉลาดเชิงพื้นที่
ภาษามอบวิธีให้เครื่องจักรพูดถึงโลกนั้น แบบจำลองโลกคือวิธีที่เครื่องจักรจะในที่สุดเข้าใจ จินตนาการ ใช้เหตุผล และโต้ตอบกับมัน







