YouMind
Đăng nhập

Phân loại chức năng của các mô hình thế giới (World Models)

@drfeifei
TIẾNG ANH03 thg 6, 2026
787K
4.3K
874
150
5.7K

TL;DR

Bài viết này xác định hệ thống phân loại chức năng cho các mô hình thế giới AI, chia chúng thành các nhóm trình kết xuất (renderers), mô phỏng (simulators) và lập kế hoạch (planners), đồng thời lập luận rằng mô phỏng là cầu nối quan trọng để đạt được trí tuệ không gian thực thụ.

"Thế giới là tất cả những gì đang diễn ra." — Ludwig Wittgenstein,

Tractatus Logico-Philosophicus

, 1921

Thế giới không được tạo nên từ ngôn từ.

Trong một bài luận trước, chúng tôi đã lập luận rằng trí thông minh không gian là ranh giới tiếp theo của AI và mô hình thế giới chính là con đường dẫn đến đó. Ở đây, nhóm World Labs và tôi muốn đi sâu hơn một cấp độ: trong số rất nhiều thứ đang được xây dựng và gọi là 'mô hình thế giới', những mảnh chức năng nào thực sự cấu thành nên khả năng đó — và mỗi mảnh phục vụ cho mục đích gì?

Các mô hình ngôn ngữ đã mang lại cho máy móc khả năng vượt trội trong việc nắm bắt các khái niệm, từ vựng và lý luận, nhưng thế giới vật lý, dù là ảo hay thực, lại vận hành trên một nền tảng khác. Trong khi các mô hình ngôn ngữ học cấu trúc thống kê của văn bản, thì mô hình thế giới học cấu trúc thống kê của không gian và thời gian: cách ánh sáng chiếu trên một bề mặt, cách một khu vườn trông từ một góc mà không máy ảnh nào từng ghi lại, cách các vật thể phản ứng với lực và tuân theo các định luật vật lý.

Điều này khiến "mô hình thế giới" trở thành một trong những thuật ngữ quan trọng nhất và cũng bị lạm dụng nhiều nhất trong AI ngày nay. Thị giác máy tính, robot, học tăng cường và AI tạo sinh đều tuyên bố đang xây dựng các mô hình thế giới, và mỗi lĩnh vực lại hiểu theo một cách khác nhau. Một mô hình video tạo ra những ngọn lửa đẹp mắt nhưng vi phạm vật lý, một mô hình ngôn ngữ ứng tác một trò chơi có thể chơi được, và một công cụ mô phỏng vật lý mô phỏng trung thực quá trình đốt cháy — tất cả đều được gọi chung một cái tên.

Người Hy Lạp cổ đại không bao giờ thống nhất được thế giới được tạo nên từ gì, dù là lửa, nước, hay các nguyên tử không thể phân chia, bởi vì "thế giới" chưa bao giờ là một thứ duy nhất. Nó luôn là một sự thay thế cho tổng thể mà một nhà tư tưởng nào đó cần để suy luận. AI cũng thừa hưởng vấn đề tương tự, đúng vào thời điểm lĩnh vực này cần sự chính xác.

Vòng lặp bên dưới hệ thống phân loại

Để cắt ngang sự nhầm lẫn đó, chúng ta bắt đầu với một sơ đồ lâu đời hơn bất kỳ công nghệ nào đang được đề cập. Các sách giáo khoa về học tăng cường, bao gồm cả cuốn sách kinh điển của Sutton và Barto, đã sử dụng một phiên bản của cùng một bức tranh này trong nhiều thập kỷ để mô tả cách một tác nhân tương tác với thế giới. Tên chính thức của bức tranh này là quá trình quyết định Markov quan sát một phần, hay POMDP, và định nghĩa gốc của thuật ngữ "mô hình thế giới" thuộc về truyền thống đó.

Một tác nhân, có thể là một người, một robot, hoặc một hệ thống phần mềm, thực hiện các hành động. Những hành động đó ảnh hưởng đến trạng thái của thế giới. Tác nhân không bao giờ thấy trực tiếp trạng thái đó. Những gì đến được với tác nhân là các quan sát: các photon chiếu vào võng mạc, các kết quả đọc từ cảm biến, và các pixel trong một khung hình video. Các quan sát mới cung cấp thông tin cho các hành động mới, và vòng lặp tiếp tục.

Từ "trạng thái" cần được làm rõ, bởi vì ý nghĩa của nó thay đổi giữa các lĩnh vực. Đây không phải là trạng thái của nhà hóa học, sự khác biệt giữa rắn, lỏng và khí. Đây là trạng thái của nhà vật lý và nhà robot: một mô tả hoàn chỉnh về những gì đang xảy ra trong thế giới tại một thời điểm nhất định, bao gồm mọi vật thể, mọi vị trí, mọi vận tốc, mọi thuộc tính. Trạng thái là thực tế nền tảng của thế giới; hoàn chỉnh về mặt nguyên tắc, nhưng không bao giờ hiển thị trực tiếp cho bất kỳ tác nhân nào bên trong nó. Quan sát là góc nhìn một phần của tác nhân về thực tế đó. Hành động là những gì tác nhân làm để đáp lại.

Vòng lặp này — tác nhân đến hành động đến trạng thái đến quan sát và quay lại — là cấu trúc đã mang lại ý nghĩa kỹ thuật cho thuật ngữ "mô hình thế giới" hiện đại. Bản thân cụm từ này đã cũ hơn, bắt nguồn từ đề xuất năm 1943 của Kenneth Craik rằng tâm trí suy luận bằng cách chạy "các mô hình thu nhỏ" của thực tế, và được đưa vào mạng nơ-ron vào cuối những năm 1980 và đầu những năm 1990. Và vòng lặp cũng giải thích ý nghĩa của thuật ngữ này ngày nay. Những thứ khác nhau hiện đang được gọi là mô hình thế giới thực ra là các phép chiếu khác nhau của cùng một vòng lặp này. Mỗi thứ tạo ra một phần khác nhau của nó.

Ba chức năng của mô hình thế giới

Loại mô hình thế giới đầu tiên là công cụ kết xuất. Công cụ kết xuất tạo ra các quan sát dưới dạng pixel dành cho mắt người, và chất lượng quan trọng nhất là độ trung thực về mặt thị giác. Một mô hình video biến một dòng văn bản thành một cảnh quay điện ảnh từ trên cao là một công cụ kết xuất. Một hệ thống tương tác như Genie 3 của Google, hoặc RTFM của World Labs, nơi mô hình tạo ra các khung hình theo thời gian thực dựa trên đầu vào của người dùng, cũng vậy. Mô hình không mang theo bất kỳ sự hiểu biết rõ ràng nào về cấu trúc ba chiều. Nó tạo ra những gì người xem sẽ thấy, chứ không phải những gì thực sự tồn tại. Các tòa nhà trong cảnh quay từ trên cao có thể trông hoàn hảo từ trên cao, nhưng hãy thử lái xe qua thành phố bên dưới và chúng sẽ đổ vỡ.

Loại thứ hai là công cụ mô phỏng. Công cụ mô phỏng tạo ra trạng thái: một biểu diễn trung thực về mặt hình học, vật lý hoặc động lực học của thế giới mà cả con người và chương trình máy tính đều có thể tính toán và tương tác. Trong khi hợp đồng của công cụ kết xuất hoàn toàn là về thị giác, thì hợp đồng của công cụ mô phỏng là về cấu trúc, đòi hỏi hình học vững chắc dưới sự kiểm tra, vật lý tôn trọng các định luật Newton, và động lực học hoạt động theo cách thế giới cần hoạt động dựa trên các định luật vật lý. Một công cụ mô phỏng phục vụ hai đối tượng cùng một lúc. Các chuyên gia con người như kiến trúc sư, nhà thiết kế, nhà làm phim và nhà phát triển trò chơi cần độ chính xác vượt xa tính hợp lý về mặt thị giác. Các chương trình máy tính như tác nhân học tăng cường, bộ điều khiển robot và xe tự hành sử dụng các công cụ mô phỏng làm bãi tập huấn luyện, nơi chúng có thể tương tác với thế giới ở quy mô lớn, thử nghiệm các kịch bản có thể nguy hiểm, tốn kém hoặc không thể thực hiện trong thực tế.

Loại thứ ba là công cụ lập kế hoạch. Công cụ lập kế hoạch tạo ra các hành động. Với một quan sát và một mục tiêu, công cụ lập kế hoạch trả lời câu hỏi về việc tác nhân nên làm gì tiếp theo. Theo nhiều cách, đây là nghịch đảo của công cụ kết xuất. Trong khi công cụ kết xuất nhận các hành động làm đầu vào và tạo ra các quan sát, thì công cụ lập kế hoạch nhận các quan sát làm đầu vào và tạo ra các hành động, khép kín vòng lặp nhận thức-hành động. Các mô hình Ngôn ngữ-Thị giác-Hành động, các hệ thống dựa trên mô hình, và làn sóng mới của Mô hình Hành động Thế giới đều là những nỗ lực hướng tới công cụ lập kế hoạch: các hệ thống có thể quyết định một robot nên làm gì trong một thế giới không có cấu trúc.

Ba danh mục này mô tả hầu hết những gì thực sự đang được phát hành ngày nay, và sự phân biệt giữa chúng rất hữu ích trong thực tế. Tuy nhiên, các danh mục này không hoàn toàn tách biệt. Cùng một kiến thức nền tảng về cách thế giới vận hành—hình học, vật lý, động lực học—nằm bên dưới tất cả chúng. Một mô hình có thể kết xuất một cái cốc từ bất kỳ góc nào, về mặt nguyên tắc, sẽ có thể mô phỏng những gì xảy ra khi cái cốc bị đẩy và lên kế hoạch cho một bàn tay nhặt cái cốc lên. Các nghiên cứu thú vị nhất ngày càng cố tình làm mờ ranh giới giữa ba loại này.

Fei-Fei Li - inline image

GIF

Tại sao mô phỏng là then chốt

Trong ba danh mục, công cụ mô phỏng nhận được ít sự chú ý của công chúng nhất, và lại là quan trọng nhất trong ba loại. Bài luận này giải quyết sự bất đối xứng này.

Công cụ kết xuất cho đến nay là thương mại trưởng thành nhất. Một số sản phẩm tạo hình ảnh hoặc video từ văn bản đang mở rộng nhanh chóng trong thị trường tiêu dùng hoặc doanh nghiệp. Mô hình Nano Banana của Google đã đưa khả năng tạo hình ảnh chất lượng kết xuất vào tay hàng trăm triệu người dùng tiềm năng. Công nghệ là thật, và thị trường là thật. Tuy nhiên, các công cụ kết xuất tối ưu hóa cho tính hợp lý về mặt thị giác thay vì độ chính xác vật lý, và giới hạn đó rất quan trọng. Đầu ra của chúng rất đẹp, nhưng không thể tin cậy để thiết kế một tòa nhà hay huấn luyện robot.

Công cụ lập kế hoạch là hấp dẫn nhất và sơ khai nhất, liên quan chặt chẽ đến lĩnh vực học robot đang phát triển nhanh chóng.** Lĩnh vực này đã tạo ra các bản demo robot trong hai năm qua trông ấn tượng trong video, nhưng cần thẳng thắn về những gì các bản demo đó thực sự cho thấy. Hầu như tất cả đều bị giới hạn trong các thiết lập phòng thí nghiệm có kiểm soát chặt chẽ, với các bộ đồ vật hẹp và các chuỗi nhiệm vụ ngắn. Chưa có bản demo nào được xác nhận ở mức độ phức tạp, biến thiên, hoặc thời lượng mà việc triển khai trong thế giới thực đòi hỏi. Khoảng cách giữa một đoạn phim demo ấn tượng và một robot làm việc đáng tin cậy trong nhà bếp, nhà kho, hoặc phòng mổ vẫn còn rất lớn. Tuy nhiên, các khoản cược thương mại là rất đáng kể. Một làn sóng các công ty được tài trợ tốt đang chạy đua để tung ra các hệ thống lập kế hoạch đa năng, trong khi các nhà khai thác cơ sở hạ tầng lớn nhất đang định vị việc lập kế hoạch trên các ngăn xếp mô phỏng rộng hơn. Một robot có thể lập kế hoạch là một robot có thể làm việc, và toàn bộ ngành công nghiệp đang chạy đua để trở thành người đầu tiên đạt được điều đó.

Mô phỏng là cầu nối giữa hai loại. Nếu ngôn ngữ là một sự trừu tượng hóa của thế giới và pixel là một phép chiếu của nó, thì hình học, vật lý và động lực học chính là bản thân thế giới. Một công cụ mô phỏng phải hoạt động ở cấp độ đó: xương sống cấu trúc mà từ đó cả diện mạo thị giác (cho công cụ kết xuất) và hậu quả hành động (cho công cụ lập kế hoạch) có thể được suy ra.

Một mô hình thành thạo mô phỏng có thể chiếu sự hiểu biết của nó thành pixel cho người tiêu dùng là con người, và thành dự đoán hành động cho các tác nhân nhập thể. Một mô hình chỉ thành thạo kết xuất, hoặc chỉ lập kế hoạch, không thể làm được điều nào. Diện tích bề mặt thương mại là rất lớn. Riêng Omniverse của NVIDIA đã nhắm đến thị trường mà công ty ước tính hơn một nghìn tỷ đô la trong các nhà máy, nhà kho, chuỗi cung ứng và bản sao kỹ thuật số. Đào tạo robot, thử nghiệm xe tự hành, trực quan hóa kiến trúc, kỹ thuật và khám phá thuốc đều phụ thuộc vào một thứ có hình dạng mô phỏng.

Các vấn đề mở khó nhất trong lĩnh vực này cũng nằm ở đó. Dữ liệu ba chiều với hình học, thuộc tính vật liệu và chú thích vật lý rõ ràng khan hiếm hơn nhiều bậc so với video internet mà các công cụ kết xuất được huấn luyện. Khoảng cách mô phỏng - thực tế, là sự khác biệt giữa cách mọi thứ hoạt động trong mô phỏng và cách chúng hoạt động trong thực tế, vẫn tồn tại. Các công cụ mô phỏng tạo sinh giới thiệu một rủi ro mới trên đỉnh của điều đó: hình học do AI tạo ra có thể trông đúng trong khi chứa các giao cắt tự hoặc tỷ lệ sai tạo ra vật lý vô nghĩa. Mô phỏng đa vật lý ở quy mô lớn, nơi các vật thể rắn, vật thể biến dạng, chất lỏng và vải tương tác với nhau, vẫn đắt hơn nhiều bậc so với mô phỏng đơn miền.

Tại World Labs, Marble là bước đi đầu tiên của chúng tôi vào lãnh thổ này. Nó nhận các lời nhắc đa phương thức (văn bản, hình ảnh, video, hoặc bản phác thảo không gian) và tạo ra các môi trường 3D có thể khám phá, xuất ra các Gaussian splat để khám phá trực quan cùng với các lưới va chạm mà một công cụ mô phỏng vật lý có thể vận hành. Nhưng Marble chỉ là chương đầu tiên của một vòng cung dài hơn nhiều đang được viết trên khắp lĩnh vực khi ranh giới giữa kết xuất, mô phỏng và lập kế hoạch bắt đầu sụp đổ.

Nơi ranh giới đang sụp đổ và điều gì tiếp theo

Nhưng còn nhiều điều sắp tới. Mô hình quan trọng nhất trong lĩnh vực này ngay bây giờ là ba danh mục đang bắt đầu hòa trộn vào nhau. Hiểu biết chung là kiến thức cần thiết để kết xuất một thế giới, mô phỏng nó và hành động trong đó phần lớn là giống nhau. Tiếp tục ví dụ trước, một mô hình thực sự hiểu cách một cái cốc đặt trên bàn (hình học, thuộc tính vật liệu, phản ứng với lực, v.v.) sẽ có thể kết xuất cái cốc đó từ bất kỳ góc nào, mô phỏng những gì xảy ra khi cái cốc bị đẩy, và lên kế hoạch cho một bàn tay nhặt cái cốc lên. Ba danh mục là ba phép chiếu của một sự hiểu biết nền tảng duy nhất.

Ví dụ: một số lượng nhỏ nhưng ngày càng tăng các công trình gần đây từ các phòng thí nghiệm robot khác nhau đã chứng minh rằng—ít nhất về mặt khái niệm—một công cụ kết xuất video được huấn luyện trước có thể được sử dụng làm xương sống cho dự đoán thế giới và hành động chung, gợi ý một cầu nối giữa công cụ kết xuất và công cụ lập kế hoạch bằng cách cho phép một mô hình tưởng tượng điều gì sẽ xảy ra và phải làm gì. Marble của World Labs đã xuất ra các Gaussian splat và lưới va chạm từ một mô hình duy nhất, xóa tan ranh giới giữa công cụ kết xuất và công cụ mô phỏng. Mọi cấp độ đang chuyển từ đầu ra thụ động sang hệ thống tương tác, với các công cụ kết xuất trở nên phụ thuộc vào hành động, các công cụ mô phỏng tạo ra các thế giới có thể kiểm soát và chỉnh sửa nhiều hơn, và các công cụ lập kế hoạch cân nhắc thay vì chỉ phản ứng.

Điểm cuối hợp lý là một mô hình thế giới thống nhất: một mô hình nền tảng có thể kết xuất các góc nhìn chân thực, tạo ra cấu trúc chính xác về mặt vật lý và lên kế hoạch các chuỗi hành động, chuyển đổi giữa các phương thức đầu ra tùy thuộc vào nhu cầu của người dùng hạ nguồn. Chúng ta vẫn sẽ phải đối mặt với một số thách thức khó khăn. Bức tranh dữ liệu không đồng đều, với các công cụ kết xuất ngập trong video internet trong khi các công cụ mô phỏng và lập kế hoạch đối mặt với sự thiếu hụt nghiêm trọng các tài sản 3D và trình diễn robot. Tối ưu hóa cho vẻ đẹp thị giác có thể hy sinh độ chính xác mà robot hoặc mô phỏng độ trung thực cao cần. Hòa giải những căng thẳng này bên trong một kiến trúc duy nhất là vấn đề mở xác định trong nghiên cứu mô hình thế giới ngày nay, và đây là điều World Labs đặt ra để làm khi chúng tôi tiếp tục phát triển Marble.

Fei-Fei Li - inline image

GIF

Tuy nhiên, hướng đi đã rõ ràng. Cùng một cược mà lĩnh vực này đã đặt ra từ cuối những năm 1980 — rằng một mô hình thế giới đủ phong phú là tất cả những gì bất kỳ tác nhân nào cần để nhìn thấy thế giới, xây dựng chúng và hành động trong chúng — là cược hiện đang thúc đẩy toàn bộ một thế hệ nghiên cứu. Điều mang lại trọng lượng cho "cược lớn" đó là sự hội tụ đang diễn ra: ba luồng, mỗi luồng đã thúc đẩy và định hình các ngành công nghiệp trị giá hàng tỷ đô la, bắt đầu như các chương trình nghiên cứu riêng biệt, đang bắt đầu hoạt động như một. Tổng thể lại, khi ranh giới giữa chúng sụp đổ, chúng sẽ định hình lại một thứ lớn hơn: mối quan hệ giữa trí thông minh máy móc và thế giới vật lý mà nó sinh sống — vòng cung dài của trí thông minh không gian.

Ngôn ngữ đã cho máy móc một cách để nói về thế giới đó. Các mô hình thế giới là cách máy móc cuối cùng sẽ đến để hiểu, tưởng tượng, suy luận và tương tác với nó.

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral