YouMind
登入

世界模型的功能分類學

@drfeifei
英語2026年6月03日
787K
4.3K
874
150
5.7K

TL;DR

本文定義了 AI 世界模型的功能分類學,將其分為渲染器、模擬器與規劃器,並論證模擬技術是實現真正空間智慧的關鍵橋樑。

「世界就是一切實際存在的情況。」

—— 路德維希·維根斯坦,《邏輯哲學論》,1921 年

世界並非由文字構成。

在<a href="https://drfeifei.substack.com/p/from-words-to-worlds-spatial-intelligence">先前的文章</a>中,我們論證了空間智能是 AI 的下一個前沿,而世界模型正是通往此路線的關鍵。在此,World Labs 團隊與我想更深入一層:在目前許多正在構建並被稱為「世界模型」的項目中,真正構成這項能力的核心功能元件有哪些?它們各自又扮演什麼角色?

語言模型賦予了機器對概念、詞彙與推理的非凡掌握,但物理世界(無論虛擬或真實)運作於不同的基礎之上。語言模型學習的是文字的統計結構,而世界模型學習的是空間與時間的統計結構:光如何落在表面上、一個從未經相機捕捉的角度所見的花園景色、物體如何對力作出反應並遵循物理定律。

這使得「世界模型」成為現今 AI 領域中最重要、同時也最容易混淆的術語之一。電腦視覺、機器人學、強化學習與生成式 AI 各自宣稱在建構世界模型,但彼此的內涵卻大相徑庭。一個能生成華麗但物理上不可能的火焰的影片模型、一個即興創作可遊玩遊戲的語言模型、以及一個精確模擬燃燒的物理引擎,竟都共享同一個名稱。

古希臘人始終無法就世界由何構成達成共識——是火、水,還是不可分割的原子——因為「世界」從來就不是單一事物。它始終是某個思想家需要推理的整體的代稱。AI 繼承了同樣的問題,而此刻正是這個領域需要精確性的時刻。

分類法之下的迴圈

要釐清這層混亂,得從一個比任何現有技術都更古老的圖形說起。在強化學習的教科書中(包括 Sutton 與 Barto 的經典著作),多年來一直使用相同版本的圖形來描述 Agent 如何與世界互動。這個圖形的正式名稱是部分可觀察馬可夫決策過程(POMDP),而「世界模型」一詞的原始定義便源自此傳統。

一個 Agent(可以是人、機器人或軟體系統)採取行動,這些行動會影響世界的狀態。Agent 從未直接看見狀態,它接收到的是觀測:落在視網膜上的光子、感測器的讀數、影片畫格中的畫素。新的觀測引導新的行動,這個迴圈不斷重複。

「狀態」這個詞需要釐清,因為它在不同領域中的意義不同。這並非化學家所謂的狀態(固態、液態、氣態的區別),而是物理學家與機器人學家所定義的狀態:對世界在某一時刻所發生一切之完整描述,包括每個物體、每個位置、每個速度、每個屬性。狀態是世界底層的現實,原則上完整,但對於任何內部的 Agent 而言,從不可見。觀測是 Agent 對該現實的部分視角。行動則是 Agent 對此作出的回應。

這個迴圈——從 Agent 到行動,再到狀態,再到觀測,再回到 Agent——正是賦予現代「世界模型」一詞技術含義的結構。該詞本身的歷史更悠久,可追溯至 Kenneth Craik 在 1943 年提出的觀點:心靈透過運行現實的「小規模模型」來推理,並在 1980 年代末至 1990 年代初進入神經網路領域。而這個迴圈也解釋了今日人們對該詞的理解。目前被稱為世界模型的不同事物,實則是這個相同迴圈的不同投影。每一個都輸出該迴圈的不同部分。

世界模型的三種功能

第一種世界模型是渲染器。 渲染器以人類眼睛可觀看的畫素形式輸出觀測,其最關鍵的品質是視覺逼真度。 一個將文字提示轉化為電影級空拍畫面的影片模型就是渲染器。類似 Google 的 Genie 3,或 World Labs 自家的 RTFM**,這些模型根據使用者輸入即時生成畫格,屬於交互式系統。該模型對三維結構並無明確理解。它只產生觀看者會看到的畫面,而非實際存在的東西。空拍畫面中的建築物從上方看可能完美無瑕,但若試圖在下方城市中駕車,它們便會分崩離析。

第二種是模擬器。模擬器輸出狀態:一種在幾何、物理或動態上忠於世界的表示法,人類與電腦程式皆可對其進行計算和互動。 渲染器的承諾純屬視覺,而模擬器的承諾則是結構性的:要求幾何形狀經得起檢驗、物理遵循牛頓定律、動態行為根據物理定律符合世界應有的方式。模擬器同時服務兩類使用者。人類專業人士(如建築師、設計師、電影製片人、遊戲開發者)需要超越視覺可信度的準確性。電腦程式(如強化學習 Agent、機器人控制器、自動駕駛車輛)則將模擬器作為訓練場,在其中與大規模世界互動,測試在現實世界中危險、昂貴或不可能執行的情境。

第三種是規劃器。規劃器輸出行動。 給定觀測與目標,規劃器回答 Agent 下一步該做什麼。這在某種意義上是渲染器的反向。渲染器以行動為輸入產生觀測,規劃器則以觀測為輸入產生行動,閉合感知-行動迴圈。視覺-語言-行動模型(VLA)、基於模型的系統,以及最新一波的世界行動模型(World Action Models),都是規劃器的嘗試:能夠在非結構化世界中決定機器人該做什麼的系統。

這三個類別涵蓋了目前大多數真正在出貨的系統,而區分它們在實際操作中非常有用。然而,這些類別並非截然分離。共同的世界運作知識——幾何、物理、動態——位於所有類別之下。一個能從任何角度渲染杯子的模型,原則上也應該能模擬杯子被推動時會發生什麼,並規劃一隻手去撿起它。越來越多的有趣研究刻意模糊這三者之間的界線。

Fei-Fei Li - inline image

GIF

為什麼模擬器是關鍵

在這三個類別中,模擬器獲得的公眾關注最少,卻是最重要的。本文旨在解決這種不對稱。

渲染器是商業上最成熟的類別。 許多影像或文字轉影片的產品正在消費或企業市場快速擴張。Google 的 Nano Banana 模型已將渲染等級的圖片生成能力交到潛在數億使用者手中。這項技術是真實的,市場也是真實的。然而,渲染器最佳化的是視覺可信度而非物理準確度,這個天花板至關重要。它們的輸出很漂亮,但無法用來設計建築或訓練機器人。

規劃器是最引人入勝也最初始的類別, 與快速發展的機器人學習領域緊密相關。** 過去兩年,該領域產生了許多在影片中看起來令人驚豔的機器人展示,但我們必須誠實面對這些展示實際呈現的內容。幾乎所有展示都局限於高度受限的實驗室環境,使用狹窄的物體集合和短暫的任務時間跨度。沒有一個經過複雜度、變化性或持續時間的驗證,以達到現實世界部署的要求。從一個令人印象深刻的展示影片,到一個能在廚房、倉庫或手術室中可靠運作的機器人,差距仍然巨大。儘管如此,商業賭注依然龐大。一波資金充足的創業者正競相推出通用的規劃系統,而最大的基礎設施參與者則將規劃定位於更廣泛的模擬堆疊之上。能規劃的機器人就是能工作的機器人,整個產業都在競相成為第一個實現的。

模擬器是兩者之間的橋樑。 如果語言是世界的抽象化,畫素是世界的投影,那麼幾何、物理與動態就是世界本身。模擬器必須在該層次運作:它是結構性骨幹,從中可以衍生出視覺外觀(供渲染器使用)和行動後果(供規劃器使用)。

一個掌握模擬能力的模型,可以將其理解投射為畫素供人類消費,以及投射為行動預測供具身 Agent 使用。一個只會渲染或只會規劃的模型,兩者都做不到。其商業影響力巨大。僅 NVIDIA 的 Omniverse 一項,就瞄準了公司估算超過一兆美元的市場,涵蓋工廠、倉庫、供應鏈與數位孿生。機器人訓練、自動駕駛測試、建築視覺化、工程與藥物發現,都依賴於某種形式的模擬。

這個領域中最困難的開放性問題也存在於此。具有明確幾何、材質屬性和物理標註的三維數據,其數量遠比渲染器訓練所用的網路影片少了數個數量級。模擬到現實的差距(sim-to-real gap)——即事物在模擬中的行為與現實中的行為之間的差異——依然存在。生成式模擬器在此之上引入了新的風險:AI 生成的幾何形狀可能看起來正確,但卻包含自相交或尺寸錯誤,導致物理運算無意義。大規模的多物理模擬(剛體、可變形物體、流體與布料同時交互作用)的成本仍然比單一領域模擬高出數個數量級。

在 World Labs,Marble 是我們涉足此領域的第一步。它接受多模態提示(文字、圖片、影片或空間草圖),生成可探索的 3D 環境,輸出高斯潑濺(Gaussian splats)供視覺探索,同時輸出碰撞網格(collision meshes)供物理引擎運作。但 Marble 只是一個更長歷程的第一章,隨著渲染、模擬與規劃之間的界線開始崩解,這個領域正在書寫更長遠的故事。

邊界正在崩解,接下來會發生什麼

但更多發展還在後頭。目前該領域最重要的模式是,這三個類別正開始相互融合。共同的理解是,渲染世界、模擬世界以及在其中行動所需的知識大致相同。延續先前的例子,一個真正理解杯子如何放在桌上(其幾何、材質屬性、對力的反應等)的模型,應該能夠從任何角度渲染該杯子、模擬杯子被推動時會發生什麼,並規劃一隻手去撿起它。這三個類別是單一底層理解的三個投影。

例如:來自多個機器人實驗室的小但越來越多的最新研究顯示(至少在概念上),預訓練的影片渲染器可以用作聯合世界與行動預測的骨幹,從而暗示渲染器與規劃器之間的橋樑,讓單一模型既能想像會發生什麼,又能決定該做什麼。World Labs 的 Marble 已能從單一模型輸出高斯潑濺與碰撞網格,消除了渲染器與模擬器之間的界線。每個層級都正從被動輸出邁向互動式系統, 渲染器變成條件於行動,模擬器生成更可控、更可編輯的世界,規劃器則進行深思熟慮而非只是反應。

邏輯上的終點是一個統一的 world model:一個基礎模型,既能渲染逼真的視覺效果,又能生成物理準確的結構,還能規劃行動序列,根據下游消費者的需求在輸出模態之間切換。 我們仍將面臨許多艱鉅的挑戰。數據狀況不均衡,渲染器有海量的網路影片,而模擬器與規劃器則面臨 3D 資產與機器人示範的嚴重短缺。最佳化視覺美感可能會犧牲機器人或高保真模擬所需的精確度。在單一架構內調和這些矛盾,是今日世界模型研究中決定性的開放性問題,而這正是 World Labs 在持續演進 Marble 的過程中所要努力的方向。

Fei-Fei Li - inline image

GIF

然而,方向是明確的。自 1980 年代末以來,這個領域一直在押注的同一個賭注——一個足夠豐富的世界模型,就是任何 Agent 觀看世界、建構世界、並在其中行動所需的一切——正是現在驅動整個世代研究的賭注。讓這個「大賭注」具有重量的,是已經在進行的融合:三個線索,各自已驅動並塑造數十億美元的產業,最初是不同的研究計畫,現在開始像一個整體。當它們之間的界線崩解時,它們將共同重塑更大的東西:機器智慧與其所在的物理世界之間的關係——空間智能的長遠進程。

語言讓機器有了談論世界的方式。世界模型則是機器最終將理解、想像、推理並與世界互動的方式。

一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章