YouMind
로그인

세계 모델의 기능적 분류 체계

@drfeifei
영어2026년 6월 03일
787K
4.3K
874
150
5.7K

TL;DR

이 글은 AI 세계 모델을 렌더러, 시뮬레이터, 플래너로 분류하는 기능적 체계를 정의하며, 시뮬레이션이 진정한 공간 지능을 달성하기 위한 결정적인 가교임을 역설합니다.

"세계는 존재하는 모든 것이다." — 루트비히 비트겐슈타인,

논리-철학 논고

, 1921

세계는 말로 이루어져 있지 않다.

이전 에세이에서 우리는 공간 지능이 AI의 다음 개척지이며, 세계 모델이 그 길이라고 주장했습니다. 여기서 World Labs 팀과 저는 한 단계 더 깊이 들어가고자 합니다. 현재 구축되고 '세계 모델'이라 불리는 많은 것들 중에서, 어떤 기능적 조각들이 실제로 그 능력을 구성하며, 각각의 목적은 무엇일까요?

언어 모델은 기계에게 개념, 어휘, 추론에 대한 놀라운 능력을 부여했지만, 물리적 세계(가상이든 현실이든)는 다른 기반 위에서 작동합니다. 언어 모델이 텍스트의 통계적 구조를 학습하는 반면, 세계 모델은 공간과 시간의 통계적 구조, 즉 빛이 표면에 어떻게 떨어지는지, 어떤 카메라도 포착하지 못한 각도에서 정원이 어떻게 보이는지, 물체가 힘에 어떻게 반응하고 물리 법칙을 따르는지 등을 학습합니다.

이로 인해 '세계 모델'은 오늘날 AI에서 가장 중요하면서도 가장 과도하게 사용되는 용어 중 하나가 되었습니다. 컴퓨터 비전, 로봇공학, 강화 학습, 생성형 AI는 각각 세계 모델을 구축하고 있다고 주장하며, 각각이 의미하는 바는 상당히 다릅니다. 아름답지만 물리적으로 불가능한 불꽃을 생성하는 비디오 모델, 플레이 가능한 게임을 즉흥적으로 만들어내는 언어 모델, 그리고 연소를 충실히 시뮬레이션하는 물리 엔진이 모두 같은 이름으로 불리고 있습니다.

고대 그리스인들은 세계가 불, 물, 또는 불가분의 원자 중 무엇으로 이루어져 있는지 결코 합의하지 못했습니다. '세계'는 결코 단일한 것이 아니었기 때문입니다. 그것은 항상 특정 사상가가 추론해야 하는 총체성을 대신하는 자리 표시자였습니다. AI는 현장에 정밀함이 필요한 바로 그 순간에 동일한 문제를 물려받았습니다.

분류 체계 아래의 루프

이 혼란을 해소하는 것은 해당 기술들보다 오래된 다이어그램에서 시작됩니다. 서턴과 바로의 표준 교과서를 포함한 강화 학습 교과서는 수십 년 동안 에이전트가 세계와 상호작용하는 방식을 설명하기 위해 동일한 그림의 버전을 사용해 왔습니다. 이 그림의 공식 명칭은 부분 관찰 마르코프 결정 과정(POMDP)이며, '세계 모델'이라는 용어의 원래 정의는 이 전통에 속합니다.

사람, 로봇 또는 소프트웨어 시스템이 될 수 있는 에이전트는 행동을 취합니다. 이러한 행동은 세계의 상태에 영향을 미칩니다. 에이전트는 상태를 직접 볼 수 없습니다. 에이전트에게 도달하는 것은 관찰입니다. 망막에 떨어지는 광자, 센서의 판독값, 비디오 프레임의 픽셀 등입니다. 새로운 관찰은 새로운 행동에 정보를 제공하고, 루프는 계속됩니다.

'상태'라는 단어는 설명이 필요합니다. 그 의미는 분야마다 달라지기 때문입니다. 이것은 화학자의 상태(고체, 액체, 기체의 차이)가 아닙니다. 이것은 물리학자와 로봇 공학자의 상태입니다. 즉, 특정 순간에 세계에서 일어나고 있는 모든 일(모든 물체, 모든 위치, 모든 속도, 모든 속성 포함)에 대한 완전한 설명입니다. 상태는 세계의 근본적인 현실이며, 원칙적으로는 완전하지만 그 안에 있는 어떤 에이전트에게도 직접적으로 보이지 않습니다. 관찰은 그 현실에 대한 에이전트의 부분적인 시각입니다. 행동은 이에 반응하여 에이전트가 하는 일입니다.

에이전트에서 행동, 상태, 관찰, 그리고 다시 돌아오는 이 루프는 현대 용어 '세계 모델'에 기술적 의미를 부여한 구조입니다. 이 표현 자체는 더 오래되어, 케네스 크레이크가 1943년에 마음이 현실의 '소규모 모델'을 실행함으로써 추론한다는 제안으로 거슬러 올라가며, 1980년대 후반과 1990년대 초반에 신경망으로 이어졌습니다. 그리고 이 루프는 오늘날 사람들이 이 용어로 의미하는 바를 설명하기도 합니다. 현재 세계 모델이라고 불리는 다양한 것들은 실제로 이 동일한 루프의 서로 다른 투영입니다. 각각은 루프의 서로 다른 부분을 출력합니다.

세계 모델의 세 가지 기능

첫 번째 종류의 세계 모델은 렌더러입니다. 렌더러는 사람의 눈을 위한 픽셀 형태로 관찰을 출력하며, 가장 중요한 품질은 시각적 충실도입니다. 텍스트 프롬프트를 영화 같은 드론 샷으로 바꾸는 비디오 모델은 렌더러입니다. Google의 Genie 3 또는 World Labs 자체의 RTFM과 같은 인터랙티브 시스템도 마찬가지로, 모델이 사용자 입력에 따라 실시간으로 프레임을 생성합니다. 이 모델은 3차원 구조에 대한 명시적 이해를 가지고 있지 않습니다. 그것은 보는 사람이 보게 될 것을 생성할 뿐, 실제로 존재하는 것을 생성하지는 않습니다. 드론 샷의 건물은 위에서 보면 완벽해 보일 수 있지만, 아래 도시를 운전해 보려고 하면 무너집니다.

두 번째 종류는 시뮬레이터입니다. 시뮬레이터는 상태를 출력합니다. 즉, 인간과 컴퓨터 프로그램 모두가 계산하고 상호작용할 수 있는, 기하학적, 물리적 또는 동적으로 충실한 세계의 표현입니다. 렌더러의 계약이 순수하게 시각적인 반면, 시뮬레이터의 계약은 구조적입니다. 즉, 검사를 견딜 수 있는 기하학, 뉴턴의 법칙을 존중하는 물리, 그리고 물리 법칙이 주어졌을 때 세계가 필요로 하는 방식으로 작동하는 동역학을 요구합니다. 시뮬레이터는 동시에 두 소비자를 대상으로 합니다. 건축가, 디자이너, 영화 제작자, 게임 개발자와 같은 인간 전문가는 시각적 그럴듯함을 넘어선 정확성을 필요로 합니다. 강화 학습 에이전트, 로봇 제어기, 자율 주행 차량과 같은 컴퓨터 프로그램은 시뮬레이터를 훈련장으로 사용하여 현실에서 실행하기에는 위험하거나, 비용이 많이 들거나, 불가능한 시나리오를 테스트하면서 대규모로 세계와 상호작용할 수 있습니다.

세 번째 종류는 플래너입니다. 플래너는 행동을 출력합니다. 관찰과 목표가 주어지면, 플래너는 에이전트가 다음에 무엇을 해야 하는지에 대한 질문에 답합니다. 이것은 여러모로 렌더러의 역입니다. 렌더러가 행동을 입력으로 받아 관찰을 생성하는 반면, 플래너는 관찰을 입력으로 받아 행동을 생성하여 지각-행동 루프를 닫습니다. 비전-언어-행동 모델, 모델 기반 시스템, 그리고 새로운 World Action Model 물결은 모두 플래너, 즉 비구조화된 세계에서 로봇이 무엇을 해야 하는지 결정할 수 있는 시스템을 위한 시도입니다.

이 세 가지 범주는 오늘날 실제로 출시되고 있는 대부분의 것을 설명하며, 이들 간의 구분은 실제로 유용합니다. 그러나 범주는 근본적으로 분리되어 있지 않습니다. 세계가 어떻게 작동하는지에 대한 동일한 기본 지식(기하학, 물리, 동역학)이 그 모두 아래에 있습니다. 어떤 각도에서든 컵을 렌더링할 수 있는 모델은 원칙적으로 컵이 밀렸을 때 무슨 일이 일어나는지 시뮬레이션하고 컵을 집기 위한 손을 계획할 수 있어야 합니다. 점점 더, 가장 흥미로운 연구는 의도적으로 세 가지 범주 간의 경계를 모호하게 만듭니다.

Fei-Fei Li - inline image

GIF

시뮬레이션이 핵심인 이유

세 가지 범주 중에서 시뮬레이터는 가장 적은 대중의 주목을 받으면서도 가장 중요한 것입니다. 이 에세이는 이러한 비대칭성을 다룹니다.

렌더러는 단연코 상업적으로 가장 성숙했습니다. 많은 이미지 또는 텍스트-비디오 제품이 소비자 또는 기업 시장에서 빠르게 확장되고 있습니다. Google의 Nano Banana 모델은 잠재적으로 수억 명의 사용자에게 렌더러 수준의 이미지 생성을 제공했습니다. 기술은 실제이며, 시장도 실제입니다. 그러나 렌더러는 물리적 정확성보다 시각적 그럴듯함을 최적화하며, 그 한계는 중요합니다. 그 출력물은 아름답지만, 건물을 설계하거나 로봇을 훈련시키는 데 신뢰할 수 없습니다.

플래너는 가장 흥미롭고 가장 초기 단계에 있으며, 빠르게 진화하는 로봇 학습 분야와 밀접하게 연결되어 있습니다.** 이 분야는 지난 2년 동안 비디오에서 인상적으로 보이는 로봇 데모를 생산했지만, 해당 데모가 실제로 보여주는 것에 대한 솔직함이 필요합니다. 거의 모든 데모는 제한된 물체 세트와 짧은 작업 지평을 가진, 심하게 제약된 실험실 환경에 국한되었습니다. 실제 배치가 요구하는 복잡성, 가변성 또는 지속 시간에서 검증된 것은 없습니다. 설득력 있는 데모 릴과 주방, 창고 또는 수술실에서 안정적으로 작동하는 로봇 사이의 격차는 여전히 큽니다. 그럼에도 불구하고 상업적 베팅은 상당합니다. 자금이 풍부한 진입자들의 물결이 범용 계획 시스템을 출시하기 위해 경쟁하는 반면, 가장 큰 인프라 업체들은 더 광범위한 시뮬레이션 스택 위에 플래너를 위치시키고 있습니다. 계획할 수 있는 로봇은 일할 수 있는 로봇이며, 전체 산업은 가장 먼저 도달하기 위해 경쟁하고 있습니다.

시뮬레이션은 둘 사이의 다리입니다. 언어가 세계의 추상화이고 픽셀이 그것의 투영이라면, 기하학, 물리, 동역학은 세계 그 자체입니다. 시뮬레이터는 그 수준에서 작동해야 합니다. 즉, 시각적 외관(렌더러용)과 행동 결과(플래너용) 모두를 도출할 수 있는 구조적 백본이어야 합니다.

시뮬레이션을 마스터한 모델은 인간의 소비를 위해 픽셀로, 그리고 체화된 에이전트를 위해 행동 예측으로 그 이해를 투영할 수 있습니다. 렌더링만 마스터하거나 계획만 마스터한 모델은 어느 쪽도 할 수 없습니다. 상업적 표면적은 엄청납니다. NVIDIA의 Omniverse만 해도 회사가 추정하는 공장, 창고, 공급망 및 디지털 트윈에서 1조 달러 이상의 접근 가능한 시장을 목표로 합니다. 로봇 훈련, 자율 주행 차량 테스트, 건축 시각화, 엔지니어링 및 약물 발견은 모두 시뮬레이션 형태의 무언가에 의존합니다.

이 분야에서 가장 어려운 미해결 문제도 거기에 있습니다. 명시적 기하학, 재료 속성 및 물리적 주석이 있는 3차원 데이터는 렌더러가 훈련하는 인터넷 비디오보다 훨씬 더 드뭅니다. 시뮬레이션에서 사물이 어떻게 작동하는지와 현실에서 어떻게 작동하는지의 차이인 시뮬-투-리얼 격차는 지속됩니다. 생성형 시뮬레이터는 그 위에 새로운 위험을 도입합니다. AI 생성 기하학은 올바르게 보일 수 있지만, 의미 없는 물리를 생성하는 자기 교차 또는 잘못된 스케일을 포함할 수 있습니다. 강체, 변형 가능한 물체, 유체 및 직물이 모두 상호작용하는 대규모 다중 물리 시뮬레이션은 단일 도메인 시뮬레이션보다 훨씬 더 많은 비용이 듭니다.

World Labs에서 Marble은 이 영역으로의 첫 번째 움직임입니다.** 멀티모달 프롬프트(텍스트, 이미지, 비디오 또는 공간 스케치)를 받아 탐험 가능한 3D 환경을 생성하며, 시각적 탐험을 위한 가우시안 스플랫과 물리 엔진이 작동할 수 있는 충돌 메쉬를 함께 출력합니다. 그러나 Marble은 렌더링, 시뮬레이션 및 계획 간의 경계가 무너지기 시작하면서 이 분야 전체에서 쓰여지고 있는 훨씬 더 긴 호의 첫 번째 장에 불과합니다.

경계가 무너지고 있는 곳과 그 다음은 무엇인가

하지만 더 많은 것이 올 것입니다. 현재 이 분야에서 가장 중요한 패턴은 세 가지 범주가 서로 혼합되기 시작하고 있다는 것입니다. 공유된 통찰력은 세계를 렌더링하고, 시뮬레이션하고, 그 안에서 행동하는 데 필요한 지식이 대부분 동일하다는 것입니다. 앞선 예를 계속하면, 컵이 테이블 위에 어떻게 놓이는지(기하학, 재료 속성, 힘에 대한 반응 등)를 진정으로 이해하는 모델은 어떤 각도에서든 그 컵을 렌더링하고, 컵이 밀렸을 때 무슨 일이 일어나는지 시뮬레이션하고, 손이 컵을 집도록 계획할 수 있어야 합니다. 세 가지 범주는 단일한 근본적 이해의 세 가지 투영입니다.

예를 들어, 다양한 로봇 연구소의 소수이지만 증가하는 최근 연구는 (적어도 개념적으로) 사전 훈련된 비디오 렌더러가 공동 세계 및 행동 예측을 위한 백본으로 사용될 수 있음을 보여주었으며, 이는 하나의 모델이 무슨 일이 일어날지와 무엇을 해야 할지를 상상할 수 있도록 함으로써 렌더러와 플래너 사이의 다리를 암시합니다. World Labs의 Marble은 이미 단일 모델에서 가우시안 스플랫과 충돌 메쉬를 출력하여 렌더러와 시뮬레이터 사이의 경계를 해체합니다. 모든 수준은 수동적 출력에서 인터랙티브 시스템으로 이동하고 있으며, 렌더러는 행동 조건화되고, 시뮬레이터는 더 제어 가능하고 편집 가능한 세계를 생성하며, 플래너는 단순히 반응하는 것이 아니라 숙고하고 있습니다.

논리적 종착점은 통합된 세계 모델입니다. 즉, 사실적인 뷰를 렌더링하고, 물리적으로 정확한 구조를 생성하며, 행동 시퀀스를 계획하고, 다운스트림 소비자의 필요에 따라 출력 양식 간에 전환할 수 있는 하나의 기반 모델입니다. 우리는 여전히 수많은 어려운 도전에 직면할 것입니다. 데이터 상황은 고르지 않아, 렌더러는 인터넷 비디오가 풍부한 반면 시뮬레이터와 플래너는 3D 자산과 로봇 데모의 심각한 부족에 직면해 있습니다. 시각적 아름다움을 최적화하는 것은 로봇이나 고충실도 시뮬레이션에 필요한 정밀도를 희생할 수 있습니다. 단일 아키텍처 내에서 이러한 긴장을 조화시키는 것이 오늘날 세계 모델 연구에서 정의된 미해결 문제이며, 이것이 World Labs가 Marble을 계속 진화시키면서 착수하는 일입니다.

Fei-Fei Li - inline image

GIF

그러나 방향은 분명합니다. 1980년대 후반부터 이 분야가 계속해온 동일한 베팅, 즉 충분히 풍부한 세계 모델이 어떤 에이전트든 세계를 보고, 구축하고, 그 안에서 행동하는 데 필요한 전부라는 베팅이 지금 전체 연구 세대를 추진하고 있습니다. 이 '큰 베팅'에 무게를 실어주는 것은 이미 진행 중인 수렴입니다. 각각 자체적으로 수십억 달러 규모의 산업을 추진하고 형성해 온 세 개의 실이 별도의 연구 프로그램으로 시작되었지만 하나처럼 행동하기 시작했습니다. 종합하면, 그들 사이의 경계가 무너짐에 따라, 그들은 더 큰 무언가, 즉 기계 지능과 그것이 거주하는 물리적 세계 간의 관계, 즉 공간 지능의 긴 호를 재형성할 것입니다.

언어는 기계에게 그 세계에 대해 이야기할 수 있는 방법을 주었습니다. 세계 모델은 기계가 마침내 그것을 이해하고, 상상하고, 추론하고, 상호작용하게 하는 방법입니다.

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기