“Dünya, durum olan her şeydir.” — Ludwig Wittgenstein,
Tractatus Logico-Philosophicus
, 1921
Dünya, sözcüklerden ibaret değildir.
Daha önceki bir yazıda, mekânsal zekânın yapay zekânın bir sonraki sınırı olduğunu ve dünya modellerinin bu sınıra giden yol olduğunu savunmuştuk. Burada, World Labs ekibi ve ben, bir adım daha derine inmek istiyoruz: Şu anda inşa edilen ve ‘dünya modelleri’ olarak adlandırılan birçok şeyden hangi işlevsel parçalar aslında bu yeteneği oluşturuyor ve her birinin amacı ne?
Dil modelleri, makinelere kavramlar, kelime dağarcığı ve akıl yürütme konusunda olağanüstü bir hakimiyet kazandırdı; ancak fiziksel dünya, ister sanal ister gerçek olsun, farklı bir temel üzerinde işler. Dil modelleri metnin istatistiksel yapısını öğrenirken, dünya modelleri uzay ve zamanın istatistiksel yapısını öğrenir: ışığın bir yüzeye nasıl düştüğü, bir bahçenin hiçbir kameranın yakalamadığı bir açıdan nasıl göründüğü, nesnelerin kuvvete nasıl tepki verdiği ve fizik yasalarını nasıl izlediği.
Bu durum, “dünya modeli”ni günümüz yapay zekâsındaki en önemli ve en çok anlam yüklenen terimlerden biri haline getiriyor. Bilgisayarlı görü, robotik, pekiştirmeli öğrenme ve üretken yapay zekâ; her biri dünya modelleri inşa ettiğini iddia ediyor ve her biri bundan oldukça farklı bir şey anlıyor. Göz kamaştırıcı ama fiziksel olarak imkansız alevler üreten bir video modeli, oynanabilir bir oyunu doğaçlama yapan bir dil modeli ve yanmayı sadakatle simüle eden bir fizik motoru; hepsi aynı adla anılıyor.
Antik Yunanlılar dünyanın ateşten mi, sudan mı, yoksa bölünemez atomlardan mı oluştuğu konusunda hiçbir zaman fikir birliğine varamadılar çünkü “dünya” hiçbir zaman tek bir şey olmadı. Her zaman, belirli bir düşünürün akıl yürütmesi gereken herhangi bir bütünlüğün yerine kullanılan bir kavramdı. Yapay zekâ, alanın tam da kesinliğe ihtiyaç duyduğu bir anda aynı sorunu miras aldı.
Sınıflandırmanın altındaki döngü
Bu karışıklığı gidermek, söz konusu teknolojilerin herhangi birinden daha eski bir diyagramla başlıyor. Sutton ve Barto'nun referans kitabı da dahil olmak üzere pekiştirmeli öğrenme ders kitapları, bir ajanın bir dünyayla nasıl etkileşime girdiğini tanımlamak için onlarca yıldır aynı şemanın bir versiyonunu kullanmıştır. Bu şemanın resmi adı kısmen gözlemlenebilir Markov karar süreci veya kısaca POMDP'dir ve “dünya modeli” teriminin orijinal tanımı bu geleneğe aittir.
Bir insan, bir robot veya bir yazılım sistemi olabilen bir ajan, eylemler gerçekleştirir. Bu eylemler dünyanın durumunu etkiler. Ajan, durumu asla doğrudan görmez. Ajan, gözlemler yoluyla bilgi alır: retinaya düşen fotonlar, bir sensörden gelen okumalar, bir video karesindeki pikseller. Yeni gözlemler yeni eylemleri besler ve döngü devam eder.
“Durum” kelimesinin açıklanması gerekir çünkü anlamı alandan alana değişir. Bu, kimyagerin durumu, yani katı, sıvı ve gaz arasındaki fark değildir. Bu, fizikçinin ve robotikçinin durumudur: dünyada belirli bir anda olup bitenlerin, her nesne, her konum, her hız, her özellik dahil olmak üzere eksiksiz bir tanımı. Durum, dünyanın altında yatan gerçekliğidir; prensipte eksiksizdir, ancak içindeki hiçbir ajan tarafından asla doğrudan görülemez. Gözlemler, bir ajanın bu gerçekliğe dair kısmi görüşüdür. Eylemler ise ajanın buna yanıt olarak yaptıklarıdır.
Bu döngü — ajandan eyleme, duruma, gözleme ve geri — modern “dünya modeli” terimine teknik anlamını kazandıran yapıdır. İfadenin kendisi daha eskidir, Kenneth Craik'in 1943'te zihinlerin gerçekliğin “küçük ölçekli modellerini” çalıştırarak akıl yürüttüğü önerisine kadar uzanır ve 1980'lerin sonu ile 1990'ların başında sinir ağlarına taşınmıştır. Döngü ayrıca insanların bugün bu terimle ne kastettiğini de açıklar. Şu anda dünya modelleri olarak adlandırılan farklı şeyler, aslında aynı döngünün farklı yansımalarıdır. Her biri, döngünün farklı bir parçasını üretir.
Bir dünya modelinin üç işlevi
Birinci tür dünya modeli bir oluşturucudur (renderer). Bir oluşturucu, insan gözü için tasarlanmış pikseller biçiminde gözlemler üretir ve en önemli kalite görsel doğruluktur. Bir metin istemini sinematik bir drone çekimine dönüştüren bir video modeli bir oluşturucudur. Aynı şekilde Google'ın Genie 3'ü veya World Labs'ın kendi RTFM'si gibi, modelin kullanıcı girdisine bağlı olarak gerçek zamanlı kareler ürettiği etkileşimli bir sistem de öyledir. Model, üç boyutlu yapı hakkında açık bir anlayış taşımaz. Bir izleyicinin göreceği şeyi üretir, ne olduğunu değil. Drone çekimindeki binalar yukarıdan kusursuz görünebilir, ancak aşağıdaki şehirde araba kullanmaya kalkışırsanız dağılırlar.
İkinci tür bir simülatördür. Bir simülatör, durum üretir: insanların ve bilgisayar programlarının üzerinde hesaplama yapabileceği ve etkileşime girebileceği, geometrik, fiziksel veya dinamik olarak sadık bir dünya temsili. Oluşturucunun sözleşmesi tamamen görselken, simülatörün sözleşmesi yapısaldır; incelemeye dayanan geometri, Newton yasalarına saygı duyan fizik ve fizik yasaları göz önüne alındığında dünyanın olması gerektiği gibi davranan dinamikler talep eder. Bir simülatör aynı anda iki tüketiciye hizmet eder. Mimarlar, tasarımcılar, film yapımcıları ve oyun geliştiricileri gibi insan profesyoneller, görsel olasılığın ötesinde doğruluğa ihtiyaç duyarlar. Pekiştirmeli öğrenme ajanları, robot kontrolörleri ve otonom araçlar gibi bilgisayar programları, simülatörleri, gerçekte çalıştırılması tehlikeli, pahalı veya imkansız olacak senaryoları test ederek dünyayla büyük ölçekte etkileşime girebilecekleri eğitim alanları olarak kullanır.
Üçüncü tür bir planlayıcıdır. Bir planlayıcı, eylemler üretir. Bir gözlem ve bir hedef verildiğinde, bir planlayıcı ajanın bir sonraki adımda ne yapması gerektiği sorusunu yanıtlar. Bu, birçok yönden oluşturucunun tersidir. Oluşturucu girdi olarak eylemleri alıp gözlemler üretirken, planlayıcı girdi olarak gözlemleri alıp eylemler üreterek algı-eylem döngüsünü kapatır. Görme-Dil-Eylem modelleri, model tabanlı sistemler ve yeni Dünya Eylem Modelleri dalgası, planlayıcılara yönelik girişimlerdir: yapılandırılmamış bir dünyada bir robotun ne yapması gerektiğine karar verebilen sistemler.
Bu üç kategori, günümüzde fiilen sunulanların çoğunu tanımlar ve aralarındaki ayrım pratikte faydalıdır. Ancak kategoriler temelde ayrı değildir. Dünyanın nasıl çalıştığına dair aynı temel bilgi (geometri, fizik, dinamik) hepsinin altında yatar. Bir bardağı herhangi bir açıdan oluşturabilen bir modelin, prensipte, bardak itildiğinde ne olacağını simüle edebilmesi ve bardağı almak için bir el planlayabilmesi gerekir. Giderek artan bir şekilde, en ilginç araştırmalar bilinçli olarak üçü arasındaki sınırları bulanıklaştırmaktadır.
GIF
Simülasyon neden kilit taşıdır
Üç kategori arasında simülatör, en az kamuoyu ilgisini çeken ve en önemli olandır. Bu makale bu asimetriyi ele almaktadır.
Oluşturucu, açık ara en ticari olarak olgunlaşmış olanıdır. Bir dizi görüntü veya metinden videoya ürün, tüketici veya kurumsal pazarlarda hızla büyümektedir. Google'ın Nano Banana modeli, oluşturucu kalitesinde görüntü üretimini potansiyel olarak yüz milyonlarca kullanıcının eline vermiştir. Teknoloji gerçektir ve pazarlar gerçektir. Bununla birlikte, oluşturucular fiziksel doğruluktan ziyade görsel olasılık için optimize edilir ve bu tavan önemlidir. Çıktıları güzeldir, ancak bir bina tasarlamak veya bir robotu eğitmek için onlara güvenilemez.
Planlayıcı en ilgi çekici ve en yenisi olup, hızla gelişen robotik öğrenme alanıyla yakından bağlantılıdır.** Alan, son iki yıl içinde videolarda etkileyici görünen robotik demolar üretti, ancak bu demoların gerçekte ne gösterdiği konusunda açık sözlü olmak gerekir. Neredeyse tamamı, dar nesne kümeleri ve kısa görev ufukları ile ağır şekilde kısıtlanmış laboratuvar düzenekleriyle sınırlı kalmıştır. Hiçbiri, gerçek dünya dağıtımının gerektirdiği karmaşıklık, değişkenlik veya süre düzeyinde doğrulanmamıştır. İlgi çekici bir demo videosu ile bir mutfakta, depoda veya ameliyathanede güvenilir bir şekilde çalışan bir robot arasındaki boşluk hâlâ çok büyüktür. Yine de ticari bahisler oldukça önemlidir. İyi finanse edilmiş bir dizi yeni girişim, genel amaçlı planlama sistemlerini piyasaya sürmek için yarışırken, en büyük altyapı oyuncuları planlamayı daha geniş simülasyon yığınlarının üzerine konumlandırmaktadır. Plan yapabilen bir robot, çalışabilen bir robottur ve tüm endüstri, oraya ilk varan olmak için yarışmaktadır.
Simülasyon, ikisi arasındaki köprüdür. Dil, dünyanın bir soyutlamasıysa ve pikseller onun bir yansımasıysa, o zaman geometri, fizik ve dinamik dünyanın kendisidir. Bir simülatör bu düzeyde çalışmalıdır: hem görsel görünümün (oluşturucular için) hem de eylem sonuçlarının (planlayıcılar için) türetilebileceği yapısal omurga.
Simülasyonda ustalaşan bir model, anlayışını insan tüketimi için piksellere ve somutlaşmış ajanlar için eylem tahminlerine yansıtabilir. Yalnızca oluşturmada veya yalnızca planlamada ustalaşan bir model, bunların hiçbirini yapamaz. Ticari yüzey alanı çok büyüktür. NVIDIA'nın Omniverse'i tek başına, şirketin fabrikalar, depolar, tedarik zincirleri ve dijital ikizlerde trilyon doların üzerinde olduğunu tahmin ettiği toplam pazara hitap etmektedir. Robotik eğitimi, otonom araç testleri, mimari görselleştirme, mühendislik ve ilaç keşfi, simülasyon benzeri bir şeye bağlıdır.
Alanın en zor açık problemleri de orada yaşamaktadır. Açık geometriye, malzeme özelliklerine ve fiziksel açıklamalara sahip üç boyutlu veri, oluşturucuların üzerinde eğitim aldığı internet videosundan kat kat daha az bulunur. Simülasyondaki şeylerin davranışı ile gerçeklikteki davranışları arasındaki fark olan simülasyondan gerçeğe geçiş (sim-to-real) sorunu devam etmektedir. Üretken simülatörler, bunun üzerine yeni bir risk ekler: Yapay zeka tarafından üretilen geometri doğru görünebilir ancak anlamsız fizik üreten kendi kendine kesişmeler veya yanlış ölçek içerebilir. Katı cisimler, deforme olabilen nesneler, akışkanlar ve kumaşın tamamının etkileşime girdiği büyük ölçekli çoklu fizik simülasyonu, tek alanlı simülasyondan kat kat daha pahalı olmaya devam etmektedir.
World Labs'ta Marble, bu alandaki ilk hamlemizdir.** Multimodal istemleri (metin, görsel, video veya mekansal çizim) alır ve bir fizik motorunun üzerinde çalışabileceği çarpışma ağlarıyla birlikte görsel keşif için Gauss sıçramaları çıktısı vererek keşfedilebilir 3D ortamlar oluşturur. Ancak Marble, oluşturma, simülasyon ve planlama arasındaki çizgiler çökmeye başladıkça alan genelinde yazılan çok daha uzun bir yayın yalnızca ilk bölümüdür.
Sınırların çöktüğü yerler ve sırada ne var
Ancak daha fazlası gelecek. Şu anda alandaki en önemli eğilim, üç kategorinin birbiri içine geçmeye başlamasıdır. Ortak görüş, bir dünyayı oluşturmak, simüle etmek ve içinde eylemde bulunmak için gereken bilginin büyük ölçüde aynı olduğudur. Önceki örneğe devam edersek, bir bardağın bir masada nasıl durduğunu (geometrisi, malzeme özellikleri, kuvvete tepkisi vb.) gerçekten anlayan bir model, o bardağı herhangi bir açıdan oluşturabilmeli, bardak itildiğinde ne olacağını simüle edebilmeli ve bir elin bardağı alması için plan yapabilmelidir. Üç kategori, tek bir temel anlayışın üç yansımasıdır.
Örneğin: çeşitli robotik laboratuvarlarından az ama artan sayıda yeni çalışma, en azından kavramsal olarak, önceden eğitilmiş bir video oluşturucunun, ortak dünya ve eylem tahmini için omurga olarak kullanılabileceğini göstermiştir; bu da bir modelin ne olacağını ve ne yapacağını hayal etmesine izin vererek oluşturucu ile planlayıcı arasında bir köprü olduğunu düşündürmektedir. World Labs'ın Marble'ı, oluşturucu ve simülatör arasındaki sınırı ortadan kaldırarak, zaten tek bir modelden Gauss sıçramaları ve çarpışma ağları çıktısı vermektedir. Her seviye, pasif çıktıdan etkileşimli sisteme doğru ilerliyor; oluşturucular eylem koşullu hale geliyor, simülatörler daha kontrol edilebilir ve düzenlenebilir dünyalar üretiyor ve planlayıcılar sadece tepki vermek yerine muhakeme yapıyor.
Mantıksal son nokta, birleşik bir dünya modelidir: fotogerçekçi görünümler oluşturabilen, fiziksel olarak doğru yapı üretebilen ve eylem dizileri planlayabilen, aşağı yönlü tüketicinin ihtiyacına bağlı olarak çıktı biçimleri arasında geçiş yapan tek bir temel model. Hâlâ bir dizi zorlu zorlukla karşı karşıyayız. Veri durumu dengesizdir; oluşturucular internet videosuyla dolup taşarken simülatörler ve planlayıcılar ciddi 3D varlık ve robot gösterimi sıkıntısı çekmektedir. Görsel güzellik için optimize etmek, bir robotun veya yüksek kaliteli simülasyonun ihtiyaç duyduğu hassasiyeti feda edebilir. Bu gerilimleri tek bir mimari içinde uzlaştırmak, bugün dünya modeli araştırmalarındaki tanımlayıcı açık problemdir ve World Labs, Marble'ı geliştirmeye devam ederken tam da bunu yapmaya koyulmaktadır.
GIF
Ancak yön açıktır. Alanın 1980'lerin sonlarından beri yaptığı aynı bahis (yeterince zengin bir dünya modelinin, herhangi bir ajanın dünyaları görmesi, inşa etmesi ve içlerinde eylemesi için ihtiyaç duyduğu her şey olduğu fikri) şimdi bir nesil araştırmayı yönlendiren bahistir. Bu “büyük bahse” ağırlık veren şey, halihazırda devam eden yakınsamadır: her biri kendi başına milyar dolarlık endüstrileri yönlendiren ve şekillendiren, ayrı araştırma programları olarak başlayan üç iplik, tek bir iplik gibi davranmaya başlamaktadır. Bunlar bir arada ele alındığında, aralarındaki sınırlar çöktükçe, daha büyük bir şeyi yeniden şekillendireceklerdir: makine zekası ile içinde yaşadığı fiziksel dünya arasındaki ilişki - mekansal zekanın uzun yayı.
Dil, makinelere bu dünya hakkında konuşmanın bir yolunu verdi. Dünya modelleri, makinelerin nihayet onu anlamaya, hayal etmeye, akıl yürütmeye ve onunla etkileşime girmeye geleceği yoldur.







