YouMind
Oturum aç

Depolama ucuz, dikkat pahalı. Aradaki farkı avantaja çeviren sistemi kullanıyor musunuz?

@S_BatMan
İNGILIZCE26 May 2026
1.3M
305
37
11
179

TL;DR

19 farklı yapay zeka sistemi üzerinde yapılan analizler, en etkili ajanların bağlamı yönetmek için katmanlı bellek mimarilerini kullandığını ortaya koyuyor. Sıcak, ılık ve soğuk verileri birbirinden ayıran bu sistemler, veri erişimini optimize eder ve gürültüyü en aza indirir.

Katmanlamanın Getirisini Sağlayan Asimetri

Ajan belleği tasarımında tek bir şeyi değiştirecek olsanız, şunu yapın: depolama maliyeti ile dikkat maliyetini aynı şeymiş gibi ele almayı bırakın.

Bunu 19 sistem üzerinde derinlemesine inceledim ve sürekli karşıma çıkan bulgu şu: belleği iyi yöneten sistemler, mutlaka en gelişmiş erişim (retrieval) yöntemine sahip olanlar değil. Bunun yerine, hangi anıların (memory) isteme (prompt) dahil edilmesi gerektiğini çözmüş olanlar. Bu farklı bir problem ve farklı bir çözümü var.

Depolama ucuzdur. Dikkat pahalıdır. 128k bağlamlı bir modelin 110k vasat bağlam okuması, ampirik olarak, aynı modelin 8k özenle seçilmiş bağlam okumasından daha iyi bir ajan değildir. Bu konudaki araştırma tutarlıdır: bağlam gürültüyle doldukça erişim kalitesi düşer ve bu düşüş doğrusal değildir. Model, alakasız materyali basitçe görmezden gelmez. Onu işler ve bu işlem, sinyali bastırır.

Depolamada bu özellik yoktur. Veritabanında duran bir gerçeği saklamanın hiçbir maliyeti yoktur. Maliyet, ancak onu alıp isteme yüklediğinizde ortaya çıkar. Bu da sorunun "Bunu depolamalı mıyım?" değil, "Bunu almalı mıyım ve eğer alacaksam ne zaman?" olduğu anlamına gelir.

Katmanlamanın temelinde işte bu yeniden çerçeveleme yatar. Farklı bellek öğelerinin farklı erişim kalıpları vardır. Bir ajanın her turda ihtiyaç duyduğu şeyler: kullanıcının adı, mevcut projesi, belirtilmiş tercihleri. Sık sık ama her zaman değil ihtiyaç duyduğu şeyler: son kararlar, açık sorular, son birkaç oturumdan epizodik gerçekler. Gerektiğinde bulunabilmeli ama asla her turu yüklememeli: üç ay önceki toplantı notları, tamamlanmış görevler, ham transkriptler, tek seferlik referans materyali.

Düz bir depo (flat store) bu üç kategoriyi de aynı şekilde ele alır. Sıcak öğeler, soğuk öğelerin arama maliyetini öder. Soğuk öğeler, istemi gürültüyle şişirir. Öğelerin daha alakalı hale geldikçe yükselmesi (graduation) için bir mekanizma yoktur ve daha az alakalı hale geldikçe yaşlanıp çıkması (aging out) için de bir mekanizma yoktur. İşletim sistemi benzetmesi birebirdir: CPU'lar L1, L2, L3, RAM, SSD ve diske sahiptir, çünkü baytlar farklı değildir, erişim sıklığı katbekat farklıdır. İncelediğim 19 sistemden 7'si, ben bakmaya başlamadan önce zaten açık bir katmanlama yapmıştı. Bunlardan ikisini ayrıntılı olarak anlamakta fayda var.

Referans Uygulama Olarak MemoryOS

MemoryOS, 19 sistem içinde katmanlı belleğin en net uygulamasıdır. Her biri farklı bir veri şekline, farklı bir gecikme bütçesine ve farklı bir role sahip üç katman.

Kısa vadeli katman, maksimum 10 QA çifti uzunluğunda bir Python deque'dir. Gömmeler (embedding) yok, arama dizini yok, ısı takibi yok. Saf konuşma ham maddesidir, son on alışveriş, mikrosaniye gecikmeyle kullanılabilir. Deque dolduğunda, en eski çift orta vadeli katmana akar.

Orta vadeli katman, 2000 oturuma kadar tutar. Her oturum bir özet, bir gömme, bir anahtar kelime kümesi ve ısı sayaçları taşır. Katman, Faiss ile indekslenir ve kosinüs benzerliği ile aranır. Katman kapasiteye ulaştığında, en soğuk oturumlar çıkarılır (eviction). Bir oturum yeterince ısındığında, uzun vadeli katmana yükseltilir (promotion).

Uzun vadeli katman, 90 boyutlu bir psikoloji ve uyum şeması, biri kullanıcı gerçekleri, diğeri asistan gerçekleri için olmak üzere her biri maksimum 100 girişle sınırlandırılmış iki bilgi tabanı deque'sidir. Bu, kalıcı katmandır, oturumlar arasında hayatta kalır ve kullanıcının dayanıklı modelini taşır.

Yükseltmeyi yöneten ısı formülü on iki satırlık Python kodudur. Üç sinyal: ziyaret sıklığı (LFU benzeri), etkileşim derinliği (konuya katılımın bir göstergesi) ve 24 saatlik yarı ömre sahip üstel azalma (recency decay). Bir segment, 5,0'da yükseltme eşiğini geçer. Yükseltmeden sonra, ziyaret ve etkileşim sayaçları sıfırlanır ve ısı kabaca 1,0'a geriler.

Gözden kaçması kolay tasarım kararı: ısı, yükseltmeyi kontrol eder, erişimi değil. Erişim, tamamen anlamsaldır, orta vadeli gömmeler üzerinde kosinüs benzerliği. Isı, bir segmentin uzun vadeli katmana geçip geçmeyeceğine karar veren bir arka plan sinyalidir. İki konu birbirinden ayrılmıştır ve bu ayrıştırma, formülün kendisinden daha önemlidir.

MemoryOS'un masada bıraktığı şeyleri de belirtmek gerek. Katsayılar 1,0'da sabit kodlanmıştır, gerçek kullanım kalıplarından ağırlıkları öğrenmek için bir mekanizma yoktur. Düşürme (demotion) yolları yoktur; bir şey uzun vadeli katmana ulaştığında orada kalır. Ve formül, sıklığı önemin üzerinde optimize eder. Kritik ama nadir bir gerçek, bir partnerin adı, tıbbi bir durum, katı bir kısıtlama, yalnızca bir kez ortaya çıkarsa yükseltme eşiğini asla geçemeyebilir. Orta vadeli katman segmenti çıkardığında, gerçek kaybolur.

Hindsight'ın Teori Türevli Katmanları

Hindsight, tamamen farklı bir başlangıç noktasından aynı üç katmanlı yapıya ulaşır. MemoryOS işletim sistemi önbellek teorisinden yararlanırken, Hindsight bilişsel bilimden yararlanır.

Üç katman Dünya (World), Deneyim (Experience) ve Gözlemlerdir (Observations). Dünya, evren hakkında nesnel iddiaları, temel gerçekleri, her zaman açık, uzun ömürlü tutar. Deneyim, sistemin kendi birinci şahıs eylemlerini, epizodik kaydı tutar. Gözlemler, Dünya ve Deneyim gerçeklerinden türetilen, kaynak bellek kimlikleri, bir kanıt sayısı ve inancın nasıl geliştiğini izleyen bir geçmiş alanı taşıyan birleştirilmiş inançları tutar.

Her üç katman da, bir gerçek türü ayırt edici ile ayrılmış olarak aynı veritabanı tablosunda yaşar. Gerçek türü başına kısmi HNSW indeksleri oluşturulur. Şema birleşiktir; erişim kalıpları birleşik değildir.

Hindsight'da yükseltme, sayaç odaklı değildir. Bu, toplu LLM odaklı birleştirmedir (consolidation). Yeni bir gerçek yazıldığında, bir async işlemler tablosuna sıraya alınır. Bir arka plan çalışanı, mevcut örtüşen gözlemlerin yanında yeni gerçekleri getirir, bir toplu istem oluşturur ve modelden oluşturma, güncelleme ve silme işlemlerini ister. Kaynak bellekler, yeniden işlemeyi önlemek için bir birleştirilme-zamanı damgası ile damgalanır. Erişilme sıklığı ne olursa olsun, her yeni gerçek, Gözlemler katmanına yükseltme için değerlendirilir.

MemoryOS'tan temel fark budur. Üst katman yükseltmesini ısı yerine birleştirmeye bağlayarak Hindsight, kritik ama nadir gerçekler için kör noktayı önler. Tek bir birleştirme geçişi, her yeni gerçeği dikkate alır. Bir şeyin yükselip yükselmemesi için sıklık alakasızdır.

Açıkça söylemek gerekirse: iki sistem, farklı temel prensipler, farklı uygulama dilleri, farklı hedef kullanım durumları ve her ikisi de altta ham materyal, ortada bir çalışma katmanı ve üstte sentezlenmiş kalıcı bir katman olmak üzere üç katmana ulaşır. Her ikisi de async yükseltme kullanır. Her ikisi de alt katmanlara kadar kaynak (provenance) taşır. Yazılım mimarisinde yakınsak evrim (convergent evolution) buna benzer ve bir kalıbın yük taşıyıcı olduğuna dair bildiğim en güçlü sinyaldir.

@supermemory'nin Tür-Koşullu Katmanlaması

supermemory, yönetilen API dağıtım şeklinde çalışır ve bu, mimariyi değiştirmeden uygulamayı değiştirir. Üç katman statik profil, dinamik profil ve belge ve parça deposudur.

Statik profil, istikrarlı uzun vadeli gerçekleri, sıcak katmanı tutar. Profil uç noktasından statik bir dizi olarak döndürülür, uçta (edge) önbelleğe alınır ve gecikme bütçesi kabaca 50ms'dir. Dinamik profil, yakın ve epizodik bağlamı, ılık katmanı tutar. Birçok giriş, bir TTL (yaşam süresi) belirleyen bir forgetAfter alanı taşır. Belge ve parça deposu, gerektiğinde arama uç noktaları üzerinden sorgulanan soğuk katmandır.

Katman ataması yazma zamanında gerçekleşir. Bir çıkarma LLM'i, gelen her belleği bir isStatic boolean ve isteğe bağlı olarak bir forgetAfter değeri ile sınıflandırır. Sınıflandırma, tüm tüketiciler için tek tip, kapalı bir çıkarma istemi tarafından zorlanır.

Yönetilen API dağıtım şekli, bir süreç içi tasarımcının doğrudan kopyalayamayacağı ancak anlaması gereken üç şeyi mümkün kılar. Soğuk katman verileri daha ucuz donanımda, ham baytlar için nesne depolamada, meta veriler ve parçalar için standart bir ilişkisel depoda, sıcak profil ise uçta ayrı olarak önbelleğe alınmış olarak durabilir. Sıcak katman, arama yolundan ayrı, kendi SLA'sına sahip kendi uç noktasını alır. Ve çıkarma istemi merkezileştirilmiştir, bu da katman atamasının, ajan başına sınıflandırmanın nadiren olduğu kadar tutarlı olduğu anlamına gelir.

Ödünleşimler gerçektir. Uzak bir sıcak katman, yalnızca ağ hızlıysa hızlıdır. Ajan, motorun katman sınıflandırmasını geçersiz kılamaz. Çıkarma istemi bir kara kutudur. Ancak mimari desen (sıcak katmanın kendi uç noktası olması, soğuk katmanın daha ucuz donanımda olması, katman atamasının yazma zamanında yapılması), dağıtım şekli aynı olmasa bile kopyalamaya değerdir.

Yükseltme ve Sabit Tipoloji

mem9, katmanlamanın ne olmadığını netleştiren karşıt örnektir.

mem9'un üç değerli bir bellek türü sütunu vardır: pinned, insight ve digest. Pinned bellekler, açık içerik yazma yollarıyla atanır, manuel olarak oluşturulur, LLM uzlaştırmasından korunur. Insight'lar, her LLM çıkarımlı yazma ile atanır, değiştirilebilir, sürümlenebilir, yerini başkası alabilir. Her ikisi de aynı RRF puanlaması ile aynı hibrit geri çağırmaya katılır. Tür alanı, bir erişim filtresi veya katman sinyali değil, bir yazma koruma bayrağıdır.

Bu tipolojidir, katmanlama değil. Ayrım önemlidir çünkü ikisi kolayca karıştırılabilir. Tipoloji, yönetişimi tanımlar: bu belleği kim, hangi koşullar altında değiştirebilir? Katmanlama, erişim kalıplarını tanımlar: bu belleğe ne sıklıkla ihtiyaç duyulur ve hangi depolama temsili bu sıklığa en iyi hizmet eder? Bir sistem her ikisine de sahip olabilir. supermemory'nin isStatic'i bir katman sinyalidir; ayrı bir isInference bayrağı ise bir yönetişim sınıfına daha yakındır. Ancak bunları birbirine karıştırmak pratikte en fazla belirsizliği üretir.

Bellek satırlarınıza bir tür alanı eklerken kendinize sormanız gereken soru, alanın bir erişim kalıbını mı yoksa bir yönetişim sınıfını mı tanımladığıdır. Eğer bir erişim kalıbıysa, katmanlama inşa ediyorsunuzdur. Eğer bir yönetişim sınıfıysa, tipoloji inşa ediyorsunuzdur. Her ikisi de kullanışlıdır. Aynı şey değillerdir.

Düz Deponun Size Maliyeti

Düz bir bellek deposu çalıştırmanın dört somut sonucu vardır.

Sıcak yol, soğuk yolun arama maliyetini öder. Her erişim, aynı öğeler üzerinde aynı indeksi tarar. Kullanıcının adını arayan ajan, altı ay önceki bir toplantı notunu arayan ajanla aynı arama maliyetini öder. Küçük ölçekte bu görünmezdir. Ölçekte ise bir gecikme sorunudur.

Soğuk yol, istemi gürültüyle şişirir. Erişim, anlamsal olarak yakın öğeleri döndürür; bu, mevcut bağlamı, yerini başkasının aldığı gerçekleri ve mevcut turla alakasız ancak gerçekte doğru olan materyali içerir. Model bunların hepsini işler. Depo büyüdükçe bağlam penceresindeki sinyal-gürültü oranı düşer.

Öğelerin yükselmesi için bir mekanizma yoktur. Bellek statik değildir. Bir ilişkinin başlarındaki geçici bir epizodik gerçek, zamanla kullanıcının tercihleri veya kısıtlamaları hakkında dayanıklı bir sinyal haline gelebilir. Düz bir depo, bu geçişi fark etmek için herhangi bir mekanizma sunmaz. Öğe, alaka düzeyi nasıl değişmiş olursa olsun, yazıldığı temsilde kalır.

Öğelerin yaşlanıp çıkması için bir mekanizma yoktur. Düşürme, silme değildir. Bayat materyali kaldırmak isteyen düz bir depo, onu silmek zorundadır. Katmanlı bir depo, onu daha soğuk bir temsile taşıyabilir, hala bulunabilir, artık sıcak yolu yüklemez. Düz depo, katmanlı deponun sahip olmadığı ikili bir seçimi zorlar.

Net Sonuç

19 sistemden 18'i katmanlama uygular, buna işaret eder veya bunun için açık öneriler sunar. İstisna mem9'dur; farklı bir sorunu çözen bir tipoloji katmanına sahiptir ve üzerine katmanlama eklenmesinden fayda sağlayacaktır.

Ajan belleğini sıfırdan inşa ediyorsanız, 19 sistemin işaret ettiği ilerleme şudur. Ajanın her turda neye ihtiyacı olduğunu belirleyin, bu sizin sıcak katmanınızdır. Sık sık ama her zaman değil neye ihtiyacı olduğunu belirleyin, bu ılık katmanınızdır. Gerektiğinde bulması gereken ancak asla her turu yüklememesi gereken şeyi belirleyin, bu soğuk katmanınızdır. Bir yükseltme mekanizması seçin: MemoryOS gibi ısı tabanlı, Hindsight gibi LLM yargısı veya supermemory gibi çıkarma zamanı sınıflandırması. Bir düşürme mekanizması seçin: zaman azalması, TTL veya tazelik kategorileri. Yükseltme ve erişim puanlamasını başlangıçta ayrı tutun, ayrıştırmayı eklemek, çözmekten daha kolaydır. Sentezlenmiş bir inancın nereden geldiği sorusuna her zaman cevap verebilmek için üst katmanlardan alt katmanlara kadar kaynağı (provenance) takip edin.

19 sistem pek çok konuda hemfikir değil. Ancak bu konuda hemfikirler: Tek bir düz bellek deposu, önemsiz olmayan herhangi bir ajan bellek sistemi için yanlış varsayılandır.

Depolama ucuzdur. Dikkat pahalıdır. Farktan yararlanan sistemi inşa edin.

Bu Makaleyi ilginç bulduysanız lütfen paylaşın

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet