YouMind
Oturum aç

Kökeni olmayan bir gerçek, ıssız bir adadır. Her hafıza neden kaynağını taşımalıdır?

@S_BatMan
İNGILIZCE18 May 2026
1.2M
265
18
6
133

TL;DR

Bu makale, RAG sistemlerinde köken bilgisinin kritik rolünü incelemekte; halüsinasyonları önlemek ve denetlenebilir bir yapay zeka hafızası sağlamak için altı seviyeli veri takibini ve üç olgunluk aşamasını detaylandırmaktadır.

Tam metin aşağıda Türkçe'ye çevrilmiştir. Markdown yapısı, bağlantılar, teknik terimler ve marka adları korunmuştur.


Üretimde bir yıldır çalışan düz bir RAG sistemiyle oturun ve ona dört soru sormayı deneyin. "Bunu neden söyledin?" Model, müşterinin sözleşme yenileme tarihi hakkında kendinden emin bir cevap üretti, ancak kaynak maddeye giden iz mevcut değil. "Bu iddiayı yeniden doğrula -- kaynak değişti." Sözleşme geçen hafta değiştirildi. Ondan türetilen her bilgi şüpheli hale geldi. Onları bulamıyorsunuz çünkü hangi belgeden geldiklerini bilmiyorlar. "Bu iki çelişkili bilgi arasında karar ver." Biri Alex'in Google'da çalıştığını söylüyor, diğeri Stripe'da. İkisinde de bir güven puanı veya kaynak zaman damgası yok. Yazmanın güncelliğinin, kanıtın güncelliğiyle hiçbir ilgisi yok. "Bu halüsinasyonu ilişkilendir." Model toplantının Perşembe günü olduğunu söyledi. Perşembe günü hiçbir toplantı yoktu. LLM'in tarihi uydurup uydurmadığını veya bellekteki kötü verilerin onu yanıltıp yanıltmadığını söyleyemezsiniz.

Bu dört başarısızlığın tek bir ortak nedeni var. Her biri eksik bir sütundur. Bir kaynak tanımlayıcı, bir yakalama zaman damgası, bir güven puanı, bir yanıt alıntı günlüğü. Her biri yazma anında birkaç bayta mal olur. Bunlara sahip olmamanın maliyeti sınırsızdır: her iddia denetlenemez, her çelişki çözülemez, her halüsinasyon izlenemez.

19 sistem genelinde desen tutarlıdır. En güçlü uygulamalar, kaynağı bir mahkemenin delile davrandığı gibi ele alır -- her iddia, kesintisiz bir el değiştirme zinciriyle gelir ya da hiç gelmez. En zayıfları hiçbirini taşımaz ve üretimde bir şeyler ters gittiğinde bunun bedelini her seferinde öder. Bu yazı, derlemin ortaya çıkardığı altı kaynak düzeyini, bunları ayıran üç uygulama olgunluğu katmanını ve bunu en başından doğru inşa etmenin dürüst maliyetini ele alıyor.

Altı düzey, tek disiplin

19 sistemi arka arkaya okuduğunuzda, altı farklı kaynak düzeyi kendini ayırıyor. Bunlar bir hiyerarşi değil; birbirlerine diktirler. Bir sistem, nedensel kaynak olmadan kaynak kaynağına sahip olabilir. Güven puanlaması olmadan sürümlemeye sahip olabilir. En güçlü uygulamalar altısını da kapsar. En zayıflarının hiçbiri hiçbirini kapsamaz.

Kimlik, "tam olarak hangi bilgi?" sorusunu yanıtlar. OpenContext, alım anında her bağlam parçası için UUID'ler oluşturur ve bunları aracının yanıtlarda doğrudan kullanabileceği bir alıntı şeması olarak sunar. Tanımlayıcı, yeniden adlandırmalardan, taşımalardan ve yeniden düzenlemelerden sağ çıkar çünkü yola değil, içeriğe bağlıdır. mem9, her satırda sabit bir bellek kimliği ve If-Match eşzamanlılık koruması ile açık bir sürüm sayacı taşır. Kimlik kaynağı olmadan, işler ters gittiğinde ne hakkında konuştuğunuzu bile adlandıramazsınız.

Kaynak, "nereden geldi?" sorusunu yanıtlar. Hindsight, her gözlemde kaynak türünü ve tanımlayıcısını kaydeder, böylece sistem belirli bir bilginin hangi konuşma veya belgeden üretildiğini yanıtlayabilir. mem9, her satırda kaynak, aracı kimliği ve oturum kimliği taşır. Supermemory, anıların yanında belge kimliklerini saklar. Kaynak kaynağı olmadan, bir kaynak değiştiğinde güncellemeleri basamaklandıramazsınız çünkü hangi bilgilerin ona bağlı olduğunu bilemezsiniz.

Nedensel, "hangi aracı adımı bunu kullandı?" sorusunu yanıtlar. Hindsight, alınan ve kullanılan her bilgiyi, tam alma bağlamıyla (hangi alıcının onu yüzeye çıkardığı, hangi sırayı aldığı ve aracının onu gerçekten tüketip tüketmediği) bir gözlem katmanında yakalar. Moraine, her iz adımını kendi kaynak kaydı olarak ele alır ve aracının tüm yürütmesini, kaynak adreslenebilir olaylar dizisi olarak kurtarılabilir hale getirir. Nedensel kaynak olmadan, "sistem bu bilgiyi aldı" ile "aracı bu yanıtı üretmek için bu bilgiyi kullandı" arasında ayrım yapamazsınız.

Yakalama güveni, "bunu yazarken ne kadar emindik?" sorusunu yanıtlar. Graphify, bilgi grafiğindeki her kenarı üç düzeyli yakalama güveniyle işaretler: belirleyici çıkarımlar için CONFIRMED (ONAYLANDI), yüksek güvenli LLM çıkarımları için LIKELY (MUHTEMEL) ve belirsiz iddialar için AMBIGUOUS (BELİRSİZ). AMBIGUOUS kenarlar, sessizce bilgi olarak ele alınmak yerine insan incelemesi için "bilgi boşlukları" olarak yüzeye çıkar. Hindsight, her gözlemde, tazelik yaşam döngüsü boyunca zamanla azalan bir güven puanı taşır -- taze gözlemlere güvenilir, bayat olanların ağırlığı azaltılır veya emekliye ayrılır. mem9, önce gölge modunda yakın yinelenen algılama çalıştırır, mühendis eşiği gerçek verilerden kalibre edene kadar puanları kaydeder ancak bunlara göre hareket etmez. Yakalama güveni olmadan, belirsiz bilgiler ve kesin bilgiler eşit ağırlıkla alınır ve aracı sağlam bir iddia ile eğitimli bir tahmin arasında ayrım yapamaz.

Sürümlenmiş, "daha önce neye inanıyorduk?" sorusunu yanıtlar. Supermemory, belleği, yazılı kenarları (güncellemeler, genişletmeler, türetmeler) olan sürümlenmiş bir DAG olarak ele alır ve her inanca taahhüt geçmişi verir. mem9, yazma yolunu böler: insan düzenlemeleri için yerinde değişiklik, yeni içeriğin eskisini anlamsal olarak değiştirdiği LLM odaklı yeniden yazmalar için ekle-ve-arşivle. Tolaria, Git'in sürüm geçmişini tamamen taşımasına izin verir ve tek satırlık farkları birinci sınıf, kullanıcıya yönelik bir yapı olarak ele alır. Sürümlenmiş kaynak olmadan, sistemin Salı günü neye inandığına geri dönemezsiniz çünkü eski inançlar arşivlenmek yerine silinir.

Karşılıklı, "bu kaynağı hangi diğer bilgiler paylaşıyor?" sorusunu yanıtlar. llm-wiki, dört sinyalli alaka grafiğinde doğrudan bağlantının üzerinde kaynak örtüşmesini tartar -- aynı ham belgeden gelen iki sayfanın, doğrudan bir wiki bağlantısı olan iki sayfadan daha güçlü bir şekilde ilişkili olduğu varsayılır çünkü LLM çapraz bağlantıda güvenilmezdir ancak kaynakların ön yüzü mekanik olarak korunur. EdgeQuake, derlem genelinde varlıklar ve ilişkiler üzerinde kaynak kimliklerini biriktirir, böylece aynı varlığın farklı kaynaklardan tekrarlanan bahsedilmeleri kaynak ağırlığını güçlendirir. second-brain, kaynağı sözcüksel dizin birleşik anahtarının bir parçası olarak taşır ve tek bir belgenin birden çok iş hattından bağımsız olarak indekslenmesine izin verir. Karşılıklı kaynak olmadan, "bana bu sistemde aynı konuşmadan gelen her şeyi göster" veya "bu belgeden başka ne öğrendik?" sorularını yanıtlayamazsınız.

Altı düzey birbirine diktir ancak birbirlerini güçlendirirler. Kaynak kaynağı, kimlik olmadan işe yaramaz (izini sürebilmek için önce bilgiyi adlandırmanız gerekir). Sürümleme, güven olmadan daha zayıftır (düzenlemelerin soyunu bilirsiniz ancak sistemin bunların herhangi biri hakkında ne kadar emin olduğunu bilemezsiniz). Karşılıklı sorgular, önce kaynağın mevcut olmasına bağlıdır. Altısını da taşıyan sistemler, belleği sessizce çürümeyen sistemlerdir.

Üç uygulama olgunluğu katmanı

Derlem, kaynağın nerede yaşadığına ve okuma zamanında ne yapabileceğine göre üç katmana ayrılır.

Katman 1, çoğu ekip için başlangıç noktası olan kaynaksız RAG'dir. İçerik ve bir gömme ile düz vektör depoları. Kaynak sütunu yok, güven puanı yok, sürüm geçmişi yok. Bir bilgi alındığında, metin ve bir benzerlik puanı alırsınız. Nereden geldiğini, sistemin bu konuda ne kadar emin olduğunu veya yerini daha iyisinin alıp almadığını izleyemezsiniz. Buradan başlayan her sistem zamanla Katman 2'ye doğru ilerlemiştir.

Katman 2, kaynağı satırda taşır. Kaynak kimliği, güven, sürüm -- tümü bilginin yanında sütunlar olarak bulunur. mem9 burada, her satırda kaynak, aracı kimliği, oturum kimliği ve sürüm ile bulunur. Supermemory'nin sürümlenmiş DAG'ı Katman 2 yapısıdır. Graphify'nin üç düzeyli kenar güveni Katman 2 disiplinidir. Kaynak sorgular için mevcuttur ancak alma sonuçlarını otomatik olarak süslemez. Onu kullanan sorguyu yazmanız gerekir.

Katman 3, arayanın sormasına gerek kalmadan okuma zamanı sonuçlarını kaynak bağlamıyla süsler. Hindsight burada referanstır -- alınan her bilgi, kaynak türü, güven puanı, tazelik durumu ve alıcı başına sıralama zaten eklenmiş olarak gelir. Sonucu tüketen aracı, kaynağı ayrı bir arama olarak değil, bilginin bir parçası olarak görür. mem9'un kaynak-dönüş süslemesi, Katman 2 ve Katman 3 arasında yarı yolda durur ve okuma zamanı bağlamını bir Katman 2 şemasına aşılar.

Geçiş tek yönlüdür. Hiçbir sistem Katman 3'te başlamaz ve kaynak disiplinini kaldırmaya karar vermez. Sütunlar, mevcut oldukları anda değerlerini kanıtlarlar. Bugün bir bellek sistemi tasarlıyorsanız, soru "kaynağa ihtiyacım var mı?" değil, "seçtiğim katmanın üzerindeki her katmana daha sonra ulaşmanın, şimdi yerleştirmekten daha zor olduğunu bilerek hangi katmandan başlamak istiyorum?" sorusudur.

Uyarıcı örnek: hesaplanmış ve atılmış

Understand-Anything, güven için alt yapı mevcutken ancak onu kaydedecek sütun yokken ne olduğunu gösterir. Sistem, belirleyici kenarları (bir proje tarayıcı tarafından kaynak dosyalardan çözümlenir) çıkarılmış kenarlardan (anlamsal analiz sırasında bir LLM tarafından tahmin edilir) ayırır. Bu bilgi gerçek ve anlamlıdır -- yapısal bir içe aktarma kenarı, kod dışı bir çıkarımdan daha yüksek güveni hak eder. Ancak her ikisi de grafikte aynı olan 0,7 ağırlığında saklanır. Güven sinyali yazma zamanında hesaplanır ve kalıcılıktan önce atılır.

Bir güven alanı eklemek, büyük bir bilgi kalitesi getirisi olan küçük bir değişiklik olacaktır. Sistem hangi kenarların sağlam ve hangilerinin tahmin olduğunu zaten bilir. Sadece, önemli olduğu yerde -- daha sonra, aracının aralarında ayrım yapması gerektiğinde alınacak satırda -- ayrımı kaydetmez. Bu desen, derlemdeki birden çok sistemde görülür: bilgi yazma zamanında mevcuttur, yakalaması ucuzdur ve sonra kimse sütunu eklemediği için kaybolur.

Bunu doğru inşa etmenin dürüst maliyeti

Kaynak, baytlara mal olur. Bir kaynak kimliği, bir güven puanı, bir sürüm sayacı -- her biri satır başına birkaç alan ekler. Ölçekte bu önemlidir, ancak üretimde bir şeyler ters gittiğinde ve sistemin neden yanlış bir cevap ürettiğini izleyemediğinizde bunlara sahip olmamanın maliyetinden çok daha az önemlidir.

Hesaplama maliyeti beklenenden daha düşüktür. Güven puanlaması tipik olarak yazma zamanında bir ek LLM çağrısı (veya yapısal bilgiler için belirleyici bir buluşsal yöntem) gerektirir ve bu, sonraki her okumada amorti edilir. Kaynak takibi, zaten var olan bir tanımlayıcıyı kaydetmekten başka bir maliyete sahip değildir. Sürümleme, tam bir anlık görüntü değil, yazma başına bir ek sütun veya bir ekleme maliyetine sahiptir. Hindsight'ın gözlem katmanı, alınan ve kullanılan bilgilerin sayısıyla orantılı depolama ekler, ancak yalnızca aracının gerçekten tükettiğini kaydeder, gördüğü her şeyi değil.

Operasyonel maliyet asıl sorudur. Katman 3 süslemesi, her almada daha fazla verinin akması anlamına gelir ve bu da bağlam penceresi kullanımını ve yanıt gecikmesini biraz artırır. Bunu gönderen sistemler, süslemeleri kısa tutarak (bir kaynak türü enum'u, bir güven kayan noktası, bir tazelik durumu) bunu halleder, satır içi tam kaynak ağaçları yerine. Aracı, meta verilerde boğulmadan ayrım yapmak için yeterli bilgiyi alır.

En güçlü uygulamaların ortak noktaları

Derlemdeki örneklerin yeniden belirtilmesi gerekir çünkü hiçbiri sorunun aynı dilimini çözmez:

OpenContext, herhangi bir dosya sistemi yeniden düzenlemesinden sağ çıkan UUID'ler oluşturur ve bunları aracının doğrudan kullanabileceği bir alıntı şeması olarak sunar. mem9, her satırda kaynak, aracı kimliği, oturum kimliği, her güncellemede sürüm taşır ve arama sonuçlarını açık bir bütçe tarafından yönetilen kaynak-dönüş bağlamıyla süsler. Supermemory, belleği, yazılı kenarları olan sürümlenmiş bir DAG olarak ele alır ve her inanca taahhüt geçmişi verir. Hindsight, alınan ve kullanılan her bilgiyi, tam kaynak kaynağı, evrim geçmişi ve alıcı başına sıralama ile bir gözlem katmanında yakalar. Graphify, her kenarı üç düzeyli yakalama güveniyle işaretler ve belirsiz kenarları bilgi olarak ele almak yerine insan incelemesi için yüzeye çıkarır.

Birleştirici gözlem açıktır: kaynak meta veri değildir, bilginin bir parçasıdır. Onu bu şekilde ele alan sistemler, belleği sessizce çürümeyen, çelişkileri yargılanabilen, halüsinasyonları izlenebilen ve inanç geçmişi, ihtiyacı öngörmek zorunda kalmadan geçmişteki herhangi bir noktaya geri sarılabilen sistemlerdir.

Bunu yapmayan sistemler, kullanıcılarının eninde sonunda güvendikleri belleğin aslında bir ada olduğunu öğrendiği sistemlerdir.

Kaynak, yazma zamanında satın alabileceğiniz en ucuz sigortadır. Disiplin, ihtiyacınız olduğunu öğrenmeden önce onu satın almaktır.

Bu makaleyi faydalı buldunuz mu? Lütfen paylaşın ki başkaları da faydalansın :)

Bir sonraki yazı, hibrit alma ve RRF'yi, vektör ve anahtar kelime sinyallerini birinin diğerini bastırmasına izin vermeden birleştirmenizi sağlayan deseni ele alıyor -- bu, kaynak size bir bilginin sağlam olduğunu söylediğinde ancak yalnızca alaka düzeyi onu gömeceğinde en çok önem kazanır. O yazı yakında geliyor.

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet