Döngüyle başlayın. Metin token'lara dönüşür. Token'lar bir Transformer'dan geçer. Attention, önceki token'lardan hangilerinin önemli olduğuna karar verir. Runtime, modelin her seferinde tüm konuşmayı yeniden hesaplamasını önlemek için bir KV önbelleği tutar. Ardından model bir sonraki token'ı seçer ve işlemi tekrarlar.
LLM'lerin nasıl çalıştığına, modellerin her seferinde 1 token düşünerek nasıl ilerlediğine ve bunları yerel olarak nasıl çalıştırabileceğinize dair pratik bir rehber.
Bu döngü oturduğunda, donanım ve yazılım seçimleri hakkında akıl yürütmek kolaylaşır. VRAM, niceleme, bağlam uzunluğu, sohbet şablonları, kod çözme, RAG, sunum motorları ve model seçimi, aynı mekaniğin birer parçası haline gelir.
Döngüyle başlayın: Token'lar girer, olasılıklar çıkar, her seferinde bir sonraki token.Ağırlıklar, modelin hangi örüntüleri öğrendiğini söyler. Bağlam, modelin şu anda neye baktığını belirtir. KV önbelleği, döngüyü kullanılabilir kılan çalışma belleğidir.Donanım, çalışma zamanları ve model seçimi, ancak modelin uyduğu bellek, bağlam ve biçimlendirme kurallarını anladıktan sonra anlam kazanır.
Amaç, önce yerel LLM mekaniğini sezgisel hale getirmek, ardından size donanım, çalışma zamanları, sunum ve 21 Mayıs 2026 itibarıyla güncel LLM araştırmalarına pratik bir yol sunmaktır.
Odak Noktası
Bu, modele öncelik veren bir rehberdir. Mekanikle başlar: çıkarım, token'lar, Transformer'lar, attention, KV önbelleği, ön doldurma, kod çözme, kod çözme kontrolleri, model paketleri, sohbet şablonları, model türleri, uzun bağlam, RAG, ajanlar, ince ayar ve çok modlu modeller.
Bunun ardından, yerel dağıtım katmanına geçer: yerelin gerçekte ne anlama geldiği, niceleme, VRAM matematiği, donanım kademeleri, çalışma zamanı seçenekleri, sunum modları, lisanslar, model seçimi, gizlilik, sorun giderme, kıyaslamalar, kurulum yolları ve pratik kullanım senaryoları.
Bu sıralama önemlidir. Bir GPU seçmeden önce, uzun bir girdinin neden belleğe mal olduğunu anlamalısınız. Bir modeli yargılamadan önce sohbet şablonlarının neden önemli olduğunu anlamalısınız. Saniye başına token'ları önemsemeden önce kod çözmenin neden sıralı olduğunu anlamalısınız.
Daha derin donanım ve yazılım yolu için, kendi kendine barındırılan LLM'ler / yerel AI konusunda üç bölümlük bir serim var:
- Bölüm 1: LLM'ler için GPU Bellek Matematiği (2026 Sürümü).
- Bölüm 2: Yerel AI Donanımı için Bellek Bant Genişliği (2026 Sürümü).
- Bölüm 3: LLM'ler ve Yerel AI Donanımı için Çıkarım Motorları (2026 Sürümü).
İlk iki yazı, donanım kapasitesi ve bant genişliği matematiğini açıklar. Üçüncüsü, bu donanımı kullanılabilir çıkarıma dönüştüren yazılım katmanını açıklar. Bu makale, önce size model tarafı temelini verir, ardından mekanik netleştiğinde bu dağıtım katmanlarına geri döner.
Bir LLM Aslında Ne Yapar

Bir modeli çalıştırmaya çıkarım denir. Standart bir decoder-only LLM için çıkarım, tekrar tekrar tekrarlanan aynı döngüdür:
- Metninizi token'lara dönüştürün.
- Bu token'ları modele besleyin.
- Olası her bir sonraki token için puanlar hesaplayın.
- Bir kod çözme politikasıyla bir token seçin.
- Bu token'ı diziye ekleyin.
- Model durana, kullanıcı durdurana veya bir token sınırına ulaşılana kadar tekrarlayın.
Model, tüm cevabı tek seferde yazmaz. Her seferinde bir token üretir. Her yeni token, bir sonraki token'ı etkileyen dizinin bir parçası haline gelir.
Matematiksel olarak model, öğrenilmiş bir fonksiyondur:
f(theta, dizi) -> next_token üzerinde olasılık dağılımı
Burada:
- theta, model ağırlıkları anlamına gelir.
- dizi, girdi artı şu ana kadar üretilen token'lar anlamına gelir.
- Logits, softmax öncesi ham puanlardır.
- Olasılıklar, softmax sonrası normalleştirilmiş puanlardır.
- Kod çözme, bu olasılıkları seçilen bir token'a dönüştürür.
Bu nedenle yerel üretim hızı, saniye başına token sayısı ile ölçülür. Sisteminiz tekrar tekrar bir ileri geçiş çalıştırır, bir token seçer veya örnekler, KV önbelleğini günceller ve devam eder.
Burada algı önemlidir. Uzun bir ön doldurma, ilk kelimenin ortaya çıkmasından önce uzun bir duraklama anlamına gelir. Yavaş kod çözme, cevabın yavaş akması anlamına gelir. Yerel geliştiriciler genellikle kod çözme hızına takıntılıdır çünkü kullanıcıların hissettiği şey budur, ancak 10K token'lık bir belge yapıştırdığınızda canınızı yakan şey ön doldurma süresidir.
Token'lar

LLM'ler ham metni kelimeler olarak görmez. Onları token'lar olarak görür: Dahili olarak tamsayı kimlikleriyle temsil edilen küçük metin parçaları.
Bir token şunlar olabilir:
- Tam bir kelime: "merhaba"
- Bir kelime parçası: "bilgi", "sayar", "lık"
- Bir noktalama işareti
- Boşlukla ön eklenmiş bir dize
- Bir bayt düzeyinde geri dönüş
- <|user|>, <|assistant|>, , veya gibi özel bir kontrol işareti
Tokenizer, metni token kimliklerine ve token kimliklerini metne geri eşler. Yaygın tokenizer aileleri arasında BPE tarzı tokenizer'lar ve SentencePiece tarzı tokenizer'lar bulunur. Farklı model aileleri farklı tokenizer'lar kullanır ve bu önemlidir. 4.000 kelimelik bir belge, bir tokenizer'da 5.000 token, diğerinde 7.500 token olabilir.
Kelime dağarcığı boyutu da önemlidir. Daha büyük bir kelime dağarcığına sahip bir tokenizer, bazı metinleri daha az token'a sıkıştırabilir, ancak aynı zamanda gömme ve çıktı projeksiyon boyutunu da değiştirir. Bu, saniye başına token sayısının model aileleri arasında tam olarak karşılaştırılamamasının nedenlerinden biridir.
Token'lar önemlidir çünkü şunları belirler:
- Bağlam penceresine ne kadar metin sığacağını.
- KV önbelleğinin ne kadar büyük olacağını.
- Girdi işleme sırasında ne kadar gecikme yaşayacağınızı.
- Çok dilli veya kod ağırlıklı metnin verimli olup olmadığını.
- Modelin özel sohbet işaretçilerini doğru görüp görmediğini.
Bir modelin bağlam penceresi, aynı anda dikkat edebileceği maksimum token sayısıdır. 2026'da, yaygın yerel yetenekli modeller 8K ve 32K bağlamlardan 128K, 256K ve hatta sunucu sınıfı sistemlerde 1M token bağlamına kadar değişmektedir.
Ancak desteklenen bağlam uzunluğu, ucuz, hızlı veya eşit derecede doğru bağlam anlamına gelmez. Teknik olarak 128K token işleyebilen bir model, 64K'da yavaşlayabilir ve 100K'da tutarlılığını kaybedebilir. Kullanmayı planladığınız bağlam uzunluklarını her zaman test edin.
Token'lar iş birimidir. Bunu anladığınızda, uzun bağlam sihirli olmaktan çıkar ve tahmin edebileceğiniz bir faturaya dönüşür.
Yardımcı Alıştırma: Metnin gerçek zamanlı olarak nasıl token'lara ayrıldığını görmek için Token demo uygulamamı deneyin.
Transformer'lar

Modern LLM'lerin çoğu Transformer mimarisine dayanır. Yerel sohbet LLM'lerinin çoğu decoder-only Transformer'lardır: Önceki token'lara bakarken bir sonraki token'ı tahmin ederler.
Bu noktanın üzerindeki her şey (token'lar, ağırlıklar, yapılandırma ve sohbet şablonları dahil) alttaki gerçek motor için bir hazırlıktır. Transformer, sayıları hareket ettiren iskelettir.
Basitleştirilmiş bir Transformer katmanı şunları içerir:
- Token gömmeleri: Token kimlikleri vektör haline gelir.
- Konumsal bilgi: Modelin token sırasına ihtiyacı vardır. Birçok modern LLM, konumu döndürmelerle kodlayan RoPE'yi kullanır.
- Self-attention: Her token temsili, önceki token temsillerine geri bakar ve neyin önemli olduğuna karar verir.
- MLP / feed-forward bloğu: Temsilleri genişleten ve sıkıştıran yoğun bir doğrusal olmayan hesaplama. Parametrelerin büyük bir kısmı burada yaşar.
- Katman normalizasyonu ve artık bağlantılar: Bunlar derin ağları dengeler ve bilginin birçok katmandan akmasına yardımcı olur.
- Çıktı projeksiyonu: Son gizli durum, kelime dağarcığı üzerinde logits haline gelir.
Bu tarifi düzinelerce veya yüzlerce kez tekrarlayın ve bir dil modeli elde edersiniz.
Transformer özeti: Token'lar vektör haline gelir, attention diziyi birbirine bağlar, MLP'ler temsili yeniden şekillendirir, RoPE konumu düz tutar ve son projeksiyon son gizli durumu sonraki token logits'lerine dönüştürür.
Attention
Attention, bir token'ın bir sonraki tahmin için önceki token'lardan hangilerinin önemli olduğuna nasıl karar verdiğidir. Aynı zamanda yerel çıkarımın belleğe bu kadar duyarlı olmasının nedenlerinden biridir.
Klasik MHA, birçok kafa için ayrı anahtar/değer durumu depolar. Modele esneklik verir, ancak KV önbelleğini büyütür.
Modern yerel modeller genellikle daha verimli attention tasarımları kullanır:
- MQA: Birden çok sorgu kafası, bir anahtar/değer kafasını paylaşır. Bellek açısından verimlidir, ancak daha az ifade edici olabilir.
- GQA: Sorgu kafaları grupları, anahtar/değer kafalarını paylaşır. Birçok mevcut yerel modelde yaygın orta yoldur.
- MHA: Tam çok kafalı attention. Güçlü olabilir, ancak uzun bağlam hızla pahalı hale gelir.
FlashAttention ve SDPA tarzı uygulamalar gibi modern çekirdekler, attention bellek trafiğini azaltır ve GPU'yu daha meşgul tutar. İyi attention çekirdeklerine sahip bir çalışma zamanı, aynı model ve donanımda bile olmayana göre önemli ölçüde daha hızlı olabilir.
Bu nedenle iki 7B modeli uzun bağlamda çok farklı davranabilir. Parametre sayısı tüm hikaye değildir. 128K bağlamda bir 7B MHA modeli 24 GB GPU'yu tüketebilirken, aynı reklamı yapılan bağlama sahip bir 7B GQA modeli boş alanla sığabilir.
Modelleri karşılaştırırken, yalnızca parametre sayısına değil, attention türüne, KV kafalarına, bağlam uzunluğuna ve çalışma zamanı desteğine bakın.
KV Önbelleği

KV önbelleği, modelin üretim sırasındaki çalışma belleğidir. Önceki token'lar için anahtar/değer attention durumlarını depolar, böylece model üretilen her token'da tüm geçmişi sıfırdan yeniden hesaplamaz.
KV önbelleği olmadan, üretim acımasızca verimsiz olurdu. KV önbelleği ile üretim kullanılabilir, ancak önbellek aşağıdakilerle orantılı bellek tüketir:
token'lar x katmanlar x kv_heads x head_dim x hassasiyet x 2
x 2, anahtarlar ve değerler içindir.
Eski Llama benzeri 7B MHA modelleri için kullanışlı bir kural, FP16 KV önbelleğinde token başına yaklaşık 0,5 MiB'dir. Bu, 4K token'ın yalnızca KV önbelleği için yaklaşık 2 GiB'ye mal olabileceği anlamına gelir. 32K token'da, yalnızca 16 GiB KV önbelleğine bakıyor olabilirsiniz.
Daha yeni GQA/MQA modelleri bunu önemli ölçüde azaltır. Bazı çalışma zamanları ayrıca FP8 veya INT8 KV önbelleğini de destekler. Bu, 2026'da yerel kullanıcılar için önereceğim pratik sıkıştırma tabanıdır.
8 bitin altındaki KV önbelleğini varsayılan olarak ele almayın. KIVI, KVQuant ve daha yeni sıkıştırılmış önbellek çekirdekleri gibi araştırma sistemleri, 2 bit ila 4 bit KV'nin dikkatli algoritmalar, kalibrasyon ve özel çekirdeklerle çalışabileceğini göstermektedir. Bu, bir masaüstü çalışma zamanında gelişigüzel bir Q4 KV anahtarını çevirmekle aynı şey değildir. 8 bitin altında, özellikle kodlama, araç çağrıları, JSON, uzun bağlamlı erişim ve önceki token'ların tam olarak önemli olduğu görevler için sıkı test yapın.
Ayrıca KV önbelleği nicelemesini spekülatif kod çözme ile karıştırmayın. Gayri resmi olarak genellikle DTree olarak kısaltılan DFlash ve DDTree, gelecekteki token'ları taslak haline getirerek ve doğrulayarak kod çözme gecikmesine saldırır. Hızı artırabilirler, ancak KV önbelleği bellek faturasını silmezler.
Bu nedenle bir model boş bir girdide sığabilir ancak uzun bir belge yüklediğinizde çökebilir. Ağırlıklar sığar. Çalışma belleği sığmadı.
Ön Doldurma ve Kod Çözme
LLM çıkarımının iki farklı performans rejimi vardır: ön doldurma ve kod çözme.

Ön doldurma, modele verdiğiniz girdiyi işler. 20.000 token'lık bir belge yapıştırırsanız, model ilk cevap token'ını üretmeden önce bu 20.000 token'ı işlemelidir. Ön doldurma nispeten paralelleştirilebilir, bu nedenle GPU'lar bunu verimli bir şekilde halledebilir, ancak yine de pahalı olabilir.
İlk token'ın görünmesini beklediğiniz süre genellikle ön doldurma süresidir.
Kod çözme, her seferinde bir tane olmak üzere yeni token'lar üretir. Üretilen her token şimdiye kadarki diziye bağlıdır, bu nedenle kod çözme çok daha sıralıdır. Akış yazma efekti buradan gelir ve genellikle bir modelin hızlı mı yoksa yavaş mı hissettirdiğini belirleyen aşamadır.
Uzun girdiler ön doldurmayı cezalandırır. Uzun cevaplar kod çözmeyi cezalandırır. Uzun sohbetler her ikisini de cezalandırır çünkü KV önbelleği büyür.
Bir sohbet oturumunda, her tur önbelleğe eklenir. Bir sohbetin 16K token'a kadar çalışmasına izin verirseniz, üretilen her yeni token'da 16K token'ın tümü için bellek maliyetini ödersiniz. Bu nedenle sonsuz geçmişi tutan sohbet arayüzleri sonunda yavaşlar veya çöker.
Kod Çözme

Model logits ürettikten sonra henüz hiçbir şey yazmamıştır. Yalnızca olası her bir sonraki token'ı puanlamıştır. Kod çözme, bu puanları gerçek bir token'a dönüştüren, bu token'ı bağlama ekleyen ve döngüyü tekrarlayan politikadır.
Çalışma zamanı veya çıkarım motoru, token'ları birkaç şekilde seçebilir. Her seferinde en yüksek olasılıklı token'ı seçebilir. Daraltılmış bir olası token kümesinden örnekleyebilir. Tekrarlamayı cezalandırabilir. Bir sınırlayıcıda durabilir. Aynı girdinin tekrarlanabilir şekilde davranması için sabit bir tohum kullanabilir.
Bu seçimler model ağırlıklarını değiştirmez, ancak modelin sesini, determinizmini, yaratıcılığını, risk profilini ve döngü eğilimini değiştirir.
Önemli düğmeler üç pratik soruyu yanıtlar:
- Rastgelelik: Ne kadar varyasyona izin verilir?
- Kuyruk erişimi: Örnekleyici, düşük olasılıklı token'lara ne kadar gidebilir?
- Sınırlar: Döngüleri, başıboş konuşmayı, şema ihlallerini veya kontrolden çıkmış çıktıyı ne önler?
Hassas işler için dar başlayın: düşük sıcaklık, kısa maksimum token sınırları, açık durdurma dizileri ve çıktının JSON veya bir şemayla eşleşmesi gerektiğinde kısıtlanmış kod çözme. Yaratıcı işler için, daha yüksek sıcaklık, top-p ve ardından sıralanan birden çok aday ile örnekleyiciye daha fazla alan verin. Kodlama için, ilk geçişi muhafazakar tutun, ardından yalnızca kasıtlı olarak keşfederken alternatifleri örnekleyin.
Açgözlü kod çözme her zaman daha doğru değildir. Genellikle kırılgandır. Açgözlü bir kod çözücü, alternatifleri asla keşfetmediği için döngülere takılabilir veya genel cevaplar üretebilir. Değerlendirmeler için deterministik ayarlar kullanın. Fikir üretimi için modelin nefes almasına izin verin.
Bir Model Paketi Neler İçerir
Çalıştırılabilir bir yerel LLM, tek bir büyük ağırlık dosyasından daha fazlasıdır. Bir model paketi genellikle şunları içerir:
- Mimari/yapılandırma: Katman sayısı, gizli boyut, attention türü, RoPE ayarları, kelime dağarcığı boyutu, özel token'lar ve bağlam uzunluğu.
- Ağırlıklar: Genellikle safetensors, GGUF, GPTQ, AWQ, EXL2 veya başka bir çalışma zamanına özgü biçimde depolanan öğrenilmiş parametreler.
- Tokenizer: Metni token kimliklerine ve token kimliklerini metne dönüştüren kurallar.
- Sohbet şablonu: Sistem, kullanıcı, asistan, araç ve akıl yürütme mesajları için tam işaretleme.
- Üretim yapılandırması: Sıcaklık, top-p, durdurma token'ları, tekrarlama cezaları ve maksimum token'lar için varsayılanlar.
- Lisans ve model kartı: Modelin nasıl kullanılabileceğine ilişkin yasal ve operasyonel talimatlar.
Ağırlıklar en büyük dosyadır, ancak modelin tamamı değildir. Tokenizer, yapılandırma veya sohbet şablonu yanlışsa, aynı ağırlıklar bozuk hissedebilir.
Paket bölümü, size birlikte seyahat etmesi gerekenleri söyler. Sonraki bölüm, sohbet şablonunun insanların en sık bozduğu kısım olduğunu açıklar.
Sohbet Şablonları

Bir sohbet modeli, belirli bir konuşma biçimiyle eğitilmiştir. Örneğin, şöyle bir şey bekleyebilir:
<|system|> Yardımcı bir asistansınız. <|user|> KV önbelleğini açıklayın. <|assistant|>
Başka bir model şunu bekleyebilir:
[BOS] [INST] KV önbelleğini açıklayın. [/INST]
Bir diğeri, ChatML tarzı işaretçiler kullanabilir. Bir başkası, özel akıl yürütme token'ları gerektirebilir. Bir başkası, araç çağrısı XML veya JSON sarmalayıcılarına ihtiyaç duyabilir.
Yanlış biçimi kullanmak, anlamsız konuşmaya, rol karışıklığına, yok sayılan sistem girdilerine, tekrarlanan girdilere, reddetme tuhaflıklarına, bozuk araç çağrılarına, kötü kıyaslama sonuçlarına ve asıl hatanın şablon olduğu durumda modelin aptal olduğu sonucuna varılmasına neden olabilir.
En iyi uygulama:
- Transformers kullanırken tokenizer'ın apply_chat_template'ini kullanın.
- Harbor destekli ön uçlarda, llama.cpp'de, LM Studio'da, vLLM'de veya SGLang'de modele özgü şablonlar kullanın.
- Modelin temel, eğitimli, sohbet, akıl yürütme veya araç ayarlı olup olmadığını kontrol edin.
- BOS/EOS token'larının doğru olduğundan emin olun.
- Uzun olmaları gerekmedikçe sistem girdilerini kısa tutun.
- Araç kullanımı için, model/çalışma zamanı tarafından beklenen tam şemayı izleyin.
Kullanıcıların model değiştirmesine izin veren bir uygulama oluşturuyorsanız, şablon değiştirmeye de ihtiyacınız vardır. Bir şablon biçimini sabit kodlamak ve ardından başka birini bekleyen bir model yüklemek, kötü yerel model değerlendirmelerinin yaygın bir kaynağıdır.
Şablona bir API sözleşmesi gibi davranın. Yanlış anlarsanız, test ettiğinizi düşündüğünüz modeli gerçekten test etmiyorsunuzdur.
Model Türleri

Tüm LLM'ler aynı davranış için ayarlanmamıştır.
Çoğu kullanıcı için varsayılan başlangıç noktası, belleğe rahatça sığan bir boyutta yakın tarihli bir eğitimli/sohbet ayarlı model olmalıdır.
Nedenini bilmiyorsanız, temel bir modelle başlamayın. Temel modeller, sorunuzu yanıtlamak yerine girdinizi tamamlar. Araştırmacılar, ince ayar yapanlar ve özel ardışık düzenler oluşturan kişiler için kullanışlıdırlar. Diğer herkes için sinir bozucudurlar.
Temel bir modele Fransa'nın başkenti neresidir? diye sorarsanız, Paris yerine ve Paris'in nüfusu nedir? diye devam edebilir.
Pratik ayrım basittir:
- Temel model: Ön eğitim araştırması, ince ayar ve özel ardışık düzenler için iyidir.
- Eğitimli model: Doğrudan talimat takibi için iyidir.
- Sohbet modeli: Rol biçimlendirmeli çok turlu diyalog için iyidir.
- Akıl yürütme modeli: Görev ekstra düşünme token'ları ve doğrulamadan yararlandığında iyidir.
- Araç ayarlı model: Yapılandırılmış çağrılar, JSON veya işlev kullanımı önemli olduğunda iyidir.
Yerel Gerçekte Ne Anlama Gelir

Yerel bir LLM, ağırlıkları ve çıkarım çalışma zamanı sizin kontrolünüzde olan bir modeldir. Hangi modelin çalıştığına, nasıl çalıştığına, hangi verileri gördüğüne ve çıktılara ne olduğuna siz karar verirsiniz.
Bu özgürlük, beraberinde iş getirir. Artık operasyon ekibi sizsiniz. İndirmeleri, güncellemeleri, uyumluluk sorunlarını, bellek sınırlarını ve güvenliği siz halledersiniz. Bir şey bozulduğunda, dosyalanacak bir destek bileti yoktur. Sadece siz, günlükler ve belgeler vardır.
Yerel şunlar anlamına gelebilir:
- Bir telefonda çalışan 2B parametreli bir model.
- Bir tüketici GPU'sunda çalışan 7B ila 14B bir model.
- Yüksek performanslı bir iş istasyonunda çalışan 30B ila 70B bir model.
- Bir veya daha fazla veri merkezi GPU'sunda çalışan seyrek bir MoE modeli.
- vLLM, SGLang, TensorRT-LLM, llama.cpp, Harbor, LM Studio veya özel bir PyTorch yığını kullanan özel bir dağıtım.
Önemli nokta: Yerel, otomatik olarak çevrimdışı, özel, güvenli, ucuz veya açık kaynak anlamına gelmez. Yalnızca modeli kendiniz çalıştırdığınız anlamına gelir. Yerel bir uygulama yine de eve telefon açabilir. Bir model açık ağırlıklı olabilir ancak açık kaynak olmayabilir. Bir model yerel olabilir ancak yüklenmesi güvensiz olabilir. Nicelenmiş bir model belleğe sığabilir ancak kötü cevaplar verebilir.
Bu takas, gizlilik, düşük gecikme süresi, özel davranış, çevrimdışı çalışma veya ölçekte maliyet kontrolüne ihtiyacınız olduğunda buna değer. Mutlak en iyi model kalitesine ihtiyacınız olduğunda ve buna uygun donanıma sahip olmadığınızda buna değmez. Bu durumda, barındırılan bir API doğru araçtır.
Yerel LLM'ler, tek bir denklemi anladığınızda pratiktir:
Yerel LLM başarısı = model uyumu + doğru girdi biçimi + iyi çalışma zamanı + gerçekçi değerlendirmeler.
Geri kalan her şey ayrıntıdır. Ayrıntılar önemlidir.
Niceleme

Niceleme, belleği azaltmak ve bazen verimi artırmak için ağırlıkları daha düşük hassasiyette depolar.
2026'da yerel kullanıcılar için kural:
- FP16/BF16: Bellek bol olduğunda en iyi kalite. Değerlendirme için temel olarak kullanın.
- Q8 / INT8: Birçok görev için kayıpsıza yakın, ancak yine de büyük. VRAM'iniz olduğunda ve minimum kalite kaybı istediğinizde iyidir.
- Q6 / Q5: Orta düzeyde tasarrufla mükemmel kalite. Güçlü bir orta yoldur.
- Q4: Birçok sohbet ve belge iş akışı için varsayılan tüketici tatlı noktası.
- Q3 / Q2: Yalnızca daha büyük bir modele sığdırmanız gerektiğinde. Matematik, kod, yapılandırılmış çıktı ve araç kullanımı ilk bozulanlardır.
Ağırlık nicelemesi, KV önbelleği nicelemesi ile aynı şey değildir. Ağırlık nicelemesi modeli küçültür. KV önbelleği nicelemesi, canlı bağlam belleğini küçültür.
KV önbelleği için, FP16/BF16'yı temiz temel olarak ve FP8/INT8'i pratik yerel sıkıştırma tabanı olarak kabul edin. 8 bitin altı, araştırma ağırlıklı ve iş yüküne duyarlıdır. Yalnızca gerçek girdilerinizdeki kaliteyi ölçtükten sonra kullanın.
Niceleme başarısızlığı ilk olarak matematik, çok adımlı akıl yürütme, kod doğruluğu, araç kullanımı güvenilirliği, JSON/şema uyumu, ince talimat takibi ve uzun bağlamlı erişimde kendini gösterir.
Daha yüksek hassasiyette daha küçük bir model, çok az bit'e sıkıştırılmış daha büyük bir modeli yenebilir. Parametre sayısına tapmayın. Q6'daki bir 7B modeli, akıl yürütme görevlerinde Q2'deki bir 13B modelini daha az bellek kullanarak ve daha hızlı çalışarak yenebilir.
Dosya Biçimleri ve Yükleme Güvenliği

safetensors, Python pickle davranışı olmadan tensörleri depolamak için tasarlanmış güvenli bir tensör serileştirme biçimidir. Mümkün olduğunda, özellikle PyTorch/Transformers modelleri için safetensors kullanın.
Güvenilmeyen kaynaklardan gelen rastgele .bin dosyalarından kaçının. PyTorch pickle tabanlı yükleme, seri durumdan çıkarma sırasında rastgele kod yürütebilir. Yerel AI güvenlik kuralı bir numara: Bir yabancının model dosyasının, bir yabancının kod yürütmesi haline gelmesine izin vermeyin.
GGUF, llama.cpp ekosisteminin ikili model biçimidir. llama.cpp, CPU çıkarımı, Apple Silicon çıkarımı, basit yerel sunucular, taşınabilir nicelenmiş modeller veya LM Studio gibi masaüstü araçları istediğinizde GGUF kullanın.
ONNX, standartlaştırılmış dağıtım ve donanıma özgü hızlandırma için, özellikle olağan PyTorch yığını dışında kullanışlıdır. Intel NPU'larına, ARM cihazlarına veya özel hızlandırıcılara dağıtım yapıyorsanız, ONNX genellikle en az dirençli yoldur.
TensorRT-LLM, NVIDIA'nın üretim GPU dağıtımları için yüksek performanslı çıkarım yoludur. Güçlüdür, ancak llama.cpp veya Harbor'dan daha karmaşıktır. Genellikle bir kontrol noktasını TensorRT motorlarına dönüştürürsünüz, bu da zaman ve GPU belleği alır, ancak bir kez oluşturulduktan sonra mükemmel verim sağlar.
EXL2 / GPTQ / AWQ biçimleri, özellikle daha büyük modelleri tek GPU'lara sıkıştırmak için GPU odaklı yerel çıkarım topluluklarında yaygındır.
Dosya biçimi seçimi kozmetik değildir. Hangi çalışma zamanlarının modeli yükleyebileceğini, hangi nicelemeyi kullanabileceğinizi ve ne kadar hızlı çalıştığını belirler.
Çalışma Zamanları ve Sunum Modları

Çalışma zamanı, modeli yükleyen ve çıkarımı gerçekleştiren yazılımdır. 2026'da, yerel LLM çalışma zamanı ekosistemi olgun, kullanışlı ve parçalanmış durumdadır.
Yerel olarak deney yapan tek bir kişi için Harbor, LM Studio veya llama.cpp ile başlayın. Harbor, ön uçlar, arka uçlar ve destekleyici hizmetlerin birbirine bağlı olduğu eksiksiz bir yerel yığın istediğinizde en iyi seçimdir. LM Studio, en kolay masaüstü odaklı yoldur. llama.cpp, taşınabilir düşük seviyeli iş gücüdür.
Bir ekip veya özel hizmet için vLLM veya SGLang'a bakın. Maksimum NVIDIA üretim performansı için TensorRT-LLM'yi araştırın. Tarayıcı veya mobil dağıtım için MLC veya WebLLM'e bakın.
Çalışma zamanı seçimi, sizi genellikle bir biçim ekosistemine kilitler. llama.cpp, GGUF anlamına gelir. vLLM ve SGLang genellikle safetensors veya Hugging Face kontrol noktaları anlamına gelir. TensorRT-LLM, ONNX veya optimize edilmiş motorlar anlamına gelir. Önce çalışma zamanını seçin, ardından doğru biçimde modeller bulun.

Üç pratik sunum modu vardır.
Tek kullanıcılı yerel, bir kişi için bir masaüstü uygulaması, CLI yığını veya komut satırı sunucusu anlamına gelir. Harbor, LM Studio, llama.cpp sunucusu, ExLlama/TabbyAPI ve küçük Transformers betiklerinin tümü buraya sığar. Amaç hızlı yinelemedir: Bir operasyon platformu oluşturmadan davranışı, hızı, bellek kullanımını ve girdi biçimlerini karşılaştırın.
Ekip veya özel API, bir iş istasyonunda veya sunucuda OpenAI uyumlu bir uç nokta anlamına gelir. vLLM, SGLang, TensorRT-LLM ve llama.cpp sunucusu, model boyutuna ve verim ihtiyaçlarına bağlı olarak burada görünür. Birden çok kişi veya iş bir modeli paylaştığında, izleme, girdi/sürüm yönetimi, yönlendirme ve gerçekçi gecikme ölçümlerine ihtiyacınız vardır.
Üretim sunucusu farklı bir iştir. Artık konuşmanın içinde sürekli gruplama (continuous batching), ön ek önbelleğe alma (prefix caching), spekülatif kod çözme (speculative decoding), sayfalanmış dikkat (paged attention), tensör paralelliği (tensor parallelism), pipeline paralelliği (pipeline parallelism), nicemlenmiş sunum (quantized serving), yapılandırılmış çıktılar (structured outputs), yük dengeleme (load balancing), GPU kullanımı (GPU utilization), gecikme yüzdelikleri (latency percentiles), istem önbelleğe alma (prompt caching), kabul kontrolü (admission control), günlükleme (logging), yük devretme (failover), gizlilik (privacy) ve maliyet kontrolleri (cost controls) yer alır.
Üretim ölçeğinde, modeli yükleyebilir miyim? kolay sorudur. Zor soru ise onu gerçek trafik altında güvenilir bir şekilde sunabilir miyim? sorusudur.
Yerel Modeller İçin VRAM Hesapları

Üç ana bellek tüketicisi vardır:
- Model ağırlıkları
- KV önbelleği
- Çalışma zamanı yükü
Kaba ağırlık belleği formülü şöyledir:
ağırlık_belleği ~= parametreler x parametre_başına_byte
Kullanışlı yaklaşık değerler:
- FP16/BF16: Parametre başına yaklaşık 2 bayt.
- INT8/Q8: Parametre başına yaklaşık 1 bayt.
- Q4: Parametre başına yaklaşık 0,5 bayt, artı format yükü.
Sonra şunları ekleyin:
- Çalışma zamanı yükü: Çerçeve tamponları, CUDA yükü, bellek parçalanması ve geçici tensörler.
- KV önbelleği: Etkin bağlamdaki her belirteçle birlikte büyür.
- Toplu/iş eşzamanlılık belleği: Her eşzamanlı isteğin kendi önbelleğine ihtiyacı vardır.
- Görüntü kodlayıcı belleği: Görüntüler de belirteç haline gelir.
- Spekülatif kod çözme belleği: Taslak modeller, taslak başlıkları veya ekstra doğrulama yapıları ücretsiz değildir.
- Adaptör belleği: LoRA adaptörleri küçüktür, ancak yine de gerçektir.
MoE modelleri bir başka kırışıklık daha ekler. Bir model, parametrelerinin yalnızca bir kısmını belirteç başına etkinleştirebilir, ancak etkin olmayan uzmanların genellikle bellekte bir yerde bulunması gerekir. Etkin parametreler hesaplama maliyetini etkiler. Toplam parametreler, yükleme ve kapasite planlamasını hâlâ etkiler.
Gerçekçi bir tahmin şöyle görünür:
toplam_bellek = nicemlenmiş_ağırlıklar + KV_bel_bağlam_önbelleği + çalışma_zamanı_yükü + toplu_eşzamanlılık_yükü + güvenlik_payı
İşte tuzak: Q4'teki 13B'lik bir model, 8K bağlamda rahatça sığabilir, ancak KV önbelleği dört katına çıktığı için 32K'da başarısız olur. Ağırlıklar değişmedi. Bağlam değişti.
Yüzde 10 ila 20 boşluk bırakın. VRAM kullanımının yüzde 99'unda çalışmak, bellek yetersizliği hataları ve parçalanma arızaları için yalvarmaktır.
Pratikte Donanım Kademeleri

Bunlar, nicemlenmiş çıkarım ve makul bağlam uzunlukları varsayarak 2026 için pratik kurallardır. Kesin sonuçlar çalışma zamanına, nicemlemeye, model mimarisine, dikkat türüne, bağlam uzunluğuna ve işletim sistemi/sürücü yüküne bağlıdır.
2026'da ciddi yerel kullanıcıların çoğu için 16 GB, en rahat minimum GPU kademesi, 24 GB en iyi değer meraklısı kademesi ve 48 GB+, daha güçlü yerel dünyanın açıldığı yerdir.
Performans, bellek bant genişliğine, GPU FLOP'larına, VRAM kapasitesine, KV-önbellek boyutuna, dikkat uygulamasına, nicemlemeye, toplu iş boyutuna, istem uzunluğuna, oluşturulan uzunluğa ve çalışma zamanı olgunluğuna bağlıdır.
Kod çözme (decode) genellikle bellek bant genişliğiyle sınırlıdır: GPU, bayt başına nispeten az hesaplama yaparken ağırlıkları tekrar tekrar akıtır. Ön doldurma (prefill), istemi paralel olarak işleyebildiği için daha çok hesaplama sınırlıdır. Bu nedenle, aynı VRAM kapasitesine sahip iki kart, birinin bellek bant genişliği çok daha yüksekse çok farklı belirteç hızlarına sahip olabilir.
En acı verici yerel kurulum, modelin neredeyse sığdığı ve katmanları CPU'ya döktüğü kurulumdur. Teknik olarak çalışabilir, ancak belirteç hızı çökebilir. CPU boşaltması deneyler için kabul edilebilir. Bir performans stratejisi değildir.
Sığacak Bir Model Seçin
Pratik soru en iyi model hangisi? değildir. Donanımınızda gerçek iş yükünüzü kazanan en küçük model hangisi? sorusudur.
Gerçekten ihtiyacınız olan bağlam uzunluğuna rahatça sığan, güncel bir instruct/chat modeliyle başlayın. 8 GB ila 12 GB VRAM veya birleşik belleğiniz varsa, küçük başlayın. 16 GB ila 24 GB arasındaysanız, önce 7B ila 14B sınıfı modelleri test edin. 48 GB veya daha fazlasına sahipseniz, daha büyük yoğun modeller ve MoE modelleri gerçekçi hale gelir.
Bir kontrol noktasına aşık olmadan önce şu bellek filtresini kullanın:
ağırlıklar + KV önbelleği + çalışma zamanı yükü <= mevcut belleğin yüzde 80 ila 90'ı
Ardından, aynı 20 ila 50 istemi adaylar arasında çalıştırın. Gerçek görevlerinizi dahil edin: Kod düzenlemeleri, belge Soru-Cevap, JSON çıktısı, özetler, araç çağrıları, uzun bağlam veya gerçekten ihtiyacınız olan her şey. Yanıt kalitesini, gecikmeyi, bellek kullanımını, şablon güvenilirliğini ve hata modlarını ölçün.
Pratik bir model seçimi genellikle beş kontrole indirgenir:
- Görev uyumu: Sohbet, kodlama, belgeler, ajanlar, çok modlu, uç veya ince ayar.
- Bellek uyumu: Ağırlıklar, KV önbelleği, çalışma zamanı yükü ve güvenlik payı.
- Arayüz uyumu: Belirteçleyici, sohbet şablonu, durdurma belirteçleri, araç şeması ve muhakeme modu.
- Çalışma zamanı uyumu: Çalışma zamanınız bu mimariyi, nicemlemeyi, bağlam uzunluğunu ve sunum modunu iyi destekliyor mu?
- Lisans uyumu: Onu kullanmayı planladığınız yerde gerçekten kullanabilir misiniz?
Lider tabloları keşif için kullanışlıdır. Kendi değerlendirmelerinizin yerini tutmazlar. Önemli olan kıyaslama, sizin iş yükünüzdür.

Basit bir yerel asistan için, güncel bir 7B ila 14B instruct modeli, Q4/Q5 niceleme, doğru sohbet şablonu, 8K ila 32K bağlam ve Harbor, LM Studio veya llama.cpp'yi seçin. Devasa boyut yerine yanıt verebilirliğe öncelik verin.
Yerel bir kodlama asistanı için, yeterli VRAM'iniz varsa kod yapabilen 14B ila 32B'lik bir model seçin. Düşük sıcaklık, depo taraması, test yürütme ve yama tabanlı bir iş akışı kullanın. Araçları olmayan bir kod modeli, ürünün yarısıdır.
Özel bir belge asistanı için, güçlü bir instruct modeli, yerel bir yerleştirme modeli, bir yeniden sıralayıcı, bir RAG hattı, alıntı zorunluluğu ve orta ila uzun bağlam seçin. 200 sayfalık bir PDF'i yapıştırıp umut etmeyin.
Bir muhakeme kurulumu için, muhakeme için ayarlanmış bir model, bütçeye ekstra belirteçler, düşük ila orta sıcaklık, doğrulama ekleme ve matematik, kod veya arama için araçlar kullanın. Muhakeme modelleri daha fazla belirteç harcar. Bütçeyi buna göre ayarlayın.
Düşük kaynaklı bir kurulum için, 1B ila 4B'lik bir model, Q4/Q5, kısa istemler, yapılandırılmış görevler, alma veya araçlar ve sıkı bir çıktı şeması seçin. Küçük modeller, görev kısıtlandığında kullanışlı hale gelir.
Hızı Ne Kontrol Eder?

Saniye başına belirteç tek bir şey tarafından kontrol edilmez. Model boyutu, bellek bant genişliği, hesaplama, dikkat çekirdekleri, bağlam uzunluğu, niceleme, gruplama ve çalışma zamanı kalitesinin bir sonucudur.
Ana kaldıraçlar şunlardır:
- Bellek bant genişliği: Kod çözme genellikle model ağırlıklarını tekrar tekrar akıtır, bu nedenle bant genişliği tek kullanıcılı belirteç hızına hakimdir.
- GPU FLOP'ları: Ön doldurma ve büyük gruplar daha fazla paralel hesaplama kullanır, bu nedenle FLOP'lar orada daha önemlidir.
- VRAM kapasitesi: Model veya KV önbelleği CPU'ya dökülürse performans çökebilir.
- Dikkat uygulaması: FlashAttention, SDPA, sayfalanmış dikkat ve çalışma zamanına özgü çekirdekler hem hızı hem de bellek davranışını değiştirir.
- Niceleme: Daha küçük ağırlıklar bellek hareketini azaltır, ancak agresif niceleme kaliteye zarar verebilir ve bazen nicelemeyi çözme yükü ekleyebilir.
- Toplu iş boyutu ve eşzamanlılık: Gruplama verimi artırır, ancak her etkin dizinin KV önbelleğine ihtiyacı vardır.
- İstem uzunluğu: Uzun istemler ön doldurma süresini artırır.
- Oluşturulan uzunluk: Uzun yanıtlar kod çözme hızını ortaya çıkarır.
- Spekülatif kod çözme: EAGLE tarzı yöntemler, MTP, DFlash ve DDTree, desteklendiğinde hedef geçiş başına taslak olarak oluşturulmuş birden fazla belirteci doğrulayabilir.
Acı verici kurulum, neredeyse sığan kurulumdur. Katmanları veya önbelleği CPU'ya döken bir model teknik olarak çalışabilir, ancak belirteç hızı kullanılabilirden perişanlığa düşebilir.
Kullanmayı planladığınız tam çalışma zamanını, nicelemeyi, bağlam uzunluğunu, istem şeklini ve iş yükünü kıyaslayın. Bir BF16 lider tablosu numarası, Q4 yerel yığınınızın nasıl hissettireceğini size söylemez.
Uzun Bağlam
Uzun bağlam sihirli geliyor: Tek bir istemde 128 bin, 256 bin, hatta 1 milyon belirteç. Kullanışlıdır, ancak gerçek maliyetleri vardır.
Daha fazla bağlam, daha fazla KV önbellek belleği, daha yavaş istem işleme, daha fazla dikkat çalışması, daha zor değerlendirme ve alakasız metnin modelin dikkatini dağıtması için daha fazla yol anlamına gelir. Kalite ayrıca mesafe boyunca düşebilir. Bir model, uzun bir belgenin sonunu iyi bir şekilde işlerken, başlangıca yakın gömülü kritik ayrıntıları gözden kaçırabilir.
Uzun bağlamı tüm belge analizi, kod tabanı dilimleri, yasal veya teknik inceleme, transkript özetleme, çok dosyalı muhakeme ve alma işleminin bağlamı kaçırdığı RAG geri dönüşü için kullanın.
Uzun bağlamı almanın yerine koymayın. Bir tamamlayıcıdır. Büyük külliyatlar için RAG ve nihai seçilmiş kanıtlar için uzun bağlam kullanın.
Pratik alışkanlıklar yardımcı olur:
- Kritik talimatları başlangıca ve sona yakın yere koyun.
- Bölüm başlıkları ve sınırlayıcılar kullanın.
- Kaynak parçalarına bağlı alıntılar isteyin.
- Alakasız geçmişi sıkıştırın.
- Sonsuz sohbet geçmişi yerine özet belleği kullanın.
Uzun bağlamı ücretsiz bir defter olarak değil, pahalı bir dikkat olarak düşünün.
Çok Modluluk
Çok modlu yerel modeller, metne ek olarak görüntüleri ve bazen ses veya videoyu da kabul eder. Modern açık ağırlıklı ekosistemler giderek bu modelleri içerir.
Gizli maliyet, metin dışı girdinin de belirteç haline gelmesidir. Görüntü kodlayıcılar bellek ekler. Görüntü yamaları bağlam tüketir. Ses ve video, girdi bütçesini patlatabilir. Çok modlu şablonların yanlış anlaşılması da yalnızca metin şablonlarından daha kolaydır.
Tek bir yüksek çözünürlüklü görüntü, bağlam penceresinde binlerce belirteç tüketebilir. Yerel olarak çok modlu bir model çalıştırıyorsanız, görüntü belirteçlerini metin belirteçleriyle aynı şekilde sayın. Aynı bütçeden gelirler.
Küçük VLM'ler görsel ayrıntıları halüsinasyon görebilir. OCR güvenilirliği değişir. Grafikler ve tablolar hala zordur. Ciddi belge veya görüntü iş akışları için gerçek örneklerle değerlendirin. Basit bir fotoğrafın gösterimine güvenerek fatura çıkarma kalitesini kanıtlamayın.
2026 Yerel Model Sahnesi

Model sahnesi hızla değişiyor. 21 Mayıs 2026 itibarıyla, yerel LLM kullanıcıları en iyi tek model yerine aileler ve ekosistemler açısından düşünmelidir.
Qwen 3.5 / Qwen 3.6, önemli bir açık ağırlıklı ailedir çünkü tüm yelpazeyi kapsar: Dizüstü bilgisayarlar için küçük modeller, iş istasyonları için yoğun orta boy modeller, çoklu GPU sunumu için MoE modelleri, FP8 varyantları, uzun bağlam, çok dilli çalışma, kodlama, araçlar ve ajan iş akışları. Pratik çıkarım basittir: Dizüstü bilgisayar deneylerinden ciddi yerel sunuma kadar uzanan tek bir ekosistem istediğinizde Qwen güçlü bir varsayılan ailedir.
Gemma 4 önemlidir çünkü Google DeepMind bu aileyi kullanışlı yerel dağıtıma doğru itmektedir: Verimli uç modeller, daha büyük yoğun ve MoE seçenekleri, çok modluluk, daha büyük modellerde uzun bağlam, geniş dil desteği, daha güçlü kodlama/ajan davranışı ve Apache 2.0 lisanslaması. Bu kombinasyon, ticari kullanım ve cihaz tarafı dağıtımı önemli olduğunda test etmeye değer kılar.
Kimi / Moonshot AI, GLM / Z.ai, DeepSeek, MiniMax ve Mistral da takip edilmesi gereken temel ailelerdir. Kimi, uzun vadeli kodlama, çok modlu muhakeme, araç kullanımı ve ajan iş akışları için uygundur. GLM, kodlama ajanları, uzun vadeli görevler, MoE sistemleri ve dağıtım odaklı model sürümleri için önemlidir. DeepSeek, büyük MoE sistemleri, Çok Başlı Gizli Dikkat (Multi-head Latent Attention), DeepSeekMoE, FP8 sunum yolları, seyrek dikkat ve yüksek verimli kendi kendine barındırma nedeniyle etkili olmaya devam etmektedir. MiniMax, pratik ajan iş yükleri ve çıkarım açısından verimli MoE modelleri için izlenmeye değerdir. Mistral hala önemlidir çünkü ürün grubu, genelci, kodlama, muhakeme, çok modlu ve uzman kullanım durumlarını güçlü dağıtım desteğiyle kapsar.
Nemotron 3, NVIDIA donanımında üretim sınıfı ajan sistemleri için NVIDIA'nın açık model ailesidir. Aile, Nano, Super ve Ultra boyutlarını içerir, hibrit Mamba-Transformer MoE tasarımları kullanır ve TensorRT-LLM, NIM, Dynamo, Blackwell NVFP4/FP8 yolları ve kurumsal ajan dağıtımıyla yakından bağlantılıdır. Bunu, gündelik bir masaüstü sohbet ailesinden ziyade, NVIDIA'nın açık ağırlıklı sunum yığınlarının nereye gitmesini istediğine dair bir sinyal olarak değerlendirin.
Açık ağırlıklı yapay zeka artık yalnızca Llama ve diğer her şey değil. Bir ekosistem seçiyorsunuz: Ağırlıklar, lisans, belirteçleyici, şablon, nicelemeler, çalışma zamanı desteği, sunum yolu, topluluk araçları ve hata modları.
Qwen 27B Yoğun Modeli
Qwen 3.5 / 3.6 27B (Yoğun), kodlama, çok dilli çalışma, araç kullanımı, düşünme/düşünmeme modları ve uzun bağlamla ilgilenen yerel kullanıcılar için en pratik genel ağırlıklı seçeneklerden biridir. Qwen 3.5 27B ve Qwen 3.6 27B model kartları, OpenAI uyumlu sunum yollarını, varsayılan düşünme modunu, araç kullanımını ve 262.144 belirtece kadar bağlam uzunluklarını ve desteklenen çerçevelerde YaRN aracılığıyla daha uzun bağlam uzantısını açıklar.
Qwen, çalışma zamanı kodlama, ajanlar veya çok dilli kapsama alanı için doğru şekilde yapılandırıldığında 2x RTX 3090 kurulumu için güçlü bir varsayılandır.
Çıkarım Araştırması
2026'nın sınırı yalnızca model kalitesi değildir. Aynı zamanda çıkarım verimliliğidir. PagedAttention, sunumda KV-önbellek bellek israfına saldırır. FP8 KV önbelleği artık vLLM gibi sistemlerde pratik bir çalışma zamanı özelliğidir. DFlash ve DDTree, blok difüzyon taslak modelleri ve taslak ağaçlarıyla spekülatif kod çözmeyi araştırır. NVFP4 ayrıca NVIDIA donanımında izlenmeye değerdir çünkü desteklenen yığınlar için pratik dağıtım söylemini değiştirir.
Bunların bir kısmı üretime hazırdır. Bir kısmı hala araştırma aşamasındadır. Bazıları yalnızca çalışma zamanınız onu temiz bir şekilde destekliyorsa önemlidir. Makale hızlandırmalarını bir masaüstü uygulamasında bir onay kutusu olarak ele almayın.
Hata Modları ve Düzeltmeler
Çoğu yerel LLM hatası gizemli değildir. Genellikle bellek uyumu, biçimlendirme, çalışma zamanı desteği, kod çözme ayarları veya alma kalitesinden kaynaklanırlar.

Bellek yetersiz: Ağırlıklar, KV önbelleği, çalışma zamanı yükü veya toplu iş boyutu sığmıyor. Daha küçük bir model kullanın, bağlamı azaltın, toplu iş/eşzamanlılığı düşürün, daha iyi bir niceleme seçin veya daha fazla boşluk bırakın.
Anlamsız konuşma veya rol karmaşası: Sohbet şablonu, belirteçleyici, BOS/EOS belirteci, muhakeme modu anahtarı veya araç şeması yanlış. Model kalitesini suçlamadan önce model kartını ve çalışma zamanı şablonunu doğrulayın.
Yavaş ilk belirteç: Ön doldurma pahalıdır. İstemi kısaltın, ön ek önbelleğe almayı kullanın, almayı iyileştirin, bağlamı azaltın veya daha hızlı bir çalışma zamanı kullanın.
Yavaş akış: Kod çözme darboğazdır. Bellek bant genişliğini, nicelemeyi, CPU dökülmesini, dikkat arka ucunu, spekülatif kod çözme desteğini ve modelin donanım için çok büyük olup olmadığını kontrol edin.
Kötü belge yanıtları: Alma muhtemelen başarısız oldu. Ayrıştırılmış metni, öbek sınırlarını, meta verileri, en iyi K almayı, yeniden sıralamayı ve alıntı temellendirmesini inceleyin.
Kötü JSON veya araç çağrıları: Daha düşük sıcaklık, kısıtlı kod çözme, daha katı şemalar, daha iyi örnekler ve araç kullanımı için ayarlanmış bir model kullanın.
Tekrarlayan döngüler: Sıcaklığı veya en iyi p'yi azaltın, tekrar cezaları ekleyin, durdurma belirteçlerini kontrol edin ve şablonun modelin kendi yanıtını yeni bir istem olarak görmesine neden olmadığından emin olun.
Sıkıcı kontrollerle başlayın. Bunlar, model değiştirmekten daha fazla sorunu çözer.
Yığın Nasıl Büyütülür

Başlangıç Seviyesi: En Kolay Kullanışlı Kurulum
Harbor veya LM Studio, güncel bir 4B ila 9B instruct modeli, Q4 niceleme, 8K ila 32K bağlam ve yerleşik bir sohbet kullanıcı arayüzü kullanın. Aynı boyut sınıfında iki veya üç model indirin ve bunları aynı istemlerde karşılaştırın.
Amaç: İstem oluşturmayı öğrenmek, modelleri karşılaştırmak, hızı ve belleği anlamak ve ilk başta özel kodlamadan kaçınmak.
Orta Seviye: Geliştirici Kurulumu
llama.cpp veya Transformers, GGUF veya safetensors, OpenAI uyumlu bir yerel sunucu, basit bir RAG hattı ve küçük bir değerlendirme seti kullanın. Yerel sunucunuzu yalnızca bir sohbet kullanıcı arayüzü kullanmak yerine gerçek bir uygulama veya komut dosyasından çağırın.
Amaç: Yerel uygulamalar oluşturmak, almayı test etmek, kaliteyi ölçmek ve localhost'tan sunmak.
İleri Seviye: Özel Sunum Kurulumu
vLLM veya SGLang, bir veya daha fazla GPU, OpenAI uyumlu bir API, izleme, istem/sürüm yönetimi, bir değerlendirme paketi, yeniden sıralama ile RAG ve araç korumalı alanı kullanın.
Amaç: Gerçek kullanıcılara veya dahili iş akışlarına hizmet etmek, verimi ve gecikmeyi optimize etmek ve güvenlik ve gözlemlenebilirliği sürdürmek.
Uzman Seviyesi: Özel Optimizasyon
TensorRT-LLM, özel çekirdekler, özelleştirilmiş çalışma zamanları, niceleme deneyleri, spekülatif kod çözme, çoklu GPU paralelliği, ince ayar, damıtma ve üretim değerlendirmeleri kullanın.
Amaç: Ölçekte çıkarım verimliliği, daha düşük maliyet ve daha yüksek kalite için mühendislik zamanından ödün vermek.
Gizlilik Otomatik Değildir

Yerel LLM'ler gizliliği artırır çünkü istemler ve çıktılar donanımınızda kalabilir. Ancak yerel, otomatik olarak güvenli anlamına gelmez.
Tehditler arasında kötü amaçlı model dosyaları, pickle tabanlı ağırlık yükleme, güvenilmeyen trust_remote_code, alınan belgelerdeki istem enjeksiyonu, araç çağrısı istismarı, günlükler aracılığıyla sır sızıntısı, masaüstü uygulamalarından gelen telemetri, tarayıcı uzantıları veya eklentileri, yüksek riskli ortamlarda model halüsinasyonları, lisans ihlalleri ve ince ayar sırasında veri kirlenmesi yer alır.
Çalışabilir bir yerel yapay zeka güvenlik temelinin dört alışkanlığı vardır:
- Dikkatli yükleyin: Saygın kaynaklardan safetensors veya GGUF'u tercih edin, güvenilmeyen .bin dosyalarından kaçının ve trust_remote_code'u gelişigüzel etkinleştirmeyin.
- Sınırlarla çalıştırın: Ayrıcalıksız bir kullanıcı, ajanlar için konteynerler veya korumalı alanlar kullanın ve çevrimdışı gizlilik önemli olduğunda ağ erişimini devre dışı bırakın.
- Sırları koruyun: Kimlik bilgilerini istemlerden ve RAG dizinlerinden uzak tutun, masaüstü uygulaması telemetri ayarlarını gözden geçirin ve yürütmeden önce araç çağrılarını doğrulayın.
- Önemli olanı sürümlendirin: Model, istem, adaptör, çalışma zamanı ve niceleme sürümlerini takip edin ve bir gizlilik felaketi yaratmadan hata ayıklama için yeterli günlük tutun.
Yerel yapay zeka güvenliği çoğunlukla sıkıcı operasyonel disiplindir. Bu aynı zamanda rastgele bir kontrol noktası indirmekten, onu root olarak çalıştırmaktan ve yerel yapay zekayı yerel bir güvenlik ihlaline dönüştürmekten nasıl kaçınılacağıdır.
Önemli Olan Kıyaslamalar

Gerçekte çalıştıracağınız yığını kıyaslayın. Bir modelin BF16 lider tablosu puanı, sizin Q4 yerel gerçekliğiniz değildir.
Kaliteyi, gecikmeyi, belleği, güvenilirliği ve çalışma uyumunu ölçün:
- Kalite: Yalnızca genel kıyaslamalar değil, gerçek görevlerinizdeki doğruluk.
- Gecikme: İlk belirtece kadar geçen süre, saniye başına kod çözme belirteci ve uçtan uca süre.
- Bellek: Ağırlık belleği, KV-önbellek büyümesi, tepe VRAM ve yük altında boşluk.
- Biçimlendirme: Sohbet şablonu doğruluğu, JSON/şema başarısı, araç çağrısı güvenilirliği ve durdurma belirteci davranışı.
- Alma: Alıntı aslına uygunluğu, yanıt temellendirmesi, eksik kanıt davranışı ve yeniden sıralayıcı etkisi.
- Operasyonlar: Başlangıç süresi, ısınma davranışı, çökme kurtarma, günlükleme, gizlilik ve sürüm takibi.
30 ila 100 temsili istem içeren küçük bir değerlendirme seti oluşturun. Beklenen yanıtları veya puanlama kriterlerini, gecikme ve bellek ölçümlerini, hata kategorilerini, RAG'a özgü temellendirme kontrollerini, ilgiliyse JSON uyumluluk kontrollerini ve belirsiz görevler için insan incelemesini ekleyin.
Ardından modelleri karşılaştırın. Bir lider tablosunun yerel yığınınızı sizin için seçmesine izin vermeyin.
Yerel Modellerle Kodlama

Kodlama, en iyi yerel LLM kullanım durumlarından biridir çünkü istemler genellikle özel kod içerir, gecikme önemlidir, yineleme sıktır, API maliyetleri hızla artabilir ve yerel modeller düzenleyiciler, kabuklar, grep, test çalıştırıcıları ve yama iş akışlarıyla entegre olabilir.
En güçlü yerel kodlama kurulumu çıplak bir sohbet robotu değildir. Hedeflenen depo bağlamına, kod tabanı üzerinde almaya, dosya yollarına, ilgili kod parçalarına, test yürütmeye ve bir yama döngüsüne bağlı, kod yapabilen bir instruct modelidir.
Kod çözmeyi deterministik veya düşük sıcaklıkta tutun. Belirsiz tavsiyeler yerine yamalar isteyin. Testleri otomatik olarak çalıştırın. Yeni bir modelin gerçekten daha iyi olup olmadığını anlayabilmeniz için gerçek hatalardan ve görevlerden oluşan küçük bir değerlendirme seti bulundurun.
Yerel bir modelin inceleme yapmadan büyük bir kod tabanını yeniden yazmasına izin vermeyin. Yerellik, bir kodlama ajanını bilge yapmaz. Yalnızca bağlamı özel, döngüyü daha ucuz ve entegrasyonu kontrol etmeyi kolaylaştırır.
Yerel Ajanların Korkuluklara İhtiyacı Var

Yerel bir LLM, araçları kullanabildiğinde çok daha kullanışlı hale gelir: Dosya arama, kabuk komutları, tarayıcı otomasyonu, veritabanları, kod yürütme, takvimler, bilet sistemleri, dahili API'ler, vektör veritabanları, ev otomasyonu, robotik veya uç cihazlar.
Araç kullanımı güvenlik modelini değiştirir. Halüsinasyon gören bir sohbet robotu can sıkıcıdır. Dosya sistemine erişimi olan bir ajan, dosyaları silebilir. Tarayıcı erişimi olan bir ajan, sırları sızdırabilir. Kabuk erişimi olan bir ajan, günlükleri okuyabildiğinizden daha hızlı makineye zarar verebilir.
Yerel ajan güvenliğinin dört katmanı vardır. Ajana yalnızca gerçekten ihtiyaç duyduğu dizinleri, API'leri, ağ erişimini ve kimlik bilgilerini vererek kapsamını sıkı tutun. Korumalı alanlar, konteynerler, en az ayrıcalıklı kullanıcılar, yıkıcı eylemler için onaylar ve şema tarafından doğrulanmış araç argümanları ile yürütmeyi kısıtlayın. Girdileri düşmanca kabul edin çünkü alınan belgeler, web sayfaları, biletler ve e-postalar istem enjeksiyonu içerebilir. Araç çağrılarını, model sürümlerini, istemleri ve onayları günlüğe kaydederek, sırları günlüklere dökmeden bir denetim izi tutun.
Yapılandırılmış çıktılar yardımcı olur, ancak bunlar bir güvenlik sınırı değildir. JSON şemaları, kısıtlı kod çözme ve işlev imzaları, araç çağrılarını doğrulamayı kolaylaştırır. Modelin isteği anladığını, güvenli eylemi seçtiğini veya enjekte edilen talimatlardan kaçındığını kanıtlamazlar.
Ciddi araç kullanımı için politika kontrollerini modelin dışına koyun.
RAG, Devasa İstemleri Yener
RAG, Retrieval-Augmented Generation (Alma ile Artırılmış Üretim) anlamına gelir. Tüm bilgileri isteme doldurmak yerine, bir bilgi tabanından ilgili parçaları alır ve modele yalnızca bu parçaları verirsiniz.
İyi bir yerel RAG sistemi genellikle belge alımı, ayrıştırma, öbekleme, yerleştirmeler, bir vektör dizini, alma, yeniden sıralama, istem oluşturma, yanıt oluşturma, temellendirme kontrolleri ve değerlendirmeyi içerir. Her aşama bir başarısızlık noktasıdır.
Kötü ayrıştırma, tabloları çöp haline getirir. Kötü öbekleme, yanıtı sınırlar arasında böler. Kötü alma, alakasız paragraflar döndürür. Kötü yeniden sıralama, doğru yanıtı 20. sıraya gömer. İyi bir model, asla almadığı kanıtlardan güvenilir bir şekilde yanıt veremez.
Çoğu kötü RAG sistemi, LLM yüzünden kötü değildir. Öbekleme, alma, yeniden sıralama ve değerlendirme yüzünden kötüdürler.
Öbekleme stratejisi sessiz katildir. Örtüşmesiz sabit boyutlu öbekler cümleleri bölebilir ve bağlamı kaybedebilir. Anlamsal öbekleme veya üst belge alımı ile hiyerarşik öbekleme genellikle daha iyi çalışır, ancak evrensel bir cevap yoktur. Öbek boyutunu, örtüşmeyi ve bölme kurallarını gerçek belgelerinizde değerlendirmeniz gerekir.
İyi bir yeniden sıralayıcı, vasat bir almayı kurtarabilir. Hiçbir yeniden sıralayıcı, alma sırasında yanıtı kaybeden öbekleri düzeltemez.
Belgeler ve Bilgi Çalışması
Özel belgeler için yerel LLM'ler parlar: Toplantı transkripti özetleri, sözleşme incelemesi, teknik dokümantasyon Soru-Cevap, araştırma notu sentezi, e-posta taslağı hazırlama, politika arama, dahili destek asistanları ve uyumluluk iş akışlarının tümü, kaynak materyali ona sahip olan makineye veya kuruluşa yakın tutmaktan yararlanır.
İş akışı basit ama affetmez. Belgeleri dikkatlice ayrıştırın, sayfa ve bölüm meta verilerini koruyun, anlamsal olarak öbekleyin, yerleştirmeler ve yeniden sıralayıcılar kullanın, alıntılar isteyin, yanıtları genel muhakemeden ayırın ve alıntı aslına uygunluğunu değerlendirin.
Modelin belgelerinizde ne olduğunu bildiğini varsaymayın. Yalnızca isteme koyduğunuzu veya bağlama aldığınızı bilir.
Toplantı transkriptleri için konuşmacı etiketlerini ve zaman damgalarını koruyun. Sözleşme incelemesi için, rastgele belirteç sayısı yerine madde veya bölüme göre öbekleyin. Teknik dokümantasyon Soru-Cevap için, modelin kaynakları doğru bir şekilde alıntılayabilmesi için alınan öbeklere sayfa numaraları veya bölüm bağlantıları ekleyin.
Belge çalışması için, ayrıştırıcınız ve alıcınız model kadar önemlidir.
Uç Dağıtım

Küçük modeller, telefonlarda, dizüstü bilgisayarlarda, robotlarda, IoT ağ geçitlerinde, fabrika cihazlarında, araçlarda, tıbbi cihazlarda, çevrimdışı saha ekipmanlarında ve tarayıcı uygulamalarında giderek daha kullanışlı hale geliyor. Uç, yalnızca iş istasyonunun daha küçük bir versiyonu değildir. Farklı bir dizi kısıtlaması vardır.
Çeviri tamamlandı.
Çeviri:
Edge dağıtımı, düşük bellek, düşük güç, termal sınırlamalar, kesintili bağlantı, gizlilik gereksinimleri, gerçek zamanlı gecikme, küçük bağlam pencereleri ve öngörülebilir geri dönüş davranışı ile yönetilir. Bu cihazlarda, küçük ve güvenilir bir model, büyük ve kırılgan bir modeli yener.
Pratik bir edge kurulumu genellikle 0.5B ile 4B arası bir model, agresif ağırlık nicelemesi, küçük promptlar, sabit şemalar, araç destekli iş akışları, yerel yerleştirmeler, önbelleğe alma ve gereksiz sohbet geçmişi olmamasını içerir.
Bağlantı koptuğunda, çalışmaya devam eden yerel bir model, başarısız olan daha büyük bir modelden daha değerlidir. Yerel yapay zekanın geleceği sadece dev iş istasyonu modelleri değildir. Aynı zamanda veriye yakın, faydalı işler yapan küçük modellerdir.
Yerel Bir LLM Çalıştırma Kılavuzu
Bunu, yerel bir modele gerçek iş için güvenmeden önceki son kontrol noktası olarak kullanın.
Seç ve uydur: Göreve uygun bir model ailesi seçin, lisansı okuyun, donanım gereksinimlerini onaylayın, bir niceleme seviyesi seçin ve toplam bellek faturasını tahmin edin. Sadece ağırlık boyutunda durmayın. KV önbelleği, çalışma zamanı yükü, toplu iş/eşzamanlılık ve güvenlik marjını da dahil edin.
Yükle ve biçimlendir: Güvenilir kaynaklardan safetensors veya GGUF tercih edin, güvenilmeyen pickle tabanlı dosyalardan kaçının, tokenlaştırıcıyı ve sohbet şablonunu doğrulayın, bağlam uzunluğunu bilinçli olarak ayarlayın ve görev için kod çözme parametrelerini seçin. Şablon yanlışsa, değerlendirme geçersizdir.
Değerlendir ve çalıştır: Temsili promptlarla test edin, ilk token süresini ve kod çözme hızını ölçün, tepe bellek kullanımını izleyin, RAG eklemeden önce almayı değerlendirin, ajan eklemeden önce araçları korumalı alana alın ve daha basit yöntemler başarısız olana kadar ince ayar yapmayın.
Önemli olan her şeyi sürümlendirin: Model, niceleme, çalışma zamanı, prompt, sohbet şablonu, adaptör, yerleştirme modeli, yeniden sıralayıcı, değerlendirme seti ve donanım profili. Yerel sistemler, yalnızca ne çalıştırdığınızı yeniden oluşturabildiğinizde kontrol edilmesi daha kolaydır.
İnce Ayar
İnce ayar, ek veriler üzerinde eğitim yaparak model davranışını değiştirir. Yerel kullanıcılar için en önemli yöntemler LoRA ve QLoRA'dır.
LoRA, temel modeli dondurur ve küçük düşük dereceli adaptör ağırlıklarını eğitir. Bu, eğitilebilir parametreleri azaltır ve birden çok hafif adaptörü korumanıza olanak tanır. QLoRA, bunu 4 bitlik nicelenmiş bir model aracılığıyla LoRA adaptörlerine ince ayar yaparak genişletir.
Şu durumlarda ince ayar yapın: Tutarlı bir yazım stiline, alana özgü çıktı formatına, tekrarlayan sınıflandırma veya çıkarma davranışına, araç çağrısı formatı güvenilirliğine, uzmanlaşmış bir asistan kişiliğine, RAG'ın çözemediği alan adaptasyonuna veya dar bir görevde daha iyi küçük model performansına ihtiyacınız varsa.
Önce ince ayar yapmayın. Bu sırayı deneyin: doğru sohbet şablonu, daha iyi prompt, daha iyi model, daha iyi kod çözme, RAG, yeniden sıralama, birkaç örnekli öğrenme ve ardından ince ayar.
Model alanımı anlamıyor gibi görünen sorunların çoğu, aslında promptumun belirsiz olması, şablonumun yanlış olması veya almamın bozuk olmasıdır.
İyi bir ince ayar planı şunları içerir: temiz veri, eğitim/doğrulama/test ayrımı, temel değerlendirmeler, net hedef davranış, güvenlik incelemesi, aşırı uyum kontrolleri, regresyon değerlendirmeleri, adaptör sürümlemesi, lisans incelemesi ve bir geri alma planı.
Açık Ağırlık, Açık Kaynak Anlamına Gelmez
2026'da, açık model ifadesi genellikle özensizce kullanılır. Açık ağırlık, kaynağı mevcut, açık kaynak ve yerel uyumlu arasında ayrım yapmalısınız.
Açık ağırlık genellikle ağırlıkları indirebileceğiniz anlamına gelir. Otomatik olarak modeli ticari olarak kullanabileceğiniz, özgürce değiştirebileceğiniz, çıktıları üzerinde eğitim yapabileceğiniz, herhangi bir ölçekte dağıtabileceğiniz veya atıf gereksinimlerini göz ardı edebileceğiniz anlamına gelmez.
Kaynağı mevcut, kodun veya ağırlıkların görünür olduğu anlamına gelir. Mutlaka lisansın açık kaynak olduğu anlamına gelmez.
Açık kaynak yapay zeka modeli daha güçlü bir iddiadır. OSI'nin Açık Kaynak Yapay Zeka Tanımı, bir yapay zeka sistemini mimari, parametreler/ağırlıklar, çıkarım kodu ve parametreleri türetmek için kullanılan yeterli veri bilgisi ve kodu içeren olarak ele alır. Bu, ağırlıkların Hugging Face'te olmasından çok daha yüksek bir çıtadır.
Bazı lisanslar izin verici görünür ancak kısıtlamalar içerir: Rekabetçi kullanım yok, çıktılar üzerinde eğitim yok, belirli bir ölçeğin üzerinde dağıtım yok, coğrafi hariç tutmalar, atıf gereksinimleri, patent maddeleri veya türevler üzerinde copyleft benzeri yükümlülükler.
Kural: Herhangi bir modeli ticari olarak kullanmadan önce model kartını ve lisansı okuyun. Bir model mükemmel, indirilebilir ve yerel olarak çalıştırılabilir olabilir, ancak yine de yasal veya dağıtım kısıtlamalarınız için uygun olmayabilir.
Sözlük
Model ve Ayar Terimleri
- Aktif Parametreler: Bir MoE modelinde, belirli bir token için yalnızca bazı parametreler kullanılır. Bir modelin yüz milyarlarca toplam parametresi olabilir, ancak token başına çok daha az aktif parametresi olabilir.
- Adaptör: Genellikle LoRA aracılığıyla temel modele eklenen küçük, eğitilebilir bir modül.
- Temel Model: Sohbet veya talimat takibi için özel olarak ayarlanmamış, önceden eğitilmiş model.
- İnce Ayar: Bir hedef alan veya çıktı stili için model davranışını değiştiren ek eğitim.
- Talimat Modeli: Talimatları takip edecek şekilde ayarlanmış model.
- LoRA / QLoRA: Düşük dereceli adaptörler kullanan verimli ince ayar yöntemleri; QLoRA, nicelenmiş temel modeller aracılığıyla eğitim yapar.
- MoE: Uzmanlar Karışımı. Token başına yalnızca seçili uzman alt ağlarının etkinleştirildiği seyrek bir mimari.
- Ağırlıklar / Parametreler: Model içindeki öğrenilmiş sayısal değerler.
Çıkarım Mekaniği
- BOS / EOS: Dizi-başı ve dizi-sonu tokenları.
- Sohbet Şablonu: Sistem, kullanıcı, asistan ve araç mesajlarını temsil etmek için kullanılan biçimlendirme.
- Bağlam Penceresi: Modelin aynı anda işleyebileceği maksimum token sayısı.
- Kod Çözme: Modelin yeni tokenları tek tek oluşturduğu aşama.
- DFlash: Paralel taslak oluşturma için blok difüzyonu kullanan, 2026 yılına ait spekülatif bir kod çözme yaklaşımı.
- DDTree / DTree: Bir blok difüzyon dağılımından bir taslak ağacı oluşturan ve bunu verimli bir şekilde doğrulayan bir spekülatif kod çözme yöntemi.
- GQA / MQA: KV önbellek boyutunu azaltan ve çıkarım verimliliğini artıran dikkat varyantları.
- Çıkarım: Çıktılar üretmek için modeli çalıştırma.
- KV Önbelleği: Önceki tokenlar için depolanmış anahtar/değer dikkat durumları.
- Ön Doldurma: Modelin oluşturmadan önce giriş promptunu işlediği aşama.
- RoPE: Modern LLM'lerde yaygın olan bir konumsal kodlama yöntemi olan Döner Konum Yerleştirmeleri.
- Spekülatif Kod Çözme: Daha ucuz bir taslak modelinin tokenlar önerdiği ve hedef modelin bunları doğruladığı bir hızlandırma tekniği.
- Tokenlaştırıcı: Metni token kimliklerine ve geri dönüştüren bileşen.
- Top-p / Top-k / Sıcaklık: Token oluşturma için örnekleme kontrolleri.
Alma, Dosyalar ve Sunum
- AWQ: Aktivasyon farkındalıklı ağırlık nicelemesi.
- Yerleştirme Modeli: Arama/alma için metni vektörlere dönüştüren model.
- FP8 KV Önbelleği: Bazı çalışma zamanlarında desteklenen pratik bir 8 bit KV önbellek sıkıştırma modu.
- GGUF: llama.cpp tarafından yoğun olarak kullanılan bir model dosya formatı.
- PageAttention: vLLM tarzı sunum tarafından kullanılan bir KV önbellek bellek yönetimi tekniği.
- Niceleme: Bellekten tasarruf etmek ve verimliliği artırmak için sayısal hassasiyeti azaltma.
- RAG: Almayla Artırılmış Oluşturma. İlgili harici bağlamı alın ve modele verin.
- Yeniden Sıralayıcı: Alınan pasajları alaka düzeyine göre yeniden sıralayan model.
- Safetensors: Pickle tabanlı yürütme risklerinden kaçınan daha güvenli bir tensör serileştirme formatı.
Son Sözler
Yerel LLM ekosistemi; kompakt edge modelleri, güçlü 7B ila 32B tüketici modelleri, büyük MoE açık ağırlık sistemleri, çok modlu modeller, uzun bağlamlı modeller, yerel muhakeme modelleri, olgun çıkarım çalışma zamanları ve giderek daha yetenekli özel sunum yığınlarını içerir.
Ancak temeller değişmedi: model her seferinde bir token tahmin eder, tokenlar kelime değildir, ağırlıklar modelin tamamı değildir, sohbet şablonları önemlidir, KV önbelleği gizli bellek faturasıdır, niceleme bir ödünleşimdir, uzun bağlam ücretsiz değildir, RAG kalitesi almaya bağlıdır, ince ayar değerlendirmeler gerektirir ve yerel gizlilik hala güvenlik disiplini gerektirir.
Yerel modelleri iyi çalıştırmak için mitolojiye ihtiyacınız yok. Belleğe neyin sığdığını, modelin hangi şablonu beklediğini, çalışma zamanının nasıl davrandığını ve değerlendirmelerinizin önemsediğiniz işle eşleşip eşleşmediğini bilmeniz gerekir.
Yerel LLM'ler çoğunlukla bellek matematiği artı biçimlendirme artı değerlendirmedir. Bunları doğru yapın, yığının geri kalanı hakkında akıl yürütmek çok daha kolay hale gelir.
Bir dahaki sefere kadar.
-Ahmad





