Fable 5.1 gerçekten canavar gibi bir model. Ve token'ları da canavar gibi tüketiyor.
İşte dört komutla token israfını nasıl azaltacağınız ve bunu daha da ileriye taşıyan ücretsiz açık kaynak repolar.
Bunların hiçbiri çıktı kalitesini etkilemez. Sadece aynı sonuç için ödediğiniz bedeli değiştirir.
Ve bunların hepsi, Fable 5.1 kullanıyor olsanız da olmasanız da işe yarar, çünkü token maliyeti hangi modeli çalıştırdığınızdan bağımsız olarak aynı şekilde birikir.
Şimdi başlayalım.
Adım 1: Çaba seviyenizi düşürün.
Bu, en büyük tasarruf taktiğidir ve her istekte kontrol edebileceğiniz bir ayardır.
Beş seviye vardır: low, medium, high, xhigh ve max.
Çaba, modelin cevap vermeden önce ne kadar düşüneceğini kontrol eder. Daha yüksek çaba, yanıttan önce daha fazla düşünme anlamına gelir ve bu, görevin gerçekten bu düşünmeye ihtiyacı olup olmadığına bakılmaksızın daha fazla token harcar.
Şöyle düşünün. Çaba seviyesi, birinin cevap vermeden önce ne kadar süre düşünmesine izin verdiğinizdir. Birine 2+2'nin kaç ettiğini sorun, "4" der. Önce on dakika boyunca çok düşünmesini isteyin, aynı "4" cevabı için on dakikalık düşünme süresinin bedelini ödersiniz.
İşin aslı... çoğu görev 2+2 gibidir.
Anthropic'in Fable 5.1 için tavsiyesi şudur: varsayılan olan high seviyesinden başlayın. Yalnızca en yetenek odaklı kodlama ve ajan çalışmaları için xhigh veya max'e çıkın. Düşük seviyenin kaliteyi hâlâ koruduğu onaylandıktan sonra, rutin veya gecikmeye duyarlı görevler için medium veya low'a düşün.

Rakamlar inanılmaz. CursorBench'te, düşük çabadaki Fable 5.1, yüksek çabadaki Fable 5'ten daha yüksek puan alırken maliyeti üçte biriydi.
Güvenmeden önce test edin. Doğru cevabını bildiğiniz bir görev seçin ve düşük seviyede çalıştırın.
"Bu isteği düşük çabada çalıştır ve yanıtta neyin değiştiğini söyle"
Gerçek görevlerinizden birini kullanın. Düşük çabanın daha kötü sonuç anlamına geldiğini varsaymadan önce çıktıyı doğrudan karşılaştırın. Ağır işleri, çok adımlı akıl yürütmeyi, gerçek hata ayıklamayı, yanlış bir cevabın daha sonra zaman kaybettireceği her şeyi yüksek veya üzerinde tutun.
Adım 2: Maliyet optimizasyonu çalıştırın.
Bu özellik, claude-api becerisinin bir parçası olarak 26 Ağustos'ta kullanıma sunuldu. Yakın zamandaki kullanımı inceler ve belirli bir proje için önemli olan maliyet kaldıraçlarını sıralar.
1/claude-api cost-optimize
Sırasıyla önbelleğe almayı, token hijyenini, toplu işlemeyi, çaba seviyesini ve model seçimini kontrol eder. Önbelleğe alma ve token hijyeni genellikle en ucuz düzeltmelerdir ve yapısal bir değişiklik (model değiştirmek gibi) önermeden önce en hızlı şekilde karşılığını verir.

Her öneri tek tek onaylanır veya atlanır. Onay olmadan hiçbir şey değişmez, bu nedenle bir kurulumu yeniden yazma riski yoktur.
Adım 3: Prompt denetimi çalıştırın.
Prompt'lar ve beceriler zamanla gereksiz bilgi biriktirir.
Bunu bir çekmece gibi düşünün. Her düzenleme içine bir şey daha koyar ve siz onu asla temizlemezsiniz. Ancak bu "çekmece", gereksiz bilgiler temizlenene kadar her istek için size token ücreti ödetir.
1/claude-api prompt-audit

Sahip olduğunuz herhangi bir Skills klasöründe çalıştırın. Eski beceriler, muhtemelen defalarca düzenlediğiniz beceriler, en çok israfın bulunduğu yerlerdir. Her düzenleme, değiştirdiği şeyi kaldırmadan bir şey eklemiştir. Bunu çalıştırın ve farkı göreceksiniz.
Adım 4: Eski API yapılandırmalarını taşıyın.
Bir proje hâlâ daha eski bir model için oluşturulmuş bir yapılandırmayı çalıştırıyorsa, bu komut, kod tabanı genelindeki model kimliği değişimini ve bozucu parametre değişikliklerini halleder.
1/claude-api migrate this project to claude-fable-5-1
Gerçek hedef modeli adlandırın. Önce kapsamı onaylar (tüm çalışma dizini, bir alt dizin veya belirli bir dosya listesi) ve ardından düzenleme yapar. Daha sonra size elle doğrulanması gerekenlerin bir kontrol listesini verir.
İsrafı daha da azaltmak için dört repo.
Bunlar yalnızca Fable 5.1'e özel değil. Herhangi bir modelde aynı token tasarrufu geçerlidir, bu nedenle nelerin mevcut olduğunu ve her birinin gerçekte ne yaptığını bilmek iyidir.
Caveman

Modelin kendi yanıtlarını ayrıntılı olmak yerine kısa, telgraf tarzı yanıtlara sıkıştırır.
Kurulum:
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
RTK

Kabuk komut çıktısını modelin bağlamına ulaşmadan önce sıkıştıran bir Rust proxy'si.
Kurulum:
1brew install rtk2rtk init -g
Ponytail

Ajanın baştan daha az kod yazmasını sağlar. Elli satır yerine tek bir satırı seçen, kıdemli bir geliştirici bakış açısı.
Kurulum:
1/plugin marketplace add DietrichGebert/ponytail2/plugin install ponytail@ponytail
CodeGraph

Bu tamamen farklı çalışır. Metni sıkıştırmak yerine, kod tabanının bir bilgi grafiğini oluşturur, böylece ajan, dosyaları grep ve read ile taramak yerine doğrudan sembol ilişkilerini ve çağrı grafiklerini sorgulayabilir.
Kurulum:
1npx @colbymchenry/codegraph2cd your-project3codegraph init -i
Nereden başlamalı.
Başka hiçbir şey yapılmayacaksa bile, 1. Adımı uygulayın. Bir sonraki rutin görevde çaba seviyesini düşürün ve çıktıyı karşılaştırın. Bu tek ayar, kredileriniz için herhangi bir repodan daha fazlasını yapar ve denemesi ücretsizdir.
Ardından, projelerinizden herhangi birinde cost-optimize ve prompt-audit çalıştırın.
Anthropic'in kendi ekibinden gelen dört onaylanmış ayar, bir repodan kurulan her şeyden daha iyidir. Bundan sonra, size verdiğim dört repoyla daha geniş ekosisteme bir göz atın.
Bu size token/para kazandırdıysa, beğenmeyi ve ağınızla paylaşmayı unutmayın.
Bir sonrakinde görüşmek üzere :)





