Prompt önbelleğe alma, talimatlar ve çabanın ayarlanması, uygulama performansından ödün vermeden Claude'un maliyetini düşürebilir.
Performans ve maliyet genellikle bir ödünleşim olarak görülür: daha az harcamak için daha kötü sonuçları kabul edersiniz. Uygulamada, Claude Platformu kullanan birçok uygulamanın üç düzeltme ile performanstan ödün vermeden maliyeti düşürebileceğini gördük: prompt önbellek isabet oranını en üst düzeye çıkarmak, sınır Claude modellerine geçerken promptlarınızdaki anti-kalıpları kaldırmak ve çabayı göreve göre ayarlamak. Bu kılavuzu claude-api becerisine ekledik. Bu makalede, claude-api becerisine sahip Claude Code'un genellikle performansı korurken veya iyileştirirken maliyeti düşürmenin yollarını nasıl bulabileceğini gösteriyoruz.
Prompt Önbelleği
Claude bir yanıt oluşturmadan önce, önce promptunuzu dahili bir çalışma durumuna işler. Ön doldurma adı verilen bu adım, girdiyi işlemenin pahalı kısmıdır. Prompt önbelleğe alma, bu durumu (anahtar-değer veya KV önbelleği) kaydeder: bir istek aynı önekle başladığında, Claude onu yeniden hesaplamak yerine geri okur. Önbellek okumaları, tam girdi fiyatının bir kısmından faturalandırılır.
Prompt önbelleğinin etkin kullanımını sağlamak için birkaç pratik husus vardır. İlk olarak, prompt önbelleği belirli bir modele sabitlenmiştir. İkinci olarak, prompt önbellek okumaları önek boyunca bayt olarak tam olmalıdır. Son olarak, prompt önbelleğinin sınırlı bir yaşam süresi (TTL) vardır.
Bu noktaları akılda tutarak, birkaç pratik ipucu vardır:
- Konuşma sırasında çaba ayarını değiştirirken dikkatli olun. Bu ayarlar, içeriğinizin önünde prompta işlenir, bu nedenle önbelleğe alınmış önekin bir parçasıdır. Yalnızca Opus 5 ve Fable 5.1 dahil olmak üzere belirli Claude modellerinde, önbelleği bozmadan konuşma sırasında çabayı güncelleyebilirsiniz.
- Değişken değerleri önekten uzak tutun. Sistem promptundaki dinamik bir zaman damgası veya kimlik, model çağrıları arasında değişebilir ve önbelleği bozabilir.
- Kendini yeniden sıralayan araç tanımlarından kaçının. Claude mesajlar API'sini kullanırken, prompt sabit bir sırayla birleştirilir ve araç tanımları en üstte işlenir. Araç tanımındaki herhangi bir değişiklik önbelleği bozacaktır.
- Konuşmaları bölerken dikkatli olun. Alt aracılar ve dallar, yalnızca çatalın öneki bayt olarak aynıysa, aynı modeldeyse ve aynı çabayı kullanıyorsa, üst öğenin önbelleğini paylaşır.
Nasıl düzeltilir
Prompt önbellek yönetimi için birkaç ders biriktirdik:
- Prompt önbellek isabet oranınızı dikkatlice izleyin. Claude Console ve önbellek tanılama API'si, prompt önbellek isabetsizliklerinin nedenleri (Şekil 1) ve iki isteğin tam olarak nerede farklılaştığı dahil olmak üzere prompt önbellek tanılaması sağlar.

- Nadiren kullanılan araçları erteleyin. Tüm araçlarınızı önceden bildirin ancak nadiren kullanılanları defer_loading olarak işaretleyin: bunlar önbelleğe alınmış önekin dışında kalır ve yalnızca Claude bunları araç aramasıyla aradığında konuşmaya eklenir, böylece önbellek korunur.
- Sistem promptu güncellemelerini mesaj olarak uygulayın. Belirli Claude modelleri, sistem promptunu düzenlemek yerine konuşma sırasında bir mesaj olarak bir sistem talimatı eklemenize izin verir, bu da önbelleği korur.
- İsteği, kararlı kısım kararlı kalacak şekilde düzenleyin. Önce statik bağlamı (araç tanımları ve sistem promptu) ve arkalarına büyüyen konuşmayı ekleyin (Şekil 2).

- Prompt önbelleği zaten bozulacaksa model veya çabada değişiklik yapın. Sıkıştırma gibi belirli işlemler, önbelleğin çoğunu (konuşmayı) zaten yeniden yazar. Bu, model veya çaba değiştirmek için iyi bir zamandır, çünkü zaten bir isabetsizlik için ödeme yapıyorsunuzdur.
- Konuşma büyüdükçe önbellek kırılma noktasını taşıyın. Claude Platformu ile, önbellek kırılma noktasını son önbelleğe alınabilir bloğa uygulamak için otomatik önbelleğe alma ayarlayabilirsiniz.
- Önbelleği önceden ısıtın. Gecikmeyi azaltmak için, gerçek trafiğinizle aynı çaba ayarını kullanarak max_tokens: 0 ve açık bir önbellek kırılma noktası ile bir istek gönderin. Bu, promptu işler ve hiçbir şey oluşturmadan önbelleğe yazar. Oturum başlangıcında (örneğin, bir kullanıcı yazarken) çalıştırırsanız, ilk gerçek istek sıcak bir önbelleğe isabet eder.
- Prompt önbellek TTL'sini aşmayın. 5 dakikalık önbellek TTL'si, isteğin başlangıcından itibaren sayılır. Bir aracı, 5 dakikadan uzun süren araç çağrıları veya alt aracı istekleri üzerinde bloke olursa, sonuç geri gelmeden üst öğenin önbelleğinin süresi dolar. Bu gibi durumlarda, önek için 1 saatlik bir TTL ayarlamayı düşünün.
Talimatlar
Promptlar, model zayıflıklarını yamalayan talimatlar biriktirebilir. Bu talimatlar, en son Claude modellerinin yeteneklerine göre sürüklenebilir. İşte sınır Claude modellerini engelleyen ve yanlışlıkla maliyetleri artırabilen yaygın promptlama "anti-kalıpları":
- Doğrulama ritüelleri. "Çalışmanı iki kez kontrol et" veya "yanıtlamadan önce iki kez doğrula" gibi talimatlar genellikle sınır modeller tarafından harfiyen alınır ve tokenları boşa harcayabilir.
- Kapsamlılık ve vurgu artırıcıları. "Maksimum derecede kapsamlı ol", "KRİTİK: HER ZAMAN YAPMALISIN…" sınır modellerle çalışırken ayrıntıya ve ekstra araç çağrılarına yol açabilir.
- Zorunlu prosedürler ve karalama defteri iskeleleri. Sabit adımlı süreçler (örneğin, "bir karalama defterinde adım adım düşün") veya akıl yürütme şablonları, sınır modellerin ihtiyaç duymadığı ritüellerdir. Bu iskele, yerel akıl yürütmenin üzerine yığılabilir ve gereksiz tokenlar kullanabilir.
- Eski örnekler. Eski bir modelin başarısızlık modlarına göre ayarlanmış az sayıda örnek, bir sınır modele ihtiyaç duymadıkları isteklerde uzun akıl yürütme zincirlerini taklit etmeyi öğretebilir.
- Çelişkili kurallar. Sınır modeller talimat takibinde daha iyidir. Çelişkili talimatlar ("her zaman politika dahilinde iade et" vs. "yükseltme olmadan asla iade yapma") sınır modeller tarafından daha harfiyen takip edilebilir ve bu da performansın düşmesine neden olur.
- Güncel olmayan yapılandırma. Daha eski bir Claude nesli için yazılmış ayarlar (örneğin, manuel düşünme bütçeleri), daha yeni modellerle Claude Platformu tarafından reddedilebilir.
Nasıl düzeltilir
claude-api becerisini, bu anti-kalıplara karşı uyanık olan yeni bir komutla güncelledik. Claude Code'da, promptlarınıza, becerilerinize veya araç açıklamalarınıza karşı /claude-api prompt-audit komutunu çalıştırın. Denetim, çalışma dizininizdeki Claude API'sini çağıran uygulama kodu ve Claude Code'un kendi yapılandırması (örneğin, CLAUDE.md veya beceriler) dahil olmak üzere her şeyi kapsar.
Örneğin, bir müşteri desteği kıyaslamasında Opus 4.8'den Opus 5'e bir model geçişini test ettik. Temiz bir prompttan başladık ve her seferinde bir anti-kalıp yerleştirdik (kullanımdan kaldırılmış bir düşünme ayarı, bir çift çelişkili iade kuralı, manuel bir karalama defteri, "iki kez doğrula", "maksimum derecede kapsamlı ol" ve zorunlu altı adımlı bir prosedür), bize altı eski prompt verdi.
Her birini Opus 4.8'de, yalnızca model kimliği değiştirilmiş Opus 5'te ve prompt başına bir kez /claude-api prompt-audit çalıştırdıktan sonra Opus 5'te çalıştırdık (Şekil 3, altının ortalamasını göstermektedir).

Opus 5 ile, doğrulama ritüelleri ("iki kez doğrula"), her iadede sipariş aramayı çoğaltarak gereksiz tokenlar kullanır. Vurgu artırıcıları ("maksimum derecede kapsamlı ol"), düzinelerce gereksiz bilgi tabanı araması haline geldi.
/claude-api prompt-audit komutunu çalıştırmak anti-kalıpları kaldırdı, maliyetleri ortalama %14,6 azalttı ve doğruluğu ortalama %5,3 artırdı. Maliyet düştü çünkü ekstra araç çağrıları ve kopyalanan akıl yürütme ortadan kaldırıldı. Doğruluk üç nedenden dolayı arttı. Kullanımdan kaldırılmış düşünme ayarı, API'nin her yönlendirme isteğini doğrudan reddetmesine neden oldu. Çelişkili iade kuralları, Opus 5'in müşteriden onay isterken borçlu olduğu dört iadeyi alıkoymasına yol açtı. Ve manuel karalama defteri, Opus 5'in yerleşik düşüncesiyle çarpıştı: üç bilette araç çağrısını akıl yürütmesinin içine yazdı ve hiçbir zaman yürütmedi.
Çaba
Çaba, Claude'a "ne kadar çalışması gerektiğini" söyler. Düşük çabada Claude genellikle sonuçlara daha hızlı ulaşır. Yüksek çabada Claude, yanıtlamadan önce müzakere eder, doğrular ve alternatifleri keşfeder.
Tek bir modelde çaba seviyeleri arasında maliyet ve performans arasındaki ilişki değişebilir. Örneğin, Claude Fable 5, FrontierCode Diamond'da (en zor 50 görev) görev başına 5,35 $ için düşük çabada %11,5 puan alır. Maksimum çabada Fable 5, görev başına 19,00 $ için %30,9 alır; çabayı değiştirmek, puanı maliyetin yaklaşık 3,5 katı için yaklaşık 2,7 kat (+19 puan) artırır (Şekil 4).
Claude Fable 5.1'de, Humanity's Last Exam (araçlar olmadan) azalan bir son adımla dik bir eğri gösterir. Soru başına yaklaşık 0,30 $ için düşük çabada yaklaşık %53 ve soru başına yaklaşık 2,23 $ için maksimum çabada yaklaşık %61 puan alır; maksimuma son adım, %46 daha fazla maliyet için yaklaşık yarım puan ekler. Kazanç, kıyaslamanın çalışmadan çalışmaya değişen gürültüsü içinde kalır, bu nedenle ölçülebilir bir kazanç olmadan daha fazla ödersiniz.

Çaba her iki yönde de yanlış ayarlanabilir:
- Daha yükseğin her zaman daha iyi olduğunu varsaymak. Yüksek çaba, aşırı düşünmeye neden olabilir. Claude, görevin gerektirdiğinden daha fazla zamanı müzakere ederek harcar, bu da maliyet ve gecikme ekler ve yanıt kalitesini düşürebilir. Müzakere yalnızca bulunacak kanıt olduğu sürece yardımcı olur.
- Düşük çabaya yönelmek. Çok düşük ayarlandığında, Claude yeterli kanıta sahip olmadan durur. Daha az araç çağrısı yapar, bu nedenle üçüncü yerine ilk arama sonucundan yanıtlayabilir. Zor adımlarda daha az düşünür ve normalde kendi başına çalıştıracağı kontrolü atlar. Yanıt bitmiş görünür, ancak kısmi bilgi üzerine inşa edilmiştir.
Nasıl düzeltilir
Çabayı ayarlamak için bazı yararlı yollar vardır:
- Daha güçlü modelleri daha düşük çabada test edin. Düşük çabadaki daha güçlü bir model, çok çalışan (yüksek çaba) daha zayıf bir modelden daha ucuz olabilir. Örneğin, CursorBench 3.2'de, düşük çabadaki Claude Fable 5.1, maliyetin üçte biri ile yüksek çabadaki Fable 5'in performansına eşleşir (Şekil 5). Daha yeni modeli daha ucuz yapan iki şey vardır: düşük çabada görev başına daha az iş yapar ve Fable 5.1'in prompt önbellek okumaları, milyon token başına Fable 5 için 1,00 $ yerine 0,25 $ olarak fiyatlandırılır. Fable 5'in fiyatlarında bile, düşük çabadaki Fable 5.1 yaklaşık %40 daha ucuza mal olur.

- Görev şeklinizi anlayın. Uygulama performansını bir çaba seviyesi taraması boyunca ölçmek, belirli göreviniz için maliyet-performans ödünleşimini anlamanın yararlı bir yoludur. Doygun olmayan bir değerlendirmede, çaba seviyeleri arasında düz bir maliyet-performans eğrisi, görevin düşünme hesaplamasıyla sınırlı olmadığını gösterir; çabayı artırmak faydalı değildir.
Bu ayarlama genellikle modeller ve çaba seviyeleri arasında bir değerlendirme çalıştırmayı içerir. Claude Code'da, /claude-api hillclimb bu aramayı sizin için gerçekleştirir: değerlendirmenizi eğitim ve test kümelerine ayırır, yapılandırma değişiklikleri önerir ve bulduklarını düzeltmek için başarısız eğitim örneklerini okur.
Bir müşteri desteği kıyaslamasında, varsayılan (yüksek) çabasında Opus 4.8'den başlayarak çalıştırdık. Tepe tırmanıcı önce düşük çabada Opus 5'i denedi ve zorunlu araç çağrısı ritüellerini, karalama defteri adımlarını ve çelişkili kuralları kaldırmak için prompt-audit uyguladı. Bu, %98,9 eğitim doğruluğunda Opus 4.8 taban çizgisini temizledi ve maliyeti bilet başına 2,6 sente düşürdü (Şekil 6).

Daha sonra, bilet başına 1 sentte daha da ucuz olan düşük çabadaki Sonnet 5'e geçti, ancak doğruluk %88,9'a düştü. Başarısız eğitim biletlerini okuyan Claude, prompta yönlendirme kuralları ve bir iade limiti çapraz referansı ekleyerek Sonnet 5'i aynı maliyetle %98,9'a geri getirdi.
Aramanın hiç görmediği 14 ayrılmış bilette, nihai yapılandırma, orijinal kurulumun %78,6'sına karşı %90,5 puan aldı ve maliyeti yaklaşık beşte biri kadardı.
Maliyet Düşürmeyi Otomatikleştirme
Prompt önbelleğe alma, talimatlar ve çaba, maliyeti düşürmek için yaygın kaldıraçlardır. Dokümantasyonumuz daha fazlasını kapsar. Claude API'sini kullanan uygulama kodunun bütünsel bir maliyet denetimini çalıştırmak için /claude-api cost-optimize ekledik: harcamanızın nereye gittiğini profiller, maliyet düşürmeleri uygular ve bir değerlendirme sağlarsanız, tasarrufların performansla nasıl ödünleştiğini gösterir.
cost-optimize, tokenlarınızın nereye gittiğini bularak başlar: bir Claude Admin API anahtarınız varsa kuruluşunuzun kullanım ve maliyet raporlarından, uygulamanız bunu günlüğe kaydediyorsa her API yanıtındaki kullanım nesnesinden veya her ikisi de başarısız olursa istek oluşturma kodunuzu okuyarak ve tahmin ederek.
Daha sonra mevcut tasarrufları sıralar, prompt önbelleğe alma ile başlayarak, her isteğin taşıdıklarını kırparak (bir prompt-audit dahil), çıktıyı sınırlayarak ve gözetimsiz çalışmayı toplu işleyerek. Bir değerlendirme sağlarsanız, daha da ileri gider ve çaba seviyeleri ve model seçenekleri arasında maliyet ve performansı hesaplar. Bunu, Sonnet 5'i bir taban çizgisi olarak kullanarak dört genel kıyaslamada çalıştırdık (Şekil 7):
- LegalBench (~%58 daha düşük maliyet): cost-optimize, görevler arasında paylaşılan bir öneki önbelleğe almayı, düşük çaba ayarlamayı ve görevleri Toplu İşlem API'si aracılığıyla işlemeyi önerdi. Düşünme tokenları 102.779'dan 8.284'e düştü ve geçme oranı gürültü içinde kaldı ve maliyet ~%58 düştü.
- tau2-bench perakende (~%73 daha düşük maliyet): Açık kırılma noktası yerleşimi ile prompt önbelleğe almayı uygulayarak, cost-optimize, geçme oranını sabit tutarken harcamayı %72 azalttı.
- OfficeQA Pro (~%52 daha düşük maliyet): cost-optimize, toplu işleme ve belge önbelleğe alma ekledi ve bu da maliyeti 136,20 $'dan 64,87 $'a düşürdü.
- SWE-bench Verified (~%55 daha düşük maliyet): cost-optimize, varsayılan yapılandırmanın zaten doğru şekilde önbelleğe aldığını buldu. Tasarruflar, çabayı orta seviyeye ayarlamaktan ve aracının çıktısını yalnızca birkaç özlü cümleyle sınırlamaktan geldi. Görev başına medyan adım sayısı 29'dan 17'ye düştü ve prompt tokenları 75,2M'den 33,7M'ye düştü.

Başlarken
Bir sınır Claude modeline geçiş yaptığınızda ve mevcut promptlarınızı kontrol etmek istediğinizde /claude-api prompt-audit ile başlayın. Çalışma dizininizdeki promptları, becerileri ve araç açıklamalarını tarar. Bu, Claude API'sini çağıran uygulama kodu veya Claude Code'un yapılandırması (CLAUDE.md, beceriler) olabilir. Sınır modelleri engelleyen yaygın anti-kalıpları kaldırır.
Uygulamanız Claude API'sini kullandığında ve bir maliyet denetimi istediğinizde /claude-api cost-optimize komutuna başvurun. Token harcamasını profiller ve ardından farklı kaldıraçları test eder: prompt-audit uygular, ancak aynı zamanda prompt önbelleğe alma, gözetimsiz çalışmayı toplu işleme veya çıktıyı sınırlama yoluyla maliyeti düşürmenin yollarını da kontrol eder. Bir değerlendirme sağlarsanız, çaba ve model seçimi ödünleşimlerini ölçer.
Son olarak, maliyet ve performans üzerinde bir arama için /claude-api hillclimb kullanın. Bir değerlendirme verildiğinde, Claude onu eğitim ve test kümelerine ayırır, ardından maliyeti düşürmeyi ve taban çizgisi performansını korumayı amaçlayan uygulamanıza güncellemeler önerir. Claude, aramayı yönlendirmek için başarısız eğitim durumlarını okur ve nihai yapılandırma, ayrılmış test kümesinde puanlanır.
Daha fazla bilgi edinmek için:
- Dokümantasyonumuzu burada görün
- Maliyet düşürme yemek kitabımızı burada görün
- claude-api becerisini burada görün; beceri ayrıca Claude Code'a da yerleşiktir
- Bu makaleyi Claude Blog'da burada görün
Lance Martin (@RLanceMartin), Brad Abrams (@brada), Isabella He (@IsabellaKHe) ve Ben Lehrburger (@benlehrburger) tarafından yazılmıştır.





