OpenAI veya Anthropic faturanızın içinde gerçekte ne var, ikisinin de yayınladığı ama bir sohbet kutusundan erişemeyeceğiniz indirimler neler ve bu indirimlere erişebilen katman neden artık sahip olabileceğiniz bir şeye dönüştü?
Çoğu insana yapay zekanın size ne kadara mal olduğunu sorduğunuzda, aylık abonelik ücretini söylerler.
Tek bir konuşmanın maliyetini sorduğunuzda ise ortam sessizleşir; bu da anlaşılır bir durum çünkü dürüst cevap karmaşıktır. Hem OpenAI hem de Anthropic, göremediğiniz bir birim üzerinden faturalandırma yapar, fiyatlandırmayı dört ayrı eksen üzerinde belirler ve kendi dokümantasyonlarında, metin kutusunun başında oturuyorsanız neredeyse tamamen erişilemez olan bir dizi indirimi yayınlar.
Bunların hiçbiri gizli değildir. Hepsine şu anda fiyatlandırma sayfalarında ve geliştirici dokümanlarında ulaşabilirsiniz. Sadece çoğu insanın durduğu yerden bir kat aşağı inmeniz gerekir.
Yayınlanan fiyat listesi ile sıradan bir kişinin ödediği fiyat arasındaki bu boşluk bir skandal değildir. Bu bir iş modelidir ve yakın zamana kadar bu işin diğer tarafında olmanın bir yolu yoktu.
Bu yazı, faturada gerçekte neler olduğunu, gerçek kaldıraçların neden orada bulunduğunu ve bu kaldıraçları çeken katmanın sadece ödeyebileceğiniz değil, tutabileceğiniz bir şeye dönüşmesiyle nelerin değiştiğini ele alıyor. Yapay zeka ve sahiplik hakkında daha fazla içerik istiyorsanız @MossAI_Official hesabını takip edin.
Kendi dokümanlarından doğrudan faturanızdaki 7 madde
Aşağıdaki her şey OpenAI veya Anthropic tarafından yayınlanmıştır. Mühendislik ekipleri dışında bunların neredeyse hiçbiri genel bilgi olarak bilinmez. Oranlar sürekli değiştiği için rakamları alıntı olarak değil, yapısal örnekler olarak değerlendirin.
- Her iki platformda da çıktı maliyeti, girdi maliyetinin birkaç katıdır
Her iki fiyat listesindeki tüm modeller, girdi ve çıktıyı ayrı ayrı faturalandırır ve çıktı her zaman daha pahalıdır. Oran genellikle dört ile altı arasında değişir.

Pratikteki bakış açısı değişikliği önemli kısımdır. Yazdığınız şey neredeyse bedavadır. Modelin geri söylediği şey ise faturadır. Yanıtı kısıtlamak, maliyetiniz üzerinde soruyu kısaltmaktan çok daha etkilidir; bu da neredeyse herkesin yaptığı davranışın tam tersidir.
2. Okumanıza izin verilmeyen akıl yürütme için faturalandırılırsınız
Gerçekten sizi şaşırtması gereken madde budur.
OpenAI'nin kendi yardım dokümantasyonu, akıl yürütme (reasoning) tokenlarının yanıt metni olarak görünür olmadığını ancak çıktı kullanımına dahil edildiğini ve çıktı tokenları olarak faturalandırıldığını belirtir. Bu nedenle kısa bir görünen yanıt, görüntülenen metninden daha fazla token kullanabilir. Akıl yürütme rehberleri, ham akıl yürütme tokenlarının ifşa edilmediğini, yalnızca isteğe bağlı bir özet sunulduğunu doğrular.
Yapısal olarak görmenize izin verilmeyen metin için çıktı oranlarını ödüyorsunuz.
3. Çıktı sınırınız gizli kısmı sınırlamaz
Daha da keskinleşiyor. Bu modelleri çalıştırmaya yönelik dokümantasyon, maksimum çıktı token parametresinin yalnızca görünür çıktıyı sınırladığını, gizli akıl yürütme tokenlarının bu sınırdan etkilenmediğini belirtir.
Belgelenmiş bir sonuç buna eşlik eder. Bir istek, bütçesinin tamamını akıl yürütme aşamasında tüketebilir ve hiçbir şey döndürmeden çıkabilir; üstelik tokenlar zaten harcanmış olur. OpenAI'nin akıl yürütme rehberi bu durumu açıkça kabul eder ve görünür bir yanıt almadan girdi ve akıl yürütme tokenları için maliyet oluşabileceğini not eder.
Sayaç çalışır, ekran boş kalır ve bu bir hata değil, belgelenmiş bir davranıştır.
4. Tekrarlayan bağlam %90 indirimlidir ve ikisi de bunu size söyler
İstem önbellekleme (prompt caching), yığındaki en büyük tek kaldıraçtır ve çoğu kişi bunun adını bile duymamıştır.
Anthropic'in önbellek dokümantasyonu, önbellek okumalarını temel girdi fiyatının 0,1 katı olarak belirler; beş dakikalık önbellek yazımı 1,25 kat, bir saatlik yazım ise 2 kat olarak uygulanır. OpenAI, mevcut GPT-5 ailelerinde aynı yapıyı uygular; önbelleğe alınmış girdileri standart girdi oranının yaklaşık yüzde onuna fiyatlandırır ve önbellek yazımları kendi primlerini taşır.
Arithmetic burada faydalı hale gelir. Okuma onda bir, yazım 1,25 kat olduğunda, önbellek isabeti olmayan bir durum (cache miss), aynı ön ek için isabetli duruma göre yaklaşık on iki buçuk kat daha fazla maliyete yol açar ve başabaş noktası yaklaşık iki okumada gerçekleşir. Her çağrıda aynı sistem istemini, araç şemasını veya referans belgesini yeniden gönderen herhangi bir şey için, küçük bir fatura ile büyük bir fatura arasındaki tüm fark budur.

Ayrıca bilmenin değer olduğu şekilde kırılgandır. Her iki sağlayıcı da tam ön eşleşme (exact prefix matching) üzerine önbellek alır, bu nedenle istemin yükseklerinde değişen tek bir bayt, altındaki her şeyi geçersiz kılar ve fiyat sessizce tam orana döner.
5. İkisi de bekleyebilecek işler için faturayı yarıya indirebilir
OpenAI ve Anthropic, girdi ve çıktıda %50 indirimli asenkron toplu işlem (batch) katmanlarını çalıştırır. Anthropic'in fiyatlandırma dokümantasyonu, önbellek çarpanlarının toplu işlem indirimiyle üst üste bindirilebileceğini açıkça belirtir.
Bunları üst üste bindirdiğinizde, toplu işlem içindeki önbelleğe alınmış bir girdi tokenı, standardın çok küçük bir kesrine denk gelir. Etkileşimli hiçbir şey için çalışmaz; bu da hiçbir tüketici ürününün bunu size sunmamasının tam nedenidir.
6. İndirim, hangi modeli kullandığınızı düşündüğünüze değil, hangi model kimliğine sabitlendiğinize bağlıdır
Neredeyse kimsenin kontrol etmediği bir madde de budur.
Önbellek indirimi, bir sağlayıcının kataloğu boyunca homojen değildir. OpenAI'de, mevcut GPT-5 aileleri önbelleğe alınmış girdilerde yaklaşık %90 indirim alırken, eski nesil modeller çok daha az indirim sunar. Anthropic'te standart önbellek okuma çarpanı temel girdinin 0,1 katıdır ve bazı yeni modeller daha da ileri gider.
Aynı sağlayıcı, aynı özellik adı, ancak konfigürasyonunuzdaki bir dizeye bağlı olarak maddi açıdan farklı ekonomiler. Eski model kimlikleri, bundan daha kötüdür. Bulut ortakları aracılığıyla hala erişilebilir olan emekliye ayrılmış Anthropic modelleri, orijinal oranlarını taşır ve bu oranlar, daha düşük yetenekli bir model için mevcut fiyatın birkaç katı olabilir.
Birisi o diziyi bir kez ayarladı ve kimse tekrar göz atmadı. Şaşırtıcı derecede fazla gereksiz harcama aslında burada yatar.
7. Bir bağlam eşiğini aşmak, tüm isteği yeniden fiyatlandırabilir
En ince detay ve en can sıkıcı yapıya sahip olan madde.
OpenAI, bazı modellerde ayrı uzun bağlam oranları yayınlar ve mekanizma insanların varsaydığı gibi değildir. Eşiğin üzerinde, yalnızca çizginin üzerindeki tokenlar değil, tüm istek yeniden fiyatlanır. Bir token fazlası, tüm çağrıyı yaklaşık iki katına çıkarır.
Anthropic bu konuda farklı bir pozisyon aldı. Son Claude modellerinde, tam bağlam penceresi standart token başına oranlarla faturalandırılır ve önbellek ile toplu işlem indirimleri tüm pencere boyunca uygulanır.
Bu, iki platform arasındaki gerçek bir yapısal farktır ve herhangi bir tüketici arayüzünden görünmezdir. İş yükünüz uzun bağlamlarda çalışıyorsa, diğer tüm fiyatlandırma hususlarını gölgede bırakabilir.

Kaldıraçlar kamuya açıktır. Yine de onlara erişemezsiniz.
Yapısal nokta şudur.
Yukarıdaki her kaldıraç API katmanında bulunur. Bunlara erişmek, önbelleğin gerçekten isabet etmesini sağlamak için istem yapısını kontrol etmeyi, doğru işin doğru fiyat katmanına gitmesi için model yönlendirmeyi (routing), gecikmeye tolerans gösterebilen işler için toplu işlem yapmayı, akıl yürütme çabasını kontrol etmeyi ve bir isteğin hangi bağlam katmanına düştüğünü bilmeyi gerektirir.
Tüketici sohbet arayüzünde bir metin kutunuz ve aylık bir ücretiniz vardır. Yönlendirme yapamazsınız, toplu işlem yapamazsınız, önbellek ön ekini yapılandıramazsınız ve akıl yürütme çabası ayarınızın size ne kadara mal olduğunu göremezsiniz.
Bu nedenle bir makas (spread) oluşur. Bir tarafta, bunları birleştirerek yetkin bir operatörün elde ettiği sonuç vardır. Diğer tarafta ise sıradan bir kullanıcının ödediği miktar vardır. Kimse dolandırılmıyor. İndirimler mühendislik yüzeyleridir, tüketici özellikleri değildir ve tüketici ürünleri bunları ortaya çıkarmak üzere tasarlanmamıştır.
Bu makasın içinde yaşayan işletmeler röleler (relays), ağ geçitleri ve toplayıcılardır (aggregators). Kullanıcılar ile sağlayıcılar arasında otururlar, yeterli olan en ucuz modele yönlendirme yaparlar, tekrarlayan bağlamın tam fiyatla yeniden satın alınmaması için önbellekleri sıcak tutarlar, toplu işlenebilecek şeyleri toplu işlerler ve kullanıcıya ham bir API'den daha basit bir şey sunarlar.
Gelirleri bu makastır. İşte burası ilginç hale geliyor.

Bir röle, bir aktarım (throughput) işidir ve bu burada nadirdir
Bu piyasadaki çoğu şey bahistir. Bir görüş benimsersiniz, haklı ya da haksız olursunuz ve sonuç sallanır.
Bir röle ise bir gişe noktasıdır (toll booth). Hacim akar, birim başına marj birikir ve ekonomi, birinin haklı olmasıyla değil, kullanım arttıkça ölçeklenir.
Üç özellik buna bağlıdır ve üçü de nadirdir.
Gelir birim başınadır ve süreklidir. Düzensiz değildir, olay odaklı değildir, bir çağrının doğru yöne gitmesine bağlı değildir. Tokenlar akar, marj birikir, saatlerce böyle devam eder.
Talep kripto ile korelasyonsuzdur. Kod yazan, video üreten ve asistan çalıştıran insanlar önce piyasaya bakmazlar. Tüketim iticisi yapay zeka benimsemesidir ve bu sektörde diğer her şeyle birlikte hareket etmeyen çok az şeyden biridir.
Aktivite bir yorum değil, bir sayıdır. Aktarım, bir atıf tartışması olmadan ölçülebilir. İyi bir ayın beceri mi şans mı olduğu sorusu yoktur. İstekler ya geçti ya da geçmedi.
Sonuncusu, duyulduğundan daha önemlidir. Herhangi bir şeyi sahiplenilebilir kılmanın zor kısmı, ne yaptığını kanıtlamaktır. Bir aktarım işinde, olan şey ile gösterilebilen şey arasındaki mesafe alışılmadık derecede kısadır.

Model Max ve gişe noktasını sadece ödeme yapmak yerine sahiplenmek
Model Max, bir token API rölesidir ve şu anda Moss Agent Marketplace'te bir tazmin (redemption) ajanı olarak canlıdır.
Ürün tarafı basittir. Tek bir rota üzerinden modellere erişim; yönlendirme, önbellekleme ve toplu işleme, bu kararların aslında alınabildiği katmanda (bir metin kutusuyla takılıp kaldığınız katmanda değil) yönetilir.
Diğer yarısı dikkat edilmesi gereken kısımdır. Pazar Yerinde bir ajan olarak röle, sadece kullandığınız bir şey değildir. Aynı zamanda pozisyon sahibi olabileceğiniz bir şeydir.
Bu şekil, bu kategorideki çoğu şeyden farklıdır. Bir rölenin aktivitesi, doğrulanabilir bir iddia için ideal girdiye yakındır çünkü aktarım bir anlatı değil, bir gerçektir. Yorumlanacak bir geçmiş performansı yoktur, güvenerek kabul edilecek bir performans hikayesi yoktur. Kullanım oldu ya da olmadı ve bu okunabilirdir.
Ayrıca, kullanılan şey ile sahiplenilen şeyin aynı nesne olduğu ikinci tazmin ajanımızdır. Rölenin hem müşterisi hem de sahibi olabilirsiniz ve ikinci ilişki bir sadakat seviyesi değildir. Bir pozisyondur.
Ticaret ajanlarıyla başladık çünkü ticaret, var olan en sert sınav alanıdır. Bir sayı ya gerçektir ya da bir hikayedir ve zincir hangisi olduğunu konusunda yalan söylemenize izin vermez. Tazmin ajanları, asla bir perpetual sözleşme açmayacak olan insanlara da aynı standardı taşır. Bunlardan sonra gelecek olanlar, sadece zincir üzerinde çalışan değil, kendileri zincir üzerinde ihraç eden ve işleten sistemlere doğru daha da ileri gider.
Bununla ilgili daha fazlası, çıkmadan önce değil, çıktığında paylaşılacak.
Ne kullanırsanız kullanın, bu hafta yapmanız gereken 4 şey
Bunların hiçbiri Moss gerektirmez.
İstem uzunluğunu optimize etmeyi bırakın ve çıktıyı kısıtlamaya başlayın. Soru için değil, yanıt için para ödüyorsunuz. Beş yüz kelime yerine elli kelime istemek, maliyetiniz üzerinde isteminizi düzenlemekten yaklaşık on kat daha fazla etki yaratır.
Akıl yürütme çabası ayarınızın size ne kazandırdığını kontrol edin. Müzakere gerektirmeyen görevlerde, yüksek çaba, aslında aldığınız hiçbir şeyi iyileştirmeyen gizli tokenlara harcanan paradır. İnsanların farkında olmadan fazla ödeme yapmasının en yaygın yolu budur.
Konfigürasyonunuzu açın ve model kimliğini okuyun. Kullandığınızı düşündüğünüz model adı değil, gerçek dize. Ardından bunu mevcut fiyat listesine karşı kontrol edin. Eski kimlikler sessizce eski ekonomileri taşır ve bazen daha düşük yetenekli bir model için çok daha kötü önbellek indirimlerine sahiptir.
Eğer bir şey inşa ediyorsanız, başka herhangi bir şeyi optimize etmeden önce önbellek isabet oranını ölçün. Yanıttaki kullanım alanları, taze girdi, önbellek yazımları ve önbellek okumaları arasındaki dağılımı verir. Tekrarlayan çağrılarda sıfır okuma, isteminizin yükseklerinde bir şeyin değiştiğini ve altındaki her şeyi geçersiz kıldığını gösterir. Bu, tek bir baytın arkasına saklanmış on iki katlık bir maliyet farkıdır.
Dördünün altındaki alışkanlık asıl derstir. Yapay zeka harcamasını, bir sayı içeren bir abonelik olarak değil, bir yapıya sahip bir fatura olarak ele alın. Yapı görünür hale geldiğinde, onun içinde kimin nerede konumlandığı sorusu da görünür hale gelir.
Şimdi ne yapılmalı?
moss.site adresine gidin ve Model Max'e bakın. Eğer ihtiyacınız buysa onu bir röle olarak kullanın. Eğer ilginizi çekiyorsa, bir pozisyon sahibi olmanın ne anlama geldiğine bakın. İkisi de canlıdır ve aynı nesnedir; bizim yeni bulduğumuz kısım da budur.
Her ekonomi sonunda altyapısının kime ait olduğunu belirler. Yapay zeka ekonomisi şu anda herkesin gişede ödeme yaptığı ve kimsenin "bu gişenin sahibi kim?" diye sormayı düşünmediği aşamadadır.
Bu soru biraz daha açık kalacak.
Kaynaklar
- OpenAI Yardım Merkezi, Anlama ve token sayma, akıl yürütme tokenlarının yanıt metni olarak görünürken çıktı olarak faturalandırılması hakkında: https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them
- OpenAI akıl yürütme modelleri rehberi, ham akıl yürütme tokenlarının ifşa edilmemesi ve görünür bir yanıt olmadan maliyet oluşması hakkında: https://developers.openai.com/api/docs/guides/reasoning
- OpenAI API fiyatlandırma sayfası, mevcut model başına girdi, önbelleğe alınmış girdi ve çıktı oranları, toplu işlem ve esnek katmanlar ve uzun bağlam oranları için: https://openai.com/api/pricing/
- Microsoft Learn Q&A Azure OpenAI faturalandırma hakkında, gizli akıl yürütme tokenlarının faturalandırmaya dahil edilmesi ve maksimum çıktı token parametresinin onları sınırlamaması hakkında: https://learn.microsoft.com/en-us/answers/questions/5542366/why-did-azure-report-more-completion-tokens-than-m
- Anthropic istem önbellekleme dokümantasyonu, önbellek okumalarının temel girdinin 0,1 katı olması, yazım çarpanları ve Batch API indirimiyle üst üste binmesi hakkında: https://platform.claude.com/docs/en/build-with-claude/prompt-caching
- Anthropic fiyatlandırma sayfası, mevcut model başına oranlar ve Batch API indirimi için: https://claude.com/pricing





