LLM Çıkarımı: Geçmiş, Bugün ve Gelecek — Değer Nereye Kayıyor?

@lightseekorg
İNGILIZCE07 Ağu 2026
133K
170
25
8
261

TL;DR

LLM çıkarım motorları metalaştıkça, rekabet avantajı yazılım çekirdeklerinden operasyonel ölçeğe, GPU kapasitesine ve fiziksel veri merkezi varlıklarına kayıyor.

LLM Çıkarımı — Geçmiş, Bugün ve Gelecek: Değer Nereye Kayıyor?

Son iki yıldır LLM çıkarımı, yapay zekâ altyapısındaki en çok çekişilen katmanlardan biri oldu. Düzinelerce çıkarım sağlayıcısı, GPU bulutu, açık kaynak projesi ve çip satıcısı aynı hedefin peşinde koştu: eğitilmiş bir modele rakipten daha hızlı ve daha ucuz hizmet vermek.

Bu çekicilik, makul bir fikre dayanıyordu. Çıkarım, yazılımsal bir hendeği olan bir yazılım sorununa benziyordu. Daha iyi kernel'ler, daha akıllı bir zamanlayıcı veya daha güçlü bir spekülatif kod çözme, premium fiyatlandırmayı ya da aynı fiyatta daha iyi marjları destekleyebilirdi. Bir süreliğine şirket içi motor gerçek bir rekabet silahıydı ve kıyaslamalar anlaşmaları kazandırıyordu.

O dönem sona eriyor. Çıkarım her zamankinden daha önemli ve pazar büyümeye devam ediyor; ancak savunulabilir değer motordan uzağa kaydı. Motor katmanı hızla metalaşıyor. Değer önce servis operasyonlarına ve platformlara, ardından sermayeye, GPU kapasitesine ve nihayetinde veri merkezlerinin kendisine kayıyor.

Yazılım performansı hâlâ önem taşıyor. Yavaş veya güvenilmez bir motor, bir sağlayıcıyı elenebilir kılabilir. Ancak iyi performans artık herkesin erişebileceği bir hâle geldi; bu da herhangi bir şirketin bunun için ek ücret talep etmesini zorlaştırıyor. Soru artık motorun değer yaratıp yaratmadığı değil, motor ortak bir altyapı hâline geldiğinde bu değeri kimin yakalayacağı.

Üç donanım nesli bu kaymayı görünür kılıyor. Aynı desen, bugün çıkarım sağlayıcıları arasındaki rekabeti ve bundan sonra nereye yöneleceğini de açıklıyor.

Bölüm I: Geçmiş — Motor Hendeğin Kendisiyken

Üç nesil, üç kontrol listesi

Her NVIDIA donanım nesli, şirket içi bir motor için bir kontrol listesiyle geldi. Değişen şey, listenin ne kadar hızlı kamuoyunun bilgisi hâline geldiği ve herkes tamamladıktan sonra geriye ne kadar az avantaj kaldığıydı.

Ampere dönemi (A100). İlk çıta somuttu. CUDA Graphs destekleyen, başlatma yükünü ortadan kaldıran; EAGLE-1 veya Medusa gibi spekülatif kod çözme uygulayan ve sağlam bir W8A8 INT8 niceleme sunan bir motor, alanın çoğunun önünde duruyordu. Mühendislik zor ama sınırlıydı ve bu kısa listeyi tamamlamak bir sağlayıcıyı en üst kademeye taşıyordu. Bu özellikler anlaşmaları kazandırıyordu.

Hopper dönemi (H100/H200). Liste büyüdü ve ikiye bölündü. Tek bir dağıtım için — ister tek replika, ister tek düğüm, ister birkaç düğüm — farklılaştırıcılar FlashAttention-3, FP8 attention, EAGLE-3 spekülatif kod çözme ve W8A8 FP8 nicelemeydi. Güçlü uygulamalar, dikkat çekici tek düğüm sonuçları üretiyordu.

Hopper ayrıca ayrıştırılmış dağıtımda ikinci bir cephe açtı. Prefill-decode (PD) ayrıştırması, giderek baskın hâle gelen MoE mimarileri için uzman paralelliği (EP) ve bellek hiyerarşisi genelinde KV önbellek boşaltma desteği, en büyük sözleşmelerin yaşadığı küme ölçeğinde belirleyiciydi. Bu kademe, kernel çalışmasının yanı sıra sistem mühendisliği de gerektiriyordu. Bir süreliğine en güçlü sağlayıcıları diğerlerinden ayırdı.

İki kademe farklı yetenekleri ödüllendirdi. Kernel ekipleri, sınırlı bir dağıtımda hâlâ bir kıyaslamayı kazanabiliyordu; en büyük üretim iş yükleri ise makineler, bellek havuzları ve hata etki alanları arasında koordinasyon gerektiriyordu. Bu ikinci kademenin kopyalanması daha uzun sürdü ve sağlayıcılara mühendislik çalışmasını gelire dönüştürmek için daha geniş bir pencere tanıdı.

Blackwell dönemi (B200/B300/GB200/GB300). Burada kontrol listesi tek ana maddeye daraldı: NVFP4 optimizasyonu. Öne çıkan yol artık bağımsız bir uygulama değil. Ekipler NVIDIA'nın gönderdiği trtllm-gen cubin'lerini entegre ediyor veya doğrudan TensorRT-LLM üzerine inşa ediyor. Spekülatif kod çözme, FP8 ve FP4 yolları, ayrıştırma desteği ve MoE paralelliği zaten referans yığında mevcut.

Blackwell, yap ya da satın al kararını değiştiriyor. Yığını bir kez inşa etmek teknik derinlik gösteriyordu; artık bu, satıcının işini yeniden üretmek anlamına gelebilirken rakipler aynı mühendisleri başka yerde harcıyor. Özel bir uygulama hâlâ alışılmadık bir modele veya dağıtıma uygun olabilir; ancak artık lider performansa giden varsayılan yol değil.

Çıkarımın sırları yok. Önemli her tekniğin bir makalesi, açık kaynak uygulaması veya satıcı ikili dosyası var. Bir zamanlar bir avuç performans ekibi arasında dolaşan bilgi, yetenekli her grubun inceleyebileceği veya entegre edebileceği koda paketlenmiş durumda. Kontrol listesi hâlâ bir motoru nitelendiriyor; ancak artık onu öne çıkarmıyor.

TRT-LLM neden Blackwell'in temeli oldu

TensorRT-LLM'in Blackwell dönemindeki konumu, piyasanın her iki tarafındaki teşviklerden kaynaklanıyor.

NVIDIA'nın TRT-LLM'in iyi performans göstermesine ihtiyacı var. Yazılım; InferenceX başvuruları, lansman günü iddiaları ve açılış konuşması sonuçları dâhil yeni donanım kıyaslamalarının temelini oluşturuyor. Bu nedenle yeni bir çip için optimizasyonlar, büyük bir kernel mühendisliği organizasyonu ve yetkin bir çalışma zamanı tarafından desteklenerek ilk günden TRT-LLM'e geliyor.

Bağımsız motorlar bu avantajı yalnızca çabayla yeniden üretemez. NVIDIA donanım yol haritasını görüyor, en alt yazılım katmanlarını kontrol ediyor ve her neslin lansmanda güçlü görünmesini sağlamak için doğrudan ticari bir nedene sahip. TRT-LLM, bu teşviklerin buluştuğu yer.

Aynı zamanda, bir avuç en ileri düzey açık ağırlıklı model ailesi artık ciddi üretim trafiğinin ezici çoğunluğunu oluşturuyor. Sağlayıcıların yüzlerce mimariyi destekleme ihtiyacı azaldı. Bu daralan model kümesi ve Blackwell donanımı göz önüne alındığında, TRT-LLM mevcut en yüksek performans tavanını sunuyor. Genel amaçlı bir motorun geleneksel gerekçesi olan model desteğinin genişliği, talep daraldığında daha az önem taşıyor.

Üretim artık uzmanlaşmayı ödüllendiriyor. Uzun kuyruğu zarifçe işleyen bir motor kullanışlıdır; ancak bir sağlayıcı gelirinin çoğunu müşterilerin gerçekten talep ettiği modellerden kazanır. Popüler modellerin ve güncel NVIDIA donanımının küçük matrisinde, en yüksek performans mimari genişlikten daha ağır basıyor.

2025 ortasından bu yana daha fazla çıkarım ekibi tamamen bağımsız motorları sürdürmeyi bırakıp TRT-LLM üzerinde ikincil geliştirmeye geçti. Kalıcı zayıflığı kullanılabilirlik. Geliştirici deneyimi zorlu; ancak bir GPU filosundan son yüzde 20'yi çıkarmakla görevli bir ekip, zorlu bir araç zincirini tolere edecektir. Kullanılabilirlik eşitliği bozar; Blackwell üzerindeki TRT-LLM'in eşitliği bozacak rakibi yok.

Bu ekipler mühendislik yapmayı bırakmadı. Hâlâ modelleri ayarlıyor, çalışma zamanı davranışını yamalıyor ve motorun çevresindeki üretim sistemlerini kuruyorlar. Değişen şey, başladıkları katman. NVIDIA'nın temelinden başlamak, daha fazla çabayı kendi iş yüklerine, daha az çabayı genel mekanizmayı yeniden üretmeye yönlendiriyor.

Hızlandırıcı: kodlama ajanları

Açık kaynak yakınsaması ve NVIDIA'nın dikey hamlesi, özel avantajların ömrünü zaten kısaltıyordu. Son altı ayda kodlama ajanları, çıkarım mühendisliğinin maliyetini düşürerek bunu daha da kısalttı.

Kernel çalışması, çalışma zamanı değişiklikleri ve servis altyapısı, yapay zekâ desteğiyle daha hızlı tamamlanabiliyor. Intent Lab, TRT-LLM üzerinde ajan destekli çalışarak yaklaşık bir haftada, çok büyük uçtan uca kazanımlar sağlayan optimizasyonları teslim etti. Daha önce bu kapsamda bir iş, özel bir mühendisi bir çeyrek boyunca meşgul edebilirdi.

Özel motor çalışmasının ekonomisi bu hızla değişiyor. Altı mühendis-ayı gerektiren ve dokuz aylık münhasırlık sağlayan bir teknik, yatırımı haklı çıkarabilirdi. İnşa edilmesi iki hafta sürüyor, rakipler üç haftada yeniden üretiyorsa sonuç bir hendek değil; bir koşu bandıdır. İş teknik olarak zor olmaya devam ediyor; ancak avantajın faydalı ömrü sıfıra yaklaşıyor.

Ekonomik olarak önemli olan, öncülüğün ne kadar sürdüğü. Zor bir optimizasyon, şirket inşa etme maliyetini geri kazanmadan yayılırsa ticari olarak zayıf kalabilir. Kodlama ajanları mühendisliği önemsizleştirmiyor; münhasırlığın daha hızlı sona ermesini sağlıyor.

Açık motorlara kalan: topluluk, kullanılabilirlik ve çok az sadakat

vLLM, SGLang ve diğer açık kaynak motorlar, TRT-LLM'in zorlu geliştirici deneyiminin açık bıraktığı pazara hizmet ediyor. Kendine özel çıkarım ekibi olan sağlayıcılar dışında kalan kullanıcıların çoğu araştırmacıdır veya çevrimdışı üretim çalıştırır: gecikmeye duyarlı çevrimiçi sunum yerine verim odaklı toplu iş yükleri. Bu ortamlarda TRT-LLM ile performans farkı mütevazıdır, çoğu zaman ihmal edilebilir.

Bu kullanıcılar farklı bir iş akışı için optimize eder. Bir modeli hızlıca ayağa kaldırmak, yığını yeniden yazmadan mimari değiştirmek ve bir şey bozulduğunda yanıt bulmak isterler. Birkaç puanlık verimlilik, özellikle iş yükünün etkileşimli bir gecikme hedefi yoksa, bir çalışma zamanıyla boğuşarak geçen günleri nadiren haklı çıkarır.

Benimseme bunun yerine kullanım kolaylığına, dokümantasyona ve topluluğa bağlı. Paketi kur, bir Hugging Face deposuna yönlendir ve OpenAI uyumlu bir uç nokta aç. Bir araştırmacı veya toplu üretim hattı için satın alma kararının tamamı budur.

Benimseme sadakat değildir. OpenAI uyumlu API üzerinde standartlaşma, bir motor geçişini en basit durumda bir base_url değişikliğine indirger. Bir ekip bugün vLLM çalıştırabilir, yarın SGLang deneyebilir ve haftanın ilerleyen günlerinde ikisini de kıyaslayabilir. Açık motorlar, kazandıkları iş yükleri için rekabet etmeye devam etmek zorunda.

Kullanıcılar bu taşınabilirlikten yararlanır; kalıcı kontrol arayan projeler yararlanamaz. Topluluk büyüklüğü bir iş yükünü çekebilir ve dokümantasyon onu bir süre tutabilir; ancak ikisi de bir rakibin daha hızlı bir sürüm yayınlaması durumunda ekibin karşılaştırmayı yeniden yapmasını engellemez.

Gerçek geçiş maliyetleri çevrimiçi üretimde ortaya çıkar. Bunlar izleme ve uyarılardan, dağıtım hatlarından, olağanüstü durum kurtarmadan, otomatik hata kurtarmadan, birikmiş hata düzeltmelerinden ve üretim uç durumlarının uzun kuyruğundan gelir. Yalnızca araç çağrısı ayrıştırma bile bunlardan bolca sağlar. Bu operasyonel katman kilitlenme yaratır; ancak bu, bir yetenek hendeğinden çok geçiş sürtünmesidir. Yetkin bir ekip bunu haftalar içinde başka bir motorun çevresinde yeniden üretebilir. Daha da önemlisi, bu bilgi kullanıcının SRE organizasyonuna aittir; bu nedenle motor projesi bundan hiçbir şey yakalamaz.

Ticari olarak operasyonel bilgi, bir dağıtımı yapışkan hâle getirirken motor satıcısına fiyatlandırma gücü vermez. Kullanıcı geçiş maliyetini üstlenir ve çevresindeki sistemlerin çoğuna sahiptir. Değiştirme can sıkıcı olsa bile, motorun kendisi hesabı güvence altına almış değildir.

Kamu malı olarak açık kaynak

Başlıca açık kaynak motorlar bu rolü büyük ölçüde kabul etti. vLLM ve SGLang çalışmalarının neredeyse tamamını topluluğa geri veriyor. Stratejik hedefleri benimsenme; sonuç ise özellikler, performans ve kararlılık açısından giderek iyileşen ücretsiz bir temel. Pratikte ekosistem, herkes için en ileri düzey çıkarımı sübvanse ediyor.

Projelerin kendileri için bir maliyet var. Temeldeki her iyileştirme, şirket içi motorlar ve iyileştirmeyi yapan açık motorlar dâhil farklılaşma alanını daraltıyor. Tabanı yükselterek bu projeler, kendi katmanlarının değerini de sıkıştırıyor.

İşaret: motor şirketleri yığında yukarı çıkıyor

Motor yazarlarının davranışı, bir motorun tek başına fazla değer yakalayamayacağının en net kanıtı.

İki önde gelen açık kaynak motorun arkasındaki şirketler üretim sunum işi almaya başladı; bildirilene göre önde gelen model laboratuvarları ve tüketici platformlarıyla çıkarım sözleşmeleri imzalıyor. Belirttikleri gerekçe mantıklı: üretim çalıştırmak, bir motorun ele alması gereken hataları ortaya çıkarmanın en hızlı yolu. Ölçekte dogfooding, uç durumları bulur.

Bu aynı zamanda bu şirketleri bir zamanlar en önemli kullanıcıları ve savunucuları olan sağlayıcılarla rekabete sokuyor. Proje benimsenmeyi sağlarken, sunum sözleşmeleri gelir üretiyor. Projenin kullanıcıları aynı hizmeti sattığında bu roller uzlaştırılması zor hâle geliyor.

Motor şirketleri sağlayıcı etiketine karşı anlaşılır şekilde dikkatli. Ekosistemleri, sübvanse edilmiş bir rakip değil, tarafsız bir yukarı akış projesi isteyen şirketlere bağlı. Ancak motor şirketi müşteriler için üretim işlettiğinde, iş nasıl tanımlanırsa tanımlansın örtüşme gerçektir.

Sunuma geçmek, beraberindeki açıklamadan daha fazlasını söylüyor. Motor yazarları, motor katmanının tek başına bir işi desteklemesini beklemiyor. Soru şu: sunum daha savunulabilir mi?

Bölüm II: Bugün — Sağlayıcıları Gerçekte Ne Farklılaştırıyor?

Yerleşiklerin gerçek avantajları kernel'lerle ilgili değil

Together AI, Fireworks ve Baseten gibi önde gelen çıkarım sağlayıcılarının kalıcı avantajları bir motor kıyaslamasında görünmez.

İlk hamle avantajı ve marka. Bir model laboratuvarı bir lansman ortağı aradığında veya yapay zekâ odaklı bir startup üretim çıkarımı istediğinde, bu şirketler ilk kısa listede yer alır. Zihin payı, sözleşme üstüne sözleşmeye karar verene kadar yumuşak görünür. Hızlı bir pazarda varsayılan olarak değerlendirilmek, dar bir kıyaslama öncülüğünden daha değerlidir.

Platform. Yılların çalışması dağıtım araçlarında, gözlemlenebilirlikte, kurumsal kontrollerde ve uyumlulukta birikti. Yeni bir oyuncu bu yüzeyi tek tek yeniden inşa etmek zorundayken, yerleşikler onu genişletmeye devam ediyor.

Bu özelliklerin hiçbiri halka açık bir hız tablosu kazandırmaz; ancak birlikte bir müşterinin bir iş yükünü üretime taşıyıp taşıyamayacağına karar verirler. Ayrıca bileşik etki yaratırlar. Her dağıtım, başka bir eksik kontrolü veya hata modunu ortaya çıkarır ve düzeltme, sonraki müşteriye sunulan platformun parçası olur.

GPU kapasitesi ve tedarik zinciri. Bu, en zor avantaj ve üzerinde en az konuşulan. Sağlayıcılar donanım nesilleri arasında tahsisler güvence altına almalı, bulutlar ve neocloud'larla müzakere etmeli, heterojen filoları yönetmeli ve düzensiz talebe karşı kapasite planlaması yapmalı. Yerleşikler bunu yük altında yapmayı öğrendi. Büyük bir sözleşme geldiğinde belirleyici soru çoğu zaman kimin motorunun daha hızlı olduğu değil, kimin gelecek ay binlerce GPU'yu çevrimiçi duruma getirebileceğidir.

Geç oyuncular bu ekonomilere yanıt veriyor. Modal bir çıkarım hizmeti başlattı. Nebius, bulutuna sunum eklemek için Eigen AI'yı satın aldı. Çıkarım, ham GPU-saatlerinden daha iyi marjlar taşır; bu nedenle GPU bulutları yukarı çıkarken motor şirketleri alttan sunuma geçiyor. Sağlayıcılar, bulutlar ve motor şirketleri aynı katmanda birleşiyor çünkü değer şu anda orada toplanıyor.

Her grup farklı bir avantajla başlar. Motor şirketleri yazılım uzmanlığı, GPU bulutları kapasite, yerleşik sağlayıcılar müşteriler ve işletme deneyimi getirir. Aynı ürüne doğru hareketleri, kalan farkları daha görünür kılıyor: dağıtım, sermaye ve ölçekte güvenilir bir hizmet yürütme yeteneği.

Küçük parti TPS sıralamaları neden solacak

Artificial Analysis'daki düşük eşzamanlılık çıktı hızı sıralaması hâlâ ilgi çekiyor ve yıllarca mühendislik kalitesi için adil bir vekil oldu. Her donanım döngüsüyle daha az şey söylüyor. Standart API testleri ya tek istek ya da on paralel istek kullanır. Bu yükte, bir sağlayıcı daha yeni donanımı DSpark gibi yük farkında spekülatif kod çözmeyle birleştirebilir, makine başka şekilde boştayken her isteğe daha fazla parti kapasitesi harcayabilir ve olağanüstü kullanıcı başına TPS yayınlayabilir. Sayı gerçek ama kapsamı dar: hafif yüklü bir uç noktanın bir kullanıcının token'larını ne kadar hızlı üretebildiğini gösterir; bir filonun bir işletmeye ne kadar verimli hizmet ettiğini değil.

Üretimin farklı bir hedefi vardır. Önce kullanıcı başına TPS'yi uygulamanın gerektirdiği seviyenin üzerinde tut. Ardından bu tabanın altına düşmeden GPU başına dakikada toplam token'ı (TPM/GPU) maksimize et. Kullanıcı deneyimi yeterince hızlı olduğunda, hafif yüklü TPS'deki bir başka artış, aynı GPU'da daha fazla eşzamanlı kullanıcıya hizmet etmekten çok daha az değerli olabilir. Teslim edilen token başına maliyet, manşet sıralamasından daha önemlidir.

Spekülatif kod çözme ayrımı keskinleştiriyor. Düşük partide ucuz olan doğrulama çalışması, eşzamanlılık altında değerli parti kapasitesini tüketebilir; bu nedenle en yüksek hafif yüklü TPS için ayarlanmış bir yapılandırmanın en iyi üretim maliyet eğrisinde olması gerekmez. Yararlı sonuç bir Pareto sınırıdır: bir eksende kullanıcı başına TPS, diğerinde TPM/GPU; uygulamanın hız tabanı çalışma noktasını seçer ve token başına maliyet bundan çıkar.

Küçük parti TPS işe yaramaz değil. Bir etkileşim tabanı oluşturur ve açıkça çok yavaş olan uç noktaları ortaya çıkarır. Artificial Analysis'in kendi artan eşzamanlılık testi, sistemin bir bütün olarak neleri kaldırabildiğini ölçerek daha yararlı yöne işaret ediyor. Solacak olan, küçük parti sıralamasının kazananın her şeyi aldığı yorumu. Üretim alıcıları, kimin en yüksek TPS'yi yayınladığıyla değil, kullanıcı başına TPS gereken tabanın üzerinde kalırken her GPU'nun ne kadar ücretli trafik taşıdığıyla daha çok ilgilenecek. Bu, makalenin deseninin minyatürü: en görünür sayı, paranın nereye gittiğini tahmin etmeyi bırakıyor.

Gün-0 desteği: ilişki hendeği güçleniyor

2026'daki bir değişiklik yerleşikleri daha da güçlendirdi: model geliştiriciler çıkarım sağlayıcılarıyla giderek daha doğrudan ortaklık kuruyor.

Gün-0 desteği bir zamanlar açık kaynak motorlardan geçerdi. Bir lansmandan önce bir laboratuvar vLLM veya SGLang ile koordinasyon kurar; motor desteği birleştirir; aşağı akıştaki sağlayıcılar onu alırdı. Bu, açık motorlara dağıtım zincirinde merkezi bir yer verdi.

Eski bağımlılık zayıflıyor. Büyük laboratuvarlar artık çıkarım sağlayıcılarına sürümden önce, bazen açık kaynak motor ekiplerinden önce erken erişim veriyor. Bir laboratuvarın lansman gününde birleştirilmiş bir pull request'ten daha fazlasına ihtiyacı var. SLA'lı, ayarlanmış ve yük testi yapılmış üretim kapasitesi gerekiyor. Bir sağlayıcı paketi teslim edebilir; bir motor yalnızca ilk bileşenini sağlar.

Erken erişim yayınlanmış bir teknik değil, bir ilişkidir; bu nedenle rakipler bunu bir makaleden veya kernel'den yeniden üretemez. Laboratuvarlar bunu zaten güvendikleri ortaklara verir ve markaya ve kapasiteye sahip sağlayıcıları güçlendirir. Bu arada açık kaynak motorlar, sürüm hattının önündeki yerlerini kaybediyor. Sağlayıcılar Gün-0 çalışmasına giderek daha fazla öncülük ediyor ve motorlar takip ediyor.

Başarılı bir lansman, bir sağlayıcının bir sonraki lansman için erken erişim alma olasılığını artırır ve erken erişim şansını yine artırır. Bir optimizasyonun aksine, ilişki yayınlandıktan sonra piyasanın geri kalanına açılmaz.

Sunum katmanında son oyun: bir sermaye oyunu

Rakipler sunum katmanına ulaştığında ortak bir çıtayla karşılaşır. Güvenilir bir sağlayıcı SLA'sını baskı altında tutmalı, en üst düzey gecikme sunmalı ve doğruluğu korumalı. Bunlar zorlu operasyonel gerekliliklerdir ve sağlayıcıları GPU bayiilerinden ayırır. Ayrıca giriş koşuludur: karşılamak giriş sağlar, kaçırmak bir sağlayıcıyı eler.

Ortak motorlar ve kamuya açık teknikler, ciddi sağlayıcıları karşılaştırılabilir performansa, güvenilirliğe ve fiyatlandırmaya çeker. Bu çizginin üzerinde GPU kapasitesi belirleyici değişken hâline gelir. Başka bir deyişle, rekabet bir sermaye rekabetine dönüşür.

Volan doğrudan işler. Sermaye GPU kapasitesini güvence altına alır. Kapasite, kısıtlı rakiplerin geri çevirmek zorunda kaldığı daha büyük model laboratuvarı ve kurumsal sözleşmeleri mümkün kılar. Bu sözleşmeler çıkarım hacmi ve ARR üretir. Daha yüksek ARR, bir sonraki kapasite bloğunu ödeyen daha büyük bir finansman turunu ve değerlemeyi destekler.

Hazır bir filo ayrıca satış konuşmasını değiştirir. Büyük bir lansman için sağlayıcı seçen bir müşteri, daha sonra ortaya çıkabilecek kapasiteye güvenemez. Ayrılmış, ağa bağlı ve hazır makinelere ihtiyaç duyar. Bu kaynakları taahhüt edebilen bir sağlayıcı, gecikme ve token fiyatı müzakerenin içine girmeden önce avantaja sahiptir.

Mühendisler için bu rahatsız edici bir sonuç. Sunumun son oyunu bir yazılım rekabetinden çok sermaye yoğun bir altyapıya benziyor; erken dönem bulut bilişime, havayollarına veya telekomünikasyona daha yakın. Operasyonel mükemmellik hayatta kalmayı belirler; sermayeye erişim ölçeği belirler.

Operasyonlar hâlâ yaşayabilir şirketleri başarısız olanlardan ayırır. Düşük kullanım oranı, zayıf güvenilirlik veya kötü kapasite planlaması, iyi finanse edilmiş bir sağlayıcıyı yok edebilir. Ancak her ciddi rakip teknik çıtayı karşıladığında, bir kernel iyileştirmesi bir sonraki büyük sözleşmeyi kabul etmek için gereken bilançonun yerini tutamaz.

Piyasa zaten bu yöne hareket etti. Önde gelen sağlayıcılar büyük turlar topladı ve değerlemeleri son bir yılda katlandı. Yatırımcılar kernel mühendisliği için değil, kapasiteyi kapma yarışında konum için ödüyor.

Bölüm III: Gelecek — Değer Betona Gömülüyor

Tahmin: hepsi veri merkezi satın alacak

Sermaye mantığı sahipliğe işaret ediyor. Yeterli ölçekte, mal maliyeti GPU'lar ve elektrik tarafından yönetilen bir şirket, bilgi işlem veya veri merkezi alanı kiraladığında marj kaybeder. Kiralanan her katman, brüt marjın bir kısmını başka bir bilançoya aktarır.

Önde gelen çıkarım sağlayıcıları bu nedenle GPU tahsislerinde veya uzun vadeli bulut taahhütlerinde durmak yerine veri merkezlerini — altlarındaki tesisler ve enerji sözleşmeleri dâhil — satın alacak veya edinecek. Topladıkları savaş sandıkları başka hiçbir son oyunda anlam ifade etmiyor.

Çıkarım sağlayıcısı, motoru ürün olan bir yazılım şirketi olarak başladı. Platform ve SLA satan bir yönetilen hizmet şirketine dönüştü. Şimdi kapasite satan bir altyapı şirketine dönüşüyor. Bu ilerleme boyunca değer; kernel'lerden servis operasyonlarına, ardından çeliğe, araziye ve enerji satın alma anlaşmalarına taşındı.

Her adım şirketin becerilerini ve ekonomisini değiştirir. Yazılım yinelemesi yerini filo yönetimine, tedarike, finansmana ve enerji stratejisine bırakır. Arayüz bir API olarak kalabilir; ancak altındaki iş daha ağır ve kullanıma daha açık hâle gelir.

Hikâye bir yazılım hendeğinin kaybıyla başladı. Aynı şirketlerin dünyanın en eski hendekleri için rekabet etmesiyle kapanıyor: toprak, enerji ve sermaye. Hendek gerçekte hiçbir zaman yazılımda değildi.

Hâlâ "çıkarım sağlayıcısı", asla "neocloud"

Veri merkezleri satın aldıktan sonra bile bu şirketler kendilerini neocloud yerine çıkarım sağlayıcısı olarak tanımlamaya devam edecek. Sermaye piyasaları, token satan bir yapay zekâ altyapı şirketine, GPU-saati kiralayan bir neocloud'dan daha yüksek çarpan verir.

Etiketin altında yeni bir tür neocloud'a benzeyecekler: farklı bir arayüze sahip aynı varlık yoğun temel; çıplak GPU'lar yerine token, SLA ve API satıyor. Dünyanın CoreWeave'leri önce varlık tabanını inşa etti ve sunuma doğru ilerliyor. Dünyanın Fireworks'leri önce arayüzü inşa etti ve varlık tabanına doğru ilerliyor. Her iki yol da aynı kurumsal şekle çıkar; başlangıç noktası etiketi ve ona bağlı çarpanı belirler.

API üzerinden satış paketlemeyi değiştirir. Token'lar yazılımı, operasyonları ve kapasiteyi müşterinin doğrudan tüketebileceği bir üründe paketler. GPU-saatleri alttaki metayı daha fazla açığa çıkarır. İki şirket benzer varlıklara sahip olabilir; ancak biri bu varlıkları yığında daha yukarıda paketlediği için çok farklı değerlemeler alabilir.

Veri merkezlerine sahip olacaklar ve yine de kendilerine çıkarım sağlayıcısı diyecekler çünkü etiket binadan daha değerli.

Gerçek rakip alttan geliyor

Hedef, sermaye yoğun ve veri merkezi sahibi bir token işiyse, mevcut oyuncuları buna uzaklıklarına göre sıralamak rekabet tablosunu değiştirir.

Together AI, Fireworks ve Baseten'in markaları, platformları ve sözleşmeleri var. Yine de çok yıllık inşaat ve enerji teslim süreleriyle kısıtlı tesisler, güç ve neocloud ölçeğinde bir tedarik zincirinden oluşan bir varlık tabanı inşa etmeleri veya satın almaları gerekiyor.

Nebius zaten veri merkezlerine sahip ve kendi GPU tedarik zincirini işletiyor. Halka açık bir şirket olarak ayrıca, özel sağlayıcıların yalnızca tekrarlanan büyük turlarla yaklaşabileceği bir finansman kanalına sahip. Eksik parçası sunum katmanıydı. Eigen AI satın alımı yazılımı ve bir ekibi getirdi; odaklı bir yıl, yazılım açığının çoğunu kapatır çünkü çıkarımın sırları yok.

Buna karşılık, yazılım öncelikli bir sağlayıcı fiziksel takvimi aynı şekilde sıkıştıramaz. Enerji bağlantıları, inşaat ve ekipman teslimatı çok yıllı programları izler. Sermaye bu kuyruklarda bir yer güvence altına alabilir; ancak bunları bir yazılım sürüm döngüsüne dönüştüremez.

Yazılım, bir varlık tabanına, varlık tabanının bir yazılım şirketine eklenebileceğinden çok daha hızlı eklenebilir. Motorun metalaşması sağlayıcıların büyümesine yardımcı oldu, ancak aynı zamanda en tehlikeli rakiplerini de güçlendirdi.

Together AI, Fireworks ve Baseten'in karşısındaki en büyük rakip başka bir sağlayıcı değil. Bu rakip Nebius; ardından teknoloji yığınında yukarı tırmanmaya istekli her neocloud geliyor.

Mühendislik saatleri bunun yerine nereye gidiyor

Çıkarım mühendisliği sağlayıcıların içinde hâlâ önem taşıyacak, ancak kaynak dağılımı değişecek. Açık kaynak motorlar bu yeniden dağılımı mümkün kılıyor.

Ücretsiz motor taban çizgisi iyileştikçe, sağlayıcılar pahalı mühendislik süresini çekirdeklerden ve çalışma zamanlarından kaydırabilir. Bu saatler; SLA'ya somutluk kazandıran altyapı güvenilirliğine, yenilemeleri destekleyen platform deneyimine ve giderek artan ölçüde RL'ye (pekiştirmeli öğrenme) yönelir. Pekiştirmeli öğrenme dağıtımları yoğun çıkarım gerektirir; bu nedenle serving uzmanlığı, büyüyen eğitim sonrası (post-training) pazarı için doğrudan RL altyapısına aktarılır.

Sağlayıcılar teknik işten geri çekilmiyor. Heterojen bir filoda güvenilirlik, yük altında hızlı kurtarma ve verimli RL dağıtımları zorlu sistem problemleridir. Bu çözümler sağlayıcının müşterilerine ve operasyonlarına daha yakın konumlanır ve bu da onları farklılaşma kaynağı olarak daha değerli kılar.

Motor katmanındaki değer kaybolmadı. Açık kaynak, bu değeri ücretsiz bir temele dönüştürerek mühendislik değerinin üzerine inşa edilen sistemlere taşınmasını sağladı. Çoğu şirket için stratejik soru artık bir motor inşa edip etmemek değil. Ücretsiz bir motorun kazandırdığı zamanı nereye harcayacağı. Açık kaynak kamusal fayda çalışmalarının yararlanıcıları, diğer şirketlerin yol haritalarında ortaya çıkar.

Hikâye henüz bitmedi

Oyunun sonu hâlâ belirsizliğini koruyor. Vera Rubin, MI455, LPU ve diğer çıkarım odaklı donanımlar, önceki her donanım geçişinde olduğu gibi kontrol listesini sıfırlayacak. Her sıfırlama; yeni sayısal formatlar, bellek hiyerarşileri ve paralellik dengeleri aracılığıyla motor farklılaşmasına kısa süreliğine yeniden alan açar. Ardından teknikler yayılır ve pencere kapanır.

Yeni model mimarileri ve iş yükleri benzer açılımlar yaratacak. Büyük yeniden kullanılabilir bağlamlara sahip ajanlar ve üretim ölçeğinde RL, yeni kısıtlamalar getiriyor. Motor metalaşması tekrarlayan bir döngüdür. Buluş ile yayılma arasındaki aralık kısalıyor, ancak ortadan kaybolmadı.

Her açılımda hızlı bir ekip hâlâ anlamlı işler kazanabilir. Geçici avantajlar, büyük bir donanım veya model geçişiyle aynı döneme denk geldiklerinde önem taşır; çünkü gelir ve müşteri ilişkileri, rakipler arayı kapattıktan sonra da varlığını sürdürebilir. Değişen şey, açılımı fark edip değerlendirmek için mevcut olan süredir.

Motorlar ve sağlayıcılar hâlâ iki testle karşı karşıya. Birincisi tepki hızı: avantaj hâlâ mevcutken bir geçişi yakalayabilirler mi? Her nesil, bir donanım döngüsü geç kalan iyi yönetilen şirketleri geride bıraktı. Ayrıştırma (disaggregation) veya Blackwell'in NVFP4 ekonomisinde erken hareket eden ekipler, geçici ama bileşik kazançlar elde etti.

İkinci test finansal: ARR büyürken marjı koruyabilirler mi? Bir sağlayıcı, düşük fiyatlı kapasiteyle büyüme satın alarak daha fazla gelir elde edebilir ancak daha fazla para kaybedebilir. Rekabet kızıştıkça ve brüt marjlar altyapı ekonomisine yaklaştıkça, operasyonel disiplin hayatta kalmanın koşulu hâline gelir. Filo kullanımı, enerji maliyetleri, talep tahmini, kapasite planlaması ve taahhütlü ile spot gelir arasındaki denge, bir sonraki kazananlar grubunu belirleyecek. Milyarlarca dolar toplamak yalnızca başlangıç; bu milyarları iyi harcamak asıl ustalık işi.

Bu pazarda değer sürekli yer değiştiriyor: modellerden motorlara, motorlardan serving'e ve serving'den kapasiteye ve enerjiye. Kalıcı bir savunma hendeği kalmayan katmanları geride bırakıyor. Bir sonraki kazananlar, kontrol listesi herkesin bildiği bir bilgi hâline gelmeden bu değişimi fark edecek.

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet