Yapay zeka ile yazılan dizilere yöneldiğimizde, sayısız kişi bunun Pocket FM'in sonu olacağını söyledi. Altı uzun ayın ardından neredeyse onlara inanmaya başlamıştım. Ancak sonra ekosistemimiz patlama yaşadı; hem de yapay zeka yazarlığına rağmen değil, tam da onun sayesinde. İki yıldan kısa bir sürede yapay zekamız, yazarların Pocket üzerinde 100 milyon dolarlık bir fikri mülkiyet (IP) dahil olmak üzere 161 gişe rekorları kıran yapım oluşturmasına yardımcı oldu.
LLM'lerin yazarlıkta bu kadar kötü olması, bizi kendi özel modellerimizi ve altyapımızı kurmaya zorladı. Sıfırdan başlamak zaman zaman moral bozucuydu. Bu süreç devasa bir deneme yanılma sürecini ve platformdaki 550 bin yazar ile 100 milyondan fazla kullanıcının ürettiği altın değerinde bir veri setini gerektirdi.
Hiçlikten nasıl kusursuzca kalibre edilmiş bir yazarlık modeline ulaştığımızı, Pocket FM'in neden mükemmel bir test alanı olduğunu ve Sherpa'nın gişe rekorları kıran yapımlar yazmasını sağlayan o gizli formülü anlatacağım.
ChatGPT piyasaya sürüldüğünden beri herkes onun çok "yapay zeka gibi" duyulduğuna dikkat çekti. Bir LLM'den ne uzunlukta olursa olsun herhangi bir şey yazmasını istediğinizde, metin uzun tirelerle dolup taşar, kısa ve kesik cümleler araya sızar ve ortaya çıkan metin koca, sıkıcı bir ödev gibi okunur.
LLM'ler temelde mantıksal akıl yürütme, matematik sorularını yanıtlama, kodlamada yardım etme ve ansiklopedik bilgiyi geri çağırmak için tasarlandı. Eğitimlerinde hiçbir şey, onlara bir okuyucunun isteyerek okuyacağı veya dinleyeceği bir şey yazmayı öğretmez. Bu, modellerin suçu değildir.
Pekiştirmeli öğrenme, çıktı net bir başarı sinyaliyle bağlantılı olduğunda en iyi şekilde çalışır; yani bir işe yarayıp yaramadığı modeli eğitir. Kodlamada kod ya çalışır ve istediğinizi yapar ya da yapmaz. Sonuç kesindir.
Bir şey yazdığınızda ise onun gerçekten iyi olup olmadığını bilemezsiniz. Okuyucunun ilk cümleden sonra metni bırakıp bırakmadığını veya sonuna kadar okuyup okumadığını bilmezsiniz. Daha da kötüsü, 10 kişiye okudukları belirli bir kitap veya makaleyi sorun, 10 farklı cevap alırsınız.
Üretimi ve dağıtımı tek elden yönetmek, Pocket FM'i çok benzersiz bir konuma getiriyor. Kullanımı dakikası dakikasına izliyoruz. İnsanların ne zaman dinlemeyi bıraktığını, bir sonraki bölüm için geri dönüp dönmediklerini ve uzun vadede bizimle kalıp kalmadıklarını biliyoruz. Bundan daha iyi bir sinyal olamaz. Kullanıcının kopmasına ne sebep oluyorsa Sherpa ondan kaçınmayı öğreniyor; kullanıcıyı belirli bir diziye bağlı tutan ne varsa, Sherpa bunu yeni diziler için kullanıyor.

Pocket FM'deki ortalama bir kullanıcı günde 150 dakikadan fazla dinleme yapıyor; bu YouTube'dakinin neredeyse 3 katı, Netflix'tekinin ise yaklaşık %50 fazlası. Bence son derece eğlenceli, sürükleyici ve hiper kişiselleştirilmiş içeriklerden oluşan yeni bir dalganın henüz çok başındayız ve daha fazla veri elde ettikçe bu dalga sadece daha da güçlenecek.
Yapay zeka yazarlığı neden yapay zeka gibi duyuluyor?
Dostoyevski muhteşem bir yazardı çünkü karakterlerinin davranışlarında ve tiratlarında çelişkileri ve duyguları gözler önüne serdi. Oscar Wilde ve Fitzgerald, esprili anlatımlarını o kadar güzel süslediler ki sayfaları çevirmekten kendinizi alamazsınız. Conan Doyle ise bilgiyi son ana kadar okuyucudan saklama yeteneğiyle öne çıktı.
Genel amaçlı LLM'ler tam da bunların tersini yapmak üzere inşa edildi ve bu konuda ustalaşmalarının bir yolu yok. Cevapları doğrudan verirler, nötr bir dille yazarlar ve aktarımın etkisini artırmak için kaynakları aşırı kullanırlar. Benzer şekilde, iyi yapay zeka asistanları sizi hızla doğru sonuca ulaştırmak üzere eğitilir. Tüm bu temel yapı taşları yazılarına sızar ve işte bu yüzden yazarlıkta kötüdürler.
Yaratıcı yazarlık gerilim, duygu, çatışmanın yaratılması ve yavaşça çözülmesi, tek cümlelik tanımlamaların ötesine geçen karakter özellikleri ve tempo değişimleri gerektirir. Kullanıcılar, onları hikayeye bağlayan ipuçlarını alırken yanlış sonuçlara yönlendirilmelidir.
Daha uzun süre düşünen bir akıl yürütme modeli bile genellikle problemi çözmeye odaklanır; seyircinin o sonuca ulaşma deneyimi için ödüllendirilmez. Bir gizemi çözmek ile bir gizem yazmak birbirinden tamamen farklı iki şeydir.
Var olanı düzeltmeye çalışarak başarısız olduk
Başlangıçta, mevcut olanlarla idare edebileceğimizi düşündük. Hazır modelleri denedik ve onların ruhsuz hikaye anlatıcılığını onarma umuduyla ince ayar yapmaya çalıştık.
Giderek güçlenen modellere doğrudan prompt göndermeyi, hikaye geliştikçe güncellenen özetler tutmayı ve sorguları yanıtlamak için bilgi grafikleri ile geri çağırma (retrieval) sistemlerini kullanmayı denedik.
Doğrudan prompt gönderdiğinizde, 100. bölüme geldiğinizde 10-20 tutarsızlıkla karşılaşırsınız. Güncellenen özetler, önemli detayları adeta boşluğa savurarak bundan sonraki hikayeyi sekteye uğratır. Daha büyük bir bağlam penceresi yardımcı olur ancak modeller yine de uzun bağlamlarda bilgiyi doğru kullanmakta zorlanabilir.
Asıl çıktının yanı sıra sorgular, bir modelin yazdıklarını ne kadar anladığını ölçmenin en iyi yoludur. Erken aşamalarda fark ettik ki bir modele ne kadar emek harcarsak harcayalım, birden fazla bölümden detay gerektiren çok adımlı (multi-hop) anlatıbilimsel sorguları yanıtlamakta başarısız oluyordu. Bu durum, teknolojinin mevcut sınırlarını gözler önüne serdi.
Bu yolun sürdürülemez olduğu sonucuna vardık ve kendi teknolojimizi geliştirmeye karar verdik... Yazarlara hikaye anlatıcılığının en zorlu kısımlarında rehberlik etmesi için hak ettiği adıyla Sherpa.
Sherpa'nın dinlemek isteyeceğiniz bir hikaye yazmasının teknik nedenleri
Sherpa, uzun metrajlı, seri halindeki yaratıcı yazarlık için geliştirilmiş bir model altyapısıdır. Üç bileşenden oluşuyor; bu girişin ardından her birini daha detaylı açıklayacağım:
- Bir planlayıcı, her hikaye yayının (arc) ve sahnenin neyi başarması gerektiğine, karakter gelişimine ve ilişkilerin evrimine karar verir.
- Bir Anlatı Dünyası Modeli (Narrative World Model), neler olduğunu, her karakterin ne bildiğini ve hikayenin seyirciye henüz hangi sözleri verdiğini yapılandırılmış bir şekilde kaydeder.
- Bir düzyazı motoru bu plana ve duruma göre taslak oluştururken, eleştirmenler karakter davranışını, sürekliliği ve sahne kalitesini kontrol eder. Ardından yazar düzenlemeleri ve seyirci tepkileri bir sonraki iterasyonun iyileştirilmesine yardımcı olur.
Sonuçlar oldukça cesaret verici. Sherpa ve rakiplerinin her biri boş bir sayfadan bir hikaye yazdığında, körleştirilmiş ikili değerlendirmelerde rakibe bağlı olarak vakaların %65,6 ila %97,1'inde Sherpa tercih edildi. Sherpa'nın pekiştirmeli öğrenmesi ve Pocket'in büyüyen veri seti göz önüne alındığında, bu farkın açılmaması için hiçbir neden yok.

Bellek - Anlatı Dünyası Modeli (NWM)
Dil modellerinin çağrılar arasında belleği yoktur, bu yüzden bir hikaye hakkında bildikleri her şey prompt'a sığmalıdır. Daha uzun bağlam pencereleri bunu çözmez çünkü modeller, uzun bir prompt'un ortasına gömülmüş bilgileri düzensiz bir şekilde kullanır. Ham metin üzerinde yapılan geri çağırma işlemleri de sorunu çözmez. Bir arama, bir nesnenin nerede olduğunu söyleyen kısmı getirebilir ama şu an nerede olduğunu değil.
Bir bölüm Sherpa ile nihai hale getirildiğinde, bir model ondan yapılandırılmış kayıtları çıkarır ve her biri onu destekleyen metin pasajına bağlanır. Alanlar kurgu için tasarlanmıştır: karakterlerin neleri bilip neleri henüz bilmediği, bir olayın ne zaman gerçekleştiğine karşı seyircinin bunu ne zaman öğrendiği, hangi hazırlıkların bir karşılık beklediği. Her gerçek, onu kuran bölümden onu değiştiren bölüme kadar geçerlidir. Bir yazar önceki bir bölümü düzenlerse, ona bağlı olan her şey yeniden oluşturulur.
Soruları yanıtlamak için NWM, grafiği aynı anda hem tam kelime öbekleriyle hem de anlam üzerinden tarar, her sonucun doğrudan bağlantılarını çeker ve modele küçük, odaklanmış bir paket sunar.
Bölüm farkındalığına sahip geri çağırma sistemi yalnızca ilgili evrensel doğruları (canon) yüzeye çıkararak, gelecekteki hikaye sızıntısı olmadan çok adımlı akıl yürütmeyi mümkün kılar. 60 maddelik dahili bir testte Sherpa NWM, çalıştırma başına 0,7793 dolar maliyetle %86,7 (52/60) doğruluk oranına ulaştı. Bu, opus 5.x sınıfı modellerle Claude Code'un bellek altyapısının sunduğu doğruluğun aynısıdır ve maliyeti yaklaşık 21 kat daha düşüktür (çalıştırma başına 16,2172 dolar). Ayrıca yalnızca düzyazıya dayalı geri çağırma işlemini 20 puan geride bırakırken (66,7% → 86,7%) maliyeti de önemli ölçüde daha düşüktü.

Düzyazı Motoru: Kırmak o kadar zordu ki kendi modelimizi kurmak zorunda kaldık
Pekiştirmeli öğrenme bir ödül sinyaline ihtiyaç duyar ve düzyazının belirgin bir ödül sinyali yoktur. Bir paragrafın Nobel ödüllü kalitede mi yoksa sadece yer doldurucu mu olduğunu söyleyen bir testi yoktur.
Sherpa, yazarlık işinin her bir parçasını farklı bir modele devreder. Her karakter bir ajandır; özel olarak eğittiğimiz ve son eğitimden geçirdiğimiz modeller üzerinde çalışan bu ajanlar, kişiliklerine, hikayenin mevcut hedefine, yakın zamandaki olaylara ve dünyada kendileriyle ilgili olan kısımlara dayanarak bundan sonra ne yapmayı planladıklarını önerir. Ayrı bir eleştirmen modeli her öneriyi inceler ve belirsiz, mantıksız, karaktere aykırı, tekrar eden veya hikayeyi ilerletmeyen her şeyi geri gönderir. Üçüncü bir model olan anlatıcı ise hangi önerilerin sahneye uyduğuna karar verir ve bunları bir sonraki paragrafa yazar. Sayfaya ulaşan eylemler sadece hikayenin belleğine eklenir.
Buna ek olarak, seri kurgu için oluşturulmuş ödül fonksiyonlarıyla tescilli bir düzyazı modeli eğitiyoruz. Süslü ve abartılı anlatımı, tekrarı ve aşırı açıklamayı cezalandırırken; doğal diyalogları, sesleri ve gerilimi ödüllendiriyoruz.
Düzyazıyı ölçtüğümüz sinyaller:
- Bu, yerleşik olaylarla veya karakter bilgisini çelişiyor mu?
- Eylem mantıklı mı, karaktere uygun mu ve sahneyi ilerletiyor mu?
- Yazarlar bu diyaloğu, sesi ve tempoyu alternatifine tercih ediyor mu?
- Dinleyiciler bölümü bitirip sonraki bölümler için geri dönüyor mu?
Bu sinyaller farklı zaman dilimlerinde işler. Bir cümle kulağa hoş gelebilir ama evrensel doğruları bozabilir; bir uçurum kenarı finali (cliffhanger) bir sonraki bölümün başlangıcını iyileştirirken tüm bir hikaye yayını zayıflatabilir. "İyi yazarlığın" ne kadar öznel olduğu düşünüldüğünde, Sherpa'nın elde tutmayı tek bir skor olarak görmek yerine bu sinyaller genelinde optimizasyon yapması gerekir.
Sherpa'nın Düzyazı Motoru, dahili kurgu testlerimizde değerlendirdiğimiz açık kaynaklı ve ticari modellerin çoğunu şimdiden geride bırakıyor; Sonnet 5'e karşı %69, Gemini 3.1 Pro'ya karşı ise %94 düzyazı tercih skoru elde etti. Her bir çubuk, her iki sunum sırasıyla değerlendirildiğinde belirtilen modele kıyasla Sherpa'nın yazımının tercih edilme oranını gösterir; %50 eşitliği temsil eder. Bunlar devam eden son eğitim sürecinin erken sonuçlarıdır ve eğitim sürdükçe daha fazla kazanım elde etmeyi bekliyoruz.

Hiyerarşik Hikaye Planlayıcı
Hikaye yapısı tüm dizinin bir özelliğidir, oysa dil modelleri yalnızca bir sonraki parçayı üretir. Sonraki kelime tahmininde hiçbir şey, 5. bölüme yerleştirilen bir ipucunun 60. bölümde bir karşılığı olması gerektiğini veya bu bölümün bir hedefe, çatışmaya ve sonuca ihtiyacı olduğunu bilmez. Öncü bir modelden alınan 100 sayfalık bir hikayede, yalnızca beş bölümü örnekleyen bir yapay zeka editörü 52 yapısal sorun tespit etti: işe yaramayan ilerlemeler ve hikayenin hiç ihtiyaç duymadığı bölümler.
Sherpa'nın planlayıcısı genel anlatıdan başlayarak yaylara ve bölümlere doğru iner ve her sahneye bir görev verir; buna neyi çözülmemiş bırakması gerektiği de dahildir. Böylece 20. bölüm, 80. bölümdeki büyük ifşayı ele vermeden ona zemin hazırlayabilir. Her hazırlık, karşılığını bulana kadar hikaye belleğinde açık bir söz olarak saklanır. Bir hedef oluşturucu hikayeyi hareket halinde tutar: bir hedefe ulaşıldığında veya tıkandığında, daha önceki hiçbir hedefi tekrarlamayan yeni bir hedef belirler. Aynı 100 sayfalık testte yapısal sorunlar 52'den 31'e düştü ve yalnızca hedef güncellemelerinin kaldırılması bile bölüm düzeyindeki eleştirileri neredeyse yarı yarıya azalttı.

Sherpa'nın önümüzdeki birkaç yıl içinde yazarların milyar dolarlık IP'ler yaratmasına yardımcı olması için gereken her şey hazır. Platforma daha fazla içerik üreticisi ve kullanıcı kattıkça Sherpa da sürekli gelişiyor.
Önümüzde çok iş var ve çözülmemiş birçok sorun bulunuyor; Sherpa'yı mükemmelleştirmek bunlardan biri, yazarların onu en iyi şekilde kullanabilmesi için lojistik koşulları yaratmak da öyle.
Pocket FM'de yaptıklarımız konusunda son derece heyecanlıyım. İçerik üreticilerinin, birkaç yıl önce milyonlarca dolarlık bir bütçe gerektirecek hikayeleri anlatarak geçimlerini sağlamalarına yardımcı oluyoruz.
1 trilyon dolarlık bir fırsatın henüz çok başındayız.





