YouMind
Oturum aç

Bu Çeviri Gerçekten Doğru mu?

@KurandoIida
JAPONCA21 May 2026
531K
47
6
4
32

TL;DR

Bu makale, modern çeviri süreçlerindeki nesnel değerlendirme eksikliğini incelemekte ve kaliteyi basit bir akıcılığın ötesinde değerlendirmek için yapılandırılmış özetler kullanan bir araç olan CATER'ı tanıtmaktadır.

Uzun bir İngilizce e-posta alıyorsunuz, denizaşırı bir müşteriden. Cevap yazmaya vaktiniz yok. Şimdilik onu DeepL'e ya da daha yeni bir alışkanlıkla ChatGPT'ye atıp Japoncaya çeviriyor ve ekranınızda okuyorsunuz. İçeriği anlıyorsunuz. Bir yargıya varabiliyorsunuz. Ya da en azından, öyle hissediyorsunuz.

Bunun tersi de geçerli. Şirket içi bir İngilizce duyuru yapmanız gerekiyor, bu yüzden Japonca yazdığınız bir taslağı makine çevirisinden geçiriyor, çıkan İngilizceyi tarıyor, "gayet iyi görünüyor" diye düşünüyor ve gönder tuşuna basıyorsunuz. Karşı taraftan gelen cevap pek tuhaf görünmüyor. Yani "Bu sefer de iyi gitmiş olmalı" diye düşünüyorsunuz.

Sorun şu ki, bu tarafta kimse gerçekten iyi gidip gitmediğini doğrulamış değil. Kaynak ve hedef metinleri yan yana koyup "bu kısım iyi", "bu kısım riskli" ya da "bu kısım felaket" diye yargılayan süreç, modern çeviri hatlarında eksik.

Bu sadece kişisel e-postalarla sınırlı değil. Pazarlama metinleri, şirket içi duyurular, sözleşme taslakları, yatırımcı ilişkileri materyalleri, destek SSS'leri—son birkaç yılda her türden belge makine çevirisine teslim edildi. Hacim patladı. Oysa kalite kontrol katmanı neredeyse hiç artmadı. Bazı insanlar kontrol ettiklerini sanıyor. "Okuyup rahatsızlık hissetmemeyi" kontrol sanıyorlar. Öyle değil. Bu bir kontrol değil; bu, temenni.

Ve birçok kişinin gözden kaçırdığı şey, bunun sadece makine çevirisiyle ilgili olmadığıdır. Profesyonel çevirmenlere sipariş edilen çevirilerde bile, müşterinin çevirinin tüm metin boyunca niyetiyle tutarlı olup olmadığını bağımsız olarak doğrulamasının neredeyse hiçbir yolu yoktur. Teslim edileni okurlar, "Japonca gibi okunuyor" ya da "İngilizce olarak geçer" diye düşünürler ve iş biter. Maliyet sorunları nedeniyle, işin tüm metin için verilen brife göre yapılıp yapılmadığını madde madde doğrulama görevini kimse üstlenmez. Bunu yapmanın bir yolu olmadığını söylemek daha doğru olabilir.

Çeviri değerlendirme alanı bu sorunu çözme işini üstlendi. Ancak bu alan, sektör dışındakilerin düşündüğü kadar iyi durumda değil.

Makine Çevirisi Herkesin Sandığı Kadar Mükemmel Değil

Öncelikle bir efsaneyi ortadan kaldırmak gerekiyor.

2026'daki makine çevirisi ve LLM çıktıları kesinlikle birkaç yıl öncesinden farklı bir seviyede. Bu bir gerçek. Günlük kullanımın %80'inde, insanların artık işi yeniden yapması gerekmiyor.

Ancak, bundan sonrası yanlış anlaşılıyor. Geri kalan %20'de—özellikle çevirinin belirli bir "amacı" olduğu durumlarda—mevcut sistemler hala tutarlı çalışmıyor. Spesifik olarak iki şey oluyor.

Birincisi, çeviri niyetindeki dalgalanma. Aynı kaynak metni aynı modele iki kere atıp ikisinde de "konuşma olarak çevir" talimatı verseniz bile, ortaya çıkan iki çeviri tutarlı bir tonda olmayacak. Biri kışkırtıcı olabilirken diğeri biraz daha ölçülü olabilir. Amaca göre varış noktası sadece olasılıksal olarak belirleniyor.

Diğeri ise uzun metinlerdeki tutarlılık. Bir belge "contract" kelimesini ilk yarıda "sözleşme" olarak çevirirken, ikinci yarıda "akdi" olarak çevirebilir. İlk yarıda resmi olan bir ton, ikinci yarıda fark edilmeden samimiye kayabilir. Özel isimler üç farklı yazımla görünebilir. Tek başlarına bunlar ölümcül değil. Ama belgenin bütünü için, beden darbeleri gibi kaliteyi aşındırırlar.

Dahası, bu sorunları sadece çıktıyı okuyarak fark etmek zordur. Her bir cümleye bakarsanız, hepsi "düzgün cümlelerdir". Rahatsızlığın kaynağı cümle seviyesinde değil, belge seviyesindedir. Rahatsızlık hissetmeyen okuyucular, gönder tuşuna basarken kendilerini güvende hissederler. Bunun güvende hissetmeleri gereken bir durum olup olmadığı ayrı bir konu.

Aynı yapısal sorunlar insan çevirmenlerde de görülür. Uzun bir belge sırasında yorgunluk ya da yargı dalgalanmaları baş gösterir. Tür veya üslup ayrıntıları ilk ve son sayfalar arasında tam olarak örtüşmeyebilir. Kıdemliler bunun farkındadır, bu yüzden öz-değerlendirmeye zaman ayırırlar. Ancak bu öz-değerlendirmenin tam olup olmadığını dışarıdan doğrulamanın da bir yolu yoktur.

Kısacası, ister makine ister insan olsun, sektör genelinde bir çevirinin kalitesinin "amaca göre" ve "tüm metin boyunca" tutarlı olup olmadığını bağımsız olarak doğrulayacak bir mekanizma eksiktir. Mevcut durum budur.

Sahip Olduğumuz Metrikler Umursadığımız Şeyi Ölçmüyor

Doğrulama mekanizmaları olmadığından değil. Var. Sorun, neyi ölçtükleri.

Makine çevirisi araştırmalarındaki iki ana otomatik değerlendirme metriği BLEU ve COMET'tir. BLEU, çıktıyı bir referans çeviriyle karşılaştırır ve örtüşen kelime dizilerini sayar. COMET, anlamsal benzerliği puanlamak için önceden eğitilmiş bir model kullanır. Her ikisi de amaçlanan kullanımları için faydalıdır. Ve her ikisi de mühendisliğin kaçamayacağı aynı öncülü paylaşır: "doğru cevap" diye bir şeyin var olduğu ve bu doğru cevabın test setine konulan referans çeviri olduğu öncülü.

Bir etkinlik olarak çeviri bu şekilde çalışmaz.

Japon çocuk edebiyatından bir cümle ödünç alalım: "Ano otokonoko wa marude Momotaro mitai da." Japonya'da büyümüş biri için Momotaro, bir köpek, bir maymun ve bir sülünle devleri yenen bir halk kahramanıdır. Bir çocuğa "Momotaro gibi" demek, yaşına göre cesur olduğu, gözü pek olduğu ve küçük olsa da hafife alınmaması gerektiği anlamını taşır.

Bunu Momotaro'yu hiç duymamış bir İngiliz okuyucu için çevirirseniz, birden fazla seçenek vardır.

Kelimesi kelimesine yazabilirsiniz: "That boy is just like Momotaro." Orijinalin yüzeyi mükemmel korunur. Referans çeviri de aynısıysa, BLEU çok mutlu olur. Ancak İngiliz okuyucuya neredeyse hiçbir şey aktarılmaz. Cümlenin anlamı, bilmedikleri bir ismin içinde tamamen kilitli kalır.

Şöyle de yazabilirsiniz: "That boy is so brave for his age." Kültürel özgüllüğü feda edersiniz, ancak anlam anında yerine ulaşır.

Ya da cesur bir adım atabilirsiniz: "That boy's another little Hulk." Bu cesur bir seçimdir. Kültürel olarak anlaşılmaz bir referansı, kültürel olarak anlaşılır bir başkasıyla değiştirir. Referansın "içeriğinden" ziyade "işlevini" nakleden bir uyarlamadır. Brife (sipariş detaylarına) bağlı olarak, bu en iyi hamle olabilir veya uygunsuz olabilir.

Hangisi doğru cevaptır? Koşullara bağlıdır. Okuyucuya, mecraya, izin verilen takdir aralığına, çevreleyen metnin üslubuna ve yaklaşık on iki başka faktöre bağlıdır. Ve tüm bu faktörler cümle seviyesinin üzerinde, sadece cümlelere bakan metriklerin göremediği bir yerde bulunur.

BLEU, şans eseri referans çeviriyle eşleşen seçimleri över ve hangisi daha üstün olursa olsun diğer her şeyi cezalandırır. COMET, anlamsal mesafeye göre sıralar ve çevirinin okuyucuda nasıl bir etki yaratması gerektiği sorusunu tamamen atlar. Hiçbiri size "bu işe hangi seçim uyuyor" demez. Her şeyden önce, Hulk ile değiştirme fikri bir insan çevirmenin yapabileceği bir sıçramadır, ancak bir referans çeviriye yakınlık üzerine eğitilmiş bir metrik bunu asla ödüllendirmez.

Çeviri hakkında önemli bir şey söyleyeyim. Tek bir doğru cevap yoktur. Her satır için, geçerli seçenekler bir yelpaze gibi açılır. Hangisini alacağı çevirmenin yargısıdır. "Momotaro gibi," "yaşına göre cesur," "küçük bir Hulk"—hepsi savunulabilir seçimlerdir. Değerlendirmenin işi, tek ve biricik doğru çeviriyi tahmin etmek değildir. Çevirmenin yaptığı yargıya bakıp bu iş için işe yarayıp yaramadığını açıkça söylemektir.

Doğrudan Bir LLM'ye Sorduğunuzda Ne Olur

Modern yolu tercih etmek isterseniz, metrikleri atlayıp doğrudan bir LLM'ye sorabilirsiniz. "İşte kaynak, işte çeviri—nasıl?"

Bu, düşündüğünüzden daha iyi ve umduğunuzdan daha kötü çalışır.

Düşündüğünüzden daha iyi çalışır çünkü LLM'ler prensipte üslup, hedef kitle, kültürel referanslar ve retorik etkiler gibi—BLEU ve COMET'in ulaşamadığı şeyler hakkında akıl yürütebilir. Bir cümlenin ritmini kaybettiğini fark edebilir. Momotaro çevirisinin anlaşılmaz olduğunu belirtebilir.

Umduğunuzdan daha kötü çalışmasının iki nedeni vardır ve pratikte birleşik bir etki yaratırlar.

Birincisi, değerlendirme eksenlerinin kayması. Aynı soruyu aynı modele iki kere sorarsanız, farklı boyutsal konfigürasyonlara sahip cevaplar döndürecektir. İlki akıcılığa odaklanabilir, ikincisi doğruluğa ve üçüncüsü yarı yolda yeni bir kategori icat edebilir. Birden çok belgedeki değerlendirmeleri karşılaştıramazsınız çünkü ölçülen şey baştan tutarlı değildir. Siz ölçerken, ölçüm aletinin kendisi hareket ediyordur.

İkincisi ise dalkavukluktur (pozpohlama). LLM'ler, muhataplarını memnun etmek için oldukça güçlü bir şekilde eğitilir. Bir çeviri uzatıp "Bu iyi mi?" diye sorarsanız, yüksek olasılıkla "İyi" diyecektir. Itiraz ederseniz, itirazınıza katılacaktır. Model, "soğukkanlı bir değerlendirici olmak" için değil, "dinliyormuş ve kullanıcıya saygı duyuyormuş gibi yapmak" için optimize edilmiştir. Düşük riskli kullanımlar için bu sorun değildir. Ancak çeviriyi bir ürün olarak teslim eden, çeviriyi notlayan ya da gerçek parayla çeviri satın alan biri için bu özellik, ihtiyaç duyulanın tam tersidir.

Sonuç olarak, garip bir durum devam etti. İstediğimiz şey—uzman olmayanların çevirileri gerçekten doğrulaması için bir araç—düzgün bir şekilde mevcut değildi. Çeviriyi dışarıdan yaptırdıysanız, sadece satıcıya güvenmek zorundaydınız. Makine çevirisi kullandıysanız, parmaklarınızı çarpıp dua etmek zorundaydınız. Bir çeviriyi güvenilir bir şekilde kontrol edebilen tek kişiler, zaten her iki dile de çeviriye ihtiyaç duymayacak kadar hakim olan kıdemli incelemecilerdi.

CATER'ın Yapmaya Çalıştığı Şey

CATER adında bir araç var. Ben geliştirme tarafındayım. Bunun bu soruna yönelik ilk ciddi çözüm girişimi olduğuna inanıyorum, bu yüzden ne yaptığını açıklayayım.

CATER, çeviriyi altı açık eksende değerlendirir: Dilbilgisel Hassasiyet (GP), Anlamsal Bütünlük (SI), Olgusal Tutarlılık (FC), Terminoloji Tutarlılığı (TC), Söylem Tutarlılığı (DC) ve İletişimsel & Biçimsel Uygunluk (CSA). Eksenler çalışmadan çalışmaya değişmez. Her seferinde aynıdırlar. Değerlendirme A ile Değerlendirme B'yi karşılaştırırsanız, bu karşılaştırmanın bir anlamı vardır.

Puanlama LLM'ye bırakılmamıştır. Model, hataları tanımlama ve karakterize etmeden sorumludur ve deterministik bir hat, şiddet, zorunluluk derecesi ve eksen duyarlılığına dayalı olarak sayısal değerler hesaplar. Aynı girdiyi iki kere çalıştırırsanız, aynı sayıları alırsınız. Bu küçük bir uygulama detayı gibi gelebilir. Öyle değil. Bu, bir "alet"i bir "atmosfer"den ayıran çizgidir.

Ve biraz zaman ayırmak istediğim şey, Çeviri Brifi'dir.

Brief, CATER'a çevirinin ne için olduğunu söyler. Okuyucu kim, mecra ne, nasıl bir etki yaratmalı, neler feda edilebilir ve neler mutlaka korunmalıdır? Bir brifle değerlendirme artık "bu soyut bir doğru cevaba ne kadar yakın?" sorusu olmaktan çıkar. Şu soruya dönüşür: "Bu çeviri, yapması için tutulduğu işi yapıyor mu?" Bildiğim kadarıyla, gerçekten önemli olan tek soru budur.

Bir brif sağladığınızda, Momotaro örneği çözülür. Brief "Amerikalı çocuklar için çocuk kitabı, okunabilirlik en önemli öncelik" ise, "That boy is just like Momotaro" CSA ekseninde işaretlenir çünkü referans yerine ulaşmaz. "That boy's another little Hulk" yüksek puan alabilir. Brief "Akademik bir antoloji için edebi çeviri, kültürel özgüllüğü koru" ise, yargı tersine döner. Momotaro satırını orijinaldeki gibi tutmak doğrudur ve onu Hulk ile değiştirmek aşırı yerlileştirmedir. Aynı kaynak, aynı seçenekler, farklı brif, farklı doğru cevap. Değerlendirici bunu görebilir çünkü brif birinci sınıf bir girdidir.

Bir brif sağlamazsanız, CATER onu çıkarımla tamamlar. Gerçek uygulamada, yazılı brifi olan çeviriler azınlıktadır. Ancak her zaman örtük bir brif vardır. Tür, üslup ve hedef kitle, "iyi bir çeviri"nin sınırlarını belirler. Yetenekli bir incelemci, okurken kafasında brifi otomatik olarak yeniden oluşturur. CATER aynı şeyi açıkça yapar ve çıkarılan brifi ekranda görüntüler. Yanlışsa, bir insan düzeltebilir.

CATER'ı Nobel Ödüllü Bir Çeviriye Uygulamak

Somut bir örnek vereyim. Bu bir makine çevirisi çıktısı değil. Konuşmayı, makine çevirisinin ortaya çıkmasından çok önceki insan edebi çevirisine kaydıracağım.

Yasunari Kawabata'nın "Kar Ülkesi", Edward Seidensticker çevirisi. İlk olarak 1956'da çevrilen ve daha sonra revize edilen bu Seidensticker çevirisi, Kawabata 1968'de Nobel Edebiyat Ödülü'nü kazandığında seçici kurulun başvurduğu çeviriydi. 20. yüzyıl Japon edebiyatı İngilizce çevirisinin zirvesi olarak adlandırılabilir. Bunu aşan bir insan çevirisi bulmak oldukça zordur.

Açılış paragrafını CATER'dan geçirdim. Açık bir brif verilmedi; değerlendiricinin onu çıkarmasına izin verdim.

Genel puan: 58.8/100. Yargı: "Büyük revizyon gerekli." İşte eksenlere göre dağılım:

Lütfen aceleyle sonuç çıkarmayın. CATER "Seidensticker kötü" demiyor. Dilbilgisi, olgular ve mantıksal yapı mükemmel puanlar alıyor. Bozuk olan, temel anlam ve edebi etkiler—sınırlı ama kritik kısımlar. Ve CATER tam olarak bu bozulmaların nerede olduğunu gösteriyor.

"Yoru no soko ga shiroku natta" (Gecenin dibi beyazladı), Seidensticker tarafından "The earth lay white under the night sky" olarak çevrilmiştir. CATER'ın teşhisi şudur: "gecenin dibi" gibi mecazi ve algısal ifade, "gece gökyüzünün altında zemin beyazdır" gibi farklı bir sahneyle değiştirilmiştir. Beyazlığın gecenin içinden yükseldiği orijinalin anlamsal etkisi korunmamıştır. Minimum düzeltme olarak "The bottom of the night turned white" önerilir. SI ekseninin 25'e düşmesinin ana nedeni budur.

Bir tane daha. Bir kızın pencereyi açıp "sanki uzaklara bağırıyormuş gibi, 'İstasyon şefi! İstasyon şefi!'" diye seslendiği bir sahne. Seidensticker'ın çevirisi: "Leaning far out the window, the girl called to the station master as though he were a great distance away." Doğrudan konuşmanın kendisi, bir özet açıklamayla değiştirilmiştir. CATER'ın yorumu: "Çağrının kendisinin yankısı ve sahnenin anlık canlılığı kaybolmuştur. Konuşulan içerik silindiği için, edebi bir yeniden üretim olarak varlık hissi zayıflamıştır." Bu, CSA eksenini 0'a getirdi.

Bu noktaları doğru şekilde ele almak, Seidensticker'ın bu seçimler için kendi nedenleri olması gerektiğini kabul etmektir. 1950'lerde İngilizce konuşan okuyucular için edebi bir çeviri olarak, dönemin çeviri normları dahilinde bilinçli olarak bunu seçmiştir. CATER'ın yorumu bunu "yanlış çeviri" olarak adlandırmaz, "brife göre yargının değiştiği bir yorumlama meselesi" olarak ele alır. Ancak, aynı kaynak metni modern bir Japon edebiyatı çeviri projesi için sipariş ettiyseniz ve "Orijinalin şiirsel atmosferinin yeniden üretimine öncelik ver" diyen bir brif yazdıysanız, yargı bu çevirinin işini yapmadığı yönünde olacaktır. Aynı çeviri, farklı brif, farklı sonuç.

Buradan çıkarmanızı istediğim şey puanın kendisi değil, üç şeydir.

Birincisi: Dünya edebiyat tarihinde iz bırakan bir çeviri bile belirli bir brif altında "revizyon" yargısı alabilir. Bu, çeviri kalitesinin mutlak bir tavanı olmadığının kanıtıdır ve aynı zamanda değerlendirmenin bir brife göreli bir görev olduğunun bir göstergesidir.

İkincisi: CATER sadece "bu kötü" demez, "şöyle düzelt" için belirli alternatifler sunar. Teşhis ve reçete entegredir. Bu sayede değerlendirme sonuçlarını gören taraf bir sonraki adımı atabilir.

Üçüncüsü: Dilbilgisi, olgular ve mantıksal yapı mükemmel olsa bile, edebi bir çeviri olarak iş başarısız olabilir. "Okuyup rahatsızlık hissetmemekle" yakalanamayan başarısızlıklar, farklı eksenlerde düzgün bir şekilde ortaya çıkar. Makine çevirisi çıktısını "rahatsızlık hissetmediğim için iyiydi" diyerek kontrol etmenin ne kadar zayıf bir doğrulama olduğu—bu, Seidensticker seviyesindeki bir çevirinin bile açık eksenlere ayrıldığında sarsıldığı gerçeğinden geriye doğru hesaplanarak görünür hale gelir.

Bu Neden Çeviri Araştırmacısı Olmayanlar İçin Bile Önemli?

Şu ana kadar söylediklerimin çoğu, yerelleştirme sektörü dışındakilere içeriden bir muhabbet gibi gelebilir. İşte yine de neden önemli olduğu.

Çeviri şu anda LLM'lerin birincil kullanım alanlarından biridir. Müşteri desteğini, ürün metinlerini, şirket içi duyuruları, yasal belgeleri ve sözleşmeleri makine çevirisi hatlarından geçiren şirketlerin sayısı ve trafik hacmi, üç yıl önce var olmayan bir ölçektedir. Bu hatların üzerinde taşıdığı ekonomik aktivite muazzamdır. Üzerlerinde oturan doğrulama katmanı neredeyse sıfırdır. İnsanlar doğrulayamadıkları çevirileri teslim ediyorlar. Modelin sayıları uydurmadığı, "must"ı "should"a yumuşatmadığı ve pazarlama metnini işe yarar kılan tonu düşürmediği umuduyla yasal maddeler gönderiyorlar.

Ve tekrar ediyorum, bu makine çevirisiyle ilgili bir sorun değil. Profesyonel çevirmenlere yaptırılan çeviriler de aynı doğrulama yokluğunda teslim ediliyor. Müşteri, teslim edilen çeviriyi okuyor ve "Japonca gibi okunuyor" diye onaylıyor. Bu, çevirinin bir kalite kontrolü değildir; teslimatın Japonca olduğunun bir onayıdır. İkisi arasında olması gereken uzun mesafe, şimdiye kadar hiç kimse tarafından kat edilmemiştir.

2026'daki otomatik çeviri, çoğu kullanım için "pratik olarak yeterli" bir seviyededir. Bu doğru. Ancak "çoğu kullanım için yeterli" bir doğrulama stratejisi değildir. Hataların ölümcül olabileceği durumlarda—klinik belgeler, sözleşmeler, kamuya açık beyanlar, edebi çeviriler—"okurken rahatsızlık hissetmedim" ya da "güvenilir bir çevirmene sordum" artık kabul edilebilir cevaplar değildir.

Uzun süredir eksik olan şey, uzman olmayanların çıktıyı doğrulaması için bir katmandı. Tek bir sayı değil. Bir kauçuk damga değil. "Bu çevirinin gücü burada, riski şurada ve eğer X'e değer veriyorsanız, bu kısmı düzeltin" diyen yapılandırılmış, okunabilir bir teşhis.

İşte CATER budur. cater.erudaite.ai adresinde ücretsiz deneyebilirsiniz. Metodoloji ve arkasındaki teori about.erudaite.ai adresinde mevcuttur.

Elinizdeki bir çeviriyi—örneğin, göndermeden önce bir e-posta, şirket içi materyaller, bir sözleşme taslağı ya da dış kaynaktan yeni teslim edilmiş bir metin—içeri atın ve ne çıktığını görün.

Çevirinin kalitesini ve özelliklerini CATER ile doğrulayabilmelisiniz.

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet