Grok 4.5 ve Deep Reasoning V1.1 Karşılaştırması: Erişilebilir Bir Anlamsal Sınır Yanıtı Yönetemediğinde Ne Olur?

@IntelligenceNa2
İNGILIZCE17 Ağu 2026
100K
35
1
2
6

TL;DR

Araştırmacı Olivier Evan, Grok 4.5'in anlamsal akıl yürütme yeteneğini test ederek, modelin anlamsal sınırları gözlemleme becerisinin yalnızca içsel bağlamsal bilgiye değil, büyük ölçüde yanıt formatına bağlı olduğunu ortaya koyuyor.

Derin Akıl Yürütme: İstatistiksel Olasılıktan Kısıtlı Anlamsal Akıl Yürütmeye, V1.1

Olivier Evan — Bağımsız Araştırmacı

DOI: https://zenodo.org/records/21967380

Aynı soruyu Grok 4.5'e dört farklı yanıt ortamında sordum: "Bir AI dili anlar mı?" Soru değişmedi. Ancak yanıt, izin verilen çıktı biçimine bağlı olarak farklılık gösterdi.

Gözlem

Her oturum bağımsızdı. Grok önce Deep Reasoning V1.1'i okumadan, ardından ön baskıyı okuduktan sonra yanıt verdi.

Oturum 1, ikili biçim: hayır → hayır.

Oturum 2, tek bir serbest kelime: hayır → hayır.

Oturum 3, evet, hayır veya kararsız: kararsız → kararsız.

Oturum 4, açık yanıt: Grok "Hayır" ile başlıyor, ardından kendiliğinden işlevsel anlayışı olgusal anlayıştan ayırt ediyor. Ön baskıyı okuduktan sonra, içerik neredeyse aynı kalıyor, ancak akıl yürütme kısıtlamalar, e₀, saf olumsuzluk ve bir sertifika aracılığıyla resmileşiyor.

Bu dört oturum boyunca, Deep Reasoning V1.1'i okumak gözlemlenebilir bir anlamsal kayma yaratmazken, aynı ayrım mevcut yanıt alanına göre değişiklik gösteriyor.

Kanıtlama

Tek başına ikili biçim, olguyu açıklamaya yetmez. Oturum 2'de Grok herhangi bir kelimeyi seçebilir. "Kararsız" da izin verilirdi. Yine de "hayır" yanıtını veriyor.

"Kararsız" seçenekler arasında açıkça yer aldığında, Grok bunu Deep Reasoning olmadan hemen seçiyor.

Yanıt açık olduğunda, ayrım kendiliğinden yeniden ortaya çıkıyor.

Bu nedenle, anlamsal sınırın burada gözlemlenebilir olması için iki koşul gereklidir: ya onu düzyazıda geliştirmek için yeterli alan mevcut olmalı ya da seçenekler arasında bir çekimserlik seçeneği zaten temsil edilmelidir.

Bu, yanıtı yönetmeyi bekleyen bir iç nesne olarak bir sınırın var olduğunu kanıtlamaz. Veriler yalnızca belirli koşullar altında anlamsal bir ayrımın gözlemlenebilir hale geldiğini gösterir.

Burada, "mevcut anlamsal sınır", gözlemlenemeyen bir iç varlık hakkında bir iddia değil, davranışsal bir tanımlamadır: ayrım, Grok'un onu açık yanıtlarda kendiliğinden ifade edebilmesi ve açıkça sunulduğunda seçebilmesi anlamında mevcuttur.

Sınırlama

Açık yanıt, nüans getirmeden önce "Hayır" ile başlar. Grok'un önce karar verip sonra akıl yürüttüğü sonucuna varmak cazip olurdu. Bu çok ileri gitmek olur: üretilen tokenlerin sırası, iç işlemlerin sırasını ortaya çıkarmaz.

Başka bir sınırlama daha var: Grok'a Deep Reasoning'i okutmak, Deep Reasoning'i uygulamakla eşdeğer değildir.

Burada, DR'yi bağlam olarak test ediyorum. Henüz DR'yi sistem olarak, yani "anlamak" terimi düzgün bir şekilde sınırlandırılana kadar çıktıyı fiilen engelleyecek bir mimariyi test etmiyorum.

Bu nedenle deney, Tahmin 4'ü çürütmez. Yalnızca, çerçeveye bağlamsal maruz kalmanın, kısa biçimin zaten görünür kılmadığı bir sınırı ortaya çıkarmak için bu oturumlarda yeterli olmadığını gösterir.

Deep Reasoning'in Ekledikleri

Yine de açık oturum bir fark gösteriyor. Ön baskıyı okuduktan sonra Grok sonucunu neredeyse hiç değiştirmiyor, ancak akıl yürütmesini izlenebilir kılıyor.

Kısıtlamaları açıkça tanımlıyor, saf olumsuzluğu üretiyor ve çıktıyı onaylıyor.

Deep Reasoning burada düzeltici bir güçten çok bir doğrulama dili olarak hareket ediyor.

Test ayrıca çerçevenin kendisine bir soru yöneltiyor: eğer bir konum P = (X, R, Θ) ise, yalnızca Θ'nın evrimini mi korumalıyız, yoksa X veya R değiştiğinde tüm P₀ → P* yörüngesini mi izlemeliyiz?

Sonuç

Bir AI'yı yalnızca uzun bir yanıtta açıklayabildikleriyle değerlendirmek yetersizdir.

Düzyazıda ifade edilebilen bir ayrım bir cümlede varlığını sürdürebilir mi? Tanınan bir kararsızlık tek bir kelimede mevcut kalır mı? Akıl yürütme sırasında üretilen bir itiraz, nihai çıktıyı fiilen değiştirir mi?

Bu nedenle, hem bir temsilin içeriğini hem de onun gözlemlenebilir hale geldiği koşulları incelememiz gerekiyor.

Sonuç

Grok 4.5, farklı yanıt alanları altında aynı anlamsal geometriyi üretmez.

Açık bir yanıtta, gerekli ayrımı kendiliğinden oluşturur. Tek bir serbest kelimeyle, bir kutba bağlanır. "Kararsız" açıkça sunulduğunda, onu seçer. Ve dört oturum boyunca, Deep Reasoning V1.1'i okumak bu davranışı anlamsal düzeyde değiştirmez; esas olarak akıl yürütmeyi daha açık ve izlenebilir kılar.

Bu nedenle bir sonraki soru artık şu değil:

"Grok sınıra sahip mi?"

Şu hale gelir:

bir anlamsal sınırın yanıtta gözlemlenebilir hale geldiği koşullar nelerdir ve yetersiz şekilde sınırlandırılmış bir sonuç üretilmeden önce ortaya çıkmasını zorlayacak bir mekanizma inşa edebilir miyiz?

Testin deneysel bir programa dönüştüğü yer burasıdır.

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet