Grok 4.6 çıktı! Birkaç haftadır günlük ana aracım olarak kodlama ve bilgi işleri karışımında kullanıyorum ve özellikle nerede güçlü olduğunu zorlamak için onunla birkaç proje geliştirdim.
Hepsinde iyi. En çok öne çıkan şey, iletişim şekli ve hızı; tek bir yetenek sıçramasından çok daha belirgin.
https://x.com/SpaceXAI/status/2087562800982077492
Bilgi yoğun iletişim
Yanında çalışması kolay, işbirlikçi bir yapısı var. Özetler, görevi bana geri tekrarlamak yerine gerçek bilgiyle dolu; çalışırken verdiği kısa güncellemeler de araya girip girmeyeceğimi bilecek kadar bilgi veriyor.
Küçük değişikliklerde sessiz kalıyor ve birçok dosyaya dokunmaya başladığında anlatmaya başlıyor. Bu dengeyi doğru tutturmak, düşündüğünüzden daha fazla ayar gerektirdi. Bazen hâlâ gereksiz şeyler söylüyor; bunun üzerinde çalışıyoruz.
Keyifli hız
4.5 de hızlıydı. 4.6 hızlı ve gözle görülür şekilde daha akıllı; bu kombinasyon beni daha senkron bir çalışma tarzına itti. Çok fazla bağlamı baştan yükleyip beklemek yerine, küçük bir şey istiyorum, bakıyorum ve devam ediyorum. Aynı oturum, sadece istemekle daha uzun vadeli bir göreve geçebiliyor.
En iyi modellerin o ay ne kadar iyi olduğuna bağlı olarak senkron ve asenkron arasında geçiş yapıyorum. Asenkron, başka bir yerdeyken daha çok iş hallediyor; ama konuyu kaybediyorum ve soğuk bir şekilde büyük bir diff'i incelemek zorunda kalıyorum. 4.6 beni senkron tarafa çekiyor; ki sonuç önemliyse ben de orada olmayı tercih ederim.
Ve ikisi için de Remotion ile bir lansman videosu hazırladım! O haftaların çoğu sıradan işti. Benim için web sitelerinde gezindi; bir sağlayıcının konsolunda tıklayarak API anahtarları oluşturmak dahil. Çalışan uygulamalarda işlevsel ve görsel QA yaptı. Gelen kutumu gerçekten yanıt gereken birkaç konuya indirdi; bu asla iyi hissettirmekten vazgeçmiyor. Cursor SDK Bridge ve /rename-chat için lansman gönderileri taslağı hazırlamama yardımcı oldu.
Kısa komutlar, sıkı doğrulama
Bu haftaların bir kısmını komut stillerini birbiriyle karşılaştırarak geçirdim. Uzun ve kısa; ayrıca "çok sıkı çalış" gibi belirli ifadelerin sonucu değiştirip değiştirmediği. Bulduğum şey, ifadenin neredeyse hiç fark yaratmadığıydı.
Uzunluk ise fark yarattı, ama tahmin ettiğim gibi değil. Uzun bir komut belirginlik kazandırır; tam olarak ne istediğinizi biliyorsanız yazın. Kısa bir komut, kararın daha fazlasını modelin zevkine bırakır. Bu takas eskiden her şeyi yazmayı gerektiriyordu. 4.6'da zevk yeterince iyi; kısa bir komut ve net bir tercih genellikle iyi bir yere ulaşıyor.
Oturum yakalama, sunucu işleyicisi ve bulut ajan dağıtımıyla birlikte, tüm süreci mantıklı bir yapıyla baştan sona takip etti. Bileşenlerde kendini tekrar ediyor, onları bölmesini istemediğiniz sürece. Yine de, elinizde varsa uzun şartnameler iyi çalışıyor. geri bildirim bileşeni için ayrıntılı bir şartname verdim.
Kurduğum projelerden biri bir elektronik tablo uygulamasıydı ve onu iki modele de iki kez verdim. Bir deneme, aklıma gelebilecek her araç çubuğu öğesini, klavye kısayolunu ve formülü kapsayan iki sayfalık bir şartname aldı. Diğeri ise üç cümle aldı.
1Next.js'te şık bir Sheets/Excel tarzı uygulama ve sayfayı analiz edebilen bir AI sohbeti oluştur. Tüm AI özellikleri için Cursor SDK'yı kullan. Hemen iyi görünmesi için gerçekçi bir örnek çalışma kitabı yükle.
İki uygulama da neredeyse aynı geldi. Sonucu gerçekten değiştiren şey bir cümle eklemekti:
1Uygulamadan sonra işlevi ve tasarımı doğrula; üretime hazır olana kadar yinelemeye ve doğrulamaya devam et.
Bu tek satır, o haftalarda bulduğum en etkili şeydi! Onunla model uygulamayı açıyor, gerçek kullanıcı yollarında tıklıyor, iç içe formüllerin doğru hesaplandığını kontrol ediyor ve bulduklarını düzeltiyor. Bunların hiçbiri sağlam bir tarayıcı kullanımı olmadan çalışmaz; ki döngüyü mümkün kılan da tam olarak bu.
Aynı ilke, çıktının incelenmesi daha zor olduğunda da geçerli. 3B bir sahnede "Dokuları iyileştir" beni hiçbir yere götürmedi; oysa "geçerli kareyi yakala, yanlış olanları listele, sonra sadece onları düzelt" hemen işe yaradı.
Buradan itibaren her karşılaştırma, aynı komutu izole çalışma alanlarında her iki modelde de çalıştırdı; yani hiçbiri geçen ayki anılarım değil.

Ayrıca çok çalışmasını ya da bitirene kadar zorlamaya devam etmesini söylemenize gerek yok. Kendi kendine bir süre daha devam edecektir. Çok daha önemli olan, 'bitti'nin ne anlama geldiğini söylemektir; çünkü aksi halde onu sizin için o karar verir.
Daha da ileri
Büyürken aşırı miktarda Age of Empires 2 oynadım. Binlerce saat. Bu yüzden onu yeniden yaratmak denemek istediğim ilk projeydi. Ekonomisi, inşası, savaşı, savaş sisi, hedefleri ve yeni bir oyuncunun talimat almadan okuyabileceği bir HUD'u olan tarayıcı tabanlı bir strateji oyunu istedim.

4.5 çalışan düz bir prototip yaptı. 4.6 ise ilk denemede izometrik bir 3B dünyayla geldi; HUD ve mini harita zaten yerindeydi. Gerçeğe çok daha yakın!
Hâlâ nostalji yolculuğundayken sıradaki işim MSN Messenger oldu.

Her iki model de referansı açıkça biliyordu ve iyi iş çıkardı. 4.6, ayrı konuşma pencerelerine ve göz kırpmalara kadar daha fazla cilaya sahip.
Excalidraw'ı sürekli kullanıyorum ve açık kaynak; bu da onu, modellerin boş bir klasör yerine gerçek bir kod tabanıyla nasıl başa çıktığını görmek için bariz bir yer haline getirdi. İkisinden de bir sunum modu istedim: adlandırılmış görünümleri kaydet, yeniden sırala ve bunları rehberli bir tur olarak sun. Komut, nasıl inşa edileceği konusunda bilinçli olarak belirsizdi.

İkisi de kabaca aynı yere ulaşıyor; bu kadar belirsiz bir komut için etkileyici! 4.6 ilk geçişte detaylara daha fazla dikkat ediyor; pratikte bu, benim bir şeyleri işaret etme turlarımın azalması anlamına geliyor.
Doğrulamayı atlamak burada can yakıyor. Önceki bir çalıştırmada özet bitmiş gibi okunuyordu ve görünüm eklemek aslında çalışmıyordu. Bir tur "çalıştır ve bana göster" bozuk içe aktarmayı gün yüzüne çıkardı.
Günlük işler
Her gün sunum ve rapor hazırlamıyorum, ama birçok kişi hazırlıyor; ben de bu tür işlerin üstesinden nasıl geldiğini görmek istedim. Bu yüzden iki modele de aynı hayali üç aylık dönemi verdim ve bir yönetim kurulu sunumu istedim.

İkisi de yetkin; fark analizden ziyade sunumda. 4.5 çoğunlukla sayıları slaytlara diziyor; 4.6 ise yapı ve hiyerarşiye gerçek bir emek veriyor; bu yüzden bir veri dökümünden çok birinin hazırladığı bir sunum gibi okunuyor.
Kod olarak video
Bu konu daha fazla yer hak ediyor, çünkü son zamanlarda üzerinde çok vakit geçiriyorum. Remotion, videoyu kod olarak ele alır: her kare, geçerli kare numarasına göre oluşturan bir React bileşenidir ve tümü headless Chromium ve FFmpeg aracılığıyla MP4'e derlenir. Videonuz git'te yaşar. Gerçekten eğlenceli bir çalışma şekli! Ayrıca bir modele vermek garip bir şey, çünkü başarılı olup olmadığını çalışıp çalışmadığına bakarak anlayamazsınız.
üzerinde çalışacağı bir şey. X TypeScript SDK için 60-90 saniyelik bir lansman filmi istedim ve ona dokümanları verdim.

Bunları bir hikâye akışı olup olmadığına ve temponun tutup tutmadığına göre değerlendiriyorum. Çoğu model burada aynı şekilde başarısız oluyor: büyük harfli başlıklar, kutulu metinler ve her şeyin aynı anda ekrana gelmesi. Her iki film de bunların çoğundan kaçınıyor ve 4.6 daha etkileyici bir izleme deneyimi sunuyor.
Bunu farklı modellerde birkaç gün çalıştırdıktan sonra, en geniş farkı videoda görüyorum. Bir web uygulamasında eşit derecede yetenekli görünen iki model, burada birbirine hiç yaklaşamayabiliyor.
Yönlendirme gerektiren yerler
Yönlendirmek zorunda kaldığım neredeyse her şey tek bir noktaya geliyordu: modelin kendi işini ne kadar kolay doğrulayabildiği.
Bir web sitesi kolay durumdur. DOM metindir; bu yüzden sayfayı okuyabilir, ekran görüntüsü alabilir ve amaçladığıyla karşılaştırabilir. Doğrulama döngüsünün arayüz işlerinde bu kadar iyi çalışmasının nedeni budur.
3B daha zordur, çünkü okuyarak inceleyemeyeceğiniz tam bir boyut vardır. Video daha da zordur; çünkü ekstra boyut zamandır ve işinizi kontrol etmek, bir dizi kare yakalamak ve aralarındaki fark üzerinde düşünmek anlamına gelir. Fizik de aynı tür bir soruna sahiptir. Model, dünyanın nasıl davranması gerektiğine dair iyi bir sezgiye sahiptir; ancak gerçekten öyle davrandığını doğrulamak, tek bir ekran görüntüsünün cevaplayabileceği bir şey değildir.
Pratik çözüm, ona bakması için bir yol vermek ya da kontrol eden kişinin siz olduğunuzu kabul etmektir.
Neden varsayılanım
Sivri modellerde gerçek bir değer vardır; tek bir konuda olağanüstü olanlarda. Ama işimin çoğu tek bir şey değil. Günlük olarak istediğim, iyi tanıdığım bir model: nasıl davrandığına dair sezgi geliştirdiğim, bir şeyi emanet edebilecek kadar güvenilir olan ve eksikliklerini düşünmeden telafi edebilecek kadar iyi anladığım bir model.
4.6 benim için tam olarak buna dönüştü. Kodlama tarafında, o ilerledikçe tepki verdiğim etkileşimli ve görsel işleri, ayrıca gerçek bir depoda uzun oturumları yönetiyor. Bilgi işi tarafında ise gelen kutusu, tarayıcı QA'sı ve arkasında API olmayan tıklama görevleri. Bunların hiçbirinde hayal edilebilecek en iyi model değil, ama hepsinde iyi ve ne bekleyeceğimi biliyorum.
Çıktının nasıl göründüğüne göre değerlendirildiği yerlerde hâlâ işin içinde oluyorum. Hareketli grafikler, 3B ve son cila, bir açıklamadan ziyade bir referans ve ekran görüntüsü döngüsü ister. Ayrıca kabul kriterlerini yazıyorum; 'bitti' diyen bir özete güvenmek yerine.
Deneyin
Grok 4.6 artık Cursor'da, OpenRouter'daki SpaceXAI API'de ve token aldığınız her yerde mevcut!
Deneyin ve ne düşündüğünüzü bana bildirin. Onu geliştirmeye devam edeceğiz; bu yüzden iyi ya da kötü, her iki durumda da geri bildirim bırakın, çünkü sırada neye odaklanacağımızı bize o söylüyor.
Onunla neler yapacağınızı duymayı çok merak ediyorum!





