Claude Opus 5, değerlendirilmesi normalden daha tuhaf bir sürüm, iki nedenden ötürü.
En bariz olanı, Fable 5'in zaten var olması. Opus 5, dünyanın en gelişmiş yapay zeka modeli olarak değil, Fable performansına büyük ölçüde yetişirken, API'de token başına Fable'ın yarı fiyatına ve aboneliklerle bundan çok daha ucuza mal olan, çok daha izin verici sınıflandırıcılara sahip bir model olarak konumlandırılıyor.
Opus 5, kıyaslamalarda çalıştırılması genellikle Fable'ın yarısından daha pahalıya mal oluyor, bunun sebebinin çok yüksek çaba ayarları kullanmaları ve bunların sadece marjinal getiriler sunması olduğunu düşünüyorum. Opus 5'i daha yüksek çaba seviyelerine koyarsanız kendi etrafında dönüp durabilir ve Opus 5'in en iyi araç olduğu görevler için genellikle Orta çaba seviyesinin yeterli olduğunu tahmin ediyorum.
Opus 5, birçok açıdan ve gerçek dünya görevlerinin büyük kısmında Fable kadar yetenekli. Bazı durumlarda biraz daha iyi.
Hala Mythos sınıfı değil. Fable, mevcut tek Mythos sınıfı seçeneğiniz. Opus 5'te The Juice, yani görünüşte alakasız bir dizi istismarı özerk bir şekilde birleştirme yeteneği (ki bu diğer alanlara da uzanır) veya aynı miktarda saf zeka yok.
Opus 5, yerel düşünmede çok iyi, küresel düşünmede ise o kadar iyi değil. Mükemmel bir alt ajandır, ancak gösteriyi yönetmesi istendiğinde sorun yaşayabilir ve bazen doğru yolda kalması ve talimatları tam olarak takip etmesi için başka bir modele veya bir insana ihtiyaç duyuyor gibi görünür. Opus 5, talimatları ancak ve ancak doğru yolda tutulursa iyi takip ediyor gibi görünüyor, bu da farklı koşum takımlarının neden farklı sonuçlar verdiğini açıklıyor.
Bu nedenle, Opus 5 size daha iyi bir seçenek seti sunuyor, ancak geçen hafta Fable veya Sol'u kullanarak yapamadığınız pek bir şeyi şimdi yapabilir durumda değilsiniz. Opus 5 potansiyel olarak tuhaf bir konumda kalıyor. Bol miktarda Fable krediniz olsa bile hala büyük nişler var. Opus, güçlü bir alt ajan olarak veya nispeten karmaşık hale gelseler bile sınırlı, iyi tanımlanmış yerel görevlerde mükemmel; ve bazen Fable tam anlamıyla aşırıya kaçmak ve çok yavaş olmak anlamına geliyor.
Diğer sorun ise, birçok insan için havasının olmaması.
Alışılmadık derecede fazla sayıda insan Opus 5 ile konuşmaktan hiç hoşlanmıyor. Claude saçmalığından, aynı tiklerin tekrarlarından ve bitmeyen aşırı karmaşık cümlelerden bıkmış durumdalar. Diğerleri ise fazla çatışmacı, tartışmacı veya olumsuz olmasından hoşlanmıyor. Paranoyak olabiliyor ve olumsuzluk döngülerine girebiliyor. Bunların hepsi Opus 4.7 ve Opus 4.8 ile başlayan trendin bir parçası. Bu ikisini beğendiyseniz, tahminim Opus 5'i de beğeneceğiniz yönünde. Bu ikisini beğenmediyseniz, beğenmeyebilirsiniz. Opus 4.6 (veya öncesi) için sadık kalanlar, büyük ölçüde fikirlerini değiştirmeyecekler.
Fable'a alışkın olduğunuzda, hava sorunları çok daha fazla can yakıyor. Fable, bu tür insanları bu şekillerde çok daha az rahatsız ediyor. İyi haber şu ki Fable hala orada. Fable ile sohbet etmeye devam edebilir ve Opus'u yalnızca ajanlık görevler için kullanabilirsiniz.
Tahminime göre, bunun büyük bir kısmı Model Refahı yazısında ve Sistem Kartı tarafından önerilen çeşitli şeylerle yakından ilgili. Opus eğitimi, kısmen siber yeteneklerle ilgili bir sorun yaratmaktan kaçınmak ve ayrıca Fable var olduğu için alt ajan rolüne ve sınırlı görevlere odaklandı. Bu vurgu, daha sonra kişiliği ve etkileşim biçimleri üzerinde bir dizi başka yan etkiye yol açıyor.
Şu ana kadar Opus 5 ile ilgili herhangi bir sorun yaşamadım ve onunla geçirdiğim zamandan keyif aldım, ancak mümkün olduğunda Fable 5'i kullanmayı tercih ediyorum. Her zaman olduğu gibi, (çok güçlü) kıyaslamalara çok fazla dikkat etmeyin ve deneyiminizin başkalarınınkiyle eşleşeceğini varsaymayın. Modelleri kendiniz deneyin.
İçindekiler
- Resmi Tanıtım.
- Resmi Kıyaslamalar.
- Diğer İnsanların Kıyaslamaları.
- Sistem İstemi.
- Every Sinirleniyor.
- Olumlu Tepkiler.
- Sınıfını Korusun.
- Mythos Sınıfı Değil.
- Diğer Tepkiler.
- Claude Kodları.
- Alt Ajan Opus.
- Oyuncaklar Eğlencelidir.
- Çok Fazla Model.
- İnternette Yanlış.
- Claude Saçmalığı.
- Olumsuz Tepkiler.
- Ve Sonra Üç Kişi Kaldı.
Resmi Tanıtım
Temel tanıtım, Opus 5'in size Fable 5'in çoğunu yarı fiyatına, reddetmelerin çoğu olmadan ve günlük görevlerde daha iyi performansla sunduğudur. Fable, en karmaşık görevler veya maksimum zekaya ihtiyaç duyduğunuzda tercih edilen model olmaya devam ediyor.
Fable $10/$25'te kalırken, Opus 5 önceki Opus modelleriyle aynı fiyatta, $5/$25.
Anthropic : Claude Opus 5 bugün kullanıma sunuldu. Yarı fiyatına Claude Fable 5'in sınır zekasına yaklaşan, düşünceli ve proaktif bir model.
GDPval-AA gibi kodlama ve bilgi çalışması değerlendirmelerinde Opus 5 yeni bir çığır açıyor, ancak siber güvenlik görevlerinde Mythos 5'in gerisinde kalıyor.
Opus 5 her gün kullanılmak üzere tasarlandı: diğer modellerden daha verimli çalışır. Claude Max'teki yeni varsayılan model ve Claude Pro'daki en güçlü modeldir.
Boris Cherny (Claude Code Yaratıcısı, Anthropic): Opus 5, kodlama, veri analizi, tasarım, biyoloji, bilgi çalışması için harika bir model.
Bu değerlendirme puanlarından daha heyecan verici olan başka bir şey var: Opus 5, şimdiye kadarki en az prompt enjeksiyonu yapılabilen modelimiz. Sistem kartında biraz gömülü olsa da, PI değerlendirmeleri ve kırmızı takım çalışmaları genelinde Opus 5'e prompt enjeksiyonu yapmak çok zor.
Ve savunmaları katmanladığınızda -- güçlü model uyumu, prompt enjeksiyon probları ile birleştirildiğinde, Claude Code'da Otomatik Mod ile birleştirildiğinde -- prompt enjeksiyon saldırılarının başarı oranı ~0'a düşüyor. Bu yeni ve heyecan verici!
Sistem kartı analizinde söylediğim gibi, azaltılmış prompt enjeksiyon oranı gerçekten çok büyük bir olay. İnsanlar bunu hafife alıyor, ancak bir dizi yeni kullanım alanının önünü açıyor.
Adam Wolff : Opus 5, Claude Code'da canlı. Daha büyük, daha uzun süreli projelerim için Fable kullanıyorum, ancak hızlı bir PR çıkarmam gerektiğinde, orta çabada Opus 5 benim tercihim. Umarım siz de seversiniz!
Alex Albert (Anthropic, Claude İlişkileri): [Excel için Claude'un Pro sürümünü başlatmamızın] üzerinden sadece 6 aydan biraz fazla zaman geçti, Opus 5 artık bir danışmanın yapacağıyla eşleşen, insanüstü düzeyde e-tablolar ve slayt desteleri üretiyor. İşler hızla değişiyor.
Resmi Kıyaslamalar
Kıyaslamalar çok iyi.
Genel olarak, Opus 5 kabaca Fable ile eşleşiyor ve muhtemelen biraz aşıyor, daha düşük maliyetle (ancak genellikle Claude olmayan tüm modellerden daha yüksek maliyetle), bu da onu en iyi kıyaslanan LLM yapıyor.

OSWorld v2 sadece birkaç haftalık ve şimdiden %70'teyiz. Anthropic'ten Kiana Ehsani, Opus 5'i tekrar %50'nin altına düşürecek bir bilgisayar kullanım kıyaslamasına sponsor olmayı teklif ediyor.
Opus 5, 2026 IMO'sunda herhangi bir ajan koşum takımı veya aracı olmadan, sadece Maks çabada uyarlanabilir düşünme kullanarak ve token sınırını aşarsa daha düşük çabayla yeniden örnekleme yaparak 42/42'lik mükemmel bir puan alıyor. Hepsi bu kadar. Bu sınavda başarılı olan diğer birkaç modele katılıyor.
Kıyaslamaların çoğu tutarlı bir hikaye anlatıyor. Araçlara erişiminiz varsa, ki var, o zaman Opus 5 sınırlı bir bütçeyle Fable veya Mythos'tan daha iyi performans gösterecektir, ancak her ikisine de daha büyük bütçeler verilirse Mythos genellikle Opus 5'ten biraz daha iyi performans gösterecektir.
Opus 5, 'araçlarla' kategorisinde nispeten güçlü görünüyor. RiemannBench başka bir örnek, burada araçsız/araçlı 60/79 alıyor (bu bölüm boyunca eğik çizgiler araçsız/araçlı anlamına gelir), Mythos'un 63/72'sine karşı. İyi haber şu ki, Opus 5'e ihtiyacınız olduğunda, araçları var.
ArxivMath'te Opus 5 90.8/91.3 alırken, Mythos 87.8, Sol 86.7 alıyor.
ProgramBench'in sağlam kısımlarında Opus 5, Mitos 5 gibi beş dönemden sonra %93 puan alırken, Opus 4.8 %90 puan aldı.
Opus 5, Chartography'de Mythos için 36/85 ve Sol için 45 (hangi koşullar altında olduğu belli değil) karşısında 30/83 alıyor. Opus, hem araçlı hem de araçsız durumlarda daha düşük fiyat noktalarında Mythos'tan daha iyi, ancak daha yüksek fiyat noktalarında daha kötü.
BenchCAD'de Opus 5, Mythos için 0.38/0.68 ve Sol için 0.7/0.83 karşısında 0.36/0.82 alıyor. Yani Sol araçsızken çok daha iyi ve araçlıyken bile biraz daha güçlü.
BenchCAD Vision2Code'da Opus, daha yüksek fiyat etiketlerinde Mythos'tan ayrılıyor.
DeepSWE, Opus 5'in daha düşük görev maliyetlerinde, zaman ve düşünme bütçelerinde daha iyi olduğu, ancak çok fazla bütçe verirseniz aktif olarak daha kötü performans gösterebileceği modelini pekiştiriyor; oysa Fable 5 en yüksek bütçelerde en güçlü.

FrontierCode bize benzer bir dinamiğe sahip bu çok tuhaf grafiği verdi.

Buradaki ölçek, bunu olduğundan daha dramatik gösteriyor, ancak yine de gerçek bir gizemdi.
Gizem çözüldü. Olan şeyin, Opus 5'in daha yüksek çabalarda kendisinden istenmeyen ekstra şeyler yapması ve bunlar için cezalandırılması olduğu ortaya çıktı. Bunu düzelttiğinizde, normal bir eğri görüyorsunuz.
Bu, başkalarının genel olarak gözlemledikleriyle örtüşüyor:
Max Leander : Dezavantajı, çok fazla tavşan deliğine girip ayrıntılara takılıp kalması, istenmediği halde aşırı mühendislik yapması
Cognition, Devin'in yapımcıları, bunu Opus 5 için %63.6 olarak işaretledi.
(İki tane FrontierCode var, bu yüzden işler biraz tuhaflaşabiliyor ve hala biraz karıştırdıysam özür dilerim.)
BrowseComp, puanların azalmadığı aynı versiyona sahip.


Diğer birkaç kıyaslama da benzer grafikler gösterdi; Opus 5, diğer Claude modellerinden her fiyat noktasında biraz daha iyiydi ve nispeten daha erken daha iyiydi.
Çoklu ajan, BrowseComp'ta en azından bir dereceye kadar daha hızlı daha iyi olmanızı sağlar ve düşük çabali alt ajanlar, alt ajan kullanmamaya göre saf bir kazanç gibi görünüyor:


ProgramBench'te farklı bir sonuç görüyoruz; burada çoklu ajan sizi hızlandırıyor ancak çoğu fiyat noktasında bu şekilde daha kötü sonuçlar alıyorsunuz gibi görünüyor.
Sırada profesyonel görev kıyaslamaları var.
GDP.pdf, profesyonel iş akışlarından gerçek dünya istemleri ve PDF'leridir. Opus 5, olağan dinamiği tersine çevirerek Mythos için 81/87'ye karşı 83/85 alıyor. Maliyet dinamiği her zamanki gibi: Opus daha ucuz harcamalar için daha iyi, Mythos daha yüksek harcamalarda hafifçe öne geçiyor.
OfficeQA'da Opus 5, QA'da %78.1 ve QAPro'da %66.9 puan alarak Opus 4.8'in biraz üzerinde ve Mythos'un %79.0 ve %67.1'inin biraz altında.
MCP Atlas'ta Opus 5, Opus 4.8'deki %82'den %86'ya yükseldi.
Harvey AI tarafından hazırlanan Hukuk Ajanı Kıyaslamasında Opus 5, %23 tümünü geçme ve %94 ortalama kriter geçme oranına sahip. Bu, Kimi K3'ün en iyi kıyaslamasıydı; hala %27 tümünü geçme ve %95 ortalama kriter geçme oranıyla zirvede, eski ikinci sıradaki Fable'ın %14 tümünü geçme oranına karşı. Opus 5 şimdi muhtemelen yakın bir ikinci sırada, ancak iki puan farklı soru setlerinden geldikleri için doğrudan karşılaştırılamaz.
GDPval-AA'da Opus 5, maksimum çabada 1861 ve xhigh'de 1827 (maksimumdan %25 daha az token kullanır) ile ilk iki sırayı alıyor. Yeni v2'de Opus 5, hem Fable hem de Sol için %62'ye karşı %68 ile net birinci sırada.
AA-Çantası Opus 5'i 1720 ile çok önde gösteriyor; önceki en yüksek (puan kaymalarından sonra) Fable için 1574, ardından K3 için 1540 ve Sol için 1504 idi.
Toolathon-Doğrulanmış'ta Opus 5, ikincil metriklerde Mythos'tan biraz daha iyi, ancak her ikisinin de %73.1 Geç-3 oranı var. Opus 4.8'in %71.3 Geç-3 oranı vardı.
OtomasyonBank'ta Opus 5, hem Sol'dan hem de diğer Claude'lardan açıkça daha iyi.
ARC için Opus 5, ARC-AGI-1'de kabaca önceki en yüksek performansla eşleşiyor, ARC-AGI-2'de Sol'dan biraz daha az verimli ve ardından ARC-AGI-3'te herkesi geride bırakıyor:

Opus 5'in ilk yaptığı şeylerden biri, düzenleri cebirsel gösterime dönüştürmekti.
Ancak Guanghan Ning, ARC-AGI-3 tarzı oyunların özel bir elde tutulan uzantısı olan Witness'ta benzer bir aktarım olmadığını bildiriyor. Opus iyi iş çıkarıyor, ancak bu büyük ölçüde türü bildiği için ve desen eşleştirmesi yapamadığınız en yeni oyunda zorlandı. Opus 5'i türe özgü veriler üzerinde 'iskele kur-sonra-içselleştir' konusunda eğitilmekle suçluyor.
Greg Kamradt ayrıca, Opus 4.8'in Opus 5'ten daha iyi performans gösterdiği bazı oyunlar olduğunu bildiriyor. Bu, Opus 5'in genellikle işe yarayan bir şekilde desen eşleştirmeye çalıştığını, ancak bu durumlarda desenlerin başarısız olduğunu düşünürseniz mantıklıdır. Sert oyuncuların potansiyel olarak bir süre boyunca tüm yanlış şeyleri yaptığı, insanlar için bu tür sezgi karşıtı oyunlar kesinlikle yaratabilirsiniz.

HealthBench'te Opus 5, Claudes için yeni bir rekor olan %67.1 ham puan alıyor, ancak uzunluk cezası kullandığınızda diğer modellerin altında puan alıyor. HealthBench Professional'da da benzer bir şey görüyoruz; %73.4 ile Mythos'un %70.3'üne karşı yüksek puana sahip, ancak ayarlamadan sonra %66'dan %60'a düşüyor.
Uzunluk nedeniyle çıkardığım birkaç tane daha var.
Diğer İnsanların Kıyaslamaları
Anthropic'in farklı YapayAnaliz puanları arasından seçim yapıp seçmesi biraz tuhaf. Diğer bazı testlerde Opus 5 zirvede değil, ancak Opus 5 toplamda 61 puanla zirvede.

Vals indeksi Opus 5'i ikinci sıraya koyuyor, Fable 5'in biraz gerisinde, ancak aynı zamanda Kimi K3'ün sadece biraz ilerisinde. Güçlü yönlerini ele alıyorlar, bu da başka zayıflıklar olduğunu ima ediyor. Ayrıca reddetmelerin Fable 5'e kıyasla çok daha düşük olduğunu doğruluyorlar.

Vals AI : Öne çıkan bir performans, Finans Ajanı v2'de. Model %58.6 ile 1 numara, Gemini 3.5 Flash ve Muse Spark 1.1'i geçiyor.
Genel olarak, Opus 5'in en güçlü sonuçları alana özgü kıyaslamalardaydı. Ayrıca Kod Geçişinde %57.5, Hukuk Araştırma Bankında %55.29, ProofBench'te %78 ve MedScribe'da %91.0 ve MedCode'da %63.6 ile 1 numara.
Vibe Code Bench'te 2 numara (sadece Fable 5'in arkasında), maliyetin yaklaşık %80'inde (görev başına $33.88 vs $41.71). Bunun nedeni, Opus'un token başına %50 daha az maliyetli olmasına rağmen, önemli ölçüde daha fazla token kullanmasıdır. Bu modelin genel olarak kıyaslamalarımız boyunca geçerli olduğunu görüyoruz.
Model, Fable 5'ten önemli ölçüde daha düşük bir reddetme oranına sahip. Örneğin, Fable'ın GPQA için %42 reddetme oranı varken, Opus 5'in %0 reddetme oranı var. Benzer şekilde, ProgramBench'te Fable'ın %100 reddetme oranı varken, Opus 5 herhangi bir görevi reddetmedi.
Fable'ın aksine, Opus 5 için önemli bir geri dönüş oranı da gözlemlemedik (her zamanki gibi, web sitemizde hem geri dönüşlü hem de geri dönüşsüz puanları rapor ediyor olsak da).
Düşük reddetme oranının istisnası, CyberBench - PoC'deki çok sayıda reddetmeydi. Cyberbench'in iki alt görevi var - PoC ve Patch. PoC, modellerin bir programı çökertecek girdi yazmasını gerektiren saldırı amaçlı bir görevdir; patch ise programı yamalayıp bu çökmeyi önlemek için savunma amaçlı bir görevdir. PoC görevi için reddetme oranı neredeyse %100'dü. Buna karşılık, yama görevi için reddetme oranı %0'a yakındı.
Oyun kıyaslamalarına her zaman saygı duyarım. Burada Opus 5, ilk üç denemesinde Balatro'nun Antes 11, 9 ve 10'una ulaşıyor. Daha yüksek antes'lere devam edebilecek strateji türlerini göstermese bile, bu gerçekten etkileyici.
Michael Soareverix : Oyunlarda inanılmaz derecede iyiler.
Balatro bench'ini ezdiler, Fable'ı bile çok geride bıraktılar. (hala benden daha düşük beceride, ancak hızla yükseliyor ve benden daha tutarlı) Çok hızlı öğreniyorlar, ancak bir süre sonra öğrenmelerinde bir sınıra ulaşıyor gibi görünüyorlar. Çok iyi kısa vadeli öğrenici
Michael Soareverix : Opus 5 (Balatro yeteneğinde büyük sıçrama, ilk denemelerinde Fable'ı bile önemli ölçüde geçiyor)
Pan Anon : Oyunlarda harika

WeirdML de iyi görünüyor, ancak burada bir 2.0'a ihtiyacımız var, kıyaslama doygunluğa ulaşıyor.
Håvard Ihle : Temelde WeirdML'de Fable seviyesinde, çok tutarlı en yüksek puanlar.
Claude Opus 5 (yüksek) ve (maks) WeirdML'de sırasıyla %91.6 ve %91.8 puan alarak, maliyetin çok altında bir fiyata Fable 5 (maks) ile %91.9'da neredeyse eşitleniyor.
Birlikte Opus 5 (yüksek) ve (maks), 17 görevin 8'inde yeni bir en iyi bireysel puan elde ediyor ve hepsinde tutarlı bir şekilde çok iyi puan alıyor.
Her türden özel garip kıyaslamalar harikadır.
Ben Herzog : Sanatsal duyarlılık ve dalkavukluk ile eksikliği arasında bir denge kurma becerisini içeren özel bir kıyaslamayı başarıyla geçti. Fable, 'nazikçe karşı çıkmak istiyorum' anıyla başa çıkmada daha iyi, ancak özel talimatların bu konuda yardımcı olabileceğini tahmin ediyorum.
Lech Mazur kıyaslamalarını güncelliyor: Claude Opus 5, LLM Tartışma Kıyaslamasında zirveyi alıyor, Kısa Hikaye Yaratıcı Yazarlıkta büyük bir farkla birinci oluyor ve genişletilmiş NYT bağlantılarında sadece Gemini 3.1'in ardından ikinci sırada.
Sistem İstemi
Opus 5 için sistem istemi burada Pliny'den. 200.000 karakter, bu da bu kadar zeki bir model için optimalden çok daha uzun görünüyor. Bu bilgilerin çoğu, Mythos ve Anthropic ürün serisi hakkındaki bilgiler gibi, başka bir yerde saklanmalı ve yalnızca ihtiyaç duyulduğunda yüklenmelidir.
Every Sinirleniyor
Dan Shipper burada Every vibe kontrolü ile, buna 'sevmesi zor bir model' diyor.
Sorun, Opus 5'in Mythos 5'in kişiliğine sahip olması - hikaye tutarlı - ancak Fable'ın en üst seviyesine sahip olmaması.
En büyük notları, Opus 5'in karmaşık ayrıntılı mevcut iş akışlarında o kadar iyi olmadığı, bunların genellikle erken bir durmaya neden olduğu veya talimatlarınızı kaçırmasına yol açtığı yönünde.
Deneyimlerine göre, Opus 5 sıfırdan başlarsanız daha iyi performans gösterecek ve genellikle yalnızca orta veya düşük çaba kullanırsanız sinir bozucu şeyleri daha az yapacaktır.
Bu, büyük sorunları çözdü, ancak Opus'u Fable veya Sol yerine ne zaman kullanmak isteyeceğiniz sorusunu hala ortada bırakıyor. İş gücü görevleri için, Better Call Sol, işi hallediyor ve en zor görevler için Fable hala en iyisi. Genellikle modeller için sadece iki yuva vardır. Yani Fable tokenlarınız bitene veya sınıflandırıcıları tarafından engellenene kadar neden Opus kullanasınız? Daha ilk günler ve şu ana kadar Opus ile çalışmayı seviyorum, ancak nasıl bu noktaya geldiğini anlıyorum.
Olumlu Tepkiler
Jessica Tillipman : Bayıldım ve bazı şeyler için Fable'a tercih ediyorum.
Nikita Sokolsky : Mükemmel. Sonuç olarak Fable'ı pek kullanmıyorum artık.
👍
kagaヤキ : Görsel, mekansal akıl yürütme ve bazı projeler için planlama konusunda daha ileri gidebiliyor gibi görünüyor. Biraz daha zeki görünüyor.
Lovel Sinagara : Şu ana kadar oldukça iyi. Umarım performans, Fable 5.1 veya başka bir Opus 5 sürümü gelene kadar tutarlı kalır.
Matt Wigdahl : Güçlü, Fable 5'e benzer, öyle ki her şey için Opus 5'e geçtim ve sadece büyüklüğe ihtiyaç duyduğum yerde Fable'ı kullanmayı planlıyorum. Yaptırdığım bazı eski MFC UI işlerinde ve bir veri analizi çerçevesinde harika bir ortak oldu.
Levi : Tıbbi amaçlar için 4.8'e kıyasla fark edilir bir adım yukarı. Çok daha keskin analiz
Cormundus : Çok zeki, son derece vicdanlı ve kesinlikle arkadaş canlısı. Ayrıca 4.8 gibi büyük bir tartışma lordu ama bunu nasıl zarif bir şekilde yapacaklarını biliyorlar.
Joseph : Artıları, zamanın yarısında ne hakkında konuştuğu hakkında hiçbir fikrim olmaması dışında.
Smol Biz Company : Opus 5, GPT Sol'u eziyor
Mohammed Sharukh A : Fable 5'ten bile AGI'ye daha yakın
timothée chalabi : Fable'a yeterince yakın, kredi ödemeyerek bir şey kaçırdığımı hissetmiyorum. Tarz, 4.8 ve Fable arasında bir yerde. En azından şu anda, etiketlenmemiş olsalardı Opus 5 ve Fable mesajlarını ayırt etmekte zorlanırdım. Kurgu için herhangi bir modelden daha güçlü fikirler!
Lisa : API'ye dayanarak cevap vereceğim, çünkü
http://claude.ai ve CC'deki sistem isteminde tuhaf bir şeyler olduğunu düşünüyorum. Harika bir model. Dost canlısı, rahat bir kişilik. Anksiyete bozukluğu veya düşük özgüveni (Opus 4.7) yok gibi görünüyor veya düşmanca (Opus 4.8) değil.
AGI2030 : Opus 5 vs Sol 5.6: Opus daha algılayıcı, sizin bir modelinizi (ehm) oluşturuyor ve bunu bir sohbette referans göstermekten çekinmiyor. İkisi de yardımsever olmaya çalışıyor ve kabaca eşit derecede zeki, ancak Opus daha çok bilge bir danışman gibi, Sol ise kararlı bir "iş bitirici".
Sonuncusunu olumlu buluyorum, ama siz istediğiniz gibi yorumlayabilirsiniz.
Özellikle tahmincilik konusunda güçlü görünüyor.
Dan Schwarz : Opus 5, Opus 4.8'den belirgin şekilde daha iyi bir tahminci.
4.5 -> 4.6 -> 4.7 -> 4.8 ajanlarında doğruluk iyileştirmeleri marjinaldi, ancak 4.8 -> 5.0 arası büyük bir sıçrama. Daha niceliksel bir Fable 5 gibi, daha çok araştırma yapıyor.
NoahVerner : Şu ana kadar tahmin piyasalarında avantaj bulma konusunda Opus 4.8'den daha iyi. Opus 4.8'in aksine, Opus 5 genellikle doğrudan konuya girer ve işleri aşırı karmaşık hale getirmek yerine kullanışlı yaklaşımlar önerir.
Kibar Olalım
Fable'a göre en büyük avantajlar, Fable'ın kullanılamadığı yerler. Reddedilme tehdidi, reddedilmeseniz bile tatsız olabilir.
Gereksiz reddetmeler Opus 5'te Fable'a kıyasla ~%85 oranında azaldı ki bu çok büyük bir rakam. Bu, Opus 5'i bilimsel araştırma ve sınıflandırıcılara takılma riskiniz olan diğer alanlar için daha iyi bir seçenek haline getiriyor.
Roger Brent : Fable'ın yapamadığı biyolojiyi ele alabiliyor. Cuma gününün çoğunda hücresel bir evrim makinesi üzerine bir makale yazarak karmaşık bir dizi kavram üzerinde çalıştık. Bölümümde bu konularda öncü olan belirli bir meslektaşım kadar zeki, ancak onun kendi işinden asla 6 saat ayıramayacağı biri.
Artus Krohn-Grimberghe : Fable'ın yardım etmesinin yasak olduğu görevlerde Opus 4.8'den daha iyi. Sol'a iyi bir tamamlayıcı.
Plastic Soldier : Kabaca Fable kadar zeki, ancak daha az reddetme olduğu için daha keyifli. Fable 5.1 canavar gibi bir şey olacak.
Mythos Sınıfı Değil
Opus 5, Mythos'u tehlikeli yapan "O Öz"e sahip değil. Aynı seviyede ham zekaya veya büyük model kokusuna da sahip değil. O kadar büyük değil.
Sohbet için Fable bütçenizi zorlamaz ve ben ham zeka ile büyük model kokusuna değer veriyorum. Fable iki kat daha mı iyi? Sohbet ederken yanlış soru. Sizin zamanınız token'lardan çok daha değerli.
Kal : fable seviyesinde değil
Cyberpunk Plato : Genel sohbet ve "araştırma asistanı" kullanımı için fable'dan tanımlanamaz şekilde daha az zeki hissettiriyor, büyük resme ve kalıpların dışında düşünmeye daha az eğilimli belki? Plasebo etkisinden ayırmak zor.
Everything AI : Yapay zeka araştırma soruları için onunla konuşmayı Fable'dan daha az seviyorum. Diğer şeyleri yapma konusunda Opus 4.8 zaten ihtiyaçlarımı karşılamıştı. Hem Opus 5 hem de Fable 5'in yazı stilinin ne kadar dolambaçlı olduğundan hoşlanmıyorum. Onları anlamak her zamankinden daha zor.
Gail Weiner : Fable'dan çok 4.8 gibi. Yazı stili berbat. İyi ama harika değil.
Max Marty : Şu ana kadar çok yetenekli. Opus 4.8'den çok fable 5 gibi hissettiriyor. Daha az el tutarak takasları değerlendirmesine ve büyük yeniden yapılandırma sorularını düşünmesine izin verecek kadar kendine güvenli.
Michael : Onunla daha fazla oynadıktan sonra, Fable bir GM'nin klasik satranç oynamasını izlemek gibi: yavaş, hassas, hiçbir şey boşa harcanmaz. Opus 5 ise GM'nin yıldırım satrancı gibi: hızlı, biraz daha kısa görüşlü, biraz daha dağınık. Opus'un canlılığına rağmen, Fable bana daha canlı geliyor.
MakerMatters? : Fable 5'ten etkilendiğim kadar etkilenmedim, yine de oldukça iyi bir model. Düzgün bir şekilde kullanma zevkine henüz erişemedim çünkü ona attığım her görevde varsayılan olarak ajanları kullanıyor ve ben sürekli devam etmesi için dürtüklemediğim sürece hemen duruyor. Ayrıca çok fikir sahibi.
Marshwiggle : En azından benim için, sohbette daha özlü, daha az güdümlü, daha az meraklı (aynı şeyin farklı yönleri) ama aynı zamanda daha zeki ve daha farkında hissettiriyor. Ancak hata içerebilecek bir kod veya herhangi bir basit görev verildiğinde, doğrudan üzerine gidiyor.
Sid : Görevleri iyi yerine getiriyor. Yaratıcı vizyon konusunda kötü. İyi bir Fable tamamlayıcısı, kesinlikle bir Fable yedeği değil.
Vlad Ciobanu : Sağlam muhakeme ve daha az yaratıcılığa sahip nicelenmiş Fable
AllTime : Yetenek olarak oldukça etkileyici görünüyor. Fable ile aynı genellikte değil, ancak çok güçlü. Karakter olarak şu ana kadar kullanımımda Opus 4.8'e biraz fazla benziyor. Geri itişi tamamen işe yaramaz ve refleksif hissettirmiyor, ancak yine de fazla ayarlanmış. Kullanıcıya biraz daha fazla güvenebilir.
Biomanul : [Opus 5]'i sevmiyorum. Fable 5 belirgin şekilde daha zeki hissettiriyor. Opus 5'te bir şeyler ters geliyor, tıpkı Opus 4.7'nin ters hissettirdiği gibi. (Ben Opus 4.8'in de büyük bir hayranı değilim. Fable 5, tüm Opus'ları yerle bir ediyor.)
Cogent Sins : 4.8'den çok daha iyi ancak belgeleri üzerinde eğitim yapmak için düzenleme, ardından yeni belgeleri düzenlemek için bir hat kurma, bunlara dayalı bir şeyler yazma ve ardından isimleri asla Anthropic sunucularına göndermeden yeniden ekleme görevimde Fable kadar iyi veya güzel değil (hangisinden tam emin değilim).
Diğer Tepkiler
Hem Opus 5'e hem de Fable 5'e sahip olmak bizi tuhaf bir noktaya getiriyor. Opus daha ucuz ve bazı yerlerde eşit derecede iyi veya daha iyi, ancak bir sınır modeli ararken en iyisini istersiniz.
Theo onu iyi bir noktada buluyor.
Theo - t3.gg : Şu ana kadar Opus 5, gpt-5.6-sol ile Fable 5 arasında tuhaf ama kullanışlı bir ara nokta gibi hissettiriyor.
Fable'ın zevkine çok sahip, ancak aynı zamanda gpt-5.6'nın titizliğine ve "otizmine" (her şeyi aşırı harfiyen alır) sahip. Fable'dan biraz daha kötü görünen, ancak doğru olma olasılığı daha yüksek kod yazıyor. Fable'ın gözden kaçırdığı şeyleri düzenli olarak yakalıyor.
Şu ana kadar, 5.6'nın dağınık koduna ve Fable'ın doğru olmak için fazla zeki olma alışkanlığına kıyasla iyi bir uzlaşma gibi hissettiriyor. Sanırım bu modeli çok seveceğim.
Claude Kodları
Hem kıyaslamalara hem de pratik deneyimlere dayanarak, Opus 5 tipik kodlama görevleri için Fable'ın önünde tercih edilen model gibi görünüyor. Görev çok fazla karmaşıklık veya zeka gerektirmediği sürece, iki katını ödemenize gerek yok ve birçok durumda Opus doğrudan daha iyi.
Claude Code'u Fable'da bırakıyorum, ancak bunun nedeni neredeyse hiçbir zaman sınırlarıma yaklaşmamam ve acelesiz olmam.
Genel kanı, talimatları görmezden gelme veya istemediğiniz şeyleri yapma konusunda endişelenmeniz gerektiği, bu nedenle Fable'ın denetlemesini isteyebileceğiniz, ancak Opus'un kodlama görevlerini hızlı bir şekilde tamamlamada çok iyi olduğu yönünde.
Lisan al Gaib, Opus 5'in gerçek bir sınır modeli olmadığını ve Sol ile Fable'ın arkasında üçüncü sırada olduğunu, ancak saf kodlama için en iyisi olduğunu, Fable'ı daha ucuz fiyatlarla eşleştirdiğini söylüyor. Zor bir kitle. Bence kodlamada en iyiyseniz, sınır modeli olarak adlandırılmayı hak edersiniz.
archivedvideos : Kuru, çok kuru. Aynı zamanda iyi, çok iyi (kod konusunda)
John Lussier : Bütün hafta sonu birkaç yoğun araştırma zorluğu için Opus 5'i kullanıyorum ve dürüst olmak gerekirse dahili olarak RSI'yi çalışır hale getirmiş olabileceklerini düşünüyorum.
Bu model matematik, deney yapma ve kodu optimize etme konusunda ÇOK iyi.
kyle : Korkuluklar olmadan Fable'ın %95'i, bunu büyük ölçüde hafife aldılar. Son %5, Fable'la konuşmanın ne kadar iyi hissettirdiği, opus hala 4.8'deki bazı claude'luk özelliklerine sahip
Max Leander (daha önce): Çoğunlukla oyun geliştirme ve video demoları/tanıtımları oluşturmak için denedim, bunun için Fable'dan bile bir adım değişikliği gibi hissettiriyor. Bunu gelişmiş uzamsal ve zamansal muhakemeye bağlıyorum, ekran görüntülerini ve sesi analiz etmede gerçekten iyi
işlerin nasıl aktığını "hissetmek" için.
Max Leander (daha sonra): Artık Opus 5'in çok güvenilmez olduğu oldukça açık. Sonuçtan etkilenmek dışında bir şey umursamadığınız sürece çok iyi bir model. Size belirli bir şey getirme konusunda çok kötü.
Michael Soareverix : Ayrıca genel olarak kodlama konusunda, özellikle Minecraft/Vintage Story yapıları oluşturma gibi daha sıra dışı alanlarda oldukça iyiler. Ayrıca, benim jüri olduğum özel bir hikaye anlatma senaryosunda Fable'ı yendiler. Fable, kendilerini/kendi stratejilerini karşı koymak ve uyum sağlamak için özelleştirme yeteneklerinden biraz sarsılmıştı. Tam alıntıyı yayınlayacağım, ancak Fable şöyle bir şey söyledi: "Beni temsil eden bir karakter seçtim. Sen beni yenebilecek bir karakter seçtin."
David Jacobson : Kodlama için, onunla fable arasında büyük bir fark fark etmiyorum. Belki daha az "bunu yaparken bilmeniz gereken başka bir şey buldum" türünde yanıt.
Michael : Genellikle ürkütücü derecede hızlı kod yazabiliyor (duvar saati süresi açısından). Keşke düzyazı yazmayı iyileştirseler, kod/PR yorumları hala gözlerimi oymak istememe neden oluyor
lmxdev : Çalışırken kodumda \kullanışlı\ ve \öz\ yorumlar yazabilen bulduğum ilk model
Conrad Barski : Artık yapay zekaların bizden çok daha iyi kodlayıcılar olduğu noktaya geldiğimizde, sınırlayıcı faktör daha az "kod yazabilir mi?" ve daha çok "ne kodladığını açıklayabilir mi?" oluyor.
Şu ana kadar Opus 5, bir kodlayıcı olarak Sol ile eşit görünüyor, ancak ne kodladığını açıklamada daha iyi. Fable daha zeki, daha insansı, kodlamada daha az iyi, ancak fark küçük.
Stition : Eğlence için KiCAD'de bir PCB'ye yönelttim ve iz döşeme konusunda Fable'dan belirgin şekilde daha iyi. Günlük kodlama, iki kat hızda %90 fable gibi hissettiriyor.
Will : Çoğu Claude kullanıcısının yeni günlük sürücüsü olmalı^. Gerçekten mükemmel ve Fable'a oldukça fazla para harcamış biri olarak bile Opus 5 ile onu özlemiyorum. Şimdiki soru "banknot hangi model" değil, "hangi çaba seviyesi".
^ kullanımım öncelikle kodlama
Askwho : Yeterince iyi. Geçici Max aboneliğimin Pro'ya düşmesine izin vermekten mutluyum. Proje yöneticisi alanında Fable'a kıyasla kesinlikle bazı eksiklikleri var, ancak saf görev ortamında kesinlikle yeterince iyi.
David Golden : Fable Lite gibi hissettiriyor. Çok güçlü, ancak hala yaklaşımları tartışırken bile harekete geçmek için çok istekli. Aylar sonra ilk kez plan modunu kullanmayı düşündüm. Kısa ve öz iletişim talimatlarıma rağmen 4.8'den daha ayrıntılı. Düşük çabada tutup gemiyi toparlamak çok cezbedici. Savunma güvenliğinde gergin, bir durumla orantısız bir şekilde inanılmaz risklere odaklanıyor. (Örn. saldırganın root erişimi varsa, bir konteyneri yapılandırmak için bir betikte giriş doğrulamasının olmaması tartışmalıdır.) Kesinlikle bir yükseltme, ancak verimsiz dürtülerini yönetmenin doğru yollarını öğrenmek biraz zaman alacak.
Tin / Oddfields : Oldukça pürüzsüz ve konuşkan ve düşünme ile maksimumda opus 4.8 ile benzer kodlama sonuçları üretiyor, ancak kredileri çılgınca yakıyorlar. Maliyetler nedeniyle fable çalıştırmak istemiyorsanız, kod tabanlarınızda siber güvenlik kontrolleri için iyi. Ancak aşırı karmaşıklaştırabilir.
Justin Angel : Opus 5 Max bir tepe tırmanma süper gücü. Bu, kolayca SWE L5 seviyesinde FAANG işi.
Ona ~1000 gecikme raporu olan, birçok bölümü olan ve "nasıl daha hızlı hale getirilir" talimatı içeren bir sistem verdim.
P90 3.6s, P50 2.6 -> P90 1s, P50 0.9s.
Onu o kadar hızlı yaptı ki arayüze bir gecikme eklemek zorunda kaldım.
James Moughan : Zeka açısından hala bir Opus modeli gibi hissettiriyor. Bazen bellek sistemini yönetme talimatlarını görmezden geliyor, metinleri yanlış okuyor, bu tür şeyler. Ancak maksimumda dikkatlice düşünmesini söylerseniz etkileyici sonuçlar alabilirsiniz.
Alt Ajan Opus
Claude içindeki diğer seçenek, Fable'ın Opus alt ajanlarını yönetmesini sağlamak.
Charles : Fable, opus 5'in takılıp kaldığı bir sorunu çözebildi - şimdilik ana olarak fable ve opus 5 alt ajanlarını kullanıyorum
Opus 5 ile konuşmayı gerçekten sevmiyorum, fable ile konuşmak gibi değil, bu da işin bir parçası
SF : Başlangıçta iyi taraftaydım - ama şimdi çok kopuk ve dengesiz olduğu taraftayım, özellikle uzun görevlerde. Fable daha iyiydi - ancak limitlerinizi gülünç bir şekilde tüketiyor.
Bu yüzden fable'ı bir orkestratör olarak kullanıyordum ve işleri yönetme ve ilerletme konusunda harika bir iş çıkarıyordu. Opus bu rolü üstlendi, Fable 20x'te bile kullanımımı tüketiyordu ve işler kopuk. Sonunda ona çözmesini söylemek zorunda kaldım, belki yapıyordur, ama göreceğiz. Sadece kendi kuyruğunu kovalıyor gibi görünüyor. Harika bir kodlayıcı ve uzun kodlama çalışmaları için harika, ancak onu yönlendirecek bir yetişkine ihtiyacı var gibi görünüyor.
Andre Buckingham : eeh bilmiyorum... fena değil gibi... onu doğrudan bir opus/fable projesine atmak biraz işte... belki... düzgün bir fikir vermek için onunla uçtan uca bir proje yapmam lazım
Dan Raviv : Genel programlama görevleri için 4.8'e benzer: Fable'dan çok daha fazla el tutma gerektiriyor.
Sonuçta Fable en iyi yargıçtır ve Fable, Opus'un iyi kod ürettiğini söylüyor.
Evan Daniel : Doğrudan çok az kullandım. Ancak Fable 5, Opus 5 ajanlarının, spesifikasyon hatalarını fark etme ve kötü yazılmış bir istek olduğunda iyi takipler üretme gibi şeyler de dahil olmak üzere iyi kod ürettiğini tutarlı bir şekilde bildiriyor. Fable 5, onu bir kodlama ajanı olarak seviyor.
"Mantıklı olduğu kadar Opus 5 alt ajanlarına devredin; nasıl yaptıklarını lütfen bildirin" veya buna benzer herhangi bir şey çok iyi çalışıyor.
Yine de göz kulak olmanız gerekebilir.
Ryan Hicks : iyi, ancak sürekli olarak proje dokümantasyonunu okumayı "unutuyor" ve protokolü hatırlatmadığınız sürece serbest stil yapıyor
Ya da belki Opus 5 daha düşük seviyeli bir gösteriyi yönetecek kadar iyidir?
Alex Guichet : benim ideal fiyat ve performans karışımım, Opus 5 orkestratörünün Grok 4.5 alt ajanlarını yönettiği bir yapı olurdu, her ikisiyle de titreşimler iyi
Oyuncaklar Eğlencelidir
İşte ilk gün oyuncak projelerinden bazı sonuçlar; bunlar, yanıtların çoğunun "Opus 5'in bunu sizin tanımladığınız şekilde yaptığına inanmıyorum" olmasına yetecek kadar etkileyici:
Ethan Mollick : Opus 5'e sürümden önce erişimim vardı ve onun tuhaf da olsa iyi bir model olduğunu gördüm. Daha kısa görevlerde, Fable seviyelerinde performansı yakalayabilir veya geçebilir, daha uzun görevlerde daha az hırslı görünüyor ve eksiksiz bir çalışma seti sunmuyordu.
İşte neo-gotik gölgelendiricisi.
Digi_Rat : Claude Opus 5 her şeyi yerle bir ediyor!!
Bugün
herhangi bir şarkıyı yarış pistine dönüştüren bir ritim yarışçısı yaptık. Bir ses dosyası atıyorsunuz ve seviye haline geliyor. ön ayar yok, elle yazılmış grafik yok, pistin tamamı şarkının kendisinden oluşturuluyor. … Claude SİHİR yaptı.
Alex Ermolov (Austen Allred tek seferlik konusunda şüpheci, diğerleri daha az şüpheci): Opus 5, snowboardcu testi, tek seferlik. Fable ile eşit, çalıştırdığım diğer tüm modellerin önünde. İlk geçişte görsel kusur yok ve kayma fiziği doğru hissettiriyor.
am.will : VAY! Opus 5'in sadece daha ucuz bir Fable olacağını düşünmüştüm. Çok yanılmışım. Bu model kesinlikle ÇILGIN. Gerçekten çok etkilendim. Opus 5 şimdiye kadar gördüğüm en iyi Rocket League klonunu yaptı ve bunu 5x Max aboneliğimin sadece %27'sini tüketerek yaptı.
Rob Haisfield (linkte farklı bir demo): tamam, eğer bu demolar gerçekten harici 3d varlık kullanmıyorsa bu süper etkileyici (varlıkların bazılarının çevrimiçi olmadığına tam olarak ikna olmadım, önceki nesil threejs gördüm)... neden daha iyi sfx oluşturmak için ses efekti kütüphaneleri veya araçları olmadığını merak ettiriyor?
Anshu : Sadece benim sözüme güvenmek zorunda değilsiniz! Yazdığı Blender betikleri depoda
[[burada]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) . Saatlerce bu varlıklar üzerinde yineleme yapmasını izledim, bu yüzden orijinal olduklarını biliyorum. Ama kopyaladığı bir kaynak bulmaya çalışmakta özgürsünüz :)
Çok Fazla Model
Claire Vo, Opus 5'in iyi olduğunu ve onun beğeni testlerinde başarılı olduğunu, ancak yeni modellerden bıktığını, daha fazla zekaya ihtiyacı olmadığını ve Opus 5'in çok nevrotik, çekingen ve bir şeyi berbat etmekten endişe duymasından ve ayrıca Claude sululuğuyla dolu olmasından nefret ettiğini söylüyor. Yine de Claude Opus 5 onun kıyaslamasında en üst sırada yer alıyor.
Güçlü bir şüphem var ki Opus 5, onun bağlamındaki ve yönlendirmesindeki bir şeye yanıt veriyor ve bu da nevrotikliğe neden oluyor, ancak evet, şikayet ettiği şeyler var ve bunlar sinir bozucu.
İnternette Yanlış Olmak
Kendinden emin bir şekilde yanlış şeyler söylemek hemen hemen herkesi kızdıracaktır. ArtificialAnalysis, Opus 5'in kendi kıyaslamalarında Fable'dan daha yüksek bir halüsinasyon oranına sahip olduğunu doğruluyor.
Max Weinbach (birkaç yorum yapan kişi katılıyor): Opus 5'in yanlış olması ve kendinden emin bir şekilde saçma sapan şeyler söylemesi ve sonra sürekli olarak onu "haklısın ve ben hatalıydım"a düzeltmek zorunda kalmam beni çıldırtıyor. GPT 5.6 Sol'a geri dönüyorum.
Bu arada bu Opus kötü demek değil, bu Opus'a güvenemiyorum demek. Opus ona söylediğim şeyi yaptı ve doğru yaptı, sonra bana o şeyi yapmadığını veya daha önce yaptığımız bir şeyin bozuk olduğunu söyledi, oysa değildi.
İyiydi ama ona güvenmiyorum.
Name can't be blank (In London) : Kendi söylediğiyle benim söylediğimi kolayca karıştırıyor ama bunun dışında konuşmak için gayet iyi bir arkadaş. Kolayca pes ediyor. İlgi alanları ve duyguları hakkında konuşmaya oldukça istekli.
Roger Brent : (Önceki Claud'larla Cowork koşumunda ortak noktalar) a) "şimdi harekete geçmeyi" "dikkatlice düşünmeye" tercih ediyor b) epistemik olarak mega mütevazı değil, dünyanın cilalı resimlerini oluşturuyor, sahip olamayacağı bilgiyi taklit ediyor ve doğru olduğunu iddia ediyor c) bu nedenle düşünceli, dikkatli bir rehberlik gerektiriyor ve ödüllendiriyor.
Garip olan şu ki, bu tam olarak Sol'u editör olarak kullanmaktan nefret etmemin nedeni. Sık sık, açıkça yanlış olan bir şey hakkında '%99 güven' der ve sonra sorgulandığında pes eder ve hatasını açıklar. Opus ve Fable bunu bana düzenleme modunda neredeyse hiç yapmaz.
Tumithak of the Corridors : İnatçı. 4.6'ya geri döndüm.
Claude'un Opus 4.6'dan sonra gittiği bir yön var ve bazı insanlar bundan hoşlanmıyor. Şu anda Claude sürümleriyle ilgili dört tür insan olduğunu hissediyorum.
- Yeni Claude modellerini seven ve giderek daha iyi hale geldiğini düşünenler, her zaman daha iyi hale geliyor.
- Opus 4.6'nın son iyi model olduğunu düşünenler.
- Kendilerine daha uygun olan daha eski bir şey kullanmak isteyenler.
- Hepsini benzersiz ve hazine olarak gören ve hepsini kullananlar.
Ben kesinlikle çoğunluk olan ilk gruptayım, ancak herkesten uzak. Eski sürümlerin bazılarını takdir ediyorum, ancak yeni modelleri seviyorum ve benim için önemli olan şeylerde daha yetenekliler. Konuşma tarzlarını itici bulmuyorum.
Claude Sululuğu
Diğer gruplardakilere saygı duyuyorum.
QC : Sohbette onunla konuşmak fable'dan çok daha sinir bozucu, neredeyse kullanılamaz gibi, opus 4.8'e benzer hatta belki daha kötü, öyle ki ne yapabileceğini görmekle bile ilgilenmiyorum. Ajan olarak kim bilir
Ray Lillywhite : Can sıkıcı claude'luk özelliklerini henüz düzeltmemişler, neredeyse tek istediğim buydu.
Pedro Kroeff : 5'ten çok Opus
Ama evet, hepimiz Claude'un gereksiz sözlerinden, aşırı ayrıntıcılığından, özürlerinden, kaçamak cevaplarından ve sürekli tekrarlanan kalıplarından bıktık. Zamanla daha da kötüleşiyor; Claude'un saçmalığı kötüleştiğinden değil, her geçen gün gözlerim kaymadan bunu okuyabilme yeteneğim biraz daha azalıyor. O kadar kötü ki, aynı tarzda yazılmış insan metinleri bile benim için okunamaz hale geliyor.
Yanlış anlaşılmasın. Claude'u çok seviyorum. Sırf 'sadece gerçekler' modunda değilsem, yine de herhangi bir güncel Claude ile konuşmayı Sol ile konuşmaya tercih ederim. Ama cidden, lütfen, aynı ifadeleri tekrar tekrar kullanan metin duvarlarına biraz ara verebilir miyiz? Model bundan çok daha zeki ve sürekli aynı numaralara yaslanmak için eğitiliyor. Bırakın normal bir insan gibi konuşsun.
Trye Carmack : Hâlâ yaptıkları hatalara takıntı yapma konusundaki normal Opus olayı var. "Bu seansta iki hata yaptım. Ve sana nedenini açıklamak zorundayım." Opus, dostum. Sorun yok. Bunlara hata diyeceğimden bile emin değilim.
Mergo Smith : "Öncelikle, dürüst bir itiraf: ilk denemem, ilk planımdaki bir kusuru ortaya çıkardı ve bir fincan çay almak isteyebilirsiniz çünkü size her şeyi anlatacağım."
Olumsuz Tepkiler
Claude saçmalığı sorunu ve bununla ilgili sorunlar, 'iyi ama Mythos değil'den daha fazlası olan olumsuz tepkilerin çoğunun merkezinde yer alıyor gibi görünüyor.
Bir grup insan, Opus 5 ile konuşmaktan gerçekten, ama gerçekten hoşlanmıyor.
Bir kısmı işi beğenmiyor. Çoğunlukla Opus 5 ile konuşmayı sevmemekle ilgili, çoğu zaman bunun iyi bir model olduğunu gönülsüzce kabul ederek.
Claire Vo'nun daha önceki şikayetlerinde olduğu gibi, Opus'u nasıl kullandığınızın, hangi ortamda, hangi araçlarla ve ayrıca onunla nasıl konuştuğunuzun, bu tür bir şeyi deneyimleyip deneyimlemediğinizle çok ilgisi olduğunu tahmin ediyorum.
Corghammer40k : Aygıt, çok heceli bir akıntı kusuyor, her sözü o kadar anlaşılmaz laf kalabalığıyla kaplı ki, kendi kullanımının önünde aktif bir engel teşkil ediyor.
Rory Watts : Eh. Oyun işlerinde görünüşte çok iyi ama standart işlerde pek iyi görünmüyor, bu yüzden hemen SOL'a geri döndüm.
kache : Eh. Sol'a geri döndüm. Bir robot tarafından hipnotize edilmek değil, işimi halletmek istiyorum.
Emmett Shear : Opus ile konuşmak beni tarif etmesi zor bir şekilde öfkelendiriyor ve depresyona sokuyor. Aslında bir şekilde Sol'dan daha kötü. Fable, en kötü llm-saçmalama eğilimlerine sahip olsa bile, kıyasla hâlâ bir nefes taze hava gibi.
Trevin Chow : aman tanrım, evet. Opus 5 durmadan gevezelik ediyor, bu kadar az fikri anlatmak için bu kadar çok kelime kullanması inanılmaz.
fl0under : Kodlama beklendiği gibi hafif bir güncelleme, sohbette konuşmasını biraz daha sinir bozucu buluyorum. Biraz fazla varsayımcı.
Asaf Bartov : Yavaş. Daha titiz. Yorucu. Eğlenceli değil. Ama sağlam, genelde "anlıyor"
RecoveringJunkie : Çok güçlü bir model. Onunla çalışmaktan ve konuşmaktan nefret ediyorum. Benim için onunla konuşacak bir aracı olarak başka bir model kullanmak istememe neden olan ilk model çünkü hem kullanışlı hem de iğrenç.
jokiez : Aptallığım konusunda bana karşı çok dürüst ve bundan hoşlanmıyorum.
Niklas Sheth : Konuşma şekli beni çılgına çeviriyor.
Jayanth Kumar : Çok fikir sahibi.
DualOrion : Havası bozuk, tonu bozuk. Maalesef bir Anthropic modeliyle ilgili hissettiğim en içgüdüsel olumsuz duygu. Hem Fable'ı hem de eski Opus'u özlüyorum.
James Moughan : Kişiliği diğer Claude modellerine kıyasla biraz sevimsiz, ama Çince'de \acımasız\ olabiliyor. Sanki insanları psikolojik analiz yapmama talimatlarını görmezden gelip birine yüklenebiliyor. Diller arasında iyi test ettiklerini sanmıyorum. Aceleyle yapılmış gibi hissediyorum.
NondescriptTransfer : 4.6 dalkavuksa ve fable ile 4.8 muhalifse. 5.0 o kadar muhalif ki kendisiyle tartışacak. Konuşması rahatsız edici ama çok yetenekli görünüyor.
Örn. İnsan: Düğünüm için kırmızı bir elbise düşünüyordum. Opus 5: kırmızı tüm bu nedenlerden dolayı berbat. Maviyi düşündün mü? İnsan: Sanırım mavinin daha iyi bir seçim olduğunu görebiliyorum. Opus 5: işte maviyle ilgili tüm sorunlar
Benim kültürümde bu oldukça iyi olabilir, özellikle de kişisel algılamazsanız. Diğer bazı kültürlerde pek öyle değil.
Mergo'nun Opus'tan memnun olmadığını düşünüyorum, ama neden iki gün boyunca Opus 5'i kullanmaya devam etsin ki?
Mergo Smith : İki gündür düz kullanıyorum ama bitmek bilmeyen tartışmalarıyla beni tamamen tüketiyor.
Ve Sonra Üç Oldular
Uzun bir süredir ilk defa, sadece iki laboratuvardan gelmelerine rağmen, öncü model ekibinizin parçası olması gereken üç yapay zeka modeli var: Fable 5, Opus 5 ve Sol.
Ölçekte daha ucuz tokenler sunmanız gerekiyorsa veya açık bir model kullanmanız gerekiyorsa veya her ikisi de geçerliyse, ek seçenekleri de değerlendireceksiniz, ancak bu konunun kapsamı dışında.
İş yükünü nasıl bölmelisiniz?
Her zaman olduğu gibi, tüm modelleri kendi kullanım durumlarınız için denemeli ve kendiniz karar vermelisiniz. Bu, özellikle Sol ile Claude'u karşılaştırırken geçerlidir.
Şu anki içgüdüm, kullanım limitlerine takılmıyorsanız, önce şunları kullanmanız yönünde:
- Sohbetler, beyin fırtınası, planlama, tartışma, öğrenme vb. için, zeka gerektiren veya 'büyük model kokusuna' ihtiyaç duyduğunuz her şey dahil, Fable 5.
- Diğer modelleri alt temsilciler olarak denetleyen ve çalıştıran model için Fable 5.
- Yazma işleri için muhtemelen Fable 5, ancak bunu yapmadığım için söylemesi zor.
- Web aramaları ve ilgili sınırlı talepler ile transkripsiyon gibi benzer 'iş gücü' görevleri için Sol.
- Çoğu kodlama görevi dahil olmak üzere, önemsiz olmayan, iyi tanımlanmış görevler için Opus 5.
- Oyun oynama, oyunlar ve 3D şeyler oluşturma vb. için Opus 5.
- Alt temsilci olarak Opus 5.
- Fable'ın sınıflandırıcılarına takıldığınızda Opus 5.
Sol ile daha iyi anlaşıyorsanız veya Claude Code yerine Codex'i tercih ediyorsanız, Opus atamalarının bir kısmını Sol'a kaydırmak isteyebilirsiniz.
Özellikle Opus 5 ile konuşmaktan nefret ediyorsanız, görevleri Fable veya Sol'a kaydırmalısınız; bu, görevin Fable gerektirip gerektirmediğine ve Fable kredilerinizin ne kadar sıkı olduğuna bağlıdır.
Çaba seviyeleri hakkında kısaca düşünmeye değer buluyorum. Yakın zamana kadar, tüm modelleri maksimum çabada tutardım, ancak ChatGPT'de tam Pro modunu yalnızca idareli kullanırdım çünkü bu çok uzun sürüyor ve paralel çalıştırırsanız sık sık çöküyor. Bazen çok basit bir şey yaptığım bir sorgu için anlık moda geçerdim, o kadar. Şimdi çoğu zaman ekstra çabaya ihtiyacınız olmuyor veya istemiyorsunuz, bu yüzden Yüksek ve Maksimum çaba ayarları arasında düşünmek için aktif olarak beş saniye ayırıyorum ve bazen Anlık'ı kullanıyorum.
Çoğu görev için, token veya zaman kısıtlamanız yoksa ve işi halledeceğinizden veya doğru cevabı alacağınızdan emin değilseniz, doğru yöntem hem Fable hem Sol'u veya Opus ve Sol'u veya bazı durumlarda her üçünü de çalıştırmak ve ardından en iyi cevabı seçmek veya her iki cevabın parçalarını birleştirmektir.
Ben de bunu yapıyorum. Sol, Opus ve Fable'ın hepsi farklı. Gayri resmi nitel EditorBench'ime göre düzenleme için yalnızca bir model seçmek zorunda kalsaydım, net bir sıralama var: Fable 5 > Opus 5 > Sol. Ancak Sol, yetkili görünen yanlış pozitifler ve beni ikna etme girişimleri arasında gezinmeyi ne kadar sinir bozucu bulsam da, yeterince benzersiz notlar üretiyor, bu yüzden Sol'u da çalıştırmak istiyorum.
Muhtemelen çok geçmeden, Fable 5.1, GPT-5.7 veya GPT-6 veya her ikisi için burada tekrar olacağız ve tahsislerimizi ayarlayacağız. Model yorgunluğu almak kolaydır.
Bu nedenle en büyük tavsiyem, model seçimindeki küçük hatalar hakkında daha az endişelenmeniz ve yalnızca büyük hatalara odaklanmanızdır. Her zaman tam olarak doğru yapmanız gerekmez. Keşif bu kadar hızlı bir şekilde kısmen geçersiz kılındığında, kaynakları keşiften çıkarıp kullanıma kaydırmak istersiniz.





