3 Eylül 2026'da OpenAI, GPT-6 Astra'yı yayınladı.
Birçok kişi Codex model ayarlarını Astra'ya çevirip orada bırakıyor.
Ancak OpenAI o gün sadece modeli güncellemedi. Resmi duyuruda, Codex 'Harness'ini Astra ile birlikte güncelledikleri açıkça belirtiliyor (Kaynak: OpenAI "GPT-6 Astra: Yeni nesil zeka" https://openai.com/index/gpt-6-astra/ ).
Beyin ve beynin çalıştığı ortam. OpenAI ikisini aynı anda yeniden inşa etti.
Ancak, net olmayan talimatlar veya çelişkili kurallar kalırsa, Astra görevi yarıda bırakabilir veya sürekli açıklama isteyebilir.
Bu yazıda size şu üç şeyi sunacağım:
- Codex Harness'ini oluşturan 8 unsurun (öncelikleriyle birlikte) tam açıklaması
- Hemen kopyalayıp yapıştırabileceğiniz 4 teşhis ve envanter çıkarıcı komut
- Bugün sadece 30 dakikada nereden başlayacağınıza dair bir uygulama sırası
Geride durmanın anlamı yok, o yüzden en önemli komutu önce paylaşacağım. Bu komut, Codex'in mevcut proje durumunu kendi kendine raporlamasını sağlar.
▼ Buradan kopyalayın
Sen bir Codex Harness Tasarımcısısın.
Hedef, GPT-6 Astra'nın bu projede "görevleri her seferinde ayrıntılı talimatlara ihtiyaç duymadan güvenli, tekrarlanabilir ve sonuna kadar tamamlayabileceği" bir durum yaratmaktır.
Öncelikle, herhangi bir değişiklik yapma. Mevcut proje yapılandırmasını, ayar dosyalarını ve mevcut özellikleri gözden geçir, ardından aşağıdakileri teşhis et:
- AGENTS.md: Amaç, uyulması gereken kurallar, yasaklar, tamamlanma koşulları ve referanslar net mi?
- docs / context: Gerekli bilgiyi kendi başına bulabilecek şekilde yapılandırılmış mı? Eski, gereksiz veya çelişkili açıklamalar var mı?
- Skills: Hangi tekrarlayan görevler Skill'e dönüştürülmeli? Tersine, hangi Skill'ler gereksiz?
- MCP / Plugins: Hangi harici araçlar veya veri bağlantıları eksik?
- Environment: Bağımlılıkları, kurulumu ve test yürütmeyi kendi başına tekrarlayabiliyor musun?
- Permissions / Sandbox: Sana aşırı izinler mi verilmiş? Tersine, işi durduran çok fazla bekleyen onay var mı?
- Hooks / Tests: Yürütme öncesi kontroller, gizli bilgi tespiti, test etme ve tamamlanma kontrolleri otomatikleştirilebilir mi?
- Browser / Computer Use: Bitmiş ürünü fiilen çalıştırarak doğrulanması gereken görevler var mı?
- Subagents: Araştırma, inceleme veya test etme gibi paralelleştirilirse daha hızlı olacak görevler var mı?
- Feedback Loop: Geçmiş başarısızlıkları veya düzeltme talimatlarını AGENTS.md / docs / Skill / Hook / Test'e geri besleyen bir mekanizma var mı?
Çıktı formatı: A. Her bir maddeyi 5 puanlık ölçekte değerlendir B. En kritik 5 eksiklik C. Bugün 30 dakikada düzeltilebilecek şeyler D. Bir hafta içinde sistematik hale getirilecek şeyler E. Oluşturulacak/değiştirilecek dosyalar ve spesifik değişiklik önerileri F. Güvenlik/izin riskleri G. Uygulama önceliği
Tahminlere dayanarak ayarlar uydurma. Yargılamadan önce mevcut Codex özelliklerini ve sürümlerini kontrol et. Özelliklerin Experimental / Beta / Deprecated olduğunu açıkça belirt.
Bu teşhis sonuçlarını inceleyene kadar dosyaları değiştirme, izinleri genişletme veya harici servislere bağlanma.
▲ Buraya kopyalayın
Bunu okumayı bitirmeden çalıştırmak, daha sonra zaman kazandıracaktır.
Bu Makalenin Hedefi ve Kullanımı
Bu hedef, 7 Eylül 2026 itibarıyla Codex'tir. Codex hızlı güncellenir, bu yüzden okumadan önce tarihi kontrol edin.
İçerikte 8 harness bileşeni, 7 olgunluk seviyesi ve kopyalanıp yapıştırılabilecek 4 komut şablonu bulunmaktadır.
Hedef kitle, "Codex'i kullanan ancak AGENTS.md yazdıktan sonra duran kişilerdir." Mühendis olmayanların da okuyabilmesi için teknik terimlere ilk geçtiklerinde açıklamalar ekleyeceğim.
Her şeyi okumasanız bile değer sağlamak için her bir öğeye "Öncelik" ekledim. Sadece yüksek öncelikli olanları seçseniz bile en azından minimum düzeyde çalışacaktır.
"Harness" Tam Olarak Nedir?
Harness, iş yapmak için modelleri, araçları ve insanları birbirine bağlayan bir sistemdir.
OpenAI'in teknik blog yazısı "Codex ajan döngüsünü açmak" (Ocak 2026, Michael Bolin), Codex harness'ini "tüm Codex deneyimlerinin temelini oluşturan çekirdek ajan döngüsü ve yürütme mantığı" olarak tanımlar (https://openai.com/index/unrolling-the-codex-agent-loop/ ).
Ajan döngüsü şu tekrarı ifade eder:
- Kullanıcı girdisini al
- Düşünmesi için modele sorgu gönder
- Modelin seçtiği aracı çalıştır
- Sonucu göster ve tekrar düşünmesini sağla
Bu döngüyü çalıştıran model değil, Codex tarafıdır.
Bir şirket benzetmesi kullanmak gerekirse:
Astra = Son derece yetenekli bir çalışanın beyni. Harness = O çalışanın çalıştığı şirketin kendisi. İşe alım kuralları, iç Wiki, çalışma prosedürleri, iç sistemlere erişim hakları, onay kuralları, denetim süreçleri ve iş arkadaşları.
Yaygın bir hata, "AGENTS.md = Harness" şeklinde tembelce özetlemektir. AGENTS.md, harness'in yalnızca bir parçasıdır. Tıpkı bir şirketin sadece dağıtılmış bir kural kitabıyla yönetilmemesi gibi.
Pratikte, AGENTS.md, Skills, MCP, Hooks, izin ayarları, yürütme ortamları, tarayıcı ve Subagents gibi unsurları birleştirerek "rahat bir çalışma ortamı" yaratma çabasının tamamına Harness Mühendisliği denir. Bu makale terimi bu anlamda kullanmaktadır.
Astra Sürümüyle Gerçekte Ne Değişti?
Üç şey değişti ve bunların hepsi OpenAI tarafından resmi olarak belirtildi.
- OpenAI beyni ve ortamı aynı anda geliştirdi
Astra duyurulduğunda OpenAI, Codex harness'ini güncellediklerini açıkça belirterek, Mind2Web tarayıcı işlem kıyaslamasında GPT-5.6 Sol ortamına kıyasla görev tamamlama hızının 1,9 kat arttığını bildirdi.
OSWorld 2.0'da Astra, GPT-5.6 Sol'un %65,7'sine kıyasla %72,6 puan aldı. Ayrıca, gerekli süre için simülasyon değerlendirmeleri, görev başına yaklaşık 75 dakikadan yaklaşık 40 dakikaya bir düşüş olduğunu bildirdi.
Burada dikkatli olunmalıdır: bunlar OpenAI'in kendisi tarafından yayınlanan rakamlardır ve belirli koşullar altındaki kıyaslama sonuçlarıdır. Sizin ortamınızda 1,9 kat daha hızlı olacağının garantisi yoktur.
Ancak çıkarılacak ders açıktır: hız artışları yalnızca modelden değil, model ve yürütme ortamının birleşiminden geldi.
- Astra "çevresel talimatları" çok daha iyi okuyor
Bu, pratik çalışma için en etkili değişikliktir.
OpenAI'in model rehberliği, Astra'nın daha güçlü talimat takip yeteneklerine sahip olmakla birlikte, Skills ve AGENTS.md gibi dosyalarda bulunan talimatlara karşı daha hassas olabileceğini belirtir. Skills ve modelin erişebildiği diğer dosyaların denetlenmesini şiddetle tavsiye eder (https://developers.openai.com/api/docs/guides/latest-model ).
Aynı belge daha spesifik bir uyarı içerir: bir skill dosyasındaki net olmayan veya çelişkili talimatlar, modelin erken bir aşamada durmasına ve işi bloke etmesine neden olabilir.
Durum şudur:
Beyin daha akıllı hale geldi. Bu nedenle, hem iyi hem de kötü kurallara eskisinden daha sadık hale geldi.
Geçen yıldan beri eklemeler yaptığınız bir AGENTS.md dosyasında gereksiz bir cümlenin kaldığını varsayalım. Sol bunu uygun şekilde görmezden gelebilirdi. Astra buna harfiyen uyacaktır.
- Yetkilendirme ve bellek yönetimindeki değişiklikler
Resmi duyuruya göre Astra, Codex içindeki bağlam pencereleri arasında not tutarak, biriken ayrıntıları her seferinde tek bir özete sıkıştırma ihtiyacını ortadan kaldırabilir. Bu, uzun görevler sırasında bilgi kaybını azaltır.
Ancak, 7 Eylül 2026 itibarıyla bu deneysel bir özelliktir. config.toml dosyasında açıkça etkinleştirilmesi gerekir ve varsayılan olarak kapalıdır. OpenAI, önümüzdeki haftalarda bunun varsayılan bir Astra özelliği haline geleceğini duyurdu, ancak şimdilik ayarı kendiniz eklemediğiniz sürece çalışmayacaktır.
Öte yandan, model rehberliği ayrıca Astra için "Subagent'lara yetkilendirmenin, iş akışınızın beklediği kadar sık olmayabileceğini" belirtir. Bu, paralelleştirme istiyorsanız, harness tarafında ne zaman yetkilendirme yapılacağını belirtmeniz gerektiği anlamına gelir.
Rehberlik ayrıca Astra'nın ayrıntılı, biçimlendirilmiş yanıtlara yöneldiğini, bu nedenle gerekli stili ve yapıyı belirtmeniz gerektiğini belirtir.
Tüm bunlar şu noktaya işaret ediyor: "Model akıllı diye onu kendi haline bırakmayın," aksine "Akıllı olduğu için tam olarak belirtildiği gibi hareket edecektir, bu yüzden belirtimlerinizi düzeltin."
Harness'in 8 Öğeli Haritası
Burada listelenen 8 öğe ve daha sonra açıklanan 7 olgunluk seviyesi, resmi OpenAI tanımları değildir. Şu ana kadar görülen resmi bilgilere dayanarak bu makale için benzersiz bir şekilde düzenlenmiştir. Bunları pratik bir çerçeve olarak kullanın.
İşte şirket benzetmeleri ve öncelikleriyle birlikte harita:
- AGENTS.md | İşe Alım Kuralları ve Temel Politika | Öncelik: En Yüksek
- docs / Context | İç Wiki ve Kılavuzlar | Öncelik: Yüksek
- Skills | Standart Çalışma Prosedürleri | Öncelik: Yüksek
- MCP / Plugins | İç Sistemlere Bağlantı | Öncelik: Orta
- Environment | PC, Masa, Çalışma Ortamı | Öncelik: Yüksek
- Permissions / Sandbox | Yetki ve Onay Kuralları | Öncelik: En Yüksek
- Hooks / Tests | Otomatik Kontroller ve Denetimler | Öncelik: Orta
- Browser / Subagents | Gözler, Eller, Astlar | Öncelik: Orta
Yeni başlayanlar 1 ve 6 ile başlamalıdır. Nedeni basit: sadece bu ikisini düzenleyerek diğer öğeler için temeli sağlamlaştırırsınız. Ancak bu, diğerlerini kontrol etmemeniz gerektiği anlamına gelmez. MCP üzerinden bağlanılan harici servislerin izinleri, Skills'teki prosedürler ve Hooks tarafından yürütülen betiklerin tümü güvenlik doğrulamasına tabidir. Özellikle MCP dışarıya bir bağlantı olduğu için, hedefin güvenilir olup olmadığını ve verilen izinlerin minimum düzeyde olup olmadığını ayrıca kontrol edin.
Aşağıda her birinin açıklaması bulunmaktadır.
Talimat ve Bilgi Katmanı | AGENTS.md, docs, Skills
AGENTS.md
Nedir: Deponun köküne yerleştirilen bir işaretleme dosyası. Codex, çalışmaya başlamadan önce onu okur ve projeye özgü kurallar olarak ele alır.
Ne işe yarar: "Testleri her zaman bu komutla çalıştır" veya "Bu dizine dokunma" gibi ön koşulları her komutta yazmaktan kurtulursunuz.
Hemen hemen herkesin yaptığı başarısızlık, aşırı doldurmadır.
OpenAI'in teknik blog yazısı "Harness mühendisliği: Codex'i ajan-ilk dünyada kullanmak" (11 Şubat 2026, Ryan Lopopolo), iç başarısızlıkları anlatır. Devasa bir AGENTS.md denemesi, bağlam baskısına, eski kuralların kalmasına ve neyin önemli olduğu konusunda kafa karışıklığına yol açtı (https://openai.com/index/harness-engineering/ ).
Ekip, AGENTS.md'yi yaklaşık 100 satırlık bir "harita" olarak çalıştırmaya geçti. Ayrıntılar docs altına yerleştirilir ve AGENTS.md sadece onlara işaret eder.
Yeni yetenekli bir çalışana 1000 sayfalık bir kural kitabı ezberletmek yerine, "Takılırsan bu rafa bak" diyen bir rehber harita verirsiniz. Fark budur.
Bağlam sınırlı bir kaynaktır. Devasa talimat dosyaları, görevin kendisini veya okunacak kodun yerini dışarı iter.
Harita tarzı bir AGENTS.md genellikle şöyle görünür:
▼ Buradan kopyalayın
AGENTS.md
Bu proje nedir?
(1-3 satır. Ne yapıyorsunuz, kim kullanıyor?)
Önce bunları okuyun
- Tasarım Politikası: docs/architecture.md
- Dizin Yapısı: docs/structure.md
- Sözlük: docs/glossary.md
- Geçmiş Başarısızlıklar ve Düzeltmeler: docs/postmortems.md
Uyulması gereken kurallar
- Testler: Tümünü (gerçek komut) ile çalıştırın ve başarısızlıklar varken tamamlandı olarak bildirmeyin.
- Yasak alanlar: (Yolları listeleyin)
- Commit'ten önce: (linter / formatter komutları)
Tamamlanma Tanımı
Yalnızca aşağıdakilerin tümü karşılandığında "Tamamlandı" olarak bildirin:
- Testler geçiyor
- Değişikliğin amacı bir paragrafta açıklanabiliyor
- İstenmeyen yan etkiler için kendi kendine doğrulama yapıldı
Emin olmadığınızda
Varsayımda bulunmayın; en az iki seçenek sunun ve bana sorun.
Talimat Önceliği
- Benim (kullanıcının) anlık talimatlarım
- Bu AGENTS.md
- Skills'teki prosedürler Daha yüksek öncelikli olanlarla çelişen düşük öncelikli talimatları yok sayabilirsiniz. Bir talimatı atlarsanız, adını bildirin.
▲ Buraya kopyalayın
Sondaki "Talimat Önceliği" özellikle Astra ve sonraki modeller için etkilidir. Model rehberliği, kullanıcı talimatlarının mı yoksa skill talimatlarının mı öncelikli olduğunun netleştirilmesini açıkça belirtir.
docs / Context
Nedir: AGENTS.md tarafından başvurulan gerçek bilgi deposu. Tasarım belgeleri, mimari diyagramlar, sözlükler, geçmiş karar kayıtları vb.
Ne işe yarar: Codex bunları yalnızca gerektiğinde okur, bu nedenle sürekli olarak bağlam tüketmezler.
Harness Mühendisliği makalesinde dikkat çekici olan, yavaş ilerlemenin açıklamasıdır. Bunun nedeni Codex'in yetenek eksikliği değil, "ortamın yeterince belirtilmemiş olmasıydı."
Eksik olan şeyler, Codex'in okuyabileceği biçimde araçlar, soyutlamalar, iç yapılar ve bilgilerdi.
Bu nedenle bir şey başarısız olduğunda, ekibin tepkisi "daha çok denemesini sağlamak" değildi. "Hangi yetenek eksik ve bunu ajan için nasıl okunabilir ve uygulanabilir hale getirebiliriz?" diye düşünmekti.
Harness mühendisliğinin özü budur. Komutu değil, ortamı düzeltin.
Açıklığa kavuşturmak gerekirse, bu bir iç OpenAI vaka çalışmasıdır. 3 kişilik bir ekip, 5 ayda insan tarafından yazılmış 0 satır kodla yaklaşık 1 milyon satır ve 1.500 PR üretti; bu, genel kullanıcıların aynı sonuçları tekrarlayabileceği anlamına gelmez.
Skills
Nedir: SKILL.md formatında bir dosya. Belirli görevleri her seferinde aynı prosedürle yürütmek için gerekirse talimatları, referans materyallerini ve betikleri bir araya getirir.
Ne işe yarar: İyi komutları kopyalayıp yapıştırmaktan, işin kendisini kaydetmeye geçebilirsiniz.
Örneğin, "Makale Oluşturma"yı bir Skill haline getirirseniz, içerik şöyle olur:
- Araştırma
- Doğrulama
- Başlık önerileri
- Yapı tasarımı
- Yazma
- Yasaklı ifade kontrolü
- Son inceleme
Astra ve sonrası için uyarı, çok fazla eklememektir. Skill adları ve açıklamaları bağlama yüklenir, bu nedenle sayı artarsa açıklamalar kısaltılır ve hangisinin seçileceğine karar vermek zorlaşır. Açıklamalar çelişiyorsa veya hepsi "Beni kullan" diyorsa, model göreve uymayan bir Skill yükleyebilir.
Skill'ler "yalnızca belirli görevler için gereken prosedürler" içindir, "her seferinde ihtiyaç duyulan talimatlar" değil. Bunu karıştırmak, her şeyi AGENTS.md'ye yazmakla aynıdır.
Eller ve Ayaklar Katmanı | MCP, Plugins, Environment
MCP / Plugins
Nedir: MCP, Codex'i harici araçlara ve verilere bağlamak için bir standarttır ve hem CLI hem de IDE uzantılarında kullanılabilir. Plugins, Skills, Connectors ve MCP araçlarını birlikte dağıtmak için bir mekanizmadır. Codex'te ChatGPT masaüstü uygulamasında ve CLI'de bulunurlar, ancak IDE uzantılarında bulunmazlar.
Ne işe yarar: Codex'in harici belgelere, tarayıcılara, tasarım araçlarına vb. erişmesini sağlar.
Astra ne kadar akıllı olursa olsun, gerekli bilgiye ulaşamıyorsa bir anlamı yoktur. İç sistem hesabı olmayan parlak bir çalışan gibidir.
Ancak, önceliği Orta olarak belirledim. Ne kadar çok MCP eklerseniz, araç seçenekleri o kadar artar ve bağlam tüketilir. Doğru yaklaşım, yalnızca şu anda ulaşmakta zorlandıklarınızı eklemektir.
Environment
Nedir: Bağımlılıklar, kurulum prosedürleri, test yürütme yöntemleri ve çalışma dizini yapıları gibi fiilen harekete geçmek için gerekli iskele.
Ne işe yarar: Codex, "çalıştırma ve doğrulama" noktasına kadar kendi kendine ilerleyebilir. Bu eksikse, Codex sadece bir kod yazıcısı olmaya geri döner.
Bunu kontrol etmenin basit bir yolu, temiz bir durumdan "Kurulum yap, testleri geç ve sonuçları raporla" diye sormaktır. Durduğu her yer, tam olarak eksik olan şeydir.
Her görev için dizinleri ayırmak üzere Git worktree kullanmak, birden çok paralel görevin çarpışmasını zorlaştırır.
Güvenlik ve Denetim Katmanı | Permissions, Sandbox, Hooks
Permissions / Sandbox
Nedir: Codex'in ne kadarını otomatik olarak yürütebileceğini belirleyen iki bağımsız ayar. Sandbox, dosyaların ve ağların erişim alanını belirlerken, onay politikası, insan onayının nerede isteneceğini belirler.
Resmi Codex belgelerine göre, CLI ve IDE uzantıları için ilk ayarlar, ağ erişimi olmaması ve yalnızca etkin çalışma alanı içinde yazma ile sınırlıdır (https://developers.openai.com/codex/sandbox ).
Sandbox'ın 3 seviyesi vardır:
- read-only: Okuyabilir ancak yazamaz. Danışma ve planlama için.
- workspace-write: Çalışma klasörü ve geçici dizinler içinde yazabilir. Standart olan budur.
- danger-full-access: Her yere yazabilir. Sandbox'ı etkili bir şekilde kaldırır.
Yaygın olarak kullanılan Auto ön ayarı, workspace-write ve "yalnızca gerektiğinde onay iste" kombinasyonudur. Codex, çalışma alanı dışında düzenleme yapmaya veya ağa dokunmaya çalıştığında durup kontrol edecektir.
Oturum sırasında geçiş yapmak isterseniz /permissions komutunu kullanabilirsiniz. Planlama aşaması için read-only ve yürütme aşaması için Auto, gerçekçi bir işletim şeklidir.
Anlamanızı istediğim şey, özerkliğin her şeye izin vermek anlamına gelmediğidir.
Onaylar can sıkıcı diye danger-full-access'e kaçmak en az etkili çözümdür. Sadece belirli bir dizine yazması gerekiyorsa, sadece o konuma izin verin.
▼ Buradan kopyalayın
【Codex CLI: Planlama ve Çalışma için Yapılandırma Örnekleri】
Hedef, Codex CLI 0.134.0 veya sonrasıdır.
Ayarlar üç dosyada kaydedilir: "Ortak," "Planlama" ve "Çalışma."
Bu açıklamanın tamamını tek bir yapılandırma dosyasına yapıştırmayın. Yalnızca ilgili ayarları ilgili hedefe yazın.
Hedefler, standart Codex ayarları içindir.
■ 1. Ortak Ayarlar
Yol: ~/.codex/config.toml
Mevcut ayarları silmeyin; aşağıdaki öğeleri ekleyin veya değiştirin. Aynı [sandbox_workspace_write] varsa, yinelenen başlıkları önlemek için içini düzenleyin.
[sandbox_workspace_write]
network_access = false
Yalnızca gerekirse ek onaylı dizinleri belirtin.
writable_roots = ["/absolute/path/to/approved-directory"]
Yalnızca ek yazma hedefleri gerekiyorsa, writable_roots satırının başındaki # işaretini kaldırın ve örnek yolu gerçek mutlak yolla değiştirin.
■ 2. Planlama Ayarları
Yol: ~/.codex/plan.config.toml
Bu iki satırı ortak ayarlardan ayrı bir dosyaya kaydedin.
approval_policy = "on-request"
sandbox_mode = "read-only"
■ 3. Çalışma Ayarları
Yol: ~/.codex/work.config.toml
Bu iki satırı başka bir ayrı dosyaya kaydedin.
approval_policy = "on-request"
sandbox_mode = "workspace-write"
■ Nasıl kullanılır
Başlatma komutunu yapılandırma dosyasına yazmayın; proje klasöründe terminalden çalıştırın.
Planlama için başlatmak üzere:
codex --profile plan
Çalışma için başlatmak üzere:
codex --profile work
Seçilen profil ayarları, ortak ayarların üzerine katmanlanacaktır.
Proje tarafı ayarları ve kurumsal kısıtlamalar da geçerli olduğundan, başlatma sonrasında /permissions ile gerçek izinleri kontrol edin.
Not: network_access = false, sandbox içinde çalıştırılan komutların iletişim ayarıdır. MCP gibi harici bağlantıların izinlerini ayrıca kontrol edin.
▲ Buraya kopyalayın
Bir sınırı bir birim genişletmek, sınırın kendisini atmaktan tamamen farklıdır. Aynısı ağ erişimi için de geçerlidir; bu, yalnızca bağımlılık paketlerini getirmesi gereken projeler için geçerli bir karardır.
Hooks / Tests
Nedir: Codex işlemesinin ortasına kendi betiklerinizi veya MCP araçlarınızı eklemek için bir mekanizma. Varsayılan olarak Kararlı bir özellik olarak etkindir.
Ne işe yarar: Örneğin, bu otomasyonlar:
- Bir aracı çalıştırmadan hemen önce tehlikeli komutları durdurmak
- API anahtarları gibi sırları denetlemek
- Bir dosyayı düzenledikten hemen sonra bir linter çalıştırmak
- Çalışmanın sonunda testlerin geçtiğini doğrulamak
"Hata yapmamaya dikkat et" anlayışını "hata varsa sistem durur" anlayışına dönüştürmekle ilgilidir.
Ancak OpenAI'in kendisi, Hooks'ların mutlak uygulama sınırları değil, korkuluklar olarak ele alınması konusunda uyarır, çünkü Codex eşdeğer işi farklı araç yollarıyla gerçekleştirebilir.
Gerçekten durdurulması gereken şeyler, Hooks'ta değil, sandbox ve izin seviyesinde durdurulmalıdır. Hooks, üzerine yerleştirilen ikinci ağdır.
Gözler ve Ekip Katmanı | Browser, Subagents
Browser / Computer Use
Bir web sitesi oluşturup "Kodu yazdım, bitti" ile bitirmek israftır.
Not: Burada açıklanan Computer Use (gerçek ekran işlemi) şu anda Codex'in masaüstü uygulama sürümü için bir özelliktir. Bu bölümde ele alınan yerleşik Browser / Computer Use, ChatGPT masaüstü uygulamasında kullanılır. Yerleşik Browser, Codex CLI veya IDE uzantılarında mevcut değildir. CLI/IDE'de tarayıcı işlemleri için MCP veya Playwright gibi başka mekanizmalar hazırlayın.
Bunu yapmasını sağlamalısınız:
- Tarayıcıyı aç
- Gerçek ekranı göster
- Çalıştırmayı dene
- Bozuk kısımları bul
- Onları düzelt
- Tekrar kontrol et
Astra, bilgisayar işlem kıyaslamalarında önemli ölçüde gelişmiş bir nesildir, bu nedenle bu süreci devretmeye değer. OSWorld 2.0'da sürenin 75 dakikadan 40 dakikaya düştüğü raporu tam olarak bununla ilgilidir.
Harness Mühendisliği vaka çalışmasında, Codex'in hata tekrarından düzeltmeye ve doğrulamaya kadar her şeyi halletmesi için Chrome DevTools Protocol, DOM, ekran görüntüleri, günlükler ve metrikleri işleyebileceği bir ortam yarattılar.
Subagents
Nedir: Codex'in işi birden çok alt ajan arasında bölmesini sağlayan bir mekanizma. Her birinin bağımsız bir bağlamı vardır.
Ne işe yarar: Araştırma, test etme, günlük analizi ve özetleme gibi okuma ağırlıklı, bağımsız görevleri paralelleştirir.
İki uyarı:
Birincisi, birden çok ajanın aynı kodu aynı anda yazması çakışacaktır. Yazma görevlerini paralelleştirirken dikkatli olun.
Diğeri ise token tüketiminin artmasıdır. Hızlanır, ancak daha ucuz olmaz.
Ve Astra'ya özgü olarak, model rehberliği yetkilendirme sıklığının beklenenden daha düşük olabileceğini söyler. Paralelleştirme istiyorsanız, AGENTS.md veya komutlarda açıkça belirtin: "Araştırma görevlerini bölebilir ve paralel olarak çalıştırabilirsiniz."
Astra Dönemi Tersine Dönüşü | Ekleme Değil, Envanter Çıkarma
8 öğe listeledim, ancak iletmek istediğim en önemli şey tam tersi.
Astra için yapılacak ilk şey, mevcut talimatların bir envanterini çıkarmaktır. OpenAI ayrıca modelin başvurduğu Skills ve AGENTS.md gibi talimatların denetlenmesini önerir. Gerekli talimatları koruyun, boşlukları doldurun ve eski/çelişkili olanları doğrulamadan sonra düzeltin veya azaltın.
OpenAI rehberliğinde kullanılan fiil "eklemek" değil, "denetlemek"tir.
Astra'yı önceden doğrulayan ekiplerden gelen raporlar aynı yöne işaret ediyor. Bir AI kodlama aracı sağlayıcısı olan Kilo, bir incelemede Astra'nın açıkça daha az AGENTS.md iskelesi gerektirdiğini ve geçen yıl boyunca biriktirilen "modeli yoldan çıkarmamak için" talimatların çoğunun artık gereksiz olduğunu yazdı. Hatta şişmiş bir ajan dosyanız varsa, yarısını silip tekrar denemenizi önerdiler (https://blog.kilo.ai/p/gpt-6-astra-what-we-learned-previewing ).
Bu, bir şirketin izlenimidir, resmi bir görüş değildir. Ancak, "çelişkili talimatların erken durmalara neden olabileceğini" belirten resmi rehberlikle mükemmel bir şekilde örtüşmektedir.
Model ne kadar akıllıysa, eski talimatlara o kadar takılır. Paradoksal, ama doğru.
Envanter çıkarma, en hızlı Codex'in kendisi tarafından yapılır.
▼ Buradan kopyalayın
Lütfen bu depodaki AGENTS.md'yi, docs altındaki her şeyi ve yüklenmiş tüm Skill dosyalarını oku. Henüz değişiklik yapma.
GPT-6 Astra ile çalışmayı varsayarak, aşağıdakileri sınıflandır ve raporla:
【Tutulacaklar】 Hala geçerli olan ve aslında karar verme yeteneğini geliştiren talimatlar. Nedenini tek satırda açıkla.
【Silinme Adayları】 Aşağıdakilerden herhangi birine giren öğeler. Orijinal metni alıntıla ve bir neden belirt. Bu bir silme kararı değil, insanın değerlendirmesi için bir listedir.
- Önceki nesil modelleri yönlendirmek için yazılmış, artık gereksiz olan talimatlar.
- Zaten değişmiş olan belirtimlere, yollara veya komutlara işaret eden talimatlar.
- Sana söylenmeden doğal olarak yaptığın şeyleri yapmanı emreden talimatlar.
- Diğer talimatlarla çelişen talimatlar.
Ancak, talimatın güvenlik, emniyet veya geçmiş kazalar/olaylar nedeniyle eklenmiş olma ihtimali varsa, bunu 【Silinme Adayı】 olarak sınıflandırmayın. Bunun yerine, ayrı bir 【İnsan Yargısı Gerektirir】 kategorisine koyun ve bu ihtimalin neden var olduğunu düşündüğünüzü açıklayın. Kendi yargınıza dayanarak "gereksiz" olduğu sonucuna varmayın.
【Yeniden Yaz】 Niyeti doğru ancak ifadesi belirsiz, gereksiz veya önceliği net olmayan talimatlar. Bir yeniden yazma önerisi sunun.
【Sorular】 Okurken anlamını yargılamakta zorlandığınız açıklamalar.
Son olarak, aşağıdaki iki noktayı bildirmeyi unutmayın:
- Sizi fiilen engelleyen veya tereddüt etmenize neden olan talimatlar varsa, tam satırı ve neden tereddüt ettiğinizi belirtin.
- AGENTS.md yaklaşık 100 satırlık bir dizine indirgenecek olsaydı, hangi yapıyı kullanırdınız?
▲ Buraya kadar kopyala
Ortaya çıkan "Silinme Adayı" listesi tamamen silinmemelidir. Öncelikle, bu talimatın neden eklendiğini, geçmişini ve kaldırılırsa neyi etkileyeceğini kontrol edin. Geçmiş kazalardan sonra eklenen doğrulama prosedürleri, sırf Codex onları "mevcut benliği için gereksiz" olarak değerlendirdi diye kaldırılmamalıdır. Özellikle güvenlik veya emniyet talimatları için, son kararı geçmişi bilen kişi vermelidir. Yalnızca eklenme nedeni doğrulanan ve etkisinin sınırlı olduğu değerlendirilen öğeler için silme işlemine devam edin. Şüpheye düşerseniz, talimatı koruyun. docs klasörüne taşıyorsanız, gerektiğinde AGENTS.md'den güvenilir bir şekilde başvurulabilmesi için net bir yol bırakın.
Olgunluk | Şu Anda Neredesiniz?
Kendi seviyenizi kontrol edin.
Seviye 0: Her seferinde prompt yazmak. Her sabah yetenekli bir çalışana her şeyi sıfırdan anlatmak gibi.
Seviye 1: AGENTS.md ve docs mevcut. Kuralları ve kılavuzları olan bir şirket gibi.
Seviye 2: Skill'ler mevcut. Rutin işler için prosedürler belirlenmiş.
Seviye 3: MCP ve Eklentiler bağlı. Gerekli sistemlere bağımsız olarak erişebilme.
Seviye 4: İzinler, Hook'lar ve Testler çalışıyor. Otomatik yürütme ve otomatik denetim mevcut.
Seviye 5: Tarayıcı ve Alt Ajanlar kullanılıyor. Bağımsız olarak doğrulayabilme ve iş devredebilme.
Seviye 6: Geri bildirim döngüsü mevcut. Her başarısızlıkta sistemin kendisi güncelleniyor.
Birçok kişi Seviye 1'de. Ve AGENTS.md'yi kalınlaştırarak ilerlemeye çalışıyorlar. Bu Seviye 2 değil; sadece şişirilmiş bir Seviye 1.
Seviye 6 doğası gereği farklıdır. Yeni özellikler eklemekle ilgili değildir. Sadece şu işletim kuralına sahip olmakla ilgilidir: "Aynı hata iki kez yapılırsa, bu düzeltmeyi AGENTS.md, Skill, Hook veya Test'e geri besle."
OpenAI'nin Harness Engineering makalesinde "tek seferlik doğrulama yerine sürekli düzeltme"ye doğru ilerlediği nokta burasıdır.
Yürütme Sırası | 30 Dakika, 1 Gün, 1 Hafta
Önceliklendirin. Bunları sırayla yapın.
İlk 30 Dakika
- Bu makalenin başındaki tanılama promptunu çalıştırın.
/permissionsile mevcut izin ayarlarını kontrol edin. Düzenli olarakdanger-full-accesskullanıyorsanız, önceworkspace-write'a geri dönün.- AGENTS.md'yi açın ve okuyun. Gereksiz, çelişkili veya güncelliğini yitirmiş açıklamaları kontrol edin. 100 satır, yalnızca dahili bir OpenAI örneğidir, mutlak bir standart değildir. Satır sayısından ziyade içeriğin düzenli olup olmadığına bakın.
1 Gün
- Envanter promptunu çalıştırın. 【Silinme Adaylarını】 yalnızca eklenme nedenini ve etkisini onayladıktan sonra silin. 【İnsan Yargısı Gerektirir】 için, geçmişi bilen biriyle kontrol ettikten sonra karar verin.
- Silinen içeriğin değerli kısımlarını
docsklasörüne taşıyın. - AGENTS.md'nin sonuna "Talimat Önceliği" ekleyin.
- Temiz bir durumdan "Testleri kur ve geç" diye isteyin ve nerede durduğunu kaydedin.
1 Hafta
- Haftada ikiden fazla yaptığınız bir görevi seçin ve onu bir Skill'e dönüştürün.
- Ulaşmakta zorlandığınız harici bir veri kaynağı varsa, onu MCP üzerinden bağlayın.
- Gizli bilgi kontrolü veya düzenleme sonrası linter çalıştırmasından birini bir Hook haline getirin.
- Geri bildirim için başarısızlıkları kaydedeceğiniz bir yer belirleyin.
Bu noktaya kadar, Seviye 1'den Seviye 4'ün girişine ulaşmış olacaksınız.
Tersine Dizin | Amaca Göre
Aynı açıklamayı tekrarlamayı bırakmak istiyorum → AGENTS.md
Codex eski bilgilere başvuruyor → docs / Context envanteri
Aynı görevin kalitesi dalgalanıyor → Skill'ler
Gerekli verilere ulaşılamıyor → MCP / Eklentiler
Kod yazabiliyorum ama doğrulamaya geçemiyorum → Ortam
Kendi başına hareket etmesinden korkuyorum veya çok fazla onay var → İzinler / Sandbox
Aynı hata tekrarlanıyor → Hook'lar / Testler
Düzen bozulmalarını fark etmiyorum → Tarayıcı / Bilgisayar Kullanımı
Araştırma çok uzun sürüyor → Alt Ajanlar
Astra'ya geçtikten sonra görevin ortasında durmaya başladım → Önce durdurma bildirimlerini, onay taleplerini ve hataları kontrol edin. Gerekirse, CLI'da /status ile ayarları ve kullanımı kontrol edin. Çelişkili talimatlardan şüpheleniliyorsa, AGENTS.md ve Skill'lerin envanterini çıkarın.
Bir Sonraki Rekabet Ortam, Zeka Değil
Model seçme oyunu çoğunlukla bitti.
Astra yeterince akıllı ve tam olarak talimat verildiği gibi hareket ediyor. Bu nedenle, talimat olarak bıraktığınız şey sonucu belirler.
Prompt'ları iyi yazma oyunundan, çalışma ortamlarını iyi tasarlama oyununa. Astra bu geçişi sonlandıran modeldir.
Bugün yapmanız gereken tek bir şey var. AGENTS.md'yi açın ve okuyun. Başlangıç noktası burasıdır.
Buraya kadar okuduğunuz için teşekkür ederim.
ChatGPT, Claude ve Copilot kullanarak zaman tasarrufu ve AI yan işleriyle ilgili spesifik örnekleri ücretsiz bir açık sohbette paylaşıyorum. "AI kullanabilen" tarafta olmak istiyorsanız, hemen katılın.





