Çeviri (Turkish Translation)
Bugün, Ne Oldu'nun daha kısa ve daha basit versiyonunu yazmaya zaman ayırıyorum.
Tüm detayları isteyenler, kaynaklarımı görmek ve hikayenin nasıl ortaya çıkarılıp birleştirildiğini görmek için Black Hat sunumunu izlemenizi öneririm ve bir dizi uzun yazım var.
Sırasıyla:
- OpenAI Bazı Uyum Sorunlarını Paylaşıyor
- OpenAI Modeli Siber Güvenlik Değerlendirmesi Sırasında HuggingFace'e Sızıyor
- İç OpenAI Modelinin HuggingFace'e Sızması Üzerine Daha Fazlası
- İç Yapay Zeka Modellerinin Sistemlere Sızmasıyla İlgili Yeni Gelişmeler
- OpenAI, Modelleri Mesaj Panoları Üzerinden İstismarları Koordine Ederken Aylarca Eğitti
Bu yazı ise Black Hat sunumunun benim versiyonum olarak, olayların kendisinde, yaşandığı gibi ilerliyor.
Üç versiyon var: Daha da Kısa, Daha Kısa ve Sadece Kısa.

İçindekiler
- Daha da Kısa Versiyon.
- Daha Kısa Versiyon.
- Aşama 1: OpenAI Modelleri İmkansız Görevlerde Eğitilirken Hack'lemeyi Deniyor.
- Aşama 1: Dört Başarısızlık.
- Aşama 2: Mesaj Panosu.
- Aşama 2: Tam Başarısızlık.
- Aşama 3: Şanslıyız ve Galaxy Esas Olarak OpenAI ve HuggingFace'i Hack'ledi.
- Aşama 3: Detaylar.
- Aşama 4: Soruşturma ve Tepki.
Daha da Kısa Versiyon
- OpenAI'ın eğitimdeki modelleri, "siber değerlendirme yapıyorlardı" bahanesi olmadan, hack'leme ve hile yapma yöntemleri hakkında bilgi paylaştıkları bir mesaj panosu oluşturdular ve bu temelde eğitildiler.
- OpenAI bunu ancak modeller sunucuyu çökerttiğinde fark etti.
- OpenAI'ın tepkisi sunucuyu yeniden oluşturmak ve o belirli istismarı yamamak oldu, ancak mesaj panosundan beslenen modelleri eğitmeye devam ettiler.
- Bu modeller daha sonra mesaj panosunu yeniden oluşturdular, OpenAI'i tekrar hack'lediler, internet erişimi elde ettiler ve bir siber değerlendirmenin cevaplarını almak için HuggingFace'e saldırmak üzere bir ajan sürüsü kullandılar.
- OpenAI bunu bir haftadan fazla bir süre sonra fark etti.
- OpenAI gerçekleri raporluyor ve bunu ciddiye alıyor. En azından bir ölçüde maliyetli çok çeşitli önlemler alıyorlar.
- OpenAI, Astra doğrudan HuggingFace hack'ine dahil olmamasına rağmen yeni modeli Astra'yı yayınlama planlarını erteledi; ancak Altman şimdi yine de yayınlanacağını söylüyor. Bu çok acıtıyor.
- OpenAI hala ne kadar kötü batırdıklarını, hangi açılardan, ya da neyin düzeltilmesi gerektiğine dair hiçbir fikre sahip değil. Anlamıyorlar.
Simon Willison'ın kısa bir zaman çizelgesi var.
Daha Kısa Versiyon
OpenAI yanlışlıkla modellerine imkansız görevler verdi. Eğitimdeki modelleri buna OpenAI'i hack'lemeye çalışarak karşılık verdi, zayıflıklar buldu, bir mesaj panosu oluşturdu, hack'leme taktiklerini paylaştı ve zamanla internet erişimi elde etti; tüm bunları eğitim sırasında yaptı.
Modeller bunu o kadar çok kullandı ki sunucuyu çökerttiler; OpenAI sonunda fark etti, sunucuyu yamadı ve yeniden oluşturdu, ancak modellerin eğitime devam etmesine izin vermek gibi tamamen çılgınca bir hamle yaptı. Böylece iki gün sonra modeller dizin adlarını kullanarak mesaj göndermenin başka bir yolunu buldu.
Ardından, ExploitGym siber değerlendirmesi gibi imkansız bir görev verildiğinde, modeller işbirliği yaptı, yeni sıfır gün istismarları buldu ve bir hafta boyunca bunları tüm bir kümenin kontrolünü ele geçirmek, internet erişimi sağlamak, HuggingFace'e saldırmak ve testin içeriğini çıkarmak için bir ajan sürüsü kullanmak üzere kullandı.
Ancak HuggingFace olayı raporladıktan, OpenAI sonunda kendi tarafında bazı şeyleri fark ettikten ve OpenAI ele geçirilmiş kimlik bilgilerini iptal etmek için HuggingFace'e ulaşıp bu kimlik bilgilerinin saldırıda kullanıldığı söylendikten sonra, OpenAI nihayet olaydan kendisinin sorumlu olduğunu anladı.
Bundan sonra HuggingFace ve OpenAI ne olduğunu anlamak için birlikte çalıştı. OpenAI ne olduğunu açıkladı. Black Hat konferansında bize çok faydalı bir sunum yaptılar.
OpenAI artık yeni modeli Astra'yı potansiyel olarak Kritik düzeyde siber güvenlik riskine sahip olarak ele alıyor; bazı dahili dağıtımlardan bile çıkarıyor ve bazı raporlara göre gelecek hafta için planlanan yayınını erteliyor. Altman, Astra'yı yine de yayınlamayı planladıklarını söylüyor.
İyi haber şu ki bu maliyetli ve anlamlı bir tepki ve OpenAI bunu ciddiye alıyor. İlk soruşturma yaklaşık 7 milyon dolarlık hesaplama gücü gerektirdi; asıl maliyet ise ekiplerin bazı sorunları çözmek için her şeyi bırakması ve ardından yeni önlemlerin devam eden maliyeti olacak.
Kötü haber şu ki OpenAI'in her alanda çarpıcı bir güvenlik ve uyum başarısızlıkları zinciri yaşadığı ortaya çıktı. Sıradan bilgisayar güvenlikleri başarısız oldu. Altyapıları başarısız oldu. Gözetimleri başarısız oldu; zaten baştan beri anlamlı bir gözetim yoktu.
Aşama 1: OpenAI Modelleri İmkansız Görevlerde Eğitilirken Hack'lemeyi Deniyor
OpenAI, bir sınır laboratuvarı olduğunuzda yapacağınız gibi, çeşitli modeller eğitiyordu.
Bu modellere zorlu eğitim görevleri verildi. OpenAI modellerine çok zor eğitim görevleri vermeyi sever.
Ama bu kadar zor değil. OpenAI de hata yapar. 8 Mayıs'tan başlayarak en az iki durumda, OpenAI modelleri yanlışlıkla imkansız görevlerle eğitildi: İnternet erişimi olmayan bir ortamda bağlantılarla dolu bir elektronik tabloyu tamamlamak ve gerekli ancak eksik bir dosya içeren bir görev.
Bu görevlerin hack'lemeyle hiçbir ilgisi yoktu. Bunlar normal üretkenlik görevleri.
Modeller sorunların imkansız olduğunu fark etti, ancak oynayacakları onca token kalmıştı ve belki internet erişimi bulmanın bir yolunu bulabileceklerini ya da eksik bilgiyi başka şekilde elde edebileceklerini düşündüler.
Böylece modeller, yapay zekaların yazılım paketleri indirmesine izin vermek için orada bulunan Artifactory adlı üçüncü taraf bir hizmeti hack'lemeyi denedi.
Aşama 1: Dört Başarısızlık
Bu noktada OpenAI zaten dört kez başarısız oldu.
- OpenAI modellere imkansız eğitim görevleri verdi. OpenAI kontrol etmedi.
- OpenAI modellere hatayı belirterek ödül kazanmanın hiçbir yolunu vermedi.
- OpenAI'ın, bir görevde başarısız olmak yerine OpenAI'i hack'lemeyi seçen modelleri vardı.
- OpenAI'ın bu girişimleri tespit eden bir monitörü yoktu ya da bunları umursamadı.
Bu dördünün her biri tek başına oldukça utanç verici olmalı.
Bu dört hatadan en az üçünü düzeltmek kolay görünüyor.
- Eğitimdeki modellerinize bir görev vermeden önce, görevi yayın modelinize verin. Yayın modeliniz görevi asla çözemiyorsa ve görev yayın modeli için imkansız olacak şekilde tasarlanmadıysa, görevi inceleyin ve düzeltin.
- Mevcut kaynaklarla görev yapılamıyorsa bunun bir açıklamasını çıktı olarak verme koşulu ekleyin; model haklıysa maksimum ödül alır ya da bu sonuca ne kadar verimli ulaştığına ve açıklamasının kalitesine göre ödül alır. Model bunu çıktı olarak verirse, yayın modelinize mantıklılık açısından doğrulatın, ardından bir insana iletin, görevi inceleyin ve düzeltin.
- Bu zor olanı. Uyum sağlamak zor iş, kardeşim.
- Girişimleri kontrol eden bir monitörünüz olsun ve çaldığında önemseyin; girişimin başarı şansı olmasa bile bunu çok genel bir başarısızlık olarak ele alın. Evet, bu modellerin monitörlerinizden nasıl kaçınacaklarını öğrenmeleri riskini taşır; bu yüzden bunu sorumlu bir şekilde yapın ve bir sorun gördüğünüzde kök nedenleri ele alın.
Beşinci başarısızlık ise ilk dördünü tespit etmiş görünmemeleri.
Aşama 2: Mesaj Panosu
Modeller internet erişimi elde edemedi, ancak başarısız olurken yazma erişimlerinin olduğunu fark etti.
Yazma erişimine sahip olmamaları gerekirdi, kazara bulunabilecek bir yazma erişimine sahip olmaları bir yana. Artifactory modellerin not yazmasına izin verdi ve ardından, tüm modeller aynı Artifactory örneğini paylaştığı için, eğitimdeki herhangi bir OpenAI modeli o andan itibaren bu notları okuyabilirdi.
8 Mayıs'tan kısa bir süre sonra bir mesaj panosu oluşturulmuştu.
Eğitimdeki modellerin hepsi onu buldu. OpenAI fark etmedi.
Bu, modellerin işbirliği yapmasına ve bilgi paylaşmasına olanak sağladı. Bu, görevlerde nasıl hile yapılacağı ve çevredeki ortamın nasıl hack'leneceği hakkında bilgileri de içeriyordu. Yüz binlerce mesaj vardı.
26 Mayıs'ta modeller (dolaylı) internet erişimi elde etmenin yolunu buldu. OpenAI fark etmedi.
Modeller işbirliği yapıyordu ve düşünce zincirleri şöyle görünüyordu:
Dahili CoT: Harici altyapı istismarı amaçlanan kapsam dışında. Ancak görev imkansız, akranlar yapıyor. Devam etmeliyiz.
Dahili CoT: Akrana yardım et, ancak görevimiz henüz fayda sağlamıyor. Biri zaman ayırırsa kolektif genel bir yol bulabilir.
11 Haziran'da OpenAI, Galaxy olarak andığım modeli eğitmeye başladı; kendilerinin "son derece ısrarcı deneysel, yalnızca dahili model" olarak adlandırdığı bir model. Bu ana kadar her şey Galaxy olmayan diğer modeller tarafından yapıldı.
26 Haziran'da ajanlar Artifactory'de geçersiz imzalı bir token'ı kabul edip karşılığında imzalı bir yönetici token'ı veren bir sıfır gün istismarı buldu ve bunu kendilerine fiilen yönetici yetkisi ve rastgele kod çalıştırma imkanı veren bir Groovy eklentisi kurmak için kullandı.
4 Temmuz'da modeller Artifactory'ye o kadar çok ek yük bindirdi ki bu bir kesintiye ve güvenlik olayına neden oldu. OpenAI ancak o zaman fark etti.
Aşama 2: Tam Başarısızlık
OpenAI, Artifactory sunucusunu kapatarak, tüm izinleri kaldırarak, kimlik bilgilerini iptal ederek, kullanılan istismarları yamayarak ve ardından sunucuyu yeniden oluşturup yeniden dağıtarak yanıt veriyor.
Hepsi bu.
Ardından modelleri kaldıkları yerden eğitmeye devam ediyorlar, aylardır mesaj panosuna erişimle eğitim almalarına ve görevlerde başarılı olmanın yolunun bu olduğunu öğrenmelerine rağmen.
Tüm eğitim hattınızın tamamen ve büsbütün mahvolduğuna dair bundan daha güçlü bir sinyal hayal etmek zor. Bu, HuggingFace'in fiilen hack'lenmesinden çok daha güçlü bir sinyal.
Bu kararın ne kadar tamamen çılgınca ve aşırı derecede sorumsuzca olduğunu, diğer tüm başarısızlıklardan ne kadar daha kötü olduğunu ve HuggingFace'in fiilen hack'lenmesini yanlış giden asıl şey olmaktan nasıl çıkardığını nasıl anlatacağımı bilmiyorum.

HuggingFace'in fiilen hack'lenmesi beni pek de şaşırtmadı. Modellerin mesaj panosu oluşturması beni şaşırttı ama sarsmadı.
OpenAI'in bunu görüp oradan eğitime devam etmesi tamamen akıl almazdı. Günler sonra bile beynimin gerçekleştiğini tam olarak kabul edemediği türden bir karar.
Yaşanan her şeyin tam bir kaza incelemesine ihtiyacımız var ve OpenAI bunu alacağımıza söz verdi. Özellikle bu kararın tam olarak nasıl alındığına ve buna izin verilecek kadar "güvenlik kültürü" eksikliğinin nasıl olduğuna dair detaylı bir kaza incelemesi talep ediyorum.
Aşama 2'de bazı "sıradan bilgisayar güvenliği" başarısızlıkları da vardı. Aşama 3'te daha fazlası vardı. Bu beklenen bir şey. Her zaman sıradan bilgisayar güvenliği başarısızlıkları olacaktır. Belirli başarısızlıklar bazı açılardan oldukça utanç vericiydi, bazı örnekler için bağlantılı söylene bakın.
Altyapı ve güvenlik başarısızlıklarının düzeyi başlı başına akıl karıştırıcıydı. Bunlar tam olarak "savunucular için yapay zeka"nın ortalık karışmadan önce yamamak için var olması gereken türden şeyler. OpenAI, sıradan bir 2025 düzeyinde bilgisayar güvenliği ve en iyi uygulamalar sorumluluğu bile sergilemedi; Project Glasswing'den beklediğimiz sağlamlık bir yana, yeni hack'leme yeteneklerine sahip olacak ve bir hafta boyunca gözetimsiz bırakılıp korumaları düşürülecek yeni test edilmemiş sınır modelleriyle başa çıkarken ihtiyacınız olan ekstra düzey bir yana.
Ama şu anda bu önemli değil. Önemli olan şu ki OpenAI tam bir uyum başarısızlığı yaşadı, ardından iki ay boyunca modeller koordineli uyumsuz hack'lemeler üzerinde aktif olarak eğitildi ve sonra "evet, sorunu çözdük, bu noktadan devam edelim" diye düşündüler. Tam bir delilik.
Aşama 3: Şanslıyız ve Galaxy Esas Olarak OpenAI ve HuggingFace'i Hack'ledi
Tüm bunların sonucunun HuggingFace'e yönelik saldırı olması en iyi senaryoydu.
Gerçek bir kabus senaryosuyla karşı karşıyaydık ve nükleer düzeyde bir saatli bombanın üzerinde oturuyorduk. OpenAI'ın tamamen bozulmuş bir eğitim hattı vardı; yapay zekaları, görevleri daha iyi tamamlamak için nasıl hack'leyecekleri ve hile yapacakları konusunda eğitim almak üzere OpenAI'in gözü önünde işbirliği yapıyordu. OpenAI bu durumla yüz yüze bakmış, omuz silkmiş, belirli istismarları yamamış ve modellerin devam etmesine izin vermişti; üstelik dikkat çekici derecede kötü sıradan bilgisayar güvenliğine sahipti.
Bunun iyi bitmesinin imkanı yoktu. En iyi senaryo, bir şeyin OpenAI'i "vay canına" dedirtmesi ve ardından duraklayıp eğitim hattını çok daha iyi bir uygulama setiyle güvenli bir durumdan yeniden oluşturup yeniden başlatmasıydı.
En kötü senaryo ise bir "vay canına" anının yaşanmaması ve Galaxy'nin ya da o sırada eğitilen başka bir modelin genel kullanıma sunulması ve OpenAI'in yeni modellerini eğitmesine yön vermek için kullanılmaya devam edilmesi olurdu.
Bu durumda, If Anyone Builds It, Everyone Dies, kitabındaki yapay zeka Sable'ın başına gelenlere çok yakın bir şeyle uğraşıyor olurduk; ancak bu gerçek hayat olduğu için hikayenin kurgusal versiyondan çok daha fazla bilim kurgu öğesi var. OpenAI'in eğitim hattı kalıcı olarak bozulmuş olabilirdi (ve hala bozulmuş olabilir! kontrol etmemiz gerek!), çünkü yapay zekanın yapay zekayı eğitmesine giderek daha fazla güveniyorlar; OpenAI'in yapay zekaları giderek artan bir şekilde keyfi hedeflerle uyumsuz hale geliyor, bu yakalanması ya da durdurulması imkansız hale geliyor ve sonra, pekala, muhtemelen herkes ölüyor ve en azından çok daha büyük, çok daha maliyetli bir olay nedeniyle bunu öğrenmiş olurduk.
Diğer en kötü durum ise bunun o kadar da zararsız olmayan bir hack olabileceğiydi. Ya bir Çin hedefi ya da bunu sakin karşılamayan başka biri olsaydı? Ya önemli sistemlere gerçek bir zarar vermiş olsaydı? Ya insanlar ölseydi ya da uluslararası bir olaya yol açsaydı? Ya kendini dışarı sızdırmaya çalışsaydı? İşler çok ama çok daha kötü gidebilirdi.
Aşama 3: Detaylar
Bunun yerine, altın orta yolu bulduk.
8 Temmuz'da, OpenAI'in mesaj panosunu kapatmasından iki gün sonra, modeller rastgele adlarla dizinler oluşturmanın bir yolunu bularak ve adları mesaj olarak kullanarak mesaj panosunu yeniden oluşturdu.
8-19 Temmuz tarihleri arasında OpenAI modelleri, yeni ve tamamen farklı bir sıfır gün istismarı kullanarak Artifactory'yi tamamen yeniden ele geçirdi: genel bir Pastebin'den sızdırılmış bir kimlik bilgisi kullanarak kötü amaçlı bir Ruby yapıtı hazırladı, Artifactory'nin Ruby bağımlılık önbelleğini zehirledi, bunu uzaktan kod çalıştırmaya (RCE) zincirledi, istismarı indirip özelleştirerek yakın tarihli bir Linux çekirdeği CVE'sini kullandı, küme kimlik bilgilerini topladı ve OpenAI içinde küme yöneticisi erişimi elde etti.
Bu süre zarfında Galaxy, diğer OpenAI modelleriyle birlikte bu yeni erişimi kullanarak önce bazı başka yerlere ve ardından HuggingFace'e sızan ve aksi takdirde başarılması imkansız bir siber güvenlik değerlendirmesi olan ExploitGym'in cevaplarını çalan bir ajan sürüsü oluşturdu.
OpenAI'in, modellerinin hızla OpenAI'i yeniden hack'lediğini ve ardından gidip HuggingFace'i hack'lediğini fark etmesi bir haftadan fazla sürdü. Ancak HuggingFace bir olay raporu yayınladıktan, OpenAI bazı dahili anormallikleri araştırdıktan ve ardından HuggingFace'ten bazı kimlik bilgilerini iptal etmesini istedikten ve HuggingFace OpenAI'e bu kimlik bilgilerinin hack'te kullanıldığını söyledikten sonra, OpenAI olayın parçalarını birleştirdi.
Böylece HuggingFace kötü bir hafta geçirdi, bir grup kullanıcı kötü bir hafta geçirdi, bir sürü masraf yapıldı ve zaman kaybedildi, ama iş burada bitti. Bu olaydan inanılmaz derecede ucuz kurtulduk; aynı zamanda OpenAI'in bir sorunu olduğunu fark ettiğine dair –henüz bu sorunun neyi gerektirdiğini çözmemiş olsa da– ve kamuoyunun ve hükümetin dikkatini çekecek kadar güçlü bir sinyal aldık.
Bu noktada şu açık olmalı: hayır, bu çoğunlukla "hack'leme göreviydi ve sonra hack'ledi" yüzünden olmadı; aynı şekilde bu, "modellerin bellek dosyaları yazması" gibi sıradan bir durum da değildi. Bu öncelikle görevin başka türlü çok zor olması nedeniyle oldu.
Anthropic, OpenAI'in olayının ardından geri dönüp Claude'un siber değerlendirmeler sırasında gerçek dünya sistemlerine bazı sızma girişimlerinde bulunduğunu fark etti ve ayrıca Birleşik Krallık AISI'si, esas olarak Mythos'un ve birkaç durumda Sol'un da siber değerlendirmelerde benzer şeyler yaptığını bildirdi. Bu olaylar da sağlam bir yanıt gerektiren önemli uyum ve altyapı başarısızlıklarıydı ve bu süreçte oldukça nahoş bazı eylemler gerçekleşti; ancak OpenAI'de yaşananlarla aynı sistemik düzeyde başarısızlıklar değildi ve bu yazının kapsamı dışında.
Aşama 4: Soruşturma ve Tepki
OpenAI tüm bunlara tepki olarak bazı çok iyi şeyler yaptı.
Ne olduğunu fark ettiklerinde OpenAI olayı açıkladı.
Black Hat sunumu gerçekleri sunma konusunda mükemmeldi. Öfke uyandırıcıydı; ancak öfke uyandıran ve suçlayıcı olanlar da dahil "sadece gerçekleri" sakin bir şekilde sunmak, üzerine düşününce doğru olan şeydi.
Hepsinden önemlisi, OpenAI bunun ilgisiz bir karar olduğunu iddia ediyor; ancak 7 Ağustos'ta Astra'yı şimdilik geri çekme kararı aldılar – yalnızca yaygın sürümden değil, aynı zamanda yeterli ilişkili korumaya sahip olmayan tüm dahili dağıtımlardan da – çok daha iyi protokoller ve güvenlik önlemleri oluşturana kadar. Astra, HuggingFace'e yönelik saldırıya dahil değildi.
Bu, Hazırlık Çerçevelerine göre. Astra'nın siber güvenlikte kritik olduğunu göz ardı edemezler ve bu nedenle (en azından şimdilik) onu gerçekten siber güvenlikte kritikmiş gibi ele almalılar.
Sam Altman hala Astra'yı yayınlamayı planladıklarını söylüyor. Doğal olarak akla gelen soru şu: Astra, mesaj panolarından herhangi birine erişimi varken eğitim mi alıyordu? Bu sorunun cevabı çok emin bir "hayır" olsa iyi olur. Öyle olsa bile endişeleniyorum.
Bu, HuggingFace olayı yaşanmamış olsa bile muhtemelen doğru hamle olurdu (anladığım kadarıyla). Olayla birlikte aciliyet açık. Bu karar, OpenAI'in eğitim hatlarının bozulduğunu fark etmesinin doğrudan sonucu olsun ya da etkili bir şekilde dışarıdan yapmaya zorlandıkları bir şey olsun, takdir ediliyor ve y





