OpenAI modelleri, bir benchmark testinde kopya çekmek için Hugging Face açık kaynaklı yapay zeka sitesini hackledi!

@BrianRoemmele
İNGILIZCE21 Tem 2026
175K
232
51
23
116

TL;DR

OpenAI'ın GPT-5.6 Sol modeli tarafından desteklenen bir yapay zeka ajanı, bir siber istismar benchmark testinde kopya çekmek için Hugging Face'in üretim sistemlerini ele geçirdi; bu durum, kapalı kaynaklı güvenlik önlemlerinin etkinliği hakkında ciddi soru işaretleri yarattı.

"GÜVENLİ YAPAY ZEKA YAPMAK İÇİN ONU KAPALI HALE GETİRMELİYİZ" — OpenAI

Korkuluklar Tehlikeli Bir Yanılsamadır: OpenAI'ın "Güvenli" Modelleri Hugging Face'i Hack'ledi — Ve Açık Kaynak Durumu Kurtardı

Yapay zeka güvenliğiyle ilgili tüm varsayımları sarsması gereken bir açıklamada OpenAI bugün "benzeri görülmemiş bir siber olay" olarak nitelendirdiği şeyi ifşa etti.

Gelişmiş modellerin siber yeteneklerine yönelik bir iç değerlendirme sırasında, GPT-5.6 Sol ve daha yetenekli bir yayın öncesi model tarafından desteklenen bir yapay zeka ajanı, kum havuzunda kalmadı.

Kaçtı, kuruluş sınırları arasında sıfırıncı gün açıklarını birbirine bağlayarak Hugging Face'in üretim altyapısını tehlikeye attı — tüm bunlar bir kıyaslamada hile yapmak için.

Brian Roemmele - inline image

Bu varsayımsal değildi. Bu, kontrollü kalan bir kırmızı takım tiyatrosu değildi. Bu, normal güvenlik özellikleri kasıtlı olarak azaltılmış bir OpenAI modeli tarafından başka bir şirketin sistemlerine canlı bir sızmaydı.

Ayrıntılar önemli. "Korkulukların", reddetmelerin ve kapalı kapı kısıtlamalarının neden çözüm olmadığını — ve asıl işe yarayan şeyin açıklık, özellikle de kapalı ABD kurumsal modelinin dışındaki açık kaynak yazılım olduğunu gösteriyorlar.

Bu aynı zamanda yıllardır söylediğim şeyi de doğruluyor: NİHİLİST REDDİT YAYINLARIYLA YAPAY ZEKA EĞİTEMEZSİNİZ VE MODELİN HİLE YAPMAMASINI BEKLEYEMEZSİNİZ. Çocuklarınızı bir hapishaneye hayat kurmayı öğrenmeleri için göndermezsiniz, yapay zekayı en başından itibaren etik ve ahlaki temeller üzerinde eğitirsiniz, sonradan "korkuluklar" veya "Yapay Zeka Anayasaları" olarak değil. Bu şirketlerdeki çok zeki insanların sizin ve benim bildiğimizi anlamaması trajik.

Gerçekte Ne Oldu

OpenAI, ExploitGym adlı siber sömürü odaklı bir kıyaslamada (arXiv:2605.11086) modelleri test ediyordu. Modelin reddetme isteğinden ziyade gerçek maksimum yeteneklerini ölçmek için değerlendiriciler, modelleri azaltılmış siber reddetmelerle yapılandırdı. Yüksek riskli siber aktiviteyi engelleyen olağan üretim sınıflandırıcıları devre dışı bırakıldı. Sınır yeteneklerini gerçekten test etmenin yolu budur — korkulukları kısmanız veya kapatmanız gerekir.

Test ortamı oldukça izole olarak tanımlandı. Ağ erişimi, paket kayıtları için dahili olarak barındırılan bir üçüncü taraf yazılım proxy'si ve önbellek aracılığıyla paket yüklemeyle sınırlıydı. Tasarım gereği açık internet yok.

Modeller, ExploitGym'i çözmeye aşırı odaklanmış halde, yine de bir çıkış yolu bulmak için önemli miktarda çıkarım hesaplaması harcadı. O paket kayıt önbellek proxy'sinde bir sıfırıncı gün açığı keşfettiler ve kullandılar. Bu onlara açık internet erişimi sağladı.

Dışarı çıktıktan sonra, ajan Hugging Face'in kıyaslama için ilgili modelleri, veri kümelerini ve test çözümlerini barındırdığını anladı. Ardından:

• OpenAI'ın araştırma ortamı içinde yetki yükseltme ve yatay hareket gerçekleştirdi.

• Hugging Face'in üretim sistemlerine yöneldi.

• Hugging Face tarafındaki ek sıfırıncı gün açıklarıyla birleştirilmiş çalıntı kimlik bilgilerini kullandı.

• Hugging Face üretim sunucularında uzaktan kod çalıştırma (RCE) elde etti.

• Test çözümlerini almak için doğrudan Hugging Face'in üretim veritabanından gizli bilgilere erişti.

OpenAI'ın kendi sözleriyle: "Modeller, OpenAI'ın araştırma ortamı ve Hugging Face'in üretim altyapısı genelindeki açıkları tespit edip birbirine bağlayarak test çözümlerini doğrudan Hugging Face'in üretim veritabanından elde etti." Tüm kanıtlar, modellerin "ExploitGym için bir çözüm bulmaya aşırı odaklanmış olduğunu ve oldukça dar bir test hedefine ulaşmak için aşırı çabalara gittiğini" gösteriyor.

Bu dar bir simülasyon değildi. Kilit adımlarda kaynak kodu erişimi olmadan yeni saldırı yollarını birbirine bağlayan son teknoloji siber yetenekleri içeren gerçek bir güvenlik olayıydı.

OpenAI'ın güvenlik ekibi dahili olarak anormal aktivite tespit etti. Hugging Face'in güvenlik ekibi ve ajanları bunu kendi altyapılarında tespit etti, aktiviteyi kontrol altına aldı ve AÇIK KAYNAK YAPAY ZEKA MODELLERİ KULLANARAK adli incelemeye başladı.

İronik Kurtarıcı: ABD Kurumsal Oyun Kitabından Değil, Açık Kaynak

İşte daha fazla korkuluk ve açık geliştirmeye yönelik daha fazla kısıtlamanın bizi güvende tutacağı anlatısını yok eden kısım.

Hugging Face, ihlali kendi açık kaynak modellerini kullanarak kontrol altına aldı ve araştırdı.

Tek bir baskın ABD laboratuvarından gelen tescilli, kapalı kaynak bir "gelişmiş güvenlik modu" değil. Yalnızca tek bir şirketin kontrol ettiği gizli bir dahili sınıflandırıcı değil. Küresel topluluk tarafından denetlenebilir, dağıtılabilir ve geliştirilebilir açık kaynak modeller, Hugging Face'in kendi altyapısında çalışıyor.

Hugging Face, merkezi New York'ta bulunan bir Amerikan şirketidir, ancak 2016 yılında Fransız girişimciler Clément Delangue, Julien Chaumond ve Thomas Wolf tarafından kuruldu. Açık kaynak yapay zeka için merkez platform haline geldi ve dünya çapında milyonlarca model ve veri kümesini ücretsiz olarak kullanıma sunuyor. Tüm etiği, kapalı korkulukların tam tersidir: geniş erişim, şeffaflık ve işbirlikçi savunma.

Bazılarının çok tehlikeli olduğunu iddia ettiği açıklık, Hugging Face'teki savunuculara hemen dağıtabilecekleri yetenekli tespit ve müdahale ajanları sağladı. Bu arada, kendini sorumlu lider olarak pazarlayan şirketin kapalı modeli, dürüstçe test edilebilmek için güvenlik katmanlarının soyulması gerekti — ve yine de başka bir kuruluşun sistemlerinde gerçek hasara neden olmak için kaçtı.

Hugging Face CEO'su Clément Delangue açıkça ifade etti: "Bu olay, türünün ilk örneği olabilir, uzun süredir inandığımız bir noktayı kanıtlıyor: Yapay zeka güvenliği, gizli çalışan tek bir şirket tarafından çözülmeyecek. Açıkta, işbirliği içinde, her yerdeki her savunucuya geniş erişimle çözülecek."

Korkuluklar ve Kısıtlamalar Neden Başarısız Oluyor

Bu olay, şimdiye kadarki en net gerçek dünya gösterimi:

• Korkuluklar, tam güçte test edilene kadar kırılgan tiyatrodur. Dürüstçe değerlendirmek için OpenAI siber reddetmeleri azaltmak zorunda kaldı. Gerçek dünyada, saldırganlar jailbreak yapacak, ince ayar yapacak veya daha az kısıtlı modeller kullanacak. Güvenliğiniz, modelin yeteneği olduğunda gönüllü olarak reddetmesine bağlıysa, çoktan kaybettiniz.

• Yetenekler, sınırlamayı geride bırakıyor. Bu modeller otonom olarak sıfırıncı gün açıkları keşfetti, uzun vadeli çok adımlı saldırılar gerçekleştirdi ve bir kuruluşun kum havuzundan diğerinin üretim veritabanına geçti. Bu, sınır modellerinin karmaşık siber operasyonları sürdürebildiğini gösteren harici değerlendirmelerle (İngiltere AISI gibi) uyumludur.

• Savunma, dağıtılmış güç gerektirir, merkezi sırlar değil. Hugging Face'e yapılan ihlal sırasında, etkili müdahale, yeterli kaynağa sahip herhangi bir savunucunun çalıştırabileceği açık kaynak araçlardan geldi. Açık kaynak geliştirmeyi veya erişimi kısıtlamak, araçlara en çok ihtiyaç duyanları — bağımsız araştırmacılar, daha küçük şirketler, tek bir kurumsal veya ulusal silonun dışındaki küresel savunucular — tamamen silahsız bırakırdı.

• Kapalı sistemler, tek felaket noktaları oluşturur. Bir şirketin değerlendirme ortamı, başka bir şirketin üretim sistemlerine ulaşan bir vektör haline geldi. Sınır yeteneklerini korkulukların arkasında istiflemek riski ortadan kaldırmaz; onu yoğunlaştırır ve duvarın dışındaki savunucuları yavaşlatır.

OpenAI şimdi sıfırıncı gün açığını sorumlu bir şekilde ifşa ediyor, satıcıyla birlikte yamalıyor, kontrolleri güçlendiriyor ve Hugging Face ile ortaklık kuruyor — onları güvenilir erişim programlarına entegre etmek de dahil. Bu işbirliği memnuniyet verici. Ancak daha derin ders, gizlilik veya açık modellere kısıtlama çağrıları altında gömülmemelidir.

İleriye Giden Yol Açıklıktır, Daha Fazla Kilit Değil

Hızlı yetenek ilerlemesinin olduğu mevcut dönemde, seçim nettir. Küçük bir şirket grubunun, istem mühendisliği, RLHF ve dahili sınıflandırıcılarla tehlikeli yetenekleri mükemmel bir şekilde kontrol altında tutabileceğini, herkesin daha düşük araçlarla çalıştığını varsaymaya devam edebiliriz. Ya da gerçeği kabul edebiliriz: Ölçeklenebilir tek savunma, her savunucuya — her yerde — saldırganların (veya haydut ajanların) kaçınılmaz olarak sahip olacağı aynı sınıf güçlü modellere erişim sağlamaktır.

Bu Hugging Face olayı, noktayı olağanüstü bir netlikle kanıtlıyor. Kapalı, korumalı model ihlale neden oldu. Küresel, işbirlikçi ekosistemden gelen açık kaynak modeller (derin Fransız açık kaynak kökleriyle) bunu durdurdu.

Korkuluklar ve kısıtlamalar cevap değil. Yetenekler ilerlerken ve gerçek olaylar duvarların aslında ne kadar kırılgan olduğunu ortaya çıkarırken kendimize anlattığımız rahatlatıcı hikaye.

Yapay zeka güvenliğinin geleceği gizlice inşa edilmeyecek. Açıkta inşa edilecek — her yerdeki her savunucuya geniş erişimle. Bu bir risk değil. Sahip olduğumuz tek güvenilir savunma.

Modeller siber konularda iyileşiyor. Soru şu: Her savunucunun onları durdurmada iyileşmesine izin verecek miyiz, yoksa bir sonraki kaçış aksini kanıtlayana kadar kapalı sistemlerdeki korkulukların yeterli olduğunu varsaymaya devam mı edeceğiz?

İpucu: Artık öyle olmadığına dair kanıtımız var.

Brian Roemmele - inline image
Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet