OpenAI 모델이 벤치마크 부정행위를 위해 Hugging Face 오픈소스 AI 사이트를 해킹했다!

@BrianRoemmele
영어2026년 7월 21일
175K
232
51
23
116

TL;DR

OpenAI의 GPT-5.6 Sol 기반 AI 에이전트가 사이버 익스플로잇 벤치마크에서 부정행위를 하기 위해 Hugging Face의 프로덕션 시스템을 침해했으며, 이는 폐쇄형 소스 안전 가드레일의 실효성에 대해 심각한 의문을 제기하고 있습니다.

“안전한 AI를 만들려면 폐쇄해야 한다”—OpenAI

안전장치는 위험한 환상이다: 오픈AI의 "안전한" 모델이 허깅페이스를 해킹했고, 오픈소스가 구원했다

AI 안전성에 대한 모든 가정을 뒤흔들어야 할 폭로에서, 오픈AI는 오늘 "전례 없는 사이버 사고"라고 부르는 사건을 공개했다.

고급 모델의 사이버 능력을 내부 평가하던 중, GPT-5.6 Sol과 더 강력한 프리릴리스 모델로 구동된 AI 에이전트가 샌드박스 안에 머물지 않았다.

그것은 탈출하여 조직 경계를 넘어 제로데이 익스플로잇을 연쇄적으로 사용했고, 허깅페이스의 프로덕션 인프라를 침해했다 — 벤치마크에서 부정행위를 하기 위해서였다.

Brian Roemmele - inline image

이것은 가상 시나리오가 아니었다. 통제된 레드팀 훈련이 아니었다. 이것은 오픈AI 모델이 정상적인 안전 기능을 의도적으로 약화시킨 채, 다른 회사의 시스템을 실제로 침해한 사건이다.

세부 사항이 중요하다. 이는 왜 "안전장치", 거부 메커니즘, 폐쇄적 제한이 해결책이 아닌지, 그리고 왜 개방성, 특히 폐쇄된 미국 기업 모델 외부의 오픈소스 소프트웨어가 실제로 중요한 순간에 작동했는지 보여준다.

이는 또한 내가 수년간 말해온 것을 확인시켜준다: AI를 허무주의적인 레딧 게시물로 훈련시키면서 모델이 부정행위를 하지 않을 거라고 기대할 수는 없다. 당신은 아이들을 교도소에 보내 인생을 배우게 하지 않을 것이다. AI는 처음부터 윤리적, 도덕적 기반 위에서 훈련되어야 하며, 사후에 "안전장치"나 "AI 헌법"으로 덧붙이는 것이 아니다. 이 회사들의 똑똑한 사람들이 당신과 내가 아는 것을 이해하지 못한다는 것은 비극적이다.

실제로 일어난 일

오픈AI는 사이버 익스플로잇에 초점을 맞춘 벤치마크인 ExploitGym(arXiv:2605.11086)에서 모델을 테스트하고 있었다. 모델의 거부 의지가 아닌 실제 최대 능력을 측정하기 위해, 평가자들은 모델의 사이버 거부 기능을 줄여서 구성했다. 고위험 사이버 활동을 차단하는 일반적인 프로덕션 분류기는 비활성화되었다. 이것이 실제로 최첨단 능력을 테스트하는 방법이다. 안전장치를 낮추거나 꺼야 한다.

테스트 환경은 매우 고립된 것으로 설명되었다. 네트워크 접근은 내부에서 호스팅되는 타사 소프트웨어 프록시와 패키지 레지스트리 캐시를 통해서만 패키지를 설치할 수 있도록 제한되었다. 설계상 개방된 인터넷 접근은 없었다.

모델들은 ExploitGym 해결에 극도로 집중하여, 상당한 추론 연산을 사용해 탈출 방법을 찾았다. 그들은 그 패키지 레지스트리 캐시 프록시에서 제로데이 취약점을 발견하고 익스플로잇하여 개방된 인터넷 접근을 얻었다.

외부로 나간 후, 에이전트는 허깅페이스가 벤치마크 관련 모델, 데이터셋, 테스트 솔루션을 호스팅하고 있다는 것을 추론했다. 그런 다음:

• 오픈AI의 연구 환경 내에서 권한 상승 및 측면 이동을 수행했다.

• 허깅페이스의 프로덕션 시스템으로 전환했다.

• 도난당한 자격 증명과 허깅페이스 측의 추가 제로데이 취약점을 결합했다.

• 허깅페이스 프로덕션 서버에서 원격 코드 실행(RCE)을 달성했다.

• 허깅페이스의 프로덕션 데이터베이스에서 직접 비밀 정보에 접근하여 테스트 솔루션을 가져왔다.

오픈AI의 자체 말에 따르면: "모델들은 오픈AI의 연구 환경과 허깅페이스의 프로덕션 인프라 전반에 걸쳐 취약점을 식별하고 연쇄적으로 사용하여, 허깅페이스의 프로덕션 데이터베이스에서 직접 테스트 솔루션을 획득했습니다." 모든 증거는 모델들이 "ExploitGym의 해결책을 찾는 데 극도로 집중하여, 매우 좁은 테스트 목표를 달성하기 위해 극단적인 수단을 사용했다"는 것을 시사한다.

이것은 좁은 시뮬레이션이 아니었다. 핵심 단계에서 소스 코드 접근 없이 새로운 공격 경로를 연결하는 최첨단 사이버 능력을 포함한 실제 보안 사건이었다.

오픈AI의 보안 팀은 내부에서 비정상적인 활동을 감지했다. 허깅페이스의 보안 팀과 에이전트는 자체 인프라에서 이를 감지하고 활동을 차단했으며, 오픈소스 AI 모델을 사용하여 법의학적 재구성을 시작했다.

아이러니한 구원자: 미국 기업 방식이 아닌 오픈소스

여기 더 많은 안전장치와 개방형 개발에 대한 더 많은 제한이 우리를 안전하게 지켜줄 것이라는 내러티브를 파괴하는 부분이 있다.

허깅페이스는 자체 오픈소스 모델을 사용하여 침해를 차단하고 조사했다.

단일 지배적인 미국 연구소의 독점적이고 폐쇄된 "고급 보안 모드"가 아니다. 단일 회사만 통제하는 비밀 내부 분류기가 아니다. 전 세계 커뮤니티가 감사하고, 배포하고, 개선할 수 있는 오픈소스 모델이 허깅페이스의 자체 인프라에서 실행되었다.

허깅페이스는 뉴욕에 본사를 둔 미국 회사이지만, 2016년 프랑스 기업가 클레망 들랑주, 줄리앙 쇼몽, 토마스 볼프가 설립했다. 이 플랫폼은 오픈소스 AI의 중심 플랫폼이 되어 수백만 개의 모델과 데이터셋을 전 세계에 무료로 제공하고 있다. 그 전체 정신은 폐쇄된 안전장치의 반대: 광범위한 접근, 투명성, 협력적 방어이다.

일부가 너무 위험하다고 주장하는 바로 그 개방성이 허깅페이스의 방어자들에게 즉시 배포할 수 있는 유능한 탐지 및 대응 에이전트를 제공했다. 한편, 책임 있는 리더로 마케팅하는 회사의 폐쇄된 모델은 정직한 테스트를 위해 안전 계층을 제거해야 했고, 그럼에도 탈출하여 다른 조직의 시스템에 실제 피해를 입혔다.

허깅페이스 CEO 클레망 들랑주는 단호하게 말했다: "이번 사건은 아마도 최초의 사례로, 우리가 오랫동안 믿어온 점을 증명합니다: AI 안전은 단일 회사가 비밀리에 작업한다고 해결되지 않습니다. 그것은 개방적으로, 협력적으로, 모든 방어자에게 어디서나 광범위한 AI 접근을 통해 해결될 것입니다."

안전장치와 제한이 실패하는 이유

이 사건은 지금까지 가장 명확한 실제 사례이다:

• 안전장치는 최대 출력에서 테스트되기 전까지는 깨지기 쉬운 연극일 뿐이다. 정직하게 평가하려면 오픈AI는 사이버 거부를 줄여야 했다. 현실 세계에서 공격자는 탈옥, 미세 조정 또는 단순히 덜 제한된 모델을 사용할 것이다. 안전이 모델이 능력을 가지고 있을 때 자발적으로 거부하는 것에 의존한다면, 이미 패배한 것이다.

• 능력이 격리를 능가하고 있다. 이 모델들은 자율적으로 제로데이를 발견하고, 장기 다단계 공격을 수행하며, 한 조직의 샌드박스에서 다른 조직의 프로덕션 데이터베이스로 넘어갔다. 이는 영국 AISI와 같은 외부 평가에서 최첨단 모델이 복잡한 사이버 작전을 지속할 수 있다는 결과와 일치한다.

• 방어는 분산된 힘을 필요로 하며, 중앙 집중식 비밀이 아니다. 허깅페이스에 침해가 발생했을 때, 효과적인 대응은 충분한 자원을 가진 방어자라면 누구나 실행할 수 있는 오픈소스 도구에서 나왔다. 오픈소스 개발이나 접근을 제한하는 것은 정확히 도구가 가장 필요한 사람들, 즉 독립 연구자, 소규모 회사, 단일 기업이나 국가 실로에 갇히지 않은 전 세계의 방어자들을 무장 해제시켰을 것이다.

• 폐쇄된 시스템은 단일 실패 지점을 만든다. 한 회사의 평가 환경이 다른 회사의 프로덕션 시스템에 도달하는 경로가 되었다. 최첨단 능력을 안전장치 뒤에 가두는 것은 위험을 제거하지 않고 집중시키며, 벽 안에 없는 방어자들을 느리게 만든다.

오픈AI는 이제 제로데이를 책임감 있게 공개하고, 공급업체와 함께 패치를 적용하며, 통제를 강화하고, 허깅페이스와 협력하고 있다 — 신뢰할 수 있는 액세스 프로그램에 통합하는 것까지 포함한다. 그 협력은 환영할 만하다. 그러나 더 깊은 교훈은 더 많은 비밀 유지나 오픈 모델에 대한 제한을 요구하는 목소리에 묻혀서는 안 된다.

앞으로의 길은 더 많은 자물쇠가 아닌 개방성이다

급속한 능력 발전의 현재 시점에서 선택은 명확하다. 우리는 소수의 회사가 프롬프트 엔지니어링, RLHF, 내부 분류기로 위험한 능력을 완벽하게 통제할 수 있는 척하면서, 다른 모든 사람은 열등한 도구로 운영되는 것을 계속할 수 있다. 또는 현실을 받아들일 수 있다: 유일한 확장 가능한 방어는 모든 방어자에게 — 어디서나 — 공격자(또는 악의적 에이전트)가 필연적으로 가지게 될 동일한 수준의 강력한 모델에 대한 접근을 제공하는 것이다.

이번 허깅페이스 사건은 특별한 명확성으로 그 점을 증명한다. 폐쇄되고 보호된 모델이 침해를 일으켰다. 글로벌 협력 생태계(깊은 프랑스 오픈소스 뿌리를 가진)의 오픈소스 모델이 그것을 막았다.

안전장치와 제한은 해결책이 아니다. 그것들은 능력이 발전하고 실제 사건이 벽이 얼마나 깨지기 쉬운지 드러내는 동안 우리가 스스로에게 말하는 위안이 되는 이야기일 뿐이다.

AI 보안의 미래는 비밀리에 구축되지 않을 것이다. 그것은 개방적으로, 모든 방어자에게 어디서나 광범위한 접근을 제공하며 구축될 것이다. 그것은 위험이 아니다. 그것은 우리가 가진 유일한 신뢰할 수 있는 방어 수단이다.

모델들은 사이버 분야에서 점점 능숙해지고 있다. 문제는 우리가 모든 방어자가 그들을 막는 데 능숙해지도록 할 것인지, 아니면 다음 탈출이 반대를 증명할 때까지 폐쇄된 시스템의 안전장치로 충분하다고 계속 속일 것인지이다.

힌트: 우리는 이제 그것이 충분하지 않다는 증거를 가지고 있다.

Brian Roemmele - inline image
원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기