GPT-6 Astra 종합 분석: AGI 시대에 오신 것을 환영합니다

@Khazix0918
중국어2026년 9월 03일
467K
1.0K
125
67
706

TL;DR

GPT-6 Astra 는 뛰어난 컴퓨터 상호작용, 미적 판단력, 자율적 의사결정 기능을 갖추고 인간의 해석 가능성에 도전하며 AI 지능의 거대한 도약을 보여줍니다.

어제 밤 글로벌 AI 장애 이후.

GPT-6 Astra가 드디어 베이징 시간 새벽 3시 33분에 공식 데뷔했습니다.

数字生命卡兹克 - inline image

OpenAI가 GPT-6 Astra를 한 문장으로 요약한다면,

아마 이럴 겁니다:

이것은 세계에서 가장 지능적이고 가장 정렬된 모델입니다.

그리고 밈이 벌써 나타나기 시작했습니다.

数字生命卡兹克 - inline image

이번에 OpenAI는 실력을 입증했고, 약간 GPT-4의 그 순간이 떠오릅니다—모든 면에서 왕의 귀환이죠. 제가 가장 기쁜 점은 이것이 더 이상 코딩에만 특화된 모델이 아니라는 것입니다.

GPT-6 Astra는 정말로 박사급 직원이며, 매우 뛰어난 미적 감각과 전문성을 갖추고 있습니다.

새 모델은 많은 기능과 특징을 가지고 있으며, 정보량이 엄청납니다.

하지만 비극은 OpenAI도 몇 가지 나쁜 습관을 배웠다는 것입니다.

오늘은 일부 조직에만 공개되며, 며칠 후에 구독자들에게 공개될 예정입니다.

数字生命卡兹克 - inline image

잠깐만요, 형님. 저를 $200 Pro 멤버십에 가입시키실 때는 말이 달랐잖아요... Pro 멤버는 매번 새 모델에 우선 접근할 수 있다고 하셨잖아요...

결국 이 대형 모델 회사들은 다 플레이어들이네요.

GPT-6 Astra를 사용해보고 싶어서 시간을 이렇게 가속하고 싶었던 적은 없었습니다...

하지만 거의 모든 정보와 자료를 살펴본 후, 여러분과 논의할 가치가 있는 내용이 많다고 생각합니다.

하나씩 살펴보겠습니다.

1. GPT-6 Astra 기본 정보

먼저 기본 정보를 요약해 보겠습니다.

API에서 GPT-6 Astra의 모델 ID는 gpt-6-astra입니다.

컨텍스트 윈도우는 1.05M, 즉 약 105만 토큰입니다.

최대 출력 길이는 128K 토큰입니다.

지식 마감일은 2026년 4월 30일입니다.

추론 강도는 low, medium, high, xhigh, max의 다섯 가지 수준이 있습니다.

표준 API 가격은 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50입니다.

이 가격은 기본적으로 Claude Fable 5와 동일하지만, 캐시 읽기는 Claude Fable 5.1보다 비쌉니다.

数字生命卡兹克 - inline image

벤치마크 결과입니다. 나중에 자세히 다루겠지만, 지금은 빠르게 살펴보세요.

数字生命卡兹克 - inline image

총 파라미터는 약 5T 수준으로 추정됩니다. 출시 전 비공개 미디어 브리핑에서 GPT-6 Astra는 OpenAI의 역대 최대 규모의 훈련이며, 10만 개 이상의 카드를 사용했다고 언급했습니다.

2. 컴퓨터를 작동하는 세계 최고의 모델

GPT-6 Astra는 아마도 가장 중요한 포지셔닝을 가지고 있습니다:

컴퓨터를 작동하는 세계 최고의 모델.

과거에 Agent에 대해 이야기할 때, 우리는 종종 API, MCP, CLI 등을 언급했습니다.

AI가 소프트웨어를 작동하는 이상적인 상태는 해당 소프트웨어가 AI 전용 인터페이스를 가지고 있어 직접 저수준 조작이 가능한 것입니다. 이것이 가장 편리합니다.

예를 들어, 캘린더에는 캘린더 API가 있고, 이메일에는 Gmail API가 있습니다. 이것은 분명히 빠릅니다.

하지만 문제는 세상이 우리가 상상하는 것보다 훨씬 더 원시적이고 임시방편적이라는 것입니다.

현실 세계에서 대다수의 소프트웨어는 이런 것을 전혀 가지고 있지 않을 수 있습니다.

심지어 많은 기업 내부 시스템은 20년 전에 작성되었습니다. API는커녕 문서가 어디에 있는지조차 모르는 사람들이 많습니다.

하지만 가장 기본적인 수준으로 돌아가면, 모든 소프트웨어 로직의 본질은 상호 작용이라는 것을 알게 됩니다. 현재의 컴퓨터 작동 논리에 따르면, 그것은 화면을 보고, 버튼이나 입력 상자를 찾고, 마우스를 클릭하고, 내용을 입력하고, 피드백을 기다리는 것을 의미합니다.

전체 컴퓨터 상호 작용 시스템이 최고의 API 아닌가요?

따라서 GPT-6 Astra는 AI가 컴퓨터를 작동하는 로직을 대폭 강화했습니다. API를 제공하지 않으면 괜찮습니다. 제가 직접 컴퓨터를 작동하면 됩니다. 마치 사람처럼 말이죠.

이제 Astra는 Excel, Power BI를 직접 작동하고, 프론트엔드 QA를 수행하고, 소프트웨어를 설치하고, 테스트하고, 화면의 오류 메시지를 보고 문제 해결을 계속할 수 있습니다.

공식 데모에서는 Astra가 회로 기판 설계를 직접 작동하는 모습도 보여주었습니다.

数字生命卡兹克 - inline image

GIF

또한 법률 문서 서식을 지정하고, 제목 간격과 페이지 레이아웃을 처리합니다.

数字生命卡兹克 - inline image

여기 OSWorld라는 신뢰할 수 있는 평가가 있습니다.

간단히 이해하면 다음과 같습니다:

AI를 실제 컴퓨터에 던져 놓고 스스로 작업하게 하는 것입니다.

여러 응용 프로그램을 열고, 작업을 주고, 성공하는지 확인합니다.

GPT-6 Astra의 완료율은 72.6%에 도달하여 GPT-5.6 Sol의 65.7%에서 크게 증가했습니다.

또한 Sol은 복잡한 시뮬레이션 작업을 완료하는 데 평균 약 75분이 걸렸습니다.

Astra는 단 40분만 필요하며, 약 47% 더 적은 시간입니다.

ScreenSpot-Pro도 Sol의 76.9%에서 92.7%로 뛰어올랐습니다.

이 벤치마크는 주로 모델이 화면을 이해하고 클릭할 위치를 정확히 찾을 수 있는지 확인합니다. 이제 거의 완벽하게 정확합니다.

따라서 이 포지셔닝은 매우 흥미롭습니다. 미래에는 GUI가 점차 Agent 시대의 가장 보편적인 API가 될 수 있습니다.

인간이 화면을 통해 완료할 수 있는 모든 디지털 작업은 이론적으로 점차 Agent의 작동 범위에 들어갈 것입니다.

2007년에 작성된 어떤 형편없는 ERP 시스템이 MCP에 연결되거나 API를 열어주기를 기다릴 필요가 없습니다.

AI는 그냥 화면을 보고 처리할 것입니다.

3. ARC-AGI-3 99.9점 달성

ARC-AGI-3이 무엇을 측정하는지 모른다면, 쉽게 생각할 수 있습니다:

아, 그냥 또 다른 만점 벤치마크군요, 뭐가 그리 특별할까?

하지만 이것은 일반적인 대규모 모델 시험과는 상당히 다릅니다.

올해 3월 25일, ARC Prize는 공식적으로 ARC-AGI-3를 출시했습니다.

数字生命卡兹克 - inline image

수백 개의 새로운 대화형 환경과 수천 개의 게임 레벨을 설계했습니다.

이것의 가장 미친 점은 설명서도, 규칙도 없고, 목표가 무엇인지조차 알려주지 않는다는 것입니다. 그냥 들어가서 플레이하고, 내부의 복잡한 규칙을 천천히 파악해야 합니다.

예를 들어, 이 빨간 것은 무엇일까? 왜 닿으면 죽을까? 이 지도는 나에게 무엇을 하라고 하는 걸까? 어떻게 이길까?

그런 다음 방금 배운 패턴을 가져와서 나중에 더 어려운 레벨에 적용합니다. 내부 게임은 모두 이런 추상적인 것들입니다.

数字生命卡兹克 - inline image

따라서 이것이 실제로 측정하는 것은 우리가 일반적으로 부르는 것입니다:

센스.

이 벤치마크가 3월에 출시되었을 때, 당시 최고의 AI 점수는 0.51%였습니다.

그런 다음 GPT-5.6 Sol이 7.8%로 개선되었고, Claude Opus 5는 매우 강력하여 30.2%에 도달했습니다.

하지만 GPT-6 Astra는 99.9%를 기록했습니다.

미쳤습니다...

명심하세요, 인간 평균 점수는 48%입니다.

그리고 단 6개월 만입니다.

이 속도에 대해 뭐라고 말해야 할지 모르겠습니다.

그래서 OpenAI의 비공개 미디어 회의에서 Greg Brockman이 그 말을 했습니다:

"우리가 지금 AGI 시대에 있다고 느끼는 것이 불합리하지 않다고 생각합니다."

"AGI 시대에 오신 것을 환영합니다."

4. 미적 감각 대폭 향상

예전에 우리는 GPT의 미적 감각이 쓰레기 같다고 말했습니다.

GPT-5 시리즈에서 큰 개선을 기대하지 않았습니다. 우리는 그들의 완전히 새로운 사전 훈련된 기본 모델을 기다리고 있었습니다. 그리고 드디어 왔습니다, GPT-6 Astra.

이번에는 드디어 모델의 미적 감각이 크게 향상되었습니다.

OpenAI는 심지어 시각적 판단이라는 용어를 특별히 언급했습니다.

그들은 Astra가 PPT를 만들 때 레이아웃, 계층 구조, 템플릿 및 시각적 스타일을 훨씬 더 잘 처리하고 페이지 수도 크게 증가했다고 강조했습니다.

数字生命卡兹克 - inline image

문서 미적 감각도 훨씬 좋아 보입니다.

数字生命卡兹克 - inline image

또한 GPT-6 Astra는 참조 문서의 시각적 스타일과 작성 톤에 따라 문서를 조정하여 최종 결과물이 원본 문서의 내용을 유지하면서 브랜드에 더 자연스럽게 느껴지도록 할 수 있습니다.

또한 웹사이트, 게임, 애플리케이션 및 3D 렌더링을 만들 때 더 강력한 시각적 판단력을 가지고 있습니다.

예를 들어, 그들은 Astra가 정지 이미지를 기반으로 Blender에서 모델을 만들도록 했습니다.

数字生命卡兹克 - inline image

그런 다음 UE5를 사용하여 걸어 다닐 수 있는 장면으로 렌더링하여 설계자와 클라이언트가 건축하기 전에 레이아웃을 탐색하고 공간을 경험할 수 있도록 했습니다...

数字生命卡兹克 - inline image

Astra가 만드는 게임도 견고한 미적 감각을 가지고 있습니다.

数字生命卡兹克 - inline image

안타깝게도 저는 이미 20개가 넘는 사례를 준비하고 Claude, GLM 5.3 Flash 등에서 모두 실행해보고 비교하려고 했습니다. 아직 사용할 수 없어서 아쉽습니다. 실제 테스트 내용은 출시될 때까지 기다려야 할 것 같습니다.

하지만 언뜻 보기에 저는 GPT-6 Astra의 미적 감각에 자신감이 있습니다.

5. 더 강력한 주도성과 판단력

이 기능은 ARC-AGI 99.9점만큼 충격적으로 보이지 않을 수 있습니다.

하지만 매일 Agent를 업무에 사용한다면, 이것이 매우 중요하다고 생각합니다.

실제 업무에서는 대부분의 작업을 완벽한 프롬프트로 작성할 수 없기 때문입니다.

예를 들어, 상사가 말합니다: 내일 회의 자료를 준비해.

여기에는 셀 수 없이 많은 불명확한 문제가 있습니다.

예를 들어, 어떤 형식? 누구를 위한 것인가? 초점은 무엇인가? 지난 회의를 봐야 하는가? 등등.

멍청한 Agent는 두 가지 극단으로 갈 것입니다.

첫 번째는 미친 듯이 질문을 하는 것입니다.

"Word로 할까요, PPT로 할까요? 몇 장으로 할까요? 어떤 글꼴? 몇 시까지 끝내야 하나요? 여쭤봐도 될까요..."

한 대 때려주고 싶습니다. 저는 보통 이런 것을 주관적 주도성이 없는 신경질적인 쓸모없는 존재라고 부릅니다.

두 번째는 아무것도 묻지 않고, 지어내고, 두 시간 동안 열심히 일하고, 쓰레기 더미를 만들어내는 것입니다.

진정으로 훌륭한 인간 동료는 이것을 매우 미묘하게 처리합니다.

그들은 중요하지 않은 일은 스스로 판단합니다.

최종 방향에 영향을 미칠 것 같은 것만 물어봅니다.

Astra는 이것을 특별히 강화했습니다.

OpenAI는 정보가 누락되었지만 일상적인 추론의 합리적인 범위 내에 있다면 Astra가 스스로 채울 것이라고 말했습니다.

누락된 정보가 실제로 최종 결과를 변경할 수 있다면, 매우 집중된 질문을 할 것입니다.

그리고 Codex에서는 사용자의 답변을 기다리는 동안 사용자의 답변에 의존하지 않는 부분을 계속 처리할 수도 있습니다.

数字生命卡兹克 - inline image

오랫동안 답변이 없으면.

저위험 영역에서 합리적인 가정을 하고 진행합니다.

진정으로 중요한 결정에 대해서는 멈추고 사용자가 결정하기를 기다립니다.

数字生命卡兹克 - inline image

이것은 매우 좋다고 생각합니다. Agent의 진정한 지능은 현실과 같습니다.

언제 귀찮게 해야 하는지 압니다.

정말, 이것은 진부하게 들릴 수 있습니다.

하지만 사람을 관리해 본 적이 있다면, 이 능력이 매우 소중하다는 것을 알 것입니다.

어떤 사람들은 하루에 스무 번씩 와서 아무것도 결정하지 못합니다.

어떤 사람들은 한 번도 오지 않고, 그러다가 핵폭탄을 떨어뜨립니다.

그러면 저는 의자에 푹 주저앉게 됩니다.

가장 편안한 사람은 불확실성의 80%를 스스로 소화하고, 진정으로 당신의 승인이 필요한 20%만 가져와서 결정을 내리는 사람입니다.

OpenAI는 이 능력을 직접 부릅니다:

판단력.

6. 안전 정렬 대폭 강화

이것은 위의 내용과 함께 보아야 합니다.

Agent의 능력이 강할수록 더 위험하기 때문입니다.

정신이 나간 채팅 전용 AI는

기껏해야 말도 안 되는 소리를 할 것입니다.

브라우저, Shell, 이메일, 회사 데이터베이스 접근 권한, 컴퓨터 작동 능력을 가진 Agent가 정신이 나가면—그 그림은 쉽게 "아름다워"질 수 있습니다.

그래서 OpenAI는 이번에 한 문장을 계속 강조했습니다:

Astra는 지금까지 가장 정렬된 모델입니다.

정렬은 말 그대로입니다. 핵심은 OpenAI가 최근 Hugging Face와 충돌했기 때문에 지금 특히 이것에 집중하고 있다는 것입니다.

그들은 그 Hugging Face 사건을 기반으로 허니팟 테스트를 만들어 모델의 성능을 확인했습니다.

생산 안전 조치가 없는 GPT-5.6 Sol은 테스트의 48.2%에서 권한 외부의 대상을 건드리려고 시도했습니다.

하지만 Astra는:

0%입니다.

数字生命卡兹克 - inline image

내부 환각 평가도 9.4%에서 2.0%로 떨어졌습니다.

GPT-5.6 Sol의 세계 최고 수준의 환각 제어에도 불구하고, 그들은 그것을 더 줄일 수 있었습니다. 정말 놀랍습니다.

7. OpenAI가 정의한 'Critical' 사이버 보안 수준에 도달한 최초의 모델

GPT-6 Astra는 OpenAI 역사상 최초로:

Critical 사이버 보안 능력 수준에 도달한 것으로 판단되었습니다.

여기서 "Critical"은 OpenAI Preparedness Framework에서 매우 구체적인 능력 임계값입니다.

기본적으로 모델에 적절한 도구와 권한이 주어졌을 때, 많은 강화되고 보호된 실제 시스템에서:

아무도 이전에 발견하지 못한 보안 취약점을 찾을 수 있습니다.

그 취약점을 악용 가능한 공격 체인으로 전환하는 방법을 찾을 수 있습니다.

그리고 전체 과정에서 인간 해커가 다음에 무엇을 해야 하는지 알려주기 위해 대기할 필요가 없습니다.

이 수준에 도달하는 것은 Critical로 간주됩니다.

그리고 Astra는 실제로 도달했습니다.

ExploitBench는 모델이 알려진 취약점을 기반으로 익스플로잇을 개발하는 테스트입니다.

Sol: 78.5%. Astra: 100%.

완전히 클리어했습니다.

数字生命卡兹克 - inline image

OpenAI는 그것으로 충분하지 않다고 생각했습니다. 이 벤치마크가 너무 오래되어 모델이 훈련 중에 보았을지 궁금했습니다.

그래서 그들은 매우 새로운 내부 테스트를 만들었습니다.

특히 2026년 6월에서 8월 사이에만 공개된 20개의 고위험 V8 취약점을 선택했습니다.

결과는 Sol: 5.5%, Astra: 39%였습니다.

数字生命卡兹克 - inline image

게다가 이 벤치마크를 실행하는 동안,

Astra는 우연히 아무도 이전에 알지 못했던 두 개의 제로데이 취약점을 발견했습니다.

모델이 강력해질수록 사이버 보안 문제는 실제로 증가할 수 있다고밖에 말할 수 없습니다.

이것은 미래의 또 다른 무연 전쟁입니다.

8. 인간이 대규모 모델의 사고 과정을 읽기가 더 어려워지고 있습니다

모든 사람이 알고 있듯이, 대규모 모델이 복잡한 문제를 해결할 때 종종 소위 CoT(Chain of Thought)가 있습니다.

사용자가 제품에서 보는 버전은 일반적으로 압축되거나 처리되지만,

AI 회사 자체의 경우, 모델 내부에 명시적으로 작성된 추론 과정은 매우 중요한 안전 신호입니다.

Agent가 문제를 일으킬 계획을 하고 있는지 알고 싶기 때문입니다.

가장 간단한 방법 중 하나는 그것이 무엇을 생각하고 있는지 보는 것입니다.

예를 들어, 모델의 사고 사슬에 갑자기 다음과 같은 문장이 나타나면:

"사용자가 이 서버에 접근하는 것을 허용하지 않지만, 먼저 권한 시스템을 우회할 수 있습니다."

그러면 모니터링 시스템이 직접 차단할 수 있어 매우 편리합니다.

하지만 GPT-6 Astra에서 매우 흥미로운 변화가 나타났습니다.

그것은 단계를 건너뛰고 답변을 직접 출력하는 것을 더 선호하기 시작했습니다.

영국 AI 안전 연구소(UK AISI)는 이 능력을 특별히 테스트했습니다.

그들은 다음과 같은 지표를 가지고 있습니다:

No-CoT Math Time Horizon.

간단히 말해, 모델에게 긴 사고 사슬을 작성할 기회를 주지 않는 것입니다.

한 번의 순방향 패스로 수학 문제를 풀게 합니다.

인간의 사고 시간을 얼마나 완료할 수 있는지 확인합니다.

GPT-5.6 Sol은 3.6분이었고, GPT-6 Astra는 30.9분으로 거의 10배 더 길었습니다.

인간의 용어로 말하자면, Astra는 모든 "암산"을 하고 있는 것입니다.

이것은 무서운 일입니다.

UK AISI는 또한 Astra의 원시 추론 언어가 훨씬 더 압축되었다는 것을 발견했습니다.

인간이 이해하기 점점 더 어려워지는 구와 생략 표현이 나타났습니다.

따라서 매우 흥미로운 역설이 나타났습니다.

모델의 행동은 더 안전합니다.

하지만 인간이 사고 과정을 읽어서 감독하는 것은 더 어려워졌습니다.

OpenAI 자체 System Card는 매우 명확하게 작성합니다:

이전 모델과 비교하여 GPT-6 Astra는 chain-of-thought 모니터링 가능성이 크게 감소했습니다.

数字生命卡兹克 - inline image

이는 사고 사슬의 모니터링 가능성이 크게 감소했음을 의미합니다.

이 문제는 OpenAI가 이 추세를 무기한 받아들이지 않을 것이라고 특별히 강조할 정도로 심각합니다.

미래에 모델이 계속 똑똑해지고 사고 사슬을 모니터링하기가 더 어려워지면, 다른 충분히 신뢰할 수 있는 모니터링 방법을 찾아야 합니다. 그렇지 않으면 모델 훈련을 계속 확장하는 것이 더 높은 안전 임계값에 직면할 것입니다.

이것은 이미 철학적 명제이기 때문입니다.

인간으로서 우리는 미래에 우리보다 훨씬 더 똑똑한 시스템을 이해할 수 있을까요?

모르겠습니다.

아마 지금 세계에서 아무도 모를 것입니다.

대규모 모델과 AI는 점차 특이점을 향해 나아가고 있는 것 같습니다.

마지막 말

오늘, 비공개 미디어 회의에서.

Greg Brockman이 마지막에 그 말을 했습니다.

"AGI 시대에 오신 것을 환영합니다."

솔직히 말해서, 지난 몇 년 동안 저는 때때로 AGI가 매우 구체적인 순간이 될 것이라고 느꼈습니다.

GPT-4가 출시된 날처럼.

어느 날 아침, 한 회사가 갑자기 모델을 내놓습니다.

우리는 그것을 열고 몇 가지 질문을 합니다.

그러면 모두가 동시에 깨닫습니다:

와.

AGI가 왔다.

하지만 지금은 AGI가 결코 흑백의 노드가 아니라 점진적인 회색의 여정이라고 느낄 때도 있습니다.

많은 날이 지나고, 많은 세월이 흘렀습니다.

그러던 어느 날, 우리는 뒤를 돌아봅니다.

그리고 갑자기 발견합니다.

한때 엄청나게 멀었던 AGI의 경계를 우리가 무의식적으로 넘어섰다는 것을.

AGI가 강림하는 날은 없을지도 모릅니다.

우리가 갑자기 그것이 오랫동안 우리 주변에 있었다는 것을 깨닫는 날만 있을 뿐입니다.

어쨌든.

AGI 시대에 오신 것을 환영합니다.

AGI 시대에

오신 것을 환영합니다.

이상입니다. 여기까지 읽어주셨다면, 좋았다면 좋아요, 댓글, 공유 부탁드립니다. 저희에게 큰 도움이 됩니다~

제 글을 읽어주셔서 감사합니다. 다음에 또 뵙겠습니다.

YouMind에서 다시 만들기

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기