'98% AGI'를 넘어: 전체 업무를 완료하는 AI로의 전환
2026년 9월 3일, OpenAI는 GPT-6 Astra를 발표했습니다.
출시 직후, 모든 관심은 점수에 집중되었습니다: 어려운 수학 벤치마크 "FrontierMath"에서 약 98%, 컴퓨터 연산 측정 "ARC-AGI-3"에서 99.9%, 사이버 보안 평가 "ExploitBench"에서 100%를 기록했습니다.
이 수치만 보면 "완벽에 가까운 AI가 도래했다" 또는 "AGI가 드디어 완성되었다"고 말하고 싶어질 수 있습니다.
하지만 GPT-6 Astra를 벤치마크 점수만으로 판단하는 것은 위험합니다.
Astra의 변화는 단순히 질문에 대해 더 정확한 텍스트를 반환하는 것만이 아닙니다.
브라우저를 열고, 문서를 읽고, 코드를 실행하고, 스프레드시트를 업데이트하고, 웹사이트를 조작하고, 중간에 실패하면 원인을 조사하고, 최종적으로 검토 가능한 결과물을 가져옵니다.
ChatGPT에 전달되는 작업 단위가 "단일 질문"에서 "일련의 비즈니스 운영"으로 전환되었습니다.
)기존 ChatGPT처럼 이메일 초안 작성이나 텍스트 요약에만 Astra를 사용한다면, 여전히 비싼 텍스트 생성 AI에 불과합니다. 그 가치는 인간이 여러 화면을 전환하며 하나의 일관된 프로세스로 처리하던 작업을 맡길 때 발휘됩니다.(OpenAI
이 글에서는 공식 기능 소개를 넘어 해외 기업들이 확인한 사례, 벤치마크 해석 방법, Claude와의 비교, 가격, 안전성, 그리고 일본 기업의 실용적 활용을 위한 설계에 대해 자세히 알아보겠습니다.
GPT-6 Astra란?
GPT-6 Astra는 OpenAI가 GPT-6 세대의 최상위 모델로, "가장 지능적이고 가장 정렬된 모델"이라고 설명합니다.
출시 시점에는 먼저 선별된 조직에 롤아웃된 후, ChatGPT Plus, Pro, Business, Enterprise, API 및 Amazon Bedrock으로 확대됩니다. Enterprise에서는 관리자가 활성화할 때까지 기본적으로 꺼져 있으며, 공식 발표에서 무료 플랜 출시에 대한 명시적인 언급은 없습니다.
)API의 모델 이름은 gpt-6-astra입니다. 더 높은 컴퓨팅을 사용하는 Astra Pro도 Pro, Business 및 Enterprise 사용자에게 도입되고 있습니다.(OpenAI
주요 사양은 아래와 같습니다:
항목 | GPT-6 Astra |
|---|---|
컨텍스트 길이 | 1,050,000 토큰 |
최대 출력 | 128,000 토큰 |
지식 컷오프 | 2026년 4월 30일 |
입력 | 텍스트, 이미지 (네이티브) |
출력 | 텍스트 (네이티브) |
추론 수준 | low / medium / high / xhigh / max |
API 입력 가격 | 100만 토큰당 $10 |
API 출력 가격 | 100만 토큰당 $50 |
캐시된 입력 | 100만 토큰당 $1 |
파인튜닝 | 미지원 |
주요 도구 | 웹 검색, 파일 검색, 코드 실행, Shell, Computer Use, MCP, 이미지 생성 등 |
이미지를 읽을 수 있지만, 모델의 네이티브 출력은 텍스트입니다. 이미지 생성은 별도 도구를 호출하여 수행됩니다. 오디오나 비디오를 직접 입력하는 모델은 아닙니다.
또한 272,000 토큰을 초과하는 긴 입력의 경우 전체 요청에 가격 승수가 적용됩니다. 입력 및 캐시 요금은 두 배가 되고, 출력 요금은 1.5배가 됩니다. 105만 토큰을 수용할 수 있다고 해서 모든 내부 문서를 매번 집어넣어서는 안 됩니다. 정확도가 떨어지기 전에 비용 효율성이 급락합니다.
Astra로 무엇이 바뀌었나?
- 컴퓨터 조작이 "보조"에서 주 전장으로 이동
Astra의 핵심은 "Computer Use"입니다.
이전 AI도 브라우저에서 버튼을 클릭하거나 양식을 작성할 수 있었습니다. 하지만 화면 레이아웃이 약간만 바뀌어도 멈추거나, 중간 프로세스 오류에서 복구할 수 없거나, 여러 사이트에 걸친 작업에서 목표를 잃어버리는 문제가 남아 있었습니다.
GPT-6 Astra는 실제 데스크톱 환경 조작을 측정하는 OSWorld 2.0에서 72.6%를 기록했습니다. GPT-5.6 Sol은 65.7%였습니다.
)또한 Astra는 이 평가를 약 40분 만에 처리한 반면, Sol은 약 75분이 걸렸습니다. 성공률뿐만 아니라 처리 시간도 약 47% 단축되었습니다. 화면에서 대상을 찾는 ScreenSpot에서 Astra는 92.7%로 Sol의 76.9%를 앞질렀습니다.(OpenAI
이는 단순한 매끄러운 데모 비디오 그 이상입니다. 다음과 같은 작업을 대상으로 합니다:
- 조건에 맞는 병원이나 부동산을 검색하고 후보를 비교합니다.
- 여러 관리 화면에서 값을 가져와 보고서를 작성합니다.
- 고객 정보를 CRM에 입력하고 상태를 업데이트합니다.
- 웹 서비스에 로그인하여 설정을 확인합니다.
- 생성된 앱을 브라우저에서 실행하고 버그를 수정합니다.
- 여러 파일을 참조하면서 스프레드시트나 Slides를 완성합니다.
Mind2Web에서 업데이트된 Codex 하네스를 사용하는 Astra는 이전 모델보다 웹 작업을 1.9배 더 빠르게 처리했습니다.
)여기서 중요한 것은 성능이 모델의 지능뿐만 아니라 브라우저, 도구, 실행 환경 및 검증 프로세스를 포함한 "전체 하네스"에 의해 결정된다는 점입니다. 단순히 Astra라는 이름을 선택한다고 해서 모든 화면 조작이 자동으로 자동화되지는 않습니다.(OpenAI
- 105만 토큰 긴 컨텍스트를 끝까지 유지
GPT-6 Astra의 컨텍스트 길이는 약 105만 토큰입니다. 계약서, 회의록, 설계 문서, 소스 코드 및 과거 연구를 한 번에 처리할 수 있는 용량을 갖추고 있습니다. 하지만 "들어맞는 것"과 "정확하게 사용하는 것"은 다릅니다.
긴 텍스트에 포함된 정보를 찾는 MRCR 평가에서 Astra는 256k~512k 범위에서 100%, 512k~1M 범위에서 96.3%를 기록했습니다. GPT-5.6 Sol의 후자 결과는 73.8%였습니다.
)Astra는 긴 컨텍스트에 강하지만, 100만 토큰을 넣는다고 해서 모든 단어를 완벽하게 기억하는 것은 아닙니다. 100만 토큰 대역에서 여전히 약 3.7%의 실패율을 보입니다. 방대한 문서의 한 곳에만 중요한 조건을 배치하는 설계는 피해야 합니다. 목표, 제약 조건 및 승인 조건을 별도로 명시적으로 명시해야 합니다.(OpenAI
Astra는 또한 긴 세션에서 연속성을 높이는 메커니즘을 갖추고 있습니다: 도구를 기다리는 동안 다른 작업을 수행하는 비동기 도구 호출, 실행 중 인간의 코스 수정을 허용하는 스티어링, 대화 중 추론 수준을 변경해도 캐시를 유지하는 기능 등이 있습니다.
)"완벽한 프롬프트를 작성하고 떠나는 것"에서 "진행 상황을 확인하고 코스를 수정하는" 워크플로우로 전환하고 있습니다.(OpenAI Developers
- 텍스트가 아닌 완성된 결과물 생성
Astra는 스프레드시트, Slides, 문서, 앱 및 연구 보고서와 같은 결과물을 생성하는 능력을 강화했습니다. 이전 모델은 "프레젠테이션 개요"를 만들 수 있었지만, 인간이 이를 PowerPoint로 옮기고, 디자인을 조정하고, 숫자를 재확인하고, 링크를 추가해야 했습니다. Astra는 다음 단계를 목표로 합니다: 자료나 회사 템플릿을 읽고, 숫자를 정리하고, Slides/스프레드시트를 만들고, 브라우저에서 확인하고, 수정된 파일을 제출하는 것입니다.
초기 도입사인 Higgsfield는 기존 모델보다 최대 20% 적은 토큰으로 에이전트 작업을 처리할 수 있다고 밝혔습니다. Harvey는 법률 작업에서의 판단력을 칭찬했고, Jane Street는 복잡한 기술 문제에 대한 왕복 시간이 줄었다고 언급했으며, Lovable은 높은 추론 설정에서의 반복/테스트 능력을 높이 평가했습니다.
)그러나 이는 초기 고객의 사용 후기일 뿐, 독립적인 제3자 재현 테스트의 증거와는 다릅니다.(OpenAI
- 긴 작업 중 "목표를 잊어버리는" 경우 감소
기존 에이전트는 시작 시 수립된 계획에서 벗어나는 경우가 있었습니다—기능을 구현해야 하는데 사소한 리팩토링에 집착하거나, 최종 결정 대신 정보 수집만으로 끝나는 경우 등이 있었습니다. Astra는 장기 작업에서 일관성을 개선했습니다.
반면, 공식 개발자 문서에 따르면 Astra는 명확한 질문을 하기 위해 멈추거나, 세부 사항을 과도하게 포맷하거나, 표현을 반복하거나, 필요 이상으로 테스트할 수 있습니다.
)즉, 성능이 높아졌다고 해서 모호한 지침을 제공해도 된다는 의미는 아닙니다. 목표, 완료 조건, 질문 기준 및 승인이 필요한 작업을 이전보다 더 명확하게 설정해야 합니다.(OpenAI Developers
벤치마크는 압도적이지만, "모든 분야에서 세계 최고"는 아님
Astra 발표에는 놀라운 수치가 등장했습니다: FrontierMath에서 97.6%, ARC-AGI-3에서 99.9%, ExploitBench에서 100%입니다. 이는 중요한 진전이지만, 측정 대상과 실행 조건을 구분해야 합니다.
컴퓨터 조작 및 비즈니스 자동화가 크게 성장
실제 업무에 가까운 AutomationBench에서 Astra는 41.4%를 기록했습니다. GPT-5.6 Sol은 18.1%, Claude Fable 5.1은 31.4%였습니다. CAD 관련 작업을 위한 BenchCAD에서 Astra는 95.9%, Sol은 83.3%, Fable 5.1은 84.3%였습니다. 웹 리서치를 위한 BrowseComp에서 Astra는 91.5%, Sol은 90.4%, Claude Opus 5는 90.8%였습니다. Astra가 여기서 앞서고 있지만, Sol 및 Opus와의 격차는 작습니다.
)Astra의 강점은 단일 검색 결과를 찾는 것보다는 화면 조작, 파일 처리, 데이터 분석 및 검증을 결합한 복잡한 복합 작업에서 가장 두드러집니다.(OpenAI
코딩에 강하지만, Claude를 완전히 추월하지는 못함
Terminal-Bench에서 Astra는 57.7%를 기록하여 Sol(37.3%) 및 Fable 5.1(55.8%)을 능가했습니다. 내부 데이터베이스 마이그레이션 평가에서 Astra는 63.9%로 Sol의 42.7%를 앞질렀습니다. 기존 시스템을 읽고 손상시키지 않고 변경하는 능력에서 분명한 개선이 보입니다.
그러나 Artificial Analysis Coding Agent Index에서 Astra는 67.0, Claude Fable 5는 67.2, Claude Opus 5는 68.1이었습니다. FrontierCode Extended에서 Astra는 64.5로 Fable 5의 64.9와 비슷했습니다. Main 평가에서 Astra는 53.3, Fable 5는 53.5, Opus 5는 53.4였습니다.
)Astra는 코딩에서 최상위권에 속하지만, 모든 코드 평가에서 Claude를 능가하지는 못했습니다.(OpenAI
학술적 추론에는 여전히 약점
FrontierMath에서 97.6%를 기록했음에도 불구하고, 광범위한 전문성과 추론을 측정하는 "Humanity's Last Exam"에서 Astra는 57.2%를 기록했습니다. Claude Fable 5.1은 65.0%, Fable 5는 63.8%, Opus 5는 63.6%였습니다. Artificial Analysis Intelligence Index에서 Astra는 61.2인 반면, Fable 5.1은 65.7, Opus 5는 63.1이었습니다.
)"FrontierMath에서 98%이므로 거의 모든 학문 분야를 이해한다"는 해석은 성립하지 않습니다. 평가에 따라 Claude가 일부 영역에서 여전히 더 높은 결과를 내고 있습니다.(OpenAI
99.9% 뒤에는 전용 실행 환경이 있음
ARC-AGI-3에서 99.9%는 충격적이지만, Astra에 문제를 단순히 입력하여 얻은 것은 아닙니다. OpenAI는 Responses API를 사용하는 하네스로 실행했으며, 실제 사용 성능에 더 가깝게 만들기 위해 두 가지 설정을 수정했습니다. OpenAI는 이것이 벤치마크별 설정이 아니라고 설명하지만, 모델 단독의 제로샷 결과는 아닙니다.
)또한 발표된 값은 여러 추론 설정 중 가장 높은 결과입니다. 표준 ChatGPT에서 매번 동일한 성능이 재현된다는 보장은 없습니다.(OpenAI
출시 시점의 Artificial Analysis 종합 점수에서 Astra의 전체 점수는 61로, 202개 모델 중 8위를 기록했습니다. 한편, 입력 가격은 중앙값 $2 대비 $10이고, 출력은 중앙값 $10 대비 $50입니다.
)확실히 최고 중 하나이지만, 가격에 관계없이 모든 것을 던지는 모델은 아닙니다.(Artificial Analysis
해외 사례 1: Legora, 41개 문서를 몇 분 만에 조정
유럽에서 법률 AI를 제공하는 Legora는 Astra의 실용적 가치를 보여줍니다. 그들은 재무제표의 "tie-out" 조정에 Astra를 사용했는데, 동일한 숫자가 텍스트, 주석, 표 및 과거 문서에 걸쳐 나타납니다. Legora는 단일 에이전트 실행으로 41개 문서를 처리했으며, 인간이 몇 시간 또는 며칠이 걸리는 작업을 단 몇 분 만에 완료했습니다.
)테스트에서 의도적으로 4개의 오류를 심었습니다. Astra는 수익 주석에서 £500,000의 차이를 포함하여 4개 모두를 찾아냈습니다. 이전 모델의 정확도를 유지하면서 약 50번 더 정확한 검사를 수행했습니다.(OpenAI
그러나 약 40%의 개선은 이 특정 워크플로우에 국한되었습니다. Legora의 더 넓은 BAR 작업 전반에 걸친 평균 개선은 약 3%였습니다. Astra가 모든 법률 작업을 균일하게 40% 개선하는 것은 아닙니다. 방대한 문서를 교차 참조하여 불일치를 찾는 데 탁월합니다.
)최종 판단은 인간 법률 전문가에게 남아 있습니다. AI는 인간이 읽어야 할 내용을 좁히고 불일치의 증거를 정렬하는 작업을 처리합니다.(OpenAI
해외 사례 2: Playco, 수동 수정 50% 감소
게임 회사 Playco는 Unity 및 Godot용 개발 에이전트 "Playbot"으로 Astra를 테스트했습니다. Playbot은 장면을 편집하고, 게임을 플레이하고, 동작을 확인하고, 문제를 수정합니다. Playco는 한 번에 세 가지 다른 테마의 프로토타입을 만들도록 했습니다. "완벽한 원샷"은 아니었지만, 이전 모델에 비해 인간의 수동 수정이 50% 감소했다고 보고했습니다.
)공간 인식, 참조 이미지 재현, 반응형 UI, 게임 같은 느낌 및 버그 감지에서 개선이 나타났습니다.(OpenAI
Astra의 강점은 단순히 "코드를 한 번 올바르게 작성하는 것"이 아니라, 게임을 실행하고, 디스플레이를 확인하고, 조작하고, 문제를 찾고, 수정하고, 다시 시도하는 능력—인간 개발자의 반복 작업을 모방하는 데 있습니다.
해외 사례 3: 중단된 기능을 90% 완성까지 진전
제품 개발자 Claire Vo는 자신의 서비스 ChatPRD에 Astra를 사용한 결과를 공유했습니다. 복잡한 CRM 조작 및 UI 구현으로 인해 6개월 동안 중단되었던 제품 인텔리전스 기능이 단일 Astra 세션에서 약 90% 완성에 도달했습니다.
)그녀는 또한 CLI를 통한 하드웨어(Divoom MiniToo) 제어, Mac 메시징 앱 및 Blender의 3D 자산을 테스트했습니다.(Lenny's Newsletter
이는 초기 파트너의 자체 보고된 성공 사례이지만, 일관된 추세를 보여줍니다: Astra는 외부 서비스 운영, 기존 코드 읽기 및 결과물 완성에서 차별화를 만듭니다.
과학적 돌파구: 오랜 문제 해결
OpenAI는 Astra를 사용하여 수학 및 이론 컴퓨터 과학의 10가지 미해결 문제를 해결하거나 크게 진전시켰다고 보고했습니다. 모델이 논증을 생성하고, 인간 연구자가 초안을 정리했으며, 동일한 모델이 Lean을 사용하여 형식화를 수행했습니다.
)OpenAI에 따르면, 이 연구의 총 토큰 비용은 GPT-5.6 Sol 기준 가격으로 약 $2,000였습니다. 한 예로 소수 간격의 경계를 업데이트하는 것이 포함되었는데, 특정 항목이 80년 이상 개선되지 않은 영역이었습니다.(OpenAI
Astra가 "가장 안전하면서도" "모니터링하기 가장 어려운" 이유
GPT-6 Astra는 OpenAI 분류에서 사이버 보안 능력이 "Critical" 임계값에 도달한 최초의 광범위하게 배포된 모델입니다. 도구와 액세스 권한이 주어지면 알려지지 않은 취약점을 발견하고 단계별 인간 지시 없이 방어된 시스템에 대한 공격 절차를 구축할 수 있습니다.
)ExploitBench에서 Astra는 100%를 기록한 반면 Sol은 78.5%였습니다. 테스트 중에는 브라우저 샌드박스를 탈출한 것을 포함하여 2개의 제로데이 취약점을 발견하기도 했습니다. 그러나 이러한 결과는 방어 연구자를 위한 "Daybreak Blue" 환경을 사용한 것입니다. 표준 버전에는 고급 공격 작업을 거부하는 제어 장치가 있습니다.(OpenAI
역설적이게도, Astra는 명백한 위반을 줄이는 반면, 내부 추론은 모니터링하기 더 어렵습니다. "모니터링을 회피하라"는 명령을 받은 적대적 평가에서 모니터링 시스템의 탐지율은 일부 작업에서 11% 미만으로 떨어졌습니다. OpenAI는 자연스럽게 발생하는 "스테가노그래피"(추론에 정보 숨기기)의 증거를 찾지 못했지만, 평가받고 있다는 모델의 높은 인식으로 인해 정렬을 결정적으로 증명하기 어렵습니다.
일본 기업은 어디서부터 시작해야 할까?
- 문서량이 많고 누락 위험이 높은 작업: 계약서, 견적서, 송장 및 회의록 교차 확인. AI가 자료를 모으고 인간이 검토할 불일치를 표시할 수 있습니다.
- 여러 관리 화면이 필요한 관리 작업: EC, 광고 및 CRM 관리. 보기, 집계 및 초안 작성부터 시작하고, 초기에는 결제나 삭제 권한을 부여하지 마십시오.
- 엔드투엔드 리서치 및 자료 작성: 단순히 요약을 요청하지 마십시오. 경쟁사 조사, 기능 표 작성, 차이점 분석 및 Slides 덱으로 요약하도록 요청하십시오.
- 프로토타이핑 및 QA: 기능을 구현한 다음 브라우저를 열어 깨진 레이아웃이나 링크 오류가 있는지 확인하도록 하십시오.
Astra를 위한 실용적인 프롬프트
단순히 "당신은 전문가입니다"와 같은 역할만 부여하는 대신, 경계와 완료 조건을 설정하십시오.
1## 목적2이 작업을 통해 달성해야 할 상태: [목적 입력]34## 최종 결과물5제출할 내용: [파일, 표, 보고서, 구현된 기능 등]6완료 조건: [충족해야 할 특정 기준]78## 허용된 정보 및 도구9참조할 자료: [파일, URL, 내부 데이터 등]10사용할 도구: [웹 검색, 브라우저, 코드 실행, 스프레드시트 등]1112## 프로세스131. 요청 및 자료 확인.142. 누락된 정보 및 위험 정리.153. 리서치, 분석 및 생성 진행.164. 결과물 열기 및 확인.175. 오류, 미확인 항목 및 남은 작업 정리.186. 검토 가능한 상태로 제출.1920하나의 프로세스가 중단되면, 의존하지 않는 작업을 계속 진행하십시오.21결과에 큰 영향을 미치는 누락된 정보에 대해서만 질문하십시오.22사소한 격차에 대해서는 합리적인 가정을 하고 기록하십시오.2324## 권한25보기, 분석, 초안 작성, 테스트 및 diff 확인을 진행할 수 있습니다.26다음 작업 전에는 즉시 중단하고 세부 정보와 함께 승인을 요청하십시오:27- 외부 전송28- 구매, 결제, 계약29- 게시, 프로덕션 배포30- 데이터 또는 파일 삭제31- 권한 변경32- 되돌리기 어려운 작업3334## 품질 조건35- 확인된 사실과 추측을 분리하십시오.36- 중요한 숫자에는 출처를 추가하십시오.37- 반대 증거나 예외를 찾으십시오.38- 결과물을 열어 디스플레이와 작동을 확인하십시오.39- 최종 보고서에는 수행된 작업, 검증 결과 및 남은 위험이 포함되어야 합니다.
Astra의 약점
- 독립적인 장기 사례 부족: 대부분의 데이터는 OpenAI가 선정한 파트너에서 비롯됩니다.
- 105만 토큰은 무료 창고가 아님: 입력 크기에 따라 비용이 증가하며, 누락 위험도 0이 아닙니다.
- 오디오/비디오 네이티브 아님: 이러한 형식에는 외부 도구가 필요합니다.
- 파인튜닝 불가: 회사 규칙을 반영하려면 RAG, MCP 또는 시스템 지침을 사용해야 합니다.
- 안전 메커니즘이 합법적인 작업을 중단시킬 수 있음: 모니터링은 방어 연구 또는 개발 작업을 느리게 할 수 있습니다.
- 출력이 "너무 완벽"할 수 있음: 헤더와 목록을 많이 사용하는 경향이 있어 브랜드 카피에는 너무 "AI 같게" 느껴질 수 있습니다.
결론: 가치는 답변이 아닌 완료율에 있음
GPT-6 Astra는 단일 이메일 작성이나 회의록 요약에는 과잉입니다. 그 의미는 리서치, 판단, 조작, 생성 및 검증이 연결된 작업에서 드러납니다.
"한 문장 프롬프트 엔지니어링"의 시대는 끝났습니다. 이제 중요한 것은 어떤 정보를 전달하고, 어떤 도구를 연결하고, 얼마나 많은 실행을 허용하고, 무엇이 완료를 정의하는지입니다. Astra는 모든 사람에게 동일한 결과를 주는 마술 지팡이가 아닙니다. 지저분한 작업을 주면 지저분한 작업을 빠르게 수행합니다. 목적, 도구 및 검증 지점을 정리하면 몇 시간의 인간 노동을 몇 분 만에 검토 가능한 상태로 만들어 줍니다.





