**
OpenAI는 GPT 6 Astra를 가장 강력하고 정렬된 모델이라고 설명합니다.
Greg Brockman은 더 나아가 Astra를 인공 일반 지능의 초기 형태로 보는 것이 합리적일 것이라고 말했습니다.
이 모델은 또한 사이버 보안 분야에서 OpenAI의 Critical 임계값을 최초로 돌파했습니다. 회사에 따르면, 이 모델은 이전에 알려지지 않은 취약점을 발견하고 제한된 인간의 지침으로 작동하는 익스플로잇을 구축할 수 있습니다.
이러한 주장은 극적이지만, 이번 릴리스에서 가장 중요한 부분은 아닙니다.
진정한 변화는 아키텍처에 있습니다.
기존 언어 모델은 고정된 순서의 트랜스포머 블록을 통해 정보를 전달하고 다음 토큰을 생성합니다. Astra는 사용자에게 단어 하나를 보여주기 전에 동일한 계산 블록을 통해 내부 상태를 여러 번 처리할 수 있습니다.
단순히 더 긴 사고 체인을 생성하는 것이 아닙니다.
답변하기 전에 더 많은 시간을 생각하는 것입니다.
1 현대 언어 모델의 작동 방식
다음을 입력한다고 상상해 보세요:
에베레스트는...
모델은 다음에 올 내용을 예측해야 합니다.
어텐션 메커니즘은 컨텍스트의 어떤 부분이 중요한지 결정합니다. 에베레스트라는 단어는 산, 고도, 히말라야, 네팔, 티베트, 등반, 탐험과 같은 관련 개념을 활성화합니다.
그런 다음 모델은 이러한 연관성을 주변 컨텍스트와 결합합니다. 대부분의 경우, "지구상에서 가장 높은 산"과 같은 연속이 매우 높은 확률이 됩니다.
기존 트랜스포머 내부에서 이 표현은 일련의 블록을 통해 이동합니다. 각 블록은 이를 한 번 변환하고 결과를 다음 블록으로 전달합니다.
모델에 40개의 블록이 포함된 경우, 숨겨진 상태는 순서대로 40개 모두를 통과합니다. 최종 표현은 다음 토큰에 대한 확률 분포로 변환됩니다.
더 많은 블록은 일반적으로 더 큰 계산 깊이를 의미합니다. 더 깊은 모델은 답변을 결정하기 전에 더 많은 변환을 수행할 수 있습니다.
하지만 블록을 추가하면 파라미터 수, 메모리 요구 사항 및 학습 비용도 증가합니다.
일반적인 가정은 간단했습니다: 더 깊은 모델을 원한다면 더 큰 레이어 스택을 구축해야 한다는 것입니다.
루프 아키텍처는 이 원칙을 변경합니다.
2 루프 아키텍처가 변경하는 것
The Information의 보도에 따르면, GPT 6 Astra는 루프 트랜스포머 아키텍처를 사용합니다.
OpenAI는 완전한 기술 사양을 공개하지 않았으므로 정확한 구현은 비공개로 남아 있습니다. 하지만 일반적인 메커니즘은 공개 연구를 통해 이미 잘 알려져 있습니다.
숨겨진 상태를 모든 블록을 통해 한 번만 보내는 대신, 모델은 결과를 계산 블록으로 반환하고 다시 처리할 수 있습니다.
내부 초안이라고 생각하면 됩니다.
모델은 예비 표현을 생성하고, 동일한 가중치를 통해 다시 보내고, 이를 개선하고, 이 과정을 여러 번 반복합니다. 루프가 완료된 후에만 다음 보이는 토큰이 나타납니다.

파라미터 수는 동일하게 유지됩니다. 가중치는 하나의 블록 내에 남아 있고, 계산은 루프 수에 따라 증가하며, 최종 토큰만 출력됩니다.
핵심 세부 사항은 파라미터 수가 반드시 증가하지 않는다는 것입니다.
동일한 가중치가 매 패스마다 재사용됩니다.
증가하는 것은 계산량입니다.
기존 트랜스포머에서 토큰은 서로 다른 블록의 시퀀스를 통해 이동합니다. 루프 트랜스포머에서는 동일한 공유 구조를 여러 번 통과할 수 있습니다.
모델은 파라미터 수를 늘리지 않고 계산을 통해 더 깊어집니다.
이는 새로운 트레이드오프를 만듭니다:
- 더 많은 파라미터는 더 많은 메모리를 필요로 함
- 더 많은 루프는 더 많은 계산을 필요로 함
- 하나의 모델이 다른 작업에 다른 양의 계산을 사용할 수 있음
마지막 요점은 특히 중요합니다. 계산 깊이는 새 모델을 만들지 않고도 변경될 수 있습니다.
3 반복 깊이 학습 방법
단순히 트랜스포머 블록을 루프 안에 배치하는 것만으로는 충분하지 않습니다.
모델이 학습 중에 항상 정확히 32번의 패스를 수행한다면, 각 단계의 위치에 의존하는 법을 배울 수 있습니다. 첫 번째 패스는 하나의 함수를, 열 번째는 다른 함수를, 서른두 번째는 고정된 출력 레이어가 될 수 있습니다.
결과는 루프로 위장한 기존의 32 레이어 네트워크가 될 것입니다.
연구자들은 학습 중 반복 패스 수를 다양화하여 이 문제를 해결합니다.
가장 명확한 시연 중 하나는 반복 깊이 모델 Huginn에서 나왔습니다. 제작자들은 약 8000억 개의 토큰으로 35억 파라미터 네트워크를 학습시켰습니다.
각 학습 단계에서 루프 수는 평균이 32 근처인 분포에서 샘플링되었습니다. 한 예는 4번의 패스를, 다른 예는 17번, 또 다른 예는 40번, 그리고 또 다른 예는 90번에 가까운 패스를 받을 수 있습니다.
모델은 어떤 패스가 마지막이 될지 미리 알 수 없었습니다.
따라서 고정된 작업 순서보다 더 일반적인 것을 학습해야 했습니다.
현재 내부 상태를 개선하는 방법을 학습해야 했습니다.

arXiv의 반복 깊이 논문 초록
수십 번의 반복 단계를 통해 학습하면 또 다른 문제가 발생합니다: 메모리입니다.
표준 역전파는 모든 루프의 중간 활성화를 저장해야 합니다. 충분한 반복이 있으면 메모리 비용이 엄청나게 커집니다.
Huginn 연구자들은 실용적인 절충안을 사용했습니다. 순방향 패스는 많은 루프 동안 실행될 수 있지만, 그래디언트는 마지막 8개를 통해서만 계산되었습니다.
이전 패스는 여전히 최종 결과에 영향을 미쳤지만, 완전한 활성화 기록을 메모리에 유지할 필요는 없었습니다.
이는 잘린 시간 역전파와 유사합니다. 차이점은 반복이 시퀀스의 단어 간이 아닌 계산 깊이에서 발생한다는 것입니다.

루프 수는 매 학습 단계마다 샘플링되며, 그래디언트는 마지막 8개 패스를 통해서만 계산됩니다.
모델은 32개의 고정된 작업 시퀀스를 수행하도록 학습되는 것이 아닙니다.
프로세스가 중단될 때와 관계없이 숨겨진 상태를 유용한 답변으로 이동시키도록 학습되는 것입니다.
이는 깊이의 의미를 변화시킵니다.
깊이는 더 이상 학습 전에 엔지니어가 선택한 속성만이 아닙니다. 추론 중에 변수가 될 수 있습니다.
4 추론 중 적응형 계산
현재 대부분의 추론 제어는 보이는 토큰 수준에서 작동합니다.
모델이 더 오래 생각하도록 요청받으면, 더 긴 사고 체인을 생성하고, 더 많은 출력 토큰을 사용하거나, 추가 중간 텍스트를 만듭니다.
루프 아키텍처는 다른 메커니즘을 제공합니다.
내부 패스 수는 가중치를 수정하거나 모델이 더 긴 설명을 작성하도록 강제하지 않고 변경될 수 있습니다.
간단한 작업은 4개의 루프를 받을 수 있습니다.
어려운 수학 증명은 32개의 루프를 받을 수 있습니다.
복잡한 코딩 문제는 64개의 루프를 받을 수 있습니다.
모델은 동일하게 유지됩니다. 내부 계산량만 변경됩니다.

가중치는 고정되어 있습니다. 각 토큰을 처리하는 데 사용되는 내부 패스 수만 변경됩니다.
공개된 반복 깊이 실험은 이미 예상된 패턴을 보여줍니다.
성능은 첫 번째 루프 동안 빠르게 향상됩니다. 그런 다음 이득은 곡선이 평탄해질 때까지 작아집니다.
이는 숨겨진 상태가 수렴되고 있음을 시사합니다.
초기 패스는 큰 수정을 합니다. 후기 패스는 작은 세부 사항을 개선합니다. 결국 추가 계산은 의미 있는 개선을 생성하지 않습니다.
미래 시스템은 그 순간을 자동으로 감지할 수 있습니다.
모든 프롬프트에 고정된 루프 수를 할당하는 대신, 모델은 숨겨진 상태가 충분히 안정될 때까지 처리를 계속할 수 있습니다. 쉬운 토큰은 저렴할 것입니다. 어려운 토큰은 더 많은 계산을 받을 것입니다.
이는 진정한 적응형 계산 깊이를 만들 것입니다.
더 오래 생각하는 것이 더 많이 쓰는 것을 의미하지 않게 될 것입니다.
5 연구 및 초기 실용적 결과
트랜스포머 레이어 재사용은 새로운 아이디어가 아닙니다.
Universal Transformers는 2018년에 반복 처리를 도입했습니다. ALBERT는 레이어 간 가중치 공유를 통해 파라미터 수를 줄였습니다. Mixture of Recursions은 다른 양의 계산을 통해 토큰을 라우팅하는 방법을 탐구했습니다.
공개된 Nanbeige4.2 3B 모델은 특히 직접적인 예를 제공합니다.
해당 구성에는 22개의 레이어와 num_loops: 2가 포함되어 있습니다. 사실상 모델은 해당 레이어를 두 번 통과합니다. 22 레이어 네트워크의 파라미터 수를 가지지만 약 44 레이어 네트워크의 계산 깊이를 가집니다.

Hugging Face의 Nanbeige4.2 3B 구성
22개 레이어, num_loops: 2, Apache 2.0 라이선스. 이 메커니즘은 이미 공개 모델 구성에서 볼 수 있습니다.
수년 동안 반복 트랜스포머 설계는 지배적인 접근 방식보다는 흥미로운 연구 아이디어로 남아 있었습니다.
부족했던 것은 강력한 스케일링 증거였습니다.
9월 1일, 연구자 그룹이 SMELT를 발표했습니다. 이는 일치된 조건에서 루프 트랜스포머와 기존 트랜스포머를 비교하기 위해 설계된 연구입니다.
파라미터 수, 학습 계산량, KV 캐시 크기를 제어했습니다. 이러한 제약 조건에서 루프 모델은 동일한 성능 수준에 도달하기 위해 6.8%에서 18% 적은 학습 계산량이 필요했습니다.
가장 큰 이득은 코드에서 나타났습니다.

arXiv의 SMELT 논문 초록
계산량, 파라미터, KV 캐시가 일치된 상태에서 루핑은 학습 계산량을 6.8%에서 18% 절약하며, 가장 강력한 이득은 코드에서 나타납니다.
연구자들은 또한 어텐션 동작의 변화를 관찰했습니다.
기존 트랜스포머에서 시퀀스의 가장 초기 토큰은 종종 어텐션 싱크가 됩니다. 의미적 중요성이 제한적일 때도 불균형적으로 많은 어텐션을 받습니다.
동일한 블록을 두 번째 통과한 후, 모델의 어텐션은 더 관련성 높은 토큰으로 이동했습니다.
두 번째 루프는 단순히 첫 번째를 반복하지 않았습니다. 첫 번째 패스의 결과를 더 선택적인 처리를 위한 기반으로 사용했습니다.
SMELT는 모든 미래 모델이 반복적이어야 한다는 것을 증명하지는 않습니다. 하지만 주요 실험 조건이 일치된 후에도 루핑이 경쟁력을 유지한다는 것을 보여줍니다.
더 이상 질문은 반복 깊이가 작동할 수 있는지 여부가 아닙니다.
질문은 그것이 얼마나 멀리 확장될 수 있는지입니다.
6 해석 가능성 및 제어
루프를 매력적으로 만드는 동일한 아키텍처 기능은 모델 모니터링을 복잡하게 만듭니다.
명시적인 사고 체인 추론을 사용하면 적어도 일부 중간 단계가 읽을 수 있는 텍스트로 나타납니다. 연구자들은 이를 검사하고, 의심스러운 패턴을 찾고, 명시된 추론과 최종 답변을 비교할 수 있습니다.
반복 모델은 텍스트를 생성하지 않고 숨겨진 활성화 내에서 더 많은 처리를 수행할 수 있습니다.
Buck Shlegeris와 Ryan Greenblatt는 이것이 사고 체인 모니터링의 유용성을 줄일 수 있다고 주장했습니다. 더 많은 처리가 숨겨진 계산으로 이동하면, 보이는 설명은 모델이 결과에 도달한 방법에 대해 덜 드러낼 수 있습니다.
Sebastian Raschka는 중요한 반론을 제시했습니다.
가중치 재사용이 자동으로 비밀 또는 접근 불가능한 인지를 생성하지는 않습니다. 내부 활성화는 여전히 해석 가능성 도구로 연구될 수 있습니다. 주요 차이점은 생성이 시작되기 전에 더 많은 계산이 발생하기 때문에 모델이 더 적은 보이는 중간 토큰이 필요할 수 있다는 것입니다.
OpenAI의 수석 과학자 Jakub Pachocki는 또한 Astra의 계산 그래프가 GPT 4의 깊이의 대략 2배 이내로 유지되며, 모니터링 기능을 보존하기 위해 루프가 의도적으로 제한되었다고 말했습니다.
이는 무제한 반복 프로세스보다는 제한된 구현을 시사합니다.
사고 체인은 어쨌든 모델의 내부 계산에 대한 충실한 기록이 보장되지 않습니다. 시스템은 유용한 답변을 생성하는 데 보상을 받으며, 모든 숨겨진 작업에 대한 과학적으로 정확한 보고서를 제공하는 데 보상을 받지 않습니다.
OpenAI, Anthropic, Google DeepMind를 포함한 연구에 따르면 모델의 설명이 중요한 요소를 생략하거나, 사후에 결정을 합리화하거나, 실제로 결과에 영향을 미친 경로보다 더 깔끔한 경로를 제시할 수 있습니다.
루프 아키텍처는 이 구분을 무시하기 어렵게 만듭니다.
보이는 추론은 인터페이스일 수 있습니다.
주요 계산은 텍스트가 나타나기 전에 모델 내부에서 발생할 수 있습니다.
7 GPT 6 Astra 결과
GPT 6 Astra의 가장 놀라운 벤치마크 결과는 ARC AGI 3에서 99.9%의 점수입니다.
그 숫자는 거의 최종처럼 들리지만, 테스트 실행 방식에 크게 의존합니다.
Simon Willison은 99.9% 결과가 OpenAI의 맞춤형 Provider Adapter 하네스에서 나왔다고 강조했습니다. 표준 ARC Prize 하네스에서 동일한 모델은 62.7%를 기록했습니다.
모델은 변경되지 않았습니다.
평가 환경이 변경되었습니다.

동일한 모델이 두 가지 다른 실행 비용으로 두 가지 다른 점수를 생성합니다.
OpenAI 실행 비용은 약 $19,000였습니다. 표준 실행 비용은 약 $26,000였습니다.
상당히 높은 점수는 또한 더 저렴한 설정에서 생성되었습니다.
이는 반드시 결과를 무효화하지는 않습니다. 맞춤형 어댑터는 모델과 더 효과적으로 상호 작용하거나 일반 평가 프레임워크가 놓치는 기능을 노출할 수 있습니다.
하지만 헤드라인 숫자는 이를 생성한 조건과 분리하여 해석될 수 없습니다.

ARC AGI 3의 GPT 6 Astra
하나의 모델, 두 개의 평가 하네스, 37.2% 포인트 차이.
다른 평가는 덜 극적입니다.
Artificial Analysis Intelligence Index에서 Astra는 GPT 5.6 Sol과 거의 비슷하고 Claude Fable 5.1보다 약 5포인트 낮습니다.
더 실용적인 이점은 에이전트 작업의 효율성일 수 있으며, 여기서 더 낮은 비용으로 경쟁력 있는 성능에 도달할 수 있습니다.
벤치마크는 모델이 달성할 수 있는 것을 보여줍니다. 아키텍처는 이러한 기능이 어디서 오는지와 어떻게 발전할 수 있는지 설명하는 데 도움이 됩니다.
8 이것이 AI의 미래에 의미하는 바
수년 동안 언어 모델 확장은 주로 파라미터 추가, 데이터 추가, 더 큰 고정 트랜스포머 블록 스택 구축을 의미했습니다.
매 새로운 세대는 더 커지고, 더 비싸지고, 실행하기 더 까다로워졌습니다.
GPT 6 Astra는 다른 경로를 가리킵니다.
모델은 동일한 파라미터를 재사용하고, 어려운 작업에 더 많은 계산을 할당하고, 첫 번째 단어를 생성하기 전에 내부 표현을 개선할 수 있습니다.
이는 모델 크기를 추론 깊이와 분리합니다.
하나의 고정된 계산 경로를 따르는 대신, 시스템은 특정 문제의 난이도에 따라 작업량을 조정할 수 있습니다.
이는 모델 성능과 AI 사용 경제학을 모두 변경할 수 있습니다. 동일한 지능이 간단한 요청에 대해 빠르고 저렴한 모드로 작동한 다음, 작업이 진정으로 더 많은 추론을 필요로 할 때 계산 깊이를 증가시킬 수 있습니다.
반복이 언어 모델로 돌아오고 있습니다. 이번에는 주로 단어 간이 아니라, 단어를 생성하는 프로세스 내부에서 작동합니다.
다음 세대의 시스템은 더 많은 파라미터를 포함하기 때문에 더 강력해지지 않을 수 있습니다.
그들의 결정적인 이점은 좋은 답변이 이미 발견되었을 때와 내부 루프를 한 번 더 돌 가치가 있을 때를 아는 것일 수 있습니다.
출처
- OpenAI의 GPT 6 Astra 발표
- GPT 6 Astra와 AGI에 대한 Greg Brockman
- GPT 6 Astra와 Critical 사이버 보안 임계값
- Ilya Sutskever의 추천 딥러닝 독서 목록
- Astra와 루프 트랜스포머에 대한 The Verge 보고서
- 잠재 추론으로 테스트 시간 계산 확장
- Mixture of Recursions
- Hugging Face의 Nanbeige4.2 3B
- SMELT 계산 일치 MoE 루프 트랜스포머에 대한 스케일링 법칙
- Astra의 추론 아키텍처에 대한 AI 안전 우려
- Astra와 루프 트랜스포머에 대한 Sebastian Raschka의 분석
- 사고 체인 모니터링 가능성
- GPT 6 Astra에 대한 Simon Willison의 분석





