Как на самом деле мыслит GPT 6 Astra

@Mikadzyki_NFT
АНГЛИЙСКИЙ08 сент. 2026 г.
955K
83
16
16
142

Суть

В GPT 6 Astra представлена архитектура циклического трансформера, которая позволяет модели повторно использовать веса и обрабатывать внутренние состояния несколько раз перед выводом текста. Это отделяет количество параметров от вычислительной глубины, обеспечивая адаптивные вычисления во время инференса.

**

OpenAI описывает GPT 6 Astra как свою самую мощную и выверенную модель на сегодняшний день.

Грег Брокман пошел еще дальше, заявив, что было бы разумно рассматривать Astra как раннюю форму общего искусственного интеллекта.

Модель также стала первой, преодолевшей критический порог OpenAI в области кибербезопасности. По словам компании, она способна обнаруживать ранее неизвестные уязвимости и создавать рабочие эксплойты при минимальном участии человека.

Эти заявления впечатляют, но они не являются самой важной частью релиза.

Настоящее изменение — архитектурное.

Обычная языковая модель пропускает информацию через фиксированную последовательность блоков трансформера и генерирует следующий токен. Astra может обрабатывать свое внутреннее состояние через одни и те же вычислительные блоки несколько раз, прежде чем показать пользователю хотя бы одно слово.

Она не просто генерирует более длинную цепочку рассуждений.

Она тратит больше времени на размышления, прежде чем ответить.

1 Как работают современные языковые модели

Представьте, что вы вводите:

Эверест — это...

Модель должна предсказать, что будет дальше.

Ее механизм внимания определяет, какие части контекста важны. Слово «Эверест» активирует связанные понятия: горы, высота, Гималаи, Непал, Тибет, восхождения, экспедиции.

Затем модель объединяет эти ассоциации с окружающим контекстом. В большинстве случаев продолжение вроде «самая высокая гора на Земле» становится высоковероятным.

Внутри обычного трансформера это представление проходит через последовательность блоков. Каждый блок преобразует его один раз и передает результат следующему.

Если модель содержит 40 блоков, скрытое состояние проходит через все 40 по порядку. Финальное представление преобразуется в распределение вероятностей для следующего токена.

Больше блоков обычно означает большую вычислительную глубину. Более глубокая модель может выполнить больше преобразований, прежде чем принять решение.

Но добавление блоков также увеличивает количество параметров, требования к памяти и стоимость обучения.

Обычное предположение было простым: если вам нужна более глубокая модель, вам нужно построить более крупный стек слоев.

Циклическая архитектура меняет этот принцип.

2 Что меняет циклическая архитектура

Согласно сообщениям The Information, GPT 6 Astra использует циклическую архитектуру трансформера.

OpenAI не публиковала полную техническую спецификацию, поэтому точная реализация остается закрытой. Но общий механизм уже хорошо изучен в открытых исследованиях.

Вместо того чтобы отправлять скрытое состояние через каждый блок только один раз, модель может вернуть результат в вычислительный блок и обработать его снова.

Думайте об этом как о внутреннем черновике.

Модель создает предварительное представление, снова пропускает его через те же веса, уточняет и повторяет процесс несколько раз. Только после завершения цикла появляется следующий видимый токен.

Mikadzyki🌙 - inline image

Количество параметров остается прежним. Веса остаются внутри одного блока, вычисления растут с количеством циклов, и только финальный токен выдается наружу.

Ключевая деталь в том, что количество параметров не обязательно увеличивается.

Одни и те же веса используются повторно на каждом проходе.

Увеличивается объем вычислений.

В обычном трансформере токен проходит через последовательность разных блоков. В циклическом трансформере он может проходить через одну и ту же общую структуру несколько раз.

Модель становится глубже за счет вычислений, не становясь больше за счет количества параметров.

Это создает новый компромисс:

  • Больше параметров требует больше памяти
  • Больше циклов требует больше вычислений
  • Одна модель может тратить разный объем вычислений на разные задачи

Последний пункт особенно важен. Вычислительная глубина может меняться без создания новой модели.

3 Как обучается рекуррентная глубина

Простое помещение блока трансформера в цикл недостаточно.

Если модель всегда выполняет ровно 32 прохода во время обучения, она может научиться полагаться на позицию каждого шага. Первый проход может выучить одну функцию, десятый — другую, а тридцать второй может стать фиксированным выходным слоем.

Результатом будет обычная 32-слойная сеть, замаскированная под цикл.

Исследователи решают эту проблему, варьируя количество рекуррентных проходов во время обучения.

Одна из самых наглядных демонстраций была получена на модели рекуррентной глубины Huginn. Ее создатели обучили сеть с 3,5 миллиардами параметров на примерно 800 миллиардах токенов.

На каждом шаге обучения количество циклов выбиралось из распределения со средним значением около 32. Один пример мог получить четыре прохода, другой — 17, третий — 40, а четвертый — около 90.

Модель не могла заранее знать, какой проход будет последним.

Поэтому ей пришлось научиться чему-то более общему, чем фиксированная последовательность операций.

Ей пришлось научиться улучшать свое текущее внутреннее состояние.

Mikadzyki🌙 - inline image

Аннотация из статьи о рекуррентной глубине на arXiv

Обучение через десятки рекуррентных шагов создает еще одну проблему: память.

Стандартное обратное распространение потребовало бы хранения промежуточных активаций из каждого цикла. При достаточном количестве повторений затраты памяти становятся огромными.

Исследователи Huginn использовали практический компромисс. Прямой проход мог выполняться для многих циклов, но градиенты вычислялись только для последних восьми.

Более ранние проходы все еще влияли на конечный результат, но их полная история активаций не должна была оставаться в памяти.

Это похоже на усеченное обратное распространение во времени. Разница в том, что рекуррентность происходит по вычислительной глубине, а не по словам в последовательности.

Mikadzyki🌙 - inline image

Количество циклов выбирается на каждом шаге обучения, а градиент вычисляется только для последних восьми проходов.

Модель не учат выполнять жесткую последовательность из 32 операций.

Ее учат перемещать свое скрытое состояние в сторону полезного ответа независимо от того, когда процесс будет остановлен.

Это меняет значение глубины.

Глубина больше не является только свойством, выбранным инженерами до обучения. Она может стать переменной во время инференса.

4 Адаптивные вычисления во время инференса

Большинство современных механизмов управления рассуждениями работают на уровне видимых токенов.

Если модель просят подумать дольше, она генерирует более длинную цепочку рассуждений, использует больше выходных токенов или создает дополнительный промежуточный текст.

Циклическая архитектура предлагает другой механизм.

Количество внутренних проходов может меняться без изменения весов и без принуждения модели к написанию более длинного объяснения.

Простая задача может получить четыре цикла.

Сложное математическое доказательство может получить 32.

Сложная задача по программированию может получить 64.

Модель остается той же. Меняется только объем внутренних вычислений.

Mikadzyki🌙 - inline image

Веса остаются фиксированными. Меняется только количество внутренних проходов, используемых для обработки каждого токена.

Публичные эксперименты с рекуррентной глубиной уже показывают ожидаемую закономерность.

Производительность быстро улучшается в течение первых циклов. Затем улучшения становятся меньше, пока кривые не приближаются к плато.

Это говорит о том, что скрытое состояние сходится.

Ранние проходы вносят большие коррективы. Поздние проходы уточняют мелкие детали. В конце концов, дополнительные вычисления перестают давать значимые улучшения.

Будущая система могла бы автоматически обнаруживать этот момент.

Вместо того чтобы назначать каждому запросу фиксированное количество циклов, модель могла бы продолжать обработку, пока ее скрытое состояние не станет достаточно стабильным. Легкие токены были бы дешевыми. Сложные токены получали бы больше вычислений.

Это создало бы настоящую адаптивную вычислительную глубину.

Думать дольше больше не означало бы писать больше.

5 Исследования и первые практические результаты

Повторное использование слоев трансформера — не новая идея.

Универсальные трансформеры (Universal Transformers) представили рекуррентную обработку в 2018 году. ALBERT уменьшил количество параметров за счет совместного использования весов между слоями. Mixture of Recursions исследовал маршрутизацию токенов через разный объем вычислений.

Открытая модель Nanbeige4.2 3B предоставляет особенно наглядный пример.

Ее конфигурация содержит 22 слоя и num_loops: 2. По сути, модель проходит через эти слои дважды. Она имеет примерно такое же количество параметров, как 22-слойная сеть, но примерно такую же вычислительную глубину, как 44-слойная сеть.

Mikadzyki🌙 - inline image

Конфигурация Nanbeige4.2 3B на Hugging Face

Двадцать два слоя, num_loops: 2 и лицензия Apache 2.0. Механизм уже виден в конфигурации открытой модели.

Долгие годы рекуррентные архитектуры трансформеров оставались интересными исследовательскими идеями, а не доминирующим подходом.

Не хватало убедительных доказательств масштабирования.

1 сентября группа исследователей опубликовала SMELT — исследование, предназначенное для сравнения циклических и обычных трансформеров в сопоставимых условиях.

Они контролировали количество параметров, вычислительные затраты на обучение и размер KV-кэша. При этих ограничениях циклические модели требовали на 6,8%–18% меньше вычислительных ресурсов для обучения, чтобы достичь того же уровня производительности.

Наибольший выигрыш был получен на задачах с кодом.

Mikadzyki🌙 - inline image

Аннотация из статьи SMELT на arXiv

При сопоставимых вычислительных затратах, параметрах и KV-кэше циклирование экономит от 6,8% до 18% вычислительных ресурсов на обучение, причем наибольший выигрыш достигается на коде.

Исследователи также заметили изменение в поведении внимания.

В обычных трансформерах самые первые токены в последовательности часто становятся «поглотителями внимания». Они получают непропорционально много внимания, даже если их семантическая важность ограничена.

После второго прохода через те же блоки внимание модели сместилось в сторону более релевантных токенов.

Второй цикл не просто повторил первый. Он использовал результат первого прохода как основу для более избирательной обработки.

SMELT не доказывает, что каждая будущая модель должна быть рекуррентной. Он показывает, что циклирование остается конкурентоспособным после выравнивания основных экспериментальных условий.

Вопрос больше не в том, может ли рекуррентная глубина работать.

Вопрос в том, насколько далеко она может масштабироваться.

6 Интерпретируемость и контроль

Та же архитектурная особенность, которая делает циклы привлекательными, также усложняет мониторинг модели.

При явной цепочке рассуждений хотя бы некоторые промежуточные шаги появляются в виде читаемого текста. Исследователи могут их проверять, искать подозрительные закономерности и сравнивать изложенные рассуждения с окончательным ответом.

Рекуррентная модель может выполнять больше обработки внутри скрытых активаций, не генерируя никакого текста.

Бак Шлегерис и Райан Гринблатт утверждали, что это может снизить полезность мониторинга цепочек рассуждений. Если большая часть обработки переходит в скрытые вычисления, видимое объяснение может раскрывать меньше информации о том, как модель пришла к результату.

Себастьян Рашка предложил важный контраргумент.

Повторное использование весов не создает автоматически секретные или недоступные когнитивные процессы. Внутренние активации все еще можно изучать с помощью инструментов интерпретируемости. Основное отличие в том, что модели может потребоваться меньше видимых промежуточных токенов, потому что больше вычислений происходит до начала генерации.

Главный научный сотрудник OpenAI Якуб Похоцки также сказал, что вычислительный граф Astra остается примерно в пределах двукратной глубины GPT 4 и что цикл был намеренно ограничен для сохранения возможностей мониторинга.

Это предполагает сдержанную реализацию, а не неограниченный рекуррентный процесс.

Цепочка рассуждений в любом случае не гарантирует точной передачи внутренних вычислений модели. Система вознаграждается за выдачу полезных ответов, а не за предоставление научно точного отчета о каждой скрытой операции.

Исследования с участием OpenAI, Anthropic и Google DeepMind показывают, что объяснение модели может опускать важные факторы, рационализировать решение постфактум или представлять более чистый путь, чем тот, который на самом деле повлиял на результат.

Циклическая архитектура делает это различие труднее игнорировать.

Видимые рассуждения могут быть интерфейсом.

Основные вычисления могут происходить внутри модели до появления любого текста.

7 Результаты GPT 6 Astra

Самый впечатляющий бенчмарковый результат GPT 6 Astra — это оценка 99,9% на ARC AGI 3.

Это число звучит почти как финал, но оно сильно зависит от того, как проводится тест.

Саймон Уиллисон отметил, что результат 99,9% был получен с помощью пользовательского адаптера Provider Adapter от OpenAI. В стандартном тесте ARC Prize та же модель набрала 62,7%.

Модель не изменилась.

Изменилась среда оценки.

Mikadzyki🌙 - inline image

Одна и та же модель показывает два разных результата при двух разных затратах на запуск.

Запуск OpenAI стоил примерно $19 000. Стандартный запуск стоил примерно $26 000.

Значительно более высокий результат также был получен при более дешевой настройке.

Это не обязательно делает результат недействительным. Пользовательский адаптер может более эффективно взаимодействовать с моделью или раскрывать возможности, которые пропускает стандартная система оценки.

Но заголовочное число нельзя интерпретировать отдельно от условий, в которых оно было получено.

Mikadzyki🌙 - inline image

GPT 6 Astra на ARC AGI 3

Одна модель, две системы оценки и разрыв в 37,2 процентных пункта.

Другие оценки менее драматичны.

В Индексе искусственного анализа (Artificial Analysis Intelligence Index) Astra показывает результаты примерно на уровне GPT 5.6 Sol и примерно на пять пунктов ниже Claude Fable 5.1.

Ее более практическим преимуществом может быть эффективность в агентных задачах, где она может достигать конкурентоспособной производительности при более низкой стоимости.

Бенчмарки показывают, чего может достичь модель. Архитектура помогает объяснить, откуда берутся эти возможности и как они могут развиваться.

8 Что это значит для будущего ИИ

Долгие годы масштабирование языковых моделей в первую очередь означало добавление параметров, добавление данных и создание более крупных фиксированных стеков блоков трансформера.

Каждое новое поколение становилось больше, дороже и требовательнее в эксплуатации.

GPT 6 Astra указывает на другой путь.

Модель может повторно использовать одни и те же параметры, выделять больше вычислений для сложных задач и уточнять свое внутреннее представление, прежде чем произнести первое слово.

Это отделяет размер модели от глубины ее рассуждений.

Вместо того чтобы следовать одному фиксированному вычислительному пути, система может регулировать объем работы в зависимости от сложности конкретной задачи.

Это может изменить как производительность модели, так и экономику использования ИИ. Один и тот же интеллект может работать в быстром и недорогом режиме для простых запросов, а затем увеличивать свою вычислительную глубину, когда задача действительно требует больше рассуждений.

Рекуррентность возвращается в языковые модели. На этот раз она действует не столько между словами, сколько внутри процесса, который их создает.

Следующее поколение систем может стать более мощным не только потому, что содержит больше параметров.

Их определяющим преимуществом может быть знание того, когда хороший ответ уже найден, а когда стоит пройти по внутреннему циклу еще один раз.

Источники

Сохранение в один клик

Используйте YouMind для глубокого чтения вирусных статей с помощью ИИ

Сохраняйте источники, задавайте точные вопросы, обобщайте аргументы и превращайте вирусные статьи в полезные заметки в одном рабочем пространстве ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи