Як насправді мислить GPT 6 Astra

@Mikadzyki_NFT
АНГЛІЙСЬКА08 вер. 2026 р.
955K
83
16
16
142

Коротко

GPT 6 Astra представляє циклічну архітектуру трансформерів, яка дозволяє моделі повторно використовувати ваги та обробляти внутрішні стани кілька разів перед виведенням тексту. Це відокремлює кількість параметрів від обчислювальної глибини, забезпечуючи адаптивні обчислення під час виведення.

**

OpenAI описує GPT 6 Astra як свою найбільш здатну та узгоджену модель на сьогодні.

Грег Брокман пішов далі, заявивши, що було б розумно розглядати Astra як ранню форму загального штучного інтелекту.

Модель також стала першою, яка перетнула критичний поріг OpenAI у сфері кібербезпеки. За словами компанії, вона може виявляти раніше невідомі вразливості та створювати робочі експлойти з обмеженим керівництвом людини.

Ці твердження вражають, але вони не є найважливішою частиною релізу.

Справжня зміна — архітектурна.

Звичайна мовна модель передає інформацію через фіксовану послідовність трансформерних блоків і генерує наступний токен. Astra може обробляти свій внутрішній стан через ті самі обчислювальні блоки кілька разів, перш ніж показати користувачеві жодне слово.

Вона не просто генерує довший ланцюжок міркувань.

Вона витрачає більше часу на обдумування, перш ніж відповісти.

1 Як працюють сучасні мовні моделі

Уявіть, що ви вводите:

Еверест — це...

Модель має передбачити, що буде далі.

Її механізм уваги визначає, які частини контексту важливі. Слово "Еверест" активує пов'язані концепції, такі як гори, висота, Гімалаї, Непал, Тибет, сходження та експедиції.

Потім модель поєднує ці асоціації з навколишнім контекстом. У більшості випадків продовження, як-от "найвища гора на Землі", стає дуже ймовірним.

Усередині звичайного трансформера це представлення рухається через послідовність блоків. Кожен блок перетворює його один раз і передає результат наступному.

Якщо модель містить 40 блоків, прихований стан проходить через усі 40 по черзі. Остаточне представлення перетворюється на розподіл ймовірностей для наступного токена.

Більше блоків зазвичай означає більшу обчислювальну глибину. Глибша модель може виконати більше перетворень, перш ніж прийняти рішення.

Але додавання блоків також збільшує кількість параметрів, вимоги до пам'яті та вартість навчання.

Звичайне припущення було простим: якщо вам потрібна глибша модель, потрібно побудувати більший стек шарів.

Зациклена архітектура змінює цей принцип.

2 Що змінює зациклена архітектура

Згідно з повідомленнями The Information, GPT 6 Astra використовує зациклену архітектуру трансформера.

OpenAI не опублікувала повну технічну специфікацію, тому точна реалізація залишається закритою. Але загальний механізм уже добре зрозумілий із публічних досліджень.

Замість того, щоб надсилати прихований стан через кожен блок лише один раз, модель може повернути результат до обчислювального блоку та обробити його знову.

Думайте про це як про внутрішній чернетку.

Модель створює попереднє представлення, надсилає його через ті самі ваги знову, уточнює його та повторює процес кілька разів. Лише після завершення циклу з'являється наступний видимий токен.

Mikadzyki🌙 - inline image

Кількість параметрів залишається незмінною. Ваги залишаються всередині одного блоку, обчислення зростають із кількістю циклів, і лише остаточний токен випускається.

Ключова деталь полягає в тому, що кількість параметрів не обов'язково збільшується.

Ті самі ваги використовуються повторно на кожному проході.

Збільшується лише обсяг обчислень.

У звичайному трансформері токен проходить через послідовність різних блоків. У зацикленому трансформері він може проходити через ту саму спільну структуру кілька разів.

Модель стає глибшою за рахунок обчислень, не стаючи більшою за рахунок кількості параметрів.

Це створює новий компроміс:

  • Більше параметрів потребує більше пам'яті
  • Більше циклів потребує більше обчислень
  • Одна модель може витрачати різну кількість обчислень на різні завдання

Останній пункт особливо важливий. Обчислювальна глибина може змінюватися без створення нової моделі.

3 Як навчається рекурентна глибина

Просте розміщення трансформерного блоку всередині циклу недостатньо.

Якщо модель завжди виконує рівно 32 проходи під час навчання, вона може навчитися покладатися на позицію кожного кроку. Перший прохід може вивчити одну функцію, десятий — іншу, а тридцять другий може стати фіксованим вихідним шаром.

Результатом буде звичайна 32-шарова мережа, замаскована під цикл.

Дослідники вирішують цю проблему, змінюючи кількість рекурентних проходів під час навчання.

Одна з найкращих демонстрацій походить від моделі рекурентної глибини Huginn. Її творці навчили мережу з 3,5 мільярдами параметрів приблизно на 800 мільярдах токенів.

На кожному кроці навчання кількість циклів вибиралася з розподілу із середнім значенням близько 32. Один приклад міг отримати чотири проходи, інший — 17, третій — 40, а ще один — близько 90.

Модель не могла знати заздалегідь, який прохід буде останнім.

Тому вона мала навчитися чомусь більш загальному, ніж фіксована послідовність операцій.

Вона мала навчитися покращувати свій поточний внутрішній стан.

Mikadzyki🌙 - inline image

Анотація зі статті про рекурентну глибину на arXiv

Навчання через десятки рекурентних кроків створює ще одну проблему: пам'ять.

Стандартне зворотне поширення вимагало б зберігання проміжних активацій з кожного циклу. При достатній кількості повторень вартість пам'яті стає величезною.

Дослідники Huginn використали практичний компроміс. Прямий прохід міг виконуватися для багатьох циклів, але градієнти обчислювалися лише через останні вісім.

Ранні проходи все ще впливали на кінцевий результат, але їхня повна історія активацій не мала залишатися в пам'яті.

Це схоже на усічене зворотне поширення в часі. Різниця в тому, що рекурентність відбувається через обчислювальну глибину, а не через слова в послідовності.

Mikadzyki🌙 - inline image

Кількість циклів вибирається на кожному кроці навчання, тоді як градієнт обчислюється лише через останні вісім проходів.

Модель не вчать виконувати жорстку послідовність із 32 операцій.

Її вчать рухати свій прихований стан до корисного результату незалежно від того, коли процес зупиняється.

Це змінює те, що означає глибина.

Глибина більше не є лише властивістю, обраною інженерами до навчання. Вона може стати змінною під час інференції.

4 Адаптивні обчислення під час інференції

Більшість поточних механізмів контролю міркувань працюють на рівні видимих токенів.

Якщо модель просять подумати довше, вона генерує довший ланцюжок міркувань, використовує більше вихідних токенів або створює додатковий проміжний текст.

Зациклена архітектура пропонує інший механізм.

Кількість внутрішніх проходів може змінюватися без зміни ваг і без примушування моделі писати довше пояснення.

Просте завдання може отримати чотири цикли.

Складний математичний доказ може отримати 32.

Складна проблема кодування може отримати 64.

Модель залишається незмінною. Змінюється лише обсяг внутрішніх обчислень.

Mikadzyki🌙 - inline image

Ваги залишаються фіксованими. Змінюється лише кількість внутрішніх проходів, які використовуються для обробки кожного токена.

Публічні експерименти з рекурентною глибиною вже показують очікувану закономірність.

Продуктивність швидко покращується під час перших циклів. Потім приріст стає меншим, поки криві не наближаються до плато.

Це свідчить про те, що прихований стан збігається.

Ранні проходи роблять великі виправлення. Пізніші проходи уточнюють дрібні деталі. Зрештою, додаткові обчислення перестають давати значущі покращення.

Майбутня система могла б виявляти цей момент автоматично.

Замість того, щоб призначати кожному запиту фіксовану кількість циклів, модель могла б продовжувати обробку, доки її прихований стан не стане достатньо стабільним. Легкі токени були б дешевими. Складні токени отримували б більше обчислень.

Це створило б справжню адаптивну обчислювальну глибину.

Довше думання більше не означало б більше письма.

5 Дослідження та ранні практичні результати

Повторне використання шарів трансформера — не нова ідея.

Universal Transformers представили рекурентну обробку в 2018 році. ALBERT зменшив кількість параметрів, поділивши ваги між шарами. Mixture of Recursions досліджував маршрутизацію токенів через різну кількість обчислень.

Відкрита модель Nanbeige4.2 3B надає особливо прямий приклад.

Її конфігурація містить 22 шари та num_loops: 2. Фактично, модель проходить через ці шари двічі. Вона має приблизно кількість параметрів 22-шарової мережі, але приблизно обчислювальну глибину 44-шарової мережі.

Mikadzyki🌙 - inline image

Конфігурація Nanbeige4.2 3B на Hugging Face

Двадцять два шари, num_loops: 2 та ліцензія Apache 2.0. Механізм уже видно у відкритій конфігурації моделі.

Протягом багатьох років рекурентні конструкції трансформерів залишалися цікавими дослідницькими ідеями, а не домінуючим підходом.

Відсутнім інгредієнтом були сильні докази масштабування.

1 вересня група дослідників опублікувала SMELT — дослідження, призначене для порівняння зациклених і звичайних трансформерів за однакових умов.

Вони контролювали кількість параметрів, обчислювальні витрати на навчання та розмір KV-кешу. За таких обмежень зациклені моделі потребували на 6,8% до 18% менше обчислювальних ресурсів для навчання, щоб досягти того самого рівня продуктивності.

Найбільші вигоди з'явилися в коді.

Mikadzyki🌙 - inline image

Анотація зі статті SMELT на arXiv

За однакових обчислень, параметрів і KV-кешу, зациклення економить від 6,8% до 18% обчислювальних ресурсів на навчання, з найсильнішими вигодами в коді.

Дослідники також спостерігали зміну в поведінці уваги.

У звичайних трансформерах найперші токени в послідовності часто стають поглиначами уваги. Вони отримують непропорційно багато уваги, навіть коли їхня семантична важливість обмежена.

Після другого проходу через ті самі блоки увага моделі змістилася до більш релевантних токенів.

Другий цикл не просто повторив перший. Він використав результат першого проходу як основу для більш вибіркової обробки.

SMELT не доводить, що кожна майбутня модель має бути рекурентною. Він показує, що зациклення залишається конкурентоспроможним після вирівнювання основних експериментальних умов.

Питання більше не в тому, чи може рекурентна глибина працювати.

Питання в тому, наскільки далеко вона може масштабуватися.

6 Інтерпретованість і контроль

Та сама архітектурна особливість, яка робить цикли привабливими, також ускладнює моніторинг моделі.

При явному ланцюжку міркувань принаймні деякі проміжні кроки з'являються як читабельний текст. Дослідники можуть перевіряти їх, шукати підозрілі патерни та порівнювати заявлені міркування з остаточною відповіддю.

Рекурентна модель може виконувати більше обробки всередині прихованих активацій, не генеруючи жодного тексту.

Бак Шлегеріс і Раян Грінблатт стверджували, що це може зменшити корисність моніторингу ланцюжка міркувань. Якщо більше обробки переміщується в приховані обчислення, видиме пояснення може розкривати менше про те, як модель досягла свого результату.

Себастьян Рашка запропонував важливий контраргумент.

Повторне використання ваг не створює автоматично секретне або недоступне пізнання. Внутрішні активації все ще можна вивчати за допомогою інструментів інтерпретованості. Основна відмінність полягає в тому, що моделі може знадобитися менше видимих проміжних токенів, оскільки більше обчислень відбувається до початку генерації.

Головний науковець OpenAI Якуб Пахоцький також сказав, що обчислювальний граф Astra залишається приблизно в межах коефіцієнта два від глибини GPT 4 і що цикл був навмисно обмежений для збереження можливостей моніторингу.

Це свідчить про стриману реалізацію, а не про необмежений рекурентний процес.

Ланцюжок міркувань і так не гарантовано є точною транскрипцією внутрішніх обчислень моделі. Система винагороджується за надання корисних відповідей, а не за науково точний звіт про кожну приховану операцію.

Дослідження за участю OpenAI, Anthropic і Google DeepMind показують, що пояснення моделі може опускати важливі фактори, раціоналізувати рішення постфактум або представляти чистіший шлях, ніж той, який насправді вплинув на результат.

Зациклена архітектура робить цю відмінність важчою для ігнорування.

Видимі міркування можуть бути інтерфейсом.

Основні обчислення можуть відбуватися всередині моделі до появи будь-якого тексту.

7 Результати GPT 6 Astra

Найбільш вражаючий бенчмарковий результат GPT 6 Astra — це оцінка 99,9% на ARC AGI 3.

Це число звучить майже остаточно, але воно сильно залежить від того, як проводиться тест.

Саймон Віллісон підкреслив, що результат 99,9% був отриманий за допомогою спеціального адаптера Provider Adapter від OpenAI. За стандартного адаптера ARC Prize та сама модель набрала 62,7%.

Модель не змінилася.

Змінилося середовище оцінювання.

Mikadzyki🌙 - inline image

Та сама модель дає дві різні оцінки за двох різних вартостей запуску.

Запуск OpenAI коштував приблизно $19 000. Стандартний запуск коштував приблизно $26 000.

Значно вищий бал також був отриманий за допомогою дешевшої установки.

Це не обов'язково робить результат недійсним. Користувацький адаптер може взаємодіяти з моделлю більш ефективно або виявляти можливості, які пропускає загальна структура оцінювання.

Але заголовкове число не можна інтерпретувати окремо від умов, які його створили.

Mikadzyki🌙 - inline image

GPT 6 Astra на ARC AGI 3

Одна модель, два адаптери оцінювання та розрив у 37,2 відсоткових пункти.

Інші оцінки менш драматичні.

За індексом Artificial Analysis Intelligence Astra набирає приблизно на рівні з GPT 5.6 Sol і приблизно на п'ять пунктів нижче за Claude Fable 5.1.

Її більш практичною перевагою може бути ефективність в агентних завданнях, де вона може досягати конкурентоспроможної продуктивності за нижчої вартості.

Бенчмарки показують, чого може досягти модель. Архітектура допомагає пояснити, звідки беруться ці можливості та як вони можуть розвиватися.

8 Що це означає для майбутнього ШІ

Протягом багатьох років масштабування мовних моделей в основному означало додавання параметрів, додавання даних і побудову більших фіксованих стеків трансформерних блоків.

Кожне нове покоління ставало більшим, дорожчим і вимогливішим до запуску.

GPT 6 Astra вказує на інший шлях.

Модель може повторно використовувати ті самі параметри, виділяти більше обчислень для складних завдань і уточнювати своє внутрішнє представлення перед тим, як створити своє перше слово.

Це відокремлює розмір моделі від глибини її міркувань.

Замість того, щоб слідувати одному фіксованому обчислювальному шляху, система може регулювати обсяг роботи відповідно до складності конкретної проблеми.

Це може змінити як продуктивність моделі, так і економіку використання ШІ. Той самий інтелект міг би працювати у швидкому та недорогому режимі для простих запитів, а потім збільшувати свою обчислювальну глибину, коли завдання дійсно потребує більше міркувань.

Рекурентність повертається до мовних моделей. Цього разу вона діє не в основному між словами, а всередині процесу, який їх створює.

Наступне покоління систем може стати більш потужним не лише тому, що містить більше параметрів.

Їхньою визначальною перевагою може бути знання того, коли хорошу відповідь уже знайдено, а коли варто пройти внутрішній цикл ще раз.

Джерела

Збереження в один клік

Використовуйте YouMind для AI-глибокого читання віральних статей

Зберігайте джерела, ставте цілеспрямовані запитання, підсумовуйте аргументи та перетворюйте віральні статті на корисні нотатки в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей