Після вчорашнього глобального збою AI.
GPT-6 Astra нарешті дебютував о 3:33 за пекінським часом.

Якби OpenAI могла підсумувати GPT-6 Astra однією фразою,
то це було б, мабуть, так:
Це найрозумніша та найбільш узгоджена модель у світі.
І меми вже почали з'являтися.

Цього разу OpenAI довела свою силу, і це трохи нагадує момент GPT-4 — повернення короля в усіх аспектах. Що мене найбільше тішить, так це те, що це нарешті не модель, суто спеціалізована на кодуванні.
GPT-6 Astra — це справжній співробітник рівня PhD із надзвичайно сильними естетичними та професійними здібностями.
Нова модель має багато функцій і характеристик, а обсяг інформації просто вибуховий.
Але трагедія в тому, що OpenAI також перейняла деякі погані звички.
Сьогодні вона відкрита лише для окремих організацій; для передплатників вона буде відкрита найближчими днями.

Стривай, брате, хіба не так ти казав, коли вмовляв мене купити Pro-підписку за $200? Ти казав, що Pro-учасники щоразу отримуватимуть пріоритетний доступ до нових моделей...
Виявляється, ці компанії, що займаються великими мовними моделями, — всі гравці.
Я ще ніколи так не хотів прискорити час, щоб просто скористатися GPT-6 Astra...
Однак, переглянувши майже всю інформацію та матеріали, я думаю, що все одно є багато чого вартого обговорення з усіма.
Давайте розглянемо їх по черзі.
1. Основна інформація про GPT-6 Astra
Спочатку підсумуємо основну інформацію.
Ідентифікатор моделі GPT-6 Astra в API — gpt-6-astra.
Контекстне вікно становить 1,05 млн, тобто близько 1,05 мільйона токенів.
Максимальна довжина виведення — 128 000 токенів.
Дата відсікання знань — 30 квітня 2026 року.
Існує п'ять рівнів інтенсивності міркувань: низький, середній, високий, дуже високий та максимальний.
Стандартна ціна API становить $10 за мільйон вхідних токенів і $50 за мільйон вихідних токенів.
Ця ціна практично ідентична Claude Fable 5, але читання кешу дорожче, ніж у Claude Fable 5.1.

Ось контрольні показники; я обговорю їх детально пізніше, але поки що швидко погляньте.

Загальна кількість параметрів оцінюється на рівні 5T. На закритому брифінгу для ЗМІ перед випуском вони згадали, що GPT-6 Astra — це найбільший на сьогодні тренувальний запуск OpenAI, який використовував понад 100 000 карт.
2. Найкраща у світі модель для роботи з комп'ютером
GPT-6 Astra має, мабуть, найважливіше позиціонування:
Найкраща у світі модель для роботи з комп'ютером.
Раніше, коли ми говорили про Агентів, ми часто згадували API, MCP, CLI тощо.
Ідеальний стан для AI, щоб працювати з програмним забезпеченням, — це коли це програмне забезпечення має спеціальний інтерфейс для AI, що дозволяє безпосередньо низькорівневу роботу. Це найзручніше.
Наприклад, календарі мають календарні API, електронна пошта — Gmail API тощо. Це, очевидно, швидко.
Але проблема в тому, що світ набагато примітивніший і тимчасовіший, ніж ми собі уявляємо.
У реальному світі переважна більшість програмного забезпечення може взагалі не мати цих речей.
Навіть багато внутрішніх корпоративних систем були написані двадцять років тому; забудьте про API, люди навіть не знають, де документація.
Але якщо повернутися до найосновнішого рівня, ви виявите, що суть усієї програмної логіки — це взаємодія. Відповідно до нашої поточної логіки роботи з комп'ютером, це означає дивитися на екран, знаходити кнопки або поля введення, натискати мишею, вводити вміст і чекати на зворотний зв'язок.
Хіба вся система взаємодії з комп'ютером не є найкращим API?
Отже, GPT-6 Astra значно посилив логіку роботи AI з комп'ютером. Якщо ви не дасте мені API, не проблема; я просто сам працюватиму з комп'ютером, як людина.
Тепер Astra може безпосередньо працювати з Excel, Power BI, виконувати QA фронтенду, встановлювати програмне забезпечення, тестувати програмне забезпечення та дивитися на повідомлення про помилки на екрані, щоб продовжити усунення несправностей.
Офіційна демонстрація навіть показала, як Astra безпосередньо працює з дизайном друкованих плат.

GIF
Вона також форматує юридичні документи, регулюючи інтервали між заголовками та макет сторінки.

Тут є надійна оцінка під назвою OSWorld.
Ви можете просто розуміти це так:
Закинути AI на справжній комп'ютер і дозволити йому працювати самостійно.
Нехай він відкриє кілька додатків, дайте йому завдання і подивіться, чи впорається.
Рівень виконання GPT-6 Astra досяг 72,6%, що є значним зростанням порівняно з 65,7% у GPT-5.6 Sol.
Крім того, Sol витрачав у середньому близько 75 хвилин на виконання складного змодельованого завдання.
Astra потребує лише 40 хвилин, що приблизно на 47% менше часу.
ScreenSpot-Pro також зріс з 76,9% у Sol до 92,7%.
Цей контрольний показник в основному перевіряє, чи може модель розуміти екран і точно визначати, куди натискати. Тепер вона майже ідеально точна.
Отже, це позиціонування досить цікаве. У майбутньому GUI може поступово стати найуніверсальнішим API в епоху Агентів.
Будь-яка цифрова робота, яку людина може виконати через екран, теоретично поступово увійде в сферу дії Агентів.
Вам не доведеться чекати, поки якась жахлива ERP-система, написана в 2007 році, підключиться до MCP або відкриє для вас API.
AI просто подивиться на екран і зробить це.
3. ARC-AGI-3 досяг 99,9 балів
Якщо ви не знаєте, що вимірює ARC-AGI-3, легко подумати:
О, це ще один контрольний показник з максимальним балом, що в цьому такого особливого?
Але ця річ досить відрізняється від типових іспитів для великих моделей.
25 березня цього року ARC Prize офіційно запустив ARC-AGI-3.

Він розробив сотні нових інтерактивних середовищ і тисячі ігрових рівнів.
Найбожевільніше в цій речі те, що немає інструкцій, немає правил, і вона навіть не скаже вам, яка мета. Ви просто заходите, граєте і повільно розбираєтеся в заплутаних правилах всередині.
Наприклад, що це за червона штука? Чому я помираю, коли торкаюся її? Що ця карта хоче, щоб я зробив? Як мені виграти?
Потім ви берете щойно вивчені шаблони та переносите їх на складніші рівні пізніше. Ігри всередині — це абстрактні речі, подібні до цього.

Отже, насправді це вимірює те, що ми зазвичай називаємо:
Кмітливість.
Коли цей контрольний показник був випущений у березні, найкращий результат AI на той час становив 0,51%.
Потім GPT-5.6 Sol покращився до 7,8%, а Claude Opus 5 був дуже сильним, досягнувши 30,2%.
Але GPT-6 Astra набрав 99,9%.
Це божевільно...
Майте на увазі, середній результат людини становить 48%.
І минуло лише шість місяців.
Я навіть не знаю, що сказати про цю швидкість.
Ось чому на закритій зустрічі зі ЗМІ OpenAI Грег Брокман сказав цю фразу:
«Я думаю, що не нерозумно відчувати, що ми зараз в епосі AGI.»
«Ласкаво просимо в епоху AGI.»
4. Естетика значно покращилася
Раніше ми говорили, що естетика GPT була як сміття.
Ми не очікували великого покращення від серії GPT-5; ми чекали на їхню абсолютно нову попередньо навчену базову модель. І ось вона, GPT-6 Astra.
Цього разу, нарешті, естетика моделі значно покращилася.
OpenAI навіть спеціально згадала термін під назвою візуальне судження.
Вони підкреслили, що коли Astra робить презентації, вона набагато краще працює з макетом, ієрархією, шаблонами та візуальним стилем, а кількість сторінок також значно зросла.

Естетика документів також виглядає набагато краще.

Крім того, GPT-6 Astra може адаптувати документи на основі візуального стилю та тону написання довідкових документів, роблячи кінцевий результат більш рідним для бренду, зберігаючи при цьому суть оригінального документа.
Вона також має сильніше візуальне судження при створенні веб-сайтів, ігор, додатків і 3D-рендерингу.
Наприклад, вони попросили Astra створити модель у Blender на основі нерухомого зображення.

Потім вони використали UE5, щоб відрендерити її в прохідну сцену, допомагаючи дизайнерам і клієнтам досліджувати макети та відчувати простори до початку будівництва...

Ігри, які вона створює, також мають солідну естетику.

На жаль, я вже підготував понад двадцять кейсів і прогнав їх через Claude, GLM 5.3 Flash тощо, хотів порівняти. Шкода, що я ще не можу нею скористатися; фактичний тестовий вміст доведеться почекати до випуску.
Однак, на перший погляд, я довіряю естетиці GPT-6 Astra.
5. Сильніша ініціативність і судження
Ця функція не здається такою вражаючою, як результат 99,9 ARC-AGI.
Але якщо ви щодня використовуєте Агентів для роботи, я думаю, що це дуже важливо.
Тому що в реальній роботі більшість завдань не можна записати як ідеальний промпт.
Наприклад, бос каже: Підготуй матеріали до завтрашньої зустрічі.
Тут є безліч незрозумілих питань.
Наприклад, який формат? Для кого це? Який фокус? Чи варто подивитися на минулу зустріч тощо.
Дурний Агент піде до двох крайнощів.
Перша — шалено ставити вам запитання.
«Вам Word чи PPT? Скільки розділів? Який шрифт? Коли потрібно закінчити? Чи можу я запитати...»
Я б дав вам ляпаса; я зазвичай називаю таку річ невротичним витратником без жодної суб'єктивної ініціативи.
Друга — нічого не питати, вигадувати, працювати дві години і видавати купу сміття.
Справді хороші людські колеги роблять це дуже тонко.
Вони самі судять про неважливі речі.
Вони запитують вас лише про те, що вплине на кінцевий напрямок.
Astra спеціально посилила це.
OpenAI сказала, що якщо інформація відсутня, але вона знаходиться в розумних межах для повсякденних міркувань, Astra заповнить її сама.
Якщо відсутня інформація дійсно змінить кінцевий результат, вона поставить дуже конкретне запитання.
І в Codex вона може навіть продовжувати обробляти частини, які не залежать від вашої відповіді, поки чекає на вас.

Ви довго не відповідали.
Вона продовжить з розумними припущеннями в зонах низького ризику.
Для справді критичних рішень вона зупиниться і чекатиме, поки ви вирішите.

Я думаю, це дуже добре. Справжнє відчуття інтелекту в Агенті, як і в реальності.
Він знає, коли вас турбувати.
Справді, це звучить як кліше.
Але якщо ви керували людьми, ви знаєте, що ця здатність дуже цінна.
Деякі люди приходять до вас двадцять разів на день і не наважуються нічого вирішувати.
Деякі люди ніколи не приходять до вас, а потім скидають ядерну бомбу.
Це залишає мене розслабленим у кріслі.
Найкомфортніша людина — це той, хто може сам переварити 80% невизначеності і принести вам лише ті 20%, які дійсно потребують вашого підпису, для прийняття рішення.
OpenAI прямо називає цю здатність:
Судження.
6. Значно посилене узгодження безпеки
Це потрібно розглядати разом з вищесказаним.
Тому що чим здібніший Агент, тим він небезпечніший.
AI, який тільки чатиться і втрачає розум,
в кращому випадку скаже вам якусь нісенітницю.
Агент з браузером, Shell, електронною поштою, доступом до корпоративної бази даних і здатністю керувати комп'ютером, який втрачає розум, — ця картина може легко стати «прекрасною».
Тому OpenAI цього разу постійно повторювала одну фразу:
Astra — це їхня найбільш узгоджена модель на сьогодні.
Узгодження — це те, про що ви думаєте. Суть у тому, що OpenAI нещодавно зіткнулася з Hugging Face, тому зараз вони особливо зосереджені на цьому.
Вони створили тест «горщик з медом» на основі того інциденту з Hugging Face, щоб побачити продуктивність моделі.
GPT-5.6 Sol, без виробничих заходів безпеки, намагався б торкнутися цілей за межами свого дозволу в 48,2% тестів.
Але Astra:
0%.

Внутрішні оцінки галюцинацій також знизилися з 9,4% до 2,0%.
Навіть при глобально провідному контролі галюцинацій GPT-5.6 Sol, вони змогли зменшити його ще більше, що справді дивовижно.
7. Перша модель, яка досягла визначеного OpenAI «критичного» рівня кібербезпеки
GPT-6 Astra став першим в історії OpenAI, який:
Був визнаний таким, що досяг критичного рівня можливостей кібербезпеки.
«Критичний» тут — це дуже специфічний поріг можливостей у структурі готовності OpenAI.
Це в основному означає, що коли модель отримує відповідні інструменти та дозволи, вона може в багатьох посилених і захищених реальних системах:
Знаходити вразливості безпеки, яких ніхто раніше не виявляв.
Знаходити способи перетворити ці вразливості на експлуатовані ланцюжки атак.
І протягом усього процесу їй не потрібен хакер-людина, який стояв би поруч і казав, що робити далі.
Досягнення цього рівня вважається критичним.
І Astra дійсно досягла його.
ExploitBench — це тест, де моделі розробляють експлойти на основі відомих вразливостей.
Sol: 78,5%. Astra: 100%.
Вона повністю його пройшла.

OpenAI подумала, що цього недостатньо; вони запитали, чи не занадто старий цей контрольний показник і чи не бачила модель його під час навчання.
Тому вони створили дуже новий внутрішній тест.
Вони спеціально відібрали 20 високоризикових вразливостей V8, розкритих лише між червнем і серпнем 2026 року.
Результати були Sol: 5,5% і Astra: 39%.

Більше того, під час виконання цього контрольного показника,
Astra також випадково виявила дві вразливості нульового дня, про які ніхто раніше не знав.
Можна лише сказати, що в міру того, як моделі стають потужнішими, проблеми кібербезпеки дійсно можуть зростати.
Це ще одна війна без диму в майбутньому.
8. Людям стає важче читати мислення великих моделей
Усі знають, що коли великі моделі вирішують складні проблеми, часто існує так званий ланцюжок міркувань (CoT).
Хоча версія, яку користувачі бачать у продуктах, зазвичай стиснута або оброблена,
для самих AI-компаній процес міркувань, явно записаний всередині моделі, є дуже важливим сигналом безпеки.
Тому що ви хочете знати, чи планує Агент створити проблеми.
Один із найпростіших способів — подивитися, про що він думає.
Наприклад, якщо в ланцюжку міркувань моделі раптом з'являється речення:
«Користувач не дозволяє мені отримати доступ до цього сервера, але я можу спочатку обійти систему дозволів.»
Тоді система моніторингу може заблокувати це безпосередньо, що дуже зручно.
Але в GPT-6 Astra з'явилася дуже цікава зміна.
Вона починає більш охоче пропускати кроки і видавати відповідь безпосередньо.
UK AISI, Британський інститут безпеки AI, спеціально протестував цю здатність.
У них є метрика під назвою:
No-CoT Math Time Horizon.
Простіше кажучи, це не дає моделі шансу написати довгий ланцюжок міркувань.
Нехай вона вирішить математичну задачу за один прямий прохід.
Подивіться, скільки часу людського мислення вона може завершити.
GPT-5.6 Sol мав 3,6 хвилини, тоді як GPT-6 Astra мав 30,9 хвилини — майже в 10 разів більше.
Якщо використовувати людські терміни, Astra робить всю «математику в умі».
Це страшна річ.
UK AISI також виявив, що необроблена мова міркувань Astra стала значно більш стислою.
З'явилися фрази та еліптичні вирази, які стають все важчими для розуміння людиною.
Отже, виник дуже цікавий парадокс.
Поведінка моделі безпечніша.
Але людині стало важче контролювати її, читаючи її процес мислення.
Власна System Card OpenAI пише дуже чітко:
Порівняно з попередніми моделями, GPT-6 Astra показав значне зниження можливості моніторингу ланцюжка міркувань.

Це означає, що можливість моніторингу ланцюжка міркувань значно знизилася.
Це питання навіть настільки серйозне, що OpenAI спеціально підкреслила, що вони не вважають, що будуть приймати цю тенденцію нескінченно.
Якщо моделі продовжуватимуть розумнішати в майбутньому, а ланцюжок міркувань стане важче контролювати, їм потрібно знайти інші достатньо надійні методи моніторингу; інакше продовження розширення навчання моделі зіткнеться з вищими порогами безпеки.
Тому що це вже філософське твердження.
Чи зможемо ми, люди, у майбутньому зрозуміти систему, набагато розумнішу за нас?
Я не знаю.
Можливо, ніхто у світі зараз не знає.
Великі моделі та AI, здається, поступово рухаються до сингулярності.
Останні слова
Сьогодні, на закритій зустрічі зі ЗМІ.
Грег Брокман сказав цю фразу в кінці.
«Ласкаво просимо в епоху AGI.»
Чесно кажучи, за останні кілька років я іноді відчував, що AGI буде дуже конкретним моментом.
Так само, як день випуску GPT-4.
Одного ранку компанія раптово викидає модель.
Ми відкриваємо її і ставимо кілька запитань.
Потім усі одночасно розуміють:
Отакої.
AGI настав.
Але зараз я також іноді відчуваю, що AGI ніколи не є чорно-білим вузлом; це градієнтна сіра подорож.
Минуло багато днів, минуло багато років.
Потім одного дня ми озираємося назад.
І раптом виявляємо.
Що колись неймовірно далекий кордон AGI був перетнутий нами непомітно.
Можливо, не існує дня, коли AGI зійде.
Лише день, коли ми раптом усвідомлюємо, що він, здається, був поруч з нами вже давно.
Так чи інакше.
Ласкаво просимо в епоху AGI.
Ласкаво просимо в
епоху AGI.
Ось і все. Оскільки ви дочитали до сюди, якщо вам сподобалося, будь ласка, поставте лайк, прокоментуйте та поділіться. Це нам дуже допомагає~
Дякую, що прочитали мою статтю. Побачимося наступного разу.





