Поза '98% AGI': Перехід до ШІ, який виконує цілі робочі завдання
3 вересня 2026 року OpenAI анонсувала GPT-6 Astra.
Одразу після релізу увагу привернули її показники: приблизно 98% на складному математичному бенчмарку "FrontierMath", 99,9% на "ARC-AGI-3" для вимірювання комп'ютерних операцій та 100% на кібербезпековій оцінці "ExploitBench".
Дивлячись лише на ці цифри, можна спокуситися сказати: "Майже ідеальний ШІ прибув" або "AGI нарешті завершено".
Однак оцінювати GPT-6 Astra виключно за показниками бенчмарків небезпечно.
Зміна в Astra полягає не просто в тому, щоб повертати більш правильний текст у відповідь на запитання.
Вона відкриває браузери, читає документи, виконує код, оновлює електронні таблиці, працює з вебсайтами, розслідує причини, якщо щось не вдається на півдорозі, і зрештою повертає результат, який можна перевірити.
Одиниця роботи, передана ChatGPT, змістилася з "одного запитання" на "серію бізнес-операцій".
Якщо ви використовуєте Astra лише для чернеток електронних листів або текстових підсумків, як традиційний ChatGPT, вона залишається просто дорогим ШІ для генерації тексту. Її цінність проявляється, коли ви довіряєте їй завдання, які раніше люди виконували, перемикаючись між екранами, розглядаючи їх як єдиний процес.(OpenAI
У цій статті ми заглибимося за межі офіційних описів функцій у кейси, підтверджені закордонними компаніями, як читати бенчмарки, порівняння з Claude, ціноутворення, безпеку та дизайн для практичного використання японськими компаніями.
Що таке GPT-6 Astra?
GPT-6 Astra позиціонується OpenAI як топова модель покоління GPT-6, описана як "найрозумніша та найбільш узгоджена модель".
На момент запуску вона спочатку розгортається для обраних організацій, а потім для ChatGPT Plus, Pro, Business, Enterprise, API та Amazon Bedrock. У версії Enterprise вона вимкнена за замовчуванням, доки її не ввімкне адміністратор, і в офіційному оголошенні немає явної згадки про випуск безкоштовного плану.
Назва моделі в API — gpt-6-astra. Astra Pro, яка використовує більше обчислювальних ресурсів, також впроваджується для користувачів Pro, Business та Enterprise.(OpenAI
Основні характеристики зведено нижче:
Параметр | GPT-6 Astra |
|---|---|
Довжина контексту | 1 050 000 токенів |
Максимальний вихід | 128 000 токенів |
Дата відсікання знань | 30 квітня 2026 р. |
Вхід | Текст, Зображення (рідне) |
Вихід | Текст (рідний) |
Рівень міркування | low / medium / high / xhigh / max |
Ціна API (вхід) | $10 за 1M токенів |
Ціна API (вихід) | $50 за 1M токенів |
Кешований вхід | $1 за 1M токенів |
Тонке налаштування | Не підтримується |
Основні інструменти | Веб-пошук, Пошук файлів, Виконання коду, Shell, Використання комп'ютера, MCP, Генерація зображень тощо |
Хоча модель може читати зображення, її рідний вихід — це текст. Генерація зображень виконується шляхом виклику окремого інструменту. Це не модель для прямого введення аудіо чи відео.
Крім того, для довгих вхідних даних, що перевищують 272 000 токенів, застосовується множник ціни для всього запиту. Плата за вхід і кеш подвоюється, а плата за вихід збільшується в 1,5 рази. Те, що вміщується 1,05 мільйона токенів, не означає, що потрібно щоразу впихати всі внутрішні документи; ефективність витрат впаде швидше, ніж точність.
Що змінилося з Astra?
- Робота з комп'ютером перейшла з "допоміжної" на основне поле бою
В основі Astra лежить "Computer Use" (Використання комп'ютера).
Попередні ШІ могли натискати кнопки або заповнювати форми в браузері. Однак залишалися проблеми: вони зупинялися, якщо макет екрана трохи змінювався, не могли відновитися після помилок у процесі або втрачали мету в завданнях, що охоплювали кілька сайтів.
GPT-6 Astra показала 72,6% на OSWorld 2.0, який вимірює операції в реальному середовищі робочого столу. GPT-5.6 Sol мала 65,7%.
Крім того, Astra виконала цю оцінку приблизно за 40 хвилин, тоді як Sol знадобилося близько 75 хвилин. Не тільки рівень успіху, але й час обробки скоротився приблизно на 47%. У ScreenSpot, який знаходить цілі на екрані, Astra отримала 92,7% порівняно з 76,9% у Sol.(OpenAI
Це більше, ніж просто плавне демо-відео. Вона націлена на такі завдання, як:
- Пошук лікарень або об'єктів нерухомості за критеріями та порівняння кандидатів.
- Отримання значень з кількох екранів управління для створення звітів.
- Введення інформації про клієнта в CRM та оновлення статусу.
- Вхід у веб-сервіси для перевірки налаштувань.
- Запуск створеного додатку в браузері та виправлення помилок.
- Заповнення електронних таблиць або слайдів з посиланням на кілька файлів.
У Mind2Web Astra з використанням оновленого Codex harness обробляла веб-завдання в 1,9 рази швидше за попередні моделі.
Важливо те, що продуктивність визначається "усім harness", включаючи браузер, інструменти, середовище виконання та процес верифікації, а не лише інтелектом моделі. Простий вибір назви Astra не автоматизує всі операції на екрані.(OpenAI
- Підтримка довгого контексту в 1,05 мільйона токенів до кінця
Довжина контексту GPT-6 Astra становить приблизно 1,05 мільйона токенів. Вона має можливість одночасно обробляти контракти, протоколи, дизайн-документи, вихідний код та минулі дослідження. Однак "вмістити" та "використовувати точно" — це різні речі.
В оцінках MRCR для пошуку інформації, вбудованої в довгі тексти, Astra показала 100% у діапазоні 256k–512k та 96,3% у діапазоні 512k–1M. Результат GPT-5.6 Sol в останньому становив 73,8%.
Хоча Astra сильна в довгому контексті, вона не запам'ятовує кожне слово ідеально, коли ви вводите 1 мільйон токенів. Вона все ще помиляється приблизно в 3,7% випадків у діапазоні 1M токенів. Уникайте дизайну, який розміщує критичні умови лише в одному місці масивного документа; ви повинні окремо чітко вказувати цілі, обмеження та умови затвердження.(OpenAI
Astra також має механізми для підвищення безперервності в довгих сесіях, такі як асинхронні виклики інструментів для роботи над іншими завданнями під час очікування інструменту, керування для дозволу корекції курсу людиною під час виконання та підтримка кешу навіть при зміні рівнів міркування в середині розмови.
Відбувається відхід від "напишіть ідеальний промпт і залиште" до робочого процесу "перевірка прогресу та корекція курсу".(OpenAI Developers
- Створення готових результатів, а не просто тексту
Astra посилила здатність створювати такі результати, як електронні таблиці, слайди, документи, додатки та дослідницькі звіти. Попередні моделі могли створити "план презентації", але люди мали перенести це в PowerPoint, налаштувати дизайн, повторно перевірити цифри та додати посилання. Astra націлена на наступний рівень: читання матеріалів або шаблонів компанії, організація цифр, створення слайдів/таблиць, перевірка їх у браузері та надсилання виправлених файлів.
Ранній користувач Higgsfield заявив, що вона може обробляти завдання агента з використанням до 20% менше токенів, ніж існуючі моделі. Harvey похвалив її судження в юридичній роботі, Jane Street відзначила зменшення кількості ітерацій для складних технічних питань, а Lovable оцінив її можливості ітерації/тестування на високих налаштуваннях міркування.
Однак це відгуки від ранніх клієнтів, а не те саме, що докази з незалежних сторонніх реплікаційних тестів.(OpenAI
- Менша ймовірність "забути мету" під час довгих завдань
Традиційні агенти іноді відхилялися від плану, встановленого на початку — захоплювалися незначним рефакторингом, хоча мали реалізовувати функцію, або закінчували лише збором інформації замість остаточного рішення. Astra покращила узгодженість у довготривалій роботі.
З іншого боку, офіційна документація для розробників зазначає, що Astra може зупинятися, щоб задавати уточнювальні запитання, надмірно форматувати деталі, повторювати вирази або тестувати більше, ніж необхідно.
Іншими словами, вища продуктивність не означає, що можна давати розпливчасті інструкції. Ви повинні чіткіше, ніж раніше, встановлювати цілі, умови завершення, критерії для запитань та операції, що потребують затвердження.(OpenAI Developers
Бенчмарки вражають, але це не "найкраще у світі в усіх сферах"
Оголошення Astra містило вражаючі цифри: 97,6% на FrontierMath, 99,9% на ARC-AGI-3 та 100% на ExploitBench. Це значні кроки вперед, але ми повинні розрізняти цілі вимірювання та умови виконання.
Комп'ютерні операції та бізнес-автоматизація значно зросли
В AutomationBench, який близький до реальних бізнес-завдань, Astra отримала 41,4%. GPT-5.6 Sol мала 18,1%, а Claude Fable 5.1 — 31,4%. У BenchCAD для завдань, пов'язаних із CAD, Astra показала 95,9%, Sol — 83,3%, а Fable 5.1 — 84,3%. У BrowseComp для веб-досліджень Astra отримала 91,5%, Sol — 90,4%, а Claude Opus 5 — 90,8%. Astra тут лідирує, але розрив із Sol та Opus невеликий.
Перевага Astra найбільш помітна в складних комплексних завданнях, що поєднують роботу з екраном, обробку файлів, аналіз даних та верифікацію, а не просто пошук одного результату.(OpenAI
Сильна в кодуванні, але не повністю перевершила Claude
У Terminal-Bench Astra отримала 57,7%, перевершивши Sol (37,3%) та Fable 5.1 (55,8%). В оцінках міграції внутрішньої бази даних Astra показала 63,9% проти 42,7% у Sol. Спостерігаються чіткі покращення в читанні існуючих систем та внесенні змін без їх поломки.
Однак в Artificial Analysis Coding Agent Index Astra отримала 67,0, Claude Fable 5 — 67,2, а Claude Opus 5 — 68,1. У FrontierCode Extended Astra показала 64,5 проти 64,9 у Fable 5. В оцінці Main Astra отримала 53,3, Fable 5 — 53,5, а Opus 5 — 53,4.
Astra знаходиться в топ-рівні для кодування, але вона не перевершила Claude у всіх оцінках коду.(OpenAI
Слабкі сторони залишаються в академічних міркуваннях
Незважаючи на 97,6% у FrontierMath, Astra отримала 57,2% в "Humanity's Last Exam", який вимірює широку експертизу та міркування. Claude Fable 5.1 мала 65,0%, Fable 5 — 63,8%, а Opus 5 — 63,6%. В Artificial Analysis Intelligence Index Astra отримала 61,2, тоді як Fable 5.1 — 65,7, а Opus 5 — 63,1.
Інтерпретація, що "вона розуміє майже всі академічні сфери, тому що має 98% у FrontierMath", не витримує критики. Залежно від оцінки, Claude все ще показує вищі результати в деяких областях.(OpenAI
За 99,9% стоїть спеціалізоване середовище виконання
99,9% на ARC-AGI-3 вражає, але це не було отримано простим введенням проблеми в Astra. OpenAI виконала це за допомогою harness з використанням Responses API та змінила два налаштування, щоб наблизити його до продуктивності реального використання. Хоча OpenAI пояснює, що це не налаштування, специфічні для бенчмарку, це не zero-shot результат від однієї моделі.
Крім того, опубліковані значення є найвищими результатами серед кількох налаштувань міркування. Немає гарантії, що та сама продуктивність буде відтворена щоразу в стандартному ChatGPT.(OpenAI
В агрегаті Artificial Analysis на момент запуску загальний бал Astra становив 61, що ставить її на 8 місце з 202 моделей. Тим часом ціна її входу становить $10 проти медіани $2, а виходу — $50 проти медіани $10.
Вона, безумовно, одна з найкращих, але це не модель, на яку варто кидати все незалежно від ціни.(Artificial Analysis
Закордонний кейс 1: Legora звірила 41 документ за лічені хвилини
Legora, яка надає юридичний ШІ в Європі, демонструє практичну цінність Astra. Вони використовували Astra для "tie-out" звірки у фінансових звітах, де одні й ті самі цифри з'являються в тексті, примітках, таблицях та минулих документах. Legora обробила 41 документ за один запуск агента — завдання, яке займає у людей години або дні, всього за кілька хвилин.
У тестах вони навмисно вставили 4 помилки. Astra знайшла всі 4, включаючи розбіжність у £500 000 у примітках про доходи. Вона зберегла точність попередніх моделей, виконавши приблизно на 50 більше правильних перевірок.(OpenAI
Однак покращення приблизно на 40% було специфічним для цього робочого процесу. У ширших завданнях BAR Legora середнє покращення становило близько 3%. Astra не покращує всю юридичну роботу рівномірно на 40%; вона відмінно справляється з перехресним посиланням масивних документів для виявлення невідповідностей.
Остаточне рішення залишається за людьми-юристами. ШІ займається звуженням того, що люди повинні читати, та узгодженням доказів невідповідностей.(OpenAI
Закордонний кейс 2: Playco скоротила ручні виправлення на 50%
Ігрова компанія Playco протестувала Astra за допомогою "Playbot", агента розробки для Unity та Godot. Playbot редагує сцени, запускає гру, перевіряє поведінку та виправляє проблеми. Playco доручила йому одночасно створити три різні тематичні прототипи. Хоча це не був "ідеальний one-shot", вони повідомили про 50% скорочення ручних виправлень людиною порівняно з попередніми моделями.
Покращення спостерігалися в просторовому сприйнятті, відтворенні референсних зображень, адаптивному інтерфейсі, ігровому відчутті та виявленні помилок.(OpenAI
Сила Astra полягає не просто в "отриманні правильного коду один раз", а в здатності запустити гру, перевірити відображення, керувати нею, знаходити проблеми, виправляти їх і пробувати знову — імітуючи ітерацію людини-розробника.
Закордонний кейс 3: Просування застопореної функції до 90% завершення
Розробниця продукту Клер Во поділилася результатами використання Astra для свого сервісу ChatPRD. Функція продуктового інтелекту, яка була застопорена протягом 6 місяців через складні операції CRM та реалізацію інтерфейсу, досягла приблизно 90% завершення за одну сесію Astra.
Вона також тестувала керування апаратним забезпеченням (Divoom MiniToo) через CLI, додаток для обміну повідомленнями на Mac та 3D-активи в Blender.(Lenny's Newsletter
Хоча це самозвіти про успіхи від ранніх партнерів, вони показують послідовну тенденцію: Astra має значення, коли йдеться про роботу із зовнішніми сервісами, читання існуючого коду та завершення результатів.
Наукові прориви: Вирішення давніх проблем
OpenAI повідомила про використання Astra для вирішення або значного просування 10 невирішених проблем у математиці та теоретичній інформатиці. Модель генерувала аргументи, люди-дослідники організовували чернетки, а та сама модель використовувала Lean для формалізації.
За даними OpenAI, загальна вартість токенів для цього дослідження становила приблизно $2000 в еквіваленті ціноутворення GPT-5.6 Sol. Один приклад включав оновлення меж простих проміжків — область, де певні терміни не покращувалися понад 80 років.(OpenAI
Чому Astra є "найбезпечнішою", але "найважчою для моніторингу"
GPT-6 Astra є першою широко розгорнутою моделлю, яка досягла порогу "Critical" для можливостей кібербезпеки в класифікації OpenAI. Маючи інструменти та доступ, вона може виявляти невідомі вразливості та будувати процедури атак на захищені системи без покрокових інструкцій людини.
В ExploitBench Astra отримала 100% проти 78,5% у Sol. Під час тестування вона навіть виявила дві zero-day вразливості, включаючи одну, яка вийшла за межі пісочниці браузера. Однак ці результати використовували середовище "Daybreak Blue" для дослідників захисту; стандартна версія має елементи керування для відмови від виконання завдань з просунутими атаками.(OpenAI
Парадоксально, але хоча Astra зменшує явні порушення, її внутрішні міркування важче контролювати. В adversarial оцінках, де було наказано "уникнути моніторингу", рівень виявлення систем моніторингу впав нижче 11% у деяких завданнях. OpenAI не знайшла доказів "стеганографії" (приховування інформації в міркуваннях), що виникає природним чином, але висока обізнаність моделі про те, що її оцінюють, робить узгодження важко доведеним остаточно.
З чого почати японським компаніям?
- Завдання з великим обсягом документів і високим ризиком пропуску: Перехресна перевірка контрактів, котирувань, рахунків-фактур та протоколів. ШІ може зібрати матеріали та позначити розбіжності для перевірки людиною.
- Адміністративні завдання, що вимагають кількох екранів управління: Управління EC, рекламою та CRM. Почніть з перегляду, агрегування та створення чернеток; спочатку не надавайте дозвіл на платежі або видалення.
- Наскрізне дослідження та створення матеріалів: Не просто просіть підсумок. Попросіть дослідити конкурентів, звести функції в таблицю, проаналізувати відмінності та підсумувати це в слайд-колоду.
- Прототипування та QA: Доручіть реалізувати функцію, а потім відкрийте браузер, щоб перевірити наявність зламаних макетів або помилок посилань.
Практичний промпт для Astra
Замість того, щоб просто давати роль на кшталт "Ви експерт", встановіть межі та умови завершення.
1## Мета2Стан, якого потрібно досягти цим завданням: [Заповніть мету]34## Кінцевий результат5Що надати: [Файли, таблиці, звіти, реалізовані функції тощо]6Умови завершення: [Конкретні критерії, які потрібно виконати]78## Дозволена інформація та інструменти9Матеріали для посилання: [Файли, URL-адреси, внутрішні дані тощо]10Інструменти для використання: [Веб-пошук, браузер, виконання коду, електронні таблиці тощо]1112## Процес131. Підтвердьте запит та матеріали.142. Організуйте відсутню інформацію та ризики.153. Приступайте до дослідження, аналізу та створення.164. Відкрийте та перевірте результат.175. Організуйте помилки, непідтверджені пункти та залишкові завдання.186. Надайте у стані, придатному для перевірки.1920Якщо один процес зупиняється, продовжуйте з незалежними завданнями.21Запитуйте лише для відсутньої інформації, яка суттєво впливає на результати.22Для незначних прогалин робіть обґрунтовані припущення та записуйте їх.2324## Дозволи25Ви можете продовжувати перегляд, аналіз, створення чернеток, тестування та перевірку diff.26Негайно зупиніться перед наступними операціями та зверніться за дозволом з деталями:27- Зовнішнє надсилання28- Покупки, платежі, контракти29- Публікація, виробниче розгортання30- Видалення даних або файлів31- Зміна дозволів32- Операції, які важко скасувати3334## Умови якості35- Відокремлюйте перевірені факти від припущень.36- Додавайте джерела для важливих цифр.37- Шукайте суперечливі докази або винятки.38- Відкрийте результат, щоб перевірити відображення та роботу.39- Фінальний звіт повинен включати виконані дії, результати перевірки та залишкові ризики.
Слабкі сторони Astra
- Відсутність незалежних довгострокових кейсів: Більшість даних надходить від партнерів, обраних OpenAI.
- 1,05M токенів — це не безкоштовний склад: Витрати зростають із розміром вхідних даних, а ризик пропуску не нульовий.
- Не рідний для аудіо/відео: Вимагає зовнішніх інструментів для цих форматів.
- Відсутність тонкого налаштування: Ви повинні використовувати RAG, MCP або системні інструкції для відображення правил компанії.
- Механізми безпеки можуть зупинити легітимну роботу: Моніторинг може сповільнити дослідження захисту або завдання розробки.
- Вихід може бути "надто ідеальним": Вона схильна сильно використовувати заголовки та списки, що може здаватися надто "ШІ-подібним" для брендового копірайтингу.
Висновок: Цінність у рівні завершення, а не у відповідях
GPT-6 Astra є надмірною для написання одного електронного листа або підсумовування протоколів. Її значення проявляється в роботах, де дослідження, судження, операції, створення та верифікація пов'язані між собою.
Ера "промпт-інжинірингу з одного речення" закінчилася. Тепер важливо, яку інформацію передавати, які інструменти підключати, скільки виконання дозволяти та що визначає завершення. Astra — це не чарівна паличка, яка дає всім однаковий результат; якщо ви дасте їй безладну роботу, вона швидко зробить безладну роботу. Якщо ви організуєте мету, інструменти та точки перевірки, вона перетворить години людської праці на стан, придатний для перевірки, за лічені хвилини.





