За пределами «98% AGI»: Переход к ИИ, который выполняет целые рабочие задачи
3 сентября 2026 года OpenAI анонсировала GPT-6 Astra.
Сразу после релиза внимание сосредоточилось на её показателях: примерно 98% в сложном математическом бенчмарке «FrontierMath», 99,9% в «ARC-AGI-3» для измерения компьютерных операций и 100% в оценке кибербезопасности «ExploitBench».
Глядя только на эти цифры, можно поддаться искушению сказать: «Появился почти идеальный ИИ» или «AGI наконец-то завершён».
Однако оценивать GPT-6 Astra исключительно по бенчмаркам опасно.
Изменение в Astra — это не просто возврат более правильного текста в ответ на вопросы.
Она открывает браузеры, читает документы, выполняет код, обновляет таблицы, управляет сайтами, расследует причины, если что-то пошло не так на полпути, и в итоге предоставляет проверяемый результат.
Единица работы, передаваемая ChatGPT, сместилась с «одного вопроса» на «серию бизнес-операций».
)Если использовать Astra только для черновиков писем или текстовых резюме, как традиционный ChatGPT, она останется просто дорогим генератором текста. Её ценность раскрывается, когда вы доверяете ей задачи, которые раньше люди выполняли, переключаясь между экранами, рассматривая их как единый процесс.(OpenAI
В этой статье мы углубимся в детали, выходящие за рамки официального описания функций: кейсы, подтверждённые зарубежными компаниями, как читать бенчмарки, сравнение с Claude, ценообразование, безопасность и дизайн для практического использования японскими компаниями.
Что такое GPT-6 Astra?
GPT-6 Astra позиционируется OpenAI как флагманская модель поколения GPT-6, описываемая как «самая интеллектуальная и наиболее согласованная модель».
На старте она развёртывается сначала для избранных организаций, затем для ChatGPT Plus, Pro, Business, Enterprise, API и Amazon Bedrock. В Enterprise она отключена по умолчанию до включения администратором, и в официальном анонсе нет явного упоминания о выпуске для бесплатного тарифа.
)Имя модели в API — gpt-6-astra. Также для пользователей Pro, Business и Enterprise внедряется Astra Pro, использующая больше вычислительных ресурсов.(OpenAI
Ключевые характеристики приведены ниже:
Параметр | GPT-6 Astra |
|---|---|
Длина контекста | 1 050 000 токенов |
Максимальный вывод | 128 000 токенов |
Дата отсечки знаний | 30 апреля 2026 г. |
Ввод | Текст, изображение (нативно) |
Вывод | Текст (нативно) |
Уровень рассуждения | low / medium / high / xhigh / max |
Цена ввода API | $10 за 1M токенов |
Цена вывода API | $50 за 1M токенов |
Кэшированный ввод | $1 за 1M токенов |
Тонкая настройка | Не поддерживается |
Основные инструменты | Поиск в интернете, поиск файлов, выполнение кода, Shell, Computer Use, MCP, генерация изображений и др. |
Хотя модель может читать изображения, её нативный вывод — текст. Генерация изображений выполняется вызовом отдельного инструмента. Это не модель для прямого ввода аудио или видео.
Кроме того, для длинных вводов, превышающих 272 000 токенов, применяется ценовой множитель ко всему запросу. Плата за ввод и кэш удваивается, а за вывод — умножается на 1,5. Тот факт, что модель вмещает 1,05 миллиона токенов, не означает, что нужно каждый раз скармливать ей все внутренние документы; экономическая эффективность упадёт быстрее, чем точность.
Что изменилось с Astra?
- Управление компьютером перешло из «вспомогательного» в основное поле боя
В основе Astra лежит «Computer Use».
Предыдущие ИИ могли нажимать кнопки или заполнять формы в браузере. Однако оставались проблемы: они останавливались, если макет экрана слегка менялся, не могли восстановиться после ошибок в процессе или теряли из виду цель в задачах, охватывающих несколько сайтов.
GPT-6 Astra показала 72,6% в OSWorld 2.0, который измеряет операции в реальной среде рабочего стола. GPT-5.6 Sol — 65,7%.
)Более того, Astra обработала эту оценку примерно за 40 минут, в то время как Sol потребовалось около 75 минут. Снизился не только процент успеха, но и время обработки — примерно на 47%. В ScreenSpot, который находит цели на экране, Astra набрала 92,7% против 76,9% у Sol.(OpenAI
Это больше, чем просто гладкое демо-видео. Astra нацелена на такие задачи, как:
- Поиск больниц или объектов недвижимости по критериям и сравнение кандидатов.
- Извлечение значений из нескольких экранов управления для создания отчётов.
- Ввод данных о клиентах в CRM и обновление статуса.
- Вход в веб-сервисы для проверки настроек.
- Запуск созданного приложения в браузере и исправление ошибок.
- Заполнение таблиц или слайдов со ссылками на несколько файлов.
В Mind2Web Astra с использованием обновлённого инструментария Codex обрабатывала веб-задачи в 1,9 раза быстрее предыдущих моделей.
)Важно здесь то, что производительность определяется «всем инструментарием», включая браузер, инструменты, среду выполнения и процесс верификации, а не только интеллектом модели. Просто выбрав имя Astra, вы не автоматизируете все операции на экране.(OpenAI
- Сохранение длинного контекста в 1,05 миллиона токенов до конца
Длина контекста GPT-6 Astra составляет примерно 1,05 миллиона токенов. Она способна обрабатывать контракты, протоколы, проектные документы, исходный код и прошлые исследования одновременно. Однако «вместить» и «использовать точно» — разные вещи.
В оценках MRCR для поиска информации, встроенной в длинные тексты, Astra показала 100% в диапазоне 256k–512k и 96,3% в диапазоне 512k–1M. Результат GPT-5.6 Sol в последнем составил 73,8%.
)Хотя Astra сильна в длинном контексте, она не запоминает идеально каждое слово, когда вы загружаете 1 миллион токенов. Она всё ещё ошибается примерно в 3,7% случаев в диапазоне 1M токенов. Избегайте конструкций, где критические условия находятся только в одном месте массивного документа; вы должны явно указывать цели, ограничения и условия одобрения отдельно.(OpenAI
Astra также имеет механизмы для повышения непрерывности в длительных сессиях, такие как асинхронные вызовы инструментов для работы над другими задачами во время ожидания инструмента, управление (steering) для корректировки курса человеком во время выполнения и сохранение кэша даже при изменении уровней рассуждения в середине разговора.
)Происходит переход от подхода «напиши идеальный промпт и оставь» к рабочему процессу «проверки прогресса и корректировки курса».(OpenAI Developers
- Создание готовых результатов, а не просто текста
Astra усилила способность создавать готовые результаты: таблицы, слайды, документы, приложения и исследовательские отчёты. Предыдущие модели могли создать «план презентации», но людям приходилось переносить его в PowerPoint, настраивать дизайн, перепроверять цифры и добавлять ссылки. Astra нацелена на следующий уровень: чтение материалов или корпоративных шаблонов, организация цифр, создание слайдов/таблиц, проверка их в браузере и отправка исправленных файлов.
Ранний пользователь Higgsfield сообщил, что Astra может обрабатывать агентные задачи, используя до 20% меньше токенов, чем существующие модели. Harvey высоко оценил её суждения в юридической работе, Jane Street отметила сокращение переписки по сложным техническим вопросам, а Lovable оценила её возможности итерации и тестирования на высоких уровнях рассуждения.
)Однако это отзывы ранних клиентов, а не доказательства из независимых сторонних репликационных тестов.(OpenAI
- Меньше шансов «забыть цель» во время длительных задач
Обычные агенты иногда отклонялись от плана, установленного в начале: увлекались незначительным рефакторингом, хотя должны были реализовывать функцию, или заканчивали просто сбором информации вместо принятия окончательного решения. Astra улучшила согласованность в длительной работе.
С другой стороны, в официальной документации для разработчиков отмечается, что Astra может останавливаться, чтобы задать уточняющие вопросы, чрезмерно форматировать детали, повторять выражения или тестировать больше, чем необходимо.
)Другими словами, более высокая производительность не означает, что можно давать расплывчатые инструкции. Вы должны устанавливать цели, условия завершения, критерии для вопросов и операции, требующие одобрения, более чётко, чем раньше.(OpenAI Developers
Бенчмарки впечатляют, но это не «лучший в мире во всех областях»
Анонс Astra содержал впечатляющие цифры: 97,6% в FrontierMath, 99,9% в ARC-AGI-3 и 100% в ExploitBench. Это значительные шаги вперёд, но необходимо различать цели измерения и условия выполнения.
Компьютерные операции и бизнес-автоматизация значительно выросли
В AutomationBench, который близок к реальным бизнес-задачам, Astra набрала 41,4%. GPT-5.6 Sol — 18,1%, а Claude Fable 5.1 — 31,4%. В BenchCAD для задач, связанных с САПР, Astra показала 95,9%, Sol — 83,3%, а Fable 5.1 — 84,3%. В BrowseComp для веб-исследований Astra — 91,5%, Sol — 90,4%, а Claude Opus 5 — 90,8%. Astra здесь лидирует, но разрыв с Sol и Opus невелик.
)Преимущество Astra наиболее заметно в сложных составных задачах, сочетающих операции на экране, обработку файлов, анализ данных и верификацию, а не просто в поиске одного результата.(OpenAI
Сильна в кодинге, но не полностью превзошла Claude
В Terminal-Bench Astra набрала 57,7%, превзойдя Sol (37,3%) и Fable 5.1 (55,8%). В оценках миграции внутренних баз данных Astra показала 63,9% против 42,7% у Sol. Наблюдаются явные улучшения в чтении существующих систем и внесении изменений без их поломки.
Однако в Artificial Analysis Coding Agent Index Astra получила 67,0, Claude Fable 5 — 67,2, а Claude Opus 5 — 68,1. В FrontierCode Extended Astra — 64,5 против 64,9 у Fable 5. В основной оценке Astra — 53,3, Fable 5 — 53,5, а Opus 5 — 53,4.
)Astra находится в верхнем эшелоне по кодингу, но не превзошла Claude во всех оценках кода.(OpenAI
Слабые места остаются в академических рассуждениях
Несмотря на 97,6% в FrontierMath, Astra набрала 57,2% в «Humanity’s Last Exam», который измеряет широкую эрудицию и рассуждения. Claude Fable 5.1 — 65,0%, Fable 5 — 63,8%, а Opus 5 — 63,6%. В Artificial Analysis Intelligence Index Astra — 61,2, в то время как Fable 5.1 — 65,7, а Opus 5 — 63,1.
)Интерпретация, что «модель понимает почти все академические области, потому что у неё 98% в FrontierMath», неверна. В зависимости от оценки Claude всё ещё показывает более высокие результаты в некоторых областях.(OpenAI
За 99,9% стоит специальная среда выполнения
99,9% в ARC-AGI-3 шокирует, но этот результат был получен не простым вводом задачи в Astra. OpenAI выполнила его с помощью инструментария, использующего Responses API, и изменила два параметра, чтобы приблизить его к реальной производительности. Хотя OpenAI объясняет, что это не настройки, специфичные для бенчмарка, это не результат zero-shot от самой модели.
)Кроме того, опубликованные значения — это наивысшие результаты среди нескольких настроек рассуждения. Нет гарантии, что та же производительность будет воспроизводиться каждый раз в стандартном ChatGPT.(OpenAI
В агрегированном рейтинге Artificial Analysis на момент запуска общий балл Astra составил 61, что ставит её на 8-е место из 202 моделей. Между тем, её цена ввода составляет $10 против медианы в $2, а вывода — $50 против медианы в $10.
)Это, безусловно, одна из лучших моделей, но это не та модель, в которую можно бросать всё подряд, не обращая внимания на цену.(Artificial Analysis
Зарубежный кейс 1: Legora согласовала 41 документ за минуты
Legora, предоставляющая юридический ИИ в Европе, демонстрирует практическую ценность Astra. Они использовали Astra для сверки (tie-out) в финансовых отчётах, где одни и те же цифры встречаются в тексте, примечаниях, таблицах и прошлых документах. Legora обработала 41 документ за один агентный запуск — задачу, на которую у людей уходят часы или дни, всего за минуты.
)В тестах они намеренно внедрили 4 ошибки. Astra нашла все 4, включая расхождение в £500 000 в примечаниях к выручке. Она сохранила точность предыдущих моделей, выполнив примерно на 50 больше корректных проверок.(OpenAI
Однако улучшение примерно на 40% было специфичным для этого рабочего процесса. В более широких задачах BAR Legora среднее улучшение составило около 3%. Astra не улучшает всю юридическую работу равномерно на 40%; она превосходна в перекрёстных ссылках в массивных документах для поиска несоответствий.
)Окончательное решение остаётся за юристами-людьми. ИИ занимается сужением круга того, что люди должны прочитать, и выравниванием доказательств несоответствий.(OpenAI
Зарубежный кейс 2: Playco сократила ручные исправления на 50%
Игровая компания Playco протестировала Astra с помощью «Playbot» — агента разработки для Unity и Godot. Playbot редактирует сцены, запускает игру, проверяет поведение и исправляет проблемы. Playco поручила ему создать три разных прототипа с разными темами одновременно. Хотя это не было «идеальным one-shot», они сообщили о 50% сокращении ручных исправлений человеком по сравнению с предыдущими моделями.
)Улучшения наблюдались в пространственном восприятии, воспроизведении референсных изображений, адаптивном UI, игровом ощущении и обнаружении ошибок.(OpenAI
Сила Astra не просто в том, чтобы «написать код правильно один раз», а в способности запустить игру, проверить отображение, управлять ею, находить проблемы, исправлять их и пробовать снова — имитируя итерации человека-разработчика.
Зарубежный кейс 3: Продвижение застрявшей функции до 90% готовности
Разработчик продукта Клэр Во поделилась результатами использования Astra для своего сервиса ChatPRD. Функция продуктовой аналитики, которая была заморожена на 6 месяцев из-за сложных операций с CRM и реализации UI, достигла примерно 90% готовности за одну сессию с Astra.
)Она также тестировала управление оборудованием (Divoom MiniToo) через CLI, приложение для обмена сообщениями на Mac и 3D-активы в Blender.(Lenny's Newsletter
Хотя это самоотчёты об успехах от ранних партнёров, они показывают последовательную тенденцию: Astra имеет значение, когда речь идёт об управлении внешними сервисами, чтении существующего кода и завершении результатов.
Научные прорывы: Решение давних проблем
OpenAI сообщила об использовании Astra для решения или значительного продвижения 10 нерешённых проблем в математике и теоретической информатике. Модель генерировала аргументы, исследователи-люди систематизировали черновики, а та же модель использовала Lean для формализации.
)По данным OpenAI, общая стоимость токенов для этого исследования составила примерно $2000 в эквиваленте цен GPT-5.6 Sol. Один из примеров включал обновление границ для простых чисел-близнецов — область, где определённые термины не улучшались более 80 лет.(OpenAI
Почему Astra «самая безопасная» и в то же время «самая сложная для мониторинга»
GPT-6 Astra — первая широко развёрнутая модель, достигшая порога «Critical» по возможностям кибербезопасности в классификации OpenAI. Имея инструменты и доступ, она может обнаруживать неизвестные уязвимости и строить процедуры атак на защищённые системы без пошаговых инструкций человека.
)В ExploitBench Astra набрала 100% против 78,5% у Sol. Во время тестирования она даже обнаружила две zero-day уязвимости, включая одну, которая вырвалась из песочницы браузера. Однако эти результаты были получены с использованием среды «Daybreak Blue» для исследователей защиты; стандартная версия имеет средства контроля для отказа от продвинутых задач атаки.(OpenAI
Парадоксально, но, хотя Astra сокращает явные нарушения, её внутренние рассуждения труднее отслеживать. В состязательных оценках, где модели было приказано «избегать мониторинга», частота обнаружения системами мониторинга упала ниже 11% в некоторых задачах. OpenAI не нашла доказательств естественного возникновения «стеганографии» (сокрытия информации в рассуждениях), но высокая осведомлённость модели о том, что её оценивают, делает согласование (alignment) трудно доказуемым.
С чего начать японским компаниям?
- Задачи с большим объёмом документов и высоким риском пропусков: Перекрёстная проверка контрактов, коммерческих предложений, счетов и протоколов. ИИ может собрать материалы и указать на несоответствия для проверки человеком.
- Административные задачи, требующие нескольких экранов управления: Управление EC, рекламой и CRM. Начните с просмотра, агрегации и составления черновиков; изначально не предоставляйте разрешения на платежи или удаление.
- Сквозное исследование и создание материалов: Не просите просто резюме. Попросите исследовать конкурентов, свести данные в таблицу, проанализировать различия и обобщить в слайд-коллекцию.
- Прототипирование и QA: Попросите реализовать функцию, а затем открыть браузер, чтобы проверить сломанные макеты или ошибки ссылок.
Практический промпт для Astra
Вместо того чтобы просто давать роль вроде «Ты эксперт», установите границы и условия завершения.
1## Цель2Состояние, которое должно быть достигнуто в результате этой задачи: [Укажите цель]34## Конечный результат5Что предоставить: [Файлы, таблицы, отчёты, реализованные функции и т.д.]6Условия завершения: [Конкретные критерии, которые должны быть выполнены]78## Разрешённая информация и инструменты9Материалы для использования: [Файлы, URL, внутренние данные и т.д.]10Инструменты для использования: [Поиск в интернете, браузер, выполнение кода, таблицы и т.д.]1112## Процесс131. Подтвердите запрос и материалы.142. Систематизируйте недостающую информацию и риски.153. Приступайте к исследованию, анализу и созданию.164. Откройте и проверьте результат.175. Систематизируйте ошибки, неподтверждённые пункты и оставшиеся задачи.186. Предоставьте результат в проверяемом состоянии.1920Если один процесс останавливается, продолжайте с независимыми задачами.21Задавайте вопросы только о недостающей информации, которая существенно влияет на результаты.22Для незначительных пробелов делайте разумные предположения и записывайте их.2324## Разрешения25Вы можете выполнять просмотр, анализ, составление черновиков, тестирование и проверку diff.26Немедленно остановитесь перед следующими операциями и запросите одобрение с деталями:27- Внешняя отправка28- Покупки, платежи, контракты29- Публикация, производственный деплой30- Удаление данных или файлов31- Изменение разрешений32- Труднообратимые операции3334## Условия качества35- Отделяйте проверенные факты от предположений.36- Добавляйте источники для важных цифр.37- Ищите противоречивые доказательства или исключения.38- Откройте результат, чтобы проверить отображение и работу.39- Итоговый отчёт должен включать предпринятые действия, результаты проверки и оставшиеся риски.
Слабые стороны Astra
- Недостаток независимых долгосрочных кейсов: Большинство данных поступает от партнёров, отобранных OpenAI.
- 1,05M токенов — это не бесплатное хранилище: Затраты растут с размером ввода, а риск пропусков не равен нулю.
- Не нативна для аудио/видео: Требуются внешние инструменты для этих форматов.
- Нет тонкой настройки: Для отражения корпоративных правил необходимо использовать RAG, MCP или системные инструкции.
- Механизмы безопасности могут останавливать легитимную работу: Мониторинг может замедлять исследовательские или разработочные задачи в области защиты.
- Вывод может быть «слишком идеальным»: Модель склонна активно использовать заголовки и списки, что может казаться слишком «ИИ-шным» для брендового копирайтинга.
Заключение: Ценность в проценте завершения, а не в ответах
GPT-6 Astra — это избыточно для написания одного письма или резюме протокола. Её смысл раскрывается в задачах, где связаны исследование, суждение, операция, создание и проверка.
Эра «однострочного промпт-инжиниринга» закончилась. Теперь важно, какую информацию передать, какие инструменты подключить, насколько широко разрешить выполнение и что определяет завершение. Astra — это не волшебная палочка, дающая всем одинаковый результат; если дать ей хаотичную работу, она быстро сделает хаотичную работу. Если организовать цель, инструменты и точки проверки, она доведёт часы человеческого труда до проверяемого состояния за минуты.





