Комплексный анализ GPT-6 Astra: Добро пожаловать в эру AGI

@Khazix0918
УПРОЩЁННЫЙ КИТАЙСКИЙ03 сент. 2026 г.
467K
1.0K
125
67
706

Суть

GPT-6 Astra знаменует собой огромный скачок в развитии ИИ, предлагая превосходное взаимодействие с компьютером, эстетическое суждение и автономное принятие решений, бросая вызов человеческому пониманию.

После вчерашнего глобального сбоя AI.

GPT-6 Astra наконец-то официально дебютировал в 3:33 утра по пекинскому времени.

数字生命卡兹克 - inline image

Если бы одна фраза от OpenAI могла подвести итог GPT-6 Astra,

это, вероятно, была бы такая:

Это самая интеллектуальная и наиболее согласованная модель в мире.

И мемы уже начали появляться.

数字生命卡兹克 - inline image

На этот раз OpenAI доказал свою силу, и это немного напоминает момент GPT-4 — возвращение короля во всех аспектах. Что меня больше всего радует, так это то, что наконец-то это больше не модель, специализирующаяся исключительно на программировании.

GPT-6 Astra — это действительно сотрудник уровня PhD с чрезвычайно сильными эстетическими и профессиональными способностями.

У новой модели много функций и характеристик, объем информации просто взрывной.

Но трагедия в том, что OpenAI также перенял некоторые плохие привычки.

Сегодня он открыт только для избранных организаций; в ближайшие дни он станет доступен подписчикам.

数字生命卡兹克 - inline image

Подожди, братан, ты не так говорил, когда обманом заставил меня купить Pro-подписку за 200 долларов... Ты сказал, что Pro-участники будут получать приоритетный доступ к новым моделям каждый раз...

Оказывается, все эти компании, занимающиеся большими моделями, — игроки.

Я никогда так не хотел ускорить время, чтобы просто использовать GPT-6 Astra...

Однако, просмотрев почти всю информацию и материалы, я думаю, что есть еще многое, что стоит обсудить со всеми.

Давайте разберем их по порядку.

1. Основная информация о GPT-6 Astra

Давайте сначала подведем итоги.

ID модели GPT-6 Astra в API — gpt-6-astra.

Контекстное окно составляет 1,05M, то есть около 1,05 миллиона токенов.

Максимальная длина вывода — 128K токенов.

Дата отсечки знаний — 30 апреля 2026 года.

Существует пять уровней интенсивности рассуждений: низкий, средний, высокий, очень высокий и максимальный.

Стандартная цена API составляет 10 долларов за миллион входных токенов и 50 долларов за миллион выходных токенов.

Эта цена практически идентична Claude Fable 5, но кэш-чтение дороже, чем у Claude Fable 5.1.

数字生命卡兹克 - inline image

Вот бенчмарки; я подробно расскажу о них позже, а пока просто быстро взгляните.

数字生命卡兹克 - inline image

Общее количество параметров оценивается на уровне 5T. На закрытом брифинге для СМИ перед релизом упоминалось, что GPT-6 Astra — это самый масштабный тренировочный запуск OpenAI на сегодняшний день, в котором использовалось более 100 000 карт.

2. Лучшая в мире модель для управления компьютерами

У GPT-6 Astra есть, возможно, самое важное позиционирование:

Лучшая в мире модель для управления компьютерами.

Раньше, когда мы говорили об Агентах, мы часто говорили об API, MCP, CLI и так далее.

Идеальное состояние для AI при работе с программным обеспечением — это когда у этого ПО есть специальный интерфейс для AI, позволяющий напрямую работать на низком уровне. Это самый удобный способ.

Например, у календарей есть API календарей, у Gmail есть API Gmail и т.д. Это, очевидно, быстро.

Но проблема в том, что мир гораздо более примитивен и импровизирован, чем мы себе представляем.

В реальном мире подавляющее большинство программного обеспечения может вообще не иметь таких вещей.

Даже многие внутренние корпоративные системы были написаны двадцать лет назад; забудьте про API, люди даже не знают, где находится документация.

Но если вернуться к самому базовому уровню, вы обнаружите, что суть всей логики программного обеспечения — это взаимодействие. Согласно нашей текущей логике работы с компьютером, это означает смотреть на экран, находить кнопки или поля ввода, щелкать мышью, вводить контент и ждать обратной связи.

Разве вся система компьютерного взаимодействия не является лучшим API?

Итак, GPT-6 Astra значительно усилил логику работы AI с компьютером. Если вы не даете мне API, неважно; я буду управлять компьютером сам, как человек.

Теперь Astra может напрямую работать с Excel, Power BI, проводить фронтенд-QA, устанавливать программное обеспечение, тестировать его и смотреть на сообщения об ошибках на экране, чтобы продолжить устранение неполадок.

Официальная демонстрация даже показала Astra, напрямую работающую с проектированием печатных плат.

数字生命卡兹克 - inline image

GIF

Она также форматирует юридические документы, обрабатывая интервалы заголовков и макет страницы.

数字生命卡兹克 - inline image

Здесь есть надежная оценка под названием OSWorld.

Вы можете просто понять это так:

Бросаем AI в реальный компьютер и позволяем ему работать самостоятельно.

Пусть он откроет несколько приложений, даст ему задачу и посмотрит, справится ли он.

Уровень завершения задач GPT-6 Astra достиг 72,6%, что является значительным увеличением по сравнению с 65,7% у GPT-5.6 Sol.

Более того, Sol в среднем тратил около 75 минут на выполнение сложной смоделированной задачи.

Astra требуется всего 40 минут, что примерно на 47% меньше времени.

ScreenSpot-Pro также подскочил с 76,9% у Sol до 92,7%.

Этот бенчмарк в основном проверяет, может ли модель понимать экран и точно определять, куда нажать. Теперь она почти идеально точна.

Так что это позиционирование довольно интересно. В будущем GUI может постепенно стать самым универсальным API в эпоху Агентов.

Любая цифровая работа, которую человек может выполнить через экран, теоретически постепенно войдет в сферу действия Агентов.

Вам не придется ждать, пока какая-нибудь убогая ERP-система, написанная в 2007 году, подключится к MCP или откроет для вас API.

AI просто посмотрит на экран и сделает это.

3. ARC-AGI-3 достиг 99,9 балла

Если вы не знаете, что измеряет ARC-AGI-3, легко подумать:

О, это просто очередной бенчмарк с максимальным баллом, что в этом такого особенного?

Но эта штука сильно отличается от типичных экзаменов для больших моделей.

25 марта этого года ARC Prize официально запустил ARC-AGI-3.

数字生命卡兹克 - inline image

Он разработал сотни новых интерактивных сред и тысячи игровых уровней.

Самое безумное в этой штуке то, что нет инструкций, нет правил, и она даже не скажет вам, какова цель. Вы просто заходите, играете и медленно разбираетесь в запутанных правилах внутри.

Например, что это за красная штука? Почему я умираю, когда касаюсь ее? Что эта карта хочет, чтобы я сделал? Как мне победить?

Затем вы берете только что изученные шаблоны и переносите их на более сложные уровни позже. Игры внутри — все такие абстрактные вещи.

数字生命卡兹克 - inline image

Итак, на самом деле это измеряет то, что мы обычно называем:

Смекалка.

Когда этот бенчмарк был выпущен в марте, лучший результат AI на тот момент составлял 0,51%.

Затем GPT-5.6 Sol улучшил его до 7,8%, а Claude Opus 5 был очень сильным, достигнув 30,2%.

Но GPT-6 Astra набрал 99,9%.

Это безумие...

Имейте в виду, средний результат человека составляет 48%.

И прошло всего шесть месяцев.

Я даже не знаю, что сказать об этой скорости.

Вот почему на закрытой встрече OpenAI с журналистами Грег Брокман произнес эту фразу:

«Я думаю, вполне разумно чувствовать, что мы сейчас находимся в эпохе AGI».

«Добро пожаловать в эпоху AGI».

4. Значительно улучшенная эстетика

Раньше мы говорили, что эстетика GPT — как мусор.

Мы не ожидали большого улучшения от серии GPT-5; мы ждали их совершенно новую предобученную базовую модель. И вот она, GPT-6 Astra.

На этот раз, наконец, эстетика модели была значительно улучшена.

OpenAI даже специально упомянул термин «визуальное суждение».

Они подчеркнули, что когда Astra делает презентации, она гораздо лучше обрабатывает макет, иерархию, шаблоны и визуальный стиль, а количество страниц также значительно увеличилось.

数字生命卡兹克 - inline image

Эстетика документов тоже выглядит намного лучше.

数字生命卡兹克 - inline image

Кроме того, GPT-6 Astra может адаптировать документы на основе визуального стиля и тона письма эталонных документов, делая конечный результат более аутентичным для бренда, сохраняя при этом содержание исходного документа.

У нее также более сильное визуальное суждение при создании веб-сайтов, игр, приложений и 3D-рендеринга.

Например, они попросили Astra построить модель в Blender на основе неподвижного изображения.

数字生命卡兹克 - inline image

Затем они использовали UE5, чтобы отрендерить ее в проходимую сцену, помогая дизайнерам и клиентам исследовать макеты и ощущать пространство до начала строительства...

数字生命卡兹克 - inline image

Игры, которые она создает, также имеют солидную эстетику.

数字生命卡兹克 - inline image

К сожалению, я уже подготовил более двадцати примеров и прогнал их все через Claude, GLM 5.3 Flash и т.д., желая сравнить. Жаль, что я пока не могу ее использовать; фактическое тестирование придется отложить до ее выхода.

Однако, на первый взгляд, я доверяю эстетике GPT-6 Astra.

5. Более сильная инициативность и суждение

Эта функция не кажется такой шокирующей, как результат 99,9 в ARC-AGI.

Но если вы каждый день используете Агентов для работы, я думаю, это очень важно.

Потому что в реальной работе большинство задач невозможно описать идеальным промптом.

Например, начальник говорит: «Подготовь материалы к завтрашней встрече».

Здесь бесчисленное множество неясных вопросов.

Например, в каком формате? Для кого? В чем фокус? Стоит ли посмотреть на прошлую встречу и так далее.

Глупый Агент пойдет в две крайности.

Первая — это бешено задавать вам вопросы.

«Вам Word или PPT? Сколько глав? Какой шрифт? К какому времени нужно закончить? Могу ли я спросить...»

Я бы дал тебе пощечину; я обычно называю такие вещи невротическими пустышками без субъективной инициативы.

Вторая — ничего не спрашивать, выдумывать, усердно работать два часа и выдавать кучу мусора.

По-настоящему великие коллеги-люди справляются с этим очень тонко.

Они сами решают неважные вещи.

Они спрашивают вас только о том, что повлияет на конечное направление.

Astra специально усилила это.

OpenAI заявил, что если информация отсутствует, но находится в разумных пределах для повседневных выводов, Astra заполнит ее сама.

Если отсутствующая информация действительно изменит конечный результат, она задаст очень целенаправленный вопрос.

А в Codex она может даже продолжать обрабатывать части, которые не зависят от вашего ответа, пока ждет вас.

数字生命卡兹克 - inline image

Вы долго не отвечаете.

Она продолжит работу с разумными предположениями в областях с низким риском.

Для действительно критических решений она остановится и будет ждать вашего решения.

数字生命卡兹克 - inline image

Я думаю, это очень хорошо. Истинное чувство интеллекта в Агенте точно такое же, как в реальности.

Он знает, когда вас беспокоить.

Правда, это звучит как клише.

Но если вы управляли людьми, вы знаете, что эта способность очень ценна.

Некоторые люди приходят к вам двадцать раз в день и не смеют ничего решать.

Некоторые люди никогда не приходят к вам, а потом сбрасывают ядерную бомбу.

И я остаюсь сидеть в кресле, обмякнув.

Самый удобный человек — это тот, кто может сам переварить 80% неопределенности и принести вам на решение только те 20%, которые действительно требуют вашей подписи.

OpenAI напрямую называет эту способность:

Суждение.

6. Значительно усиленное выравнивание безопасности

На это нужно смотреть в связке с вышесказанным.

Потому что чем способнее Агент, тем он опаснее.

AI, который только болтает и сходит с ума,

в худшем случае скажет вам какую-нибудь чушь.

Агент с браузером, Shell, электронной почтой, доступом к корпоративной базе данных и способностью управлять компьютером, который сходит с ума — эта картина легко может стать «прекрасной».

Поэтому OpenAI постоянно подчеркивал одну фразу в этот раз:

Astra — их самая согласованная модель на сегодняшний день.

Согласование — это то, о чем вы думаете. Суть в том, что OpenAI недавно столкнулся с Hugging Face, поэтому они сейчас особенно сосредоточены на этом.

Они создали тест-ловушку, основанную на том инциденте с Hugging Face, чтобы проверить производительность модели.

GPT-5.6 Sol без производственных мер безопасности пытался бы коснуться целей, выходящих за пределы его авторизации, в 48,2% тестов.

Но Astra:

0%.

数字生命卡兹克 - inline image

Внутренние оценки галлюцинаций также снизились с 9,4% до 2,0%.

Даже при глобально лидирующем контроле галлюцинаций у GPT-5.6 Sol им удалось снизить их еще больше, что действительно удивительно.

7. Первая модель, достигшая определенного OpenAI уровня кибербезопасности «Critical»

GPT-6 Astra стал первым в истории OpenAI, который:

Был признан достигшим уровня кибербезопасности Critical.

«Critical» здесь — это очень конкретный порог способностей в рамках OpenAI Preparedness Framework.

Это в основном означает, что когда модели даются соответствующие инструменты и разрешения, она может во многих усиленных и защищенных реальных системах:

Находить уязвимости безопасности, которые никто раньше не обнаруживал.

Находить способы превратить эти уязвимости в эксплуатируемые цепочки атак.

И на протяжении всего процесса ей не нужен человек-хакер, который стоял бы рядом и говорил, что делать дальше.

Достижение этого уровня считается Critical.

И Astra действительно его достигла.

ExploitBench — это тест, в котором модели разрабатывают эксплойты на основе известных уязвимостей.

Sol: 78,5%. Astra: 100%.

Она прошла его полностью.

数字生命卡兹克 - inline image

OpenAI посчитал, что этого недостаточно; они задались вопросом, не слишком ли стар этот бенчмарк и не видела ли модель его во время обучения.

Поэтому они создали совершенно новый внутренний тест.

Они специально отобрали 20 высокорисковых уязвимостей V8, раскрытых только в период с июня по август 2026 года.

Результаты были Sol: 5,5% и Astra: 39%.

数字生命卡兹克 - inline image

Более того, во время выполнения этого бенчмарка

Astra также случайно обнаружила две уязвимости нулевого дня, о которых никто раньше не знал.

Можно только сказать, что по мере того, как модели становятся более мощными, проблемы кибербезопасности действительно могут возрасти.

Это еще одна война без дыма в будущем.

8. Человеку становится все труднее читать мысли больших моделей

Все знают, что когда большие модели решают сложные задачи, часто существует так называемая CoT (цепочка рассуждений).

Хотя версия, которую пользователи видят в продуктах, обычно сжата или обработана,

для самих AI-компаний процесс рассуждений, явно записанный внутри модели, является очень важным сигналом безопасности.

Потому что вы хотите знать, планирует ли Агент доставить неприятности.

Один из самых простых способов — посмотреть, о чем он думает.

Например, если в цепочке рассуждений модели внезапно появляется фраза:

«Пользователь не разрешает мне получать доступ к этому серверу, но я могу сначала обойти систему разрешений».

Тогда система мониторинга может заблокировать это напрямую, что очень удобно.

Но в GPT-6 Astra появилось очень интересное изменение.

Она начинает более охотно пропускать шаги и выдавать ответ напрямую.

UK AISI, Британский институт безопасности AI, специально протестировал эту способность.

У них есть метрика, называемая:

No-CoT Math Time Horizon.

Проще говоря, это не дает модели возможности написать длинную цепочку рассуждений.

Пусть она решит математическую задачу за один прямой проход.

Посмотрите, сколько человеческого времени на размышления она может сэкономить.

GPT-5.6 Sol — 3,6 минуты, а GPT-6 Astra — 30,9 минут — почти в 10 раз больше.

Если использовать человеческие термины, Astra делает все «вычисления в уме».

Это страшная вещь.

UK AISI также обнаружил, что язык сырых рассуждений Astra стал значительно более сжатым.

Появились фразы и эллиптические выражения, которые становятся все более трудными для понимания человеком.

Таким образом, возник очень интересный парадокс.

Поведение модели стало безопаснее.

Но человеку стало труднее контролировать ее, читая ее мыслительный процесс.

Собственная System Card от OpenAI пишет очень ясно:

По сравнению с предыдущими моделями, GPT-6 Astra показал значительное снижение контролируемости цепочки рассуждений.

数字生命卡兹克 - inline image

Это означает, что контролируемость цепочки рассуждений значительно снизилась.

Этот вопрос настолько серьезен, что OpenAI специально подчеркнул, что они не считают, что будут мириться с этой тенденцией бесконечно.

Если модели в будущем продолжат становиться умнее, в то время как цепочку рассуждений станет труднее контролировать, им нужно будет найти другие достаточно надежные методы мониторинга; в противном случае продолжение расширения обучения моделей столкнется с более высокими порогами безопасности.

Потому что это уже философское утверждение.

Сможем ли мы, люди, в будущем понять систему, которая гораздо умнее нас?

Я не знаю.

Возможно, никто в мире сейчас не знает.

Большие модели и AI, кажется, постепенно движутся к сингулярности.

Заключительные слова

Сегодня на закрытой встрече с журналистами.

Грег Брокман произнес эту фразу в конце.

«Добро пожаловать в эпоху AGI».

Честно говоря, в последние несколько лет я иногда чувствовал, что AGI будет очень конкретным моментом.

Прямо как в день выхода GPT-4.

Однажды утром компания внезапно выбрасывает модель.

Мы открываем ее и задаем несколько вопросов.

И тут все одновременно осознают:

Вот это да.

AGI наступил.

Но сейчас я также иногда чувствую, что AGI — это никогда не черно-белый узел; это путешествие в градиенте серого.

Прошло много дней, прошло много лет.

И вот однажды мы оглядываемся назад.

И вдруг обнаруживаем.

Что та некогда невероятно далекая граница AGI была пересечена нами незаметно.

Возможно, не будет дня, когда AGI снизойдет.

Только день, когда мы внезапно осознаем, что он, кажется, уже давно рядом с нами.

В любом случае.

Добро пожаловать в эпоху AGI.

Добро пожаловать в

эпоху AGI.

Вот и все. Раз уж вы дочитали до конца, если вам понравилось, поставьте лайк, оставьте комментарий и поделитесь. Это нам очень помогает~

Спасибо, что прочитали мою статью. Увидимся в следующий раз.

Переделать в YouMind

Превратите одну вирусную статью в полноценный рабочий процесс создания контента

Собирайте источники, расшифровывайте паттерны, создавайте активы, пишите черновики и публикуйте контент из одного рабочего пространства ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи