Привет, энтузиасты ИИ!
На этой неделе OpenAI сделала официальное заявление: добро пожаловать в Эпоху AGI.
GPT-6 Astra вышла, и OpenAI продаёт её как поколенческий скачок — огромный прогресс в использовании компьютера, программировании, исследованиях и той долгой, запутанной работе, которая раньше требовала постоянного человеческого контроля.
Я на секунду приму маркетинг за чистую монету, потому что он поднимает вопрос, которого индустрия тихо избегала: как нам на самом деле это измерять?
Последние несколько лет ИИ жил по бенчмаркам. Каждый запуск сопровождается таблицей, доказывающей, что новая модель на 3% лучше здесь, на 7% лучше там и загадочным образом на 12% умнее согласно бенчмарку, которого не существовало прошлой весной. Мы ранжируем их, раскрашиваем в цвета, выстраиваем в таблицы лидеров и коронуем победителя. Это работало достаточно хорошо, пока модели в основном отвечали на вопросы. Это перестаёт работать в тот момент, когда модели начинают что-то делать.
Вот в чём суть проблемы: бенчмарк — это просто банк вопросов. Вы даёте модели задачу, она выдаёт ответ, вы сверяете ответ с ключом. Даже самые навороченные бенчмарки для использования компьютера, по сути, представляют собой кучу заранее написанных задач, выполняемых в заранее созданных средах. Это действительно полезно. Но это совершенно не похоже на то, что происходит, когда вы запускаете агента на реальной машине и говорите ему что-то сделать.
В реальной жизни нет файла с бенчмарком. Ничто на вашем рабочем столе не говорит вам точно, как выглядит «готово».
Настоящий компьютер — это браузер, который зависает в середине задачи, сайт, который вчера тихо изменил дизайн, таблица с тремя противоречивыми версиями, разрешение, о котором никто не упомянул, PDF-файл, зарытый на шесть папок вглубь, API, который истекает по тайм-ауту на самом неподходящем запросе, и человек, который говорит «можешь просто разобраться с этим?», а затем уходит, не определив, что такое «это».
Агенту нужно разобраться самому. И та часть, которую никто хорошо не бенчмаркает: ему нужно восстановиться, когда первая попытка проваливается. Это совершенно другой навык, чем получение правильного ответа.
Вот почему сообщения о том, что OpenAI купила десятки тысяч потребительских Mac для обучения с подкреплением и тренировки использования компьютера, говорят о большем, чем кажется. Точные цифры были озвучены, но не проверены — однако направление не вызывает сомнений. Передовые лаборатории хотят, чтобы их модели работали на реальных машинах, а не были заперты в чат-окне. И это тихо ломает всю игру с бенчмарками.
Представьте двух агентов, один и тот же компьютер, одно и то же расплывчатое задание:
Исследуйте этот рынок, выберите три перспективные компании, составьте финансовое сравнение и подготовьте презентацию для инвестиционного комитета.
Нет одного правильного способа это сделать. Их сотни. Один агент ищет два часа. Другой пишет скрипт. Третий на полпути натыкается на лучший источник данных и выбрасывает свой первоначальный план. Четвёртый делает ошибку, замечает её и исправляет. Пятый вручает вам великолепную презентацию, построенную на совершенно неверных цифрах.
Так кто же победил? Автор бенчмарка не может заранее написать ответ, потому что его не существует.
И вот здесь становится по-настоящему неловко. Самая сложная часть оценки агента, возможно, больше не в том, был ли ответ правильным. А в том, было ли это вообще полезно. Это звучит как придирка. Но это не так.
Возьмите агента, который проходит 95% бенчмарка по использованию компьютера, а затем запустите его в реальной компании на неделю. Он создаёт неправильную структуру папок, перезаписывает живую таблицу, тратит шесть часов впустую, преследуя ложный след, уверенно цитирует статистику за 2023 год и упирается в стену разрешений, о которой даже не догадывается спросить. Каждая задача бенчмарка: выполнена идеально. Никто не оставил бы его на работе на вторую неделю.
Теперь возьмите агента, который набирает всего 85% — но знает, когда он запутался, задаёт тот самый вопрос, который его разблокирует, меняет тактику, когда что-то ломается, и тихо сдаёт работу, которой вы действительно можете воспользоваться. Кто из них умнее? Таблица лидеров понятия не имеет. Честно говоря, мы тоже.
Вот почему я считаю, что независимые бенчмарки упираются в стену. Не потому, что исследователи халтурят — они создают более сложные и реалистичные тесты, чем когда-либо. Проблема в том, что реальность постоянно оказывается больше, чем тест. Вы можете сделать бенчмарк длиннее, добавить больше инструментов, больше сайтов, больше приложений, больше шагов, больше случайности. Это не имеет значения. Вы всё равно строите игру с правилами, и как только модель учится играть в эту игру, вы возвращаетесь к исходной точке.
Итак, мы получим баллы. 91,4%. 94,7%. 97,2%. 98,1%. Люди будут спорить, побеждает ли Модель А Модель Б. Кто-то запустит ещё одну таблицу лидеров. Кто-то другой запустит таблицу лидеров для таблиц лидеров. И всё это время модель будет сидеть на реальном компьютере и делать то, что ни одно из этих чисел не может описать.
Вот он, парадокс бенчмарка: чем ближе ИИ подходит к интеллекту общего назначения, тем меньше о нём говорит банк заранее написанных вопросов.
Так что же приходит на смену? Я не думаю, что ответ — «лучший бенчмарк». Я думаю, это нечто принципиально иное. Перестаньте давать агенту вопрос и дайте ему цель. Перестаньте давать ему аккуратную песочницу и дайте ему беспорядок. Перестаньте оценивать, следовал ли он ожидаемым шагам, и оценивайте, достиг ли он результата. Перестаньте прогонять один и тот же публичный тест и бросайте его в постоянно меняющиеся среды, на частные задачи, которые он никогда не видел.
И перестаньте спрашивать только, преуспел ли он. Спросите, насколько надёжно он преуспевает, сколько это стоило, сколько времени заняло, как часто ему требовался человек, насколько безопасно он вёл себя и выдержала ли работа столкновение с реальностью.
Проще говоря: следующее поколение оценки ИИ должно меньше походить на экзамен и больше — на стажировку.
Не спрашивайте модель:
Прошёл ли он тест?
Дайте ему ноутбук, учётную запись, бюджет, цель и неделю. А потом смотрите, что он делает. Это скажет вам гораздо больше о его интеллекте — и это будет кошмаром для стандартизации. В этом-то и суть.
Реальный интеллект хаотичен, контекстуален, адаптивен и открыт. Как только вы сплющиваете его в чистый список вопросов с фиксированными ответами, вы перестаёте измерять интеллект. Вы измеряете умение сдавать тесты.
И поэтому Astra воспринимается мной иначе. OpenAI говорит нам вслух, что мы вступили в Эпоху AGI. Хорошо. Но если это правда, нам, вероятно, стоит перестать давать AGI стандартизированный экзамен, который мы разработали для чат-ботов.
Интересный вопрос больше не в том, «какой у него балл?» Он в том, «что произойдёт, если дать ему компьютер и сказать что-то сделать?» И я подозреваю, что мы вот-вот обнаружим, что у нас пока нет хорошего ответа.
Итак — добро пожаловать в Эпоху AGI. И, тихо, в то же время: добро пожаловать в Эпоху Неоцениваемого ИИ. Бенчмарк не стал хуже. Просто то, что мы пытаемся измерить, вышло за его рамки.





