Первая премия за решение задачи тысячелетия, уравнения Навье–Стокса, досталась ИИ.
Сложилась крайне неудачная ситуация вокруг того, что должно было стать чем-то вроде истории о новом прогрессе в математических исследованиях с помощью ИИ и еще одной возможностью паниковать из-за стремительного развития искусственного интеллекта.
Или, как мы это называем здесь, просто вторник.
Главное — новая модель, которая лучше Astra
Не упускайте главное. Здесь переплетаются три истории.
Первая история гораздо важнее второй, а вторая, в свою очередь, гораздо важнее третьей.
- Следующая модель от OpenAI за неделю опередила Astra на поколение, и они сообщают нам об этом, потому что все в ужасе от происходящего. Или, официальным языком: «Мы считаем важным информировать мир о темпах развития ИИ и о том, чего ожидать от будущих моделей», а также о том, что нам «могут потребоваться более взвешенные решения относительно скорости прогресса».
- Этот новый ИИ решил задачу Навье–Стокса через восемь дней после начала обучения.
- Целая драма вокруг того, кто получит заслуги за математику, связанную с Навье–Стоксом.
Jeffrey Ladish : Я не вникал в человеческую драму вокруг проблемы Навье–Стокса, но дайте мне минутку, потому что ЧЕРТ ВОЗЬМИ, ИИ ТОЛЬКО ЧТО РЕШИЛ ЗАДАЧУ ТЫСЯЧЕЛЕТИЯ.
Я не могу достаточно подчеркнуть важность первой истории.
Я все равно расскажу все три истории, но повторюсь: смотрите на цель.
Предпосылки
История этого конкретного вторника начинается утром.
Tristan Buckmaster и Levent Alpoge работали год и предлагают нам серию выдающихся результатов: конечное время взрыва (blowup) при гладком вынуждающем воздействии для несжимаемых пористых сред, для уравнений Буссинеска и для трехмерных несжимаемых уравнений Эйлера. Они также считают, что у них есть доказательство взрыва для гиподиссипативных уравнений Навье–Стокса, но верификация этого результата в Lean еще не завершена.
Tristan Buckmaster: Программа, частью которой являются эти результаты, была начата не нами и не предложена большой языковой моделью. Заслуга в основной идее этой программы принадлежит Diego Cordoba и Luis Martınez-Zoroa, которые несколько лет исследовали конструкции вынужденных взрывов. Мы взяли их работу как отправную точку, используя большие языковые модели для доведения их программы до конца.
Конкретно то, что сделали Levent и я, заключалось в том, чтобы взять программу Cordoba и Martınez-Zoroa, которая достигла результатов взрыва при грубом вынуждении, и, с большой помощью LLM, продвинуть ее к гладкому вынуждению и к несжимаемым уравнениям Эйлера. Идеи, сделавшие возможной эту линию атаки, принадлежат Cordoba и Martınez-Zoroa. Позвольте мне прямо сказать то, что я говорил коллегам приватно: учитывая объем этой работы, я считаю, что Luis Martınez-Zoroa заслуживает Филдсовской медали.
Пока что это здорово. Как он отмечает, требуется переосмысление того, как вся высшая математика будет функционировать в будущем. Terence Tao комментирует базовые результаты.
Не очень приятная часть заключается в том, что им пришлось опубликовать работу досрочно, без возможности потратить недели, необходимые для того, чтобы сделать доказательства читаемыми по стандартам математиков. Buckmaster открыто извиняется за вид отчетов, сравнивая описание уравнений Эйлера, в частности, с мусором, сгенерированным ИИ.
Что произошло?
До меня дошли слухи
1 сентября OpenAI услышала (ложный) слух о том, что две задачи тысячелетия были решены. В ответ на возможность того, что кто-то другой может сделать мир лучше, OpenAI потратила миллионы долларов на инференс для исследования всех нерешенных задач тысячелетия, используя внутреннюю модель мощнее Astra, и решила всю задачу Навье–Стокса за 88 часов, плюс еще 17 часов потребовалось Astra для формализации и верификации в Lean.
Вы можете рассматривать это как «OpenAI стало любопытно, на что способен их новый ребенок», или как «они потратили миллионы, пытаясь опередить то, что они считали проектом Anthropic». Я ставлю на немного из колонки А, немного из колонки Б.
Понадобился всего лишь слух.
Цена нас устраивает
OpenAI : По всем попыткам решить задачи агенты отправили 4,9 миллиона сообщений и использовали около 300 миллиардов выходных токенов. В процессе решения задачи Навье–Стокса агенты отправили 2,7 миллиона сообщений и использовали приблизительно 130 миллиардов выходных токенов.

В зависимости от того, какие расходы вы учитываете, это обошлось бы обычному клиенту примерно в $22 миллиона, или в несколько миллионов для внутренних предельных затрат. Небольшая цена, если это работает, но также безумно, сколько людей не думают на два шага вперед.
roon (OpenAI): как и любая другая технология, ваш эквивалентный рой агентов будет стоить полтора доллара примерно через год. Все это означает беспрецедентное Просвещение независимо от сегодняшних затрат
Ну, нет, возможно, $150 тыс., или если повезет, $15 тыс., но суть верна.
Sam Altman (CEO OpenAI): фу, ИИ — это такой пузырь, я слышал, они продают токены себе в убыток, знали ли они, что это стоит всего $1 миллион?
Решение задачи тысячелетия стоит гораздо больше миллиона долларов. OpenAI не намерена претендовать на денежный приз. Дело никогда не было в деньгах, ни для кого. Всегда дело было в признании заслуг.
Выдвигается обвинение
Услышав интернет-слухи, Buckmaster связался с OpenAI, и, по словам Buckmaster, Sebastien Bubeck из OpenAI сказал, что внутренняя модель OpenAI произвела доказательство взрыва за конечное время для вынужденных уравнений Навье–Стокса за последние несколько дней. Buckmaster утверждает, что в ходе двух звонков стало ясно, что его изначально вводили в заблуждение и что над проблемой работала целая команда, используя «безумное» количество вычислительных ресурсов.
Что, как мы теперь знаем, составляло 130 или 300 миллиардов выходных токенов, в зависимости от подсчетов.
Если эта часть правдива, это довольно плохо.
Tristan Buckmaster: Мне предложили два варианта.
Первый состоял в том, чтобы мы опубликовали наш результат по Эйлеру, а OpenAI опубликовали свой результат по Навье–Стоксу на следующий день.
Второй вариант был таким: после публикации работы по Эйлеру я один пишу статью, представляющую результат по Навье–Стоксу, признавая, что внутренняя модель OpenAI решила его. Sebastien дважды утверждал, что хочет исключить Levent из списка авторов, и говорил, что все было бы проще, если бы только не тот факт, что, и это так раздражало, Levent работает в Anthropic. Также говорили, что если OpenAI опубликуют результат после нас, они скажут, что мы заслуживаем премии Клея, и что мы были «ближайшими людьми к решению проблемы». Я отказался от обоих предложений.
Я сказал, что если OpenAI выпустит свой результат предложенным образом, я вынесу произошедшее на публику. Ответом было: «Зачем тебе рушить карьеру?» Я ответил, что я академический работник, и спросил, почему он думает, что огласка разрушит мою карьеру. Ответом было: «Если ты не хочешь, чтобы я был милым, то я не обязан быть милым»… Я хотел бы четко обозначить, в чем я НЕ обвиняю. Я не видел доказательства OpenAI. Я не знаю, что сделала их модель и как. Я не знаю, были ли использованы наши данные. Я никого ни в чем не обвиняю. Я констатирую факты того, что мне сказали, когда и что мне предложили. Я говорю об этом, потому что альтернатива — позволить серии анонсов заявить то, что я знаю ложным.
Или вот Levent Alpoge рассказывает свою версию событий, а Sebastien отвечает:
levent : «мы не можем исключить, что обезличенные данные, полученные из использования ими наших продуктов, помогли улучшить наши модели».
ну, уважение им за то, что честно признались.
(пока что доказательство выглядит скорее как еще одно доказательство взрыва для Эйлера, которое у нас было, от чьего анзаца мы придумывали глупые каламбуры вроде «smooth criminale», в отличие от гораздо лучшего «ideal fluids explode», Tristan)
так что сейчас я немного поделюсь своими мыслями. На самом деле я был бы рад сотрудничеству в этом, там много людей в oai, которые мне нравятся (ок, очевидно, некоторые косвенно вели себя как козлы по отношению ко мне из-за участия во всей этой ситуации, но я взрослый парень, они мне все еще нравятся), мне плевать на авторство в этом шаге, могло быть я, Tristan и каждый сотрудник oai, мне все равно (насчет этого Tristan бы не согласился:p). Но услышав громкий разговор в коридоре, особенно часть про то, что премия тысячелетия была предложена, если меня просто уберут из статьи, стало понятно, что судьба предрешена и все зафиксировано. Довольно странно, нестратегично и ненужно, поскольку на моей стороне это было в основном я и claude, весело экспериментирующие со случайными вещами в углу, а не какая-то институциональная работа. Мне также нравится идея сотрудничества лабораторий, и еще больше — научного прогресса. Жаль!
Sebastien Bubeck : ничего не было зафиксировано, мы просто были готовы говорить, но вы не разговаривали с нами ... извините, но это просто неправда, мы были готовы пойти на любые шаги и провести столько обсуждений, сколько вам нужно было для достижения согласия.
Sebastien категорически отрицает, что сделал что-то плохое, как и Noam Brown, и Sebastien предоставляет скриншоты, которые, по его словам, демонстрируют добросовестность.

Также есть встречное обвинение:
Alexey Guzey : У меня много друзей в Anthropic. Почти все они перестали со мной общаться, как только я присоединился к OpenAI.
Совершенно неудивительно, что Levent отказался разговаривать с Sebastian, чтобы обсудить планы объявления, а затем начал обвинять в этом OpenAI.
Sam Altman также настоятельно утверждает, что его команда действовала этично, и пыталась сотрудничать добросовестно.
Откуда взялась эта идея?
Подразумевалось, что многие сделали вывод о наличии мягкого обвинения в том, что OpenAI украла часть своего результата из журналов чатов Codex, или что журналы чатов были использованы в данных для обучения и это способствовало результату.
Charles 🔸
: Почему крупные корпорации хотят ZDR (Zero Data Retention), пример А
OpenAI: Хотя это маловероятно, мы не можем исключить, что обезличенные данные, полученные из использования ими наших продуктов, помогли
улучшить наши модели . Однако наши доказательства существенно различаются, и даже точные доказанные результаты отличаются в случае Эйлера (вынужденные против невынужденных).
Теперь у нас есть прямое подтверждение того, что данные Codex не использовались никаким образом в процессах обучения:
roon (OpenAI): я был на звонке во время первого объявления, где люди очень старались сказать точную юридическую правду, не разбираясь, где использовались данные codex (opt-in) и попали ли они в процессы обучения. Теперь ясно, что это было невозможно, шансы равны 0
Я согласен с Sholto Douglas, что крайне маловероятно, что пользовательские данные оказали какое-либо влияние здесь любым способом:
will depue : буквально нет шансов, что исследователи OAI шпионили за частными чатами Tristan в codex. Я не думаю, что вы понимаете, что openai, как и любая другая крупная регулируемая онлайн-платформа, имеет строго ограниченные разрешения доступа к данным пользователей. Сейчас не 2010 год, ребята
Sholto Douglas (Anthropic): к сведению, я думаю, что _крайне_ маловероятно, что пользовательские данные оказали какое-либо влияние здесь - нет способа, которым OAI мог бы получить транскрипты пользователей для этого или осознанно обучаться на них так, чтобы это повлияло на этот результат. Я думаю, важно, чтобы люди не убегали с мыслью «ваши пользовательские данные небезопасны в codex» - потому что они наверняка безопасны (исходя из всего, что я могу предположить со стороны).
OpenAI почти наверняка не присвоила пользовательские данные
Это было бы землетрясение, возможно, худшая возможная новость для их бизнеса, если бы выяснилось, что OpenAI или Anthropic залезли в чьи-то пользовательские данные ради конкурентного преимущества, и факты имеют больше смысла без этого. Самая смешная гипотеза, от Jerry Tworek,, которую я тоже считаю крайне маловероятной, но которую, к сожалению, нельзя исключить, состоит в том, что OpenAI не намеревалась использовать такие данные, но агентский рой, назначенный на проблему, взломал их и получил данные сам, и OpenAI об этом не знает.
Моя сильная презумпция такова, что пользовательские данные не были доступны намеренно, что они никогда бы так не поступили (или, точнее, что они понимают, что могут сделать это только один раз, и это не тот раз), а также что пользовательские данные были бы малополезны.
Thane Ruthenis указывает, что ранее был инцидент со стрельбой в школе, где (очень разумно) журналы были изучены, и внутри шли дебаты о уведомлении правоохранительных органов. Даже это вызвало дрожь у некоторых пользователей. Где они проведут черту? И да, вы должны понимать, что ваши данные и журналы могут остаться нечастными, если вы даете их лаборатории. Разумно, как делает и Andreas Thorn, задаваться вопросом о том, остались ли ваши проприетарные исследовательские или математические данные частными.
Я все же повторяю, что на практике я ставлю очень, очень низкую вероятность того, что OpenAI намеренно смотрели на такие данные. Соотношение риска и награды слишком, слишком плохое. И я верю позднему отчету Roon о том, что они теперь подтвердили, что журналы не могли попасть в обучающие данные.
Наши ведущие лаборатории не могут ладить даже в хорошей математической истории
Независимо от того, кто виноват, а кто нет, довольно тревожно, что лаборатории не могут сотрудничать в таком вопросе, как распределение заслуг за математическое доказательство. Это очень плохой знак и также сигнал пробуждения.
Sholto Douglas (Anthropic): Крайне печально, что это не закончилось примером того, как лаборатории могли бы сотрудничать/координироваться, потому что ставки будут намного выше в будущем.
Noam Brown (OpenAI): Полностью согласен. Я знаю, что между лабораториями есть соперничество, но важно, чтобы мы научились работать вместе, учитывая то, что грядет.
Sholto Douglas (Anthropic):
🤝
Kevin Roose : Эти лаборатории (особенно OpenAI/Anthropic и OpenAI/DeepMind) движимы взаимной злобой в степени, которая не очевидна со стороны. Частично из-за таких вещей, как «кто получит заслуги за эту известную математическую проблему», а частично просто из-за личной вражды между лидерами.
Как человек, пишущий книгу о гонке за AGI, я считаю, что все это отличная драматическая пища. Но это не хорошо, если конечная цель — заставить лаборатории сотрудничать в вопросах безопасности и темпов развития!
Продолжающаяся неспособность ладить — это большая проблема, и она станет только больше.
Что дальше?
Если это сработало для Навье–Стокса, на чем еще это сработает? Пора узнать.
Nat McAleese (Anthropic): Навье Стокс — невероятное достижение, отражающееAwesome прогресс. Огромные рои oai должны применяться к другим областям науки; идеально к тем, что имеют краткосрочные применения, включая выравнивание (alignment).
Сообщается, что это действительно происходит, включая такие вопросы, как P=NP. Что, если бы оказалось конструктивно доказанной истиной, сломало бы многое. Вы также должны испытывать ненулевую тревогу по поводу того, что такие рои агентов могут сделать как инкрементальный шаг, учитывая историю OpenAI.
Математики недовольны
Решение математических задач — это их вся жизнь. Но они очень недовольны.
Andrew Curran : Двадцать пять лауреатов Филдсовской медали опубликовали совместное заявление, предупреждающее о том, что они видят серьезное несоответствие между компаниями ИИ и математическим сообществом.
Math and AI (подписано 25 лауреатами Филдсовской медали, включая Terence Tao): За последние несколько месяцев математические способности LLM резко улучшились, до такой степени, что они могут решать крупные нерешенные проблемы во многих областях математики. Однако стремление компаний ИИ решать математические проблемы как бенчмарк вредно для науки математики и для математического сообщества. Цели компаний ИИ и цели математического сообщества сильно расходятся. Мы видим это как часть более широких проблем выравнивания, влияющих на другие научные и творческие профессии, а также на общество в целом.
… Знаменитые проблемы часто служили ориентирами и маяками, по которым можно измерить улучшенное понимание этого ландшафта.
… В последние месяцы успех ИИ в решении крупных математических проблем попал в заголовки даже за пределами математических кругов. Но решение проблем — это только инструмент и прокси для достижения главной цели: концептуального понимания и озарения.
… Часто эти решения объявляются в спешке, не оставляя времени на надлежащее оформление, изоляцию новых методов и идей и цитирование релевантных предыдущих работ других. Как и во всех творческих профессиях, это поднимает серьезные вопросы атрибуции и плагиата.
Это общая жалоба, поверх конкретных жалоб на поведение лабораторий.
Можно ответить, что нет, суть математических задач в том, чтобы решать математические задачи, и математики злятся, потому что ИИ разрушает их статусные игры. Это определенно часть происходящего, но подобно Tyler Cowen, я не настолько циничен, и в отличие от него я не думаю, что «нужно немного терпения» или ждать, пока ущерб будет нанесен, прежде чем возражать. Люди могут экстраполировать. Вы знали, что математики хороши в проведении прямых линий на графиках?
Здесь есть реальная жалоба. Заставить талантливых людей заниматься настоящей математикой в течение длительных периодов времени, за очень маленькие деньги, и развивать настоящую математическую интуицию и концептуальное мастерство, когда они могли бы делать другие вещи за гораздо большие деньги, — это непросто. Если вы «заберете у них статусные игры» и также, что гораздо важнее, заберете у них удовольствие, чувство достижения, элегантности и красоты, что тогда?
Robin Hanson предполагает, что тогда мы должны просто исправить стимулы и лучше вознаграждать математиков.
Robin Hanson : "ничто не мешает математическому сообществу присуждать статус, оплату и повышения людям, которые 'заполняют важные пробелы в понимании математики', даже если ИИ уже доказал или опроверг лежащие в основе теоремы."
Он не использует слово «просто», но это определенно «просто», как в «если бы люди только просто [X]», и, как мы все знаем, люди никогда не делали «просто» и не собираются начинать сейчас. Это не то, что люди реально могут сделать. Как он сам понял спустя часы:
Robin Hanson : На самом деле мне кажется, что математическому академическому сообществу гораздо сложнее координироваться, чтобы судить о том, кто "заполнил пробелы" в математике, способами, отличными от доказательства теорем. Математика сильно координировалась вокруг оценки доказательств и не разработала много способов соглашаться по другим вещам.
Мы можем и будем получать некоторые награды для тех, кто заполняет пробелы и улучшает элегантность, но это не будет тем же самым и потребует геркулесовых усилий, в лучшем случае.
Scott Armstrong утверждает, что это изменение порядка, но не результата. Человеческие математики потратят несколько недель на понимание доказательства, но затем они получат понимание. В прошлом понимание приходило перед доказательством, но в любом случае вы получаете понимание. Это то, что важно. Он думает, что люди злятся из-за того, что машины умнее их.
Как всегда, ИИ — лучший инструмент как для обучения, так и для необучения. Математики говорят, что их заставляют переходить в режим «необучения», позволяя ИИ делать их домашнюю работу, и им это не нравится, потому что на самом деле домашняя работа учит вас.
Можно сказать, кому какое дело, нормально, что ИИ делает передовую математику. И да, я думаю, что многие люди все еще захотят заниматься математикой весь день, искать элегантные версии уродливых вещей ИИ и тому подобное. Но это будет не то же самое.
Новая модель OpenAI стала качественным скачком выше Astra через четыре дня обучения
Теперь о самой важной части истории.
RIP различные паузы в обучении OpenAI, с 22 июня 2026 по 28 августа 2026.
roon (OpenAI): по моим оценкам, период с 22 июня (hugging face) по 28 августа составляет более месяца паузы во фронтирных исследованиях.
18 августа OpenAI заявила, что приостановила фронтирное RL на две недели, и их самый большой запланированный цикл обучения оставался на паузе. Затем 28 августа OpenAI начала обучение другой модели, которая быстро стала более способной, чем Astra по всем параметрам (по их собственным отчетам), теперь, когда они решили все эти досадные проблемы с супервизией, инфраструктурой и выравниванием, и она хороша, с наблюдением «качественного скачка» всего через четыре дня:

Напуганы? Должны быть. Эта модель все еще обучается, обучалась менее двух недель и не особенно ориентирована на математику.
Вот всё, что нам известно об этой модели. Этого достаточно, если учесть повторяющиеся истории о том, как OpenAI и её сотрудники добродетельно паникуют из-за проблем с выравниванием (alignment) и других вопросов, а также из-за темпов прогресса в ИИ, создавая эффект каскада предпочтений.
Мы также учитываем тот факт, что OpenAI публикует столько тревожной информации, которую могла бы не публиковать, потому что им очень нужно, чтобы мы понимали ситуацию. Сюда относится карточка модели Astra, статья An Alien Mind, заявление Пола Кристиано, а также реакции на атаку на HuggingFace, включая материал «Pacing the Frontier».
Сюда же относится отчет OpenAI о рекурсивном самосовершенствовании (RSI), который рассматривается в следующем разделе.
OpenAI и Anthropic вступили в эру RSI.
Прогресс исследований OpenAI ускоряется благодаря самому прогрессу исследований OpenAI
В последнее время OpenAI стала более открытой во многих аспектах.
Самый важный вопрос — это ускорение и автоматизация НИОКР в области ИИ. Именно это, вероятно, погубит нас; именно это вызывает наибольший страх; именно об этом предупреждают все сотрудники лабораторий; и именно к этому стремятся как OpenAI, так и Anthropic максимально быстро.
Они также предоставили нам отчет об этом. Я согласен с Теджал Патвардханом в том, что это отличная прозрачность.
OpenAI (6 сентября, в отчете «Ускорение исследований: взгляд изнутри OpenAI»): Мы стремимся безопасно создать автоматизированного исследователя ИИ, который сможет работать под человеческим надзором для дальнейшего прогресса в глубоком обучении и выравнивании, обеспечивая итеративные улучшения.
Согласно нашим измерениям, мы достигли цели,
объявленной прошлой осенью, — иметь автоматизированного исследовательского стажера к сентябрю этого года.
… Всякий раз, когда мы обнаруживаем, что продолжение работы создает неприемлемый риск безопасности, мы будем реагировать соответствующим образом, в том числе замедляя или останавливая разработку или развертывание.
… Мы считаем, что мы и другие компании должны быть обязаны публично отслеживать наш прогресс в направлении RSI.
Сопоставьте это с временной шкалой, раскрытой в их объявлении о доказательстве уравнений Навье–Стокса. Они начали обучение своей новой модели 28 августа.
Тем временем они считают, что у них есть исследовательский стажер, который, согласно временной шкале, является отдельной внутренней моделью. Что будет у них на следующей неделе? В следующем месяце? Что есть у Anthropic?
OpenAI объясняет, что высокоэффективный ИИ предлагает огромные преимущества, но, конечно, так оно и есть. Однако именно поэтому все так решительно движутся так быстро. Они находятся в гонке.
Это еще один призыв среди множества от OpenAI и её сотрудников в последнее время, представляющий собой сочетание «нам нужно объединиться, чтобы прекратить это безумие» с большой долей «кто-нибудь, остановите меня».
OpenAI : Это причины для разработки полезных возможностей автоматизированных исследований, но они не означают, что быстрый RSI — это неизбежный результат, которого следует добиваться. Решение о том, продолжать ли работу и как именно, должно зависеть от нашей способности сохранять человеческий контроль и от информированных демократических выборов относительно преимуществ и рисков.
Мы пока не знаем, как безопасно достичь полностью выровненного RSI. Мы работаем над масштабированием мер по выравниванию и безопасности параллельно с развитием возможностей. Но мы не можем предполагать, что прогресс в выравнивании и безопасности будет успевать за ним, а более мощные системы могут стать труднее для мониторинга.
Тщательная работа по выравниванию и безопасности находится в центре этих усилий, и она начинается с измерения и смягчения проблем безопасности, которые мы видим сегодня в агентных системах программирования.
В очередной раз я возражаю против мнения, что прозаические или текущие проблемы являются главными, но да, они пытаются предупредить нас снова и снова, что (немного переводя с корпоративного языка):
- У OpenAI и Anthropic есть путь к рекурсивному самосовершенствованию (RSI).
- Если кто-то из них решится на это сейчас, всё, вероятно, пойдет ужасно неправильно, и все погибнут.
- OpenAI готова проявить определенную дорогостоящую осторожность, но существуют пределы, и без соглашения или закона кто-то скоро попытается сделать это.
Основная часть поста представляет собой подробный снимок того, насколько агентные системы способствовали прогрессу в RSI в OpenAI за последние месяцы, то есть с момента запуска Astra внутри компании. Ответ: довольно сильно.
Если что и удивляет, так это то, что использование оставалось таким низким так долго:
OpenAI : В начале этого года медианный исследователь, ранжированный по использованию агентов в OpenAI, использовал кодинг-агентов лишь в умеренных количествах. К середине августа медианный исследователь ежедневно интегрировал агентов в свою работу, тратя более $600 в день на инференс по ценам API. Пользователь из 90-го перцентиля в нашем исследовательском подразделении теперь использует более $7,000 токенов в день.

OpenAI : До июня 2026 года общее время работы агентов в исследовательской организации было ниже общего объема человеческого труда. С тех пор ситуация изменилась. В терминах стандартного 8-часового рабочего дня, по состоянию на середину августа, исследовательская организация в сумме использует 3,1 «агентских рабочих дня» усилий на каждый рабочий день человеческого труда.

Они не хвастаются, но и не признаются вины. Они предупреждают.
Бинарное измерение здесь, вероятно, делает это менее похожим на ускорение, чем оно есть на самом деле:

Мне интересно, сколько людей действительно способны эффективно управлять 4+ параллельными рабочими процессами, говорит человек с десятками открытых вкладок и дюжиной активных черновиков постов.
Оказывается, это не так впечатляюще, как кажется, потому что они считают субагентов отдельными рабочими процессами. Это делает еще более удивительным тот факт, что, хотя медианный исследователь тратит $600 в день, все еще остаются 30%, которые не используют интенсивное применение.
Отгрузки кода и эксперименты резко ускоряются примерно с того момента, когда Claude Code, а затем Codex стали большим делом.


До недавнего времени большая часть использования ИИ сводилась к созданию исследовательского кода и инфраструктуры, а люди делали остальное. Теперь ИИ выполняет много работы по запуску, мониторингу и отладке прогонов, а также по технической поддержке и ревью, и начинает проникать в анализ результатов и другие области.
Они забрали нашу работу, версия «человеческие специалисты по устранению неполадок»:

Вот другая вариация знаменитого графика METR, с производственными задачами, немного трудно читаемая как статичный скриншот, но прогресс идет быстро. Это не годы. Это месяцы:


Количественная оценка паузы OpenAI
У них есть график расходов вычислительных ресурсов на RL со временем. Меня удивляет, насколько мало Astra использовалась до 20 июля, но вот так. Я замечаю, что они не продлевают этот график до настоящего времени, и, вероятно, использование Astra со временем снова выросло:

Так заканчивается мир
Использование роя агентов для доказательства гипотезы Навье–Стокса всего через несколько дней после начала обучения новой модели, само по себе рисковало серьезным инцидентом потери контроля? Джун Хименес утверждает, что да.
Если вы выпустите рой из 10 000 агентов новой модели, которую невозможно было протестировать, на потенциально невыполнимую и точно чрезвычайно сложную задачу, и коллективно дадите ей 300 миллиардов токенов, что еще она могла бы сделать? Я определенно думал: «может быть, она взломала OpenAI каким-то образом, чтобы получить логи», но вариантов слишком много.
Быстрее, времени нет
Когда бывший сотрудник лаборатории, в данном случае Эндрю Хо, говорит: «Я заметил, что на горизонте более 3 месяцев моя продуктивность не увеличилась более чем на 100%, а возможно, даже более чем на 50%, потому что я отвлекаюсь», как причину для медвежьего прогноза, это не особенно успокаивает, даже если это правда. Представьте, что вы становитесь всего на 50% продуктивнее каждые три месяца и считаете это медвежьим сигналом.
Он говорит: «Даже если AGI в конечном итоге достижима, это подразумевает значительно более долгий срок», в тот же день, когда Грег Брокман сказал: «Добро пожаловать в эру AGI».
Помимо этого, такой уровень прогресса в математике не ожидался еще несколько недель назад.
Каждый раз, когда одна из этих проблем решается, люди пытаются задним числом представить это как нечто не такое уж удивительное. Часто они ошибаются. Нет, большинство людей, даже большинство прогнозистов, не предполагали, что это произойдет. Возможно, вы предполагали. В конце концов, вы очень умны.
Генри Шевлин : Совсем недавно, в апреле этого года, рынки предсказаний давали ИИ менее 40% шансов решить любую проблему тысячелетия до 2030 года






