Новітній ШІ розв’язав задачу з премії тисячоліття

@TheZvi
АНГЛІЙСЬКА13 вер. 2026 р.
135K
199
17
16
237

Коротко

Нова модель OpenAI розв’язала задачу Нав'є-Стокса з премії тисячоліття, що спровокувало дебати про авторство, захист даних та тривожні темпи прискорення наукових досліджень за допомогою ШІ.

Перша премія за задачу тисячоліття, Нав'є–Стокса, здобута ШІ.

Склалася вкрай неприємна ситуація навколо того, що мало б бути поєднанням позитивної історії про новий прогрес у математичних дослідженнях за допомогою ШІ та чергової нагоди панікувати через стрімкий розвиток штучного інтелекту.

Або, як ми тут це називаємо, просто вівторок.

Головна новина — нова модель, яка краща за Astra

Тримайте фокус на головному. Тут є три окремі історії.

Перша історія значно важливіша за другу, а друга, у свою чергу, значно важливіша за третю.

  1. Наступній моделі OpenAI знадобився тиждень, щоб випередити Astra на ціле покоління, і вони повідомляють нам про це, тому що всі в жаху від того, що відбувається. Або офіційною мовою: «Ми вважаємо важливим інформувати світ про темпи прогресу ШІ та очікування від майбутніх моделей», а також про те, що нам «можуть знадобитися більш обдумані рішення щодо темпів розвитку».
  2. Цей новий ШІ розв’язав рівняння Нав'є–Стокса через вісім днів після початку навчання.
  3. Цілий шмат драми щодо того, хто отримає визнання за математику, пов’язану з Нав'є–Стоксом.

Джеффрі Ладіш : Я ще не занурювався в людську драму навколо задачі Нав'є–Стокса, але дайте мені хвилинку, бо БОЖЕ ВІЛЬНИЙ, ШІ ЩОЙНО РОЗВ’ЯЗАВ ЗАДАЧУ ТИСИЧОЛІТТЯ.

Неможливо переоцінити важливість першої історії.

Я все одно розповім усі три історії, але повторюся: тримайте фокус на головному.

Підготовка ґрунту

Ця конкретна вівторкова історія починається вранці.

Трістан Бакмастер і Левент Альпоге працювали протягом року й представляють нам серію видатних результатів: скінченночасове вибуховий ріст (blowup) із гладким зовнішнім впливом для несжимаемого середовища пористої структури, для системи Буcсінеска та для тривимірних несжимаемых рівнянь Ейлера. Вони також вважають, що мають доведення вибухового росту для гіподисипативних рівнянь Нав'є–Стокса, але верифікація цього результату засобами Lean ще не завершена.

Трістан Бакмастер: Програма, в яку вписуються ці результати, була започаткована не нами і не запропонована великою мовною моделлю. Авторство базової ідеї цієї програми належить Дієго Кордобі та Луїсу Мартінесу-Сороа, які протягом кількох років досліджували побудову вибухових ростів під дією зовнішніх сил. Ми взяли їхню роботу за основу, використовуючи великі мовні моделі, щоб довести цю програму до логічного завершення.

Конкретно те, що зробили Левент і я, полягало в тому, щоб взяти програму Кордоба та Мартінеса-Сороа, яка досягла результатів вибухового росту за рахунок грубих зовнішніх впливів, і, за великої допомоги LLM, поширити її на гладкі зовнішні впливи та на несжимаемые рівняння Ейлера. Ідеї, що зробили можливим цей підхід, належать Кордоба та Мартінесу-Сороа. Дозвольте мені чітко сказати те, що я говорив колегам приватно: враховуючи весь цей масив роботи, я вважаю, що Луїс Мартінес-Сороа заслуговує на Філдсівську медаль.

Поки що це чудово. Як він зазначає, це вимагає переосмислення того, як усе передове математика функціонуватиме в майбутньому. Теренс Тао надає коментар щодо базових результатів.

Менш приємним є той факт, що вони були змушені опублікувати результати достроково, не маючи можливості витратити необхідні тижні на те, щоб зробити доведення такими, які прийнято вважати читабельними серед математиків. Бакмастер прямо вибачається за вигляд звітів, порівнюючи опис результатів для Ейлера, зокрема, з «ШІ-сміттям» (AI slop).

Що сталося?

Я почув чутку

1 вересня OpenAI почула (хибну) чутку про те, що дві задачі тисячоліття були розв’язані. У відповідь на можливість того, що хтось інший може зробити світ кращим, OpenAI витратила мільйони доларів на інференс для дослідження всіх нерозв’язаних задач тисячоліття, використовуючи внутрішню модель потужнішу за Astra, і розв’язала всю проблему Нав'є–Стокса за 88 годин, плюс ще 17 годин для Astra на формалізацію та верифікацію в Lean.

Ви можете сприймати це як «OpenAI стала цікаво, на що здатне їхнє нове дітище», або як «вони витратили мільйони, намагаючись випередити те, що вони вважали проєктом Anthropic». Я ставлю на те, що це трохи з колонки А, трохи з колонки Б.

Все це зайняло лише чуток.

Наша ціна низька

OpenAI : За всіма спробами агенти надіслали 4,9 мільйона повідомлень і використали близько 300 мільярдів токенів виводу. У процесі розв’язання проблеми Нав'є–Стокса агенти надіслали 2,7 мільйона повідомлень і використали приблизно 130 мільярдів токенів виводу.

Zvi Mowshowitz - inline image

Залежно від того, які витрати ви враховуєте, це коштувало б звичайному клієнту порядку 22 мільйонів доларів, або кілька мільйонів за внутрішні граничні витрати. Невелика ціна, якщо це працює, але також божеволієш від того, скільки людей не думають на два кроки вперед.

roon (OpenAI): як і будь-яка технологія, ваш еквівалентний рій агентів коштуватиме півтора долара приблизно через рік. Все це означатиме безпрецедентне Просвітництво незалежно від сьогоднішніх витрат

Маю на увазі, ні, можливо, $150 тис., або якщо вам пощастить, $15 тис., але суть залишається тією ж.

Сем Альтман (CEO OpenAI): ух, ШІ — це така бульбашка, я чув, що вони продають токени собі в збиток, чи знали вони, що це коштувало лише $1 мільйон?

Результат для задачі тисячоліття вартий значно більше, ніж мільйон доларів. OpenAI не має наміру претендувати на грошовий приз. Це ніколи не було справою грошей, ні для кого. Завжди йшлося про визнання.

Звучить звинувачення

Почувши інтернет-чутки, Бакмастер звернувся до OpenAI, і, за словами Бакмастера, Себастьян Бюбек з OpenAI сказав, що внутрішня модель OpenAI створила доведення скінченночасового вибухового росту для рівнянь Нав'є–Стокса із зовнішнім впливом за останні кілька днів. Бакмастер стверджує, що протягом двох розмов стало зрозуміло, що його спочатку ввели в оману, і що ціла команда працювала над проблемою, використовуючи «божевільну» кількість обчислювальних ресурсів.

Що, як ми тепер знаємо, становило 130 або 300 мільярдів токенів виводу, залежно від того, що враховувати.

Якщо ця частина правдива, це досить погано.

Трістан Бакмастер: Мені запропонували два варіанти.

Перший полягав у тому, що ми публікуємо наш результат для Ейлера, а OpenAI наступного дня публікує свій результат для Нав'є–Стокса.

Другий варіант був таким: після публікації Ейлера я сам пишу статтю, представляючи результат Нав'є–Стокса, визнаючи, що внутрішня модель OpenAI розв’язала його. Себастьян двічі наполягав на тому, що хоче виключити Левента зі списку авторів, і казав, що все було б просто, якби не те, що, і це так дратувало, Левент працює в Anthropic. Також сказали, що якщо OpenAI опублікує після нас, вони скажуть, що ми заслуговуємо на Премію Клея, і що ми «найближчі люди до вирішення проблеми». Я відхилив обидві пропозиції.

Я сказав, що якщо OpenAI опублікує свій результат запропонованим способом, я оприлюдню те, що сталося. Відповіддю було: «Навіщо ти псуєш свою кар’єру?» Я відповів, що я академічний науковець, і запитав, чому він думає, що оприлюднення інформації зіпсує мою кар’єру. Відповіддю було: «Якщо ти не хочеш, щоб я був добрим, то мені не обов’язково бути добрим»… Я хотів би чітко окреслити, що я НЕ стверджую. Я не бачив доведення OpenAI. Я не знаю, що саме зробила їхня модель і як. Я не знаю, чи використовувалися наші дані. Я нікого ні в чому не звинувачую. Я констатую те, що мені сказали, коли це сталося, і що мені пропонували. Я роблю це, тому що альтернативою є дозволити послідовності анонсів говорити щось, що я знаю неправдою.

Або ось Левент Альпоге розповідає свою версію подій, а Себастьян відповідає:

levent : «Ми не можемо виключити, що деперсоніфіковані дані, отримані внаслідок використання ними наших продуктів, допомогли покращити наші моделі».

Маю визнати, їм варто віддати належне за те, що вони чесно все розкрили.

(поки що доведення більше схоже на інше наше доведення вибухового росту для Ейлера, від якого ми будували справді дурні каламбури на кшталт «smooth criminale», на відміну від набагато кращого «ideal fluids explode», Трістане)

тому я тепер коротко опишу свої думки. Насправді я був би радий співпрацювати в цьому питанні, там є багато людей в OAI, які мені подобаються (добре, очевидно, деякі поводилися як ідіоти щодо мене через участь у всій цій ситуації, але я дорослий хлопець, вони мені все одно подобаються), мені байдуже на авторство на цьому етапі, це міг бути я, Трістан і кожен повний працівник oai, мені все одно (на цьому Трістан не погодиться :p). Але почувши гучну розмову в коридорі, особливо частину, де пропонували премію за задачу тисячоліття, якщо я просто вийду зі складу авторів статті, стало зрозуміло, що гра вже зроблена і все зафіксовано. Досить дивно, нестратегічно і непотрібно, оскільки з мого боку це переважно я та Claude весело проводимо час, випадково генеруючи різні речі в кутку, а не якийсь інституційний процес. Мені також подобається ідея співпраці лабораторій, і ще більше — заради наукового прогресу. Прикро!

Себастьян Бюбек : нічого не було зафіксовано, ми просто були готові до розмови, але ви не говорили з нами ... вибачте, але це просто неправда, ми були готові піти на все можливе і провести стільки обговорень, скільки ви бажали, щоб дійти консенсусу.

Себастьян категорично заперечує, що він зробив щось погане, як і Ноам Браун, і Себастьян надає скріншоти, які, за його словами, демонструють добросовісність.

Zvi Mowshowitz - inline image

Також є зустрічне звинувачення:

Олексій Гузей : У мене багато друзів в Anthropic. Майже всі вони перестали спілкуватися зі мною, щойно я перейшов до OpenAI.

Абсолютно не дивно, що Левент відмовився говорити з Себастьяном, щоб обговорити плани анонсу, а потім почав звинувачувати OpenAI за це.

Сем Альтман також наполегливо стверджує, що його команда діяла етично, і намагалася співпрацювати добросовісно.

Звідки взялася ця ідея?

Наслідком усього цього, який багатьох зробили висновки, було м’яке звинувачення у тому, що OpenAI вкрала частину їхнього результату з журналів чату Codex, або що журнали чату були використані в тренувальних даних, і це внесло вклад у результат.

Charles 🔸

: Чому великі корпорації хочуть ZDR (Zero Data Retention), доказ А

OpenAI: Хоча це малоймовірно, ми не можемо виключити, що деперсоніфіковані дані, отримані внаслідок використання ними наших продуктів, допомогли

покращити наші моделі⁠ . Однак наші доведення суттєво відрізняються, і навіть точні доведені результати різняться у випадку Ейлера (із зовнішнім впливом проти без зовнішнього впливу).

Тепер ми маємо явне підтвердження того, що дані Codex не використовувалися жодним чином у тренувальних циклах:

roon (OpenAI): я був на дзвінку під час першого анонсу, де люди дуже старалися сказати точну юридичну правду, не перевіривши, де використовувалися дані codex (opt-in) і чи потрапили вони в тренувальні цикли. Тепер зрозуміло, що це було б неможливо, ймовірність дорівнює 0

Я погоджуюся з Шолто Дугласом, що вкрай малоймовірно, що дані користувачів мали будь-який вплив тут через будь-який метод:

will depue : буквально немає жодної ймовірності, що дослідники OAI шпигували за приватними чатами Трістана в codex. Я не думаю, що ви усвідомлюєте, що openai, як і будь-яка велика регульована онлайн-платформа, має суворо обмежений доступ до даних користувачів. Не 2010 рік, хлопці

Шолто Дуглас (Anthropic): для довідки, я вважаю, що вкрай _малоймовірно_, що дані користувачів мали будь-який вплив тут - немає способу, щоб OAI витягнули транскрипти користувачів для цього, або свідомо навчалися на них у спосіб, який вплинув би на це. Я думаю, що дуже важливо, щоб люди не тікали з думкою «ваші дані користувачів небезпечні в codex» - тому що вони точно в безпеці (спираючись на все, що я можу припустити ззовні).

OpenAI майже напевно не привласнила дані користувачів незаконно

Це було б землетрусом, можливо, найгіршою можливою історією для їхнього бізнесу, якби ми дізналися, що OpenAI або Anthropic вторглися в дані користувачів, щоб отримати конкурентну перевагу, і факти мають більше сенсу без цього. Найсмішливіша гіпотеза, від Джеррі Творека, яку я також вважаю малоймовірною, але яку, на жаль, не можемо виключити, полягає в тому, що OpenAI не мала наміру використовувати такі дані, але агентський рій, призначений для вирішення проблеми, зламав захист і отримав їх попри все, і OpenAI про це не знає.

Моє сильне припущення полягає в тому, що дані користувачів не були отримані навмисно, що вони ніколи б цього не зробили (або, скоріше, що вони принаймні усвідомлюють, що можуть зробити це лише один раз, і це не той раз), а також те, що дані користувачів були б малою допомогою.

Тейн Рутеніс зазначає, що раніше був інцидент зі стріляниною в школі, де (дуже розумно) журнали були перевірені, і всередині точилася дискусія щодо повідомлення правоохоронних органів. Навіть це викликало мурашки у деяких користувачів. Де вони проведуть межу? І так, ви повинні розуміти, що ваші дані та журнали можуть не залишитися приватними, якщо ви передасте їх лабораторії. Розумно, як також робить Андреас Торн, замислюватися про те, чи залишилися ваші пропрієтарні дослідницькі або математичні дані приватними.

Я все одно повторюю, що на практиці я поставив би дуже, дуже низьку ймовірність того, що OpenAI навмисно переглядала такі дані. Співвідношення ризику та винагороди просто дуже, дуже погане. І я вірю пізнішому звіту Roon про те, що вони тепер підтвердили, що журнали не могли потрапити в тренувальні дані.

Наші провідні лабораторії не можуть домовитися навіть у історії про математику, яка має надихати

Незалежно від того, хто винен, а хто ні, досить тривожно, що лабораторії не можуть співпрацювати в чомусь такому простому, як розподіл заслуг за математичне доведення. Це дуже поганий знак і також заклик до пробудження.

Шолто Дуглас (Anthropic): Дуже сумно, що це не завершилося як приклад того, як лабораторії можуть співпрацювати/координуватися, тому що ставки будуть набагато вищими в майбутньому.

Ноам Браун (OpenAI): Повністю згоден. Я знаю, що між лабораторіями є суперництво, але важливо, щоб ми навчилися працювати разом, враховуючи те, що наближається.

Шолто Дуглас (Anthropic):

🤝

Кевін Руз : Ці лабораторії (особливо OpenAI/Anthropic та OpenAI/DeepMind) живляться взаємною злобою до ступеня, який не очевидний ззовні. Частково через речі на кшталт «хто отримає визнання за цю відому математичну проблему», а частково просто через особисту ворожнечу між лідерами.

Для людини, яка пише книгу про гонку за AGI, усе це чудовий матеріал для драми. Але це не добре, якщо кінцева мета — змусити лабораторії співпрацювати в питаннях безпеки та темпів розвитку!

Продовження нездатності домовитися — це велика проблема, і вона стане лише більшою.

Що далі?

Якщо це спрацювало для Нав'є–Стокса, на чому ще це спрацює? Час дізнатися.

Nat McAleese (Anthropic): Нав'є Стокс — це неймовірне досягнення, яке відображає приголомшливий прогрес. Великі рої oai слід застосовувати до інших галузей науки; ідеально тих, що мають короткострокові застосування, включаючи вирівнювання (alignment).

Про це дійсно повідомляється, включаючи такі цікаві питання, як P=NP. Що, якщо б це виявилося конструктивно доведеним як істинним, зламало б багато речей. Ви також повинні мати ненульову турботу про те, що такі рої агентів можуть зробити як поступовий крок, враховуючи історію OpenAI.

Математики незадоволені

Розв’язання математичних задач — це вся їхня справа. Але вони дуже незадоволені.

Ендрю Карран : Двадцять п'ять лауреатів Філдсівської медалі опублікували спільну декларацію, попереджаючи про те, що вони бачать як серйозну невідповідність між компаніями ШІ та математичною спільнотою.

Math and AI (підписано 25 лауреатами Філдсівської медалі, включаючи Теренса Тао): За останні кілька місяців математичні можливості LLM різко покращилися, настільки, що вони можуть розв’язувати великі невирішені проблеми в багатьох галузях математики. Однак прагнення компаній ШІ розв’язувати математичні проблеми як бенчмарк шкодить науці математики та математичній спільноті. Цілі компаній ШІ та цілі математичної спільноти серйозно не узгоджуються. Ми бачимо це як частину ширших проблем вирівнювання, що впливають на інші наукові та творчі професії, а також на суспільство загалом.

… Відомі проблеми часто служили орієнтирами та маяками, відносно яких можна виміряти покращене розуміння цього ландшафту.

… Останніми місяцями успіх ШІ у розв’язанні великих математичних проблем потрапляв у заголовки навіть поза математичними колами. Але розв’язання проблем — це лише інструмент і проксі для досягнення головної мети: концептуального розуміння та інсайту.

… Часто ці рішення оголошуються в поспіху, не залишаючи часу на належне оформлення, виділення нових методів та ідей і цитування релевантних попередніх робіт інших. Як і в усіх творчих професіях, це ставить серйозні питання щодо атрибуції та плагіату.

Це загальна скарга, поверх конкретних скарг щодо поведінки лабораторій.

Можна відповісти, що ні, мета математичних задач — це розв’язання математичних задач, і математики сердяться, тому що ШІ руйнує їхні статусні ігри. Це безперечно частина того, що відбувається, але як Тайлер Коуен, я не такий цинічний, і на відміну від нього я не думаю, що «потрібно трохи терпіння» або чекати, поки шкода буде завдано, перш ніж можна буде скаржитися. Люди вміють екстраполювати. Чи знали ви, що математики вміють проводити прямі лінії на графіках?

Тут є реальна скарга. Залучити талановитих людей до реальної математики на тривалий період часу, за дуже маленькі гроші, і розвивати реальну математичну інтуїцію та опанування понять, коли вони могли б робити інші речі за набагато більші гроші, — це не легка задача. Якщо ви «заберете у них їхні статусні ігри», а також, що набагато важливіше, заберете у них задоволення, відчуття досягнення, елегантності та краси, то що тоді?

Робін Генсон пропонує, що тоді ми повинні просто виправити стимули та краще винагороджувати математиків.

Робін Генсон : "ніщо не заважає математичній спільноті присуджувати статус, зарплату та підвищення людям, які 'заповнюють важливі прогалини в математичному розумінні', навіть якщо ШІ вже довів або спростував базові теореми."

Він не використовує слово «просто», але це визначено «просто», як у «якби тільки люди просто [X]», і, як ми всі знаємо, люди ніколи нічого не робили «просто» і не збираються починати зараз. Це не реальна річ, яку люди можуть зробити. Як він сам зрозумів кілька годин потому:

Робін Генсон : Насправді мені здається, що математичній академічній спільноті значно складніше координуватися, щоб судити, хто «заповнив прогалини» в математиці, способами, відмінними від доведення теорем. Математика сильно координувалася навколо оцінки доведень і не розробила багатьох способів домовитися про інші речі.

Ми можемо і будемо отримувати певні винагороди для тих, хто заповнює прогалини та покращує елегантність, але це не буде тим самим і буде геркулесовими зусиллями, у найкращому випадку.

Скотт Армстронг стверджує, що це зміна порядку, але не результату. Людські математики витратять кілька тижнів на розуміння доведення, але потім вони отримають розуміння. У минулому розуміння приходило перед доведенням, але в будь-якому випадку ви отримуєте розуміння. Це те, що важливо. Він думає, що люди сердяться через те, що машини розумніші за них.

Як завжди, ШІ — найкращий інструмент як для навчання, так і для ненавчання. Математики кажуть, що їх примушують до режиму «ненавчання», дозволяючи ШІ робити їхню домашню роботу, і їм це не подобається, тому що насправді домашня робота вчить тебе.

Можна сказати, кому яка різниця, що нормально, коли ШІ робить передову математику. І так, я думаю, що багато людей все одно захочуть займатися математикою цілий день, шукати елегантні версії потворних речей ШІ тощо. Але це не буде тим самим.

Нова модель OpenAI стала стрибком вище за Astra через чотири дні навчання

Тепер про найважливішу частину історії.

RIP різні паузи в навчанні OpenAI, 22 червня 2026 – 28 серпня 2026.

roon (OpenAI): за моїми підрахунками, період з 22 червня (hugging face) до 28 серпня становить понад місяць паузи в передових дослідженнях.

18 серпня OpenAI заявила, що вони поставили на паузу передове RL-навчання на два тижні, і їхній найбільший запланований цикл навчання залишався на паузі. Потім 28 серпня OpenAI почала навчання іншої моделі, яка швидко стала більш потужною за Astra за всіма показниками (за їхніми власними звітами), тепер, коли вони вирішили всі ті набридлі проблеми з наглядом, інфраструктурою та вирівнюванням, і вона хороша, спостерігаючи «стрибок» після лише чотирьох днів:

Zvi Mowshowitz - inline image

Налякані? Вам слід бути. Ця модель все ще навчається, навчалася менше двох тижнів і не особливо орієнтована на математику.

Це все, що нам відомо про модель. І цього достатньо, якщо поєднати це з численними історіями про те, як OpenAI та її співробітники щиро панікують через вирівнювання (alignment) та інші проблеми, а також через темпи прогресу в ШІ, створюючи каскад переваг.

Ми також враховуємо той факт, що OpenAI оприлюднила так багато тривожної інформації, яку могла б не розголошувати, оскільки їм дуже потрібно, щоб ми розуміли ситуацію. Сюди входять картка моделі Astra, стаття An Alien Mind, заява Пола Крістіано, а також реакції на атаку на HuggingFace, включаючи документ «Pacing the Frontier».

Сюди ж входить і звіт OpenAI про рекурсивне самовдосконалення (RSI), який розглядається в наступному розділі.

OpenAI та Anthropic вступили в еру RSI.

Прогрес досліджень OpenAI прискорюється завдяки прогресу досліджень OpenAI

Останнім часом OpenAI стала більш відкритою щодо багатьох речей.

Найважливіше питання — це прискорення та автоматизація досліджень і розробок у сфері ШІ. Саме це може знищити нас, саме це найстрашніше, про що попереджають усі працівники лабораторій, і до чого OpenAI та Anthropic прагнуть якомога швидше.

Вони також дали нам звіт про це. Я погоджуюся з Теджал Патвардхан, що це чудова прозорість.

OpenAI (6 вересня, у звіті «Прискорення досліджень: погляд ізсередини OpenAI»): Ми прагнемо безпечно створити автоматизованого дослідника ШІ, який зможе працювати під наглядом людини для подальшого прогресу в глибокому навчанні та вирівнюванні, забезпечуючи ітеративні покращення.

Згідно з нашими вимірюваннями, ми досягли мети,

оголошеної минулої осені, — мати автоматизованого стажиста-дослідника до вересня цього року.

… Щоразу, коли ми виявляємо, що продовження роботи становить неприйнятний ризик безпеки, ми реагуватимемо відповідним чином, зокрема сповільнюючи або зупиняючи розробку чи впровадження.

… Ми вважаємо, що ми та інші компанії повинні бути зобов’язані публічно відстежувати наш прогрес у напрямку RSI.

Поставте це в один ряд із часовою шкалою, оголошеною ними при представленні доказу рівнянь Нав'є–Стокса. Вони почали тренувати свою нову модель 28 серпня.

Тим часом вони вважають, що мають стажиста-дослідника, який, судячи з хронології, є окремою внутрішньою моделлю. Що буде наступного тижня? Наступного місяця? Що має Anthropic?

OpenAI пояснює, що високоефективний ШІ пропонує величезні переваги, але звичайно ж, так і є. Це не причина, чому всі так наполегливо рухаються так швидко. Вони перебувають у гонці.

Це ще один заклик серед багатьох від OpenAI та її співробітників останнім часом, які поєднують у собі «нам потрібно об’єднатися, щоб покласти край цьому божевіллю», з великою часткою «хтось, зупиніть мене».

OpenAI : Це причини для розробки корисних автоматизованих дослідницьких можливостей, але це не означає, що швидкий RSI — це обов’язково результат, якого ми повинні прагнути. Чи і як діяти далі, має залежати від нашої здатності зберегти контроль над людиною та від інформованих демократичних рішень щодо переваг і ризиків.

Ми ще не знаємо, як безпечно дійти до повністю вирівняного RSI. Ми працюємо над масштабуванням заходів безпеки та вирівнювання паралельно зі зростанням можливостей. Але ми не можемо припускати, що прогрес у вирівнюванні та безпеці буде йти в ногу з розвитком, а більш потужні системи можуть стати складнішими для моніторингу.

Обережна робота з вирівнювання та безпеки є центром цих зусиль, і вона починається з вимірювання та пом’якшення проблем безпеки, які ми бачимо сьогодні в агентних системах кодування.

Щоразу я заперечую проти думки, що буденні або поточні проблеми є головними, але так, вони намагаються попередити нас, знову і знову, що (трохи перекладаючи з корпоративної мови):

  1. У OpenAI та Anthropic є шлях до рекурсивного самовдосконалення (RSI).
  2. Якщо хтось із них піде на це зараз, це, ймовірно, закінчиться жахливо, і всі загинуть.
  3. OpenAI готова проявити певну обережність, яка коштує дорого, але є межі, і без угоди чи закону хтось скоро спробує це зробити.

Основна частина посту — це детальний зріз того, наскільки агентні системи сприяли прогресу RSI в OpenAI за останні місяці, тобто з моменту запуску Astra всередині компанії. Відповідь така: досить суттєво.

Якщо і є сюрприз, то лише той факт, що використання залишалося таким низьким так довго:

OpenAI : На початку цього року медіанний дослідник за рівнем використання агентів у OpenAI використовував агенти для кодування лише в помірних обсягах. До середини серпня медіанний дослідник щодня інтегрував агентів у свою роботу, використовуючи більше $600 на день витрат на інференс за цінами API. Користувач із 90-го процентилля в нашій дослідницькій організації тепер використовує понад $7,000 токенів на день.

Zvi Mowshowitz - inline image

OpenAI : До червня 2026 року загальний час виконання агентів у дослідницькій організації все ще був нижчим за загальну кількість людської праці. З тих пір це змінилося. У термінах стандартного 8-годинного робочого дня, станом на середину серпня, дослідницька організація в сумі використовує 3,1 агентнього робочого дня зусиль на кожен робочий день людської праці.

Zvi Mowshowitz - inline image

Вони не хизуються, але й не каяться. Вони попереджають.

Бінарний характер цього вимірювання, ймовірно, робить прискорення менш помітним, ніж воно є насправді:

Zvi Mowshowitz - inline image

Мені цікаво, скільки одночасних робочих процесів людина може належно контролювати, каже чоловік із десятками відкритих вкладок і дюжиною активних чернеток постів.

Виявляється, це не так вражає, як здається, тому що вони рахують субагентів як окремі робочі процеси. Це робить ще більш дивним те, що, хоча медіанний дослідник витрачає $600 на день, все ще є 30%, які не використовують їх інтенсивно.

Швидкість доставки коду та проведення експериментів різко прискорилася приблизно з того моменту, коли Claude Code, а потім і Codex стали великою справою.

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

До недавнього часу більшість задач, для яких використовувався ШІ, полягала в створенні дослідницького та інфраструктурного коду, а решту робили люди. Тепер ШІ виконує значну частину роботи з запуску, моніторингу та налагодження процесів, а також технічної допомоги та огляду, і починає проникати в аналіз результатів та інші сфери.

Вони забрали нашу роботу, версія «людські фахівці з усунення неполадок»:

Zvi Mowshowitz - inline image

Ось інша варіація відомого графіка METR, з виробничими задачами; його важко читати як статичний знімок екрана, але прогрес стрімкий. Це не роки. Це місяці:

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Кількісна оцінка паузи OpenAI

У них є графік витрат обчислювальних ресурсів на навчання з підкріпленням (RL) у часі. Я здивований тим, як мало Astra використовувалася до 20 липня, але ось вам. Я помічаю, що вони не продовжують цей графік до сьогодення, і, ймовірно, використання Astra знову зросло з часом:

Zvi Mowshowitz - inline image

Так закінчується світ

Чи використання рою агентів для доведення рівнянь Нав'є–Стокса, лише через кілька днів після початку тренування нової моделі, саме по собі ризикувало серйозним інцидентом втрати контролю? Джун Хіменес стверджує, що так.

Якщо ви випустите рій із 10 000 агентів нової моделі, яку ви не могли належно протестувати, на потенційно неможливе і точно надзвичайно складне завдання, і колективно дасте їм 300 мільярдів токенів, що ще вони могли зробити? Я точно розглядав варіант «можливо, вони якимось чином зламали OpenAI, щоб отримати логи», але можливостей дуже багато.

Хутко, часу немає

Коли колишній співробітник лабораторії, у даному випадку Ендрю Хо, каже: «Я помічаю, що протягом періоду понад 3 місяці моя продуктивність не зросла навіть на 100%, а можливо, навіть не на 50%, тому що я відволікаюся», як причину для песимізму, це не дуже заспокійливо, навіть якщо це правда. Уявіть, що ваша продуктивність зростає лише на 50% кожні три місяці, і ви вважаєте це песимістичним прогнозом.

Він каже: «навіть якщо AGI врешті-решт досяжна, це означає значно довші терміни», у той самий день, коли Грег Брокман сказав: «Ласкаво просимо в еру AGI».

До того ж такого прогресу в математиці не очікували ще кілька тижнів тому.

Щоразу, коли одна з цих проблем вирішується, люди намагаються переписати історію так, ніби це було не таким уже й несподіваним. Часто вони помиляються. Ні, більшість людей, навіть більшість прогнозистів, не передбачали, що це станеться. Можливо, ви передбачали. Адже ви дуже розумні.

Генрі Шевлін : Ще в квітні цього року ринки прогнозів давали ШІ менше 40% шансів розв’язати будь-яку проблему з премії Милленіума до 2030 року

Zvi Mowshowitz - inline image
Збереження в один клік

Використовуйте YouMind для AI-глибокого читання віральних статей

Зберігайте джерела, ставте цілеспрямовані запитання, підсумовуйте аргументи та перетворюйте віральні статті на корисні нотатки в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей