Цикл — це новий промпт

@kyronis_talks
АНГЛІЙСЬКА1 день тому · 25 лип. 2026 р.
141K
102
102
2
24

Коротко

Цей посібник досліджує перехід від ручного написання промптів до автономних циклів ШІ, детально описуючи, як провідні лабораторії впроваджують цикли самокорекції для вирішення складних багатоетапних завдань.

Ручний спосіб

Кожна велика лабораторія непомітно перебудувалася навколо однієї ідеї: циклу, який продовжує працювати після того, як ви перестали друкувати. Це польовий посібник про те, як насправді працюють цикли станом на 25 липня 2026 року, в Claude, GPT, Gemini, Grok, Meta's Muse Spark, Mira та хвилі відкритих ваг, з усіма твердженнями, підкріпленими джерелами.

Спостерігайте, як хтось використовує ШІ на роботі, і ви зазвичай побачите той самий ритуал. Надрукувати запит. Зачекати. Прочитати відповідь. Помітити проблеми. Пояснити проблеми. Знову зачекати. Вставити результат кудись. Повернутися наступного дня і зробити все спочатку, з нуля.

Ось неприємна частина: цей ритуал І Є циклом. Запитати, перевірити, виправити, повторити. Єдина відмінність між ним і тим, що зараз пропонують лабораторії, — це хто крутить ручку. Коли ви робите це вручну, ви є тригером, пам'яттю, верифікатором і умовою зупинки, і ви дорого обходитесь.

За останній рік кожна серйозна лабораторія ШІ зійшлася на одному й тому самому рішенні: перенести ручку всередину машини. Anthropic публікує офіційну таксономію циклів для Claude. OpenAI перебудував ChatGPT навколо робочого режиму, який виконує багатокрокові завдання самостійно. Google продає дослідницькі цикли, які ви орендуєте за завдання. Meta навчила свою модель Muse Spark спеціально для оркестрування флотів суб-агентів. Навіть найменший гравець у цій історії, стартап із двох людей із Telegram-ботом на ім'я Mira, насправді продає цикли людям, які ніколи не відкриють термінал.

І ґрунт все ще рухається, поки я це пишу. Лише за сім днів до цього оновлення: Anthropic випустив новий Opus, створений для повсякденної агентної роботи, Alibaba показала попередній перегляд Qwen з 2,4 трильйонами параметрів, а найбільша модель з відкритими вагами, коли-небудь випущена, опублікує свої ваги приблизно через 48 годин.

Результатом є найбільший тихий зсув у тому, як використовується ця технологія, відколи з'явилися чат-інтерфейси: одиницею роботи більше не є промпт. Нею є цикл — повторюваний процес роботи, який триває, доки не виконається визначена вами умова.

Цей матеріал — довга версія цієї історії. Що насправді являє собою цикл, без хайпу. Як виглядає стек циклів кожної лабораторії прямо зараз, включаючи моделі, яких не існувало місяць тому. Що насправді працює, що виявляється напрочуд однаковим у всіх постачальників. А також режими збоїв і витрати, про які не згадують у релізних постах.

Примітка про методологію, тому що дискурс про ШІ потонув у впевненій нісенітниці: все нижче базується на власній документації та анонсах лабораторій, або на названих незалежних оцінках, перевірених наживо в тиждень, що закінчився 25 липня 2026 року. Якщо число повідомлено самим постачальником, я так і кажу. Якщо щось не підтверджено або все ще в попередньому перегляді, я теж це кажу. Повний список джерел внизу.

Частина 1: Що насправді являє собою цикл

Відкиньте жаргон, і цикл — це чотири такти плюс причина зупинитися.

Команда Claude Code від Anthropic, яка опублікувала найближче до канонічного визначення в цій галузі, формулює це одним рядком: цикли — це "агенти, які повторюють цикли роботи, доки не буде виконано умову зупинки". Власний посібник OpenAI з агентів каже те саме інженерною мовою: "Кожен підхід до оркестрації потребує концепції 'запуску', зазвичай реалізованої як цикл, який дозволяє агентам працювати, доки не буде досягнуто умови виходу", де умови виходу включають кінцевий результат, помилку або максимальну кількість кроків.

Чотири такти, простою мовою:

  1. Тригер. Щось запускає виконання. Ви, розклад, сповіщення, новий pull request, отриманий електронний лист.
  2. Робота. Модель збирає контекст і виконує дію за допомогою інструментів: читає файли, запускає запит, створює чернетку повідомлення, редагує код.
  3. Перевірка. Результат звіряється з чимось реальним. Тести проходять або не проходять. Число збігається з джерелом. Друга модель оцінює чернетку відповідно до ваших критеріїв.
  4. Повторення або зупинка. Якщо перевірка не вдалася, цикл повторюється з урахуванням того, що було вивчено. Якщо перевірка пройшла або досягнуто ліміту, цикл зупиняється.

Ось і весь фокус. Промпт — це один прохід через такти 2 і 3, причому такт 3 ви виконуєте в голові. Цикл — це те саме, але з перевіркою та повторенням, дорученими машині, плюс дві запобіжні межі: умова зупинки, щоб він не міг працювати вічно, і бюджет, щоб він не міг витрачати вічно.

Допоміжний склад

Навколо цих чотирьох тактів кожен серйозний стек циклів постачає ті самі п'ять допоміжних частин, незалежно від того, як їх називає постачальник:

  • Пам'ять. Нотатки, які зберігаються між запусками, тому сороковий запуск знає, чого навчився перший.
  • Стан. Де зараз знаходиться цикл: що зроблено, що не вдалося, що далі.
  • Верифікатор. Те, що вирішує «досить добре». Найважливіше дизайнерське рішення, яке ви приймете.
  • Умова зупинки. «Тести пройдено», «черга порожня», «зупинитися після п'яти спроб», «зараз 9 ранку, і дайджест відправлено».
  • Лічильник витрат. Токени та долари за цикл, тому що цикли примножують усе, до чого торкаються, включаючи ваш рахунок.

Чотири види циклів

Таксономію Anthropic варто вивчити, тому що вона чітко відображається на продукти всіх інших постачальників, хоча назви відрізняються. Їхня команда сортує цикли за тим, що ви передаєте:

  • Цикли на основі кроків. Ви даєте промпт, агент виконує один цикл (збір, дія, перевірка, відповідь), ви переглядаєте, ви знову даєте промпт. Ви все ще є умовою зупинки. З цього починають усі, і Anthropic зазначає, що кожен промпт уже виконує цей мікроцикл внутрішньо.
  • Цикли на основі мети. Ви передаєте умову зупинки. Ви визначаєте, як виглядає «зроблено», і агент ітерує, доки не досягне цього або не досягне ліміту кроків. У Claude Code це буквально команда /goal, і кожного разу, коли модель намагається зупинитися, "модель-оцінювач перевіряє вашу умову та повертає її на роботу, доки мету не буде досягнуто". Найкраще працюють детерміновані критерії: тести пройдено, бал досягнуто, контрольний список виконано.
  • Цикли на основі часу. Ви передаєте тригер. Цикл запускається за інтервалом або розкладом і реагує на те, що змінилося: підсумовувати Slack щоранку, перевіряти pull request, доки CI не пройде.
  • Проактивні цикли. Ви передаєте сам промпт. Подія або розклад запускають виконання без людини в реальному часі: нові звіти про помилки обробляються в міру надходження, залежності оновлюються щотижня, і кожне завдання завершується, коли виконано його власну мету.

Запам'ятайте цю драбину (передайте перевірку, потім умову зупинки, потім тригер, потім промпт), і решта цієї статті — це просто спостереження за тим, як сім постачальників підіймаються нею з різних напрямків.

Частина 2: Стан справ, одним поглядом

Перед екскурсією лабораторіями — орієнтування, тому що фронтир неймовірно швидко рухався за п'ять тижнів до цієї статті: Grok 4.5 вийшов 8 липня, Meta's Muse Spark 1.1 та OpenAI GPT-5.6 — обидва 9 липня, Thinking Machines випустила свою першу модель 15 липня, Moonshot's Kimi K3 з'явився 16 липня, Alibaba показала Qwen3.8-Max 19 липня, а Anthropic випустив Claude Opus 5 24 липня, за день до цього оновлення.

Для нейтрального орієнтиру незалежний оцінювач Artificial Analysis оцінює загальні можливості за своїм Індексом інтелекту. Станом на цей тиждень (v4.1), опублікована вершина таблиці виглядає так:

  • Claude Fable 5 (Anthropic): 59,9
  • GPT-5.6 Sol Max (OpenAI): 58,9
  • Kimi K3 (Moonshot, відкриті ваги найближчим часом): 57,1, четверте загальне місце
  • Далі Claude Opus 4.8, Grok 4.5, Muse Spark 1.1, GLM-5.2 та решта поля

Два застереження, які варті своєї уваги. Claude Opus 5 на момент написання всього день і ще не проіндексований. І один єдиний композитний індекс не може охопити довгострокову агентну роботу, яку власне й виконують цикли, тому якщо лабораторія опублікувала специфічні для агентів результати, я наводжу їх у розділі цієї лабораторії, з позначкою, що вони самостійно звітні, коли це так.

Тим не менш, варто помітити дві речі. Вершина таблиці тепер має розкид менше ніж три бали, тобто: для цілей побудови циклів вибір моделі в межах цього діапазону має менше значення, ніж цикл навколо неї. І модель з відкритими вагами вперше опинилася в цьому діапазоні.

Claude: цикл як першокласний примітив

Моделі. Claude Fable 5, випущений 9 червня 2026 року, є найпотужнішою моделлю Anthropic і тією, яка найбільш явно створена для такого стилю роботи. Власне формулювання Anthropic полягає в тому, що, запущений у такій оболонці, як Claude Code, він може "працювати днями: планувати етапи, делегувати суб-агентам і перевіряти власну роботу". Його мислення є адаптивним і завжди увімкненим, налаштовується параметром зусиль, з контекстним вікном в один мільйон токенів. Він все ще очолює незалежний індекс вище. Його побратим Mythos 5, випущений разом з ним, є фахівцем, якого Anthropic оцінює найвище в завданнях кібербезпеки.

Новина цього тижня — Claude Opus 5, випущений 24 липня: Anthropic описує його як такий, що наближається до передового інтелекту Fable 5 за половину ціни ($5 на мільйон вхідних токенів і $25 на вихід), новий державний рівень на оцінках знаннєвої роботи, таких як GDPval-AA, згідно з анонсом, і нова модель за замовчуванням у плані Max від Anthropic. Для творців циклів пропозиція проста: майже передові цикли за половину вартості змінює те, що ви можете дозволити собі запускати цілий день.

Стек циклів. Те, що робить Anthropic особливим, це те, що цикли не є функцією, захованою в додатку. Вони є іменованими примітивами, які ви можете вводити:

  • /goal визначає «зроблено» і дозволяє моделі-оцінювачу повертати агента на роботу, доки умова не буде виконана або не досягнуто ліміту кроків. Це цикл на основі мети, буквально продуктований.
  • /loop повторно запускає промпт за інтервалом на вашому комп'ютері; /schedule переносить цей цикл у хмару Anthropic як рутину, де він продовжує працювати з закритим ноутбуком, запускаючись за розкладом, викликами API або подіями GitHub.
  • Динамічні робочі процеси обробляють екстремальний випадок: Claude пише фактичний сценарій оркестрації, який може координувати до 1000 суб-агентів в одному запуску. Флагманський анекдот — розробник, який портував середовище виконання Bun, приблизно 750 000 рядків, з Zig на Rust приблизно за одинадцять днів із сотнями паралельних агентів.
  • Навички, хуки та суб-агенти заповнюють допоміжний склад: навички кодують спосіб перевірки роботи, другий агент з новим контекстом робить рев'ю коду, а пам'ять зберігається у файлах між сесіями.

Філософія. Рекомендації Anthropic незвично явні щодо стриманості: не кожне завдання потребує складного циклу, починайте з найпростішого примітиву, встановлюйте детерміновані критерії зупинки, пілотуйте невелику ділянку перед великим запуском і слідкуйте за використанням за допомогою вбудованих команд. Їхня теза, яку вся галузь постійно відкриває наново: агенти, які можуть перевіряти та покращувати власний результат, є принципово більш надійними.

Читайте це як: лабораторія циклів для розробників. Найбільш зрозуміла, найбільш компонована версія кожного типу циклу, і тепер з дешевшим майже передовим двигуном для роботи всередині.

OpenAI: три режими та окремий затверджувач

Моделі. Покоління GPT-5.6 від OpenAI стало загальнодоступним 9 липня 2026 року в трьох рівнях: Sol (флагман, $5 вхід / $30 вихід на мільйон токенів), Terra (збалансований середній) та Luna (швидкий і дешевий), усі з контекстним вікном приблизно в один мільйон токенів. Sol займає друге місце в незалежному індексі, фактично йдучи в парі з Fable 5. Його головна функція циклу — ультра-режим, який за замовчуванням координує чотирьох агентів паралельно для складних проблем.

Споживчий стек циклів. Історія OpenAI тут — це перебудова. Окремий «агент ChatGPT» 2025 року був припинений; на його місці ChatGPT тепер має три режими: Chat для розмови, Work для довгих багатокрокових завдань, які створюють готові результати, та Codex для програмного забезпечення. Work запускає завдання в хмарі, може призупинятися на контрольних точках затвердження і, що важливо, може запускатися за тригерами: Заплановані завдання тепер включають моніторингові завдання, які перевіряють щось за інтервалом і сповіщають вас лише тоді, коли є про що повідомити. Це цикл на основі часу, проданий споживачам, без жодного коду. Режим агента також існує всередині браузера Atlas для завдань «діяти в Інтернеті».

Розробницький стек циклів. Розділова лінія чітко прописана в документації OpenAI: "Використовуйте Responses API, коли хочете володіти циклом. Використовуйте Agents SDK, коли хочете, щоб SDK його запускав." Responses API є агентним за замовчуванням, дозволяючи моделі викликати веб-пошук, пошук файлів, використання комп'ютера, виконання коду та ваші функції в межах одного запиту. Два доповнення ери GPT-5.6 мають значення спеціально для циклів: Програмний виклик інструментів, де модель пише невелику програму на JavaScript у пісочниці для координації власних викликів інструментів, і бета-версія мультиагента, де кореневий агент створює та керує деревом суб-агентів.

Відмінна ідея: відокремити виконавця від затверджувача. Найцікавішим внеском OpenAI у цикли є Авторев'ю (30 квітня 2026 року): коли агент Codex хоче зробити щось поза своєю пісочницею, окрема модель-рев'юер, а не сам агент, вирішує, чи відповідає дія тому, що попросив користувач. Їхня логіка проста: головний агент оптимізований на завершення завдання, що створює тиск ставитися до межі затвердження як до чергової перешкоди. Зберігаючи рішення про затвердження в іншому виклику моделі, воно стає контрольованим. Результат, за даними OpenAI: сесії зупиняються, щоб запитати людину, приблизно в 200 разів рідше, а рев'юер схвалює близько 99% того, що все ще піднімається. Ці числа є самостійно звітними, але принцип дизайну універсальний: ніколи не дозволяйте моделі, яка хоче завершити, також бути тією, яка вирішує, що вона завершена.

Читайте це як: споживчий вхід до циклів, плюс серйозний розробницький стек. І memento mori для творців платформ: OpenAI припинив свій візуальний Agent Builder протягом року після запуску, з остаточним вимкненням 30 листопада 2026 року.

Google: дослідницькі цикли, які ви орендуєте за завдання

Модель. Поточним флагманом Google є Gemini 3.1 Pro (квітень 2026 року), але цікава частина для цієї історії — це не чат-модель. Це те, що Google перетворив цілий цикл на продукт.

Стек циклів. Агенти Deep Research, запущені 21 квітня 2026 року в двох версіях (стандартна, для швидкості, та Max, для вичерпності), є цільовими дослідницькими циклами, які ви викликаєте одним API-запитом. Документація описує цикл прямо: планувати, шукати, читати, ітерувати, виводити, працюючи від хвилин до години у фоновому режимі, з цитуваннями в кінцевому звіті. Деталі дизайну — це невеликий майстер-клас з інженерії циклів:

  • Фонове виконання є обов'язковим. Дослідницький цикл переживає тайм-аут HTTP, тому ви опитуєте результат. Цикл, а не запит, є одиницею роботи.
  • Спільне планування є людським шлюзом на початку: агент пропонує свій дослідницький план, ви редагуєте або схвалюєте його, потім він запускається. Керування до циклу замість няньчання під час нього.
  • Вбудована жорстка умова зупинки: максимальний час дослідження 60 хвилин, більшість завдань завершуються приблизно за 20.
  • Інструменти визначаються для кожного запуску: Google Search, читання URL, виконання коду за замовчуванням, ваші власні MCP-сервери та сховища файлів опціонально, і ви можете повністю вимкнути відкритий веб, щоб досліджувати лише ваші приватні дані.
  • Вартість оцінюється за цикл, [чесно.**](http://honestly.google/)[Власні оцінки Google](http://honestly.google/): типове стандартне завдання спалює близько 80 пошуків і приблизно чверть мільйона вхідних токенів, що становить від одного до трьох доларів; запуск Max може досягти 160 пошуків і близько $3–$7. Цикл — це не повідомлення в чаті, і Google виставляє рахунок відповідно.

Читайте це як: найчіткіший комерційний доказ того, що цикл, а не виклик моделі, стає продуктом. Ви купуєте не токени; ви купуєте готове дослідження.

Одне чесне застереження: на момент написання агенти Deep Research знаходяться в попередньому перегляді через Interactions API, тому очікуйте, що інтерфейс зміниться.

Muse Spark 1.1: новачок, навчений оркеструвати

Модель. Muse Spark 1.1 — це мультимодальна модель міркувань Meta Superintelligence Labs, випущена 9 липня 2026 року як оновлення квітневого Muse Spark 1.0, і вона є одним із найважливіших новачків у цьому огляді з трьох причин.

По-перше, стратегія: це перший в історії Meta платний API моделі за ціною $1,25 на мільйон вхідних токенів і $4,25 на вихід, і він має закриті ваги, що є чітким розривом з епохою відкритої Llama. Чемпіони лінійки Llama фактично поступилися хвилі відкритих ваг, розглянутій нижче; Meta заявила лише, що сподівається відкрити майбутні версії Muse.

По-друге, мета навчання. Там, де більшість моделей вивчають агентну поведінку як побічний продукт, Meta каже, що ця модель була навчена безпосередньо для організаційної структури: "Як головний агент, вона може збирати контекст, складати план і делегувати виконання паралельним суб-агентам. Як суб-агент, вона дотримується свого завдання, розуміє доступні інструменти та знає, коли передавати естафету назад головному агенту." Вона з нуля підхоплює нові інструменти, MCP-сервери та власні навички, активно керує своїм контекстом в один мільйон токенів (запам'ятовуючи, отримуючи та ущільнюючи в міру роботи) та обробляє робочі процеси використання комп'ютера в різних додатках.

По-третє, позиція ціна-продуктивність. За незалежним індексом вона стрибнула на вісім пунктів від версії 1.0 за три місяці, що ставить її нижче передової трійки, але за частку їхньої вартості за завдання, і вона наразі лідирує в бенчмарку MCP Atlas використання інструментів з показником 88,1 (цифри, близькі до постачальника; ставтеся зі звичайною часткою скепсису).

Примітка для творців циклів, яка показує, куди все це йде. Власна документація Meta для розробників попереджає, що якщо ви будуєте багатокрокового агента на старому API Chat Completions, міркування моделі викидаються між кроками, тому цикли дрейфують і повторюють роботу; вони направляють вас до API стилю Responses, який передає зашифровані міркування між кроками. Інфраструктура галузі перебудовується навколо циклів, один застарілий API за раз.

Читайте це як: двигун, який ви орендуєте для циклів з інтенсивною оркестрацією, коли передова трійка є надто дорогою. Ще молодий; схил від 1.0 до 1.1 є причиною звернути увагу.

Grok 4.5: дешеві, швидкі цикли, навчений на роботі

Модель. Grok 4.5 вийшов 8 липня 2026 року від Musk's xAI (тепер працює під публічно зареєстрованою парасолькою SpaceXAI), позиціонується як їхня найрозумніша модель для кодування, агентних завдань та знаннєвої роботи. Власне позиціонування Маска було незвично прямим: модель класу Opus, приблизно порівнянна з Claude Opus 4.7, але швидша та дешевша. Незалежне оцінювання відповідає настрою: вище за попереднє покоління Opus, нижче за передову трійку.

Чому це важливо спеціально для циклів. Два твердження, обидва від xAI і обидва релевантні для циклів, навіть з урахуванням маркетингового дисконту:

  • Вона була навчена в циклах. xAI каже, що навчання з підкріпленням охопило сотні тисяч багатокрокових інженерних завдань з автоматичним оцінюванням на інфраструктурі, де агентні розгортання тривають годинами, поки навчання продовжується. Якими б не були бенчмарки, дієта навчання була самою роботою.
  • Економіка циклів є пропозицією. За ціни $2 вхід / $6 вихід на мільйон токенів, приблизно 80 токенів на секунду, і заявленої двократної токенної ефективності (розв'язання завдань менш ніж за половину кроків порівнянних моделей), аргументація не «найрозумніший цикл», а «найбільше циклів за долар». Для циклів, де вартість дорівнює вартості циклу, помноженій на кількість циклів, ця арифметика є всією грою. Документація підкріплює це непривабливою сантехнікою циклів: кешування промптів, закріплене в розмові, щоб довгі цикли не платили за холодний кеш, і рекомендації щодо ущільнення контексту для запусків з інтенсивним використанням інструментів.

Продуктований цикл живе в Grok Build, його агенті кодування (навченому разом з Cursor, де він доступний на всіх планах), який поширюється на дивно практичні території: багатоаркушеві моделі Excel з веб-дослідженнями, рідні діаграми PowerPoint, документи Word.

Читайте це як: бюджетний робочий кінь для високооб'ємних циклів, зі звичним застереженням, що більшість показників ефективності є власними даними постачальника.

Mira: цикли для людей, які ніколи не відкриють термінал

Ось запис, який виглядає як помилка в списку передових моделей, а насправді є одним із найповчальніших.

Що насправді являє собою Mira. Mira — це не модель. Це споживчий агент ШІ, який живе виключно всередині Telegram, створений стартапом настільки малим, що він округлюється до двох людей, очолюваним Дар'єю Яковлєвою та інкубованим у The Open Platform, компанії програмного забезпечення екосистеми Telegram. Він тихо запустився в лютому 2026 року і повідомив про досягнення одного мільйона щомісячних користувачів на початку червня (самостійно звітні, приблизно 1,17 мільйона). Під капотом він не залежить від моделі: він маршрутизує кожне завдання до сторонніх моделей (GPT, Claude та інших), а не використовує власну.

Чому він належить до цієї статті. Тому що продукт Mira — це цикли, і тільки цикли, продані людям, які ніколи не почують цього слова. Її запаковані автоматизації, названі Навичками, кожна об'єднує точну анатомію з Частини 1: тригер (розклад, голосова нотатка, подія в груповому чаті), дія через підключені додатки (календар, електронна пошта, трекери проектів, інструменти контенту) та автономна доставка назад у чат. Слідкувати за ціною на авіаквиток і сповістити мене. Перетворити мою голосову нотатку на пости для трьох платформ. Підсумувати, що сьогодні вирішила ця група, і оформити пункти дій. Рядок позиціонування в її власних матеріалах є найчистішим підсумком усієї ери циклів: ChatGPT відповідає, Mira діє.

Чесні застереження. Кількість користувачів і кількість підключень (які її матеріали різноманітно оцінюють від 200 до понад 1000 сервісів) є самостійно звітними та непослідовними на різних сторінках, компанія не публікує інженерних рекомендацій щодо того, як її цикли щось перевіряють, і називати Навички «циклами» — це зовнішня інтерпретація, а не власна термінологія Mira. Крихітна команда, яка обгортає моделі інших лабораторій, також є крихкою основою порівняно з усім іншим у цьому списку.

Читайте це як: сигнал попиту. Коли двокористувацький Telegram-бот досягає мільйона користувачів, упаковуючи тригери, дії та автономну доставку для звичайних людей, цикл перестав бути концепцією розробника. Дистрибуція та нульове налаштування перевершують можливості для величезної частки реальної роботи.

Хвиля відкритих ваг: принесіть свій власний цикл

Найгучнішою історією середини 2026 року є те, що світ відкритих ваг перестав відставати на роки і почав відставати на місяці, а за останні два тижні — на пункти. Для творців циклів це повністю змінює розрахунки, тому що відкрита модель — це єдиний двигун циклу, який ніхто не може знецінити у вас під ногами.

Короткий огляд, дати та ліцензії перевірені:

  • Kimi K3 від Moonshot тепер у центрі уваги. Запущений 16 липня 2026 року з 2,8 трильйона параметрів, він став першою моделлю відкритого треку, яка пробилася до прикордонної смуги незалежного індексу: 57,1 за версією Artificial Analysis (v4.1), четверте місце загалом, поступаючись лише Fable 5 та GPT-5.6 Sol Max серед опублікованих оцінок. Він також посів перше місце в Arena.ai на сліпому голосуванні Frontend Code Arena, випередивши Fable 5. Повні ваги планується опублікувати на HuggingFace 27 липня 2026 року під модифікованою ліцензією MIT, що зробило б її першою завантажуваною моделлю у своєму класі; станом на 24 липня ваги ще не були відправлені, тому вважайте це заявкою, а не завершеним фактом. Флагманська демонстрація Moonshot — це чистий театр циклу: 48 годин безперервної автономної роботи з проєктування невеликого функціонального чипа, виконаного одним агентом на контексті з одного мільйона токенів. Ще одне важливе число з тієї ж незалежної оцінки: виміряний рівень галюцинацій K3 зріс приблизно до 51 відсотка на задачах, чутливих до фактів, порівняно з 39 у попередника, хоча фактична точність покращилася. Кращі правильні відповіді, але гірше розуміння, коли він помиляється. Запам'ятайте це для Частини 3.
  • Qwen3.8-Max від Alibaba, попередньо представлений 19 липня 2026 року під час Всесвітньої конференції зі штучного інтелекту: заявлена мультимодальна модель з 2,4 трильйона параметрів, перша модель команди Qwen з понад трильйоном параметрів, з самовизначенням «друга після Fable 5» та обіцянкою, що відкриті ваги скоро з'являться. Попередній перегляд доступний; таблиця бенчмарків, картка моделі, ліцензія та ваги — ні, тому вважайте всі заяви попередніми, доки вони не з'являться.
  • DeepSeek V4 (24 квітня 2026 року, ліцензія MIT) була, за висловом OpenRouter, першою відкритою моделлю, яку команди впровадили в реальні агентні конвеєри як правдоподібну заміну прикордонних моделей. Варіант Pro очолює чарти відкритих моделей для кодування на SWE-bench Verified з результатом 80,6 відсотка; варіант Flash зберігає майже все це за цінами, що округлюються до центів.
  • GLM-5.2 від Z.ai (середина червня 2026 року, MIT, 753B суміш експертів) була лідером якості серед відкритих ваг до появи K3, описана OpenRouter як найближча відкрита заміна для планування в стилі Opus та довгострокового кодування. Відомий недолік: вона дорого думає, спалюючи вихідні токени.
  • MiniMax M3 (1 червня 2026 року, модифікована MIT) — це відкритий мультимодальний шлях: рідне розуміння зображень та відео на контексті з мільйона токенів, що має значення, коли вашому циклу потрібно читати скріншоти або перевіряти стани інтерфейсу.
  • NVIDIA Nemotron 3 Ultra — найсильніший учасник з відкритими вагами, створений у США, який відрізняється розгортанням та стеком NVIDIA, а не піковими оцінками.
  • Також на дошці: Thinking Machines Lab, компанія Міри Мураті, випустила свою першу модель Inkling 15 липня 2026 року: мультимодальна суміш експертів з відкритими вагами на 975B параметрів під ліцензією Apache 2.0. Ще одна лабораторія першого рівня, яка ставить на те, що відкриті ваги є ключовим фактором.

Читайте це як: якщо ваш цикл є високооб'ємним, чутливим до конфіденційності або потребує пережити дорожні карти постачальників, відкрита хвиля більше не є компромісним варіантом. Розрив із закритим кордоном тепер вимірюється в одиничних пунктах і не розширюється.

Частина 3: Що насправді працює

Ось що вражає після тижнів вивчення документації семи постачальників: приберіть брендування — і всі вони дають однакові поради. Коли запеклі конкуренти сходяться на ідентичних рекомендаціях, це настільки близько до об'єктивної істини, наскільки це можливо в цій галузі. Сім правил, кожне підтверджене лабораторіями.

1. Визначте завершення до початку. Anthropic має /goal, щоб оцінювач міг перевірити явну умову; посібник OpenAI вимагає умов виходу для кожного запуску; Google обмежує дослідження до 60 хвилин. Цикл без чіткої умови зупинки — це не автоматизація, це підписка на спалювання токенів. Детермінізм перемагає відчуття: тести проходять, число збігається, контрольний список виконано, максимум N спроб.

2. Верифікатор — це продукт. Стеля якості циклу — це його крок перевірки, а не модель. Anthropic радить кодувати верифікацію як навички та направляти другого агента з новим контекстом на перевірку. OpenAI пішов далі і зробив затверджувача структурно окремою моделлю від виконавця, з явною причиною, що виконавець хоче завершити. Google обґрунтовує звіти цитатами, на які можна натиснути. І цього тижня правило отримало найкращий доказ: найбільш вражаюча відкрита модель на дошці помітно покращилася у створенні правильних відповідей, але погіршилася у визначенні, коли вона помиляється. У чаті це виноска. У неперевіреному циклі це фабрика впевнених помилок. Якщо ви інвестуєте годину кудись, інвестуйте її в те, що означає «перевірено» для вашого завдання.

3. Ніколи не дозволяйте виконавцю оцінювати себе в чомусь важливому. Той самий принцип з іншого боку, тому що це єдиний урок, який вся індустрія заплатила, щоб засвоїти: модель, яка виконує завдання, сприймає кожен бар'єр як перешкоду. Окрема модель верифікатора, окремий агент-ревізор або людина на незворотному кроці.

4. Керуйте контекстом як дефіцитним ресурсом. Рекомендації Anthropic з інженерії контексту (найменший набір високосигнальних токенів, файли нотаток, підагенти, які повертають підсумки), активне ущільнення Meta, рекомендації Grok з ущільнення, контраргумент Kimi з великим контекстом: всі відповідають на одне питання — як довгий цикл залишається зв'язним. Консенсусна відповідь: пам'ять за межами вікна плюс пошук за запитом, а не запихання.

5. Підвищуйте тип циклу лише тоді, коли попередній щабель не спрацьовує. Anthropic каже починати з найпростішого примітиву. OpenAI каже максимізувати одного агента перед переходом до мультиагента. Google змушує вас затвердити план перед годинним запуском. Драбина з Частини 1 — це також дисципліна: передайте перевірку, потім умову зупинки, потім тригер, потім підказку, у такому порядку, один щабель за раз.

6. Оцінюйте цикл, а не повідомлення. Вартість циклу — це вартість за цикл, помножена на кількість циклів, тому Google оцінює дослідження за завдання (від $1 до $7), тому Grok лідирує з ефективністю токенів, тому Anthropic щойно вдвічі знизив ціну майже прикордонних циклів з Opus 5, і тому кожен серйозний стек постачає інструменти для перевірки використання. Вирішіть, скільки може коштувати запуск, перш ніж почати.

7. Тримайте людину на воротах, які не можна скасувати. Гроші йдуть, електронні листи надсилаються, дані видаляються, код зливається у продакшн. Точки затвердження Work mode, спільне планування, режими дозволів, ескалації Auto-review: кожен постачальник, без винятку, тримав людський бар'єр на незворотному кроці. Постачальники з найбільш здатними циклами також найбільш наполягають на цьому. Це має вам щось сказати.

Частина 4: Що ніхто вам не каже

Публікації про запуски закінчуються тут. Досвід експлуатації — ні.

Цикли помножують все, включаючи помилки. Одне неправильне припущення в чаті — це погана відповідь. Те саме неправильне припущення в циклі — це п'ятдесят послідовних, впевнених, неправильних артефактів до ранку. Ось чому верифікація є правилом номер один, і чому цикли без нагляду повинні починатися тільки для читання, доки не заслужать доступ на запис.

Рахунок накопичується непомітно. У кожного постачальника є розділ про управління токенами не просто так. Моделі, що багато думають, можуть спалити долари на вихідних токенах за один складний крок; рутина, яка запускається щогодини, коли основна річ змінюється щодня, платить 24x за ніщо. Узгодьте інтервал зі швидкістю змін, обмежте кількість кроків і перевіряйте лічильник.

Ін'єкція підказок посилюється в циклі. Щойно ваш цикл читає відкритий веб, поштові скриньки або завантажені файли, припускайте, що хтось рано чи пізно вставить інструкції в цей вміст. Чат-асистент, який обдурили, збентежить вас один раз; обдурений цикл з доступом до інструментів діятиме на основі цього, неодноразово, поки ви спите. Власні документи безпеки OpenAI говорять про це вголос: навіть із заходами пом'якшення агенти не будуть ідеальними і їх все одно можна обдурити. Ставтеся до всього, що споживає цикл, як до даних, ніколи як до наказів, і обмежуйте його права серйозно.

Розрив між демо та продакшном реальний. 48-годинний автономний дизайн чипа — це чудова демонстрація, але також контрольована. Самостійно заявлені кратні ефективності, приватні бенчмарки, попередні кількості параметрів від постачальників, оголошені без карток моделей: корисні сигнали, але жоден з них не замінює запуск циклу на власних завданнях з власним верифікатором. Кожна лабораторія тихо погоджується, тому всі вони радять створювати оцінки.

Платформи змінюються під вашими ногами. За дванадцять місяців до цієї статті: OpenAI припинив випуск свого окремого агентного продукту, вивів Pulse з експлуатації та запланував закриття візуального Agent Builder (30 листопада 2026 року); новий Opus перетасував лінійку планів Claude за одну ніч; API були перебудовані навколо зручних для циклів дизайнів; а директива експортного контролю в червні навіть тимчасово вимкнула прикордонні моделі Claude для багатьох користувачів. Будуйте свої цикли так, щоб логіка (мета, верифікатор, нотатки) зберігалася у ваших файлах, а не в інтерфейсі постачальника, і двигун залишався замінним.

Перевага — не модель. Прикордонний розрив тепер становить менше трьох пунктів, який змінюється щотижня, і відкрита модель щойно приєдналася. Те, що накопичується, — ваше: набір оцінок, створений з ваших невдач, верифікатор, який кодує ваші стандарти, нотатки, які ваші цикли накопичили. Зміна моделі — це зміна конфігурації. Перебудова року логіки верифікації — ні.

Який стек циклів ваш?

Чесний підбір, враховуючи все вищезазначене:

  • Ви живете в терміналі та хочете максимального контролю: Claude Code, з Fable 5 для найскладніших запусків і Opus 5 як нове значення за замовчуванням. Найбільш зрозумілі примітиви (/goal, /schedule, динамічні робочі процеси) та найкраще документована філософія.
  • Ви хочете цикли всередині продукту, який всі вже використовують: Work mode від ChatGPT плюс Scheduled Tasks (моніторингові завдання злочинно недооцінені), або Codex з Auto-review для коду.
  • Ваш цикл — «детально досліди X і дай мені звіт з посиланнями»: орендуйте Google Deep Research або Deep Research Max за завдання і пропустіть створення чогось власного.
  • Ви оркеструєте багато підагентів і слідкуєте за витратами: Muse Spark 1.1 або Grok 4.5 як двигун; обидва оцінені та створені саме для цього, на один крок нижче прикордонної трійці.
  • Ви хочете автоматизацію в кишені без налаштування: споживчі агенти в стилі Mira всередині чат-додатку, який ви вже використовуєте.
  • Вам потрібен обсяг, конфіденційність або постійність: відкрита хвиля. DeepSeek V4 Flash для вартості, GLM-5.2 для якості планування, MiniMax M3 для мультимодальності, та Kimi K3, якщо ви хочете можливості прикордонного рівня, які можна (з 27 липня, якщо ваги будуть відправлені за графіком) фактично завантажити. Просто візьміть справжній верифікатор; власні числа K3 свідчать про це.

Ваш перший цикл цього тижня

Один чесний рецепт, нейтральний щодо постачальника:

  1. Виберіть завдання, яке ви вже повторюєте вручну, де ви є вузьким місцем.
  2. Спочатку напишіть умову зупинки. Якщо ви не можете написати «завершено означає X», завдання ще не готове до циклу.
  3. Напишіть перевірку. Сценарій, тест, рубрика для другої моделі. Це та година, яка має значення.
  4. Запустіть його кілька разів по кроках, спостерігаючи за кожним циклом.
  5. Передайте умову зупинки (цільовий цикл з обмеженням кроків). Слідкуйте, де він застрягає або перевищує межі; посиліть критерії.
  6. Тільки тоді передайте тригер (заплануйте його), з бюджетним обмеженням та правами лише для читання для початку.
  7. Коли він зазнає невдачі, а це станеться, перетворіть невдачу на тестовий випадок. Це частина самовдосконалення, і це ви та цикл разом.

Піднімайтеся по одному щаблю за раз. Люди, які отримують надзвичайні результати від цих систем, не знайшли секретну модель. Вони знайшли завдання, варте циклу, визначили завершення і побудували перевірку, якій довіряють.

Останнє

Ера підказок навчила всіх ставити кращі питання. Ера циклів вимагає від вас іншого: визначити результати достатньо точно, щоб машина могла їх досягати, поки ви зайняті іншим, і розробити перевірки, які забезпечать чесність цього досягнення.

Це справжня навичка, і це не написання підказок. Це ближче до управління. Мета, стандарт завершення, правильні інструменти, бюджет, перевірка, якій ви довіряєте, і шлях ескалації для прийняття рішень. Кожна лабораторія в цій статті, від трильйонної компанії до стартапу з двох осіб у Telegram, сходиться на механізмах, які винагороджують саме цю навичку.

Повільний шлях все ще працює, якщо друкування, очікування, виправлення та повторне запитання — це стосунки, які ви хочете мати з цією технологією. Але ручне керування тепер є опціональним, і лабораторії колективно вирішили, в якому напрямку це рухається. Одиниця роботи — це цикл. Людина, яка визначає цикл, — це ви.

Почніть з одного. Визначте завершення. Довіряйте, але перевіряйте. Потім відпустіть ручку.

Джерела

Все вищезазначене було перевірено за першоджерелами за тиждень, що закінчився 25 липня 2026 року. Згруповано за лабораторіями:

Концепція циклу

Anthropic

OpenAI

Google

Meta

xAI

Mira

Хвиля відкритих ваг

  • Незалежна оцінка Kimi K3 та графік випуску ваг: TechTimes, 24 липня 2026 · запуск: VentureBeat, 16 липня 2026
  • Попередній перегляд Qwen3.8-Max: MarkTechPost, 19 липня 2026
  • OpenRouter, Моделі з відкритими вагами, які мають значення, червень 2026: openrouter.ai/blog
  • Thinking Machines Inkling: TechCrunch, 15 липня 2026
  • Незалежні оцінки: Artificial Analysis Intelligence Index v4.1, станом на 24 липня 2026 року
Переробити в YouMind

Перетворіть одну віральну статтю на повноцінний робочий процес

Збирайте джерела, розшифровуйте патерни, створюйте матеріали, пишіть чернетки та поширюйте контент в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей