Ручной способ
Каждая крупная лаборатория незаметно перестроилась вокруг одной и той же идеи: цикла, который продолжает работать после того, как вы перестали печатать. Это практическое руководство по тому, как циклы на самом деле работают по состоянию на 25 июля 2026 года, в Claude, GPT, Gemini, Grok, Meta Muse Spark, Mira и волне моделей с открытыми весами, с указанием источников для каждого утверждения.
Посмотрите, как кто-то использует ИИ на работе, и вы обычно увидите один и тот же ритуал. Напечатать запрос. Подождать. Прочитать ответ. Найти проблемы. Объяснить проблемы. Снова подождать. Вставить результат куда-то ещё. Вернуться завтра и повторить всё с нуля.
Вот что неудобно: этот ритуал И ЕСТЬ цикл. Спросить, проверить, исправить, повторить. Единственное отличие от того, что сейчас предлагают лаборатории, — кто крутит ручку. Когда вы делаете это вручную, вы — триггер, память, верификатор и условие остановки, и вы обходитесь дорого.
За последний год каждая серьёзная лаборатория ИИ пришла к одному и тому же решению: перенести ручку внутрь машины. Anthropic публикует официальную таксономию циклов для Claude. OpenAI перестроила ChatGPT вокруг рабочего режима, который выполняет многошаговые задачи самостоятельно. Google продаёт исследовательские циклы, которые вы арендуете за задачу. Meta обучила свою модель Muse Spark специально для оркестровки флотов под-агентов. Даже самый маленький игрок в этой истории — стартап из двух человек с Telegram-ботом под названием Mira — на самом деле продаёт циклы людям, которые никогда не откроют терминал.
И почва продолжает двигаться, пока я пишу это. Только за семь дней до этого обновления: Anthropic выпустила новый Opus, созданный для повседневной агентской работы, Alibaba представила Qwen с 2,4 триллионами параметров, а крупнейшая модель с открытыми весами, когда-либо выпущенная, опубликует свои веса примерно через 48 часов.
Результат — самый большой тихий сдвиг в том, как используется эта технология, со времён появления чат-интерфейсов: единицей работы больше не является промпт. Это цикл — повторяющийся процесс работы, который продолжается до тех пор, пока не будет выполнено заданное вами условие.
Этот материал — длинная версия этой истории. Что такое цикл на самом деле, без хайпа. Как выглядит стек циклов каждой лаборатории прямо сейчас, включая модели, которых не существовало месяц назад. Что действительно работает — и это оказывается поразительно единообразным у всех поставщиков. А также сбои и затраты, о которых не упоминают в анонсах.
Замечание о методологии, потому что дискуссии об ИИ утопают в самоуверенной ерунде: всё ниже основано на собственной документации и анонсах лабораторий, либо на названных независимых оценках, проверенных в живую за неделю до 25 июля 2026 года. Если цифра предоставлена самим поставщиком, я это указываю. Если что-то не проверено или всё ещё в предварительном доступе, я тоже это указываю. Полный список источников внизу.
Часть 1: Что такое цикл на самом деле
Отбросьте жаргон, и цикл — это четыре такта плюс причина остановиться.
Команда Claude Code от Anthropic, опубликовавшая самое близкое к каноническому определению в этой области, формулирует это одной строкой: циклы — это "агенты, повторяющие циклы работы до тех пор, пока не будет выполнено условие остановки". Собственное руководство OpenAI по агентам говорит то же самое на инженерном языке: "Каждый подход к оркестровке нуждается в концепции «запуска», обычно реализуемой как цикл, который позволяет агентам работать до достижения условия выхода", где условия выхода включают конечный результат, ошибку или максимальное количество шагов.
Четыре такта простым языком:
- Триггер. Что-то запускает выполнение. Вы, расписание, оповещение, новый pull request, пришедшее письмо.
- Работа. Модель собирает контекст и выполняет действие с помощью инструментов: читает файлы, запускает запрос, составляет сообщение, редактирует код.
- Проверка. Результат сверяется с чем-то реальным. Тесты проходят или проваливаются. Число совпадает с источником. Вторая модель оценивает черновик по вашим критериям.
- Повтор или остановка. Если проверка не пройдена, цикл повторяется с учётом полученного опыта. Если проверка пройдена или достигнут лимит, цикл останавливается.
Вот и весь трюк. Промпт — это один проход через такты 2 и 3, причём вы выполняете такт 3 в уме. Цикл — то же самое, но с передачей проверки и повторения машине, плюс два страховочных ограничителя: условие остановки, чтобы цикл не мог выполняться бесконечно, и бюджет, чтобы он не мог тратить бесконечно.
Вспомогательный состав
Вокруг этих четырёх тактов каждый серьёзный стек циклов поставляет одни и те же пять вспомогательных элементов, как бы их ни называли поставщики:
- Память. Заметки, сохраняющиеся между запусками, чтобы сороковой запуск знал, чему научился первый.
- Состояние. Где сейчас находится цикл: что сделано, что провалилось, что дальше.
- Верификатор. То, что решает «достаточно хорошо». Самое важное проектное решение, которое вы примете.
- Условие остановки. «Тесты пройдены», «очередь пуста», «остановиться после пяти попыток», «сейчас 9 утра, и дайджест отправлен».
- Счётчик затрат. Токены и доллары за цикл, потому что циклы умножают всё, к чему прикасаются, включая ваш счёт.
Четыре вида циклов
Таксономию Anthropic стоит изучить, потому что она чётко отображается на продукты всех остальных поставщиков, даже если названия различаются. Их команда сортирует циклы по тому, что вы передаёте:
- Циклы на основе шагов. Вы даёте промпт, агент выполняет один цикл (сбор, действие, проверка, ответ), вы просматриваете, снова даёте промпт. Вы по-прежнему являетесь условием остановки. С этого все начинают, и Anthropic отмечает, что каждый промпт уже внутренне выполняет этот микроцикл.
- Циклы на основе целей. Вы передаёте условие остановки. Вы определяете, что значит «готово», и агент итеративно работает до тех пор, пока не достигнет этого или не упрётся в лимит шагов. В Claude Code это буквально команда /goal, и каждый раз, когда модель пытается остановиться, "модель-оценщик проверяет ваше условие и отправляет её обратно к работе, пока цель не будет достигнута". Детерминированные критерии работают лучше всего: тесты пройдены, оценка очищена, чеклист выполнен.
- Циклы на основе времени. Вы передаёте триггер. Цикл запускается через интервал или по расписанию и реагирует на изменения: подвести итоги Slack каждое утро, проверять pull request, пока CI не пройдёт.
- Проактивные циклы. Вы передаёте сам промпт. Событие или расписание запускают выполнение без участия человека в реальном времени: новые баг-репорты сортируются по мере поступления, зависимости обновляются еженедельно, и каждая задача завершается, когда достигнута её собственная цель.
Запомните эту лестницу (сначала передаёте проверку, затем условие остановки, затем триггер, затем промпт), и остальная часть статьи — это просто наблюдение за тем, как семь поставщиков карабкаются по ней с разных сторон.
Часть 2: Состояние дел, одним взглядом
Перед тем, как пройтись по лабораториям, — ориентир, потому что граница возможностей двигалась невероятно быстро за пять недель до этой статьи: Grok 4.5 вышел 8 июля, Meta Muse Spark 1.1 и OpenAI GPT-5.6 — оба 9 июля, Thinking Machines выпустила свою первую модель 15 июля, Moonshot Kimi K3 появился 16 июля, Alibaba представила Qwen3.8-Max 19 июля, а Anthropic выпустила Claude Opus 5 24 июля, за день до этого обновления.
Для нейтрального ориентира независимый оценщик Artificial Analysis оценивает общие возможности по своему Индексу интеллекта. По состоянию на снимок этой недели (v4.1) опубликованная верхняя часть таблицы выглядит так:
- Claude Fable 5 (Anthropic): 59.9
- GPT-5.6 Sol Max (OpenAI): 58.9
- Kimi K3 (Moonshot, открытые веса скоро): 57.1, четвёртое место в общем зачёте
- Далее Claude Opus 4.8, Grok 4.5, Muse Spark 1.1, GLM-5.2 и остальные
Два важных замечания. Claude Opus 5 на момент написания существует всего день и ещё не включён в индекс. И один составной индекс не может охватить долгосрочную агентскую работу, которая как раз и является тем, что делают циклы, поэтому, если лаборатория публиковала специфические результаты для агентов, я цитирую их в соответствующем разделе, помечая как самооценку, если это так.
Тем не менее, стоит обратить внимание на две вещи. Верх таблицы теперь представляет собой разброс менее чем в три пункта, то есть: для построения циклов выбор модели внутри этого диапазона имеет меньшее значение, чем цикл вокруг неё. И модель с открытыми весами впервые оказалась в этом диапазоне.
Claude: цикл как первоклассный примитив
Модели. Claude Fable 5, выпущенный 9 июня 2026 года, — самая capable модель Anthropic и та, которая наиболее явно создана для такого стиля работы. Собственная формулировка Anthropic: при запуске в обвязке, такой как Claude Code, она может "работать в течение нескольких дней подряд: планировать этапы, делегировать под-агентам и проверять свою собственную работу". Её мышление адаптивно и всегда включено, настраивается параметром усилий, с контекстным окном в один миллион токенов. Она по-прежнему возглавляет независимый индекс. Её собрат Mythos 5, выпущенный одновременно с ней, — специалист, которого Anthropic оценивает как самого сильного в задачах кибербезопасности.
Новость этой недели — Claude Opus 5, выпущенный 24 июля: Anthropic описывает его как приближающийся к пограничному интеллекту Fable 5 по половинной цене ($5 за миллион входных токенов и $25 за выходные), новый уровень качества в оценках работы со знаниями, таких как GDPval-AA согласно анонсу, и новая модель по умолчанию в плане Claude Max. Для создателей циклов посыл прямолинеен: почти пограничные циклы по половинной цене меняют то, что вы можете позволить себе выполнять весь день.
Стек циклов. Что делает Anthropic отличительным, так это то, что циклы — это не функция, погребённая в приложении. Это именованные примитивы, которые вы можете ввести:
- /goal определяет «готово» и позволяет модели-оценщику возвращать агента к работе, пока условие не будет выполнено или не достигнут лимит шагов. Это цикл на основе целей, буквально превращённый в продукт.
- /loop повторно запускает промпт через интервал на вашем компьютере; /schedule перемещает этот цикл в облако Anthropic как рутину, где он продолжает выполняться, даже когда ваш ноутбук закрыт, запускаемый по расписанию, API-вызовам или событиям GitHub.
- Динамические рабочие процессы обрабатывают экстремальный случай: Claude пишет фактический скрипт оркестровки, который может координировать до 1 000 под-агентов за один запуск. Флагманский анекдот — разработчик, портировавший среду выполнения Bun, примерно 750 000 строк, с Zig на Rust примерно за одиннадцать дней с помощью сотен параллельных агентов.
- Навыки, хуки и под-агенты заполняют вспомогательный состав: навыки кодируют, как проверять работу, второй агент с новым контекстом выполняет ревью кода, а память сохраняется в файлах между сессиями.
Философия. Рекомендации Anthropic необычно явно подчёркивают сдержанность: не каждая задача требует сложного цикла, начинайте с самого простого примитива, устанавливайте детерминированные критерии остановки, сначала пилотируйте небольшой фрагмент перед крупным запуском и следите за использованием с помощью встроенных команд. Их фраза, которую вся область постоянно переоткрывает: агенты, которые могут проверять и улучшать собственный вывод, принципиально более надёжны.
Резюме: лаборатория циклов для разработчиков. Самая понятная, самая компонуемая версия каждого типа цикла, и теперь с более дешёвым, почти пограничным движком для работы внутри.
OpenAI: три режима и отдельный утверждающий
Модели. Поколение OpenAI GPT-5.6 стало общедоступным 9 июля 2026 года в трёх уровнях: Sol (флагманский, $5 входа / $30 выхода за миллион токенов), Terra (сбалансированный средний) и Luna (быстрый и дешёвый), все с контекстным окном примерно в один миллион токенов. Sol занимает второе место в независимом индексе, фактически наравне с Fable 5. Его главная функция для циклов — ультра-режим, который по умолчанию координирует четырёх агентов параллельно для сложных задач.
Потребительский стек циклов. История OpenAI здесь — это перестройка. Автономный «агент ChatGPT» 2025 года был прекращён; вместо него в ChatGPT теперь есть три режима: Chat для разговоров, Work для длинных многошаговых задач, которые создают готовые результаты, и Codex для программного обеспечения. Work выполняет задачи в облаке, может приостанавливаться для контрольных точек утверждения и, что критически важно, может запускаться по триггерам: Запланированные задачи теперь включают задачи мониторинга, которые проверяют что-то через интервал и уведомляют вас только тогда, когда есть что сообщить. Это цикл на основе времени, продаваемый потребителям, без кода. Режим агента также существует в браузере Atlas для задач в вебе.
Стек циклов для разработчиков. Разделительная линия чётко указана в документах OpenAI: "Используйте Responses API, когда хотите владеть циклом. Используйте Agents SDK, когда хотите, чтобы SDK выполнял его." Responses API является агентным по умолчанию, позволяя модели вызывать веб-поиск, поиск файлов, использование компьютера, выполнение кода и ваши функции в рамках одного запроса. Два дополнения эпохи GPT-5.6 важны конкретно для циклов: Программный вызов инструментов, где модель пишет небольшую программу на JavaScript в песочнице для координации собственных вызовов инструментов, и мульти-агентная бета-версия, где корневой агент порождает и управляет деревом под-агентов.
Отличительная идея: разделить исполнителя и утверждающего. Самый интересный вклад OpenAI в циклы — это Авторевью (30 апреля 2026 года): когда агент Codex хочет сделать что-то за пределами своей песочницы, отдельная модель-рецензент, а не сам агент, решает, соответствует ли действие тому, о чём просил пользователь. Их аргументация прямолинейна: основной агент оптимизирован для завершения задачи, что создаёт давление, чтобы рассматривать границу утверждения как ещё одно препятствие. Хранение решения об утверждении в отдельном вызове модели делает его проверяемым. Результат, по данным OpenAI: сессии останавливаются, чтобы спросить человека, примерно в 200 раз реже, и рецензент одобряет примерно 99 процентов того, что всё ещё доходит до эскалации. Эти цифры заявлены самой компанией, но принцип проектирования универсален: никогда не позволяйте модели, которая хочет завершить, также быть моделью, которая решает, что она завершена.
Резюме: потребительский вход в циклы, плюс серьёзный стек для разработчиков. И напоминание о смертности для создателей платформ: OpenAI прекратила поддержку своего визуального Agent Builder менее чем через год после запуска, с жёстким отключением 30 ноября 2026 года.
Google: исследовательские циклы, которые вы арендуете за задачу
Модель. Текущий флагман Google — Gemini 3.1 Pro (апрель 2026 года), но интересная часть для этой истории — не чат-модель. Дело в том, что Google превратила целый цикл в продукт.
Стек циклов. Агенты Deep Research, запущенные 21 апреля 2026 года в двух вариантах (стандартный, для скорости, и Max, для исчерпывающего анализа), — это исследовательские циклы на основе целей, которые вы вызываете одним API-запросом. Документация описывает цикл прямо: план, поиск, чтение, итерация, вывод, выполняющийся от минут до часа в фоне, с цитатами в итоговом отчёте. Детали реализации — это небольшой мастер-класс по инженерии циклов:
- Фоновое выполнение обязательно. Исследовательский цикл переживает тайм-аут HTTP, поэтому вы опрашиваете результат. Цикл, а не запрос, является единицей работы.
- Совместное планирование — это человеческий шлюз на старте: агент предлагает свой план исследования, вы редактируете или утверждаете его, затем он выполняется. Управление до цикла вместо присмотра во время него.
- Встроено жёсткое условие остановки: максимальное время исследования 60 минут, большинство задач завершаются примерно за 20.
- Инструменты ограничены областью каждого запуска: Google Search, чтение URL, выполнение кода по умолчанию, ваши собственные MCP-серверы и файловые хранилища опционально, и вы можете полностью отключить открытый веб, чтобы исследовать только ваши приватные данные.
- Стоимость указана за цикл, честно. Собственные оценки Google: типичная стандартная задача сжигает около 80 поисков и примерно четверть миллиона входных токенов, что составляет от одного до трёх долларов; запуск Max может достичь 160 поисков и около $3–7. Цикл — это не сообщение в чате, и Google выставляет счёт соответственно.
Резюме: самое ясное коммерческое доказательство того, что цикл, а не вызов модели, становится продуктом. Вы покупаете не токены; вы покупаете готовое исследование.
Одно честное предостережение: на момент написания агенты Deep Research находятся в предварительном доступе через Interactions API, поэтому ожидайте, что интерфейс может измениться.
Muse Spark 1.1: новичок, обученный оркестровке
Модель. Muse Spark 1.1 — это мультимодальная модель рассуждений Meta Superintelligence Labs, выпущенная 9 июля 2026 года как обновление Muse Spark 1.0 от апреля, и это один из самых значимых новичков в этом обзоре по трём причинам.
Во-первых, стратегия: это первый в истории Meta платный API модели, по цене $1,25 за миллион входных токенов и $4,25 за выходные, и он с закрытыми весами — полный разрыв с эпохой открытого Llama. Сторонники линейки Llama, по сути, уступают волне моделей с открытыми весами, описанной ниже; Meta заявила только, что надеется открыть будущие версии Muse.
Во-вторых, цель обучения. Там, где большинство моделей осваивают агентское поведение как побочный продукт, Meta говорит, что эта модель была обучена непосредственно для организационной структуры: "Как главный агент, она может собирать контекст, составлять план и делегировать выполнение параллельным под-агентам. Как под-агент, она придерживается своей задачи, понимает доступные инструменты и знает, когда нужно вернуться к главному агенту." Она с нуля осваивает новые инструменты, MCP-серверы и пользовательские навыки, активно управляет своим контекстом в один миллион токенов (запоминая, извлекая и уплотняя по мере работы) и обрабатывает рабочие процессы с использованием компьютера в нескольких приложениях.
В-третьих, позиция по соотношению цена-производительность. В независимом индексе она поднялась на восемь пунктов от версии 1.0 за три месяца, что ставит её ниже пограничного трио, но при доле их стоимости за задачу, и в настоящее время она лидирует в бенчмарке использования инструментов MCP Atlas с результатом 88,1 (цифры, близкие к поставщику; относитесь с обычной осторожностью).
Примечание для создателей циклов, которое показывает, куда всё это идёт. Собственная документация Meta для разработчиков предупреждает, что если вы строите многошагового агента на старом API Chat Completions, рассуждения модели отбрасываются между шагами, поэтому циклы дрейфуют и повторяют работу; они направляют вас к API в стиле Responses, который переносит зашифрованные рассуждения между шагами. Инфраструктура индустрии перестраивается вокруг циклов, один устаревший API за раз.
Резюме: движок, который вы арендуете для циклов с интенсивной оркестровкой, когда пограничное трио избыточно по стоимости. Ещё молодой; наклон от 1.0 к 1.1 — причина обратить внимание.
Grok 4.5: дешёвые, быстрые циклы, обученный на работе
Модель. Grok 4.5 вышел 8 июля 2026 года от xAI Маска (ныне работающей под публично торгуемым зонтиком SpaceXAI), позиционируясь как самая умная модель для кодинга, агентских задач и работы со знаниями. Собственное позиционирование Маска было необычно прямым: модель класса Opus, примерно сопоставимая с Claude Opus 4.7, но быстрее и дешевле. Независимые оценки соответствуют ощущениям: выше предыдущего поколения Opus, ниже пограничного трио.
Почему это важно именно для циклов. Два утверждения, оба от xAI и оба релевантны для циклов, даже со скидкой на маркетинг:
- Она была обучена на циклах. xAI заявляет, что обучение с подкреплением охватило сотни тысяч многошаговых инженерных задач с автоматической оценкой, на инфраструктуре, где агентные запуски длятся часами, пока обучение продолжается. Что бы ни показывали бенчмарки, диета обучения была самой работой.
- Экономика циклов — это основное предложение. При цене $2 входа / $6 выхода за миллион токенов, примерно 80 токенов в секунду и заявленной двукратной эффективности токенов (решение задач менее чем за половину шагов сопоставимых моделей), аргумент не в том, что это «самый умный цикл», а в том, что это «больше всего циклов за доллар». Для циклов, где стоимость равна стоимости цикла, умноженной на количество циклов, эта арифметика — вся игра. Документация подкрепляет это неприглядной сантехникой циклов: кэширование промптов с фиксацией в разговоре, чтобы длинные циклы не платили за холодный кэш, и рекомендации по уплотнению контекста для запусков с интенсивным использованием инструментов.
Продуктовый цикл живёт в Grok Build, его агенте для кодинга (обученном совместно с Cursor, где он доступен во всех планах), который распространяется на необычно практичные области: многостраничные модели Excel с веб-исследованиями, нативные диаграммы PowerPoint, документы Word.
Резюме: бюджетная рабочая лошадка для высокообъёмных циклов, с обычной оговоркой, что большинство показателей эффективности исходят от самого поставщика.
Mira: циклы для людей, которые никогда не откроют терминал
Вот запись, которая выглядит как ошибка в списке пограничных моделей, но на самом деле является одной из самых поучительных.
Что такое Mira на самом деле. Mira — это не модель. Это потребительский ИИ-агент, который живёт полностью внутри Telegram, созданный стартапом настолько маленьким, что он округляется до двух человек, возглавляемый Дарьей Яковлевой и инкубированный в The Open Platform, компании-разработчике программного обеспечения экосистемы Telegram. Он запустился тихо в феврале 2026 года и сообщил о превышении одного миллиона ежемесячных пользователей к началу июня (самооценка, примерно 1,17 миллиона). Под капотом он не зависит от модели: он направляет каждую задачу на сторонние модели (GPT, Claude и другие), а не использует свою собственную.
Почему он в этой статье. Потому что продукт Mira — это циклы, и только циклы, продаваемые людям, которые никогда не услышат этого слова. Её упакованные автоматизации, называемые Навыками, каждая из которых объединяет точную анатомию из Части 1: триггер (расписание, голосовая заметка, событие в групповом чате), действие в подключённых приложениях (календарь, электронная почта, трекеры проектов, инструменты для контента) и автономная доставка обратно в чат. Следи за ценой на авиабилеты и оповести меня. Преврати мою голосовую заметку в посты для трёх платформ. Подведи итог того, что эта группа решила сегодня, и зафиксируй задачи. Фраза позиционирования в её собственных материалах — это самое чистое резюме всей эпохи циклов: ChatGPT отвечает, Mira действует.
Честные предостережения. Количество пользователей и количество подключений (которые её материалы варьируют от 200 до более чем 1 000 сервисов) являются самооценкой и не согласованы между страницами, компания не публикует никаких инженерных рекомендаций о том, как её циклы что-либо проверяют, и называть «Навыки» циклами — это внешняя интерпретация, а не собственная лексика Mira. Маленькая команда, оборачивающая модели других лабораторий, также является хрупкой основой по сравнению со всем остальным в этом списке.
Резюме: сигнал спроса. Когда Telegram-бот из двух человек достигает миллиона пользователей, упаковывая триггеры, действия и автономную доставку для обычных людей, цикл перестаёт быть концепцией разработчика. Распространение и отсутствие настройки побеждают возможности для огромного сегмента реальной работы.
Волна с открытыми весами: принесите свой собственный цикл
Самая громкая история середины 2026 года заключается в том, что мир открытых весов перестал отставать на годы и начал отставать на месяцы, а за последние две недели — на пункты. Для создателей циклов это полностью меняет расчёты, потому что открытая модель — это единственный движок циклов, который никто не может лишить вас поддержки.
Краткий обзор, даты и лицензии проверены:
- Kimi K3 от Moonshot теперь в центре внимания. Запущенная 16 июля 2026 года с 2,8 триллионами параметров, она стала первой моделью открытого трека, пробившей пограничную зону независимого индекса: 57,1 балла по версии Artificial Analysis (v4.1), четвёртое место в общем зачёте, уступая только Fable 5, GPT-5.6 Sol Max среди опубликованных результатов. Она также заняла первое место в слепой оценке Frontend Code Arena на Arena.ai, опередив Fable 5. Полные веса планируется опубликовать на HuggingFace 27 июля 2026 года под модифицированной лицензией MIT, что сделает её первой загружаемой моделью в своём классе; по состоянию на 24 июля веса ещё не были выпущены, поэтому считайте это заявленным сроком, а не свершившимся фактом. Флагманская демонстрация Moonshot — это чистый театр цикла: 48 часов непрерывной автономной работы по проектированию небольшого функционального чипа, выполняемая одним агентом на контексте в миллион токенов. Ещё одна важная цифра из того же независимого оценивания: измеренный уровень галлюцинаций K3 вырос примерно до 51% на задачах, чувствительных к фактам, по сравнению с 39% у предшественника, даже при улучшении фактической точности. Лучше в правильных ответах, хуже в осознании своей неправоты. Запомните это для Части 3.
- Qwen3.8-Max от Alibaba, анонсированная 19 июля 2026 года на Всемирной конференции по ИИ: заявленная мультимодальная модель с 2,4 триллионами параметров, первая модель команды Qwen выше триллиона параметров, с самоописанием «уступает только Fable 5» и обещанием скорого выпуска открытых весов. Превью доступно; таблица бенчмарков, карточка модели, лицензия и веса пока отсутствуют, так что пока считайте каждое заявление предварительным, пока не появятся подтверждения.
- DeepSeek V4 (24 апреля 2026, лицензия MIT) была, по выражению OpenRouter, первой моделью с открытыми весами, которую команды начали использовать в реальных агентских пайплайнах как правдоподобную замену фронтирным моделям. Вариант Pro лидирует в таблицах кодинговых агентов с открытыми весами на SWE-bench Verified с результатом 80,6%; вариант Flash сохраняет почти всё это при ценах, округляемых до центов.
- GLM-5.2 от Z.ai (середина июня 2026, MIT, 753B смесь экспертов) был лидером по качеству среди открытых весов до появления K3, описанный OpenRouter как наиболее близкая открытая замена для планирования в стиле Opus и долгосрочного кодинга. Известный недостаток: он дорого думает, сжигая выходные токены.
- MiniMax M3 (1 июня 2026, модифицированная MIT) — это открытый мультимодальный трек: нативное понимание изображений и видео на контексте в миллион токенов, что важно, как только вашему циклу нужно читать скриншоты или проверять состояния интерфейса.
- NVIDIA Nemotron 3 Ultra — самый сильный участник с открытыми весами, созданный в США, отличающийся развёртыванием и стеком NVIDIA, а не пиковыми показателями.
- Также на доске: Thinking Machines Lab, компания Миры Мурати, выпустила свою первую модель Inkling 15 июля 2026 года: мультимодальная смесь экспертов с открытыми весами на 975 миллиардов параметров под лицензией Apache 2.0. Ещё одна лаборатория первого уровня, делающая ставку на то, что открытые веса — это ключевой инструмент.
Воспринимайте это так: если ваш цикл высокообъёмный, чувствительный к конфиденциальности или должен пережить дорожные карты вендоров, открытая волна больше не является компромиссным вариантом. Разрыв с закрытым фронтиром теперь измеряется единичными пунктами и не расширяется.
Часть 3: Что действительно работает
Вот что поражает после недель изучения документации семи вендоров: уберите брендинг, и все они дают одни и те же советы. Когда ожесточённые конкуренты сходятся в одинаковых рекомендациях, это максимально близко к истине в этой области. Семь правил, каждое из которых подтверждено несколькими лабораториями.
1. Определите «готово» до начала. /goal от Anthropic существует, чтобы оценщик мог проверить явное условие; руководство OpenAI требует условий выхода на каждом запуске; Google ограничивает исследования 60 минутами. Цикл без чёткого условия остановки — это не автоматизация, это подписка на сжигание токенов. Детерминированность лучше ощущений: тесты пройдены, число совпало, контрольный список выполнен, максимум N попыток.
2. Верификатор — это продукт. Потолок качества цикла — это его шаг проверки, а не модель. Anthropic рекомендует кодировать проверку как навыки и направлять второго агента с новым контекстом на рецензирование. OpenAI пошла дальше и сделала утверждающего структурно отдельной моделью от исполнителя, с явной причиной: исполнитель хочет закончить. Google обосновывает отчёты цитируемыми источниками, по которым можно кликнуть. И на этой неделе появилось лучшее доказательство правила: самая впечатляющая открытая модель на доске стала заметно лучше в правильных ответах, но хуже в осознании своей неправоты. В чате это примечание. В непроверенном цикле это фабрика уверенных ошибок. Если вы инвестируете час куда-либо, вложите его в то, что означает «проверено» для вашей задачи.
3. Никогда не позволяйте исполнителю оценивать себя в чём-то важном. Тот же принцип с другой стороны, потому что это единственный урок, за который вся индустрия заплатила: модель, выполняющая задачу, воспринимает каждый шлюз как препятствие. Отдельная модель-верификатор, отдельный агент-рецензент или человек на необратимом шаге.
4. Управляйте контекстом как дефицитным ресурсом, которым он и является. Руководство Anthropic по инженерии контекста (минимальный набор высокоинформативных токенов, файлы заметок, под-агенты, возвращающие сводки), активное сжатие Meta, руководство по сжатию Grok, контраргумент Kimi с большим контекстом: все отвечают на один и тот же вопрос — как длинный цикл остаётся связным. Консенсусный ответ: память вне окна плюс поиск по запросу, а не запихивание.
5. Повышайте тип цикла только тогда, когда предыдущая ступень не справляется. Anthropic рекомендует начинать с простейшего примитива. OpenAI советует максимизировать одного агента, прежде чем переходить к мультиагентности. Google требует утверждения плана перед часовым запуском. Лестница из Части 1 — это также дисциплина: передавайте проверку, затем условие остановки, затем триггер, затем подсказку, в таком порядке, по одной ступени за раз.
6. Оценивайте стоимость цикла, а не сообщения. Стоимость цикла — это стоимость одного цикла, умноженная на количество циклов. Именно поэтому Google оценивает исследование за задачу (от $1 до $7), Grok лидирует по эффективности токенов, Anthropic только что вдвое снизила цену циклов, близких к фронтиру, с Opus 5, и каждый серьёзный стек поставляет инструменты для проверки использования. Решите, сколько может стоить один запуск, прежде чем начинать.
7. Держите человека на шлюзах, которые нельзя отменить. Уход денег, отправка писем, удаление данных, слияние кода в продакшн. Контрольные точки утверждения в Work mode, совместное планирование, режимы разрешений, эскалации в Auto-review: каждый вендор, без исключения, оставил человеческий шлюз на необратимом шаге. Вендоры с наиболее способными циклами также наиболее настойчивы в этом. Это должно о чём-то говорить.
Часть 4: Что вам никто не рассказывает
Рекламные посты заканчиваются здесь. Опыт эксплуатации — нет.
Циклы умножают всё, включая ошибки. Одно неверное предположение в чате — это плохой ответ. То же неверное предположение в цикле — это пятьдесят последовательных, уверенных, ошибочных артефактов к утру. Вот почему проверка — правило номер один, и почему автоматические циклы должны начинаться в режиме только для чтения, пока не заслужат права на запись.
Счёт тихо накапливается. В руководстве каждого вендора есть раздел по управлению токенами не просто так. Модели, требующие много размышлений, могут сжигать доллары на выходных токенах на одном сложном шаге; рутина, выполняющаяся ежечасно, когда базовое вещество меняется раз в день, платит 24-кратную цену за ничего. Сопоставляйте интервал со скоростью изменений, ограничивайте количество шагов и проверяйте счётчик.
Инъекции подсказок становятся хуже в цикле. Как только ваш цикл читает открытый веб, почтовые ящики или загруженные пользователем файлы, предполагайте, что кто-то в конечном итоге внедрит инструкции в этот контент. Чат-ассистент, которого обманули, смущает вас один раз; обманутый цикл с доступом к инструментам действует по ним, многократно, пока вы спите. Собственные документы безопасности OpenAI говорят о неудобном: даже с мерами защиты агенты не будут идеальны и их всё ещё можно обмануть. Относитесь ко всему, что цикл впитывает, как к данным, никогда как к приказам, и ограничивайте его разрешения так, как будто это серьёзно.
Разрыв между демо и продакшном реален. 48-часовая автономная разработка чипа — это великолепное демо, но также и контролируемое. Самоотчётные коэффициенты эффективности, частные бенчмарки, предварительные количества параметров, объявленные без карточек моделей: полезные сигналы, но ни один из них не заменяет запуск цикла на ваших собственных задачах с вашим собственным верификатором. Каждая лаборатория тихо соглашается, поэтому все они говорят вам создавать оценки.
Платформы меняются под вашими ногами. За двенадцать месяцев до этой статьи: OpenAI прекратила выпуск своего отдельного продукта-агента, убрала Pulse и запланировала закрытие визуального Agent Builder (30 ноября 2026 года); новая Opus перетасовала линейку планов Claude за ночь; API были перестроены вокруг дизайна, удобного для циклов; а июньская директива по экспортному контролю даже временно отключила фронтирные модели Claude для многих пользователей. Стройте свои циклы так, чтобы логика (цель, верификатор, заметки) жила в ваших файлах, а не в интерфейсе вендора, и чтобы движок оставался заменяемым.
Ров — это не модель. Фронтир теперь представляет собой разброс менее трёх пунктов, который еженедельно перетасовывается, и открытая модель только что присоединилась к нему. То, что накапливается, — ваше: набор оценок, построенный на ваших ошибках, верификатор, кодирующий ваши стандарты, заметки, которые накопили ваши циклы. Смена модели — это изменение конфигурации. Перестройка года логики проверки — нет.
Какой стек циклов ваш?
Честное сопоставление, учитывая всё вышесказанное:
- Вы живёте в терминале и хотите максимального контроля: Claude Code, с Fable 5 для самых сложных запусков и Opus 5 как новый стандарт для соотношения цена/качество. Самые понятные примитивы (/goal, /schedule, динамические рабочие процессы) и самая хорошо документированная философия.
- Вы хотите циклы внутри продукта, который все уже используют: Work mode ChatGPT плюс Scheduled Tasks (мониторинговые задачи преступно недооценены), или Codex с Auto-review для кода.
- Ваш цикл — «тщательно исследуй X и дай мне отчёт с цитатами»: арендуйте Deep Research или Deep Research Max от Google за задачу и пропустите создание чего-либо.
- Вы оркестрируете множество под-агентов и следите за расходами: Muse Spark 1.1 или Grok 4.5 в качестве движка; оба оценены и созданы именно для этого, на один шаг ниже фронтирной тройки.
- Вы хотите автоматизацию в кармане без настройки: потребительские агенты в стиле Mira внутри уже используемого вами чат-приложения.
- Вам нужен объём, конфиденциальность или долговечность: открытая волна. DeepSeek V4 Flash для стоимости, GLM-5.2 для качества планирования, MiniMax M3 для мультимодальности и Kimi K3, если вы хотите возможности уровня фронтира, которые можно (с 27 июля, если веса выйдут по расписанию) реально скачать. Просто принесите настоящий верификатор; собственные цифры K3 говорят в его пользу.
Ваш первый цикл на этой неделе
Один честный рецепт, не зависящий от вендора:
- Выберите задачу, которую вы уже повторяете вручную, где вы являетесь узким местом.
- Сначала напишите условие остановки. Если вы не можете написать «готово означает X», задача ещё не готова к циклу.
- Напишите проверку. Скрипт, тест, рубрика для второй модели. Это тот час, который имеет значение.
- Запустите его несколько раз в пошаговом режиме, наблюдая за каждым циклом.
- Передайте условие остановки (целевой цикл с ограничением по шагам). Смотрите, где он застревает или выходит за рамки; ужесточите критерии.
- Только затем передайте триггер (запланируйте его), с ограничением бюджета и правами только для чтения для начала.
- Когда он потерпит неудачу, а это произойдёт, превратите неудачу в тестовый пример. Это часть самоулучшения, и это вы и цикл вместе.
Поднимайтесь по одной ступени за раз. Люди, получающие выдающиеся результаты от этих систем, не нашли секретную модель. Они нашли задачу, достойную цикла, определили «готово» и построили проверку, которой доверяют.
И последнее
Эпоха подсказок научила всех задавать лучшие вопросы. Эпоха циклов требует от вас другого: точно определять результаты, чтобы машина могла их достигать, пока вы заняты другим, и проектировать проверки, которые обеспечивают честность этого стремления.
Это реальный навык, и это не написание подсказок. Это ближе к управлению. Цель, стандарт готовности, правильные инструменты, бюджет, проверка, которой вы доверяете, и путь эскалации для суждений. Каждая лаборатория в этой статье, от компании стоимостью в три триллиона долларов до двухчеловеческого стартапа в Telegram, сходится к механизмам, которые вознаграждают именно этот навык.
Медленный путь всё ещё работает, если печатать, ждать, исправлять и переспрашивать — это те отношения, которые вы хотите иметь с этой технологией. Но ручная рукоятка теперь необязательна, и лаборатории коллективно решили, в каком направлении это движется. Единица работы — это цикл. Человек, который определяет цикл, — это вы.
Начните с одного. Определите «готово». Доверяйте, но проверяйте. Затем отпустите рукоятку.
Источники
Всё вышеперечисленное было проверено по первоисточникам за неделю, закончившуюся 25 июля 2026 года. Сгруппировано по лабораториям:
Концепция цикла
- Anthropic, Getting started with loops: claude.com/blog/getting-started-with-loops
- OpenAI, A practical guide to building agents: openai.com/business/guides-and-resources/a-practical-guide-to-building-ai-agents
- Anthropic, Building effective agents: anthropic.com/engineering/building-effective-agents и Effective context engineering: anthropic.com/engineering/effective-context-engineering-for-ai-agents
Anthropic
- Claude Fable 5: anthropic.com/claude/fable и пост о запуске: anthropic.com/news/claude-fable-5-mythos-5
- Claude Opus 5 (24 июля 2026): anthropic.com/news/claude-opus-5
- Routines: code.claude.com/docs/en/routines · Dynamic workflows: code.claude.com/docs/en/workflows
OpenAI
- GPT-5.6: openai.com/index/gpt-5-6 · Work и Codex: help.openai.com/en/articles/20001275 · ChatGPT agent discontinued: help.openai.com/en/articles/11752874 · Agents guide: developers.openai.com/api/docs/guides/agents· Auto-review: alignment.openai.com/auto-review
- Deep Research Max announcement: blog.google · Deep Research docs: ai.google.dev/gemini-api/docs/deep-research
Meta
- Muse Spark 1.1 announcement: ai.meta.com/blog/introducing-muse-spark-meta-model-api · Coding agents guide: dev.meta.ai/docs/guides/coding-agents
xAI
- Grok 4.5: x.ai/news/grok-4-5 · Docs: docs.x.ai/developers/grok-4-5
Mira
- Product site: mira.tg · Milestone post: mira.tg/blog/mira-1-million-monthly-users
Open-weight wave
- Kimi K3 independent evaluation and weights timeline: TechTimes, 24 июля 2026 · launch: VentureBeat, 16 июля 2026
- Qwen3.8-Max preview: MarkTechPost, 19 июля 2026
- OpenRouter, The Open Weight Models that Matter, June 2026: openrouter.ai/blog
- Thinking Machines Inkling: TechCrunch, 15 июля 2026
- Independent scores: Artificial Analysis Intelligence Index v4.1, as reported July 24, 2026





