Grok 4.6 вышел! Я пользовался им несколько недель как основным инструментом в обычной смеси программирования и работы со знаниями и собрал несколько проектов специально, чтобы проверить, где он справляется.
Он хорош во всём этом. Больше всего выделяется то, как он общается и насколько он быстр, — больше, чем любой отдельный скачок возможностей.
https://x.com/SpaceXAI/status/2087562800982077492
Информационно насыщенное общение
Он умеет работать совместно так, что с ним легко находиться рядом. Сводки насыщены реальной информацией, а не пересказывают мне задачу, а короткие обновления во время работы дают мне достаточно данных, чтобы понять, стоит ли вмешиваться.
Он молчит при небольших изменениях и начинает комментировать, когда задевает много файлов. Настроить этот баланс оказалось сложнее, чем можно подумать. Он всё ещё иногда говорит мне ненужные вещи, и мы над этим работаем.
Восхитительная скорость
4.5 тоже был быстрым. 4.6 быстрый и заметно умнее, и это сочетание подтолкнуло меня к более синхронному стилю работы. Вместо того чтобы заранее загружать кучу контекста и ждать, я прошу о чём-то небольшом, смотрю на результат и продолжаю. Та же сессия может перейти к более долгосрочной задаче, просто если попросить об этом.
Я переключаюсь между синхронным и асинхронным режимом в зависимости от того, что в этом месяце лучше удаётся лучшим моделям. Асинхронно успевается больше, пока я занят чем-то другим, но я теряю нить и в итоге просматриваю большой дифф на холодную. 4.6 возвращает меня к синхронной работе, а именно там я предпочитаю находиться, когда мне важен результат.
А ещё я собрал для обоих промо-ролик с помощью Remotion! Большую часть этих недель я занимался обычной работой. Он навигировал по сайтам за меня, включая создание API-ключей через клики в консоли провайдера. Он проводил функциональное и визуальное тестирование запущенных приложений. Он сократил мой инбокс до нескольких веток, которые действительно требовали ответа, — это никогда не перестаёт радовать. Он помог мне подготовить черновики анонсов для Cursor SDK Bridge и /rename-chat.
Короткие промпты и строгая проверка
Часть этих недель я потратил на сравнение стилей промптов. Длинных против коротких, а также на проверку, влияют ли конкретные формулировки вроде «работай очень усердно» на результат. Я выяснил, что формулировка почти не имела значения.
Длина влияла, но не так, как я предполагал. Длинный промпт обеспечивает конкретность, поэтому если вы точно знаете, чего хотите, — запишите это. Короткий промпт передаёт больше решений на усмотрение модели. Раньше этот компромисс склонял к тому, чтобы расписывать всё подробно. С 4.6 вкус достаточно хорош, чтобы короткий промпт плюс чёткое предпочтение обычно давали хороший результат.
С захватом сессии, серверным обработчиком и облачной диспетчеризацией агентов он прошёл весь путь до конца с разумной структурой. Он повторяется в компонентах, если не попросить его разбить их. Длинные спецификации по-прежнему отлично работают, когда они есть. Я дал ему подробное ТЗ для виджета обратной связи.
Один из проектов, которые я создал, — приложение для работы с таблицами. Я дал его обеим моделям дважды. В одном запуске они получили двухстраничное ТЗ, охватывающее каждый элемент панели инструментов, каждое сочетание клавиш и каждую формулу, которые я мог придумать. В другом — три предложения.
1Создай аккуратное приложение в стиле Sheets/Excel на Next.js и AI-чат, который может анализировать таблицу. Используй Cursor SDK для всех AI-функций. Предзагрузи реалистичный пример рабочей книги, чтобы сразу выглядело хорошо.
Оба приложения получились почти идентичными. Что действительно изменило результат — добавление одного предложения:
1Проверяй функциональность и дизайн после реализации и продолжай итерировать и проверять, пока не будет готово к продакшену.
Эта одна строка оказалась самым эффективным приёмом за те недели! С ней модель открывает приложение, проходит реальные пользовательские сценарии, проверяет, что вложенные формулы вычисляются правильно, и исправляет то, что находит. Всё это не работает без уверенного использования браузера, и именно это делает цикл вообще возможным.
Тот же принцип действует, когда результат сложнее проверить. «Улучши текстуры» в 3D-сцене ни к чему меня не привели, тогда как «захвати текущий кадр, перечисли, что с ним не так, и исправь только эти вещи» сработало сразу.
Все дальнейшие сравнения прогоняли один и тот же промпт через обе модели в изолированных рабочих средах, так что это не моя память о прошлом месяце.

Вам также не нужно говорить ему работать усерднее или продолжать, пока не закончит. Он будет продолжать сам довольно долго. Гораздо важнее определить, что значит «готово», иначе он решает это за вас.
Идём дальше
В детстве я играл в Age of Empires 2 непозволительно много. Тысячи часов. Поэтому воссоздать её было первым проектом, который я захотел попробовать. Я попросил браузерную стратегию с экономикой, строительством, боем, туманом войны, целями и HUD, который новый игрок поймёт без инструкций.

4.5 собрал рабочий плоский прототип. 4.6 с первой попытки выдал изометрический 3D-мир с уже готовыми HUD и мини-картой. Гораздо ближе к настоящей игре!
Продолжая ностальгическую тему, я взялся за MSN Messenger.

Обе модели явно знали, о чём речь, и справились хорошо. 4.6 просто более отполирован, вплоть до отдельных окон переписки и подмигиваний.
Я постоянно пользуюсь Excalidraw, и у него открытый исходный код, поэтому он стал очевидным местом, чтобы проверить, как модели работают с реальной кодовой базой, а не с пустой папкой. Я попросил обе сделать режим презентации: сохранять именованные виды, менять их порядок и показывать как интерактивную экскурсию. Промпт был намеренно расплывчатым насчёт того, как это реализовать.

Обе приходят примерно к одному результату, что впечатляет для такого расплывчатого промпта! Просто 4.6 на первом проходе уделяет больше внимания деталям, а на практике это означает меньше раундов, где я указываю на недочёты.
Именно здесь пропуск проверки аукается. В одном из предыдущих запусков сводка выглядела как готовый результат, но добавление вида на самом деле не работало. Один раунд «запусти и покажи» выявил сломанный импорт.
Повседневная работа
Я не собираю презентации и отчёты каждый день, но многие люди занимаются этим, и я хотел посмотреть, как модель справляется с такой работой. Я дал обеим моделям один и тот же вымышленный квартальный отчёт и попросил сделать презентацию для совета директоров.

Обе компетентны, и разница в подаче, а не в анализе. 4.5 в основном раскладывает цифры по слайдам, тогда как 4.6 вкладывает реальные усилия в структуру и иерархию, так что это читается как презентация, которую сделал человек, а не как выгрузка данных.
Видео как код
Эта тема заслуживает большего внимания, потому что в последнее время я провожу с ней много времени. Remotion — это видео как код: каждый кадр — React-компонент, который рендерится в зависимости от текущего номера кадра, и всё это компилируется в MP4 через headless Chromium и FFmpeg. Ваше видео живёт в git. Это действительно увлекательный способ работы! Но передавать это модели странно, потому что нельзя понять, получилось ли, проверив, что код запускается. Я попросил сделать рекламный ролик на 60–90 секунд для X TypeScript SDK и дал модели документацию как основу для работы.

Я оцениваю такие ролики по наличию сюжетной линии и по тому, держится ли темп. Большинство моделей здесь терпят неудачу одинаково: заголовки в верхнем регистре, текст в рамках и всё появляется на экране одновременно. Оба ролика избегают большей части этого, и 4.6 смотреть интереснее.
После нескольких дней прогонов на разных моделях я вижу самый большой разброс именно в видео. Две модели, которые кажутся одинаково способными в веб-приложении, здесь могут оказаться совершенно несопоставимыми.
Где нужна корректировка
Почти всё, что мне приходилось направлять, сводилось к одному: насколько легко модель может проверять собственную работу.
Сайт — это простой случай. DOM — это текст, поэтому модель может прочитать страницу, сделать скриншот и сравнить с тем, что задумывала. Именно поэтому цикл проверки так хорошо работает в интерфейсных задачах.
3D сложнее, потому что есть целое измерение, которое нельзя проверить чтением. Видео ещё сложнее, потому что дополнительное измерение — это время, и проверка работы означает захват последовательности кадров и анализ разницы между ними. У физики та же структура проблемы. Модель хорошо понимает, как должен вести себя мир, но подтвердить, что он вёл себя именно так, нельзя одним скриншотом.
Практический ответ — дать ему способ смотреть, или принять, что проверяющим будете вы.
Почему он у меня по умолчанию
В «заточенных» моделях есть реальная ценность — в тех, которые исключительны в какой-то одной конкретной вещи. Но большая часть моей работы не представляет собой что-то одно. Каждый день мне нужна модель, которую я хорошо знаю: та, о поведении которой у меня есть интуиция, которой достаточно надёжно можно поручить задачу и недочёты которой я понимаю достаточно хорошо, чтобы обходить их не задумываясь.
Именно таким для меня и стал 4.6. В кодинге он справляется с интерактивной и визуальной работой, где я реагирую по ходу, а также с длинными сессиями в реальном репозитории. В работе со знаниями — это инбокс, тестирование в браузере и задачи на клики, за которыми нет API. Он не лучшая из мыслимых моделей в чём-то одном, но он хорош во всём этом, и я знаю, чего ожидать.
Я по-прежнему остаюсь вовлечённым там, где результат оценивают по внешнему виду. Движение, 3D и финальная полировка требуют референса и цикла скриншотов, а не описания. И я записываю критерии приёмки, а не доверяю сводке, которая говорит, что всё готово.
Попробуйте
Grok 4.6 уже доступен в Cursor, SpaceXAI API на OpenRouter и везде, где вы получаете свои токены!
Попробуйте и дайте мне знать, что вы думаете. Мы продолжим его улучшать, поэтому оставляйте обратную связь — и хорошую, и плохую, ведь именно она говорит нам, что улучшать дальше.
Буду рад узнать, что вы в итоге создадите с его помощью!





