Grok 4.6 – польовий посібник

@ericzakariasson
АНГЛІЙСЬКА12 серп. 2026 р.
664K
3.0K
301
149
3.1K

Коротко

Ерік Закаріассон представляє вичерпний польовий посібник із Grok 4.6, демонструючи його переваги у швидкості та якості програмування, дизайні інтерфейсів і створенні відео, наголошуючи на ефективності ітеративних циклів перевірки.

Grok 4.6 вийшов! Я користуюся ним уже кілька тижнів як своїм щоденним робочим інструментом у звичному поєднанні кодингу та інтелектуальної роботи, а ще створив на ньому кілька проєктів, щоб спеціально перевірити, де він показує себе добре.

Він хороший у всьому цьому. Найбільше впадає в око те, як він спілкується і який він швидкий, — навіть більше, ніж будь-який окремий стрибок у можливостях.

https://x.com/SpaceXAI/status/2087562800982077492

Інформаційно щільне спілкування

Він працює колаборативно, тож із ним легко працювати пліч-о-пліч. Підсумки насичені реальною інформацією, а не переказують мені завдання, а короткі оновлення під час роботи дають достатньо, щоб зрозуміти, чи варто переривати.

Він мовчить під час дрібних змін і починає коментувати, коли зачіпає багато файлів. Підібрати правильний баланс виявилося складніше, ніж можна подумати. Він усе ще іноді каже мені непотрібні речі — над цим ми працюємо.

Чудова швидкість

4.5 теж був швидким. 4.6 швидкий і помітно розумніший, і саме це поєднання підштовхнуло мене до синхроннішого стилю роботи. Замість того щоб заздалегідь вкладати купу контексту і чекати, я прошу щось маленьке, дивлюся на нього і продовжую. Та сама сесія може перейти до завдання з довшим горизонтом — просто попросивши про це.

Я перемикаюся між синхронною та асинхронною роботою залежно від того, що найкращі моделі вміють найкраще цього місяця. Асинхронно встигає більше, поки я зайнятий іншим, але я втрачаю нитку і в підсумку переглядаю великий диф «на холодну». 4.6 повертає мене до синхронної роботи — а саме там я волію бути, коли мені важливий результат.

І створив для них обох промо-відео за допомогою Remotion! Більша частина тих тижнів була звичайною роботою. Він сам ходив по сайтах за мене, зокрема створював API-ключі, клацаючи в консолі провайдера. Проводив функціональний і візуальний QA на запущених застосунках. Скоротив мою поштову скриньку до жменьки гілок, які справді потребували відповіді, — і це щоразу відчувається чудово. Він допоміг мені підготувати анонси для Cursor SDK Bridge та /rename-chat.

Короткі промпти, сувора перевірка

Частину тих тижнів я витратив на те, щоб порівнювати стилі промптів між собою. Довгі проти коротких, а також чи змінюють результат конкретні формулювання на кшталт «work very hard». Я виявив, що саме формулювання практично не впливало на результат взагалі.

Довжина — так, але не так, як я припускав. Довгий промпт дає конкретику, тож якщо ти точно знаєш, чого хочеш, запиши це. Короткий промпт передає більше рішень на смак моделі. Раніше ця дилема схиляла до того, щоб розписувати все. З 4.6 смак настільки добрий, що короткий промпт плюс чітка перевага зазвичай приводять до хорошого результату.

Я дав йому детальну специфікацію для віджету зворотного зв'язку — із захопленням сесії, серверним обробником і диспетчеризацією хмарних агентів, — і він відстежив усе від початку до кінця зі здоровою структурою. Він повторюється в компонентах, якщо не попросити його розбити їх. Довгі специфікації все ще добре працюють, коли вони є.

Одним із проєктів, які я створив, був застосунок для роботи з електронними таблицями, і я дав його обом моделям двічі. В одному запуску була дв сторінкова специфікація, яка охоплювала кожен елемент панелі інструментів, кожне гаряче клавішне поєднання та формулу, які я міг придумати. В іншому — три речення.

text
1Створи полірований застосунок у стилі Sheets/Excel на Next.js та AI-чат, який може аналізувати таблицю. Використовуй Cursor SDK для всіх AI-функцій. Попередньо завантаж реалістичний зразок робочої книги, щоб усе одразу виглядало добре.

Обидва застосунки повернулися майже однаковими. Що насправді змінило результат — це одне додане речення:

text
1Перевір функціонал і дизайн після реалізації та продовжуй ітерувати й перевіряти, поки все не буде готове до продакшену.

Цей один рядок виявився найвпливовішою річчю з усіх, що я знайшов за ті тижні! З ним модель відкриває застосунок, проходить реальні шляхи користувача, перевіряє, чи правильно обчислюються вкладені формули, і виправляє те, що знаходить. Усе це не працює без надійної роботи в браузері, а саме вона робить такий цикл взагалі можливим.

Той самий принцип діє, коли результат складніше перевірити. «Покращ текстури» на 3D-сцені не дало жодного результату, а «захопи поточний кадр, перелічи, що з ним не так, і виправ лише ці речі» спрацювало одразу.

Усі порівняння від цього моменту виконували однаковий промпт на обох моделях в ізольованих робочих середовищах, тож тут немає жодної моєї пам'яті про минулий місяць.

eric zakariasson - inline image

Також не потрібно казати йому наполегливо працювати чи не зупинятися, доки не закінчить. Він сам продовжуватиме досить довго. Набагато важливіше сказати, що означає «готово», бо інакше він вирішить це за тебе.

Рухаємося далі

У дитинстві я неймовірно багато грав у Age of Empires 2. Тисячі годин. Тож відтворити її було першим проєктом, який я захотів спробувати. Я попросив браузерну стратегію з економікою, будівництвом, боями, туманом війни, цілями та HUD, який новий гравець зрозуміє без інструкцій.

eric zakariasson - inline image

4.5 створив робочий плоский прототип. 4.6 одразу видав ізометричний 3D-світ, із уже готовими HUD і мінімапою. Набагато ближче до оригіналу!

Далі, у тій самій ностальгічній мандрівці, я взявся за MSN Messenger.

eric zakariasson - inline image

Обидві моделі явно знали референс і добре впоралися. 4.6 просто має більше полірування — аж до окремих вікон розмов і «підморгувань».

Я постійно користуюся Excalidraw, і він із відкритим кодом, тож він був очевидним місцем, щоб перевірити, як моделі працюють із реальною кодовою базою, а не з порожньою текою. Я попросив обидві реалізувати режим презентації: зберігати іменовані види, змінювати їх порядок і показувати як керовану екскурсію. Промпт був навмисно розмитим щодо того, як це побудувати.

eric zakariasson - inline image

Обидві приходять приблизно до того самого результату, що вражає для такого розмитого промпту! 4.6 просто приділяє більше уваги деталям уже на першому проході, що на практиці означає менше раундів, коли я показую на недоліки.

Саме тут пропуск перевірки дає про себе знати. У попередньому запуску підсумок виглядав як готовий, але додавання виду насправді не працювало. Один раунд «запусти і покажи мені» виявив зламаний імпорт.

Щоденна робота

Я не збираю презентації та звіти щодня, але багато людей це роблять, тож я хотів побачити, як модель справляється з такою роботою. Тому я дав обом моделям однаковий вигаданий квартальний звіт і попросив презентацію для ради директорів.

eric zakariasson - inline image

Обидві компетентні, а різниця — у подачі, а не в аналізі. 4.5 переважно розкладає цифри по слайдах, тоді як 4.6 вкладає реальну роботу в структуру та ієрархію, тому результат читається як презентація, яку зробила людина, а не як злив даних.

Відео як код

Це відео як код: кожен кадр — це React-компонент, який рендериться на основі номера поточного кадру, і все це компілюється в MP4 через headless Chromium та FFmpeg. Твоє відео живе в git. Це справді веселий спосіб працювати! А ще це дивна річ, яку можна віддати моделі, бо не можна зрозуміти, чи вдалося, перевіривши, що воно запускається. Ця тема заслуговує більше простору, бо останнім часом я проводжу з нею багато часу. Remotion

Щоб було від чого відштовхуватися. Я попросив 60–90-секундний проморолик для X TypeScript SDK і передав йому документацію.

eric zakariasson - inline image

Я оцінюю їх за наявністю сюжетної лінії та тим, чи тримається темп. Більшість моделей провалюються тут однаково: із заголовками у верхньому регістрі, текстом у рамках та всім, що з'являється на екрані одночасно. Обидва ролики уникають більшої частини цих помилок, але 4.6 дивитися цікавіше.

Після кількох днів тестування цього на різних моделях, відео — це те, де я бачу найбільший розкид. Дві моделі, які здаються однаково сильними у вебзастосунку, тут можуть бути дуже далекі одна від одної.

Де його треба спрямовувати

Майже все, що мені доводилося спрямовувати, зводилося до одного: наскільки легко модель може перевірити власну роботу.

Вебсайт — це простий випадок. DOM — це текст, тому вона може прочитати сторінку, зробити скриншот і порівняти з тим, що задумувала. Саме тому цикл перевірки так добре працює в UI-задачах.

3D — складніше, бо є цілий вимір, який не можна перевірити читанням. Відео ще складніше, бо додатковий вимір — час, а перевірка роботи означає захоплення послідовності кадрів і аналіз різниці між ними. Фізика має таку саму форму проблеми. Модель добре відчуває, як має поводитися світ, але підтвердити, що він справді так поводився, — це не те, на що може відповісти один скриншот.

Практичне рішення — дати їй спосіб подивитися або змиритися з тим, що перевіряєш ти.

Чому це мій вибір за замовчуванням

Є справжня цінність у моделях із піковими здібностями — тих, що видатні в чомусь одному. Але більшість моєї роботи — не щось одне. Щодня я хочу модель, яку добре знаю: таку, де я вже маю інтуїцію щодо її поведінки, якій достатньо довіряю, щоб передати справу, і де я розумію недоліки достатньо добре, щоб обходити їх, не замислюючись.

Саме таким для мене став 4.6. У кодингу він справляється з інтерактивною та візуальною роботою, де я реагую на ходу, а також із довгими сесіями в реальному репозиторії. В інтелектуальній роботі це поштова скринька, браузерний QA і задачі з кліками, за якими не стоїть API. Він не є найкращою моделлю, яку можна уявити, у кожній із цих задач, але він хороший у всіх, і я знаю, чого очікувати.

Я досі лишаюся залученим там, де результат оцінюють за тим, як він виглядає. Рух, 3D і фінальне полірування потребують референсу та циклу зі скриншотів, а не опису. І я записую критерії приймання, а не довіряю підсумку, який каже, що все готово.

Спробуй

Grok 4.6 тепер доступний у Cursor, SpaceXAI API на OpenRouter і будь-де, де ти отримуєш токени!

Спробуй і дай мені знати, що думаєш. Ми й надалі покращуватимемо його, тож залишай відгук — хороший чи поганий, бо саме це підказує нам, куди рухатися далі.

Цікаво дізнатися, що ти зрештою створиш із ним!

Переробити в YouMind

Перетворіть одну віральну статтю на повноцінний робочий процес

Збирайте джерела, розшифровуйте патерни, створюйте матеріали, пишіть чернетки та поширюйте контент в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей