YouMind
Увійти

Які моделі варті своїх грошей? Ми протестували 14 моделей на реальних інтелектуальних завданнях, щоб з'ясувати це.

@andrewbusse
АНГЛІЙСЬКА23 лип. 2026 р.
166K
11
3
1
8

Коротко

Цей аналіз 14 моделей ШІ показує, що лідери рейтингів часто не справляються з реальними інтелектуальними завданнями. Ми пропонуємо методологію вибору моделей на основі оцінки якості суджень та частоти використання, розподіляючи їх на спринтерів, середньоваговиків та важковаговиків.

Найкраща модель для роботи майже ніколи не є найкращою моделлю в лідерборді.

У світі ШІ Різдво трапляється приблизно раз на тиждень. Виходить нова модель, усі витріщаються на одні й ті ж графіки бенчмарків з хибною точністю, і ми всі погоджуємося, що це найкраще з часів винайдення колеса, аж поки наступного тижня не робимо це знову.

Але жоден із цих графіків не відповідає на єдине важливе питання. Чи може модель насправді виконувати ваше щоденне брифування або надсилати комерційну пропозицію клієнту? У Hyperagent ми надаємо доступ до всіх цих моделей на основі найкращого у своєму класі агента. Тож ми протестували їх самі. Чотирнадцять моделей, сорок два запуски, на реальній інтелектуальній роботі, яку наші клієнти щодня доручають агентам. Виявилося три речі.

  • Вартість варіювалася в 50 разів на однаковій роботі. Та сама тестова батарея коштувала $1,48 на Qwen 3.7 Plus і $75,16 на Fable 5.
  • Переможець бенчмарку не був переможцем у роботі. GPT 5.6 Sol очолив наші базові тести, але не потрапив до трійки лідерів, коли виконував реальні завдання в Hyperagent. Grok 4.5 був посередністю на базових тестах, але вийшов першим за готовою роботою, швидкістю та вартістю.
  • І жодна модель не виграла все. Правильний вибір залежав від завдання.

Висновок не в тому, щоб обрати нову улюблену модель. Це спосіб вирішувати, завдання за завданням, яка з них виправдовує свою вартість.

Мапа моделей ШІ для інтелектуальної роботи

Кожне завдання, яке ви доручаєте агенту, зводиться до двох питань: скільки судження воно потребує і як часто виконується? Позначте ці дві осі, і інтелектуальна робота розпадається на чотири території, кожна з яких потребує іншого типу моделі.

Andrew Busse - inline image

Об'ємна робота (верхній лівий кут). Тріаж, моніторинг, маршрутизація, синхронізація даних. Чітка процедура, виконується постійно, а помилка дешево виправляється. Ця робота потребує чогось швидкого та недорогого.

Щоденна майстерність (верхній правий кут). Створення чернеток, звітів, дослідження, комунікація з клієнтами. Повторювана інтелектуальна робота, яка займає більшу частину тижня — вона потребує справжнього синтезу та гарного письмового голосу, виконується надійно та часто.

Високі ставки (нижній правий кут). Перевірка контрактів, цінові переговори, глибокі занурення. Рідкісні, але неправильна відповідь коштує клієнта, контракту або маржі кварталу. Тут потенційні втрати значно перевищують вартість моделі, і саме тут найдорожчі моделі виправдовують свою ціну.

Не оптимізуйте (нижній лівий кут). Рідкісні прості запити, де будь-яка здатна модель долає планку, а різниця в ціні занадто мала, щоб на неї зважати. Це єдиний квадрат на мапі, про який ми радимо не думати.

Три класи моделей

З мапи вимальовуються три робочі класи. Вони описують економіку та профіль судження завдання, а не оцінюють модель як хорошу чи погану.

Спринтери створені для об'ємної роботи — швидкі, дешеві та послідовні, коли процедура зрозуміла, а помилку легко виправити. Haiku 4.5, Gemini 3.5 Flash і DeepSeek V4 Pro.

Середньоваговики виконують щоденну майстерність. Вони синтезують джерела, утримують багатокроковий план і добре пишуть, не беручи найвищих ставок за кожен звіт. Sonnet 5, GPT 5.6 Terra, Grok 4.5 і GLM 5.2 — туди належить більшість інтелектуальної роботи.

Важковаговики беруть на себе завдання з високими ставками, приносячи сильніше судження та більше часу на міркування до роботи, де неправильна відповідь коштує набагато більше, ніж рахунок за модель. Opus 4.8, GPT 5.6 Sol і Fable 5.

Інстинкт більшості людей — починати з високого і рухатися вниз: запускати все на Fable 5 або Opus 4.8, отримувати бажаний результат, а потім пробувати дешевші моделі, поки якість не впаде. Це працює, але ми виявили, що більшість завдань цього не потребують. Якщо ви можете назвати завдання і розмістити його на мапі, ви зазвичай можете почати з правильного класу з самого початку. Для щоденної майстерності, яка є більшістю вашої роботи, це означає починати з надійного середньоваговика, як Sonnet 5. Ви тягнетеся до пошуку зверху вниз лише тоді, коли завдання дійсно знаходиться на високоставковому кінці.

Поле ширше, ніж Claude, GPT і Gemini

Більшість команд за замовчуванням використовують кілька назв моделей, які вони вже знають. Це розумне місце для початку, але воно залишає багато списку незайманим — і деякі моделі, які виконують найкориснішу роботу в Hyperagent, не є загальновідомими назвами. Це наші робочі враження від тестування та щоденного використання, а також робота, яку ми бачили, як виконують клієнти.

Grok 4.5 — це швидке дослідження в реальному часі. Він швидко проходить через дослідження з великою кількістю інструментів і особливо добре працював у парі з рідним пошуком Exa від Hyperagent. Він також має рідний доступ до X, тому запитання про поточні настрої може повернутися з фактичними постами, що стоять за відповіддю. Він лідирував за показником готової роботи з $9,71 за повний запуск.

Muse Spark 1.1 пише чисто і перевіряє себе. Він фінішував другим у тестуванні, і наше перше враження — лаконічна, добре структурована проза з корисною звичкою перевіряти власну роботу перед тим, як повернути її. Він ще новий, тому ми б почали з контрольованих щоденних завдань перед довгими неконтрольованими.

Kimi K2.6 — це глибоке дослідження за ціною відкритої моделі. Він виконує пошук паралельно і збирає докази в одну відповідь, не беручи флагманських ставок, що робить його сильним спеціалістом з досліджень. Його єдине реальне обмеження — розмір документа, з контекстним вікном до 256 000 токенів.

GLM 5.2 — це вибір за співвідношенням ціна/якість. Він напрочуд близько підійшов до закритих середньоваговиків у рутинних дослідженнях, створенні чернеток і роботі з довгими документами приблизно за третину ціни, а його проза є однією з найсильніших за межами Sonnet і Opus. Він став щоденним драйвером для багатьох членів команди Hyperagent.

Qwen 3.7 Plus — це працівник екрану. Він особливо добре знаходить кнопки, поля та меню на відрендерених сторінках, і він недорогий для структурованого вилучення — він дав найдешевший повний запуск у нашому тестуванні. Звертайтеся до нього, коли завдання полягає в роботі з інтерфейсом або переміщенні даних, а не коли важливий голос.

DeepSeek V4 Pro — це структурований аналіз за дуже низькою ціною. Він найсильніший у звірці, очищенні даних, плановій числовій роботі та подібних структурованих завданнях. Його письмо буквальне та стисле, що добре підходить для внутрішніх пояснень і погано для клієнтської прози. Спеціаліст, і дуже економний.

Укомплектування ваших постійно активних агентів за правильною ціною

Steve Juba керує туристичною компанією з шести осіб. Він створив агента з брифінгу, підключеного до восьми джерел даних у реальному часі, який працює кілька разів на день, і це скоротило його ранковий збір контексту з більш ніж трьох годин через вісім вкладок до п'ятнадцяти хвилин.

Такий агент читає набагато більше, ніж пише, і виконує ту саму роботу сотні разів на рік, тому невелика різниця в ціні за запуск перестає бути похибкою округлення і стає реальним рядком бюджету. Розгляньмо брифінг, який читає 100 000 токенів і пише 2 000 щодня. За прейскурантними цінами липня 2026 року така робота коштуватиме приблизно:

  • $16 на рік на Qwen 3.7 Plus (спринтер)
  • $38 на рік на Kimi K2.6 (середньоваговик)
  • $40 на рік на Haiku 4.5 (спринтер)
  • $80 на рік на Sonnet 5 (середньоваговик)
Andrew Busse - inline image

Варіанти з відкритою вагою змінюють математику на таку роботу з великим обсягом читання. Kimi K2.6 виконує дослідження та синтез на рівні середньоваговика за $38 на цьому завданні — менше ніж половина Sonnet 5, і приблизно стільки ж, скільки запуск спринтера Haiku. Ви не торгуєте судженням за ціну; ви отримуєте роботу середньоваговика за гроші спринтера. Якби завдання було чистим вилученням без судження, Qwen виконав би його за $16 — але як тільки потрібен реальний синтез, Kimi дає вам це за майже ту саму ціну.

Змініть модель, збережіть агента

Нічого з цього не має значення, якщо зміна моделі означає перебудову агента. У Hyperagent це не так, тому що модель — це лише один параметр, а роль знаходиться над нею. Змініть модель, і агент збереже все, що робить його корисним:

  • Його інструкції та обсяг
  • Його навички, скрипти та робочі процедури
  • Його пам'ять про виправлення
  • Його довідкові файли та контекст компанії
  • Його підключення до систем, де живе робота
  • Його рубрики для оцінки якості
Andrew Busse - inline image

Це перетворює вибір моделі на тест, а не на міграцію. Той самий агент може виконувати те саме завдання на двох моделях без перебудови, тому ви можете знайти найдешевшу, яка долає вашу планку, замість того, щоб гадати.

Це також дозволяє дорогій частині складного робочого процесу окупитися один раз. Коли завдання дійсно цього потребує, використовуйте важчу модель для проектування та налагодження робочого процесу — потім кодифікуйте процедуру як навичку, щоб середньоваговик або спринтер міг виконувати її щодня за частку вартості.

Однак є прихована вартість, на яку варто звернути увагу. Дешевша модель з низьким рахунком не є дешевою, якщо кожен вихід потребує виправлення — час перевірки людиною та вартість помилки є частиною реальної ціни. Назвіть це податком на перевірку. Він встановлює нижню межу того, наскільки легким ви можете бути. Що відрізняється в Hyperagent, так це те, що перевірка не просто оплачується, вона накопичується: коли агент навчається з ваших виправлень через пам'ять, ці зусилля перевірки фіксуються системою і створюють кращого агента на наступному запуску.

Клієнти вже укомплектовують агентів таким чином. Ankit Das створив маркетингову операцію з Growth Orchestrator на Sonnet 5, який приймає рішення, і восьми спеціалістів каналів на GLM 5.2, які створюють повторювану роботу каналів, з окремими агентами QA, що перевіряють відповідність бренду та якість письма — все запускається з одного потоку. Eli Weiss описує свій розподіл простіше: приблизно 85% Sonnet і 15% Opus у своїх навичках і рутинах. Більшість роботи виконується на щоденному драйвері; Opus отримує менший набір завдань, де додаткове судження виправдовує свою вартість.

Це практична цінність вибору моделі в Hyperagent. Витрачайте свідомо на різні роботи, і залишайте додаткові долари для завдань, де додаткове судження змінює результат.

Обирайте модель після того, як обрали завдання

Використовуйте цю послідовність для агента, якого ви вже запускаєте:

  1. Назвіть завдання. “Підготувати понеділковий звіт клієнта” корисніше, ніж “допомогти зі звітністю”.
  2. Розмістіть його на мапі. Вирішіть, скільки судження воно потребує і як часто виконуватиметься.
  3. Почніть там, де мапа вказує. Для більшості робіт це здатний середньоваговик — використовуйте його, поки не зрозумієте крайові випадки завдання і не кодифікуєте процес у навички.
  4. Протестуйте на один клас легше протягом п'яти реальних запусків. Залиште інструкції, навички, пам'ять, джерела та рубрику незмінними.
  5. Порівняйте повну вартість. Відстежуйте кінцеву якість, послідовність, час, фактичні помилки, рахунок моделі та час перевірки людиною.
  6. Ескалуйте навмисно. Залучайте важковаговика, коли навантаження перевірки або вартість неправильної відповіді перевищує премію моделі.
  7. Використовуйте іншу модель для перевірки важливої роботи. Модель, яка зробила помилку, часто найменш схильна її помітити.

Залиште найдешевшу модель, яка надійно долає ваш стандарт. Потім витратьте різницю на ті завдання, які її заслуговують.

Переробити в YouMind

Перетворіть одну віральну статтю на повноцінний робочий процес

Збирайте джерела, розшифровуйте патерни, створюйте матеріали, пишіть чернетки та поширюйте контент в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей