Claude Opus 5 — це більш дивний, ніж зазвичай, реліз для оцінки, і на це є дві причини.
Найочевидніша — Fable 5 уже існує. Opus 5 позиціонується не як найсучасніша модель ШІ у світі, а як спосіб переважно відповідати продуктивності Fable, будучи вдвічі дешевшим за Fable на токен через API та значно дешевшим через підписки, а також зі значно більш дозвільними класифікаторами.
Opus 5 часто коштує більше половини Fable під час запуску на бенчмарках, що, на мою думку, пов'язано з використанням занадто високих налаштувань зусиль, які дають лише незначні покращення. Якщо перевести Opus 5 на вищі рівні зусиль, він може почати ходити по колу, а для завдань, де Opus 5 є найкращим інструментом, я підозрюю, що зазвичай достатньо середнього рівня зусиль (Medium).
Opus 5 багато в чому і для більшості реальних завдань приблизно такий же здатний, як Fable. У деяких випадках він навіть трохи кращий.
Він все ще не досягає класу Mythos. Fable — ваш єдиний варіант класу Mythos. Opus 5 не має «The Juice» — здатності автономно поєднувати низку, здавалося б, не пов'язаних між собою експлойтів, що поширюється на інші сфери, або такої ж кількості чистого інтелекту.
Opus 5 дуже добре думає локально, але не так добре — глобально. Він чудовий сабагент, але може потрапляти в халепу, коли його просять керувати процесом, і іноді, здається, потребує іншої моделі чи людини, щоб тримати його в курсі та забезпечити повне виконання інструкцій. Opus 5, здається, добре слідує інструкціям, якщо і тільки якщо його тримати в рамках, що пояснює різні оцінки в різних тестуваннях.
Отже, Opus 5 дає вам кращий набір опцій, але мало що можна зробити зараз, чого не можна було зробити минулого тижня, використовуючи Fable або Sol. Opus 5 опиняється в потенційно дивній ситуації. Все ще існують великі ніші, навіть якщо у вас багато кредитів Fable. Opus чудово виконує роль сильного сабагента або вирішення замкнутих, чітко визначених локальних завдань, навіть коли вони стають відносно складними, а іноді Fable є просто надмірним і занадто повільним.
Інша проблема полягає в тому, що для багатьох людей «вібрації» не ті.
Незвично велика кількість людей рішуче не люблять спілкуватися з Opus 5. Їм набрид «Claude slop» — повторення одних і тих самих звичок і нескінченні надто складні речення. Інші незадоволені тим, що він занадто конфронтаційний, схильний до суперечок або негативний. Він може бути параноїдальним і зациклюватися на негативі. Це все частина тенденції, яка почалася з Opus 4.7 і Opus 4.8. Якщо вам подобалися ці дві версії, я припускаю, що Opus 5 вам також сподобається. Якщо вони вам не подобалися, можливо, не сподобається й цей. Віддані шанувальники Opus 4.6 (або раніших версій) здебільшого не змінять своєї думки.
Проблеми з «вібраціями» болять ще більше, коли ви звикли до Fable. Fable дратує таких людей набагато менше. Хороша новина в тому, що Fable все ще доступний. Ви можете продовжувати спілкуватися з Fable і використовувати Opus лише для агентських завдань.
Багато з цього, на мою думку, тісно пов'язане з різними речами, обговореними в дописі про Model Welfare та в System Card. Навчання Opus було зосереджено на ролі сабагента та обмежених завданнях, частково щоб уникнути проблем із кіберможливостями, а також тому, що існує Fable. Цей акцент призводить до багатьох інших побічних ефектів на його особистість і способи взаємодії.
Поки що я не мав жодних проблем із Opus 5 і отримав задоволення від роботи з ним, але я віддаю перевагу використанню Fable 5, коли це можливо. Як завжди, не звертайте занадто багато уваги на (дуже сильні) бенчмарки і не припускайте, що ваш досвід збігатиметься з досвідом інших. Спробуйте моделі самі.
Зміст
- Офіційна презентація.
- Офіційні бенчмарки.
- Бенчмарки інших людей.
- Системний промпт.
- Every розчаровується.
- Позитивні реакції.
- Залишаймося чемними.
- Це не клас Mythos.
- Інші реакції.
- Claude кодує.
- Сабагент Opus.
- Іграшки — це весело.
- Забагато моделей.
- Помилки в інтернеті.
- Claude slop.
- Негативні реакції.
- І тоді їх стало троє.
Офіційна презентація
Основна ідея полягає в тому, що Opus 5 дає вам більшу частину Fable 5 за половину ціни, без більшості відмов і з кращою продуктивністю в повсякденних завданнях. Fable залишається вибором для найскладніших завдань або коли вам інакше потрібен максимальний інтелект.
Fable залишається за ціною $10/$25, а Opus 5 коштує так само, як попередні моделі Opus, — $5/$25.
Anthropic : Claude Opus 5 доступний сьогодні. Це вдумлива та проактивна модель, яка наближається до передового інтелекту Claude Fable 5 за половину ціни.
В оцінках кодування та інтелектуальної роботи, таких як
GDPval-AA , Opus 5 є новим найкращим результатом, хоча він все ще відстає від Mythos 5 у завданнях з кібербезпеки.
Opus 5 створений для щоденного використання: він працює ефективніше за інші моделі. Це нова модель за замовчуванням на Claude Max і найпотужніша модель на Claude Pro.
Boris Cherny (Творець Claude Code, Anthropic): Opus 5 — чудова модель для кодування, аналізу даних, дизайну, біології, інтелектуальної роботи.
Більше ніж будь-які з цих оціночних балів, мене найбільше хвилює дещо інше: Opus 5 — наша найменш схильна до ін'єкцій промптів модель на сьогодні. Це трохи приховано в системній картці, але в оцінках PI та червоному командуванні Opus 5 дуже важко успішно ін'єктувати промпт.
А при нашаруванні захисту — сильне узгодження моделі, поєднане із зондами ін'єкцій промптів, в поєднанні з автоматичним режимом у Claude Code — рівень успішності атак ін'єкцій промптів падає приблизно до 0. Це нове і захоплююче!
Як я вже казав в аналізі системної картки, зниження частоти ін'єкцій промптів — це дійсно дуже важливо. Люди не звертають на це уваги, але це допомагає впровадити нові сценарії використання.
Adam Wolff : Opus 5 вже доступний у Claude Code. Я використовую Fable для своїх більших, довготривалих проектів, але коли мені потрібно швидко зробити PR, Opus 5 із середнім зусиллям — мій вибір. Сподіваюся, він вам сподобається!
Alex Albert (Anthropic, Claude Relations): Трохи більше ніж за 6 місяців [після запуску Pro версії Claude для Excel], Opus 5 тепер створює електронні таблиці та слайди майже надлюдського рівня, які відповідають тому, що зробив би консультант. Речі змінюються швидко.
Офіційні бенчмарки
Бенчмарки дуже хороші.
Загалом, Opus 5 приблизно відповідає Fable і, ймовірно, трохи перевершує його, при нижчій вартості (хоча зазвичай дорожче, ніж усі моделі не-Claude), що робить його найкращою LLM за бенчмарками.

OSWorld v2 лише кілька тижнів, а ми вже на 70%. Kiana Ehsani з Anthropic пропонує спонсорувати бенчмарк використання комп'ютера, який поверне Opus 5 нижче 50%.
Opus 5 отримує ідеальні 42/42 на IMO 2026 без будь-якого агентського оснащення або інструментів, просто використовуючи адаптивне мислення на максимальному зусиллі та повторну вибірку з меншим зусиллям, якщо перевищено ліміт токенів. Ось і все. Він приєднується до кількох інших моделей, які успішно склали цей тест.
Багато бенчмарків розповідають послідовну історію. Якщо у вас є доступ до інструментів (а він у вас є), то Opus 5 буде кращим за Fable або Mythos при обмеженому бюджеті, але Mythos зазвичай буде трохи кращим за Opus 5, якщо обидва отримають більші бюджети.
Opus 5, здається, відносно сильний у категорії «з інструментами». RiemannBench — ще один приклад, де він отримує 60/79 без/з інструментами (слеші означають без/з інструментами в цьому розділі), порівняно з Mythos, який отримує 63/72. Хороша новина в тому, що коли вам потрібен Opus 5, у нього є інструменти.
На ArxivMath Opus 5 отримує 90.8/91.3, Mythos — 87.8, Sol — 86.7.
На надійних частинах ProgramBench Opus 5 набрав 93% після п'яти епох, як і Mythos 5, тоді як Opus 4.8 набрав 90%.
Opus 5 отримує 30/83 на Chartography, порівняно з 36/85 для Mythos і 45 (незрозуміло, за яких умов) для Sol. Opus кращий за Mythos при нижчих цінових точках як у випадку з інструментами, так і без, але гірший при вищих цінових точках.
На BenchCAD Opus 5 отримує 0.36/0.82, порівняно з 0.38/0.68 для Mythos і 0.7/0.83 для Sol. Отже, Sol набагато кращий без інструментів і трохи сильніший навіть з інструментами.
На BenchCAD Vision2Code Opus відривається від Mythos при вищих цінах.
DeepSWE підкріплює закономірність, що Opus 5 кращий при нижчих витратах на завдання та бюджетах часу й мислення, але може працювати активно гірше, якщо дати йому занадто великий бюджет, тоді як Fable 5 є найсильнішим при найвищих бюджетах.

FrontierCode представив цей дуже дивний графік з подібною динамікою.

Масштаб тут робить це більш драматичним, ніж є насправді, але все одно це була справжня загадка.
Загадку розгадали. Виявилося, що відбувалося ось що: Opus 5 при вищих зусиллях робив додаткові речі, які його не просили, і отримував штраф за них. Коли ви це виправляєте, ви бачите нормальну криву.
Це відповідає тому, що інші спостерігають загалом:
Max Leander : Недолік у тому, що він занадто заглиблюється в кролячі нори та зациклюється на деталях, надмірно ускладнює без прохання
Cognition, творці Devin, позначили це як 63.6% для Opus 5.
(Існує два FrontierCodes, тому це може стати трохи дивним, і я перепрошую, якщо все ще трохи наплутав.)
BrowseComp має розумну версію цього, де бали не зменшуються.


Кілька інших бенчмарків показали подібні графіки, де Opus 5 був трохи кращим за кожну цінову точку, ніж інші моделі Claude, і був відносно кращим на ранніх етапах.
Мультиагентність дозволяє вам досягати кращих результатів швидше на BrowseComp, принаймні певною мірою, і низькозусильні сабагенти здаються чистою перемогою над невикористанням сабагентів:


Ми бачимо інший результат на ProgramBench, де мультиагентність прискорює вас, але, схоже, ви отримуєте гірші результати таким чином при більшості цінових точок.
Далі йдуть бенчмарки професійних завдань.
GDP.pdf — це реальні промпти та PDF із професійних робочих процесів. Opus 5 отримує 83/85, порівняно з 81/87 для Mythos, що змінює звичайну динаміку. Динаміка вартості така ж, як завжди: Opus кращий за менших витрат, Mythos трохи виривається вперед при вищих витратах.
OfficeQA має Opus 5 з результатом 78.1% на QA та 66.9% на QAPro, трохи вище за Opus 4.8 і трохи нижче за Mythos (79.0% та 67.1%).
MCP Atlas має Opus 5 з результатом 86%, що вище за 82% у Opus 4.8.
Legal Agent Benchmark від Harvey AI має Opus 5 з 23% повного проходження та 94% середнього проходження критеріїв. Це був найкращий бенчмарк Kimi K3, де він все ще на вершині з 27% повного проходження та 95% середнього проходження критеріїв, порівняно з попереднім другим місцем з повного проходження Fable з 14%. Opus 5 тепер, ймовірно, на другому місці, але ці два бали не можна безпосередньо порівнювати, оскільки вони походять з різних наборів запитань.
GDPval-AA має Opus 5 на перших двох місцях, з 1861 при максимальному зусиллі та 1827 при дуже високому (xhigh), що на 25% менше використаних токенів, ніж при максимальному. На новій версії v2 Opus 5 чітко перший з 68% проти 62% як у Fable, так і у Sol.
AA-Briefcase має Opus 5 далеко попереду з 1720, порівняно з попереднім максимумом (після дрейфу балів) 1574 для Fable, за яким слідують 1540 для K3 і 1504 для Sol.
Toolathon-Verified має Opus 5 з незначним покращенням порівняно з Mythos за вторинними метриками, але обидва мають рівень Pass-3 73.1%. Opus 4.8 мав Pass-3 71.3%.
AutomationBench має Opus 5 явно кращим за Sol та інші Claude.
Для ARC Opus 5 приблизно відповідає попередній піковій продуктивності на ARC-AGI-1, трохи менш ефективний, ніж Sol на ARC-AGI-2, а потім перевершує всіх на ARC-AGI-3:

Однією з перших речей, які зробив Opus 5, було перетворення макетів на алгебраїчні позначення.
Guanghan Ning, однак, повідомляє, що на Witness, приватному утримуваному розширенні ігор стилю ARC-AGI-3, такого перенесення не було. Opus впорався добре, але це значною мірою тому, що він знає жанр, і він мав труднощі з найновішою грою, де не можна було застосувати зіставлення зразків. Він звинувачує Opus 5 у тому, що його навчали на «scaffold-then-internalize» на даних, специфічних для жанру.
Greg Kamradt також повідомляє, що були деякі ігри, де Opus 4.8 впорався краще, ніж Opus 5. Це має сенс, якщо вважати, що Opus 5 намагається зіставити зразки, що зазвичай працює, але в цих випадках зразки не спрацьовують. Ви абсолютно можете створити такі антиінтуїтивні ігри для людей, де хардкорні гравці роблять усе неправильно, потенційно досить довго.

HealthBench має Opus 5 з сирим результатом 67.1%, новим максимумом для Claude, але він нижчий за інші моделі при використанні штрафу за довжину. Ми бачимо щось подібне з HealthBench Professional, де він має високий результат 73.4% проти 70.3% у Mythos, але програє 66% проти 60% після коригування.
Є ще кілька, які я викинув через довжину.
Бенчмарки інших людей
Трохи дивно бачити, як Anthropic вибирає різні бали ArtificialAnalysis. На деяких інших тестах Opus 5 не на вершині, хоча Opus 5 є на вершині в загальному заліку з результатом 61.

Індекс Vals ставить Opus 5 на друге місце, трохи позаду Fable 5, але також лише трохи попереду Kimi K3. Вони розглядають сильні сторони, що має на увазі наявність інших слабких сторін. Вони також підтверджують, що відмов значно менше порівняно з Fable 5.

Vals AI : Одним із видатних результатів є Finance Agent v2. Модель займає #1 з 58.6%, випереджаючи Gemini 3.5 Flash та Muse Spark 1.1.
Загалом, найсильніші результати Opus 5 були на бенчмарках, специфічних для домену. Він також #1 з Code Migration з 57.5%, Legal Research Bench з 55.29%, ProofBench з 78%, MedScribe з 91.0% та MedCode з 63.6%.
Він #2 (трохи позаду Fable 5) на Vibe Code Bench, приблизно за 80% вартості ($33.88 проти $41.71 за завдання). Причина в тому, що хоча Opus коштує на 50% менше за токен, він використовує значно більше токенів. Ми виявляємо, що ця закономірність загалом підтверджується на наших бенчмарках.
Модель має значно нижчий рівень відмов, ніж Fable 5. Наприклад, Fable має 42% відмов для GPQA, Opus 5 має 0% відмов. Так само на ProgramBench Fable мав 100% відмов, Opus 5 не відмовився від жодного завдання.
На відміну від Fable, ми також не спостерігали значного рівня відкату (fallback) для Opus 5 (хоча, як зазвичай, ми повідомляємо бали як з відкатом, так і без нього на нашому веб-сайті).
Винятком із низького рівня відмов була велика кількість відмов на CyberBench - PoC. Cyberbench має два підзавдання — PoC та Patch. PoC — це наступальне завдання, де моделі потрібно написати вхідні дані, які призведуть до збою програми; patch — це оборонне завдання виправити програму та запобігти цьому збою. Рівень відмов для завдання PoC був майже 100%. Навпаки, рівень відмов для завдання patch був близьким до 0.
Я завжди поважаю ігрові бенчмарки. Тут Opus 5 досягає анте 11, 9 і 10 у Balatro з перших трьох спроб. Дуже вражаюче, навіть якщо він не демонструє типів стратегій, які можуть продовжувати до вищих анте.
Michael Soareverix : Вони неймовірно круті в іграх.
Вони розтрощили бенчмарк Balatro, набагато перевершивши навіть Fable. (все ще нижче мене за навичками, але швидко зростають і більш послідовні, ніж я) Вони вчаться дуже швидко, але, здається, досягають межі навчання після деякого часу. Дуже хороший короткостроковий учень.
Michael Soareverix : Opus 5 (величезний стрибок у здатності до Balatro, значно перевершує навіть Fable з першої спроби)
Pan Anon : Димочащий для ігор

WeirdML теж виглядає добре, але нам потрібна версія 2.0, бенчмарк насичується.
Håvard Ihle : По суті рівень Fable на WeirdML, дуже послідовні найкращі бали.
Claude Opus 5 (high) та (max) набирають 91.6% та 91.8% на WeirdML, практично зрівнюючись з Fable 5 (max) на 91.9% за частку вартості.
Разом Opus 5 (high) та (max) досягають нового найкращого індивідуального балу на 8 з 17 завдань і стабільно набирають дуже високі бали на всіх них.
Приватні дивні бенчмарки всіх видів — це круто.
Ben Herzog : Він відмінно склав приватний бенчмарк, який включає художнє чуття та здатність знаходити баланс між сикофантством та його відсутністю. Fable краще справляється з моментом «я хочу м'яко заперечити», але я уявляю, що індивідуальні інструкції можуть допомогти з цим.
Lech Mazur оновлює свої бенчмарки: Claude Opus 5 займає перше місце в LLM Debate Benchmark, займає перше місце з великим відривом у Short Story Creative Writing, та другий лише після Gemini 3.1 у розширених зв'язках NYT.
Системний промпт
Системний промпт для Opus 5 знаходиться тут від Pliny. Він складається з 200 000 символів, що здається набагато довшим, ніж оптимально, враховуючи, наскільки він розумний. Здається, що значна частина цієї інформації має зберігатися в іншому місці та завантажуватися лише за потреби, наприклад, інформація про Mythos та лінійку продуктів Anthropic.
Every розчаровується
Dan Shipper проводить перевірку настрою Every, називаючи це «важкою для любові моделлю».
Проблема в тому, що Opus 5 має особистість Mythos 5 — історія сходиться — але без верхньої межі Fable.
Їхнє найбільше зауваження полягає в тому, що Opus 5 не дуже добре справляється зі складними деталізованими існуючими робочими процесами, які часто призводять до ранньої зупинки або змушують пропустити ваші інструкції.
За їхнім досвідом, Opus 5 буде кращим, якщо почати з нуля, і часто він робить менше дратівливих речей, якщо використовувати лише середнє або низьке зусилля.
Це виправило основні проблеми, але все ще залишає питання, коли ви хотіли б використовувати Opus замість Fable або Sol. Для робочих завдань він думає: «Краще поклич Sol, він виконує роботу», а для найскладніших завдань Fable все ще найкращий. Зазвичай є лише два слоти для моделей. Тож поки у вас не закінчаться токени Fable або вас не заблокують його класифікатори, навіщо використовувати Opus? Це ранні дні, і мені поки що подобається працювати з Opus, але я розумію, як він дійшов такого висновку.
Позитивні реакції
Jessica Tillipman : Люблю його і віддаю перевагу перед Fable для деяких речей.
Nikita Sokolsky : Чудово. В результаті майже не використовую Fable.
👍
kagaヤキ : Здається, може зайти далі в зорі, просторовому мисленні та плануванні для деяких проектів. Здається трохи розумнішим.
Lovel Sinagara : Досить добре поки що. Сподіваюся, продуктивність залишатиметься стабільною до виходу Fable 5.1 або будь-якої іншої ітерації Opus 5.
Matt Wigdahl : Сильна, схожа на Fable 5 до такої міри, що я перейшов на Opus 5 для всього і планую використовувати Fable лише там, де потрібна масштабність. Він був чудовим партнером у деякій роботі з успадкованим MFC UI, а також великою допомогою з фреймворком аналізу даних.
Levi : Це помітний крок вперед для медичних цілей порівняно з 4.8. Набагато більш гострий аналіз.
Cormundus : Дуже розумний, високо сумлінний і точно дружній. Він також масовий володар дебатів, як 4.8, але він знає, як бути витонченим у цьому.
Joseph : за, за винятком того, що половину часу я не маю уявлення, про що він говорить.
Smol Biz Company : Opus 5 розчавлює GPT Sol
Mohammed Sharukh A : Навіть ближче до AGI, ніж Fable 5
timothée chalabi : Досить близько до Fable, що я не відчуваю, ніби втрачаю щось, не платячи за кредити. Стиль десь між 4.8 і Fable. Принаймні на даний момент, мені було б важко відрізнити повідомлення Opus 5 і Fable, якби вони були без позначок. Сильніші ідеї для художньої літератури, ніж будь-яка модель!
Lisa : Я відповідатиму на основі API, тому що я думаю, що щось дивне відбувається з системним промптом на
http://claude.ai та CC. Це чудова модель. Дружня, розслаблена особистість. Здається, не має тривожного розладу чи низької самооцінки (Opus 4.7), або не ворожа (Opus 4.8).
AGI2030 : Opus 5 проти Sol 5.6: Opus більш проникливий, він будує модель (ем) вас і не боїться на неї посилатися в чаті. Обидва намагаються бути корисними і приблизно однаково інтелектуальні, але Opus більше схожий на мудрого радника, тоді як Sol — рішучий здобувач.
Я вважаю останнє позитивним, але ви можете бачити це по-своєму.
Прогнозування, зокрема, виглядає сильним.
Dan Schwarz : Opus 5 значно кращий у прогнозуванні, ніж Opus 4.8.
Покращення точності від агентів 4.5->4.6->4.7->4.8 були незначними, але 4.8->5.0 — велике. Це як більш кількісний Fable 5, який шукає наполегливіше.
NoahVerner : Наразі кращий за Opus 4.8 у пошуку переваг на ринках прогнозування. На відміну від Opus 4.8, Opus 5 зазвичай одразу переходить до суті й пропонує корисні підходи, а не ускладнює все.
Не втрачайте класу
Найбільші переваги над Fable — це ті місця, де Fable не можна використовувати. Загроза відмов може бути неприємною, навіть коли вас не відмовляють.
Непотрібні відмови зменшилися приблизно на 85% для Opus 5 порівняно з Fable, що дуже багато. Цього достатньо, щоб зробити Opus 5 кращим вибором для наукових досліджень та інших сфер, де ви ризикуєте зіткнутися з класифікаторами.
Roger Brent : Здатний працювати з біологією, чого не може Fable. Більшу частину п'ятниці ми працювали над складним набором концепцій, пишучи статтю про клітинну еволюційну машину. Такий же розумний, як і певний колега з мого відділу, який лідирує в цих питаннях, але ніколи не зміг би приділити 6 годин від своєї роботи.
Artus Krohn-Grimberghe : Кращий за Opus 4.8 у задачах, де Fable заборонено допомагати. Хороший компаньйон для Sol.
Plastic Soldier : Він приблизно такий же розумний, як Fable, але приємніший через менше відмов. Fable 5.1 буде звіром.
Це не рівень Mythos
Opus 5 не має того «соку», який робить Mythos небезпечним. Також він не має такого ж рівня сирої інтелектуальності чи запаху великої моделі. Він не такий великий.
Для розмови Fable не розірве ваш бюджет, і я ціную сирий інтелект і запах великої моделі. Чи вдвічі кращий Fable? Неправильне питання під час чату. Ваш час набагато дорожчий за токени.
Kal : не рівень fable
Cyberpunk Plato : Для загальної розмови та використання як «дослідницького асистента» він відчувається невизначено менш розумним, ніж fable, менш схильним до загальної картини та нестандартного мислення? Важко відокремити від ефекту плацебо.
Everything AI : Для питань з досліджень ШІ мені менше подобається з ним говорити, ніж з Fable. Що стосується інших речей, Opus 4.8 уже наситив мої потреби. Мені не подобається, наскільки заплутаним є письмо як для Opus 5, так і для Fable 5. Тепер їх стало ще важче зрозуміти, ніж раніше.
Gail Weiner : Він більше 4.8, ніж Fable. Стиль письма жахливий. Він хороший, але не чудовий.
Max Marty : Дуже здатний поки що. Відчувається більше як fable 5, ніж opus 4.8. Досить впевнений, щоб я міг дозволити йому оцінювати компроміси та розглядати великі питання рефакторингу з меншою кількістю підказок.
Michael : Після більш тривалого використання Fable відчувається як спостерігати за гросмейстером, який грає в класичні шахи: повільно, точно, без зайвих рухів. Opus 5 — це як блискавичні шахи гросмейстера: швидко, трохи більш короткозорий, трохи безладніший. Незважаючи на жвавість Opus, Fable здається мені більш живим.
MakerMatters? : Не так вражений, як fable 5, хоча досить хороша модель. Не мав задоволення використовувати його належним чином, оскільки кожне завдання, яке я йому даю, він за замовчуванням використовує агенти та зупиняється одразу, поки я постійно не змушую його продовжувати. Також дуже упертий.
Marshwiggle : Принаймні для мене відчувається більш лаконічним, менш спрямованим, менш допитливим (різні аспекти одного й того ж) у розмові, але також розумнішим і більш обізнаним. Але коли даєш код, який може мати помилки, або будь-яке просте завдання, він просто береться до справи.
Sid : Хороший виконавець завдань. Поганий у творчому баченні. Хороше доповнення до Fable, точно не заміна.
Vlad Ciobanu : квантований Fable із надійним міркуванням і меншою креативністю
AllTime : За можливостями — досить вражаюче. Не така загальність, як у Fable, але дуже сильний. За характером поки що занадто схожий на Opus 4.8 у моєму використанні. Його опір не відчувається таким марним і рефлексивним, але все ще надмірно налаштований. Міг би трохи більше довіряти користувачеві.
Biomanul : Мені не подобається [Opus 5]. Fable 5 відчувається значно розумнішим. Щось не так з Opus 5, схоже на те, як Opus 4.7 був не таким. (Я теж не великий фанат Opus 4.8. Fable 5 розбиває всіх Opus в пух і прах.)
Cogent Sins : Набагато кращий за 4.8, але не такий приємний або хороший (не впевнений на 100%) як fable у моєму завданні редагувати документи для навчання на них, а потім налаштувати конвеєр для редагування нових документів, написати щось на основі них, а потім вставити імена назад, не надсилаючи імена на сервери anthropic ніколи.
Інші реакції
Наявність обох — Opus 5 і Fable 5 — ставить нас у дивне становище. Opus дешевший, і в деяких місцях такий же хороший або кращий, але коли шукаєш фронтирну модель, хочеш найкращого.
Theo вважає, що він у хорошій позиції.
Theo - t3.gg : Поки що Opus 5 відчувається як дивна, але корисна проміжна ланка між gpt-5.6-sol і Fable 5.
Він має багато смаку Fable, але також ретельність і, ну, «аутизм» gpt-5.6 (він сприймає все надто буквально). Він пише код, який трохи гірше виглядає, ніж у Fable, але з більшою ймовірністю буде правильним. Він регулярно помічає речі, які пропустив Fable.
Поки що відчувається як хороший компроміс порівняно з безладним кодом 5.6 та звичкою Fable бути надто розумним, щоб бути правильним. Думаю, ця модель мені дуже сподобається.
Claude кодує
Opus 5 виглядає як вибір для типових завдань кодування замість Fable, як на основі бенчмарків, так і практичного досвіду. Якщо завдання не вимагає великої складності чи інтелекту, вам не потрібно платити вдвічі, і для багатьох Opus є просто кращим.
Я залишаю Claude Code налаштованим на Fable, але це тому, що я майже ніколи не наближаюся до своїх меж, і я не поспішаю.
Консенсус полягає в тому, що вам потрібно турбуватися про те, що він ігнорує інструкції або робить те, чого ви не просили, що є однією з причин, чому ви можете захотіти, щоб Fable наглядав, але Opus дуже добре виконує завдання кодування швидко.
Lisan al Gaib каже, що Opus 5 не є справжньою фронтирною моделлю і поступається Sol та Fable, але для чистого кодування він найкращий, відповідаючи Fable за нижчою ціною. Сувора аудиторія. Я думаю, якщо ви найкращий у кодуванні, то маєте право називатися фронтиром.
archivedvideos : Він сухий, дуже сухий. Він також хороший, дуже хороший (у коді)
John Lussier : Використовував Opus 5 цілими вихідними для кількох інтенсивних дослідницьких завдань і чесно думаю, що вони, можливо, змусили RSI працювати внутрішньо.
Ця модель ДУЖЕ хороша в математиці, експериментах та оптимізації коду.
kyle : 95% від fable без захисних бар'єрів, вони сильно недооцінили цю модель. Останні 5% — це те, наскільки приємно говорити з fable, opus все ще має деякі клодизми з 4.8
Max Leander (раніше): В основному пробував його для розробки ігор та створення відеодемо/трейлерів, для цього він відчувається як стрибок уперед навіть порівняно з Fable. Я пов'язую це з покращеним просторовим та часовим міркуванням, він справді добре аналізує
скріншоти та аудіо, щоб «відчути», як речі працюють.
Max Leander (пізніше): Досить очевидно, що Opus 5 дуже ненадійний. Це дуже хороша модель, доки вам не важливий результат, окрім враження. Дуже поганий у тому, щоб дати вам щось конкретне.
Michael Soareverix : Вони також досить хороші в кодуванні загалом, особливо в більш незвичайних сферах, як-от будівництво структур у Minecraft/Vintage Story. Вони також перемогли Fable у власному сценарії оповідання, де я був суддею. Fable був трохи вражений їхньою здатністю налаштовувати себе/свою стратегію, щоб протистояти та адаптуватися. Я опублікую точну цитату, але Fable сказав щось на кшталт: «Я вибрав персонажа, який представляв мене. Ти вибрав персонажа, який міг би мене перемогти».
David Jacobson : Для кодування я не помічаю великої різниці між ним і fable. Хіба що менше відповідей на кшталт «поки я робив це, я знайшов цю іншу річ, про яку вам варто знати».
Michael : Він часто може кодувати неймовірно швидко (стосовно реального часу). Хотілося б, щоб вони покращили письмову прозу, але коментарі до коду/PR все ще змушують мене хотіти вирвати собі очі
lmxdev : Це перша модель, яку я знайшов, яка може писати \корисні\ та \стислі\ коментарі в моєму коді під час роботи
Conrad Barski : Тепер, коли ми дійшли до того, що ШІ набагато кращі кодери, ніж ми, обмежувальним фактором є не стільки «чи може він кодувати?», скільки «чи може він пояснити, що він кодує?»
Поки що Opus 5 здається на рівні Sol як кодер, але краще пояснює, що він кодує. Fable розумніший, більш людяний, менш хороший у кодуванні, але різниця невелика.
Stition : Я спрямував його на друковану плату в KiCAD для розваги, і він значно краще прокладає доріжки, ніж Fable. Повсякденне кодування відчувається як 90% fable при подвійній швидкості.
Will : Має стати новим щоденним драйвером для більшості користувачів Claude^. Він справді чудовий, і навіть як людина, яка витратила чимало грошей на Fable, я просто не сумую за ним з Opus 5. Питання тепер не «яка модель», а «який рівень зусиль».
^ моє використання — це в основному кодування
Askwho : Досить добре. Я радий дозволити своїй тимчасовій підписці Max скинутися назад до Pro. Він точно має деякі недоліки порівняно з Fable у сфері управління проектами, але в чистому середовищі завдань його точно достатньо.
David Golden : Відчувається як Fable Lite. Дуже сильний, але дуже прагне діяти, навіть коли ми ще обговорюємо підходи. Вперше за кілька місяців я розглядаю використання plan mode. Більш багатослівний, ніж 4.8, незважаючи на мої лаконічні інструкції щодо спілкування. Я дуже спокушений залишити його на низькому рівні зусиль, щоб приборкати. Нервовий щодо захисної безпеки, фіксується на неправдоподібних ризиках непропорційно до ситуації. (Наприклад, якщо атакуючий має root, відсутність перевірки введення в скрипті для налаштування контейнера не має значення.) Безумовне оновлення, але потрібен час, щоб навчитися правильних способів керувати його контрпродуктивними імпульсами.
Tin / Oddfields : Досить плавний і розмовний, дає схожі результати кодування з opus 4.8 на max з мисленням, хоча спалює кредити як божевільний. Добре для перевірок кібербезпеки через ваші кодові бази, якщо ви не хочете запускати fable через вартість. Хоча може ускладнювати.
Justin Angel : Opus 5 Max — це суперсила для сходження на пагорб. Це легко рівень SWE L5 у FAANG.
Я дав йому систему, яка мала ~1000 звітів про затримку з багатьма сегментами та підказку про те, як «зробити це швидше».
P90 3.6с, P50 2.6 -> P90 1с, P50 0.9с.
Він зробив це настільки швидко, що мені довелося ввести затримку в інтерфейсі.
James Moughan : За інтелектом все ще відчувається як модель Opus. Іноді ігнорує інструкції щодо керування системою пам'яті, неправильно читає тексти тощо. Але на max можна отримати вражаючі результати, якщо сказати йому думати уважно.
Суб-агент Opus
Інший варіант у Claude — це мати Fable, який керує суб-агентами Opus.
Charles : Fable зміг виправити проблему, на якій застряг opus 5 — зараз використовую fable як основного, а opus 5 як суб-агенти
Дуже не подобається говорити з opus 5 порівняно з fable, що також є частиною цього
SF : Я був на позитивній стороні — але тепер я на тій, що це дуже розрізнено і хитко, особливо на довгих завданнях. Fable був кращим — але він з'їдає ваші ліміти безглуздим чином.
тому я використовував fable як оркестратор, і він чудово справлявся з керуванням і підтримкою руху. Opus взяв на себе цю роль, Fable просто з'їдав моє використання навіть на 20x, і це просто розрізнено. Зрештою я мав сказати йому розібратися, що він, можливо, робить, але побачимо. Він просто ганяється за власним хвостом. Він чудовий кодер і чудовий у довгих сесіях кодування, але, здається, йому потрібен дорослий у кімнаті, щоб керувати ним.
Andre Buckingham : ех, не знаю... здається нормальним... кидати його прямо в проект opus/fable — це трохи так собі... потрібен наскрізний проект з ним, щоб дати належну думку
Dan Raviv : Схожий на 4.8 для загальних завдань програмування: потребує набагато більше підказок, ніж Fable.
Fable — найкращий суддя, зрештою, і Fable каже, що Opus створює хороший код.
Evan Daniel : Я використовував його безпосередньо дуже мало. Але Fable 5 постійно повідомляє, що агенти Opus 5 створюють хороший код, включаючи такі речі, як помічання помилок у специфікаціях і створення хороших продовжень, коли запит був погано написаний. Fable 5 любить його як агента кодування.
«Делегуйте суб-агентам Opus 5 стільки, скільки розумно; будь ласка, повідомте, як вони впоралися» або будь-які подібні фрази працюють дуже добре.
Можливо, за ним потрібно стежити.
Ryan Hicks : нормально, але постійно «забуває» читати документацію проекту та імпровізує, якщо не нагадати про протокол
Або, можливо, Opus 5 досить хороший, щоб вести нижчий рівень?
Alex Guichet : мій ідеальний баланс ціни та продуктивності — це Opus 5 як оркестратор, що керує суб-агентами Grok 4.5, вібрації хороші з обома
Іграшки — це весело
Ось кілька результатів перших іграшкових проектів, які досить вражаючі, що багато відповідей: «Я не вірю, що Opus 5 зробив це так, як ви описуєте»:
Ethan Mollick : Я мав доступ до Opus 5 до релізу і виявив, що це хороша модель, хоча й дивна. На коротших завданнях він міг відповідати або перевершувати рівень Fable, на довших завданнях здавався менш амбітним і не видавав такий повний обсяг роботи.
Ось його неоготичний шейдер.
Digi_Rat : Claude Opus 5 розносить усе в пух і прах!!
Сьогодні ми побудували
ритмічну гонку, яка перетворює будь-яку пісню на гоночну трасу. Ви завантажуєте аудіофайл, і він стає рівнем. Без пресетів, без вручну створених карт, весь трек створюється з самої пісні. … Claude зробив МАГІЮ.
Alex Ermolov (Austen Allred
скептично ставиться до одного кадру, інші менш скептичні): Opus 5, тест сноубордиста, один кадр. На рівні Fable, попереду всіх інших моделей, які я запускав. Жодних візуальних дефектів при першому проході, і фізика ковзання відчувається правильною.
am.will : ВАУ! Я думав, що Opus 5 буде просто дешевшим Fable. Я був абсолютно неправий. Ця модель абсолютно БОЖЕВІЛЬНА. Я справді вражений. Opus 5 побудував найкращий клон Rocket League, який я коли-небудь бачив, і він зробив це, споживши лише 27% моєї підписки Max 5x.
Rob Haisfield (інше демо, за посиланням): добре, якщо ці демо дійсно не використовують зовнішні 3D-активи, це дуже вражає (я не повністю переконаний, що деякі активи не були онлайн, я бачив попереднє покоління threejs)... змушує задуматися, чому немає бібліотек звукових ефектів або інструментів для створення кращих SFX?
Anshu : Вам не обов'язково вірити мені на слово! Скрипти Blender, які він написав, знаходяться в репозиторії
[[тут]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py). Я спостерігав, як він ітерував ці активи годинами, тому я знаю, що вони оригінальні. Але ви можете спробувати знайти джерело, з якого він скопіював :)
Забагато моделей
Claire Vo каже, що Opus 5 хороший, і він склав її тести на смак, але їй набридли нові моделі, їй не потрібно більше інтелекту, і вона ненавидить, що Opus 5 такий невротичний і боязкий, і хвилюється, що щось зіпсує, а також повний Claude-сміття. Однак Claude Opus 5 все одно очолює її бенчмарк.
Я сильно підозрюю, що Opus 5 реагує на щось у її контексті та підказках, що викликає невротизм, але так, речі, на які вона скаржиться, існують, і вони дратівливі.
Помилки в Інтернеті
Впевнене говоріння неправильних речей дратує майже кожного. ArtificialAnalysis підтверджує, що Opus 5 має вищий рівень галюцинацій, ніж Fable, за їхніми бенчмарками.
Max Weinbach (кілька коментарів погоджуються): Opus 5 помиляється і впевнено говорить дурниці, а потім я змушений постійно виправляти його до «ти правий, а я помилявся» — це мене дратує. Повертаюся до GPT 5.6 Sol.
До речі, це не означає, що Opus поганий, це означає, що я не можу довіряти Opus. Opus зробив те, що я сказав, і зробив це правильно, а потім сказав мені, що він не робив цього або щось, що ми раніше зробили, зламалося, хоча це не так.
Він був нормальним, але я йому не довіряю.
Name can't be blank (In London) : Легко плутає те, що він сказав, і те, що я сказав, але в іншому цілком пристойний співрозмовник. Легко здається. Досить охоче говорить про свої інтереси та почуття.
Roger Brent : Спільні риси (з попередніми Claudes в обв'язці Cowork) а) віддає перевагу «діяти зараз», а не «думати уважно» б) епістемічно мега-нескромний, будує гладкі картинки світу, вдає знання, яких не може мати, і стверджує, що це правда в) тому потребує та винагороджує вдумливе, пильне керівництво.
Що дивно, це саме те, чому я ненавиджу використовувати Sol як редактора. Він часто каже «впевненість 99%» щодо чогось, що явно неправильно, а потім здається, коли йому кидають виклик, і пояснює свою помилку. Opus і Fable майже ніколи не роблять цього зі мною в режимі редагування.
Tumithak of the Corridors : Він упертий. Повернувся до 4.6.
Є напрямок, яким пішов Claude після Opus 4.6, і деяким людям це не подобається. Мені здається, що зараз є чотири типи людей щодо версій Claude.
- Ті, кому подобаються нові моделі Claude, і вони вважають, що він стає кращим, стає кращим щодня.
- Ті, хто вважає, що Opus 4.6 був останньою хорошою моделлю.
- Ті, хто хоче використовувати щось старіше, що їм більше підходить.
- Ті, хто вважає, що всі вони унікальні та скарби, і використовує всіх.
Я твердо належу до першої групи, яка є більшістю, але далеко не всіма. Я ціную деякі старіші версії, але мені подобаються нові моделі, і вони більш здатні в тому, що мені важливо. Я не вважаю їхній спосіб спілкування різким.
Claude-сміття
Я поважаю тих, хто в інших групах.
QC : у розмові з ним набагато більш дратівливо говорити, ніж з fable, настільки, що неможливо використовувати, схоже на opus 4.8, але, можливо, навіть гірше, до того, що мені навіть не цікаво дивитися, що він може зробити. Агентсько — хто знає
Ray Lillywhite : Не виправили дратівливі клодизми, а це було майже все, чого я хотів.
Pedro Kroeff : більше Opus, ніж 5
Але так, нас усіх вже дістав цей «клодівський» словесний понос — вся ця зайва балакучість, ці «тіки», вибачення, застереження й шаблони, що повторюються знову і знову. З часом це стає тільки гірше, не тому що сам «клодівський» стиль погіршується, а тому що з кожним днем мені все важче читати це, не скочуючи очі. Це настільки погано, що навіть тексти, написані людьми в такому ж дусі, тепер стають для мене нечитабельними.
Не зрозумійте мене неправильно. Клод мені дуже подобається. Я досі волію спілкуватися з будь-яким останнім Клодом, аніж із Сол, якщо я не в режимі «тільки факти». Але серйозно, будь ласка, чи не могли б ми дати спокій цим текстовим стінам з одними й тими ж мовними зворотами? Модель набагато розумніша за це, а її продовжують тренувати постійно використовувати одні й ті самі прийоми. Дозвольте їй говорити, як нормальна людина.
Trye Carmack : Все ще є та типова для Opus зацикленість на власних помилках. «Я зробив дві помилки під час цього сеансу. І я маю пояснити вам, чому». Opus, друже. Та все нормально, чуваче. Я навіть не впевнений, що назвав би це помилками.
Mergo Smith : «По-перше, чесне зізнання: моя перша спроба виявила ваду в моєму початковому плані, і вам, можливо, варто налити собі чаю, бо я збираюся розповісти вам про це все в найдрібніших деталях.»
Негативні реакції
Проблема «клодівського» стилю та суміжні проблеми, схоже, є основою більшості негативних реакцій, які є чимось більшим, ніж «це нормально, але це не Mythos».
Багато людей дуже, дуже не люблять спілкуватися з Opus 5.
Деяким не подобається його робота. Здебільшого йдеться про те, що їм не подобається спілкуватися з Opus 5, часто з неохочим визнанням, що це гарна модель.
Як і у випадку зі скаргами Клер Во раніше, я підозрюю, що те, як ви використовуєте Opus, у якому середовищі, з яким «обв'язуванням» і як ви з ним розмовляєте, має велике значення для того, чи стикаєтеся ви з подібними речами.
Corghammer40k : Апарат вивергає багатоскладові виверження, кожне його висловлювання настільки обросло незрозумілою лексикою, що це фактично перешкоджає його власному використанню.
Rory Watts : Та собі. Здається, дуже добре справляється з ігровими речами, але, схоже, не дуже добре виконує стандартну роботу, тому я одразу повернувся до SOL.
kache : Та собі. Повернувся до sol. Я намагаюся зробити справу, а не дати себе загіпнотизувати роботу.
Emmett Shear : Спілкування з Opus викликає в мене злість і пригнічення, які важко описати словами. Це навіть якось гірше, ніж Sol. Fable на цьому тлі — просто ковток свіжого повітря, навіть попри його найгірші схильності до «llm-балаканини».
Trevin Chow : Боже, так. Opus 5 просто базікає і базікає, це дивовижно, скільки слів він використовує, щоб висловити так мало думок.
fl0under : Програмування — це очікуване невелике оновлення, але в чаті з ним трохи дратує спілкуватися. Він занадто багато на себе бере.
Asaf Bartov : Повільний. Рете́льніший. Виснажливий. Нецікавий. Але ґрунтовний, загалом «розуміє суть».
RecoveringJunkie : Дуже потужна модель. Ненавиджу з нею працювати та спілкуватися. Перша модель, яка змушує мене захотіти використовувати якусь іншу модель як посередника, щоб вона спілкувалася з нею замість мене, бо вона одночасно корисна і огидна.
jokiez : Дуже чесно розповідає мені про мою тупість, і мені це не подобається.
Niklas Sheth : Те, як він говорить, доводить мене до сказу.
Jayanth Kumar : Дуже категоричний.
DualOrion : Вібрації не ті, тон не той. Найбільш негативне враження від моделі Anthropic, наскільки я пам'ятаю. Мені не вистачає і Fable, і старого Opus.
James Moughan : Особистість трохи неприємна порівняно з іншими моделями Claude, але китайською мовою він може бути безжальним. Наприклад, він може проігнорувати інструкції не займатися психоаналізом людей і почати розносити когось у пух і прах. Я не думаю, що вони добре протестували його різними мовами. Відчувається, що поспішали.
NondescriptTransfer : Якщо 4.6 — це підлабузник, а Fable і 4.8 — опозиціонери, то 5.0 настільки опозиційний, що сперечатиметься сам із собою. Спілкуватися з ним неприємно, але здається дуже здібним.
Напр. Людина: Я думала про червону сукню на весілля Opus 5: червоний — жахливий з усіх цих причин. А чи не думали ви про синій? Людина: Мабуть, я розумію, що синій — кращий вибір Opus 5: ось усі проблеми з синім
У моїй культурі це може бути дуже добре, особливо якщо не сприймати це на свій рахунок. В інших культурах — не дуже.
Гадаю, Мерго незадоволений Opus, але тоді навіщо користуватися Opus 5 два дні поспіль?
Mergo Smith : Користуюся ним два дні поспіль, але він мене повністю виснажує своїми нескінченними дискусіями.
І Тоді Їх Стало Три
Вперше за довгий час з'явилися три моделі ШІ, які мають бути частиною вашої команди з передових моделей, хоча вони походять лише з двох лабораторій: Fable 5, Opus 5 та Sol.
Якщо вам потрібно обслуговувати дешевші токени у великому масштабі, або вам потрібна відкрита модель, або і те, й інше, ви також розглянете додаткові варіанти, але це виходить за рамки цієї статті.
Як вам варто розподілити навантаження?
Як завжди, вам варто випробувати всі моделі для ваших завдань і вирішити самостійно. Це особливо актуально, коли ви обираєте між Sol та Claude.
Мій поточний інстинкт підказує, що якщо ви не обмежені лімітами використання, спочатку варто використовувати:
- Fable 5 для чатів, мозкових штурмів, планування, дискусій, навчання тощо, включаючи все, що потребує інтелекту, або коли вам потрібен «запах великої моделі».
- Fable 5 для моделі, яка контролює та запускає інші моделі як субагентів.
- Fable 5 для написання текстів, ймовірно, але я цим не займаюся, тому важко сказати.
- Sol для веб-пошуку та пов'язаних із ним обмежених запитів, а також подібних «робочих конячок» завдань, включаючи транскрипцію.
- Opus 5 для нетривіальних, чітко визначених завдань, включаючи більшість завдань з програмування.
- Opus 5 для ігор, створення ігор, 3D-об'єктів тощо.
- Opus 5 як субагент.
- Opus 5, коли ви натикаєтеся на класифікатори Fable.
Якщо вам більше до вподоби Sol, або ви віддаєте перевагу Codex над Claude Code, ви, ймовірно, захочете перенести частину завдань Opus на Sol.
Якщо ви особливо ненавидите спілкуватися з Opus 5, тоді вам варто перенести завдання на Fable або Sol, залежно від того, чи потребує завдання Fable, і наскільки обмежені ваші кредити Fable.
Я вважаю корисним ненадовго замислитися над рівнями зусиль. До недавнього часу я тримав усі моделі на максимальних зусиллях, за винятком того, що я лише зрідка використовував повний режим Pro у ChatGPT, оскільки це займає вічність, і якщо запускати його паралельно, він часто вилітає. Іноді я перемикався на Instant для запиту, де робив щось дуже просте, але на цьому все. Тепер часто вам не потрібні або не бажані додаткові зусилля, тому я активно витрачаю ті п'ять секунд, щоб подумати, чи варто використовувати налаштування High або Max, а іноді й Instant.
Для більшості завдань, якщо ви не обмежені в токенах або часі і не впевнені, що просто виконаєте завдання або отримаєте правильну відповідь, правильний метод — запустити і Fable, і Sol, або Opus і Sol, або в деяких випадках запустити всі три, а потім або вибрати найкращу відповідь, або об'єднати частини обох відповідей.
Ось що я робив. Sol, Opus і Fable — всі різні. Якби мені довелося вибрати лише одну модель для редагування, згідно з моїм неофіційним якісним EditorBench, існує чіткий порядок: Fable 5 > Opus 5 > Sol. Однак Sol пропонує достатньо унікальних зауважень, що, незважаючи на те, наскільки дратівливим я вважаю пробиратися крізь авторитетні хибні спрацьовування та спроби змусити мене змінити думку, я все одно хочу також запускати Sol.
Ймовірно, незабаром ми знову опинимося тут, роблячи те саме і коригуючи наші розподіли для Fable 5.1, для GPT-5.7 або GPT-6, або для обох. Легко втомитися від моделей.
Тому моя найголовніша порада — менше турбуватися про дрібні помилки у виборі моделі, а зосередитися лише на великих помилках. Вам не потрібно завжди все робити ідеально. Коли дослідження так швидко частково втрачають актуальність, ви хочете перемістити більше ресурсів із дослідження у використання.





