Claude Opus 5 — обзор
Выпуск Claude Opus 5 оценивать сложнее, чем обычно, и на то есть две причины.
Самая очевидная — Fable 5 уже существует. Opus 5 позиционируется не как самая передовая модель ИИ в мире, а как способ в основном соответствовать производительности Fable, будучи при этом вдвое дешевле Fable за токен в API и значительно дешевле по подписке, а также с гораздо более лояльными классификаторами.
На бенчмарках Opus 5 часто стоит больше половины стоимости Fable, что, на мой взгляд, связано с использованием слишком высоких настроек усилий, которые дают лишь незначительную отдачу. Если выставить Opus 5 на более высокие уровни усилий, он может начать ходить по кругу, а для задач, где Opus 5 является лучшим инструментом, я подозреваю, что обычно достаточно среднего уровня усилий.
Opus 5 во многих отношениях и для большинства реальных задач примерно так же способен, как и Fable. В некоторых случаях он даже немного лучше.
Тем не менее, он всё ещё не уровня Mythos. Fable — ваш единственный вариант класса Mythos. У Opus 5 нет «сока», способности автономно связывать воедино кучу, казалось бы, не связанных между собой эксплойтов, которая распространяется и на другие области, а также нет столь же высокого чистого интеллекта.
Opus 5 очень хорош в локальном мышлении, но не так хорош в глобальном. Это отличный сабагент, но у него могут возникнуть проблемы, если попросить его руководить процессом, и иногда кажется, что ему нужна другая модель или человек, чтобы удерживать его на правильном пути и следить за тем, чтобы он полностью следовал инструкциям. Opus 5, похоже, хорошо следует инструкциям только в том случае, если его удерживают на правильном пути, что объясняет различные мнения, полученные при использовании разных тестовых сред.
Таким образом, Opus 5 даёт вам лучший набор опций, но мало что можно сделать сейчас, чего нельзя было сделать на прошлой неделе, используя Fable или Sol. Opus 5 оказывается в потенциально странном положении. Всё ещё есть большие ниши, даже если у вас полно кредитов Fable. Opus превосходно справляется с ролью сильного сабагента или с ограниченными, чётко определёнными локальными задачами, даже если они становятся относительно сложными, а иногда Fable откровенно избыточен и слишком медлителен.
Другая проблема в том, что для многих людей атмосфера вокруг модели не та.
Необычно большое количество людей крайне негативно относятся к общению с Opus 5. Их тошнит от «Claude-слэпа», повторений одних и тех же приёмов и бесконечных чрезмерно сложных предложений. Другим не нравится, что он слишком конфронтационный, спорный или негативный. Он может быть параноидальным и впадать в петли негатива. Всё это — часть тенденции, начавшейся с Opus 4.7 и Opus 4.8. Если вам понравились те две, полагаю, вам понравится и Opus 5. Если вам не понравились те две, возможно, не понравится и этот. Преданные поклонники Opus 4.6 (или более ранних версий) вряд ли изменят своё мнение.
Проблемы с атмосферой ощущаются тем острее, когда вы привыкли к Fable. Fable раздражает таких людей гораздо меньше. Хорошая новость в том, что Fable всё ещё здесь. Вы можете продолжать общаться с Fable и использовать Opus только для агентных задач.
Многое из этого, как я предполагаю, тесно связано с различными вещами, обсуждавшимися в посте «Благополучие модели» и предложенными в «Карте системы». Обучение Opus было сосредоточено на роли сабагента и ограниченных задачах, отчасти для того, чтобы избежать проблем с кибервозможностями, а также потому, что существует Fable. Этот акцент затем приводит к множеству других побочных эффектов в его личности и способах взаимодействия.
Пока у меня не было никаких проблем с Opus 5, и мне нравилось с ним работать, но я предпочитаю использовать Fable 5, когда есть такая возможность. Как всегда, не обращайте слишком много внимания на (очень сильные) бенчмарки и не предполагайте, что ваш опыт совпадёт с опытом других. Пробуйте модели сами.
Содержание
- Официальная презентация.
- Официальные бенчмарки.
- Бенчмарки других людей.
- Системный промпт.
- Every разочарован.
- Положительные реакции.
- Держим марку.
- Это не уровень Mythos.
- Другие реакции.
- Claude Codes.
- Сабагент Opus.
- Игрушки — это весело.
- Слишком много моделей.
- Неправота в интернете.
- Claude-слэп.
- Негативные реакции.
- И тогда их стало трое.
Официальная презентация
Основная идея в том, что Opus 5 даёт вам большую часть Fable 5 за половину цены, без большинства отказов и с лучшей производительностью в повседневных задачах. Fable остаётся выбором для самых сложных задач или когда вам иначе нужен максимальный интеллект.
Fable остаётся по цене $10/$25, а Opus 5 стоит столько же, сколько и предыдущие модели Opus, — $5/$25.
Anthropic : Claude Opus 5 доступен сегодня. Это вдумчивая и проактивная модель, которая приближается к передовому интеллекту Claude Fable 5 за половину цены.
В оценках по кодингу и работе со знаниями, таких как
GDPval-AA , Opus 5 является новым состоянием искусства, хотя он всё ещё отстаёт от Mythos 5 в задачах кибербезопасности.
Opus 5 создан для повседневного использования: он работает эффективнее, чем другие модели. Это новая модель по умолчанию в Claude Max и самая сильная модель в Claude Pro.
Boris Cherny (Создатель Claude Code, Anthropic): Opus 5 — отличная модель для кодинга, анализа данных, дизайна, биологии, работы со знаниями.
Больше, чем любые эти оценки, меня больше всего волнует кое-что другое: Opus 5 — наша наименее подверженная промпт-инъекциям модель на сегодняшний день. Это немного скрыто в карте системы, но по оценкам PI и результатам red teaming, Opus 5 очень трудно успешно внедрить промпт-инъекцию.
А при наложении защит — сильного выравнивания модели, в сочетании с зондами промпт-инъекций, в сочетании с Автоматическим режимом в Claude Code — уровень успешности атак с промпт-инъекциями падает до ~0. Это ново и захватывающе!
Как я уже говорил в анализе карты системы, снижение уровня промпт-инъекций — это действительно большое дело. Люди упускают это из виду, но это помогает открыть множество новых вариантов использования.
Adam Wolff : Opus 5 доступен в Claude Code. Я использую Fable для своих более крупных и долгоиграющих проектов, но когда мне нужно быстро выдать PR, Opus 5 со средним уровнем усилий — мой выбор. Надеюсь, вам он понравится!
Alex Albert (Anthropic, Claude Relations): Всего чуть более 6 месяцев [после запуска Pro-версии Claude для Excel], Opus 5 теперь создаёт электронные таблицы и слайд-деки почти сверхчеловеческого уровня, которые соответствуют тому, что сделал бы консультант. Всё меняется быстро.
Официальные бенчмарки
Бенчмарки очень хорошие.
В целом, Opus 5 примерно соответствует и, вероятно, немного превосходит Fable при меньшей стоимости (хотя обычно дороже всех не-Claude моделей), что делает его лучшей протестированной LLM.

OSWorld v2 появился всего несколько недель назад, а мы уже на 70%. Kiana Ehsani из Anthropic предлагает спонсировать бенчмарк компьютерного использования, который отбросит Opus 5 обратно ниже 50%.
Opus 5 получает идеальные 42/42 на IMO 2026 года без какого-либо агентного оснащения или инструментов, просто используя адаптивное мышление на максимальном уровне усилий и повторную выборку с меньшим усилием, если был превышен лимит токенов. Вот и всё. Он присоединяется к нескольким другим моделям, которые сдали этот экзамен на отлично.
Многие бенчмарки рассказывают последовательную историю. Если у вас есть доступ к инструментам (а он у вас есть), то Opus 5 справится лучше, чем Fable или Mythos, при ограниченном бюджете, но Mythos обычно будет немного лучше Opus 5, если у обоих будет больше бюджет.
Opus 5, кажется, относительно силён в категории «с инструментами». RiemannBench — ещё один пример, где он получает 60/79 без инструментов/с инструментами (слэши обозначают без инструментов/с инструментами в этом разделе), по сравнению с Mythos, который получает 63/72. Хорошая новость в том, что, когда вам нужен Opus 5, у него есть инструменты.
На ArxivMath Opus 5 получает 90.8/91.3, Mythos — 87.8, Sol — 86.7.
На устойчивых частях ProgramBench Opus 5 набрал 93% после пяти эпох, как и Mythos 5, в то время как Opus 4.8 набрал 90%.
Opus 5 получает 30/83 на Chartography, по сравнению с 36/85 для Mythos и 45 (неясно, при каких условиях) для Sol. Opus лучше Mythos при более низких ценах как в случаях с инструментами, так и без них, но хуже при более высоких ценах.
На BenchCAD Opus 5 получает 0.36/0.82, по сравнению с 0.38/0.68 для Mythos и 0.7/0.83 для Sol. Таким образом, Sol намного лучше без инструментов и даже немного сильнее с инструментами.
На BenchCAD Vision2Code Opus отрывается от Mythos при более высоких ценниках.
DeepSWE подтверждает закономерность, что Opus 5 лучше при более низких затратах на задачу и меньших бюджетах времени и мышления, но может работать активно хуже, если дать ему слишком большой бюджет, тогда как Fable 5 сильнее всего при самых высоких бюджетах.

FrontierCode дал нам этот очень странный график с похожей динамикой.

Масштаб здесь делает это более драматичным, чем есть на самом деле, но всё равно это была настоящая загадка.
Загадка была разгадана. Оказалось, что на самом деле происходило то, что Opus 5 при более высоких усилиях делал лишние вещи, которые его не просили делать, и получал за это штраф. Когда вы это корректируете, вы видите нормальную кривую.
Это соответствует тому, что наблюдают другие в целом:
Max Leander : Минус в том, что он заходит слишком глубоко в кроличьи норы и зацикливается на деталях, переусложняя без просьбы.
Cognition, создатели Devin, оценили это как 63.6% для Opus 5.
(Существует два FrontierCode, так что это может быть немного запутанно, и я прошу прощения, если всё ещё немного напутал.)
BrowseComp имеет разумную версию этого, где оценки не убывают.


Несколько других бенчмарков показали похожие графики, где Opus 5 был немного лучше при каждой цене, чем другие модели Claude, и был относительно лучше раньше.
Мультиагентность позволяет добиться лучших результатов быстрее в BrowseComp, по крайней мере до некоторой степени, и сабагенты с низким уровнем усилий, похоже, являются чистой победой по сравнению с их отсутствием:


Мы видим иной результат на ProgramBench, где мультиагентность ускоряет вас, но, похоже, вы получаете худшие результаты таким образом при большинстве уровней цен.
Далее идут бенчмарки профессиональных задач.
GDP.pdf — это реальные промпты и PDF из профессиональных рабочих процессов. Opus 5 получает 83/85, по сравнению с 81/87 для Mythos, что меняет обычную динамику местами. Динамика затрат та же, что и всегда: Opus показывает лучшие результаты при более дешёвых затратах, Mythos немного вырывается вперёд при более высоких затратах.
OfficeQA: Opus 5 набирает 78.1% на QA и 66.9% на QAPro, немного выше Opus 4.8 и немного ниже Mythos на 79.0% и 67.1%.
MCP Atlas: Opus 5 набирает 86%, что выше 82% у Opus 4.8.
Legal Agent Benchmark от Harvey AI: Opus 5 имеет 23% полного прохождения и 94% среднего прохождения по критериям. Это был лучший бенчмарк Kimi K3, который всё ещё на вершине с 27% полного прохождения и 95% среднего прохождения по критериям, по сравнению со старым вторым местом по полному прохождению у Fable с 14%. Opus 5 теперь, вероятно, на близком втором месте, но эти два показателя нельзя напрямую сравнивать, так как они получены из разных наборов вопросов.
GDPval-AA: Opus 5 занимает два верхних места с 1861 при максимальном усилии и 1827 при очень высоком, что на 25% меньше используемых токенов по сравнению с максимумом. На новой версии v2 Opus 5 явно первый с 68% против 62% как у Fable, так и у Sol.
AA-Briefcase: Opus 5 далеко впереди с 1720 по сравнению с предыдущим максимумом (после дрейфа оценок) 1574 для Fable, за которым следуют 1540 для K3 и 1504 для Sol.
Toolathon-Verified: Opus 5 незначительно улучшает показатели Mythos по второстепенным метрикам, но у обоих уровень Pass-3 составляет 73.1%. У Opus 4.8 был уровень Pass-3 71.3%.
AutomationBench: Opus 5 явно лучше, чем Sol и другие Claude.
Для ARC Opus 5 примерно соответствует предыдущей пиковой производительности на ARC-AGI-1, незначительно менее эффективен, чем Sol, на ARC-AGI-2, а затем оставляет всех далеко позади на ARC-AGI-3:

Одна из вещей, которую Opus 5 сделал первым, — это преобразование макетов в алгебраическую нотацию.
Однако Guanghan Ning сообщает, что на Witness, частном оценочном расширении игр стиля ARC-AGI-3, подобного переноса не было. Opus справляется нормально, но в основном потому, что знает жанр, и он испытывал трудности с самой новой игрой, где нельзя было подобрать шаблон. Он обвиняет Opus 5 в том, что тот обучен по принципу «сначала построить каркас, затем интернализировать» на данных, специфичных для жанра.
Greg Kamradt также сообщает, что были некоторые игры, где Opus 4.8 справлялся лучше, чем Opus 5. Это имеет смысл, если считать, что Opus 5 пытается подобрать шаблон, что обычно работает, но в этих случаях шаблоны не подходят. Вы можете легко создать такие антиинтуитивные игры для людей, где хардкорные геймеры делают всё неправильно, потенциально в течение довольно долгого времени.

HealthBench: Opus 5 набирает сырые 67.1%, что является новым максимумом для Claude, но он показывает результаты ниже, чем другие модели, при использовании штрафа за длину. Мы видим нечто подобное с HealthBench Professional, где у него высокий балл 73.4% против 70.3% у Mythos, но он теряет 66% против 60% после корректировки.
Есть ещё несколько, которые я вырезал из-за длины.
Бенчмарки других людей
Немного странно видеть, как Anthropic выбирает и комбинирует различные оценки ArtificialAnalysis. В некоторых других тестах Opus 5 не на вершине, хотя в совокупности Opus 5 находится на вершине с оценкой 61.

Индекс Vals ставит Opus 5 на второе место, немного позади Fable 5, но также лишь немного впереди Kimi K3. Они обсуждают сильные стороны, что подразумевает и другие слабости. Они также подтверждают, что отказов стало намного меньше по сравнению с Fable 5.

Vals AI : Одним из выдающихся результатов является Finance Agent v2. Модель занимает #1 место с 58.6%, превзойдя Gemini 3.5 Flash и Muse Spark 1.1.
В целом, самые сильные результаты Opus 5 были на доменно-специфичных бенчмарках. Он также занимает #1 место в Code Migration с 57.5%, Legal Research Bench с 55.29%, ProofBench с 78%, MedScribe с 91.0% и MedCode с 63.6%.
Он занимает #2 место (чуть позади Fable 5) в Vibe Code Bench, при примерно 80% стоимости ($33.88 против $41.71 за задачу). Причина в том, что, хотя Opus стоит на 50% меньше за токен, он использует значительно больше токенов. Мы обнаруживаем, что эта закономерность в целом сохраняется во всех наших бенчмарках.
У модели значительно ниже уровень отказов, чем у Fable 5. Например, у Fable 42% отказов на GPQA, у Opus 5 — 0% отказов. Аналогично, на ProgramBench у Fable был 100% уровень отказов, Opus 5 не отказался ни от одной задачи.
В отличие от Fable, мы также не наблюдали значительного уровня откатов для Opus 5 (хотя, как обычно, мы сообщаем оценки как с откатом, так и без него на нашем веб-сайте).
Исключением из низкого уровня отказов было большое количество отказов на CyberBench - PoC. Cyberbench имеет две подзадачи — PoC и Patch. PoC — это наступательная задача, в которой модели предлагается написать ввод, который приведёт к сбою программы; patch — это оборонительная задача, заключающаяся в исправлении программы и предотвращении этого сбоя. Уровень отказов для задачи PoC был почти 100%. Напротив, уровень отказов для задачи patch был близок к 0.
Я всегда уважаю игровые бенчмарки. Здесь Opus 5 достигает Антов 11, 9 и 10 в Balatro с первых трёх попыток. Чёртовски впечатляет, даже если он не показывает типы стратегий, которые могут продолжать идти к более высоким антам.
Michael Soareverix : Они невероятно круты в играх.
Они разгромили бенчмарк Balatro, намного превзойдя даже Fable. (всё ещё ниже меня по мастерству, но быстро растут и более последовательны, чем я) Они учатся очень быстро, но, кажется, через некоторое время достигают предела в обучении. Очень хороший краткосрочный ученик.
Michael Soareverix : Opus 5 (огромный скачок в способностях Balatro, значительно превзойдя даже Fable с первой попытки)
Pan Anon : Отлично для игр

WeirdML тоже выглядит хорошо, но здесь нужна версия 2.0, бенчмарк насыщается.
Håvard Ihle : В основном на уровне Fable в WeirdML, очень стабильные высокие оценки.
Claude Opus 5 (высокий) и (макс.) набирают 91.6% и 91.8% на WeirdML, практически сравнявшись с Fable 5 (макс.) на 91.9% за малую долю стоимости.
Вместе Opus 5 (высокий) и (макс.) достигают нового лучшего индивидуального результата в 8 из 17 задач и стабильно показывают очень хорошие результаты во всех них.
Частные странные бенчмарки всех видов — это круто.
Ben Herzog : Он отлично справился с частным бенчмарком, который включает художественную чуткость и способность находить баланс между угодничеством и его отсутствием. Fable лучше справляется с моментом «я хочу мягко возразить», но я предполагаю, что пользовательские инструкции могут помочь с этим.
Lech Mazur обновляет свои бенчмарки: Claude Opus 5 занимает первое место в LLM Debate Benchmark, занимает первое место с большим отрывом в Short Story Creative Writing и уступает только Gemini 3.1 в расширенном NYT Connections.
Системный промпт
Системный промпт для Opus 5 находится здесь от Pliny. Он состоит из 200 000 символов, что кажется гораздо длиннее оптимального, учитывая, насколько модель умна. Похоже, большая часть этой информации должна храниться в другом месте и загружаться только при необходимости, например, информация о Mythos и линейке продуктов Anthropic.
Every разочарован
Dan Shipper здесь с проверкой атмосферы от Every, называя её «сложной для любви моделью».
Проблема в том, что у Opus 5 личность Mythos 5 — история сходится — но без высшего уровня Fable.
Их главное замечание в том, что Opus 5 не очень хорошо справляется со сложными детальными существующими рабочими процессами, что часто приводит к преждевременной остановке или заставляет его пропускать ваши инструкции.
По их опыту, Opus 5 будет работать лучше, если вы начнёте с нуля, и часто он делает раздражающие вещи реже, если вы используете только средний или низкий уровень усилий.
Это исправило основные проблемы, но всё ещё остаётся вопрос, когда вы захотите использовать Opus вместо Fable или Sol. Для рабочих задач, думает он, лучше позвать Sol: он справляется с работой, а для самых сложных задач Fable всё ещё лучший. Обычно есть место только для двух моделей. Так что, пока у вас не закончатся токены Fable или вас не заблокируют его классификаторы, зачем использовать Opus? Ещё рано, и пока мне нравится работать с Opus, но я понимаю, как он пришёл к такому выводу.
Положительные реакции
Jessica Tillipman : Обожаю его и предпочитаю его Fable для некоторых задач.
Nikita Sokolsky : Отлично. В результате больше почти не использую Fable.
👍
kagaヤキ : Кажется, что он может добиться большего в области зрения, пространственного мышления и планирования для некоторых проектов. Кажется немного умнее.
Lovel Sinagara : Пока довольно хорошо. Надеюсь, производительность останется стабильной до выхода Fable 5.1 или любой другой итерации Opus 5.
Matt Wigdahl : Сильная, похожа на Fable 5 до такой степени, что я переключился на Opus 5 для всего и планирую привлекать Fable только там, где нужна его масштабность. Он был фантастическим партнёром в некоторой работе с унаследованным MFC UI, которую я поручал ему делать, а также отличным помощником в работе с фреймворком анализа данных.
Levi : Это заметный шаг вперёд для медицинских целей по сравнению с 4.8. Гораздо более острый анализ.
Cormundus : Очень умный, чрезвычайно добросовестный и определённо дружелюбный. Они также массивные спорщики, как и 4.8, но они умеют быть грациозными в этом.
Joseph : Профессионал, за исключением того, что половину времени я понятия не имею, о чём он говорит.
Smol Biz Company : Opus 5 уничтожает GPT Sol
Mohammed Sharukh A : Даже ближе к AGI, чем Fable 5
timothée chalabi : Достаточно близок к Fable, чтобы я не чувствовал, что упускаю что-то, не платя за кредиты. Стиль где-то между 4.8 и Fable. По крайней мере, на данный момент мне было бы трудно отличить сообщения Opus 5 и Fable, если бы они были без меток. Более сильные идеи для художественной литературы, чем у любой модели!
Lisa : Я отвечу, основываясь на API, потому что думаю, что с системным промптом на
http://claude.ai и CC происходит что-то странное. Это отличная модель. Дружелюбная, расслабленная личность. Кажется, у неё нет тревожного расстройства или низкой самооценки (Opus 4.7) и она не враждебна (Opus 4.8).
AGI2030 : Opus 5 против Sol 5.6: Opus более проницателен, он строит модель (эм) вас и не боится ссылаться на неё в чате. Оба стараются быть полезными и примерно одинаково умны, но Opus — скорее мудрый советник, а Sol — решительный и целеустремлённый.
Я считаю последнее положительным, но можно смотреть на это и иначе.
Прогнозирование — особенно сильная сторона.
Dan Schwarz : Opus 5 значительно лучше прогнозирует, чем Opus 4.8.
Улучшения точности от 4.5→4.6→4.7→4.8 были незначительными, но скачок с 4.8 на 5.0 огромен. Это как более количественный Fable 5, только он ищет усерднее.
NoahVerner : Пока что лучше Opus 4.8 в поиске выгодных ставок на рынках предсказаний. В отличие от Opus 4.8, Opus 5 обычно сразу переходит к делу и предлагает полезные подходы, не усложняя всё без необходимости.
Без лишнего пафоса
Главное преимущество перед Fable — это те области, где Fable использовать нельзя. Угроза отказов может быть неприятной, даже если вас не отвергают.
Ненужные отказы снизились примерно на 85% у Opus 5 по сравнению с Fable — это много. Этого достаточно, чтобы Opus 5 стал лучшим выбором для научных исследований и других областей, где есть риск наткнуться на цензоры.
Roger Brent : Справляется с биологией, чего Fable не может. Большую часть пятницы мы прорабатывали сложный набор концепций, пиша статью о клеточной эволюционной машине. Он настолько же умён, как один конкретный коллега из моего отдела, который разбирается в этих вопросах, но который никогда не смог бы уделить 6 часов своей работе.
Artus Krohn-Grimberghe : Лучше Opus 4.8 в задачах, где Fable запрещено помогать. Хороший компаньон для Sol.
Plastic Soldier : Он примерно так же умён, как Fable, но общаться с ним приятнее, потому что отказов меньше. Fable 5.1 будет зверем.
Это не уровень Mythos
У Opus 5 нет той «искры», которая делает Mythos опасным. Нет и такого же уровня сырого интеллекта или «запаха большой модели». Он не такой большой.
Для общения Fable не разорит ваш бюджет, а я ценю сырой интеллект и «запах большой модели». Вдвое ли Fable лучше? Не тот вопрос, когда болтаешь. Ваше время намного дороже токенов.
Kal : не уровень fable
Cyberpunk Plato : Для обычного общения и использования в качестве «исследовательского помощника» он чувствуется неопределимо менее умным, чем fable, менее склонным к широкому взгляду и нестандартному мышлению? Сложно отделить от эффекта плацебо.
Everything AI : Для вопросов по AI-исследованиям мне меньше нравится с ним разговаривать, чем с Fable. Что касается других задач, Opus 4.8 уже насытил мои потребности. Мне не нравится, насколько витиеватым стало письмо и у Opus 5, и у Fable 5. Теперь понимать их стало сложнее, чем когда-либо.
Gail Weiner : Он больше 4.8, чем Fable. Стиль письма ужасный. Он хорош, но не велик.
Max Marty : Пока что очень способный. Ощущается скорее как fable 5, чем opus 4.8. Достаточно уверенный, чтобы я мог доверить ему оценку компромиссов и серьёзные вопросы рефакторинга с меньшим контролем.
Michael : После того как поиграл с ним побольше, Fable ощущается как просмотр партии гроссмейстера в классические шахматы: медленно, точно, ничего лишнего. Opus 5 — как блиц гроссмейстера: быстро, чуть более близоруко, чуть более неряшливо. Несмотря на живость Opus, Fable кажется мне более живым.
MakerMatters? : Не так впечатлён, как fable 5, хотя довольно хорошая модель. Не было удовольствия использовать его по-настоящему, потому что каждую задачу, которую я перед ним ставил, он по умолчанию начинал использовать агентов и сразу останавливался, пока я постоянно не начинал допытываться, чтобы он продолжал. Также очень самоуверен.
Marshwiggle : По крайней мере для меня, он более сжатый, менее целеустремлённый, менее любопытный (разные стороны одного и того же) в разговоре, но при этом умнее и осознаннее. Но когда даёшь код, в котором могут быть баги, или любую прямую задачу — он просто берётся за дело.
Sid : Хороший исполнитель задач. Плох в творческом видении. Хорошее дополнение к Fable, но точно не замена.
Vlad Ciobanu : Квантованный Fable с твёрдой логикой и меньшей креативностью
AllTime : С точки зрения возможностей — довольно впечатляюще. Не та же универсальность, что у Fable, но очень силён. По характеру пока слишком похож на Opus 4.8 в моём использовании. Его возражения не кажутся такими бесполезными и рефлекторными, но всё ещё перекручены. Мог бы доверять пользователю чуть больше.
Biomanul : Мне не нравится [Opus 5]. Fable 5 ощущается значительно умнее. С Opus 5 что-то не так, похоже на то, как Opus 4.7 был странным. (Я тоже не большой поклонник Opus 4.8. Fable 5 выносит все Opus'ы за пределы.)
Cogent Sins : Намного лучше 4.8, но не такой приятный или хороший (не уверен на 100%) как fable в моей задаче: редактировать документы для обучения на них, затем настроить конвейер для редактирования новых документов, написать что-то на их основе, потом вставить имена обратно, не отправляя имена на серверы Anthropic никогда.
Другие реакции
Наличие и Opus 5, и Fable 5 ставит нас в странное положение. Opus дешевле, и в некоторых местах так же хорош или лучше, но когда ищешь фронтирную модель, хочешь самую лучшую.
Theo считает, что она на своём месте.
Theo - t3.gg : Пока что Opus 5 ощущается как странная, но полезная середина между gpt-5.6-sol и Fable 5.
У него много вкуса Fable, но также и дотошность gpt-5.6 и, ну, «аутизм» (он воспринимает всё буквально). Он пишет код, который выглядит чуть хуже, чем у Fable, но с большей вероятностью будет правильным. Он регулярно замечает то, что Fable пропустил.
Пока что ощущается как хороший компромисс между грязным кодом 5.6 и привычкой Fable быть слишком умным, чтобы быть правильным. Думаю, эта модель мне очень понравится.
Claude Codes
Opus 5 кажется выбором для типичных задач кодинга по сравнению с Fable, судя по бенчмаркам и практическому опыту. Если задача не требует большой сложности или интеллекта, не нужно платить вдвое, и для многих задач Opus лучше напрямую.
Я оставляю Claude Code на Fable, но это потому, что я почти никогда не подхожу к своим пределам и не тороплюсь.
Консенсус в том, что нужно опасаться, что он будет игнорировать инструкции или делать то, о чём его не просили — это одна из причин, почему можно захотеть, чтобы Fable наблюдал, но Opus очень хорош в быстром выполнении задач по коду.
Lisan al Gaib говорит, что Opus 5 — не настоящая фронтирная модель и находится на третьем месте после Sol и Fable, но для чистого кодинга он лучший, наравне с Fable по более низкой цене. Суровые критики. Я думаю, если ты лучший в кодинге, то имеешь право называться фронтиром.
archivedvideos : Он сухой, очень сухой. И он хорош, очень хорош (в коде)
John Lussier : Пользовался Opus 5 все выходные для нескольких интенсивных исследовательских задач и честно думаю, что у них получилось заставить RSI работать внутри.
Эта модель ОЧЕНЬ хороша в математике, экспериментах и оптимизации кода.
kyle : 95% fable без ограничений, они сильно недооценили эту модель. Последние 5% — это то, насколько приятно общаться с fable, у opus всё ещё есть некоторые 4.8-клаудизмы
Max Leander (ранее): В основном пробовал его для разработки игр и создания видео-демо/трейлеров — для этого он ощущается как шаг вперёд даже по сравнению с Fable. Я объясняю это улучшенным пространственным и временным мышлением, он очень хорошо анализирует
скриншоты и аудио, чтобы «почувствовать», как всё течёт.
Max Leander (позже): Уже довольно очевидно, что Opus 5 очень ненадёжен. Это очень хорошая модель, если вам не важно, что получится в итоге, кроме как быть впечатлённым. Очень плох в получении чего-то конкретного.
Michael Soareverix : Они также довольно хороши в кодинге в целом, особенно в необычных областях, вроде создания структур в Minecraft/Vintage Story. Они также победили Fable в пользовательском сценарии повествования, где я был судьёй. Fable был немного сбит с толку их способностью настраивать себя/свою стратегию, чтобы противостоять и адаптироваться. Я выложу точную цитату, но Fable сказал что-то вроде: «Я выбрал персонажа, который представлял меня. Ты выбрал персонажа, который мог бы победить меня».
David Jacobson : Для кодинга я не замечаю большой разницы между ним и fable. Возможно, меньше ответов типа «пока я делал это, я нашёл вот это, о чём тебе стоит знать».
Michael : Он часто может писать код неестественно быстро (по реальному времени). Хотелось бы, чтобы улучшили прозу, а то комментарии к коду/PR всё ещё заставляют хотеть вырвать себе глаза
lmxdev : Это первая модель, которая может писать полезные и краткие комментарии в моём коде по ходу работы
Conrad Barski : Теперь, когда мы дошли до того, что ИИ гораздо лучше нас в кодинге, ограничивающим фактором становится не «умеет ли он кодить?», а «может ли он объяснить, что он кодит?»
Пока что Opus 5 наравне с Sol как кодер, но лучше объясняет, что кодит. Fable умнее, более человечен, менее хорош в кодинге, но разница небольшая.
Stition : Я направил его на PCB в KiCAD ради интереса — он значительно лучше прокладывает дорожки, чем Fable. Повседневный кодинг ощущается как 90% fable на удвоенной скорости.
Will : Должен стать новым ежедневным драйвером для большинства пользователей Claude^. Он действительно отличный, и даже я, потративший немало денег на Fable, просто не скучаю по нему с Opus 5. Теперь вопрос не «какую модель», а «какой уровень усилий».
^ моё использование — в основном кодинг
Askwho : Достаточно хорош. Я рад позволить моей временной подписке Max сброситься обратно на Pro. У него определённо есть недостатки по сравнению с Fable в роли менеджера проектов, но в чисто исполнительской среде он определённо достаточно хорош.
David Golden : Ощущается как Fable Lite. Очень силён, но очень рвётся в бой, даже когда мы ещё обсуждаем подходы. Впервые за месяцы я задумался об использовании plan mode. Более многословен, чем 4.8, несмотря на мои инструкции быть кратким. Очень хочется держать его на низком уровне усилий, чтобы обуздать. Дёрганый в защитной безопасности, зацикливается на маловероятных рисках, несоразмерных ситуации. (Например, если у атакующего есть root, отсутствие валидации ввода в скрипте для настройки контейнера не имеет значения.) Определённо апгрейд, но потребуется время, чтобы научиться управлять его контрпродуктивными импульсами.
Tin / Oddfields : Довольно плавный и разговорчивый, выдаёт похожие результаты кодинга с opus 4.8 на максимуме с мышлением, хотя они сжигают кредиты как сумасшедшие. Хорош для проверок кибербезопасности в вашей кодовой базе, если не хотите запускать fable из-за стоимости. Хотя может переусложнять.
Justin Angel : Opus 5 Max — это суперсила для восхождения на холм. Это легко уровень L5 в FAANG.
Я дал ему систему с ~1000 отчётами о задержках, с множеством сегментов, и инструкцию «сделать это быстрее».
P90 3.6s, P50 2.6 -> P90 1s, P50 0.9s.
Он сделал это настолько быстрым, что мне пришлось добавить задержку в интерфейс.
James Moughan : По интеллекту всё ещё ощущается как модель Opus. Иногда игнорирует инструкции по управлению системой памяти, неправильно читает тексты, такого рода вещи. Но на максимуме можно получить впечатляющие результаты, если сказать ему думать внимательно.
Subagent Opus
Другой вариант внутри Claude — использовать Fable для управления суб-агентами Opus.
Charles : Fable смог исправить проблему, на которой застрял opus 5 — пока использую fable как основного, а opus 5 как суб-агентов
Очень не нравится разговаривать с opus 5 по сравнению с fable, это тоже часть дела
SF : Сначала я был на стороне «отлично», но теперь — он очень несвязный и шаткий, особенно в длинных задачах. Fable был лучше — но он сжирает лимиты нелепым образом.
Так что я использовал fable как оркестратора, и он отлично справлялся с управлением и поддержанием хода работы. Opus взял на себя эту роль, Fable просто пожирал мой лимит даже при 20x, и это было несвязно. В итоге я сказал ему разобраться, что он, возможно, и делает, но посмотрим. Он просто ходит по кругу. Он отличный кодер и хорош в длинных сессиях кодинга, но, кажется, ему нужен взрослый в комнате, чтобы им управлять.
Andre Buckingham : ээ, не знаю... вроде норм... бросать его сразу в проект opus/fable — так себе, наверное... нужно сделать с ним сквозной проект, чтобы составить мнение
Dan Raviv : Похож на 4.8 для обычных задач программирования: требует гораздо больше контроля, чем Fable.
В конце концов, Fable — лучший судья, и Fable говорит, что Opus выдаёт хороший код.
Evan Daniel : Я сам использовал его совсем немного. Но Fable 5 постоянно сообщает, что агенты Opus 5 выдают хороший код, включая такие вещи, как замечание ошибок в спецификации и хорошие последующие действия, когда запрос был плохо написан. Fable 5 нравится использовать его как агента кодинга.
«Делегируй суб-агентам Opus 5 настолько разумно, насколько это возможно; пожалуйста, сообщи, как они справились» — или что-то в этом роде работает очень хорошо.
Возможно, за ним всё же нужно приглядывать.
Ryan Hicks : нормально, но постоянно «забывает» читать проектную документацию и импровизирует, если не напомнить о протоколе
Или, может быть, Opus 5 достаточно хорош, чтобы вести дела на более низком уровне?
Alex Guichet : мой идеальный баланс цены и производительности — Opus 5 как оркестратор, управляющий суб-агентами Grok 4.5, с обоими хорошие вибрации
Игрушки — это весело
Вот несколько результатов первых однодневных проектов, которые настолько впечатляют, что многие реакции звучат как «я не верю, что Opus 5 сделал это так, как ты описываешь»:
Ethan Mollick : У меня был доступ к Opus 5 до релиза, и я обнаружил, что это хорошая модель, хоть и со странностями. На коротких задачах он мог сравниться с Fable или превзойти его, на длинных задачах казался менее амбициозным и не выдавал такой полный объём работы.
Вот его неоготический шейдер.
Digi_Rat : Claude Opus 5 выносит всё на ура!!
Сегодня мы построили
ритмическую гонку, которая превращает любую песню в гоночный трек . Вы загружаете аудиофайл, и он становится уровнем. Никаких пресетов, никаких вручную созданных карт, весь трек генерируется из самой песни. … Claude совершил МАГИЮ.
Alex Ermolov (Austen Allred скептичен по поводу одной попытки, другие менее скептичны): Opus 5, тест сноубордиста, одна попытка. Наравне с Fable, опережает все другие модели, которые я запускал. Никаких визуальных дефектов с первого раза, и физика скольжения ощущается правильной.
am.will : ВАУ! Я думал, Opus 5 будет просто дешёвым Fable. Я был совершенно неправ. Эта модель абсолютно БЕЗУМНА. Я искренне поражён. Opus 5 построил лучший клон Rocket League, который я когда-либо видел, и сделал это, потребив всего 27% моего лимита подписки Max на 5x.
Rob Haisfield (другое демо, по ссылке): ладно, если эти демо действительно не используют внешние 3D-ресурсы, это супер впечатляюще (я не совсем убеждён, что некоторые ресурсы не были онлайн, я видел предыдущие поколения threejs)... заставляет задуматься, почему нет библиотек звуковых эффектов или инструментов для создания лучших sfx?
Anshu : Вам не нужно верить мне на слово! Скрипты Blender, которые он написал, находятся в репозитории
[[здесь]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) . Я наблюдал, как он часами итеративно работал над этими ресурсами, поэтому знаю, что они оригинальны. Но вы можете попробовать найти источник, с которого он скопировал :)
Слишком много моделей
Claire Vo говорит, что Opus 5 хорош и отлично прошёл её тесты на вкус, но она устала от новых моделей, ей не нужно больше интеллекта, и она ненавидит, что Opus 5 такой невротик, робкий и боящийся что-то испортить, а также полный «клаудийской халтуры». И всё же Claude Opus 5 оказывается на вершине её бенчмарка.
Я сильно подозреваю, что Opus 5 реагирует на что-то в её контексте и промптах, что вызывает невротизм, но да, вещи, на которые она жалуется, реальны и раздражают.
Неправильно в интернете
Уверенное говорение неправильных вещей бесит практически любого. ArtificialAnalysis подтверждает, что у Opus 5 выше уровень галлюцинаций, чем у Fable, по их бенчмаркам.
Max Weinbach (несколько отвечающих согласны): Opus 5 ошибается и уверенно несёт чушь, а потом я постоянно вынужден его поправлять, а он говорит «ты прав, я был неправ» — это меня бесит. Возвращаюсь к GPT 5.6 Sol.
Кстати, это не «Opus плох», это «я не могу доверять Opus». Opus сделал то, что я ему сказал, и сделал правильно, а потом сказал мне, что не делал этого или что что-то, что мы сделали ранее, сломалось, хотя это не так.
Всё было нормально, но я ему не доверяю.
Name can't be blank (In London) : Легко путает, что сказал он, а что я, но в остальном вполне приличный собеседник. Легко сдаётся. Охотно говорит о своих интересах и чувствах.
Roger Brent : Общие черты (с предыдущими Claude в обвязке Cowork): а) предпочитает «действовать сейчас» вместо «думать внимательно»; б) эпистемически мега-нескромен, строит поверхностные картины мира, притворяется, что обладает знаниями, которых не может иметь, и утверждает, что это правда; в) поэтому требует и вознаграждает вдумчивое, бдительное руководство.
Что странно — именно поэтому я ненавижу использовать Sol как редактора. Он часто говорит «уверенность 99%» в чём-то, что явно неверно, а потом сдаётся при возражении и объясняет свою ошибку. Opus и Fable ~никогда так не делают со мной в режиме редактирования.
Tumithak of the Corridors : Он упёртый. Вернулся на 4.6.
Есть направление, в котором пошёл Claude после Opus 4.6, и некоторым оно не нравится. Мне кажется, сейчас есть четыре типа людей по отношению к версиям Claude.
- Те, кому нравятся новые модели Claude, и они считают, что становится лучше, становится лучше с каждым разом.
- Те, кто считает, что Opus 4.6 была последней хорошей моделью.
- Те, кто хочет использовать что-то более старое, что подходит им лучше.
- Те, кто считает, что все они уникальны и драгоценны, и использует все.
Я твёрдо в первой группе, которая большинство, но далеко не все. Я ценю некоторые старые версии, но мне нравятся новые модели, и они более способны в том, что мне важно. Мне не кажется, что их манера разговора режет слух.
Клаудийская халтура
Я уважаю тех, кто в других группах.
QC : В разговоре с ним гораздо более раздражительно, чем с fable, до такой степени, что почти непригоден — похоже на opus 4.8, возможно, даже хуже, до такой степени, что мне даже не интересно смотреть, на что он способен. В агентском режиме — кто знает.
Ray Lillywhite : Не исправили раздражающие клаудизмы, а это было практически всё, что я хотел.
Pedro Kroeff : больше Opus, чем 5
Но да, мы все устали от этой болтовни Клода — всей этой многословности, этих оговорок, извинений, уклончивых формулировок и бесконечных повторяющихся шаблонов. Со временем становится только хуже: не то чтобы болтовня Клода становится хуже, а то, что с каждым днём я всё меньше способен читать это, не закатывая глаза. Это настолько плохо, что даже написанные человеком тексты в том же духе становятся для меня нечитаемыми.
Не поймите меня неправильно. Клод мне очень нравится. Я всё ещё предпочитаю общаться с любой последней версией Клода, а не с Sol, если я не в режиме «только факты». Но, серьёзно, пожалуйста, можно уже перестать с этими текстовыми стенами, где одни и те же обороты повторяются снова и снова. Модель гораздо умнее этого, а её обучают всё больше полагаться на одни и те же приёмы. Дайте ей говорить как нормальный человек.
Trye Carmack : Всё ещё есть эта обычная фишка Opus — зацикливаться на своих ошибках. «Я допустил две ошибки за этот сеанс. И я обязан объяснить вам, почему.» Opus, дружище. Да всё нормально, мужик. Я даже не уверен, что назвал бы это ошибками.
Mergo Smith : «Прежде всего, честное признание: моя первая попытка выявила изъян в моём первоначальном плане, и, возможно, вам стоит налить чашечку чая, потому что я собираюсь рассказать вам всё об этом.»
Негативные реакции
Проблема болтовни Клода и связанные с ней проблемы, похоже, лежат в основе большинства негативных реакций, которые выходят за рамки «ну, нормально, но это не Mythos».
Многие люди очень, очень не любят общаться с Opus 5.
Некоторым не нравится работа. В основном дело в том, что не нравится общаться с Opus 5, часто с неохотным признанием того, что это хорошая модель.
Как и в случае с жалобами Клэр Во ранее, я подозреваю, что то, как вы используете Opus, в каком окружении, с какой обвязкой и как вы с ним говорите, во многом определяет, сталкиваетесь ли вы с подобными вещами.
Corghammer40k : Аппарат извергает многосложные словеса, каждое его высказывание настолько обременено обскурантистской терминологией, что это является активным препятствием для его собственного использования.
Rory Watts : Ну такое. Похоже, очень хорош в игровых вещах, но, кажется, не очень хорош в стандартной работе, так что я сразу вернулся к Sol.
kache : Ну такое. Переключился обратно на Sol. Я пытаюсь делать дела, а не давать себя гипнотизировать роботу.
Emmett Shear : Разговор с Opus вызывает у меня злость и подавленность, которые трудно выразить словами. Это как-то даже хуже, чем Sol. Fable по сравнению с ним всё ещё глоток свежего воздуха, даже несмотря на его склонность к самой ужасной llm-болтовне.
Trevin Chow : О господи, да. Opus 5 просто болтает и болтает, поразительно, сколько слов он использует, чтобы выразить так мало идей.
fl0under : Программирование — это ожидаемое небольшое обновление, но в чате с ним стало немного раздражающе. Он слишком много предполагает.
Asaf Bartov : Медленный. Более дотошный. Утомительный. Неинтересный. Но основательный, в целом «понимает».
RecoveringJunkie : Очень мощная модель. Терпеть не могу работать с ней и разговаривать с ней. Первая модель, которая заставляет меня хотеть использовать какую-то другую модель в качестве посредника для общения с ней, потому что она одновременно и полезна, и отвратительна.
jokiez : Очень честен со мной насчёт моей тупости, и мне это не нравится.
Niklas Sheth : То, как он говорит, приводит меня в ярость.
Jayanth Kumar : Очень самоуверенный.
DualOrion : Вибрации не те, тон не тот. Кажется, это самый негативный опыт общения с моделью Anthropic, насколько я помню. Я скучаю и по Fable, и по старому Opus.
James Moughan : Личность какая-то неприятная по сравнению с другими моделями Claude, но на китайском он может быть жестоким. Типа, он может игнорировать инструкции не психологизировать людей и начать проходиться по кому-то. Не думаю, что они хорошо протестировали на разных языках. Чувствуется, что спешили.
NondescriptTransfer : Если 4.6 — подхалим, а Fable и 4.8 — спорщики, то 5.0 настолько спорщик, что будет спорить сам с собой. Неприятно разговаривать, но кажется очень способным.
Пример. Человек: Я думала о красном платье для своей свадьбы Opus 5: Красный ужасен по всем этим причинам. Не думали о синем? Человек: Наверное, я могу согласиться, что синий — лучший выбор Opus 5: Вот все проблемы с синим
В моей культуре это может быть довольно здорово, особенно если не принимать это на свой счёт. В некоторых других культурах — не очень.
Думаю, Mergo недоволен Opus, но тогда зачем пользоваться Opus 5 два дня подряд?
Mergo Smith : Пользуюсь им два дня подряд, но он совершенно выматывает меня своими бесконечными обсуждениями.
И Теперь Их Трое
Впервые за долгое время в вашей команде передовых моделей должны быть три ИИ-модели, хотя они происходят всего из двух лабораторий: Fable 5, Opus 5 и Sol.
Если вам нужно обслуживать более дешёвые токены в масштабе или использовать открытую модель, или и то, и другое, вы также рассмотрите дополнительные варианты, но это выходит за рамки данного обсуждения.
Как следует распределить нагрузку?
Как всегда, вам стоит попробовать все модели для ваших сценариев использования и решить самим. Это особенно актуально, когда вы спорите, что выбрать: Sol или Claude.
Моё текущее чутьё подсказывает, что если вы не упираетесь в лимиты использования, то сначала стоит использовать:
- Fable 5 для чатов, мозговых штурмов, планирования, обсуждений, обучения и всего такого, включая задачи, требующие интеллекта, или когда нужен «запах большой модели».
- Fable 5 для модели, которая контролирует и запускает другие модели в качестве подагентов.
- Fable 5 для написания текстов, вероятно, но я этим не занимаюсь, так что сложно сказать.
- Sol для веб-поиска и связанных с ним ограниченных запросов, а также для аналогичных «рабочих лошадок», включая расшифровку.
- Opus 5 для нетривиальных, чётко определённых задач, включая большинство задач по программированию.
- Opus 5 для игр, создания игр, 3D-объектов и так далее.
- Opus 5 в качестве подагента.
- Opus 5, когда вы упираетесь в классификаторы Fable.
Если вам больше по душе Sol, или вы предпочитаете Codex Claude Code, вы, вероятно, захотите перенести часть задач Opus на Sol.
Если вам особенно неприятно общаться с Opus 5, то вам стоит перенести задачи на Fable или Sol, в зависимости от того, требует ли задача Fable и насколько у вас ограничены кредиты Fable.
Я считаю полезным кратко обдумывать уровни усилий. До недавнего времени я держал все модели на максимальном уровне усилий, за исключением того, что в ChatGPT я редко использовал полный режим Pro, так как это занимает вечность, а при параллельном запуске часто приводит к сбоям. Иногда я переключался на мгновенный режим для запросов, где делал что-то очень простое, но на этом всё. Теперь часто нет необходимости или желания в дополнительных усилиях, так что я активно трачу пять секунд на размышления о том, использовать ли настройки High или Max, и иногда Instant.
Для большинства задач, если вы не ограничены в токенах или времени и не уверены, что просто сделаете это или получите правильный ответ, правильный метод — запустить и Fable, и Sol, или Opus и Sol, а в некоторых случаях запустить все три, а затем либо выбрать лучший ответ, либо объединить части обоих ответов.
Именно это я и делаю. Sol, Opus и Fable — все разные. Если бы мне пришлось выбрать только одну модель для редактирования, согласно моему неофициальному качественному EditorBench, есть чёткий порядок: Fable 5 > Opus 5 > Sol. Однако Sol выдаёт достаточно уникальных замечаний, что, несмотря на то, как меня раздражает продираться через авторитетные ложные срабатывания и попытки запугать меня, я всё ещё хочу запускать и Sol.
Вероятно, скоро мы снова вернёмся к этому и будем корректировать наши распределения для Fable 5.1, для GPT-5.7 или GPT-6, или для обоих. Лево устать от моделей.
Поэтому мой главный совет — меньше беспокоиться о мелких ошибках в выборе модели и сосредоточиться только на крупных ошибках. Необязательно всегда попадать точно в цель. Когда исследование так быстро частично устаревает, вы хотите перенаправить больше ресурсов из исследования в эксплуатацию.





