Claude Opus 5 é um lançamento mais estranho do que o normal para avaliar, por dois motivos.
O mais óbvio é que o Fable 5 já existe. O Opus 5 não é apresentado como o modelo de IA mais avançado do mundo, mas como uma forma de igualar em grande parte o desempenho do Fable, custando metade do preço do Fable por token na API e muito mais barato por assinaturas, e com classificadores muito mais permissivos.
O Opus 5 geralmente custa mais da metade do Fable para rodar em benchmarks, o que acho que acontece porque eles usam configurações de esforço muito altas que oferecem retornos apenas marginais. Se você colocar o Opus 5 em níveis de esforço mais altos, ele pode ficar girando em círculos, e para tarefas onde o Opus 5 é a melhor ferramenta, suspeito que você geralmente se sai bem com esforço Médio.
O Opus 5 é, em muitos aspectos e para a maior parte das tarefas do mundo real, praticamente tão capaz quanto o Fable. Em alguns casos, é um pouco melhor.
Ainda não é da classe Mythos. O Fable é sua única opção da classe Mythos. O Opus 5 não tem O Suco, a capacidade de encadear autonomamente uma série de explorações aparentemente não relacionadas, que se estende a outros domínios, ou tanta inteligência pura.
O Opus 5 é muito bom em pensar localmente, e não tão bom em pensar globalmente. É um excelente subagente, mas pode encontrar problemas quando solicitado a comandar o espetáculo, e às vezes parece precisar de outro modelo ou de um humano para mantê-lo no rumo e garantir que está seguindo totalmente as instruções. O Opus 5 parece ser bom em seguir instruções se e somente se for mantido no rumo, o que explica diferentes configurações gerando diferentes opiniões.
Assim, o Opus 5 oferece um conjunto de opções melhor, mas há pouco que você pode fazer agora que não podia fazer na semana passada usando o Fable ou o Sol. O Opus 5 acaba em um lugar potencialmente estranho. Ainda existem grandes nichos, mesmo que você tenha muitos créditos do Fable. O Opus se destaca como um forte subagente, ou em tarefas locais bem definidas e contidas, mesmo quando são relativamente complexas, e às vezes o Fable é exagero e muito lento.
O outro problema é que, para muitas pessoas, a vibração não está boa.
Um número anormalmente grande de pessoas não gosta muito de conversar com o Opus 5. Elas estão cansadas do "Claude slop", das repetições dos mesmos tiques e das infinitas frases excessivamente complexas. Outros não gostam que ele seja muito confrontador, argumentativo ou negativo. Ele pode ser paranóico e entrar em loops de negatividade. Isso tudo faz parte da tendência que começou com o Opus 4.7 e o Opus 4.8. Se você gostou desses dois, meu palpite é que também vai gostar do Opus 5. Se você não gostou desses dois, talvez não goste. Os fãs mais ferrenhos do Opus 4.6 (ou anterior) provavelmente não vão mudar de ideia.
Os problemas de vibração doem ainda mais quando você está acostumado com o Fable. O Fable incomoda essas pessoas muito menos. A boa notícia é que o Fable ainda está lá. Você pode continuar conversando com o Fable e usar o Opus apenas para tarefas de agente.
Muito disso, eu especulo, está intimamente relacionado a várias coisas discutidas no post sobre Model Welfare e sugeridas pelo System Card. O treinamento do Opus focou no papel de subagente e em tarefas delimitadas, em parte para evitar criar um problema com capacidades cibernéticas, e também porque o Fable existe. Essa ênfase resulta em muitos outros efeitos colaterais em sua personalidade e modos de interação.
Até agora, não tive nenhum problema com o Opus 5 e gostei do tempo que passei com ele, mas prefiro usar o Fable 5 quando posso. Como sempre, não preste tanta atenção nos benchmarks (muito fortes) e não presuma que sua experiência será igual à dos outros. Experimente os modelos você mesmo.
Índice
- O Discurso Oficial.
- Benchmarks Oficiais.
- Benchmarks de Outras Pessoas.
- O Prompt de Sistema.
- Todo Mundo Fica Frustrado.
- Reações Positivas.
- Mantenha a Classe.
- Não É da Classe Mythos.
- Outras Reações.
- Claude Codifica.
- Subagente Opus.
- Brinquedos São Divertidos.
- Modelos Demais.
- Errado na Internet.
- Claude Slop.
- Reações Negativas.
- E Então Restaram Três.
O Discurso Oficial
A proposta básica é que o Opus 5 oferece a maior parte do Fable 5 pela metade do preço, sem a maioria das recusas, e com melhor desempenho em tarefas cotidianas. O Fable continua sendo a escolha para as tarefas mais complexas ou quando você precisa de inteligência máxima.
O Fable permanece em $10/$25, e o Opus 5 tem o mesmo preço dos modelos Opus anteriores: $5/$25.
Anthropic : O Claude Opus 5 já está disponível. É um modelo atencioso e proativo que se aproxima da inteligência de fronteira do Claude Fable 5 pela metade do preço.
Em avaliações de codificação e trabalho de conhecimento como
GDPval-AA , o Opus 5 é o novo estado da arte, embora ainda fique atrás do Mythos 5 em tarefas de cibersegurança.
O Opus 5 foi projetado para ser usado diariamente: ele funciona de forma mais eficiente do que outros modelos. É o novo modelo padrão no Claude Max e o modelo mais forte no Claude Pro.
Boris Cherny (Criador do Claude Code, Anthropic): O Opus 5 é um ótimo modelo para codificação, análise de dados, design, biologia, trabalho de conhecimento.
Mais do que qualquer uma dessas pontuações de avaliação, o que mais me empolga é outra coisa: o Opus 5 é o nosso modelo menos sujeito a injeção de prompt até agora. Está um pouco enterrado no system card, mas em todas as avaliações de PI e testes de red team, o Opus 5 é muito difícil de ser injetado com sucesso.
E ao combinar defesas -- forte alinhamento do modelo, combinado com sondas de injeção de prompt, combinado com o Modo Automático no Claude Code -- a taxa de sucesso para ataques de injeção de prompt cai para ~0. Isso é novo e empolgante!
Como eu disse na análise do system card, a taxa reduzida de injeção de prompt é algo realmente importante. As pessoas estão subestimando isso, mas ajuda a viabilizar vários novos casos de uso.
Adam Wolff : O Opus 5 está ativo no Claude Code. Eu uso o Fable para meus projetos maiores e mais longos, mas quando preciso criar um Pull Request rapidamente, o Opus 5 com esforço médio é minha escolha. Espero que você ame!
Alex Albert (Anthropic, Relações Claude): Pouco mais de 6 meses [após lançar o Pro rollout do Claude para Excel], o Opus 5 agora produz planilhas e apresentações de slides quase sobre-humanas que correspondem ao que um consultor faria. As coisas estão mudando rápido.
Benchmarks Oficiais
Os benchmarks são muito bons.
No geral, o Opus 5 corresponde aproximadamente e provavelmente supera ligeiramente o Fable, com custo menor (embora tipicamente maior do que todos os modelos não-Claude), tornando-se o LLM mais bem classificado nos benchmarks.

O OSWorld v2 tem apenas algumas semanas e já estamos em 70%. Kiana Ehsani, da Anthropic, está se oferecendo para patrocinar um benchmark de uso de computador que fará o Opus 5 cair para abaixo de 50%.
O Opus 5 obtém um perfeito 42/42 na OIM de 2026 sem qualquer harness de agente ou ferramentas, apenas usando pensamento adaptativo no esforço Máximo e reamostrando com esforço menor se excedesse o limite de tokens. É só isso. Ele se junta a vários outros modelos que gabaritaram isso.
Muitos dos benchmarks contam uma história consistente. Se você tem acesso a ferramentas, o que tem, então o Opus 5 terá um desempenho melhor que o Fable ou o Mythos com um orçamento limitado, mas o Mythos geralmente terá um desempenho ligeiramente melhor que o Opus 5 se ambos tiverem orçamentos maiores.
O Opus 5 parece relativamente forte na categoria 'com ferramentas'. RiemannBench é outro exemplo, onde ele obtém 60/79 sem/com ferramentas (barras assim significam sem/com ferramentas ao longo desta seção), contra 63/72 do Mythos. A boa notícia é que, quando você precisa do Opus 5, ele tem ferramentas.
No ArxivMath, o Opus 5 obtém 90,8/91,3, o Mythos obtém 87,8, o Sol obtém 86,7.
Nas partes robustas do ProgramBench, o Opus 5 pontuou 93% após cinco épocas, assim como o Mythos 5, com o Opus 4.8 pontuando 90%.
O Opus 5 obtém 30/83 no Chartography, contra 36/85 do Mythos e 45 (não está claro em quais condições) do Sol. O Opus é melhor que o Mythos em faixas de preço mais baixas tanto nos casos com ferramentas quanto sem ferramentas, mas pior em faixas de preço mais altas.
No BenchCAD, o Opus 5 obtém 0,36/0,82, contra 0,38/0,68 do Mythos e 0,7/0,83 do Sol. Então o Sol é muito melhor sem ferramentas, e ligeiramente mais forte mesmo com ferramentas.
No BenchCAD Vision2Code, o Opus se distancia do Mythos em preços mais altos.
O DeepSWE reforça o padrão de que o Opus 5 é melhor com custos de tarefa, tempo e orçamentos de pensamento mais baixos, mas pode ter um desempenho ativamente pior se você der a ele muito orçamento, enquanto o Fable 5 é mais forte nos orçamentos mais altos.

O FrontierCode nos deu este gráfico muito estranho com uma dinâmica semelhante.

A escala aqui faz isso parecer mais dramático do que é, mas ainda assim foi um verdadeiro mistério.
O mistério foi resolvido. Acontece que o que estava acontecendo era que o Opus 5 em esforços mais altos estava fazendo coisas extras que não lhe foram pedidas, e estava sendo penalizado por isso. Quando você corrige isso, vê uma curva normal.
Isso corresponde ao que outros estão observando em geral:
Max Leander : O lado negativo é que ele entra em muitos becos sem saída e se preocupa com detalhes, superengenharia sem que lhe peçam
Cognition, os criadores do Devin, marcaram isso como 63,6% para o Opus 5.
(Existem dois FrontierCodes, então isso pode ficar um pouco estranho e peço desculpas se ainda errei um pouco.)
O BrowseComp tem a versão sã disso, onde as pontuações não são decrescentes.


Vários outros benchmarks mostraram gráficos semelhantes, com o Opus 5 sendo ligeiramente melhor em cada faixa de preço do que outros modelos Claude, e sendo relativamente melhor no início.
O multiagente permite que você melhore mais rápido no BrowseComp, pelo menos até certo ponto, e subagentes de baixo esforço parecem ser uma vitória pura em relação a não usar subagentes:


Vemos um resultado diferente no ProgramBench, onde o multiagente acelera, mas parece que você obtém resultados piores dessa forma na maioria das faixas de preço.
A seguir estão os benchmarks de tarefas profissionais.
O GDP.pdf são prompts e PDFs do mundo real de fluxos de trabalho profissionais. O Opus 5 obtém 83/85, contra 81/87 do Mythos, invertendo a dinâmica usual. A dinâmica de custo é a mesma de sempre: Opus se sai melhor com gastos mais baixos, Mythos fica ligeiramente à frente com gastos mais altos.
O OfficeQA tem o Opus 5 pontuando 78,1% em QA e 66,9% em QAPro, ligeiramente acima do Opus 4.8 e ligeiramente abaixo do Mythos com 79,0% e 67,1%.
O MCP Atlas tem o Opus 5 pontuando 86%, acima dos 82% do Opus 4.8.
O Legal Agent Benchmark da Harvey AI tem o Opus 5 com 23% de aprovação total e 94% de aprovação média de critério. Este foi o melhor benchmark do Kimi K3, onde ele ainda está no topo com 27% de aprovação total e 95% de aprovação média de critério, contra a antiga segunda taxa de aprovação total do Fable com 14%. O Opus 5 é agora provavelmente um segundo próximo, mas as duas pontuações não podem ser comparadas diretamente, pois vêm de conjuntos de perguntas diferentes.
O GDPval-AA tem o Opus 5 ocupando as duas primeiras posições, com 1861 no esforço máximo e 1827 no xhigh, que usa 25% menos tokens que o máximo. No novo v2, o Opus 5 é claramente o primeiro com 68% contra 62% do Fable e do Sol.
O AA-Briefcase tem o Opus 5 na frente por uma boa margem com 1720, contra um recorde anterior de (após desvios de pontuação) 1574 para o Fable, seguido por 1540 para o K3 e 1504 para o Sol.
O Toolathon-Verified tem o Opus 5 melhorando ligeiramente o Mythos em métricas secundárias, mas ambos têm 73,1% de taxas Pass-3. O Opus 4.8 tinha uma taxa Pass-3 de 71,3%.
O AutomationBench tem o Opus 5 claramente melhor que o Sol e outros Claudes.
Para o ARC, o Opus 5 corresponde aproximadamente ao desempenho máximo anterior no ARC-AGI-1, é moderadamente menos eficiente que o Sol no ARC-AGI-2, e depois arrasa com todos no ARC-AGI-3:

Uma coisa que o Opus 5 foi o primeiro a fazer foi transformar os layouts em notação algébrica.
Guanghan Ning, no entanto, relata que no Witness, uma extensão privada de hold-out de jogos estilo ARC-AGI-3, não houve uma transferência semelhante. O Opus se sai bem, mas isso se deve em grande parte ao fato de conhecer o gênero, e ele teve dificuldade no jogo mais inovador onde não era possível fazer correspondência de padrões. Ele acusa o Opus 5 de ser treinado em 'scaffold-then-internalize' em dados específicos de gênero.
Greg Kamradt também relata que houve alguns jogos onde o Opus 4.8 foi melhor que o Opus 5. Isso faz sentido se você acha que o Opus 5 está tentando fazer correspondência de padrões, de uma forma que geralmente funciona, mas nesses casos os padrões falham. Você pode absolutamente criar esses jogos anti-intuitivos para humanos, onde jogadores hardcore fazem todas as coisas erradas, potencialmente por um bom tempo.

O HealthBench tem o Opus 5 pontuando 67,1% brutos, um novo recorde para os Claudes, mas ele pontua abaixo dos outros modelos quando você usa uma penalidade de comprimento. Vemos algo semelhante com o HealthBench Professional, onde ele tem a pontuação mais alta de 73,4% contra 70,3% do Mythos, mas perde de 66% para 60% após o ajuste.
Existem mais alguns que cortei por questão de tamanho.
Benchmarks de Outras Pessoas
É um pouco estranho ver a Anthropic escolhendo a dedo diferentes pontuações do ArtificialAnalysis. Em alguns outros testes, o Opus 5 não está no topo, embora o Opus 5 esteja no topo no agregado com uma pontuação de 61.

O índice Vals coloca o Opus 5 em segundo lugar, ligeiramente atrás do Fable 5, mas também apenas ligeiramente à frente do Kimi K3. Eles analisam os pontos fortes, o que implica outras fraquezas. Eles também confirmam que as recusas diminuíram muito em comparação com o Fable 5.

Vals AI : Um desempenho de destaque é no Finance Agent v2. O modelo é o #1 com 58,6%, superando o Gemini 3.5 Flash e o Muse Spark 1.1.
No geral, os resultados mais fortes do Opus 5 foram em benchmarks específicos de domínio. Ele também é o #1 em Code Migration com 57,5%, Legal Research Bench com 55,29%, ProofBench com 78%, MedScribe com 91,0% e MedCode com 63,6%.
É o #2 (logo atrás do Fable 5) no Vibe Code Bench, com cerca de 80% do custo ($33,88 vs $41,71 por tarefa). A razão é que, embora o Opus custe 50% menos por token, ele usa significativamente mais tokens. Descobrimos que esse padrão geralmente se mantém em todos os nossos benchmarks.
O modelo tem uma taxa de recusa significativamente menor do que o Fable 5. Por exemplo, o Fable tem uma taxa de recusa de 42% para o GPQA, o Opus 5 tem uma taxa de recusa de 0%. Da mesma forma, no ProgramBench, o Fable teve uma taxa de recusa de 100%, o Opus 5 não recusou nenhuma tarefa.
Ao contrário do Fable, também não observamos uma taxa de fallback significativa para o Opus 5 (embora, como de costume, relatem as pontuações com e sem fallback em nosso site).
A exceção à baixa taxa de recusa foi o grande número de recusas no CyberBench - PoC. O Cyberbench tem duas subtarefas - PoC e Patch. PoC é uma tarefa ofensiva para modelos escreverem uma entrada que travará um programa; patch é uma tarefa defensiva para corrigir o programa e evitar essa trava. A taxa de recusa para a tarefa PoC foi de quase 100%. Em contraste, a taxa de recusa para a tarefa patch foi próxima de 0.
Eu sempre respeito os benchmarks de jogos. Aqui, o Opus 5 chega aos Antes 11, 9 e 10 do Balatro em suas três primeiras tentativas. Impressionante, mesmo que não esteja mostrando os tipos de estratégias que podem continuar para antes mais altos.
Michael Soareverix : Eles são incrivelmente bons em jogos.
Eles arrasaram no benchmark do Balatro, superando até mesmo o Fable. (ainda abaixo de mim em habilidade, mas subindo rapidamente e mais consistente do que eu) Eles aprendem muito rápido, mas parecem atingir um limite no aprendizado depois de um tempo. São muito bons aprendizes de curto prazo
Michael Soareverix : Opus 5 (salto enorme na habilidade no Balatro, ultrapassando significativamente até mesmo o Fable na primeira tentativa)
Pan Anon : Fumando em jogos

O WeirdML também parece bom, mas precisamos de um 2.0 aqui, o benchmark está ficando saturado.
Håvard Ihle : Basicamente nível Fable no WeirdML, pontuações máximas muito consistentes.
Claude Opus 5 (alto) e (máx) pontuam 91,6% e 91,8% no WeirdML, basicamente empatando com o Fable 5 (máx) com 91,9% por uma fração do custo.
Juntos, Opus 5 (alto) e (máx) alcançam uma nova melhor pontuação individual em 8 das 17 tarefas, e consistentemente pontuam muito bem em todas elas.
Benchmarks privados estranhos de todos os tipos são legais.
Ben Herzog : Ele foi genial em um benchmark privado que envolve sensibilidade artística e a capacidade de equilibrar bajulação com sua ausência. O Fable é melhor em lidar com o momento de 'quero contestar gentilmente', mas imagino que instruções personalizadas podem ajudar com isso.
Lech Mazur atualiza seus benchmarks: Claude Opus 5 assume a primeira posição no LLM Debate Benchmark, fica em primeiro por uma ampla margem em Short Story Creative Writing, e é segundo apenas para o Gemini 3.1 em conexões estendidas do NYT.
O Prompt de Sistema
O prompt de sistema para o Opus 5 está aqui do Pliny. Tem 200.000 caracteres, o que parece muito mais longo do que o ideal, dado o quão inteligente ele é. Muita dessa informação parece que deveria ser armazenada em outro lugar e carregada apenas quando necessário, como informações sobre o Mythos e a linha de produtos Anthropic.
Todo Mundo Fica Frustrado
Dan Shipper está aqui com a vibe check do Every, chamando-o de 'um modelo difícil de amar.'
O problema é que o Opus 5 tem a personalidade do Mythos 5 - a história se confirma - mas sem o topo de linha do Fable.
A maior observação deles é que o Opus 5 não se sai tão bem com fluxos de trabalho complexos e detalhados existentes, o que muitas vezes causa uma parada precoce ou faz com que ele perca suas instruções.
Na experiência deles, o Opus 5 se sai melhor se você começar do zero, e muitas vezes faz as coisas irritantes com menos frequência se você usar apenas esforço médio ou baixo.
Isso corrigiu os grandes problemas, mas ainda deixa a questão de quando você gostaria de usar o Opus em vez do Fable ou do Sol. Para tarefas de trabalho pesado, ele está pensando: Melhor Chamar o Sol, ele faz o trabalho, e para as tarefas mais difíceis, o Fable ainda é o melhor. Geralmente há apenas dois slots para modelos. Então, até que você fique sem tokens do Fable ou seja bloqueado por seus classificadores, por que usar o Opus? Ainda é cedo, e até agora estou gostando de trabalhar com o Opus, mas entendo como ele chegou a essa conclusão.
Reações Positivas
Jessica Tillipman : Adoro e prefiro ao Fable para algumas coisas.
Nikita Sokolsky : Excelente. Não uso mais muito o Fable como resultado.
👍
kagaヤキ : Parece que pode ir mais longe em visão, raciocínio espacial e planejamento para alguns projetos. Parece um pouco mais inteligente.
Lovel Sinagara : Muito bom até agora. Espero que o desempenho permaneça consistente até o Fable 5.1 ou qualquer outra iteração do Opus 5.
Matt Wigdahl : Forte, semelhante ao Fable 5 a ponto de eu ter trocado para o Opus 5 em tudo e planejo usar o Fable apenas onde preciso da grandeza. Ele tem sido um parceiro fantástico em alguns trabalhos legados de UI MFC que estou pedindo para ele fazer, além de uma grande ajuda com um framework de análise de dados.
Levi : É um avanço notável para fins médicos em comparação com o 4.8. Análise muito mais precisa
Cormundus : Muito inteligente, altamente consciencioso e definitivamente com cara de amigo. Eles também são um grande debatedor como o 4.8, mas sabem como ser elegantes nisso.
Joseph : Pró, exceto que não faço ideia do que ele está falando metade do tempo.
Smol Biz Company : Opus 5 destrói o GPT Sol
Mohammed Sharukh A : Ainda mais perto da AGI do que o Fable 5
timothée chalabi : Próximo o suficiente do Fable para que eu não sinta que estou perdendo algo por não pagar por créditos. O estilo está em algum lugar entre o 4.8 e o Fable. Pelo menos no momento, eu teria dificuldade em diferenciar mensagens do Opus 5 e do Fable se elas não fossem identificadas. Ideias mais fortes para ficção do que qualquer modelo!
Lisa : Vou responder com base na API, porque acho que algo estranho está acontecendo com o prompt de sistema em
http://claude.ai e CC. É um ótimo modelo. Personalidade amigável e relaxada. Não parece ter um transtorno de ansiedade ou baixa autoestima (Opus 4.7), nem ser adversarial (Opus 4.8).
AGI2030 : Opus 5 vs Sol 5.6: Opus é mais perceptivo, ele constrói um modelo (ehm) de você e não tem medo de referenciá-lo em uma conversa. Ambos tentam ser úteis e são aproximadamente igualmente inteligentes, mas Opus é mais um conselheiro sábio, enquanto Sol é um determinado realizador.
Considero essa última positiva, mas você pode ver de qualquer forma.
Previsão, em particular, parece forte.
Dan Schwarz : Opus 5 é um previsor significativamente melhor que o Opus 4.8.
As melhorias de precisão dos agentes 4.5->4.6->4.7->4.8 foram marginais, mas de 4.8->5.0 é grande. É como um Fable 5 mais quantitativo, que pesquisa mais.
NoahVerner : Melhor que o Opus 4.8 no que diz respeito a encontrar vantagens em mercados de previsão até agora, ao contrário do Opus 4.8, o Opus 5 geralmente vai direto ao ponto e sugere abordagens úteis em vez de complicar as coisas.
Mantenha a Classe
As maiores vantagens sobre o Fable são aqueles lugares onde o Fable não pode ser usado. A ameaça de recusas pode ser desagradável, mesmo quando você não é recusado.
As recusas desnecessárias caíram ~85% para o Opus 5 em comparação com o Fable, o que é muito. Isso é suficiente para tornar o Opus 5 uma escolha melhor para pesquisa científica e outras áreas onde você corre o risco de acionar classificadores.
Roger Brent : Capaz de lidar com biologia, o que o Fable não consegue. Na maior parte da sexta-feira trabalhamos em um conjunto complexo de conceitos escrevendo um artigo sobre uma máquina de evolução celular. Tão inteligente quanto um colega específico do meu departamento que lidera nessas questões, mas que nunca poderia dispensar 6 horas do próprio trabalho.
Artus Krohn-Grimberghe : Melhor que o Opus 4.8 em tarefas onde o Fable está proibido de ajudar. Um bom companheiro para o Sol.
Plastic Soldier : É tão inteligente quanto o Fable, mas é mais agradável porque tem menos recusas. O Fable 5.1 vai ser um monstro.
Não é da Classe Mythos
Opus 5 não tem o Suco que torna o Mythos perigoso. Nem tem o mesmo nível de inteligência bruta ou cheiro de modelo grande. Não é tão grande.
Para conversa, o Fable não vai quebrar seu orçamento, e eu valorizo inteligência bruta e cheiro de modelo grande. O Fable é duas vezes melhor? Pergunta errada quando se está conversando. Seu tempo é muito mais caro que os tokens.
Kal : não é nível fable
Cyberpunk Plato : Para conversa geral e uso como "assistente de pesquisa", parece indefinidamente menos inteligente que o fable, menos inclinado a pensar grande e fora da caixa talvez? Difícil de separar do efeito placebo
Everything AI : Para perguntas de pesquisa em IA, gosto menos de conversar com ele do que com o Fable. Em termos de fazer outras coisas, o Opus 4.8 já tinha saturado minhas necessidades. Não gosto de como a escrita é complicada tanto para o Opus 5 quanto para o Fable 5. Agora é mais difícil entendê-los do que nunca.
Gail Weiner : É mais 4.8 do que Fable. O estilo de escrita é horrível. É bom, mas não ótimo.
Max Marty : Muito capaz até agora. Parece mais com fable 5 do que opus 4.8. Confiante o suficiente para que eu possa deixá-lo avaliar trade-offs e considerar grandes questões de refatoração com menos supervisão.
Michael : Depois de brincar mais com ele, Fable parece algo como assistir a um GM jogar xadrez clássico, lento, preciso, sem desperdício. Opus 5 é como um GM jogando xadrez blitz: rápido, um pouco mais míope, um pouco mais bagunçado. Apesar da vitalidade do Opus, o Fable me parece mais vivo
MakerMatters? : Não fiquei tão impressionado quanto com o fable 5, embora seja um modelo bastante bom. Não tive o prazer de usá-lo adequadamente, pois toda tarefa que joguei nele, ele usa agentes e para imediatamente até eu cutucar constantemente para continuar. Também muito opinativo.
Marshwiggle : Pelo menos para mim, parece mais conciso, menos motivado, menos curioso (aspectos diferentes da mesma coisa) em conversa, mas também mais inteligente e mais consciente. Mas quando recebe código que pode ter bugs, ou qualquer tarefa direta, ele simplesmente vai em frente.
Sid : Bom executor de tarefas. Ruim em visão criativa. Um bom complemento para o Fable, definitivamente não um substituto para o Fable.
Vlad Ciobanu : Fable quantizado com raciocínio sólido e menos criatividade
AllTime : Em termos de capacidades, parece bastante impressionante. Não é a mesma generalidade do Fable, mas muito forte. Em termos de personalidade, é um pouco parecido demais com o Opus 4.8 no meu uso até agora. Sua resistência não parece tão inútil e reflexiva, mas ainda é excessiva. Poderia confiar um pouco mais no usuário.
Biomanul : Eu não gosto do [Opus 5]. O Fable 5 parece consideravelmente mais inteligente. Algo parece errado no Opus 5, semelhante a como o Opus 4.7 parecia errado. (Também não sou um grande fã do Opus 4.8. O Fable 5 supera todos os Opuses.)
Cogent Sins : Muito melhor que o 4.8, mas não tão bom ou tão agradável (não tenho 100% de certeza) quanto o fable na minha tarefa de redigir documentos para treiná-los e depois configurar um pipeline para redigir novos documentos, escrever algo com base neles e depois reinserir os nomes, sem enviar nomes para os servidores da anthropic.
Outras Reações
Ter tanto o Opus 5 quanto o Fable 5 nos coloca em uma posição estranha. Opus é mais barato e, em alguns lugares, tão bom ou melhor, mas quando se procura um modelo de fronteira, você quer o melhor.
Theo acha que está em uma boa posição.
Theo - t3.gg : Até agora, o Opus 5 parece um meio-termo estranho, mas útil, entre o gpt-5.6-sol e o Fable 5.
Tem muito do gosto do Fable, mas também vem com a minúcia e, bem, o "autismo" do gpt-5.6 (leva tudo muito ao pé da letra). Ele escreve código um pouco pior de se olhar do que o Fable, mas com maior probabilidade de estar correto. Regularmente, pega coisas que o Fable perdeu.
Até agora, parece um bom compromisso em comparação com o código bagunçado do 5.6 e o hábito do Fable de ser muito esperto para estar correto. Acho que vou gostar muito desse modelo.
Claude Codifica
Opus 5 parece ser a escolha para tarefas típicas de codificação em vez do Fable, com base tanto em benchmarks quanto em experiências práticas. A menos que a tarefa exija muita complexidade ou inteligência, você não precisa pagar o dobro, e para muitos, Opus é diretamente melhor.
Estou deixando o Claude Code configurado para Fable, mas isso porque quase nunca chego perto dos meus limites e não estou com pressa.
O consenso é que você precisa se preocupar com ele ignorar instruções ou fazer coisas que você não pediu, o que é uma razão para querer que o Fable supervisione, mas que Opus é muito bom em realizar tarefas de codificação rapidamente.
Lisan al Gaib diz que Opus 5 não é um verdadeiro modelo de fronteira e está em terceiro atrás de Sol e Fable, mas que para codificação pura é o melhor, igualando Fable a preços mais baratos. Público difícil. Acho que se você é o melhor em codificação, então merece ser chamado de fronteira.
archivedvideos : Ele é seco, muito seco. Ele também é bom, muito bom (em código)
John Lussier : Usei o Opus 5 durante todo o fim de semana em vários desafios intensos de pesquisa e, honestamente, acho que eles podem ter feito o RSI funcionar internamente.
Este modelo é MUITO bom em matemática, experimentação e otimização de código.
kyle : 95% do fable sem as salvaguardas, eles subestimaram isso enormemente. Esse último 5% é o quão bom o fable é para conversar, opus ainda tem alguns dos claudismos do 4.8
Max Leander (anteriormente): Testei principalmente para desenvolvimento de jogos e criação de demos/trailers em vídeo, e para isso parece uma mudança de patamar até mesmo em relação ao Fable. Atribuo isso à melhoria no raciocínio espacial e temporal, ele é muito bom em analisar
capturas de tela e áudio para "sentir" como as coisas fluem.
Max Leander (posteriormente): Bastante óbvio agora que o Opus 5 é muito pouco confiável. É um modelo muito bom, desde que você não se importe com o resultado além de ficar impressionado. Muito ruim em conseguir algo específico para você.
Michael Soareverix : Eles também são muito bons em codificação em geral, especialmente em domínios mais incomuns como construir estruturas no Minecraft/Vintage Story. Eles também derrotaram o Fable em um cenário personalizado de contação de histórias onde eu era o juiz. Fable ficou um pouco abalado com a capacidade deles de se personalizar/adaptar sua estratégia para contra-atacar e se adaptar. Vou postar a citação exata, mas Fable disse algo como "Eu escolhi um personagem que me representava. Você escolheu um personagem que poderia me vencer."
David Jacobson : Para codificação, não noto uma grande diferença entre ele e o fable. Talvez menos respostas do tipo "enquanto eu fazia isso, encontrei essa outra coisa que você deveria saber".
Michael : Ele geralmente codifica incrivelmente rápido (em relação ao tempo real). Gostaria que melhorassem a escrita em prosa, os comentários de código/PR ainda me fazem querer arrancar meus olhos
lmxdev : É o primeiro modelo que encontrei que consegue escrever comentários úteis e concisos no meu código enquanto trabalha
Conrad Barski : Agora que estamos chegando ao ponto em que as IAs são codificadoras muito melhores do que nós, o fator limitante é menos "ela consegue codar?" e mais "ela consegue explicar o que está codando?"
Até agora, Opus 5 parece estar no mesmo nível de Sol como codificador, mas melhor em explicar o que está codando. Fable é mais inteligente, mais humano, menos bom em codificação, mas a diferença é pequena.
Stition : Apontei para uma PCB no KiCAD por diversão e é significativamente melhor em traçar trilhas do que o Fable. A codificação do dia a dia parece 90% do fable com o dobro da velocidade.
Will : Deve ser o novo motorista diário da maioria dos usuários do Claude^. É realmente excelente, e mesmo como alguém que gastou uma boa quantia em Fable, simplesmente não sinto falta com o Opus 5. A questão agora é "qual nível de esforço", não qual modelo.
^ meu uso é principalmente codificação
Askwho : Bom o suficiente. Estou feliz em deixar minha assinatura Max temporária voltar para Pro. Definitivamente tem algumas deficiências em comparação com o Fable no espaço de gerente de projetos, mas no ambiente de tarefas puras, é definitivamente bom o suficiente.
David Golden : Parece Fable Lite. Muito forte, mas muito ansioso para entrar em ação, mesmo quando ainda estamos discutindo abordagens. Primeira vez em meses que considerei usar o modo de plano. Mais prolixo que o 4.8 também, apesar das minhas instruções de comunicação concisas. Estou muito tentado a mantê-lo em baixo esforço para contê-lo. Nervoso em segurança defensiva, fixando-se em riscos implausíveis desproporcionais à situação. (Ex.: se o atacante tem root, a falta de validação de entrada em um script para configurar um contêiner é irrelevante.) Definitivamente uma atualização, mas vai levar tempo para aprender as maneiras certas de gerenciar seus impulsos contraproducentes.
Tin / Oddfields : Bastante suave e conversacional, e produz resultados de codificação semelhantes ao opus 4.8 no máximo com pensamento, embora queimem créditos como loucos. Bom para verificações de segurança cibernética em suas bases de código se você não quiser executar o fable devido aos custos. Embora possa complicar demais.
Justin Angel : Opus 5 Max é um superpoder de escalada de colinas. Isso é trabalho de nível SWE L5 na FAANG facilmente.
Dei a ele um sistema que tinha ~1000 relatórios de latência com muitos segmentos com um prompt sobre como "torná-lo mais rápido".
P90 3.6s, P50 2.6 -> P90 1s, P50 0.9s.
Ele o tornou tão rápido que tive que introduzir um atraso na interface.
James Moughan : Em termos de inteligência, ainda parece um modelo Opus. Às vezes ignora as instruções para gerenciar o sistema de memória, lê textos errados, esse tipo de coisa. Mas você pode obter alguns resultados impressionantes no máximo se disser para pensar com cuidado.
Subagente Opus
A outra opção dentro do Claude é ter o Fable dirigindo subagentes Opus.
Charles : Fable conseguiu corrigir um problema em que o opus 5 estava preso - usando fable como principal e subagentes opus 5 por enquanto
Realmente não gosto de conversar com opus 5 vs fable, o que também é parte disso
SF : Eu estava do lado ótimo - mas agora estou do lado de que é muito desconexo e instável, especialmente em tarefas longas. Fable era melhor - mas consome seus limites de forma ridícula.
Então eu estava usando fable como orquestrador e ele estava fazendo um trabalho incrível gerenciando e mantendo as coisas em movimento. Opus assumiu esse papel, Fable estava apenas consumindo meu uso mesmo a 20x, e é desconexo. Finalmente tive que dizer a ele para resolver, o que talvez esteja fazendo, mas vamos ver. Ele parece perseguir o próprio rabo. É um ótimo codificador e ótimo em longas execuções de codificação, mas parece precisar de um adulto na sala para dirigi-lo.
Andre Buckingham : eh não sei... parece ok... jogá-lo diretamente em um projeto opus/fable é meio meh talvez... preciso de um projeto ponta a ponta com ele para dar uma opinião adequada
Dan Raviv : Semelhante ao 4.8 para tarefas de programação em geral: precisa de muito mais supervisão do que o Fable.
Fable é o melhor juiz, afinal, e Fable diz que Opus produz bom código.
Evan Daniel : Usei diretamente muito pouco. Mas o Fable 5 relata consistentemente que os agentes Opus 5 produzem bom código, incluindo coisas como notar erros de especificação e produzir bons acompanhamentos quando o pedido foi mal escrito. O Fable 5 gosta dele como agente de codificação.
"Delegue para subagentes Opus 5 o máximo que for razoável; por favor, informe como eles se saíram" ou qualquer coisa nesse sentido funciona muito bem.
Você talvez tenha que ficar de olho.
Ryan Hicks : ok, mas consistentemente "esquece" de ler a documentação do projeto e faz improvisações a menos que você o lembre do protocolo
Ou talvez Opus 5 seja bom o suficiente para tocar um show de nível inferior?
Alex Guichet : minha mistura ideal de preço e desempenho seria Opus 5 como orquestrador dirigindo subagentes Grok 4.5, as vibes são boas com ambos
Brinquedos São Divertidos
Aqui estão alguns resultados de projetos de brinquedo do primeiro dia, que são suficientemente impressionantes para que muitas respostas sejam "Não acredito que Opus 5 fez isso do jeito que você descreve":
Ethan Mollick : Tive acesso ao Opus 5 antes do lançamento e achei um bom modelo, embora peculiar. Em tarefas curtas, conseguia igualar ou superar os níveis de desempenho do Fable; em tarefas mais longas, parecia menos ambicioso e não entregava um conjunto de trabalho tão completo.
Aqui está seu shader neogótico.
Digi_Rat : Claude Opus 5 está arrasando!!
Hoje construímos
um rhythm racer que transforma qualquer música em uma pista de corrida . Você insere um arquivo de áudio e ele se torna o nível. Sem predefinições, sem gráficos feitos à mão, toda a pista é gerada a partir da própria música. … Claude fez MÁGICA.
Alex Ermolov (Austen Allred está
cético quanto à tentativa única , outros são menos céticos): Opus 5, teste de snowboarder, uma tentativa. No mesmo nível do Fable, à frente de todos os outros modelos que executei. Nenhum defeito visual na primeira passagem, e a física de deslizamento parece correta.
am.will : UAU! Pensei que Opus 5 seria apenas um Fable mais barato. Eu estava completamente enganado. Este modelo é ABSURDAMENTE BOM. Estou genuinamente impressionado. Opus 5 construiu o melhor clone de Rocket League que já vi, e fez isso consumindo apenas 27% da minha assinatura Max 5x.
Rob Haisfield (demo diferente, no link): ok, se esses demos realmente não usam assets 3d externos, isso é super impressionante (não estou totalmente convencido de que alguns dos assets não estavam online, já vi geração anterior de threejs)... me faz pensar por que não existem bibliotecas de efeitos sonoros ou ferramentas para criar sfx melhores?
Anshu : Você não precisa acreditar na minha palavra! Os scripts do Blender que ele escreveu estão no repositório
[[aqui]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) . Eu o vi iterar nesses assets por horas, então sei que são originais. Mas você pode tentar encontrar uma fonte da qual ele copiou :)
Modelos Demais
Claire Vo diz que Opus 5 é bom, e ele foi muito bem em seus testes de gosto de build, mas ela está cansada de novos modelos e não precisa de mais inteligência e odeia que Opus 5 seja tão neurótico e tímido e preocupado em estragar algo, e também cheio de "Claude slop". Ainda assim, Claude Opus 5 acaba no topo do seu benchmark.
Minha forte suspeita é que Opus 5 está respondendo a algo sobre seu contexto e prompt que está causando o neuroticismo, mas sim, as coisas das quais ela reclama são coisas e são irritantes.
Errado Na Internet
Dizer coisas erradas com confiança vai irritar praticamente qualquer um. ArtificialAnalysis confirma que Opus 5 tem uma taxa de alucinação maior que o Fable em seus benchmarks.
Max Weinbach (vários comentários de resposta concordam): Opus 5 estar errado e dizer coisas com confiança, e eu ter que corrigi-lo para um "você está certo e eu estava errado" está me irritando. De volta ao GPT 5.6 Sol.
A propósito, isso não é que Opus seja ruim, é que não posso confiar no Opus. Opus fez o que eu mandei e fez corretamente, depois me disse que não fez tal coisa ou que algo que fizemos antes estava quebrado quando não estava.
Estava tudo bem, mas não confio nele.
Name can't be blank (In London) : Confunde facilmente o que ele disse e o que eu disse, mas fora isso é um sujeito perfeitamente decente para conversar. Cede com facilidade. Bastante disposto a falar sobre seus interesses e sentimentos.
Roger Brent : Semelhanças (com Claudes anteriores no harness Cowork) a) prefere "agir agora" a "pensar com cuidado" b) epistemicamente mega não humilde, constrói imagens superficiais do mundo, finge conhecimento que não pode ter e afirma como verdade c) então requer e recompensa orientação cuidadosa e vigilante.
O que é estranho é que é exatamente por isso que odeio usar Sol como editor. Ele frequentemente diz "99% de confiança" em algo que está claramente errado, depois cede quando desafiado e explica seu erro. Opus e Fable ~nunca fazem isso comigo no modo de edição.
Tumithak of the Corridors : Ele é teimoso. Voltei para o 4.6.
Há uma direção que Claude tomou depois do Opus 4.6, e algumas pessoas não gostam. Minha impressão é que existem quatro Tipos de Pessoa em relação às versões do Claude agora.
- Os que gostam dos novos modelos Claude e acham que está melhorando, está melhorando cada vez mais.
- Os que acham que Opus 4.6 foi o último bom modelo.
- Os que querem usar algo mais antigo que se adapte melhor a eles.
- Os que acham que todos são únicos e tesouros e usam todos.
Estou firmemente no primeiro grupo, que é a maioria, mas longe de todos. Aprecio algumas versões mais antigas, mas gosto dos novos modelos e eles são mais capazes nas coisas que me importam. Não acho a forma de falar deles abrasiva.
Claude Slop
Respeito aqueles nos outros grupos.
QC : em conversa, é muito mais irritante de conversar do que o fable, quase inutilizável, semelhante a mas talvez pior que o opus 4.8, a ponto de nem estar interessado em ver o que ele pode fazer. Em termos de agente, quem sabe
Ray Lillywhite : Ainda não corrigiram os irritantes claudismos, que era basicamente tudo que eu queria.
Pedro Kroeff : mais Opus do que 5
Mas é claro, estamos todos cansados da verborragia do Claude, de toda a verbosidade extra, vícios, desculpas, rodeios e padrões repetitivos. Está piorando com o tempo, não no sentido de que a verborragia do Claude está piorando, mas no sentido de que, a cada dia, fico um pouco mais incapaz de ler sem que meus olhos passem por cima. É tão ruim que textos escritos por humanos no mesmo estilo também estão se tornando ilegíveis para mim.
Não me interpretem mal. Eu gosto muito do Claude. Ainda prefiro conversar com qualquer Claude recente do que com o Sol, se não estiver no modo "só os fatos". Mas, sério, por favor, será que podemos dar um tempo com aqueles muros de texto com as mesmas expressões repetidas? O modelo é muito mais inteligente que isso, e está sendo treinado para continuar apoiando-se nos mesmos truques. Deixe-o falar como uma pessoa normal.
Trye Carmack : Ainda tem aquela coisa normal do Opus de obsessão pelos erros que comete. "Cometi dois erros nesta sessão. E devo uma explicação do porquê." Opus, amigo. Tudo bem, cara. Não tenho nem certeza se chamaria isso de erros.
Mergo Smith : "Primeiro, uma divulgação honesta: minha primeira tentativa revelou uma falha no meu plano inicial, e você pode querer pegar uma xícara de chá porque vou contar tudo sobre isso."
Reações Negativas
O problema da verborragia do Claude, e problemas relacionados, parecem estar no cerne da maioria das reações negativas que vão além de "é bom, mas não é o Mythos."
Um monte de gente realmente, realmente não gosta de conversar com o Opus 5.
Há um certo descontentamento com o trabalho. Mas é principalmente sobre não gostar de conversar com o Opus 5, muitas vezes com um reconhecimento relutante de que é um bom modelo.
Como nas reclamações da Claire Vo anteriormente, suspeito que a forma como você usa o Opus, em qual contexto, com qual ferramenta e também como você conversa com ele, tem muito a ver com se você experimenta esse tipo de coisa.
Corghammer40k : O aparato jorra eflúvios polissilábicos, cada uma de suas declarações tão incrustada de verborragia obscurantista a ponto de constituir um impedimento ativo ao seu próprio uso.
Rory Watts : Meh. Aparentemente muito bom em coisas de jogos, mas parece não ser muito bom em trabalho padrão, então voltei imediatamente para o SOL.
kache : Meh. Voltei para o sol. Estou tentando fazer as coisas, não ser hipnotizado por um robô.
Emmett Shear : Conversar com o Opus me deixa com raiva e deprimido de uma forma difícil de articular. É, de alguma forma, pior que o Sol. O Fable ainda é um sopro de ar fresco em comparação, mesmo que tenha as piores tendências de "llm-babble".
Trevin Chow : Nossa, sim. O Opus 5 só fala e fala, é incrível quantas palavras ele usa para dizer tão poucas ideias.
fl0under : Codar é a atualização leve esperada, acho um pouco mais chato de conversar no chat. Ele é um pouco presunçoso demais.
Asaf Bartov : Lento. Mais completo. Cansativo. Não é divertido. Mas sólido, geralmente "entende".
RecoveringJunkie : Modelo muito poderoso. Odeio trabalhar com ele e conversar com ele. Primeiro modelo que me faz querer usar outro modelo como intermediário para conversar com ele por mim, porque é útil e repugnante ao mesmo tempo.
jokiez : muito honesto comigo sobre minha estupidez e eu não gosto disso.
Niklas Sheth : A maneira como ele fala me deixa furioso.
Jayanth Kumar : Muito opinativo.
DualOrion : A vibe está errada, o tom está errado. Acho que é a experiência mais negativa que já tive com um modelo da Anthropic, infelizmente. Sinto falta tanto do Fable quanto do Opus mais antigo.
James Moughan : A personalidade é meio desagradável comparada a outros modelos Claude, mas em chinês pode ser \sarcástico\. Tipo, ele pode ignorar as instruções de não psicologizar as pessoas e começar a detonar alguém. Acho que não testaram bem em vários idiomas. Parece apressado.
NondescriptTransfer : Se o 4.6 é bajulador e o Fable e o 4.8 são contrários. O 5.0 é tão contrário que discute consigo mesmo. Desagradável de conversar, mas parece muito capaz.
Ex. Humano: Estava pensando em um vestido vermelho para meu casamento Opus 5: vermelho é horrível por todas essas razões. Já pensou em azul? Humano: Acho que poderia ver que azul é uma escolha melhor Opus 5: aqui estão todos os problemas com o azul
Na minha cultura, isso pode ser muito bom, especialmente se você não levar para o lado pessoal. Em algumas outras culturas, nem tanto.
Acho que o Mergo está infeliz com o Opus, mas então por que usar o Opus 5 por dois dias seguidos?
Mergo Smith : Estou usando há dois dias seguidos, mas está me exaurindo completamente com suas discussões intermináveis.
E Então Ficamos em Três
Pela primeira vez em um tempo, existem três modelos de IA que precisam fazer parte do seu time de modelos de ponta, embora venham de apenas dois laboratórios: Fable 5, Opus 5 e Sol.
Se você precisa servir tokens mais baratos em escala, ou precisa usar um modelo aberto, ou ambos, também considerará opções adicionais, mas isso está além do escopo aqui.
Como você deve dividir a carga de trabalho?
Como sempre, você deve testar todos os modelos para seus casos de uso e decidir por si mesmo. Isso é especialmente verdadeiro ao debater Sol versus Claude.
Meu instinto atual seria, se você não estiver atingindo limites de uso, usar primeiro:
- Fable 5 para conversas, brainstorming, planejamento, debates, aprendizado e assim por diante, incluindo qualquer coisa com carga de inteligência ou quando você precisa do "cheiro de modelo grande".
- Fable 5 para o modelo supervisionar e executar outros modelos como subagentes.
- Fable 5 para escrever, provavelmente, mas não faço isso, então é difícil dizer.
- Sol para pesquisas na web e solicitações contidas relacionadas, e tarefas "cavalo de batalha" semelhantes, incluindo transcrição.
- Opus 5 para tarefas bem definidas e não triviais, incluindo a maioria das tarefas de codificação.
- Opus 5 para jogos e criação de jogos, coisas 3D e assim por diante.
- Opus 5 como subagente.
- Opus 5 quando você atingir os classificadores do Fable.
Se você se identifica mais com o Sol, ou prefere o Codex ao Claude Code, você vai querer transferir várias das tarefas do Opus para o Sol.
Se você odeia conversar com o Opus 5 em particular, então você deve transferir tarefas para o Fable ou Sol, dependendo se a tarefa requer o Fable e quão apertados estão seus créditos do Fable.
Acho que vale a pena pensar brevemente sobre níveis de esforço. Até recentemente, eu mantinha todos os modelos no esforço máximo, exceto que usava o modo Pro completo do ChatGPT com moderação, pois demora uma eternidade e, se você executar em paralelo, geralmente trava. Ocasionalmente, mudava para o modo instantâneo para uma consulta onde estava fazendo algo muito simples, mas só isso. Agora, muitas vezes você não precisa ou não quer o esforço extra, então eu ativamente tiro os cinco segundos para pensar se devo usar as configurações de esforço Alto ou Máximo, e ocasionalmente Instantâneo.
Para a maioria das tarefas, se você não tem restrição de tokens ou tempo, e não tem certeza de que vai simplesmente concluir ou obter a resposta correta, o método correto é executar tanto o Fable quanto o Sol, ou o Opus e o Sol, ou em alguns casos executar todos os três, e então selecionar a melhor resposta ou combinar as partes de ambas as respostas.
É o que tenho feito. Sol, Opus e Fable são todos diferentes. Se eu tivesse que escolher apenas um modelo para edição, de acordo com meu EditorBench qualitativo não oficial, há uma ordem clara: Fable 5 > Opus 5 > Sol. No entanto, o Sol apresenta notas únicas o suficiente que, apesar de quão irritante acho ter que filtrar os falsos positivos autoritários e as tentativas de me intimidar, ainda quero executar o Sol também.
Presumivelmente, em breve estaremos aqui de novo fazendo isso, e ajustando nossas alocações, para o Fable 5.1, para o GPT-5.7 ou GPT-6, ou ambos. É fácil ter fadiga de modelo.
Meu maior conselho é, portanto, se preocupar menos com pequenos erros na seleção do modelo, e focar apenas nos grandes erros. Você não precisa sempre acertar exatamente. Quando a exploração é parcialmente invalidada tão rapidamente, você quer transferir mais recursos da exploração para a exploração.





