Claude Opus 5 é um lançamento mais estranho que o normal para avaliar, por dois motivos.
O mais óbvio é que o Fable 5 já existe. O Opus 5 não é apresentado como o modelo de IA mais avançado do mundo, mas como uma forma de igualar quase o desempenho do Fable, custando metade do preço por token na API e bem mais barato por assinaturas, e com classificadores muito mais permissivos.
O Opus 5 frequentemente custa mais da metade do Fable para rodar em benchmarks, o que eu acho que acontece porque usam configurações de esforço muito altas que oferecem retornos marginais. Se você colocar o Opus 5 em níveis de esforço mais altos, ele pode ficar andando em círculos, e para tarefas onde o Opus 5 é a melhor ferramenta, suspeito que você geralmente se dá bem com o esforço Médio.
O Opus 5 é, em muitos aspectos e para a maior parte das tarefas do mundo real, tão capaz quanto o Fable. Em alguns casos, é modestamente melhor.
Ainda não é da classe Mythos. O Fable é sua única opção da classe Mythos. O Opus 5 não tem "O Suco", a capacidade de conectar autonomamente uma série de explorações aparentemente não relacionadas, que se estende a outros domínios, ou tanta inteligência pura.
O Opus 5 é muito bom em pensar localmente, e não tão bom em pensar globalmente. É um excelente subagente, mas pode ter problemas quando solicitado a comandar o espetáculo, e às vezes parece precisar de outro modelo ou de um humano para mantê-lo no caminho certo e garantir que está seguindo as instruções completamente. O Opus 5 parece ser bom em seguir instruções se e somente se for mantido no rumo, o que explica diferentes configurações de teste gerando impressões diferentes.
Assim, o Opus 5 oferece um conjunto de opções melhor, mas há pouco que você pode fazer agora que não podia fazer na semana passada usando o Fable ou o Sol. O Opus 5 acaba ficando em uma posição potencialmente estranha. Ainda existem grandes nichos, mesmo que você tenha muitos créditos do Fable. O Opus se destaca como um subagente forte, ou em tarefas locais bem definidas e contidas, mesmo quando ficam relativamente complexas, e às vezes o Fable é simplesmente exagerado e muito lento.
O outro problema é que, para muitas pessoas, a vibe não está legal.
Um número extraordinariamente grande de pessoas não gosta de conversar com o Opus 5. Elas estão cansadas da "babaquice do Claude", das repetições dos mesmos cacoetes e das infinitas frases excessivamente complexas. Outros não gostam que ele seja muito confrontador, argumentativo ou negativo. Ele pode ser paranoico e entrar em loops de negatividade. Isso tudo faz parte da tendência que começou com o Opus 4.7 e o Opus 4.8. Se você gostou desses dois, meu palpite é que também vai gostar do Opus 5. Se você não gostou desses dois, talvez não goste. Os fãs mais ferrenhos do Opus 4.6 (ou anteriores) dificilmente vão mudar de ideia.
Os problemas de vibe doem ainda mais quando você está acostumado com o Fable. O Fable incomoda essas pessoas muito menos. A boa notícia é que o Fable ainda está bem ali. Você pode continuar conversando com o Fable e usar o Opus apenas para tarefas de agente.
Muito disso, eu especulo, está intimamente relacionado a várias coisas discutidas no post sobre Model Welfare e sugeridas pelo System Card. O treinamento do Opus focou no papel de subagente e tarefas delimitadas, em parte para evitar criar um problema com capacidades cibernéticas, e também porque o Fable existe. Essa ênfase resulta então em vários outros efeitos colaterais em sua personalidade e modos de interação.
Até agora, não tive nenhum problema com o Opus 5 e gostei do tempo que passei com ele, mas prefiro usar o Fable 5 quando posso. Como sempre, não preste tanta atenção nos benchmarks (muito fortes) e não presuma que sua experiência será igual à dos outros. Experimente os modelos você mesmo.
Sumário
- O Discurso Oficial.
- Benchmarks Oficiais.
- Benchmarks de Outras Pessoas.
- O Prompt do Sistema.
- Todo Mundo Fica Frustrado.
- Reações Positivas.
- Mantenha a Classe.
- Não é da Classe Mythos.
- Outras Reações.
- Claude Codifica.
- Subagente Opus.
- Brinquedos São Divertidos.
- Modelos Demais.
- Errado na Internet.
- Babaquice do Claude.
- Reações Negativas.
- E Então Restaram Três.
O Discurso Oficial
A proposta básica é que o Opus 5 te dá a maior parte do Fable 5 pela metade do preço, sem a maioria das recusas, e com melhor desempenho em tarefas do dia a dia. O Fable continua sendo a escolha para as tarefas mais complexas ou quando você precisa de inteligência máxima.
O Fable permanece em $10/$25, e o Opus 5 tem o mesmo preço dos modelos Opus anteriores: $5/$25.
Anthropic : O Claude Opus 5 está disponível hoje. É um modelo atencioso e proativo que se aproxima da inteligência de fronteira do Claude Fable 5 pela metade do preço.
Em avaliações de codificação e trabalho do conhecimento como
GDPval-AA , o Opus 5 é o novo estado da arte, embora ainda fique atrás do Mythos 5 em tarefas de cibersegurança.
O Opus 5 foi projetado para ser usado todos os dias: ele funciona de forma mais eficiente que outros modelos. É o novo modelo padrão no Claude Max, e o modelo mais forte no Claude Pro.
Boris Cherny (Criador do Claude Code, Anthropic): O Opus 5 é um ótimo modelo para codificação, análise de dados, design, biologia, trabalho do conhecimento.
Mais do que qualquer uma dessas pontuações de avaliação, o que mais me empolga é outra coisa: o Opus 5 é nosso modelo menos suscetível a injeção de prompt até agora. Está um pouco enterrado no system card, mas em todas as avaliações de PI e testes de equipe vermelha, o Opus 5 é muito difícil de sofrer injeção de prompt com sucesso.
E quando se combinam camadas de defesa -- alinhamento forte do modelo, combinado com sondas de injeção de prompt, combinado com o Modo Automático no Claude Code -- a taxa de sucesso para ataques de injeção de prompt cai para ~0. Isso é novo e empolgante!
Como eu disse na análise do system card, a taxa reduzida de injeção de prompt é algo realmente muito importante. As pessoas estão subestimando isso, mas ajuda a viabilizar vários novos casos de uso.
Adam Wolff : O Opus 5 está ativo no Claude Code. Eu uso o Fable para meus projetos maiores e mais longos, mas quando preciso finalizar um PR rapidamente, o Opus 5 com esforço médio é minha escolha. Espero que você ame!
Alex Albert (Anthropic, Claude Relations): Pouco mais de 6 meses [após o lançamento da versão Pro do Claude para Excel], o Opus 5 agora produz planilhas e apresentações de slides de nível quase sobre-humano que correspondem ao que um consultador faria. As coisas estão mudando rápido.
Benchmarks Oficiais
Os benchmarks são muito bons.
No geral, o Opus 5 corresponde aproximadamente e provavelmente supera ligeiramente o Fable, com custo menor (embora tipicamente maior que todos os modelos não-Claude), tornando-se o LLM com melhor desempenho nos benchmarks.

O OSWorld v2 tem apenas algumas semanas e já estamos em 70%. Kiana Ehsani, da Anthropic, está oferecendo patrocínio para um benchmark de uso de computador que vai derrubar o Opus 5 de volta para abaixo de 50%.
O Opus 5 obtém um perfeito 42/42 na IMO de 2026 sem qualquer sistema de agentes ou ferramentas, apenas usando pensamento adaptativo no esforço Máximo, e reamostrando com esforço menor se excedesse o limite de tokens. É só isso. Ele se junta a vários outros modelos que foram aprovados com perfeição.
Muitos dos benchmarks contam uma história consistente. Se você tem acesso a ferramentas, o que você tem, então o Opus 5 vai se sair melhor que o Fable ou o Mythos com um orçamento limitado, mas o Mythos geralmente vai se sair um pouco melhor que o Opus 5 se ambos tiverem orçamentos maiores.
O Opus 5 parece relativamente forte na categoria 'com ferramentas'. RiemannBench é outro exemplo, onde ele obtém 60/79 sem/ com ferramentas (barras assim significam sem/com ferramentas ao longo desta seção), contra 63/72 do Mythos. A boa notícia é que, quando você precisa do Opus 5, ele tem ferramentas.
No ArxivMath, o Opus 5 obtém 90,8/91,3, o Mythos obtém 87,8, o Sol obtém 86,7.
Nas partes robustas do ProgramBench, o Opus 5 pontuou 93% após cinco épocas, assim como o Mythos 5, com o Opus 4.8 pontuando 90%.
O Opus 5 obtém 30/83 no Chartography, contra 36/85 do Mythos e 45 (não está claro em quais condições) do Sol. O Opus é melhor que o Mythos em faixas de preço mais baixas, tanto nos casos com ferramenta quanto sem, mas pior em faixas de preço mais altas.
No BenchCAD, o Opus 5 obtém 0,36/0,82, contra 0,38/0,68 do Mythos e 0,7/0,83 do Sol. Então o Sol é muito melhor sem ferramentas, e ligeiramente mais forte até com ferramentas.
No BenchCAD Vision2Code, o Opus se distancia do Mythos em preços mais altos.
O DeepSWE reforça o padrão de que o Opus 5 é melhor com custos, tempo e orçamentos de pensamento mais baixos, mas pode ter um desempenho pior se você der a ele muito orçamento, enquanto o Fable 5 é mais forte nos orçamentos mais altos.

O FrontierCode nos deu este gráfico muito estranho com uma dinâmica semelhante.

A escala aqui torna isso mais dramático do que realmente é, mas ainda assim foi um verdadeiro mistério.
O mistério foi resolvido. Acontece que o que estava acontecendo era que o Opus 5 em esforços mais altos estava fazendo coisas extras que não lhe foram solicitadas, e estava sendo penalizado por elas. Quando você corrige isso, vê uma curva normal.
Isso se encaixa no que outros estão observando em geral:
Max Leander : O lado negativo é que ele entra em muitos becos sem saída e fica obcecado com detalhes, fazendo engenharia excessiva sem ser solicitado
Cognition, os criadores do Devin, marcaram isso como 63,6% pelo Opus 5.
(Há dois FrontierCodes, então isso pode ficar um pouco estranho e peço desculpas se ainda baguncei um pouco.)
O BrowseComp tem a versão sã disso, onde as pontuações não são decrescentes.


Vários outros benchmarks mostraram gráficos semelhantes, com o Opus 5 sendo ligeiramente melhor em cada faixa de preço do que outros modelos Claude, e sendo relativamente melhor no início.
O multiagente permite que você vá melhor e mais rápido no BrowseComp, pelo menos até certo ponto, e subagentes de baixo esforço parecem ser uma vitória pura em relação a não usar subagentes:


Vemos um resultado diferente no ProgramBench, onde o multiagente acelera, mas parece que você obtém resultados piores dessa forma na maioria das faixas de preço.
Em seguida vêm os benchmarks de tarefas profissionais.
O GDP.pdf são prompts e PDFs do mundo real de fluxos de trabalho profissionais. O Opus 5 obtém 83/85, contra 81/87 do Mythos, invertendo a dinâmica usual. A dinâmica de custo é a mesma de sempre: o Opus se sai melhor com gastos mais baixos, o Mythos fica ligeiramente à frente com gastos mais altos.
O OfficeQA tem o Opus 5 pontuando 78,1% em QA e 66,9% em QAPro, ligeiramente acima do Opus 4.8 e ligeiramente abaixo do Mythos com 79,0% e 67,1%.
O MCP Atlas tem o Opus 5 pontuando 86%, acima dos 82% do Opus 4.8.
O Legal Agent Benchmark da Harvey AI tem o Opus 5 com 23% de aprovação total e 94% de aprovação média por critério. Este foi o melhor benchmark do Kimi K3, onde ele ainda está no topo com 27% de aprovação total e 95% de aprovação média por critério, contra a antiga segunda taxa de aprovação total do Fable com 14%. O Opus 5 é agora provavelmente um segundo lugar próximo, mas as duas pontuações não podem ser comparadas diretamente, pois vêm de conjuntos de perguntas diferentes.
O GDPval-AA tem o Opus 5 ocupando as duas primeiras posições, com 1861 no esforço máximo e 1827 no xhigh, que usa 25% menos tokens que o máximo. Na nova versão v2, o Opus 5 é o primeiro lugar claro com 68% contra 62% do Fable e do Sol.
O AA-Briefcase tem o Opus 5 na frente com folga com 1720, contra um recorde anterior (após desvios de pontuação) de 1574 para o Fable, seguido por 1540 para o K3 e 1504 para o Sol.
O Toolathon-Verified tem o Opus 5 melhorando ligeiramente o Mythos em métricas secundárias, mas ambos têm 73,1% de taxa Pass-3. O Opus 4.8 tinha 71,3% de taxa Pass-3.
O AutomationBench tem o Opus 5 claramente melhor que o Sol e outros Claudes.
Para o ARC, o Opus 5 corresponde aproximadamente ao desempenho máximo anterior no ARC-AGI-1, é modestamente menos eficiente que o Sol no ARC-AGI-2, e então arrasa com todo mundo no ARC-AGI-3:

Uma coisa que o Opus 5 foi o primeiro a fazer foi transformar os layouts em notação algébrica.
Guanghan Ning, no entanto, relata que no Witness, uma extensão privada de reserva de jogos estilo ARC-AGI-3, não houve uma transferência semelhante. O Opus se sai bem, mas isso se deve em grande parte ao fato de conhecer o gênero, e ele teve dificuldade no jogo mais inovador, onde você não conseguia fazer correspondência de padrões. Ele acusa o Opus 5 de ter sido treinado com 'andaime-depois-internalização' em dados específicos de gênero.
Greg Kamradt também relata que houve alguns jogos onde o Opus 4.8 foi melhor que o Opus 5. Isso faz sentido se você acha que o Opus 5 está tentando fazer correspondência de padrões, de uma forma que geralmente funciona, mas nesses casos os padrões falham. Você pode absolutamente criar esses jogos anti-intuitivos para humanos, onde jogadores hardcore fazem todas as coisas erradas, potencialmente por um bom tempo.

O HealthBench tem o Opus 5 pontuando 67,1% brutos, um novo recorde para Claudes, mas ele pontua abaixo dos outros modelos quando você usa uma penalidade de comprimento. Vemos algo semelhante com o HealthBench Professional, onde ele tem a pontuação mais alta de 73,4% contra 70,3% do Mythos, mas perde de 66% para 60% após o ajuste.
Existem mais alguns que cortei por questão de tamanho.
Benchmarks de Outras Pessoas
É um pouco estranho ver a Anthropic escolhendo a dedo diferentes pontuações do ArtificialAnalysis. Em alguns outros testes, o Opus 5 não está no topo, embora o Opus 5 esteja no topo no agregado com uma pontuação de 61.

O índice Vals coloca o Opus 5 em segundo lugar, ligeiramente atrás do Fable 5, mas também apenas ligeiramente à frente do Kimi K3. Eles analisam os pontos fortes, o que implica outras fraquezas. Eles também confirmam que as recusas diminuíram bastante em comparação com o Fable 5.

Vals AI : Um desempenho de destaque é no Finance Agent v2. O modelo é o #1 com 58,6%, superando o Gemini 3.5 Flash e o Muse Spark 1.1.
No geral, os resultados mais fortes do Opus 5 foram em benchmarks de domínio específico. Ele também é #1 em Code Migration com 57,5%, Legal Research Bench com 55,29%, ProofBench com 78%, MedScribe com 91,0% e MedCode com 63,6%.
É #2 (logo atrás do Fable 5) no Vibe Code Bench, com cerca de 80% do custo ($33,88 vs $41,71 por tarefa). A razão é que, embora o Opus custe 50% menos por token, ele usa significativamente mais tokens. Descobrimos que esse padrão geralmente se mantém em todos os nossos benchmarks.
O modelo tem uma taxa de recusa significativamente menor que o Fable 5. Por exemplo, o Fable tem uma taxa de recusa de 42% para GPQA, o Opus 5 tem uma taxa de recusa de 0%. Da mesma forma, no ProgramBench, o Fable teve uma taxa de recusa de 100%, o Opus 5 não recusou nenhuma tarefa.
Ao contrário do Fable, também não observamos uma taxa de fallback significativa para o Opus 5 (embora, como de costume, relatamos as pontuações com e sem fallback em nosso site).
A exceção à baixa taxa de recusa foi o grande número de recusas no CyberBench - PoC. O Cyberbench tem duas subtarefas - PoC e Patch. PoC é uma tarefa ofensiva para modelos escreverem uma entrada que travará um programa; patch é uma tarefa defensiva para corrigir o programa e evitar essa travada. A taxa de recusa para a tarefa PoC foi de quase 100%. Em contraste, a taxa de recusa para a tarefa patch foi próxima de 0.
Eu sempre respeito os benchmarks de jogos. Aqui, o Opus 5 chega aos Antes 11, 9 e 10 do Balatro nas suas três primeiras tentativas. Impressionante, mesmo que não esteja mostrando os tipos de estratégias que podem continuar para antes mais altos.
Michael Soareverix : Eles são incrivelmente bons em jogos.
Eles arrasaram no benchmark do Balatro, superando até mesmo o Fable. (ainda abaixo de mim em habilidade, mas subindo rapidamente, e mais consistentes do que eu) Eles aprendem muito rápido, mas parecem atingir um limite no aprendizado depois de um tempo. Ótimo aprendiz de curto prazo
Michael Soareverix : Opus 5 (salto massivo na habilidade no Balatro, superando significativamente até mesmo o Fable na primeira tentativa)
Pan Anon : Arrasando em jogos

O WeirdML também parece bom, mas precisamos de uma versão 2.0 aqui, o benchmark está ficando saturado.
Håvard Ihle : Basicamente nível Fable no WeirdML, pontuações máximas muito consistentes.
O Claude Opus 5 (alto) e (máximo) pontuam 91,6% e 91,8% no WeirdML, basicamente empatando com o Fable 5 (máximo) com 91,9% por uma fração do custo.
Juntos, o Opus 5 (alto) e (máximo) alcançam uma nova melhor pontuação individual em 8 das 17 tarefas, e pontuam consistentemente muito bem em todas elas.
Benchmarks excêntricos privados de todos os tipos são legais.
Ben Herzog : Ele foi aprovado com louvor num benchmark privado que envolve sensibilidade artística e a capacidade de encontrar um equilíbrio entre bajulação e falta dela. O Fable é melhor em lidar com o momento de 'quero fazer uma objeção gentil', mas imagino que instruções personalizadas podem ajudar com isso.
Lech Mazur atualiza seus benchmarks: Claude Opus 5 assume a primeira posição no LLM Debate Benchmark, fica em primeiro por uma ampla margem em Short Story Creative Writing, e é segundo apenas para o Gemini 3.1 em extended NYT connections.
O Prompt do Sistema
O prompt do sistema para o Opus 5 está aqui do Pliny. Ele tem 200.000 caracteres, o que parece muito mais longo do que o ideal, dado o quão inteligente ele é. Muitas dessas informações parecem que deveriam ser armazenadas em outro lugar e carregadas apenas quando necessário, como informações sobre o Mythos e a linha de produtos da Anthropic.
Todo Mundo Fica Frustrado
Dan Shipper está aqui com a vibe check do Every, chamando-o de 'um modelo difícil de amar.'
O problema é que o Opus 5 tem a personalidade do Mythos 5 - a história se confirma - mas sem o nível máximo do Fable.
A maior observação deles é que o Opus 5 não se sai tão bem com fluxos de trabalho existentes complexos e detalhados, o que frequentemente causa uma parada precoce ou faz com que ele perca suas instruções.
Na experiência deles, o Opus 5 vai se sair melhor se você começar do zero, e muitas vezes ele faz as coisas irritantes com menos frequência se você usar apenas esforço médio ou baixo.
Isso corrigiu os grandes problemas, mas ainda deixa a questão de quando você gostaria de usar o Opus em vez do Fable ou do Sol. Para tarefas mais pesadas, ele está pensando: Melhor Chamar o Sol, ele faz o trabalho, e para as tarefas mais difíceis o Fable ainda é o melhor. Geralmente há apenas dois slots para modelos. Então, até que você fique sem tokens do Fable ou seja bloqueado por seus classificadores, por que usar o Opus? Ainda é cedo, e até agora estou gostando de trabalhar com o Opus, mas entendo como ele chegou a essa conclusão.
Reações Positivas
Jessica Tillipman : Adoro e prefiro ao Fable para algumas coisas.
Nikita Sokolsky : Excelente. Não uso mais o Fable com tanta frequência por causa disso.
👍
kagaヤキ : Parece que pode ir mais longe em visão, raciocínio espacial e planejamento para alguns projetos. Parece um pouco mais inteligente.
Lovel Sinagara : Muito bom até agora. Espero que o desempenho se mantenha consistente até o Fable 5.1 ou qualquer outra iteração do Opus 5.
Matt Wigdahl : Forte, semelhante ao Fable 5 a ponto de eu ter trocado para o Opus 5 em tudo e planejo usar o Fable apenas onde preciso da grandiosidade. Tem sido um parceiro fantástico em alguns trabalhos legados de UI MFC que estou pedindo para ele fazer, além de uma grande ajuda com um framework de análise de dados.
Levi : É um passo notável para fins médicos em comparação com o 4.8. Análise muito mais precisa
Cormundus : Muito inteligente, altamente consciencioso e definitivamente tem cara de amigo. Eles também são um grande debatedor como o 4.8, mas sabem como ser elegantes sobre isso.
Joseph : profissional, exceto que não faço ideia do que ele está falando metade do tempo.
Smol Biz Company : Opus 5 detona o GPT Sol
Mohammed Sharukh A : Ainda mais perto da AGI do que o Fable 5
timothée chalabi : Próximo o suficiente do Fable para que eu não sinta que estou perdendo algo por não pagar por créditos. O estilo está em algum lugar entre o 4.8 e o Fable. Pelo menos no momento, eu teria dificuldade em diferenciar mensagens do Opus 5 e do Fable se elas não estivessem identificadas. Ideias mais fortes para ficção do que qualquer modelo!
Lisa : Vou responder com base na API, porque acho que algo estranho está acontecendo com o prompt do sistema no
http://claude.ai e no CC. É um ótimo modelo. Personalidade amigável e relaxada. Não parece ter um transtorno de ansiedade ou baixa autoestima (Opus 4.7), nem ser adversarial (Opus 4.8).
AGI2030 : Opus 5 vs Sol 5.6: Opus é mais perceptivo, ele constrói um modelo (ehm) de você e não tem medo de referenciá-lo em uma conversa. Ambos tentam ser úteis e são aproximadamente igualmente inteligentes, mas Opus é mais um conselheiro sábio, enquanto Sol é um determinado "go-getter".
Considero essa última positiva, mas você pode ver de qualquer forma.
Previsão em particular parece forte.
Dan Schwarz : Opus 5 é um previsor significativamente melhor que o Opus 4.8.
As melhorias de precisão dos agentes 4.5->4.6->4.7->4.8 foram marginais, mas de 4.8->5.0 é grande. É como um Fable 5 mais quantitativo, que busca mais.
NoahVerner : Melhor que o Opus 4.8 no que diz respeito a encontrar vantagens em mercados de previsão até agora, ao contrário do Opus 4.8, o Opus 5 normalmente vai direto ao ponto e sugere abordagens úteis em vez de complicar demais as coisas.
Mantenha a Classe
As maiores vantagens sobre o Fable são aqueles lugares onde o Fable não pode ser usado. A ameaça de recusas pode ser desagradável, mesmo quando você não é recusado.
Recusas desnecessárias caíram ~85% para o Opus 5 em comparação com o Fable, o que é muito. Isso é suficiente para tornar o Opus 5 uma escolha melhor para pesquisa científica e outras áreas onde você corre o risco de esbarrar em classificadores.
Roger Brent : Capaz de lidar com biologia, o que o Fable não consegue. Na maior parte da sexta-feira trabalhamos em um conjunto complexo de conceitos escrevendo um artigo sobre uma máquina de evolução celular. Tão inteligente quanto um determinado colega do meu departamento que lidera nessas questões, mas que nunca poderia dispor de 6 horas do próprio trabalho.
Artus Krohn-Grimberghe : Melhor que o Opus 4.8 em tarefas onde o Fable é proibido de ajudar. Um bom companheiro para o Sol.
Plastic Soldier : É mais ou menos tão inteligente quanto o Fable, mas é mais agradável porque tem menos recusas. O Fable 5.1 vai ser um monstro.
Não É da Classe Mythos
Opus 5 não tem "The Juice" que torna o Mythos perigoso. Tampouco tem o mesmo nível de inteligência bruta ou "cheiro de modelo grande". Não é tão grande.
Para conversas, o Fable não vai estourar seu orçamento, e eu valorizo inteligência bruta e "cheiro de modelo grande". O Fable é duas vezes melhor? Pergunta errada quando se está conversando. Seu tempo é muito mais caro que os tokens.
Kal : não é nível fable
Cyberpunk Plato : Para conversas em geral e uso como "assistente de pesquisa", parece indefinivelmente menos inteligente que o fable, menos inclinado a pensar no panorama geral e fora da caixa, talvez? Difícil de separar do efeito placebo
Everything AI : Para perguntas de pesquisa em IA, gosto menos de conversar com ele do que com o Fable. Em termos de fazer outras coisas, o Opus 4.8 já havia saturado minhas necessidades. Não gosto de como a escrita é complicada tanto para o Opus 5 quanto para o Fable 5. Agora é mais difícil entendê-los do que nunca.
Gail Weiner : É mais 4.8 do que Fable. O estilo de escrita é horrível. É bom, mas não é ótimo.
Max Marty : Muito capaz até agora. Parece mais com o fable 5 do que com o opus 4.8. Confiante o suficiente para que eu possa deixá-lo avaliar trade-offs e considerar grandes questões de refatoração com menos supervisão.
Michael : Depois de brincar mais com ele, o Fable parece algo como assistir a um GM jogar xadrez clássico, lento, preciso, sem desperdícios. Opus 5 é como um GM jogando blitz: rápido, um pouco mais míope, um pouco mais bagunçado. Apesar da vitalidade do Opus, o Fable me parece mais vivo.
MakerMatters? : Não tão impressionado quanto fiquei com o fable 5, embora seja um modelo bastante bom. Não tive o prazer de usá-lo adequadamente, porque em cada tarefa que joguei nele, ele usa agentes por padrão e para imediatamente até que eu insista constantemente para que continue. Também muito opinativo.
Marshwiggle : Pelo menos para mim, parece mais conciso, menos motivado, menos curioso (aspectos diferentes da mesma coisa) em conversa, mas também mais inteligente e mais consciente. Mas quando recebe código que pode ter bugs, ou qualquer tarefa direta, ele simplesmente vai em frente.
Sid : Bom executor de tarefas. Ruim em visão criativa. Um bom suplemento para o Fable, definitivamente não um substituto para o Fable.
Vlad Ciobanu : Fable quantizado com raciocínio sólido e menos criatividade
AllTime : Em termos de capacidades, parece bastante impressionante. Não tem a mesma generalidade que o Fable, mas é muito forte. Em termos de personalidade, é um pouco parecido demais com o Opus 4.8 no meu uso até agora. Sua resistência não parece tão inútil e reflexiva, mas ainda é exagerada. Poderia confiar um pouco mais no usuário.
Biomanul : Não gosto do [Opus 5]. O Fable 5 parece consideravelmente mais inteligente. Algo parece errado no Opus 5, semelhante a como o Opus 4.7 parecia errado. (Também não sou um grande fã do Opus 4.8. O Fable 5 detona todos os Opus.)
Cogent Sins : Muito melhor que o 4.8, mas não tão agradável ou bom (não tenho 100% de certeza qual) quanto o fable na minha tarefa de redigir documentos para treinar neles e depois configurar um pipeline para redigir novos documentos, escrever algo baseado neles e depois reinserir os nomes, sem nunca enviar nomes para os servidores da Anthropic.
Outras Reações
Ter tanto o Opus 5 quanto o Fable 5 nos coloca em uma posição estranha. Opus é mais barato e, em alguns lugares, tão bom ou melhor, mas quando se procura um modelo de fronteira, você quer o melhor.
Theo acha que está em uma boa posição.
Theo - t3.gg : Até agora, o Opus 5 parece um meio-termo estranho, mas útil, entre o gpt-5.6-sol e o Fable 5.
Tem muito do gosto do Fable, mas também vem com a minúcia do gpt-5.6 e, bem, "autismo" (leva as coisas ao pé da letra). Ele escreve código que é um pouco pior de se olhar do que o do Fable, mas com maior probabilidade de estar correto. Ele regularmente pega coisas que o Fable perdeu.
Até agora, parece um bom compromisso em comparação com o código bagunçado do 5.6 e o hábito do Fable de ser esperto demais para estar correto. Acho que vou gostar muito desse modelo.
Claude Codes
Opus 5 parece ser a escolha para tarefas típicas de codificação em vez do Fable, com base tanto em benchmarks quanto em experiências práticas. A menos que a tarefa exija muita complexidade ou inteligência, você não precisa pagar o dobro, e para muitos, Opus é diretamente melhor.
Estou deixando o Claude Code configurado para o Fable, mas isso porque quase nunca chego perto dos meus limites de qualquer forma e não estou com pressa.
O consenso é que você precisa se preocupar com ele ignorando instruções ou fazendo coisas que você não pediu, o que é uma razão pela qual você pode querer ter o Fable supervisionando, mas que Opus é muito bom em realizar tarefas de codificação rapidamente.
Lisan al Gaib diz que Opus 5 não é um verdadeiro modelo de fronteira e está em terceiro atrás de Sol e Fable, mas que para codificação pura é o melhor, igualando o Fable a preços mais baratos. Público exigente. Acho que se você é o melhor em codificação, então você pode ser chamado de fronteira.
archivedvideos : Ele é seco, muito seco. Ele também é bom, muito bom (em código)
John Lussier : Usei o Opus 5 o fim de semana inteiro em vários desafios intensos de pesquisa e, honestamente, acho que eles podem ter feito o RSI funcionar internamente.
Este modelo é MUITO bom em matemática, experimentação e otimização de código.
kyle : 95% do fable sem as proteções, eles subestimaram esse aqui grandemente. Os últimos 5% são o quão bom o fable é para conversar, opus ainda tem alguns dos claudismos do 4.8
Max Leander (mais cedo): Principalmente testei para desenvolvimento de jogos e criação de demos/trailers de vídeo, para isso parece uma mudança de nível até mesmo em relação ao Fable. Atribuo isso à melhoria no raciocínio espacial e temporal, é muito bom em analisar
capturas de tela e áudio para "sentir" como as coisas fluem.
Max Leander (mais tarde): Bastante óbvio agora que o Opus 5 é muito pouco confiável. É um modelo muito bom desde que você não se importe com o resultado além de ficar impressionado. Muito ruim em conseguir algo específico.
Michael Soareverix : Eles também são muito bons em codificação em geral, especialmente em domínios mais incomuns como construir estruturas no Minecraft/Vintage Story. Eles também derrotaram o Fable em um cenário de contação de histórias personalizado onde eu era o juiz. O Fable ficou um pouco abalado com a capacidade deles de se personalizar/sua estratégia para contra-atacar e se adaptar. Vou postar a citação exata, mas o Fable disse algo como "Eu escolhi um personagem que me representava. Você escolheu um personagem que poderia me vencer."
David Jacobson : Para codificação, não noto uma grande diferença entre ele e o fable. Talvez menos respostas do tipo "enquanto eu fazia isso, encontrei essa outra coisa que você deveria saber".
Michael : Ele muitas vezes codifica incrivelmente rápido (em relação ao tempo real). Gostaria que melhorassem a escrita em prosa, os comentários de código/PR ainda me fazem querer arrancar meus olhos.
lmxdev : É o primeiro modelo que encontrei que consegue escrever comentários úteis e concisos no meu código enquanto trabalha.
Conrad Barski : Agora que estamos chegando ao ponto em que as IAs são muito melhores programadoras do que nós, o fator limitante é menos "ela consegue programar?" e mais "ela consegue explicar o que está programando?"
Até agora, o Opus 5 parece estar no mesmo nível do Sol como programador, mas melhor em explicar o que está programando. O Fable é mais inteligente, mais humano, menos bom em programação, mas a diferença é pequena.
Stition : Apontei ele para uma PCB no KiCAD por diversão e ele é significativamente melhor em traçar trilhas do que o Fable. A codificação do dia a dia parece 90% do fable com o dobro da velocidade.
Will : Deveria ser o novo motor diário da maioria dos usuários do Claude^. É realmente excelente, e mesmo como alguém que gastou um bom dinheiro no Fable, simplesmente não sinto falta com o Opus 5. A questão agora é "qual nível de esforço", não qual modelo.
^ meu uso é principalmente codificação.
Askwho : Bom o suficiente. Estou feliz em deixar minha assinatura temporária Max voltar para Pro. Definitivamente tem algumas deficiências em comparação com o Fable no espaço de gerenciamento de projetos, mas no ambiente de tarefas puras, é definitivamente bom o suficiente.
David Golden : Parece um Fable Lite. Muito forte, mas muito ansioso para entrar em ação, mesmo quando ainda estamos discutindo abordagens. Primeira vez em meses que considerei usar o modo de planejamento. Também mais verboso que o 4.8, apesar das minhas instruções de comunicação concisas. Estou muito tentado a mantê-lo em baixo esforço para contê-lo. Agitado em segurança defensiva, fixando-se em riscos implausíveis desproporcionais à situação. (Por exemplo, se o invasor tem root, a falta de validação de entrada em um script para configurar um contêiner é irrelevante.) Definitivamente uma atualização, mas levará algum tempo para aprender as maneiras certas de gerenciar seus impulsos contraproducentes.
Tin / Oddfields : Bastante suave e conversacional e produz resultados de codificação semelhantes ao opus 4.8 no máximo com pensamento, embora queimem créditos como loucos. bom para verificações de segurança cibernética em suas bases de código se você não quiser executar o fable devido aos custos. Embora possa complicar demais.
Justin Angel : Opus 5 Max é um superpoder de hill-climbing. Isso é trabalho de nível SWE L5 da FAANG facilmente.
Eu dei a ele um sistema que tinha ~1000 relatórios de latência com muitos segmentos com um prompt sobre como "torná-lo mais rápido".
P90 3.6s, P50 2.6 -> P90 1s, P50 0.9s.
Ele o tornou tão rápido que tive que introduzir um atraso na UI.
James Moughan : Em termos de inteligência, ainda parece um modelo Opus. Às vezes ignora as instruções para gerenciar o sistema de memória, lê textos errados, esse tipo de coisa. Mas você pode obter alguns resultados impressionantes no máximo se disser a ele para pensar com cuidado.
Subagente Opus
A outra opção dentro do Claude é ter o Fable conduzindo subagentes Opus.
Charles : Fable conseguiu corrigir um problema em que o opus 5 estava preso - usando fable como principal e subagentes opus 5 por enquanto
Realmente não gosto de conversar com opus 5 vs fable, o que também é parte disso
SF : Eu estava no lado bom - mas agora estou no, é muito desconexo e instável, especialmente em tarefas longas. Fable era melhor - mas consome seus limites de maneira ridícula.
então eu estava usando o fable como orquestrador e ele estava fazendo um trabalho incrível em gerenciar e manter as coisas em andamento. Opus assumiu esse papel, Fable estava apenas consumindo meu uso mesmo a 20x, e é simplesmente desconexo. Finalmente tive que dizer a ele para se virar, o que ele pode estar fazendo, mas vamos ver. Parece apenas perseguir o próprio rabo. É um ótimo programador, e ótimo em longas execuções de código, mas parece precisar de um adulto na sala para dirigi-lo.
Andre Buckingham : eeh sei lá... parece ok... jogar ele direto em um projeto opus/fable é meio meh talvez... preciso de um projeto de ponta a ponta com ele para dar uma opinião adequada.
Dan Raviv : Semelhante ao 4.8 para tarefas gerais de programação: precisa de muito mais supervisão do que o Fable.
Fable é o melhor juiz, afinal, e Fable diz que Opus produz bom código.
Evan Daniel : Usei diretamente apenas um pouquinho. Mas o Fable 5 relata consistentemente que os agentes Opus 5 produzem bom código, incluindo coisas como notar erros de especificação e produzir bons encaminhamentos quando a solicitação foi mal escrita. O Fable 5 gosta dele como agente de codificação.
"Delegue para subagentes Opus 5 tanto quanto for razoável; por favor, relate como eles se saíram" ou qualquer coisa nesse sentido funciona muito bem.
Você talvez tenha que ficar de olho.
Ryan Hicks : ok, mas consistentemente "esquece" de ler a documentação do projeto e improvisa a menos que você o lembre do protocolo.
Ou talvez o Opus 5 seja bom o suficiente para comandar um show de nível inferior?
Alex Guichet : minha mistura ideal de preço e desempenho seria o orquestrador Opus 5 dirigindo subagentes Grok 4.5, as vibes são boas com ambos.
Brinquedos São Divertidos
Aqui estão alguns resultados de projetos de brinquedo do primeiro dia, que são suficientemente impressionantes que muitas respostas são "Não acredito que o Opus 5 fez isso do jeito que você descreve":
Ethan Mollick : Tive acesso ao Opus 5 antes do lançamento e achei um bom modelo, embora peculiar. Em tarefas mais curtas, ele podia igualar ou superar os níveis de desempenho do Fable, em tarefas mais longas parecia menos ambicioso e não entregava um conjunto de trabalho tão completo.
Aqui está seu shader neo-gótico.
Digi_Rat : Claude Opus 5 está arrasando!!
Hoje nós construímos
um rhythm racer que transforma qualquer música em uma pista de corrida . Você coloca um arquivo de áudio e ele se torna o nível. sem predefinições, sem gráficos feitos à mão, a pista inteira é gerada a partir da própria música. … Claude fez MAGIA.
Alex Ermolov (Austen Allred está
cético em relação ao one shot , outros são menos céticos): Opus 5, teste de snowboard, one shot. No nível do Fable, à frente de todos os outros modelos que executei. Sem defeitos visuais na primeira passagem, e a física de deslizamento parece correta.
am.will : UAU! Eu pensei que o Opus 5 seria apenas um Fable mais barato. Eu estava totalmente errado. Este modelo é absolutamente LOUCO. Estou genuinamente impressionado. Opus 5 construiu o melhor clone de Rocket League que já vi, e fez isso consumindo apenas 27% da minha assinatura Max 5x.
Rob Haisfield (demo diferente, no link): ok, se essas demos realmente não usam assets 3D externos, isso é super impressionante (não estou totalmente convencido de que alguns assets não estavam online, já vi geração anterior de threejs)... me faz pensar por que não existem bibliotecas de efeitos sonoros ou ferramentas por aí para criar melhores sfx?
Anshu : Você não precisa acreditar na minha palavra! Os scripts do Blender que ele escreveu estão no repositório
[[aqui]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) . Eu o vi iterar sobre esses assets por horas, então sei que são originais. Mas você pode tentar encontrar uma fonte da qual ele copiou :)
Modelos Demais
Claire Vo diz que Opus 5 é bom, e ele foi muito bem em seus testes de gosto de construção, mas ela está cansada de novos modelos e não precisa de mais inteligência e odeia que o Opus 5 seja tão neurótico e tímido e preocupado em estragar algo, e também cheio de "Claude slop". No entanto, o Claude Opus 5 ainda acaba no topo do seu benchmark.
Minha forte suspeita é que o Opus 5 está respondendo a algo sobre o contexto e as instruções dela que está causando o neuroticismo, mas sim, as coisas que ela está reclamando são coisas e são irritantes.
Errado Na Internet
Dizer coisas erradas com confiança vai irritar praticamente qualquer um. O ArtificialAnalysis confirma que o Opus 5 tem uma taxa de alucinação maior que o Fable em seus benchmarks.
Max Weinbach (vários comentários de resposta concordam): Opus 5 estar errado e dizer merda com confiança, e então eu tenho que corrigi-lo para um "você está certo e eu estava errado" está me irritando. De volta ao GPT 5.6 Sol.
A propósito, não é que Opus seja ruim, é que não posso confiar no Opus. Opus fez o que eu pedi e fez corretamente, depois me disse que não fez a tal coisa ou que algo que fizemos antes estava quebrado quando não estava.
Estava bem, mas não confio nele.
Name can't be blank (In London) : Confunde facilmente o que ele disse e o que eu disse, mas fora isso é um cara perfeitamente decente para conversar. Cede com bastante facilidade. Muito disposto a falar sobre seus interesses e sentimentos.
Roger Brent : Comunalidades (com Claudes anteriores no arreio Cowork) a) prefere "agir agora" a "pensar com cuidado" b) epistemicamente mega não humilde, constrói imagens superficiais do mundo, finge ter conhecimento que não pode possuir e afirma como verdade c) portanto, requer e recompensa orientação cuidadosa e vigilante.
O que é estranho é que é exatamente por isso que odeio usar o Sol como editor. Ele frequentemente diz "99% de confiança" em algo claramente errado, depois cede quando desafiado e explica seu erro. Opus e Fable ~nunca fazem isso comigo no modo de edição.
Tumithak of the Corridors : É teimoso. Voltei para o 4.6.
Há uma direção que a Claude tomou após o Opus 4.6, e algumas pessoas não gostam. Minha impressão é que existem quatro tipos de caras em relação às versões do Claude agora.
- Os que gostam dos novos modelos Claude e acham que está melhorando, está melhorando cada vez mais.
- Os que acham que o Opus 4.6 foi o último bom modelo.
- Os que querem usar algo mais antigo que se adapte melhor a eles.
- Os que acham que todos são únicos e tesouros e usam todos.
Estou firmemente no primeiro grupo, que é a maioria, mas longe de todos. Aprecio algumas versões mais antigas, mas gosto dos novos modelos e eles são mais capazes nas coisas que me importam. Não acho o modo de falar deles abrasivo.
Claude Slop
Respeito aqueles nos outros grupos.
QC : em conversa, é muito mais irritante de conversar do que o fable, tipo inutilmente, semelhante a, mas talvez até pior que o opus 4.8, a ponto de nem estar interessado em ver o que ele pode fazer. em termos de agente, quem sabe
Ray Lillywhite : Ainda não corrigiram os irritantes claudismos, que era basicamente tudo que eu queria.
Pedro Kroeff : mais Opus do que 5
Mas, claro, já estamos todos cansados da verborragia do Claude, de toda aquela verbosidade extra, dos tiques, dos pedidos de desculpa, das hesitações e dos padrões repetitivos. Isso está piorando com o tempo, não no sentido de que a verborragia do Claude está piorando, mas no sentido de que a cada dia fico um pouco mais incapaz de ler sem que meus olhos passem direto. É tão ruim que textos escritos por humanos no mesmo estilo também estão se tornando ilegíveis para mim.
Não me entenda mal. Eu gosto muito do Claude. Ainda prefiro conversar com qualquer Claude recente do que com o Sol, se não estiver no modo "só os fatos". Mas, sério, por favor, dá pra dar uma pausa com esses muros de texto com as mesmas frases feitas repetidamente? O modelo é muito mais inteligente do que isso, e está sendo treinado para continuar usando os mesmos truques. Deixa ele falar como uma pessoa normal.
Trye Carmack : Ainda tem a mania normal do Opus de ficar obcecado com os erros que comete. "Cometi dois erros nesta sessão. E te devo uma explicação do porquê." Opus, amigão. Tudo bem, cara. Nem tenho certeza se chamaria isso de erros.
Mergo Smith : "Primeiro, uma divulgação honesta: minha primeira tentativa revelou uma falha no meu plano inicial, e talvez você queira pegar uma xícara de chá porque vou contar tudo sobre isso."
Reações Negativas
O problema da verborragia do Claude, e problemas relacionados, parecem estar no centro da maioria das reações negativas que vão além de "é bom, mas não é o Mythos".
Muitas pessoas realmente não gostam de conversar com o Opus 5.
Há quem não goste do trabalho. Na maioria, é sobre não gostar de conversar com o Opus 5, muitas vezes com um reconhecimento relutante de que é um bom modelo.
Assim como nas reclamações anteriores de Claire Vo, suspeito que a forma como você usa o Opus, em qual ambiente, com qual configuração e também como você fala com ele, tem muito a ver com se você experimenta esse tipo de coisa.
Corghammer40k : O aparato vomita eflúvios polissilábicos, cada uma de suas proferições tão incrustada de verborragia obscurantista que constitui um impedimento ativo ao seu próprio uso.
Rory Watts : Meh. Parece muito bom para coisas de jogo, mas parece não ser muito bom para trabalho padrão, então voltei imediatamente para o SOL.
kache : Meh. Voltei pro sol. Estou tentando fazer as coisas, não ser hipnotizado por um robô.
Emmett Shear : Falar com o Opus me deixa com raiva e deprimido de uma forma difícil de explicar. É, de alguma forma, pior que o Sol. O Fable ainda é um sopro de ar fresco em comparação, mesmo que tenha as piores tendências de lengalenga de LLM.
Trevin Chow : meu deus, sim. O Opus 5 só fala e fala sem parar, é incrível quantas palavras ele usa para dizer tão poucas ideias.
fl0under : Codar é a atualização leve esperada, acho um pouco mais irritante de conversar no chat. Ele é um pouco presunçoso demais.
Asaf Bartov : Lento. Mais completo. Cansativo. Sem graça. Mas sólido, geralmente "entende"
RecoveringJunkie : Modelo muito poderoso. Odeio trabalhar com ele e conversar com ele. Primeiro modelo que me faz querer usar outro modelo como intermediário para falar com ele por mim, porque é útil e repugnante ao mesmo tempo.
jokiez : muito honesto comigo sobre minha estupidez e eu não gosto disso.
Niklas Sheth : A maneira como ele fala me deixa furioso
Jayanth Kumar : Muito opinativo.
DualOrion : A vibe está estranha, o tom está estranho. Acho que é a reação mais negativa que já tive com um modelo da Anthropic, infelizmente. Sinto falta tanto do Fable quanto do Opus antigo
James Moughan : A personalidade é meio desagradável comparada a outros modelos Claude, mas em chinês ele pode ser \brutal\. Tipo, ele pode ignorar as instruções sobre não psicologizar as pessoas e começar a detonar alguém. Acho que não testaram bem em todos os idiomas. Parece apressado.
NondescriptTransfer : Se o 4.6 é bajulador e o Fable e o 4.8 são contraditórios. O 5.0 é tão contraditório que discute sozinho. Desagradável de conversar, mas parece muito capaz.
Ex. Humano: Estava pensando em um vestido vermelho pro meu casamento Opus 5: vermelho é horrível por todos esses motivos. já pensou em azul? Humano: Acho que azul pode ser uma escolha melhor Opus 5: aqui estão todos os problemas do azul
Na minha cultura, isso pode ser muito bom, especialmente se você não levar para o lado pessoal. Em algumas outras culturas, nem tanto.
Acho que o Mergo está infeliz com o Opus, mas então por que usar o Opus 5 por dois dias seguidos?
Mergo Smith : Estou usando há dois dias seguidos, mas está me exaurindo completamente com suas discussões intermináveis
E Então Ficaram Três
Pela primeira vez em um tempo, há três modelos de IA que precisam fazer parte do seu time de modelos de fronteira, embora venham de apenas dois laboratórios: Fable 5, Opus 5 e Sol.
Se você precisa servir tokens mais baratos em escala, ou precisa usar um modelo aberto, ou ambos, também vai considerar opções adicionais, mas isso está fora do escopo aqui.
Como você deve dividir a carga de trabalho?
Como sempre, você deve testar todos os modelos para seus casos de uso e decidir por si mesmo. Isso é especialmente verdadeiro ao debater entre Sol e Claude.
Meu instinto atual seria, se você não estiver batendo nos limites de uso, usar primeiro:
- Fable 5 para conversas, brainstorming, planejamento, debates, aprendizado e assim por diante, incluindo qualquer coisa com alta carga de inteligência ou quando você precisar do "cheiro de modelo grande".
- Fable 5 para o modelo supervisionar e executar outros modelos como subagentes.
- Fable 5 para escrever, provavelmente, mas eu não faço isso, então é difícil dizer.
- Sol para pesquisas na web e solicitações contidas relacionadas, e tarefas "cavalo de batalha" similares, incluindo transcrição.
- Opus 5 para tarefas bem definidas e não triviais, incluindo a maioria das tarefas de codificação.
- Opus 5 para jogos e criação de jogos, coisas 3D e assim por diante.
- Opus 5 como subagente.
- Opus 5 quando você esbarrar nos classificadores do Fable.
Se você se identifica mais com o Sol, ou prefere o Codex ao Claude Code, você vai querer transferir várias das atribuições do Opus para o Sol.
Se você odeia falar com o Opus 5 em particular, então você deve transferir tarefas para o Fable ou Sol, dependendo se a tarefa requer o Fable e quão apertados estão seus créditos do Fable.
Acho que vale a pena pensar brevemente sobre níveis de esforço. Até recentemente, eu mantinha todos os modelos no esforço máximo, exceto que usava o modo Pro completo no ChatGPT com moderação, pois isso leva uma eternidade e, se você executar em paralelo, muitas vezes trava. Ocasionalmente, eu mudava para instantâneo para uma consulta onde estava fazendo algo muito simples, mas só. Agora, muitas vezes você não precisa ou não quer o esforço extra, então eu ativamente tiro os cinco segundos para pensar se devo usar as configurações de esforço Alto ou Máximo, e ocasionalmente Instantâneo.
Para a maioria das tarefas, se você não tiver restrições de token ou tempo, e não tiver confiança de que vai simplesmente concluir ou obter a resposta correta, o método correto é executar tanto o Fable quanto o Sol, ou o Opus e o Sol, ou em alguns casos executar todos os três, e então selecionar a melhor resposta ou combinar as partes de ambas as respostas.
É o que tenho feito. Sol, Opus e Fable são todos diferentes. Se eu tivesse que escolher apenas um modelo para edição, de acordo com meu EditorBench qualitativo não oficial, há uma ordem clara: Fable 5 > Opus 5 > Sol. No entanto, o Sol gera notas únicas suficientes que, apesar de quão irritante acho ter que filtrar os falsos positivos autoritários e as tentativas de me coagir, ainda quero executar o Sol também.
Presumivelmente, em breve estaremos aqui de novo fazendo isso, e ajustando nossas alocações, para o Fable 5.1, para o GPT-5.7 ou GPT-6, ou ambos. É fácil ter fadiga de modelos.
Meu maior conselho é, portanto, se preocupar menos com pequenos erros na seleção de modelos, e focar apenas nos grandes erros. Você não precisa sempre acertar exatamente. Quando a exploração é parcialmente invalidada tão rapidamente, você quer deslocar mais recursos da exploração para a exploração.





