YouMind
Iniciar sessão

Opus 4.8: Mesmo preço, você paga o dobro

@shmidtqq
INGLÊS30/05/2026
1.2M
215
18
33
516

TL;DR

O Opus 4.8 da Anthropic introduz atualizações operacionais significativas, incluindo controle de esforço e fluxos de trabalho dinâmicos. Embora os benchmarks mostrem ganhos modestos, o valor real reside na otimização do uso de tokens e da velocidade para tarefas complexas de programação.

Mesmo preço. A maioria das pessoas vai apenas trocar o modelo e perder todo o resto.

shmidt - inline image

Junto com o Opus 4.8, a Anthropic lançou três coisas que mudam a forma como você trabalha no Claude Code mais do que os números dos benchmarks: controle de esforço, fluxos de trabalho dinâmicos e modo rápido mais barato. Quem configura isso corretamente obtém melhores resultados e gasta menos. Aqui está o detalhamento.

O único número que mais importa

Não é os 69,2% em codificação. É que o 4.8 tem cerca de 4x menos probabilidade de deixar passar falhas no código que ele mesmo escreveu.

Modelos mais antigos adoravam dizer com confiança "pronto, bug corrigido" com evidências superficiais. A Anthropic apostou na honestidade: o 4.8 desacelera com mais frequência e sinaliza quando não tem certeza, em vez de gerar código plausível que quebra silenciosamente casos extremos. Em uma sessão longa, isso se acumula. Um modelo que admite incerteza na etapa 15 economiza algumas horas de depuração na etapa 40.

O que mudou: a versão resumida

Codificação.

SWE-bench Verified: 87,6% → 88,6% (próximo do teto).

SWE-bench Pro (mais difícil, menos contaminado): 64,3% → 69,2%, 10+ pontos à frente do GPT-5.5.

Este é o número principal de codificação.

Terminal.

Terminal-Bench 2.1: 66,1% → 74,6% (+8,5), mas o GPT-5.5 ainda lidera (78,2%). O único benchmark de sete onde o 4.8 perde.

Trabalho do conhecimento.

GDPval-AA: 1890 Elo contra 1769 do GPT-5.5. A maior diferença em toda a tabela.

Uso do computador.

OSWorld-Verified: 83,4% (parte do ganho vem de uma atualização na ferramenta de teste, que a Anthropic sinaliza abertamente).

Ciência.

GPQA Diamond: 93,6%, praticamente estável (ambos os modelos estão acima de 93%, isso é saturação, não uma regressão).

shmidt - inline image

A própria Anthropic chama o lançamento de "uma melhoria modesta, mas tangível." Os benchmarks são um plus. As mudanças operacionais abaixo são a verdadeira história.

Recurso 1. Controle de esforço (o mais subestimado)

O Opus 4.8 padrão é Esforço Alto. Mas agora você decide quanto esforço de raciocínio ele coloca em uma tarefa. Pense nisso como uma transmissão manual para o raciocínio.

No claude.ai e no Cowork, o controle deslizante fica ao lado do seletor de modelo, com cinco níveis: Baixo, Médio, Alto (Padrão), Extra, Máximo, além de uma opção separada de Pensamento. No Claude Code, são os mesmos níveis com nomes ligeiramente diferentes, e há um modo automático:

Observação: "Extra" no claude.ai e xhigh no Claude Code são o mesmo nível, apenas rótulos diferentes em superfícies diferentes.

shmidt - inline image

A parte que importa financeiramente, para não haver confusão. NÃO há taxa adicional separada por nível de esforço. A taxa é a mesma em todos os níveis: $5 por 1M de tokens de entrada, $25 por 1M de saída. A diferença não é o preço por token, é quantos tokens o modelo gasta. Baixo responde de forma breve e pensa pouco, Máximo pensa muito e queima várias vezes mais tokens. Então, Máximo é "mais caro" devido ao volume, não à taxa.

Um guia aproximado do gasto relativo na mesma tarefa (números ilustrativos, para intuição):

Um exemplo prático. Digamos que uma resposta com Alto custe ~$0,05. A mesma solicitação em Baixo custa cerca de ~$0,005, e em Máximo pode facilmente chegar a ~$0,20-0,40. Se 60% dos seus comandos são pequenos ("o que esta função retorna?"), movê-los de Alto para Baixo reduz o gasto diário várias vezes, sem perda de qualidade onde é importante.

Por que isso impacta mais a conta. A maioria das pessoas vai deixar tudo em Alto (ou colocar no Máximo "para garantir") e nunca tocar no controle deslizante. Quem direciona o esforço por tarefa obtém os mesmos resultados por um custo visivelmente menor. Esse é o recurso mais subestimado do lançamento.

Recurso 2. Modo rápido (3x mais barato)

O modo rápido executa o Opus com velocidade 2,5x e a mesma qualidade, e agora é 3x mais barato que antes.

Ative-o no Claude Code com /fast (uma sessão ativa é marcada com um ícone ↯). O acesso via API é limitado por enquanto (lista de espera em claude.com/fast-mode).

Use o modo rápido para: grandes refatorações de múltiplos arquivos, geração de código a partir de especificações, documentação, geração de testes. Qualquer lugar onde velocidade supera profundidade. Fique no modo padrão para: depuração complexa, decisões de arquitetura, revisão de segurança. Qualquer lugar onde qualidade de pensamento supera velocidade.

Recurso 3. Fluxos de trabalho dinâmicos (o grande)

O Claude Code agora escreve um script de orquestração em JavaScript para sua tarefa e o executa em segundo plano enquanto sua sessão permanece responsiva. O plano reside no código, não no contexto do modelo, então apenas a resposta final retorna para sua sessão.

O que saber, com base na documentação oficial:

  • Até 16 subagentes simultaneamente, um limite máximo de 1.000 por execução.
  • Retomável: se o seu laptop desligar ou você fechar o terminal, a execução continua de onde parou.
  • Requer Claude Code v2.1.154+. Prévia de pesquisa.
  • Ativado por padrão em Max, Team, Enterprise. No Pro, ative em /config (e mude para Opus 4.8 primeiro).
  • Os subagentes executam no modo acceptEdits e herdam sua lista de permissões de ferramentas.

Ative com /effort ultracode (uma configuração do Claude Code: xhigh mais orquestração automática de fluxo de trabalho), ou apenas descreva uma tarefa grande em palavras:

shmidt - inline image

Bom para: migrações em mais de 200 arquivos, auditorias de segurança em toda a base de código, geração de testes em todo o projeto, grandes refatorações, pesquisa em múltiplos repositórios. Não é bom para: correções simples de bugs, edições em um único arquivo, perguntas rápidas. Exagero.

Sobre custos. Fluxos de trabalho consomem significativamente mais tokens do que uma sessão normal. A forma oficial de manter os gastos sob controle é delimitar o escopo da tarefa: execute uma auditoria em uma pasta primeiro, veja quantos subagentes ela gera, e então calibre a execução grande a partir daí.

Para desabilitar fluxos de trabalho completamente:

Exemplo de configuração do Claude Code (modelo inicial)

Variáveis de ambiente (no ~/.zshrc ou ~/.bashrc):

Depois vem a parte útil: um settings.json com permissões seguras. Ele permite que o modelo leia e edite código, execute testes e faça commit, mas bloqueia completamente as coisas perigosas: ler .env e chaves SSH, rm -rf, sudo e git push. O agente trabalha livremente, mas não pode quebrar nada ou vazar nada.

shmidt - inline image

O arquivo settings.json pronto para usar está no meu canal do Telegram (o formato é grande demais para ser lido claramente aqui): t.me/+JmDeelv5UCwwMTcy

shmidt - inline image

Folha de dicas de comandos diários

Instalando o Opus 4.8: três maneiras

A. Navegador ou aplicativo. No claude.ai, escolha Claude Opus 4.8 na lista de modelos e ajuste o controle deslizante de esforço. Sem necessidade de instalação.

B. API. Modelo ID claude-opus-4-8. Preço $5/$25 por 1M. Contexto de até 1M (200k no Microsoft Foundry), até 128k de saída. Pensamento estendido com orçamento fixo não é suportado: use pensamento adaptativo (thinking: {type: "adaptive"}) e o parâmetro de esforço.

C. Claude Code (terminal). O instalador nativo agora é o método recomendado (npm é legado):

Depois execute claude, faça login pelo navegador e escolha Opus 4.8 com /model.

Lista de verificação para migração: 4.7 para 4.8

  • Altere o ID do modelo para claude-opus-4-8
  • Execute 10-20 das suas tarefas reais no 4.7 e no 4.8 com comandos idênticos
  • Compare: taxa de conclusão, número de etapas, tokens, taxa de aprovação em testes
  • Verifique comandos ajustados para o comportamento do 4.7
  • Atribua níveis de esforço por tipo de tarefa
  • Teste o modo rápido onde a velocidade é importante
  • Atualize o Claude Code para v2.1.154+ (para fluxos de trabalho)
  • Reconfira a fatura da API após a primeira semana

Cartão de referência: tudo em um só lugar

Modelo: claude-opus-4-8 · lançado em 2026-05-28

Preço: $5 / $25 por 1M · modo rápido $10 / $50

Contexto: até 1M · até 128k de saída

Destaques: SWE-bench Pro 64,3% → 69,2% (+10 sobre GPT-5.5) · SWE-bench Verified 88,6% · 4x menos bugs perdidos · GDPval-AA 1890 Elo

Novidades: controle de esforço · modo rápido 3x mais barato · fluxos de trabalho dinâmicos (16 simultâneos / 1.000 por execução)

Obrigado pela leitura. Se você tirar uma coisa disso, que seja "direcione o esforço por tarefa."

O restante das minhas anotações sobre Claude e vibe coding está aqui: t.me/+JmDeelv5UCwwMTcy.

Vejo você lá.

@shmidtqq.

Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais