YouMind
Iniciar sesión

Opus 4.8: Mismo precio, pagas el doble

@shmidtqq
INGLÉS30 may 2026
1.2M
215
18
33
516

TL;DR

Opus 4.8 de Anthropic introduce mejoras operativas significativas, incluyendo control de esfuerzo y flujos de trabajo dinámicos. Aunque los benchmarks muestran ganancias modestas, el valor real reside en la optimización del uso de tokens y la velocidad para tareas de programación complejas.

Mismo precio. La mayoría solo cambiará el modelo y se perderá todo lo demás.

shmidt - inline image

Junto con Opus 4.8, Anthropic lanzó tres cosas que cambian cómo trabajas en Claude Code más que los números de los benchmarks: control de esfuerzo, flujos de trabajo dinámicos y modo rápido más barato. Las personas que configuran esto correctamente obtienen mejores resultados y gastan menos. Aquí está el desglose.

El número que más importa

No es el 69.2% en codificación. Es que 4.8 tiene aproximadamente 4 veces menos probabilidades de dejar pasar fallos en el código que escribió.

Los modelos anteriores solían decir con confianza "listo, error corregido" con poca evidencia. Anthropic apostó por la honestidad: 4.8 se toma más tiempo más seguido y señala dónde no está seguro, en lugar de generar código plausible que rompe casos límite silenciosamente. En una sesión larga, esto se acumula. Un modelo que admite incertidumbre en el turno 15 te ahorra un par de horas de depuración en el turno 40.

Lo que cambió: la versión corta

Codificación.

SWE-bench Verified: 87.6% → 88.6% (cerca del techo).

SWE-bench Pro (más difícil, menos contaminado): 64.3% → 69.2%, 10+ puntos por delante de GPT-5.5.

Este es el número destacado de codificación.

Terminal.

Terminal-Bench 2.1: 66.1% → 74.6% (+8.5), pero GPT-5.5 sigue liderando (78.2%). El único benchmark de siete donde 4.8 pierde.

Trabajo de conocimiento.

GDPval-AA: 1890 Elo vs 1769 para GPT-5.5. La brecha más amplia de toda la tabla.

Uso de computadora.

OSWorld-Verified: 83.4% (parte de la mejora es un harness actualizado, lo cual Anthropic señala abiertamente).

Ciencia.

GPQA Diamond: 93.6%, esencialmente plano (ambos modelos están por encima del 93%, eso es saturación, no una regresión).

shmidt - inline image

La propia Anthropic llama al lanzamiento "una mejora modesta pero tangible". Los benchmarks son un plus. Los cambios operativos a continuación son la verdadera historia.

Funcionalidad 1. Control de esfuerzo (la más infravalorada)

Opus 4.8 viene por defecto con esfuerzo Alto. Pero ahora decides cuánto razonamiento pone en una tarea. Piénsalo como una transmisión manual para el razonamiento.

En claude.ai y Cowork el control deslizante está junto al selector de modelo, con cinco niveles: Bajo, Medio, Alto (Predeterminado), Extra, Máximo, más un interruptor de Pensamiento separado. En Claude Code son los mismos niveles con nombres ligeramente diferentes, y hay un modo automático:

Nota: "Extra" en claude.ai y xhigh en Claude Code son el mismo nivel, solo etiquetas diferentes en diferentes superficies.

shmidt - inline image

La parte del dinero, para que no haya confusión. NO hay un recargo separado por nivel de esfuerzo. La tarifa es la misma en cada nivel: $5 por cada 1M de tokens de entrada, $25 por cada 1M de salida. La diferencia no es el precio por token, es cuántos tokens gasta el modelo. Low responde brevemente y piensa poco, Max piensa mucho y consume varias veces más tokens. Así que Max es "más caro" por volumen, no por la tarifa.

Una guía aproximada del gasto relativo en la misma tarea (números ilustrativos, para intuición):

Low: ~1/10 del costo de High • Medium: ~1/3 • High: punto de referencia • Extra: ~2-3x • Max: ~4-8x

Un ejemplo monetario. Supón que una respuesta High cuesta ~$0.05. La misma solicitud en Low cuesta alrededor de ~$0.005, y en Max puede llegar fácilmente a ~$0.20-0.40. Si el 60% de tus prompts son pequeños ("¿qué devuelve esta función?"), moverlos de High a Low reduce el gasto diario varias veces, sin pérdida de calidad donde importa.

Por qué esto impacta más la factura. La mayoría dejará todo en High (o lo subirá a Max "para estar seguros") y nunca tocará el control deslizante. Quienes asignan esfuerzo por tarea obtienen los mismos resultados por notablemente menos. Esa es la característica más infravalorada del lanzamiento.

Funcionalidad 2. Modo rápido (3x más barato)

El modo rápido ejecuta Opus a 2.5x de velocidad con la misma calidad, y ahora es 3 veces más barato que antes.

Actívalo en Claude Code con /fast (una sesión activa se marca con un ícono ↯). El acceso por API está limitado por ahora (lista de espera en claude.com/fast-mode).

Usa el modo rápido para: refactorizaciones grandes de múltiples archivos, generación de código a partir de especificaciones, documentación, generación de pruebas. En cualquier lugar donde la velocidad supere a la profundidad. Quédate en estándar para: depuración compleja, decisiones de arquitectura, revisión de seguridad. En cualquier lugar donde la calidad del razonamiento supere a la velocidad.

Funcionalidad 3. Flujos de trabajo dinámicos (el grande)

Claude Code ahora escribe un script de orquestación en JavaScript para tu tarea y lo ejecuta en segundo plano mientras tu sesión se mantiene receptiva. El plan vive en código, no en el contexto del modelo, por lo que solo la respuesta final regresa a tu sesión.

Lo que debes saber, según la documentación oficial:

  • Hasta 16 subagentes concurrentemente, un límite máximo de 1,000 en total por ejecución.
  • Reanudable: si tu laptop se apaga o cierras la terminal, la ejecución continúa desde donde se detuvo.
  • Requiere Claude Code v2.1.154+. Vista previa de investigación.
  • Activado por defecto en Max, Team, Enterprise. En Pro, actívalo en /config (y cambia a Opus 4.8 primero).
  • Los subagentes se ejecutan en modo acceptEdits y heredan tu lista de herramientas permitidas.

Actívalo con /effort ultracode (una configuración de Claude Code: xhigh más orquestación automática de flujo de trabajo), o simplemente describe una tarea grande en palabras:

shmidt - inline image

Bueno para: migraciones a través de 200+ archivos, auditorías de seguridad de todo el código base, generación de pruebas en todo el proyecto, refactorizaciones grandes, investigación en múltiples repositorios. No es bueno para: correcciones simples de errores, ediciones de un solo archivo, preguntas rápidas. Excesivo.

En cuanto al costo. Los flujos de trabajo consumen significativamente más tokens que una sesión normal. La forma oficial de mantener el gasto bajo control es delimitar la tarea: ejecuta primero una auditoría en una carpeta, ve cuántos subagentes genera, luego calibra la ejecución grande a partir de ahí.

Para deshabilitar los flujos de trabajo por completo:

Ejemplo de configuración de Claude Code (plantilla inicial)

Variables de entorno (en ~/.zshrc o ~/.bashrc):

Luego viene la parte útil: un settings.json con permisos seguros. Le permite al modelo leer y editar código, ejecutar pruebas y hacer commit, pero bloquea estrictamente lo peligroso: leer .env y claves SSH, rm -rf, sudo y git push. El agente trabaja libremente pero no puede romper nada ni filtrar nada.

shmidt - inline image

El archivo settings.json listo para pegar está en mi canal de Telegram (el formato es demasiado grande para leerlo claramente aquí): t.me/+JmDeelv5UCwwMTcy

shmidt - inline image

Hoja de referencia de comandos diarios

Instalando Opus 4.8: tres formas

A. Navegador o app. En claude.ai, selecciona Claude Opus 4.8 en la lista de modelos y ajusta el control deslizante de esfuerzo. No requiere instalación.

B. API. ID del modelo claude-opus-4-8. Precio $5/$25 por 1M. Contexto hasta 1M (200k en Microsoft Foundry), hasta 128k de salida. No se admite pensamiento extendido de presupuesto fijo: usa pensamiento adaptativo (thinking: {type: "adaptive"}) y el parámetro de esfuerzo.

C. Claude Code (terminal). El instalador nativo es ahora el método recomendado (npm es legado):

npm uninstall -g @anthropic-ai/claude-code

Luego ejecuta claude, inicia sesión a través del navegador y selecciona Opus 4.8 con /model.

Lista de verificación de migración: 4.7 a 4.8

  • Cambia el ID del modelo a claude-opus-4-8
  • Ejecuta de 10 a 20 de tus tareas reales en 4.7 y 4.8 con prompts idénticos
  • Compara: tasa de finalización, número de pasos, tokens, tasa de aprobación de pruebas
  • Revisa los prompts ajustados para el comportamiento de 4.7
  • Asigna niveles de esfuerzo por tipo de tarea
  • Prueba el modo rápido donde la velocidad importe
  • Actualiza Claude Code a v2.1.154+ (para flujos de trabajo)
  • Revisa la factura de la API después de la primera semana

Tarjeta de resumen: todo en un solo lugar

Modelo: claude-opus-4-8 · lanzado 2026-05-28

Precio: $5 / $25 por 1M · modo rápido $10 / $50

Contexto: hasta 1M · hasta 128k de salida

Clave: SWE-bench Pro 64.3% → 69.2% (+10 sobre GPT-5.5) · SWE-bench Verified 88.6% · 4x menos errores pasados por alto · GDPval-AA 1890 Elo

Nuevo: control de esfuerzo · modo rápido 3x más barato · flujos de trabajo dinámicos (16 concurrentes / 1,000 por ejecución)

Gracias por leer. Si te llevas algo de esto, que sea "asigna esfuerzo por tarea".

El resto de mis notas sobre Claude y vibe coding están aquí: t.me/+JmDeelv5UCwwMTcy.

Nos vemos allí.

@shmidtqq.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales