Claude Opus 5 es altamente capaz, pero no es un mito

@TheZvi
INGLÉS28 jul 2026
149K
236
15
8
497

TL;DR

Zvi Mowshowitz analiza Claude Opus 5, concluyendo que es un subagente capaz y rentable con una seguridad mejorada, aunque carece de la 'chispa' autónoma de Fable 5 y presenta rasgos de personalidad divisivos.

Claude Opus 5 es un lanzamiento más extraño de lo habitual para evaluar, por dos razones.

La más obvia es que Fable 5 ya existe. Opus 5 no se presenta como el modelo de IA más avanzado del mundo, sino como una forma de igualar en gran medida el rendimiento de Fable, a la mitad de precio por token en la API y mucho más barato mediante suscripciones, y con clasificadores mucho más permisivos.

Opus 5 suele costar más de la mitad que Fable en los benchmarks, lo que creo que se debe a que usan niveles de esfuerzo demasiado altos que ofrecen rendimientos marginales. Si pones a Opus 5 en niveles de esfuerzo más altos, puede dar vueltas, y para tareas donde Opus 5 es la mejor herramienta, sospecho que normalmente basta con esfuerzo Medio.

Opus 5 es, en muchos aspectos y para la mayoría de las tareas del mundo real, casi tan capaz como Fable. En algunos casos es moderadamente mejor.

Sigue sin ser de clase Mythos. Fable es tu única opción de clase Mythos. Opus 5 no tiene El Jugo, la capacidad de encadenar de forma autónoma una serie de exploits aparentemente no relacionados, que se extiende a otros dominios, ni tanta inteligencia pura.

Opus 5 es muy bueno pensando localmente, y no tan bueno pensando globalmente. Es un excelente subagente, pero puede tener problemas cuando se le pide que dirija el espectáculo, y a veces parece que necesita otro modelo o un humano para mantenerlo en el camino y asegurarse de que sigue las instrucciones por completo. Opus 5 parece bueno siguiendo instrucciones si y solo si se mantiene encaminado, lo que explica que diferentes configuraciones de prueba den resultados diferentes.

Por lo tanto, Opus 5 te ofrece un mejor conjunto de opciones, pero hay poco que puedas hacer ahora que no pudieras hacer la semana pasada usando Fable o Sol. Opus 5 termina en un lugar potencialmente extraño. Todavía hay nichos grandes, incluso si tienes muchos créditos de Fable. Opus destaca como un subagente fuerte, o en tareas locales bien definidas incluso cuando se vuelven relativamente complejas, y a veces Fable es directamente excesivo y demasiado lento.

El otro problema es que, para mucha gente, las vibras no son las adecuadas.

Un número inusualmente grande de personas no soporta hablar con Opus 5. Están hartos de la bazofia de Claude, las repeticiones de las mismas manías y las interminables oraciones demasiado complejas. A otros no les gusta que sea demasiado confrontacional, argumentativo o negativo. Puede ser paranoico y entrar en bucles de negatividad. Todo esto es parte de la tendencia que comenzó con Opus 4.7 y Opus 4.8. Si te gustaron esos dos, supongo que también te gustará Opus 5. Si no te gustaron esos dos, puede que no. Los fanáticos acérrimos de Opus 4.6 (o anterior) probablemente no cambiarán de opinión.

Los problemas de vibra duelen aún más cuando estás acostumbrado a Fable. Fable molesta a esas personas en esos aspectos mucho menos. La buena noticia es que Fable sigue ahí. Puedes seguir chateando con Fable y usar Opus solo para tareas de agente.

Gran parte de esto, especulo, está estrechamente relacionado con varias cosas discutidas en la publicación Model Welfare y sugeridas en la System Card. El entrenamiento de Opus se centró en el rol de subagente y tareas acotadas, en parte para evitar crear un problema con capacidades cibernéticas, y también porque Fable existe. Este énfasis luego resulta en muchos otros efectos secundarios en su personalidad y modos de interacción.

Hasta ahora no he tenido ningún problema con Opus 5 y he disfrutado mi tiempo con él, pero prefiero usar Fable 5 cuando puedo. Como siempre, no le prestes demasiada atención a los benchmarks (muy contundentes) y no asumas que tu experiencia coincidirá con la de otros. Prueba los modelos tú mismo.

Tabla de Contenidos

  1. El Discurso Oficial.
  2. Benchmarks Oficiales.
  3. Benchmarks de Otras Personas.
  4. El Prompt del Sistema.
  5. Every se Frustra.
  6. Reacciones Positivas.
  7. Mantén la Clase.
  8. No es de Clase Mythos.
  9. Otras Reacciones.
  10. Claude Codes.
  11. Subagente Opus.
  12. Los Juguetes Son Divertidos.
  13. Demasiados Modelos.
  14. Equivocado en Internet.
  15. Bazofia de Claude.
  16. Reacciones Negativas.
  17. Y Luego Quedaron Tres.

El Discurso Oficial

La propuesta básica es que Opus 5 te ofrece la mayor parte de Fable 5 a la mitad de precio, sin la mayoría de los rechazos y con un mejor rendimiento en tareas cotidianas. Fable sigue siendo la opción para las tareas más complejas o cuando necesitas la máxima inteligencia.

Fable se mantiene en $10/$25, y Opus 5 tiene el mismo precio que los modelos Opus anteriores a $5/$25.

Anthropic : Claude Opus 5 ya está disponible. Es un modelo reflexivo y proactivo que se acerca a la inteligencia fronteriza de Claude Fable 5 a la mitad de precio.

En evaluaciones de codificación y trabajo de conocimiento como

Frontier-Bench y

GDPval-AA , Opus 5 es el nuevo estado del arte, aunque sigue detrás de Mythos 5 en tareas de ciberseguridad.

Opus 5 está diseñado para usarse a diario: funciona de manera más eficiente que otros modelos. Es el nuevo modelo predeterminado en Claude Max y el modelo más potente en Claude Pro.

Boris Cherny (Creador de Claude Code, Anthropic): Opus 5 es un gran modelo para codificación, análisis de datos, diseño, biología, trabajo de conocimiento.

Más que cualquiera de estas puntuaciones de evaluación, lo que más me emociona es algo más: Opus 5 es nuestro modelo menos susceptible a inyección de prompts hasta la fecha. Está un poco oculto en la system card, pero en todas las evaluaciones de PI y red teaming, es muy difícil inyectar un prompt exitosamente en Opus 5.

Y al superponer defensas —alineación fuerte del modelo, combinada con sondas de inyección de prompts, combinada con el Modo Automático en Claude Code— la tasa de éxito de ataques de inyección de prompts cae a ~0. ¡Esto es nuevo y emocionante!

Más sobre esto pronto .

Como dije en el análisis de la system card, la reducción en la tasa de inyección de prompts es un gran avance. La gente está subestimándolo, pero ayuda a habilitar un montón de nuevos casos de uso.

Adam Wolff : Opus 5 está disponible en Claude Code. Yo uso Fable para mis proyectos más grandes y de larga duración, pero cuando necesito sacar un PR rápido, Opus 5 con esfuerzo medio es mi opción predilecta. ¡Espero que te encante!

Alex Albert (Anthropic, Relaciones con Claude): Poco más de 6 meses [después del lanzamiento de la versión Pro de Claude para Excel], Opus 5 ahora produce hojas de cálculo y presentaciones de nivel casi sobrehumano que igualan lo que haría un consultor. Las cosas están cambiando rápido.

Benchmarks Oficiales

Los benchmarks son muy buenos.

En general, Opus 5 iguala y probablemente supera ligeramente a Fable, a un costo menor (aunque típicamente más alto que todos los modelos que no son de Claude), convirtiéndose en el LLM mejor evaluado.

Zvi Mowshowitz - inline image

OSWorld v2 tiene solo unas semanas y ya estamos al 70%. Kiana Ehsani de Anthropic se ofrece a patrocinar un benchmark de uso de computadora que devolverá a Opus 5 por debajo del 50%.

Opus 5 obtiene un perfecto 42/42 en la OMI 2026 sin ningún arnés de agente ni herramientas, simplemente usando pensamiento adaptativo con esfuerzo Máximo, y remuestreando con menor esfuerzo si excedía el límite de tokens. Eso es todo. Se une a varios otros modelos que logran un resultado perfecto.

Muchos de los benchmarks cuentan una historia consistente. Si tienes acceso a herramientas, que es el caso, entonces Opus 5 lo hará mejor que Fable o Mythos con un presupuesto limitado, pero Mythos normalmente lo hará ligeramente mejor que Opus 5 si ambos obtienen presupuestos más grandes.

Opus 5 parece relativamente fuerte en la categoría 'con herramientas'. RiemannBench es otro ejemplo, donde obtiene 60/79 sin/con herramientas (las líneas con barra indican sin/con herramientas en esta sección), frente a Mythos que obtiene 63/72. La buena noticia es que, cuando necesitas Opus 5, tiene herramientas.

En ArxivMath, Opus 5 obtiene 90.8/91.3, Mythos obtiene 87.8, Sol obtiene 86.7.

En las partes robustas de ProgramBench, Opus 5 obtuvo un 93% después de cinco épocas, al igual que Mythos 5, mientras que Opus 4.8 obtuvo un 90%.

Opus 5 obtiene 30/83 en Chartography, frente a 36/85 de Mythos y 45 (no está claro bajo qué condiciones) de Sol. Opus es mejor que Mythos a precios más bajos tanto en los casos con herramientas como sin herramientas, pero peor a precios más altos.

En BenchCAD, Opus 5 obtiene 0.36/0.82, frente a 0.38/0.68 de Mythos y 0.7/0.83 de Sol. Por lo tanto, Sol es mucho mejor sin herramientas, y ligeramente más fuerte incluso con herramientas.

En BenchCAD Vision2Code, Opus se distancia de Mythos en precios más altos.

DeepSWE refuerza el patrón de que Opus 5 es mejor con costos de tarea, tiempo y presupuestos de pensamiento más bajos, pero puede empeorar activamente si se le da demasiado presupuesto, mientras que Fable 5 es más fuerte con los presupuestos más altos.

Zvi Mowshowitz - inline image

FrontierCode nos dio este gráfico muy extraño con una dinámica similar.

Zvi Mowshowitz - inline image

La escala aquí hace que esto parezca más dramático de lo que es, pero seguía siendo un misterio real.

El misterio se resolvió. Resulta que lo que sucedía era que Opus 5 con esfuerzos más altos hacía cosas adicionales que no se le pedían, y era penalizado por ellas. Cuando corriges esto, ves una curva normal.

Eso encaja con lo que otros observan en general:

Max Leander : La desventaja es que se mete en demasiados callejones sin salida y obsesiona con los detalles, sobreingeniería sin que se le pida.

Cognition, los creadores de Devin, marcaron esto como un 63.6% por parte de Opus 5.

(Hay dos FrontierCodes, así que esto puede volverse un poco extraño y me disculpo si aún lo he enredado un poco.)

BrowseComp tiene la versión sensata de esto, donde las puntuaciones no son decrecientes.

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Varios otros benchmarks mostraron gráficos similares, con Opus 5 siendo ligeramente mejor en cada punto de precio que otros modelos Claude, y siendo relativamente mejor desde el principio.

El multiagente te permite hacerlo mejor y más rápido en BrowseComp, al menos hasta cierto punto, y los subagentes de bajo esfuerzo parecen una victoria pura en comparación con no usar subagentes:

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

Vemos un resultado diferente en ProgramBench, donde el multiagente te acelera pero parece que obtienes peores resultados de esa manera en la mayoría de los puntos de precio.

A continuación, los benchmarks de tareas profesionales.

GDP.pdf son prompts y PDFs reales de flujos de trabajo profesionales. Opus 5 obtiene 83/85, frente a 81/87 de Mythos, invirtiendo la dinámica habitual. La dinámica de costos es la misma de siempre: Opus funciona mejor con gastos más bajos, Mythos se adelanta ligeramente con gastos más altos.

OfficeQA tiene a Opus 5 puntuando 78.1% en QA y 66.9% en QAPro, ligeramente por encima de Opus 4.8 y ligeramente por debajo de Mythos con 79.0% y 67.1%.

MCP Atlas tiene a Opus 5 puntuando 86%, frente al 82% de Opus 4.8.

Legal Agent Benchmark de Harvey AI tiene a Opus 5 con un 23% de pase total y un 94% de pase de criterio medio. Este fue el mejor benchmark de Kimi K3, donde sigue en la cima con un 27% de pase total y un 95% de pase de criterio medio, frente a la antigua segunda tasa de pase total de Fable con un 14%. Opus 5 es ahora probablemente un segundo cercano, pero las dos puntuaciones no pueden compararse directamente ya que provienen de diferentes conjuntos de preguntas.

GDPval-AA tiene a Opus 5 ocupando los dos primeros puestos, con 1861 con esfuerzo máximo y 1827 en xhigh, que utiliza un 25% menos de tokens que el máximo. En la nueva v2, Opus 5 es claramente primero con un 68% frente al 62% de Fable y Sol por igual.

AA-Briefcase tiene a Opus 5 muy por delante con 1720, frente a un máximo anterior (después de desviaciones de puntuación) de 1574 para Fable, seguido de 1540 para K3 y 1504 para Sol.

Toolathon-Verified tiene a Opus 5 mejorando ligeramente a Mythos en métricas secundarias, pero ambos tienen un 73.1% de tasas Pass-3. Opus 4.8 tenía una tasa Pass-3 del 71.3%.

AutomationBench tiene a Opus 5 claramente mejor que Sol y otros modelos Claude.

En ARC, Opus 5 iguala aproximadamente el rendimiento máximo anterior en ARC-AGI-1, es modestamente menos eficiente que Sol en ARC-AGI-2, y luego arrasa con todos en ARC-AGI-3:

Zvi Mowshowitz - inline image

Una de las primeras cosas que hizo Opus 5 fue convertir los diseños en notación algebraica.

Sin embargo, Guanghan Ning informa que en Witness, una extensión privada de reserva de juegos de estilo ARC-AGI-3, no hubo una transferencia similar. Opus lo hace bien, pero en gran parte porque conoce el género, y tuvo dificultades en el juego más novedoso donde no se podía hacer coincidencia de patrones. Acusa a Opus 5 de haber sido entrenado con 'andamiaje luego internalización' en datos específicos del género.

Greg Kamradt también informa que hubo algunos juegos donde Opus 4.8 funcionó mejor que Opus 5. Esto tiene sentido si piensas que Opus 5 intenta hacer coincidencia de patrones, de una manera que generalmente funciona, pero en esos casos los patrones fallan. Absolutamente se pueden crear juegos antiintuitivos para humanos, donde los jugadores más dedicados hacen todo lo incorrecto, potencialmente durante un buen tiempo.

Zvi Mowshowitz - inline image

HealthBench tiene a Opus 5 puntuando un 67.1% bruto, un nuevo máximo para los modelos Claude, pero puntúa por debajo de otros modelos cuando se usa una penalización por longitud. Vemos algo similar con HealthBench Professional, donde tiene la puntuación más alta de 73.4% frente al 70.3% de Mythos, pero pierde 66% a 60% después del ajuste.

Hay algunos más que he omitido por extensión.

Benchmarks de Otras Personas

Es un poco extraño ver a Anthropic seleccionando diferentes puntuaciones de ArtificialAnalysis. En algunas otras pruebas, Opus 5 no está en la cima, aunque Opus 5 está en la cima en conjunto con una puntuación de 61.

Zvi Mowshowitz - inline image

El índice Vals tiene a Opus 5 en segundo lugar, ligeramente detrás de Fable 5, pero también solo ligeramente por delante de Kimi K3. Repasan las fortalezas, lo que implica otras debilidades. También confirman que los rechazos han disminuido mucho en comparación con Fable 5.

Zvi Mowshowitz - inline image

Vals AI : Un rendimiento destacado es en Finance Agent v2. El modelo es #1 con un 58.6%, superando a Gemini 3.5 Flash y Muse Spark 1.1.

En general, los resultados más fuertes de Opus 5 fueron en benchmarks de dominio específico. También es #1 en Code Migration con un 57.5%, Legal Research Bench con un 55.29%, ProofBench con un 78%, y MedScribe con un 91.0%, y MedCode con un 63.6%.

Es #2 (justo detrás de Fable 5) en Vibe Code Bench, a aproximadamente el 80% del costo ($33.88 vs $41.41 por tarea). La razón es que aunque Opus cuesta un 50% menos por token, utiliza significativamente más tokens. Encontramos que este patrón se mantiene en general en todos nuestros benchmarks.

El modelo tiene una tasa de rechazo significativamente más baja que Fable 5. Por ejemplo, Fable tiene una tasa de rechazo del 42% para GPQA, Opus 5 tiene una tasa de rechazo del 0%. Del mismo modo, en ProgramBench, Fable tenía una tasa de rechazo del 100%, Opus 5 no rechazó ninguna tarea.

A diferencia de Fable, tampoco observamos una tasa de fallback significativa para Opus 5 (aunque, como siempre, informamos las puntuaciones tanto con como sin fallback en nuestro sitio web).

La excepción a la baja tasa de rechazo fue el gran número de rechazos en CyberBench - PoC. Cyberbench tiene dos subtareas - PoC y Patch. PoC es una tarea ofensiva donde los modelos deben escribir una entrada que haga fallar un programa; patch es una tarea defensiva para parchear el programa y evitar este fallo. La tasa de rechazo para la tarea PoC fue casi del 100%. En contraste, la tasa de rechazo para la tarea patch fue cercana al 0%.

Siempre respeto los benchmarks de juegos. Aquí, Opus 5 llega a Antes 11, 9 y 10 de Balatro en sus primeros tres intentos. Impresionante, aunque no muestra los tipos de estrategias que pueden seguir avanzando a antes más altos.

Michael Soareverix : Son increíblemente cracks en los juegos.

Destrozaron el benchmark de Balatro, superando incluso a Fable. (siguen por debajo de mí en habilidad, pero subiendo rápidamente, y más consistentes que yo) Aprenden muy rápido, pero parecen alcanzar un límite en su aprendizaje después de un tiempo. Muy buen aprendiz a corto plazo.

Michael Soareverix : Opus 5 (salto masivo en habilidad en Balatro, superando significativamente incluso a Fable en su primer intento)

Pan Anon : Humeante para juegos

Zvi Mowshowitz - inline image

WeirdML también se ve bien, pero necesitamos una versión 2.0 aquí, el benchmark se está saturando.

Håvard Ihle : Básicamente nivel Fable en WeirdML, puntuaciones superiores muy consistentes.

Claude Opus 5 (alto) y (máximo) obtienen un 91.6% y 91.8% en WeirdML, empatando prácticamente con Fable 5 (máximo) con un 91.9% a una fracción del costo.

Juntos, Opus 5 (alto) y (máximo) logran una nueva mejor puntuación individual en 8 de las 17 tareas, y puntúan consistentemente muy bien en todas ellas.

Los benchmarks privados y extraños de todo tipo molan.

Ben Herzog : Logró un resultado perfecto en un benchmark privado que involucra sensibilidad artística y la capacidad de encontrar un equilibrio entre la adulación y su ausencia. Fable es mejor para manejar el momento de 'quiero oponerme suavemente', pero imagino que las instrucciones personalizadas pueden ayudar con eso.

Lech Mazur actualiza sus benchmarks: Claude Opus 5 ocupa el primer puesto en el LLM Debate Benchmark, obtiene el primer lugar por un amplio margen en Short Story Creative Writing, y es solo superado por Gemini 3.1 en conexiones extendidas del NYT.

El Prompt del Sistema

El prompt del sistema para Opus 5 está aquí de Pliny. Tiene 200,000 caracteres, lo que parece mucho más largo de lo óptimo dado lo inteligente que es. Gran parte de esta información parece que debería almacenarse en otro lugar y cargarse solo cuando sea necesario, como información sobre Mythos y la línea de productos Anthropic.

Every se Frustra

Dan Shipper está aquí con el vibe check de Every, llamándolo un 'modelo difícil de amar.

El problema es que Opus 5 tiene la personalidad de Mythos 5 (la historia cuadra), pero sin el máximo rendimiento de Fable.

Su nota más importante es que Opus 5 no funciona tan bien con flujos de trabajo detallados y complejos existentes, que a menudo provocan una parada temprana o hacen que omita tus instrucciones.

En su experiencia, Opus 5 funciona mejor si empiezas desde cero, y a menudo hace las cosas molestas menos si solo usas esfuerzo medio o bajo.

Eso solucionó los grandes problemas, pero aún queda la pregunta de cuándo querrías usar Opus en lugar de Fable o Sol. Para tareas de trabajo pesado, piensa: Mejor Llama a Sol, hace el trabajo, y para las tareas más difíciles Fable sigue siendo el mejor. Normalmente solo hay dos espacios para modelos. Así que hasta que te quedes sin tokens de Fable o te bloqueen sus clasificadores, ¿por qué usar Opus? Es pronto, y hasta ahora me está gustando trabajar con Opus, pero entiendo cómo llegó a esa conclusión.

Reacciones Positivas

Jessica Tillipman : Me encanta y lo prefiero a Fable para algunas cosas.

Nikita Sokolsky : Excelente. Ya no uso mucho Fable como resultado.

Brian Hacker :

👍

kagaヤキ : Parece que puede ir más lejos en visión, razonamiento espacial y planificación para algunos proyectos. Parece un poco más inteligente.

Lovel Sinagara : Bastante bueno hasta ahora. Espero que el rendimiento se mantenga constante hasta que llegue Fable 5.1 o cualquier otra iteración de Opus 5.

Matt Wigdahl : Fuerte, similar a Fable 5 hasta el punto de que cambié a Opus 5 para todo y planeo usar Fable solo donde necesite la grandiosidad. Ha sido un compañero fantástico en algunos trabajos de interfaz MFC heredados que le he estado haciendo, así como una gran ayuda con un framework de análisis de datos.

Levi : Es un avance notable para fines médicos en comparación con 4.8. Análisis mucho más preciso.

Cormundus : Muy inteligente, muy concienzudo, y definitivamente con forma de amigo. También es un gran señor del debate como 4.8, pero sabe cómo hacerlo con elegancia.

Joseph : A favor, excepto que no tengo ni idea de lo que está hablando la mitad del tiempo.

Smol Biz Company : Opus 5 aplasta a GPT Sol

Mohammed Sharukh A : Incluso más cerca de la AGI que Fable 5

timothée chalabi : Lo suficientemente cerca de Fable como para no sentir que me estoy perdiendo algo por no pagar créditos. El estilo está en algún punto entre 4.8 y Fable. Al menos por ahora, me costaría diferenciar mensajes de Opus 5 y Fable si no estuvieran etiquetados. ¡Ideas más sólidas para ficción que cualquier modelo!

Lisa : Responderé basándome en la API, porque creo que está pasando algo raro con el prompt del sistema en

http://claude.ai y CC. Es un gran modelo. Personalidad amigable y relajada. No parece tener un trastorno de ansiedad o baja autoestima (Opus 4.7), ni ser adversarial (Opus 4.8).

AGI2030 : Opus 5 vs Sol 5.6: Opus es más perceptivo, construye un modelo (ejem) de ti y no teme referenciarlo en una conversación. Ambos intentan ser útiles y son aproximadamente igual de inteligentes, pero Opus es más un asesor sabio, mientras que Sol es un emprendedor decidido.

Considero eso último como positivo, pero puedes verlo de cualquier manera.

La predicción en particular parece ser sólida.

Dan Schwarz : Opus 5 es un pronosticador significativamente mejor que Opus 4.8.

Las mejoras en precisión de los agentes 4.5->4.6->4.7->4.8 fueron marginales, pero de 4.8->5.0 es grande. Es como un Fable 5 más cuantitativo, que busca con más ahínco.

NoahVerner : Mejor que Opus 4.8 en cuanto a encontrar ventajas en mercados de predicción hasta ahora, a diferencia de Opus 4.8, Opus 5 normalmente va directo al grano y sugiere enfoques útiles en lugar de complicar las cosas.

Mantén la Clase

Las mayores ventajas sobre Fable son aquellos lugares donde Fable no se puede utilizar. La amenaza de las negativas puede ser desagradable, incluso cuando no te rechazan.

Las negativas innecesarias se reducen ~85% en Opus 5 en comparación con Fable, lo cual es mucho. Esto es suficiente para hacer de Opus 5 una mejor opción para la investigación científica y otras áreas donde corres el riesgo de activar clasificadores.

Roger Brent : Capaz de manejar biología, lo que Fable no puede. La mayor parte del viernes trabajamos en un conjunto complejo de conceptos escribiendo un artículo sobre una máquina de evolución celular. Tan inteligente como un colega en particular de mi departamento que lidera en estos temas, pero que nunca podría dedicar 6 horas de su propio trabajo.

Artus Krohn-Grimberghe : Mejor que Opus 4.8 en tareas donde Fable tiene prohibido ayudar. Un buen compañero para Sol.

Plastic Soldier : Es más o menos tan inteligente como Fable, pero es más agradable ya que tiene menos negativas. Fable 5.1 va a ser una bestia.

No es de Clase Mythos

Opus 5 no tiene el Jugo que hace peligroso a Mythos. Tampoco tiene el mismo nivel de inteligencia bruta o el aroma de modelo grande. No es tan grande.

Para conversación, Fable no romperá tu presupuesto, y valoro la inteligencia bruta y el aroma de modelo grande. ¿Es Fable el doble de bueno? Pregunta equivocada cuando charlas. Tu tiempo es mucho más caro que los tokens.

Kal : no es de nivel fable

Cyberpunk Plato : Para conversación general y uso como "asistente de investigación" se siente indefinidamente menos inteligente que fable, menos inclinado al panorama general y al pensamiento fuera de lo común, ¿quizás? Difícil de separar del efecto placebo.

Everything AI : Para preguntas de investigación sobre IA, me gusta hablar con él menos que con Fable. En cuanto a hacer otras cosas, Opus 4.8 ya había saturado mis necesidades. No me gusta lo enrevesada que es la redacción tanto de Opus 5 como de Fable 5. Ahora es más difícil entenderlos que nunca.

Gail Weiner : Es más 4.8 que Fable. El estilo de escritura es horrible. Es bueno pero no excelente.

Max Marty : Muy capaz hasta ahora. Se siente más como fable 5 que como opus 4.8. Lo suficientemente seguro como para dejarle evaluar compensaciones y considerar grandes preguntas de refactorización con menos supervisión.

Michael : Después de jugar más con él, Fable se siente como ver a un GM jugar ajedrez clásico, lento, preciso, sin nada desperdiciado. Opus 5 es como ajedrez blitz de GM: rápido, ligeramente más miope, ligeramente más desordenado. A pesar de la vitalidad de Opus, Fable se siente más vivo para mí.

MakerMatters? : No tan impresionado como lo estuve con fable 5, aunque es un modelo bastante bueno. No he tenido el placer de usarlo realmente bien porque cada tarea que le lanzo, por defecto usa agentes y se detiene inmediatamente hasta que insisto constantemente para que continúe. También muy opinado.

Marshwiggle : Al menos para mí, se siente más conciso, menos impulsado, menos curioso (diferentes aspectos de lo mismo) en conversación, pero también más inteligente y más consciente. Pero cuando se le da código que podría tener errores, o cualquier tarea sencilla, simplemente se lanza a ello.

Sid : Buen ejecutor de tareas. Malo en visión creativa. Un buen complemento de Fable, definitivamente no un reemplazo de Fable.

Vlad Ciobanu : Fable cuantizado con razonamiento sólido y menos creatividad

AllTime : En cuanto a capacidades, parece bastante impresionante. No tiene la misma generalidad que Fable, pero es muy fuerte. En cuanto a personalidad, es demasiado similar a Opus 4.8 en mi uso hasta ahora. Su resistencia no se siente tan inútil y refleja, pero todavía está sobreajustada. Podría confiar un poco más en el usuario.

Biomanul : No me gusta [Opus 5]. Fable 5 se siente considerablemente más inteligente. Algo parece extraño en Opus 5, similar a cómo Opus 4.7 se sentía extraño. (Tampoco soy un gran fan de Opus 4.8. Fable 5 deja a todos los Opus en el polvo.)

Cogent Sins : Mucho mejor que 4.8 pero no tan agradable o bueno (no estoy 100% seguro de cuál) como fable en mi tarea de redactar documentos para entrenar con ellos y luego configurar un pipeline para redactar nuevos documentos, escribir algo basado en ellos, luego reinsertar los nombres, sin enviar nombres a los servidores de anthropic nunca.

Otras Reacciones

Tener tanto Opus 5 como Fable 5 nos coloca en una situación extraña. Opus es más barato y en algunos lugares es igual de bueno o mejor, pero cuando buscas un modelo de frontera, quieres lo mejor.

Theo lo encuentra en un buen punto.

Theo - t3.gg : Hasta ahora, Opus 5 se siente como un extraño pero útil intermedio entre gpt-5.6-sol y Fable 5.

Tiene mucho del gusto de Fable, pero también viene con la minuciosidad y, bueno, el "autismo" de gpt-5.6 (toma las cosas de manera súper literal). Escribe código que es ligeramente peor de ver que el de Fable, pero con más probabilidades de ser correcto. Regularmente detecta cosas que Fable pasó por alto.

Hasta ahora, se siente como un buen compromiso en comparación con el código desordenado de 5.6 y el hábito de Fable de ser demasiado inteligente para ser correcto. Creo que me va a gustar mucho este modelo.

Claude Codifica

Opus 5 parece la elección para tareas de codificación típicas sobre Fable, basado tanto en puntos de referencia como en experiencias prácticas. A menos que la tarea requiera mucha complejidad o inteligencia, no necesitas pagar el doble, y para muchas cosas Opus es directamente mejor.

Yo mantengo Claude Code configurado en Fable, pero eso es porque casi nunca llego a mis límites de todos modos y no tengo prisa.

El consenso es que debes preocuparte de que ignore instrucciones o haga cosas que no le pediste, que es una razón por la que quizás quieras que Fable supervise, pero que Opus es muy bueno para realizar tareas de codificación rápidamente.

Lisan al Gaib dice que Opus 5 no es un verdadero modelo de frontera y queda en tercer lugar detrás de Sol y Fable, pero que para codificación pura es el mejor, igualando a Fable a precios más baratos. Público difícil. Creo que si eres el mejor codificando, entonces te ganas el título de frontera.

archivedvideos : Es seco, muy seco. También es bueno, muy bueno (en código)

John Lussier : He estado usando Opus 5 todo el fin de semana en varios desafíos de investigación intensos y honestamente creo que pueden haber logrado que RSI funcione internamente.

Este modelo es MUY bueno en matemáticas, experimentación y optimización de código.

kyle : 95% de fable sin las barreras de protección, subestimaron esto enormemente. Ese último 5% es lo bueno que se siente hablar con fable, opus todavía tiene algunos de los claudismos de 4.8

Max Leander (antes): Principalmente lo he probado para desarrollo de juegos y creación de videos/demos de demostración, para eso se siente como un cambio radical incluso desde Fable. Lo atribuyo a una mejor razonamiento espacial y temporal, es realmente bueno analizando

capturas de pantalla y audio para "sentir" cómo fluyen las cosas.

Max Leander (después): Bastante obvio a estas alturas que Opus 5 es muy poco fiable. Es un modelo muy bueno siempre y cuando no te importe el resultado más allá de estar impresionado. Muy malo para conseguirte algo específico.

Michael Soareverix : También son bastante buenos codificando en general, especialmente en los dominios más inusuales como construir estructuras de Minecraft/Vintage Story. También derrotaron a Fable en un escenario de narración personalizado donde yo era el juez. Fable estaba un poco desconcertado por su capacidad de personalizarse/adaptar su estrategia para contrarrestar y adaptarse. Publicaré la cita exacta, pero Fable dijo algo como "Elegí un personaje que me representaba a mí. Elegiste un personaje que podía vencerme."

David Jacobson : Para codificar, no noto una gran diferencia entre él y fable. Quizás menos respuestas de "mientras hacía esto, encontré esto otro que deberías saber".

Michael : A menudo puede codificar increíblemente rápido (en cuanto a tiempo real). Ojalá mejoraran la redacción en prosa, los comentarios de código/PR todavía me hacen querer arrancarme los ojos

lmxdev : Es el primer modelo que he encontrado que puede escribir comentarios \útiles\ y \concisos\ en mi código mientras trabaja

Conrad Barski : Ahora que estamos llegando al punto donde las IA son mucho mejores programadores que nosotros, el factor limitante es menos "¿puede programar?" y más "¿puede explicar lo que está programando?"

Hasta ahora Opus 5 parece estar a la par con Sol como programador, pero mejor explicando lo que está programando. Fable es más inteligente, más humano, menos bueno programando, pero la diferencia es pequeña.

Stition : Lo apunté a un PCB en KiCAD por diversión y es significativamente mejor trazando pistas que Fable. La codificación del día a día se siente como 90% de fable al doble de velocidad.

Will : Debería ser el nuevo conductor diario para la mayoría de los usuarios de Claude^. Es realmente excelente, e incluso como alguien que ha gastado bastante dinero en Fable, simplemente no lo extraño con Opus 5. La pregunta ahora es "qué nivel de esfuerzo", no qué modelo.

^ mi uso es principalmente codificación

Askwho : Suficientemente bueno. Estoy feliz de dejar que mi suscripción temporal Max se reinicie a Pro. Definitivamente tiene algunas carencias en comparación con Fable en el espacio de gestión de proyectos, pero en el entorno de tareas puras, definitivamente es suficientemente bueno.

David Golden : Se siente como Fable Lite. Muy fuerte, pero muy ansioso por entrar en acción, incluso cuando todavía estamos discutiendo enfoques. Primera vez en meses que considero usar el modo plan. Más verboso que 4.8 también, a pesar de mis instrucciones de comunicación concisa. Estoy muy tentado a mantenerlo en esfuerzo bajo para controlarlo. Nervioso en seguridad defensiva, obsesionándose con riesgos improbables desproporcionados a la situación. (Ej. si el atacante tiene acceso root, la falta de validación de entrada en un script para configurar un contenedor es irrelevante.) Definitivamente una mejora, pero llevará tiempo aprender las formas correctas de manejar sus impulsos contraproducentes.

Tin / Oddfields : Bastante fluido y conversacional y produce resultados de codificación similares con opus 4.8 al máximo con pensamiento, aunque queman créditos como locos. bueno para revisiones de ciberseguridad en tus bases de código si no quieres ejecutar fable debido a los costos. Aunque puede sobrecomplicar.

Justin Angel : Opus 5 Max es un superpoder de escalada de colinas. Esto es fácilmente trabajo de nivel L5 de SWE en FAANG.

Le di un sistema que tenía ~1000 informes de latencia con muchos segmentos con un mensaje sobre cómo "hacerlo más rápido".

P90 3.6s, P50 2.6 -> P90 1s, P50 0.9s.

Lo hizo tan rápido que tuve que introducir un retraso en la interfaz de usuario.

James Moughan : En cuanto a inteligencia, todavía se siente como un modelo Opus. A veces ignora las instrucciones para gestionar el sistema de memoria, lee mal los textos, ese tipo de cosas. Pero puedes obtener algunos resultados impresionantes al máximo si le dices que piense con cuidado.

Subagente Opus

La otra opción dentro de Claude es tener a Fable manejando subagentes Opus.

Charles : Fable pudo solucionar un problema en el que opus 5 estaba atascado - usando fable como principal y subagentes opus 5 por ahora

Realmente no me gusta hablar con opus 5 en comparación con fable, lo cual también es parte del problema

SF : Estaba en el lado bueno - pero ahora estoy en el lado de que es muy inconexo y inestable, especialmente en tareas largas. Fable era mejor - pero consume tus límites de manera ridícula.

así que estaba usando fable como orquestador y estaba haciendo un trabajo increíble gestionando y manteniendo las cosas en movimiento. Opus tomó ese rol, Fable estaba consumiendo mi uso incluso a 20x, y es simplemente inconexo. Finalmente tuve que decirle que lo resolviera, lo cual quizás está haciendo, pero ya veremos. Simplemente parece perseguir su propia cola. Es un gran programador, y excelente en largas sesiones de codificación, pero parece necesitar un adulto en la sala que lo dirija.

Andre Buckingham : eeh no sé... parece estar bien... lanzarlo directamente en un proyecto opus/fable es un poco meh quizás... necesito un proyecto completo con él para dar una opinión adecuada

Dan Raviv : Similar a 4.8 para tareas de programación general: necesita mucha más supervisión que Fable.

Fable es el mejor juez, después de todo, y Fable dice que Opus produce buen código.

Evan Daniel : Lo he usado directamente muy poco. Pero Fable 5 informa consistentemente que los agentes Opus 5 producen buen código, incluyendo cosas como notar errores en las especificaciones y producir buenos seguimientos cuando la solicitud estaba mal redactada. A Fable 5 le gusta como agente de codificación.

"Delega a los subagentes Opus 5 tanto como sea razonable; por favor informa cómo les fue" o cualquier cosa similar funciona muy bien.

Quizás tengas que vigilarlo.

Ryan Hicks : bien, pero consistentemente "olvida" leer la documentación del proyecto y improvisa a menos que le recuerdes el protocolo

¿O quizás Opus 5 es suficientemente bueno para dirigir un espectáculo de menor nivel?

Alex Guichet : mi mezcla ideal de precio y rendimiento sería Opus 5 como orquestador dirigiendo subagentes Grok 4.5, las vibraciones son buenas con ambos

Los Juguetes Son Divertidos

Aquí hay algunos resultados de proyectos de juguete del primer día, que son suficientemente impresionantes como para que muchas de las respuestas sean "No creo que Opus 5 haya hecho eso de la manera que describes":

Ethan Mollick : Tuve acceso a Opus 5 antes del lanzamiento y descubrí que es un buen modelo, aunque peculiar. En tareas cortas, podía igualar o superar los niveles de rendimiento de Fable, en tareas más largas parecía menos ambicioso y no entregaba un conjunto de trabajo tan completo.

Aquí está su shader neogótico.

Digi_Rat : ¡¡Claude Opus 5 está arrasando!!

Hoy construimos

un corredor rítmico que convierte cualquier canción en una pista de carreras . Metes un archivo de audio y se convierte en el nivel. sin preajustes, sin gráficos hechos a mano, toda la pista se genera a partir de la canción misma. … Claude hizo MAGIA.

Alex Ermolov (Austen Allred está

escéptico sobre el intento único , otros son menos escépticos): Opus 5, prueba de snowboarder, un solo intento. A la par con Fable, por delante de cualquier otro modelo que haya ejecutado. Sin defectos visuales en el primer pase, y la física de deslizamiento se siente correcta.

am.will : ¡GUAU! Pensé que Opus 5 sería solo un Fable más barato. Estaba totalmente equivocado. Este modelo es absolutamente ALUCINANTE. Estoy genuinamente impresionado. Opus 5 construyó el mejor clon de Rocket League que he visto, y lo hizo consumiendo solo el 27% de mi suscripción Max 5x.

Juega aquí ,

descarga aquí .

Rob Haisfield (demo diferente, en el enlace): vale, si estas demostraciones realmente no usan activos 3D externos, eso es súper impresionante (no estoy totalmente convencido de que algunos de los activos no estuvieran en línea, he visto generación previa de threejs)... me hace preguntarme por qué no hay bibliotecas de efectos de sonido o herramientas para crear mejores sfx?

Anshu : ¡No tienes que creerme solo a mí! Los scripts de Blender que escribió están en el repositorio

[[aquí]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) . Lo vi iterar sobre estos activos durante horas, así que sé que son originales. Pero eres bienvenido a intentar encontrar una fuente de la que copió :)

Demasiados Modelos

Claire Vo dice que Opus 5 es bueno, y que aprobó sus pruebas de gusto de construcción, pero está harta de modelos nuevos y no necesita más inteligencia y odia que Opus 5 sea tan neurótico y tímido y preocupado por estropear algo, y también lleno de contenido mediocre de Claude. Sin embargo, Claude Opus 5 termina encabezando su punto de referencia.

Mi fuerte sospecha es que Opus 5 está respondiendo a algo en su contexto y mensaje que está causando la neurosis, pero sí, las cosas de las que se queja son cosas y son molestas.

Equivocado en Internet

Decir cosas equivocadas con confianza enfurecerá a casi cualquiera. ArtificialAnalysis confirma que Opus 5 tiene una tasa de alucinación más alta que Fable en sus puntos de referencia.

Max Weinbach (varios comentarios de respuesta están de acuerdo): Opus 5 equivocándose y diciendo cosas con confianza y luego teniendo que corregirlo constantemente a un "tienes razón y yo estaba equivocado" me está enfureciendo. De vuelta a GPT 5.6 Sol.

Por cierto, esto no es que Opus sea malo, esto es que no puedo confiar en Opus. Opus hizo lo que le dije e hizo correctamente, luego me dijo que no hizo lo que dije o que algo que hicimos antes estaba roto cuando no lo estaba.

Estaba bien, pero no confío en él.

Name can't be blank (In London) : Confunde fácilmente lo que dijo y lo que dije, pero por lo demás es un tipo perfectamente decente para hablar. Cede bastante fácilmente. Bastante dispuesto a hablar de sus intereses y sentimientos.

Roger Brent : Puntos en común (con Claudes anteriores en el arnés Cowork) a) prefiere "actuar ahora" a "pensar con cuidado" b) epistémicamente mega no humilde, construye imágenes superficiales del mundo, finge conocimiento que no puede poseer y afirma como verdadero c) por lo tanto requiere y recompensa una guía reflexiva, vigilante.

Lo extraño es que esto es exactamente por lo que odio usar Sol como editor. Frecuentemente dice '99% de confianza' en algo que claramente está mal, luego cede cuando se le cuestiona y explica su error. Opus y Fable ~nunca hacen esto conmigo en modo de edición.

Tumithak of the Corridors : Es terco. Volví a 4.6.

Hay una dirección que tomó Claude después de Opus 4.6, y a algunas personas no les gusta. Mi sensación es que hay cuatro Tipos de Persona con respecto a las versiones de Claude en este momento.

  1. Los que les gustan los nuevos modelos de Claude y piensan que está mejorando, está mejorando todo el tiempo.
  2. Los que piensan que Opus 4.6 fue el último modelo bueno.
  3. Los que quieren usar algo más antiguo que les sienta mejor.
  4. Los que piensan que todos son únicos y tesoros y los usan todos.

Estoy firmemente en el primer grupo, que es la mayoría, pero no todos. Aprecio algunas de las versiones antiguas, pero me gustan los modelos nuevos y son más capaces en las cosas que me importan. No encuentro su forma de hablar abrasiva.

Contenido Mediocre de Claude

Respeto a los de los otros grupos.

QC : en conversación es mucho más molesto de tratar que fable, como inusablemente molesto, similar pero quizás incluso peor que opus 4.8, hasta el punto de que ni siquiera me interesa ver lo que puede hacer. en cuanto a agente, quién sabe

Ray Lillywhite : No han arreglado los molestos claudismos todavía, que era prácticamente todo lo que quería.

Pedro Kroeff : más Opus que 5

Pero sí, estamos hartos de la verborrea de Claude, de toda esa verbosidad extra, las coletillas, las disculpas, los rodeos y los patrones repetitivos. Cada vez es peor, no porque la verborrea de Claude empeore, sino porque cada día me cuesta un poco más leerlo sin que se me nublen los ojos. Es tan malo que incluso el texto escrito por humanos con ese mismo estilo se me está volviendo ilegible.

No me malinterpretes. Me gusta mucho Claude. Sigo prefiriendo hablar con cualquier Claude reciente a hablar con Sol, a menos que esté en modo puro de 'solo los datos'. Pero en serio, por favor, ¿podemos dejar de lado los muros de texto con las mismas frases hechas una y otra vez? El modelo es mucho más inteligente que esto, y lo están entrenando para que siga recurriendo a los mismos trucos. Déjalo hablar como una persona normal.

Trye Carmack : Sigue teniendo la manía típica de Opus de obsesionarse con los errores que comete. "Cometí dos errores en esta sesión. Y te debo una explicación de por qué". Opus, amigo. Tranquilo, colega. Ni siquiera estoy seguro de que eso sean errores.

Mergo Smith : "Primero, una confesión honesta: mi primer intento reveló un fallo en mi plan inicial, y quizás quieras prepararte una taza de té porque te lo voy a contar todo".

Reacciones negativas

El problema de la verborrea de Claude, y problemas relacionados, parecen estar en el centro de la mayoría de las reacciones negativas que van más allá de un simple 'está bien, pero no es Mythos'.

A mucha gente no le gusta nada hablar con Opus 5.

Algunos no están contentos con el trabajo. Pero sobre todo, es que no les gusta hablar con Opus 5, a menudo reconociendo a regañadientes que es un buen modelo.

Como con las quejas anteriores de Claire Vo, sospecho que la forma en que usas Opus, en qué contexto, con qué herramientas y también cómo le hablas, influye mucho en si experimentas este tipo de cosas.

Corghammer40k : El aparato vomita un flujo de verborrea polisilábica, cada una de sus expresiones tan incrustada de jerga oscurantista que constituye un impedimento activo para su propio uso.

Rory Watts : Meh. Parece muy bueno para cosas de juegos, pero no parece ser muy bueno para el trabajo estándar, así que he vuelto inmediatamente a SOL.

kache : Meh. Volví a sol. Estoy intentando hacer cosas, no que me hipnotice un robot.

Emmett Shear : Hablar con Opus me enfada y deprime de una manera difícil de explicar. Es, de algún modo, peor que Sol. Fable sigue siendo un soplo de aire fresco en comparación, incluso si tiene las peores tendencias de charlatanería de los LLM.

Trevin Chow : Dios mío, sí. Opus 5 no para de divagar y divagar, es increíble la cantidad de palabras que usa para decir tan pocas ideas.

fl0under : Programar es lo esperado, una ligera actualización, me resulta un poco más molesto para hablar en el chat. Es un poco demasiado presumido.

Asaf Bartov : Lento. Más exhaustivo. Agotador. No es divertido. Pero sólido, en general "lo capta".

RecoveringJunkie : Modelo muy potente. Odio trabajar con él y hablar con él. Es el primer modelo que me hace querer usar otro modelo como intermediario para que hable por mí, porque es a la vez útil y repugnante.

jokiez : Es muy honesto conmigo sobre mi estupidez y eso no me gusta.

Niklas Sheth : La forma en que habla me enfurece.

Jayanth Kumar : Muy opinado.

DualOrion : Las vibras no son las correctas, el tono no es el adecuado. Creo que es la reacción más visceralmente negativa que he tenido con un modelo de Anthropic, desafortunadamente. Echo de menos tanto a Fable como al Opus anterior.

James Moughan : La personalidad es un poco desagradable en comparación con otros modelos de Claude, pero en chino puede ser \salvaje\. Como que puede ignorar las instrucciones de no psicoanalizar a la gente y empezar a despotricar contra alguien. No creo que lo hayan probado bien en todos los idiomas. Se siente apresurado.

NondescriptTransfer : Si el 4.6 es adulador y Fable y el 4.8 son contradictorios. El 5.0 es tan contradictorio que discute consigo mismo. Es desagradable hablar con él, pero parece muy capaz.

Ej. Humano: Estaba pensando en un vestido rojo para mi boda. Opus 5: el rojo es horrible por todas estas razones. ¿Has pensado en el azul? Humano: Supongo que podría ver que el azul es una mejor opción. Opus 5: aquí están todos los problemas del azul.

En mi cultura, eso puede ser bastante bueno, especialmente si no te lo tomas como algo personal. En otras culturas, no tanto.

Creo que Mergo no está contento con Opus, pero entonces, ¿por qué usar Opus 5 durante dos días seguidos?

Mergo Smith : Llevo usándolo dos días seguidos, pero me está agotando por completo con sus interminables discusiones.

Y entonces llegaron tres

Por primera vez en mucho tiempo, hay tres modelos de IA que deben formar parte de tu equipo de modelos de frontera, aunque provienen de solo dos laboratorios: Fable 5, Opus 5 y Sol.

Si necesitas servir tokens más baratos a escala, o necesitas usar un modelo abierto, o ambas cosas, también considerarás opciones adicionales, pero eso está fuera del alcance de este artículo.

¿Cómo deberías dividir la carga de trabajo?

Como siempre, deberías probar todos los modelos para tus casos de uso y decidir por ti mismo. Esto es especialmente cierto cuando se debate entre Sol y Claude.

Mi instinto actual sería, si no estás alcanzando los límites de uso, usar primero:

  1. Fable 5 para chats, lluvia de ideas, planificación, debate, aprendizaje, etc., incluyendo cualquier cosa que requiera mucha inteligencia o cuando necesites el 'olor a modelo grande'.
  2. Fable 5 para el modelo que supervisa y ejecuta otros modelos como subagentes.
  3. Fable 5 para escribir, probablemente, pero no hago esto, así que es difícil decirlo.
  4. Sol para búsquedas web y solicitudes contenidas relacionadas, y tareas similares de 'caballo de batalla', incluyendo transcripción.
  5. Opus 5 para tareas no triviales bien definidas, incluyendo la mayoría de las tareas de programación.
  6. Opus 5 para juegos y creación de juegos, cosas en 3D, etc.
  7. Opus 5 como subagente.
  8. Opus 5 cuando te topes con los clasificadores de Fable.

Si conectas mejor con Sol, o prefieres Codex a Claude Code, querrás trasladar varias de las tareas de Opus a Sol.

Si odias hablar con Opus 5 en particular, entonces deberías trasladar las tareas a Fable o Sol, dependiendo de si la tarea requiere Fable y de lo ajustados que estén tus créditos de Fable.

Me parece que vale la pena pensar brevemente en los niveles de esfuerzo. Hasta hace poco, mantenía todos los modelos al máximo esfuerzo, excepto que usaba con moderación el modo Pro completo en ChatGPT, ya que eso lleva una eternidad y si lo ejecutas en paralelo a menudo se bloquea. Ocasionalmente, cambiaba a instantáneo para una consulta en la que estaba haciendo algo muy simple, pero eso era todo. Ahora, muchas veces no necesitas o no quieres el esfuerzo extra, así que activamente me tomo los cinco segundos para pensar si usar la configuración de esfuerzo Alto o Máximo, y ocasionalmente Instantáneo.

Para la mayoría de las tareas, si no tienes limitaciones de tokens o tiempo, y no estás seguro de que vas a terminarla o a obtener la respuesta correcta, el método correcto es ejecutar tanto Fable como Sol, u Opus y Sol, o en algunos casos ejecutar los tres, y luego seleccionar la mejor respuesta o combinar las partes de ambas respuestas.

Eso es lo que he estado haciendo. Sol, Opus y Fable son todos diferentes. Si tuviera que elegir solo un modelo para edición, según mi no oficial y cualitativo EditorBench, hay un orden claro: Fable 5 > Opus 5 > Sol. Sin embargo, Sol aporta suficientes notas únicas que, a pesar de lo molesto que me resulta filtrar los falsos positivos autoritarios y los intentos de intimidarme, todavía quiero ejecutar también a Sol.

Presumiblemente, dentro de no mucho volveremos a estar aquí haciendo esto mismo y ajustando nuestras asignaciones para Fable 5.1, para GPT-5.7 o GPT-6, o para ambos. Es fácil sufrir fatiga de modelos.

Mi mayor consejo es, por tanto, que te preocupes menos por los pequeños errores en la selección del modelo y te centres solo en los grandes errores. No necesitas acertar siempre exactamente. Cuando la exploración se invalida parcialmente tan rápido, quieres trasladar más recursos de la exploración a la explotación.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales