¿Qué modelos valen la pena? Pusimos a prueba 14 modelos en tareas de conocimiento reales para descubrirlo.

@andrewbusse
INGLÉShace 1 día · 23 jul 2026
166K
11
3
1
8

TL;DR

Este análisis de 14 modelos de IA revela que los líderes en benchmarks a menudo fallan en el trabajo de conocimiento real. Proporciona un marco para elegir modelos basados en el criterio y la frecuencia, categorizándolos en velocistas, pesos medios y pesos pesados.

El mejor modelo para un trabajo casi nunca es el mejor modelo en el ranking.

En el mundo de la IA, la Navidad llega aproximadamente una vez por semana. Aparece un nuevo modelo, todos miran los mismos gráficos de benchmarks con falsa precisión, y todos coincidimos en que es lo mejor desde el pan de molde, hasta la semana siguiente, cuando repetimos el proceso.

Pero ninguno de esos gráficos responde la única pregunta que importa. ¿Puede el modelo ejecutar realmente tu informe diario o enviar un presupuesto a un cliente? En Hyperagent, te damos acceso a todos estos modelos sobre un agente de primer nivel. Así que los probamos nosotros mismos. Catorce modelos, cuarenta y dos ejecuciones, en el trabajo de conocimiento real que nuestros clientes entregan a los agentes cada día. Tres cosas destacaron.

  • La factura varió 50 veces para el mismo trabajo. La misma batería de pruebas costó $1.48 en Qwen 3.7 Plus y $75.16 en Fable 5.
  • El ganador del benchmark no fue el ganador en el trabajo. GPT 5.6 Sol encabezó nuestras pruebas de referencia, pero no entró en el top tres una vez que ejecutó trabajos reales dentro de Hyperagent. Grok 4.5 estuvo en la mitad de la tabla en la línea base y quedó primero en trabajo terminado, velocidad y costo.
  • Y ningún modelo lo ganó todo. La elección correcta variaba según el trabajo.

La conclusión no es un nuevo modelo favorito. Es una forma de decidir, trabajo por trabajo, cuál merece su costo.

El mapa de modelos de IA para el trabajo de conocimiento

Cada trabajo que le darías a un agente se reduce a dos preguntas: ¿cuánto juicio necesita y con qué frecuencia se ejecuta? Traza esos dos ejes y el trabajo de conocimiento cae en cuatro territorios, cada uno de los cuales quiere un tipo diferente de modelo.

Andrew Busse - inline image

Trabajo de volumen (arriba a la izquierda). Triaje, monitoreo, enrutamiento, sincronización de datos. Procedimiento claro, se ejecuta constantemente y un error es barato de arreglar. Este trabajo quiere algo rápido y económico.

El oficio diario (arriba a la derecha). Redacción, informes, investigación, comunicaciones con clientes. El trabajo de conocimiento recurrente que ocupa la mayor parte de la semana: necesita síntesis real y una buena voz de escritura, realizado de manera confiable y frecuente.

Alto riesgo (abajo a la derecha). Revisión de contratos, decisiones de precios, análisis profundos. Raro, pero una respuesta incorrecta cuesta un cliente, un contrato o el margen de un trimestre. Aquí es donde el lado negativo eclipsa la factura del modelo, y donde los modelos más caros ganan su tarifa.

No optimices (abajo a la izquierda). La solicitud ocasional y simple donde cualquier modelo capaz supera el listón y la diferencia de precio es demasiado pequeña para merecer una decisión. Es el único cuadrado del mapa en el que le decimos a la gente que no piense.

Las tres clases de modelos

Del mapa surgen tres clases de trabajo. Describen la economía y el perfil de juicio del trabajo, no califican a un modelo como bueno o malo.

Sprinter están diseñados para trabajo de volumen: rápidos, baratos y consistentes cuando el procedimiento es claro y un error es fácil de arreglar. Haiku 4.5, Gemini 3.5 Flash y DeepSeek V4 Pro.

Peso medio ejecutan el oficio diario. Sintetizan fuentes, mantienen un plan de múltiples pasos y escriben bien sin cobrar tarifas de primer nivel por cada informe. Sonnet 5, GPT 5.6 Terra, Grok 4.5 y GLM 5.2: donde pertenece la mayor parte del trabajo de conocimiento.

Pesos pesados toman las decisiones de alto riesgo, aportando un juicio más sólido y más tiempo de razonamiento a trabajos donde una respuesta incorrecta cuesta mucho más que la factura del modelo. Opus 4.8, GPT 5.6 Sol y Fable 5.

El instinto que la mayoría tiene es empezar desde arriba e ir bajando: ejecutar todo en un Fable 5 o un Opus 4.8, obtener el resultado deseado, luego probar modelos más baratos hasta que la calidad baje. Funciona, pero hemos descubierto que la mayoría de los trabajos no lo necesitan. Una vez que puedes nombrar el trabajo y ubicarlo en el mapa, normalmente puedes empezar en la clase correcta desde el principio. Para el oficio diario, que es la mayor parte de lo que haces, eso significa comenzar con un peso medio sólido como Sonnet 5. Solo recurres a la búsqueda de arriba abajo cuando un trabajo está genuinamente en el extremo de alto riesgo.

El campo es más amplio que Claude, GPT y Gemini

La mayoría de los equipos optan por el puñado de nombres de modelos que ya conocen. Es un punto de partida razonable, pero deja gran parte del plantel sin tocar, y algunos de los modelos que realizan el trabajo más útil en Hyperagent no son nombres conocidos. Estas son nuestras impresiones operativas de la batería y del uso diario, además del trabajo que hemos visto ejecutar a los clientes.

Grok 4.5 es investigación rápida y en tiempo real. Se mueve rápidamente a través de investigaciones con muchas herramientas y se desempeñó especialmente bien combinado con la búsqueda nativa Exa Search de Hyperagent. También tiene una línea nativa con X, por lo que una pregunta sobre el sentimiento en vivo puede devolver las publicaciones reales detrás de la respuesta. Lideró nuestra puntuación de trabajo terminado a $9.71 por la ejecución completa.

Muse Spark 1.1 escribe limpio y se verifica a sí mismo. Terminó segundo en el arnés, y nuestra impresión temprana es una prosa concisa y bien estructurada con un hábito útil de auditar su propio trabajo antes de devolverlo. Todavía es nuevo, así que comenzaríamos con trabajos supervisados del día a día antes de los largos no supervisados.

Kimi K2.6 es investigación profunda a un precio de modelo abierto. Ejecuta búsquedas en paralelo y reúne la evidencia en una sola respuesta sin cobrar tarifas de buque insignia, lo que lo convierte en un especialista en investigación sólido. Su único límite real es el tamaño del documento, con una ventana de contexto que alcanza un máximo de 256,000 tokens.

GLM 5.2 es la opción de valor. Se acercó sorprendentemente a los pesos medios cerrados en investigación rutinaria, redacción y trabajo con documentos largos a aproximadamente un tercio del precio, y su prosa está entre las más sólidas fuera de Sonnet y Opus. Se ha convertido en un motor diario para gran parte del equipo de Hyperagent.

Qwen 3.7 Plus es el trabajador de pantalla. Es particularmente bueno para encontrar botones, campos y menús en páginas renderizadas, y es económico para la extracción estructurada: produjo la ejecución completa de menor costo en nuestra batería. Recurre a él cuando el trabajo consiste en manejar una interfaz o mover datos, no cuando la voz importa.

DeepSeek V4 Pro es análisis estructurado a muy bajo costo. Es más fuerte en conciliación, limpieza de datos, trabajo numérico programado y tareas estructuradas similares. Su escritura es literal y concisa, lo que sirve bien para explicaciones internas y mal para la prosa orientada al cliente. Un especialista, y muy económico.

Dotar a tus agentes siempre activos al precio adecuado

Steve Juba dirige una agencia de viajes de seis personas. Creó un agente de informes conectado a ocho fuentes de datos en vivo que se ejecuta varias veces al día, y redujo su recopilación matutina de contexto de más de tres horas en ocho pestañas a quince minutos.

Un agente como este lee mucho más de lo que escribe y hace el mismo trabajo cientos de veces al año, por lo que una pequeña diferencia de precio por ejecución deja de ser un error de redondeo y se convierte en una partida presupuestaria real. Considera un informe que lee 100,000 tokens y escribe 2,000 cada día. A los precios de lista de julio de 2026, esa forma de trabajo cuesta aproximadamente:

  • $16 al año en Qwen 3.7 Plus (sprinter)
  • $38 al año en Kimi K2.6 (peso medio)
  • $40 al año en Haiku 4.5 (sprinter)
  • $80 al año en Sonnet 5 (peso medio)
Andrew Busse - inline image

Las opciones de peso abierto cambian las matemáticas en trabajos con mucha lectura como este. Kimi K2.6 hace investigación y síntesis de calidad de peso medio por $38 en este trabajo, menos de la mitad de Sonnet 5 y aproximadamente lo mismo que ejecutar el sprinter Haiku. No estás intercambiando juicio por costo; estás obteniendo trabajo de peso medio por dinero de sprinter. Si el trabajo fuera pura extracción sin juicio, Qwen lo ejecutaría por $16, pero en el momento en que necesita síntesis real, Kimi te da eso por un precio cercano.

Cambia el modelo, mantén el agente

Nada de esto importa si cambiar de modelo significa reconstruir el agente. Dentro de Hyperagent no es así, porque el modelo es solo un ajuste y el rol está por encima de él. Cambia el modelo y el agente conserva todo lo que lo hace útil:

  • Sus instrucciones y alcance
  • Sus habilidades, scripts y procedimientos de trabajo
  • Su memoria de correcciones
  • Sus archivos de referencia y contexto de la empresa
  • Sus conexiones con los sistemas donde vive el trabajo
  • Sus rúbricas para evaluar la calidad
Andrew Busse - inline image

Eso convierte la elección del modelo en una prueba, no en una migración. El mismo agente puede ejecutar el mismo trabajo en dos modelos sin ser reconstruido, por lo que puedes encontrar el más barato que supere tu listón en lugar de adivinar.

También permite que la parte costosa de un flujo de trabajo difícil se pague por sí misma una vez. Cuando un trabajo realmente lo necesita, usa un modelo más pesado para diseñar y depurar el flujo de trabajo, luego codifica el procedimiento como una habilidad para que un peso medio o un sprinter pueda ejecutarlo todos los días a una fracción del costo.

Sin embargo, hay un costo oculto a tener en cuenta. Un modelo más barato con una factura baja no es barato si cada salida necesita corrección: el tiempo de revisión humana y el costo de un error son parte del precio real. Llámalo el impuesto de revisión. Establece el piso de cuán ligero puedes ir. Lo que es diferente en Hyperagent es que la revisión no solo se paga, sino que se acumula: a medida que el agente aprende de tus correcciones a través de la memoria, ese esfuerzo de revisión es capturado por el arnés y produce un mejor agente en la siguiente ejecución.

Los clientes ya dotan a los agentes de esta manera. Ankit Das construyó una operación de marketing con un Growth Orchestrator en Sonnet 5 tomando las decisiones de juicio y ocho especialistas de canal en GLM 5.2 produciendo el trabajo recurrente del canal, con agentes de control de calidad separados verificando el cumplimiento de la marca y la calidad de la escritura, todo iniciado desde un solo hilo. Eli Weiss describe su división de manera más simple: aproximadamente 85% Sonnet y 15% Opus en sus habilidades y rutinas. La mayoría del trabajo se ejecuta en el motor diario; Opus obtiene el conjunto más pequeño de trabajos donde el juicio adicional merece su costo.

Ese es el valor práctico de la elección de modelo dentro de Hyperagent. Gasta deliberadamente en el trabajo y reserva los dólares adicionales para los trabajos donde el juicio adicional cambia el resultado.

Elige el modelo después de elegir el trabajo

Usa esta secuencia en un agente que ya ejecutas:

  1. Nombra el trabajo. "Preparar el informe del cliente del lunes" es más útil que "ayudar con los informes".
  2. Ubícalo en el mapa. Decide cuánto juicio necesita y con qué frecuencia se ejecutará.
  3. Empieza donde el mapa lo coloca. Para la mayoría del trabajo, eso es un peso medio capaz: úsalo hasta que entiendas los casos límite del trabajo y codifiques el proceso en habilidades.
  4. Prueba una clase más ligera durante cinco ejecuciones reales. Mantén las instrucciones, habilidades, memoria, fuentes y rúbrica sin cambios.
  5. Compara el costo total. Realiza un seguimiento de la calidad final, la consistencia, el tiempo, los errores fácticos, la factura del modelo y el tiempo de revisión humana.
  6. Escala a propósito. Recurre a un peso pesado cuando la carga de revisión o el costo de una respuesta incorrecta superen la prima del modelo.
  7. Usa un modelo diferente para revisar trabajos importantes. El modelo que cometió el error suele ser el menos propenso a verlo.

Mantén el modelo menos costoso que supere de manera confiable tu estándar. Luego gasta la diferencia en las decisiones que lo merecen.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales