¡Grok 4.6 ya está aquí! Lo he usado durante unas semanas como mi herramienta de uso diario para la mezcla habitual de programación y trabajo de conocimiento, y he construido algunos proyectos con él específicamente para ver hasta dónde aguanta.
Es bueno en todo. Lo que más destaca es cómo se comunica y lo rápido que es, más que cualquier salto puntual de capacidad.
https://x.com/SpaceXAI/status/2087562800982077492
Comunicación densa en información
Es colaborativo de una manera que da gusto trabajar con él. Los resúmenes están llenos de información real en lugar de repetirme la tarea, y las actualizaciones breves mientras trabaja me dicen lo suficiente para saber si debo interrumpir.
Se mantiene en silencio durante cambios pequeños y empieza a narrar en cuanto toca muchos archivos. Conseguir ese equilibrio requirió más ajustes de los que imaginas. Todavía me dice cosas que no necesito a veces, algo en lo que estamos trabajando.
Velocidad encantadora
4.5 también era rápido. 4.6 es rápido y notablemente más inteligente, y esa combinación me empujó hacia una forma de trabajar más sincrónica. En lugar de cargar mucho contexto de antemano y esperar, pido algo pequeño, lo reviso y sigo adelante. La misma sesión puede pasar a una tarea de mayor alcance con solo pedirlo.
Me muevo entre el modo sincrónico y el asincrónico según en qué sean buenos los mejores modelos ese mes. El modo asíncrono logra más mientras estoy en otro sitio, pero pierdo el hilo y termino revisando un diff enorme en frío. 4.6 me devuelve al modo sincrónico, que es donde prefiero estar cuando me importa el resultado.
La mayor parte de esas semanas fue trabajo ordinario. Navegó sitios web por mí, incluida la creación de claves de API haciendo clic en la consola de un proveedor. Hizo QA funcional y visual de aplicaciones en ejecución. Redujo mi bandeja de entrada a los pocos hilos que realmente necesitaban respuesta, algo que nunca deja de sentirse bien. Me ayudó a redactar los posts de lanzamiento de Cursor SDK Bridge y de /rename-chat, ¡y hasta armó un video de lanzamiento para ambos con Remotion!
Prompts cortos, verificación estricta
Pasé parte de esas semanas comparando estilos de prompts entre sí. Largos versus cortos, y si frases específicas como "trabaja muy duro" cambian el resultado. Lo que encontré es que la redacción apenas marcó diferencia alguna.
La longitud sí importaba, aunque no como suponía. Un prompt largo compra especificidad, así que si sabes exactamente lo que quieres, escríbelo. Un prompt corto le deja más de la decisión al criterio del modelo. Esa disyuntiva solía favorecer escribirlo todo. Con 4.6, el criterio es lo bastante bueno como para que un prompt corto más una preferencia clara normalmente aterrice en algo bueno.
Las especificaciones largas siguen funcionando bien cuando tienes una. Le di una especificación detallada para un widget de feedback con captura de sesión, un handler de servidor y despacho de agentes en la nube, y siguió todo el proceso de principio a fin con una estructura sensata. Eso sí, se repite en los componentes a menos que le pidas que los separe.
Uno de los proyectos que construí fue una app de hojas de cálculo, y se la di a ambos modelos dos veces. Una ejecución recibió una especificación de dos páginas que cubría cada elemento de la barra de herramientas, atajo de teclado y fórmula que se me ocurriera. La otra recibió tres frases.
1Crea una app pulida al estilo de Sheets/Excel en Next.js y un chat de IA que pueda analizar la hoja. Usa el SDK de Cursor para todas las funciones de IA. Precarga un libro de muestra realista para que se vea bien de inmediato.
Las dos apps resultaron casi idénticas. Lo que realmente cambió el resultado fue añadir una frase:
1Verifica el funcionamiento y el diseño después de la implementación, y sigue iterando y verificando hasta que esté listo para producción.
¡Esa sola línea fue lo de mayor impacto que encontré en esas semanas! Con ella, el modelo abre la app, recorre rutas de usuario reales, comprueba que las fórmulas anidadas evalúan correctamente y corrige lo que encuentra. Nada de eso funciona sin un uso sólido del navegador, que es lo que hace posible el bucle en primer lugar.
El mismo principio aplica cuando el resultado es más difícil de inspeccionar. "Mejora las texturas" en una escena 3D no me llevó a ninguna parte, mientras que "captura el frame actual, enumera qué está mal y luego arregla solo esas cosas" funcionó de inmediato.
Todas las comparaciones de aquí en adelante usaron el mismo prompt con ambos modelos en espacios de trabajo aislados, así que nada de esto es un recuerdo del mes pasado.

Tampoco necesitas decirle que se esfuerce o que siga hasta terminar. Va a seguir por su cuenta durante un buen rato. Lo que importa mucho más es definir qué significa "terminado", porque si no, él lo decide por ti.
Yendo más allá
Jugué una cantidad irracional de Age of Empires 2 de niño. Miles de horas. Así que recrearlo fue el primer proyecto que quise probar. Le pedí un juego de estrategia para navegador con economía, construcción, combate, niebla de guerra, objetivos y un HUD que un jugador nuevo pudiera leer sin instrucciones.

4.5 construyó un prototipo plano que funcionaba. 4.6 volvió con un mundo 3D isométrico al primer intento, con el HUD y el minimapa ya en su lugar. ¡Mucho más cerca del juego real!
Siguiendo con la nostalgia, después hice MSN Messenger.

Ambos modelos claramente conocían la referencia e hicieron un buen trabajo. 4.6 simplemente tiene más pulido, hasta en las ventanas de conversación separadas y los guiños.
Uso Excalidraw constantemente y es de código abierto, lo que lo convertía en el lugar obvio para ver cómo manejan los modelos una base de código real en lugar de una carpeta vacía. Les pedí a ambos un modo de presentación: guardar vistas con nombre, reordenarlas y presentarlas como un recorrido guiado. El prompt era deliberadamente vago sobre cómo construirlo.

Ambos llegan más o menos al mismo sitio, ¡algo impresionante para un prompt tan vago! 4.6 simplemente presta más atención al detalle desde el primer intento, lo que en la práctica significa menos rondas de yo señalando cosas.
Aquí también es donde saltarse la verificación pasa factura. En una ejecución anterior, el resumen parecía terminado y añadir una vista no funcionaba en realidad. Una ronda de "ejecútalo y muéstramelo" sacó a la luz el import roto.
Trabajo cotidiano
No preparo decks e informes todos los días, pero mucha gente lo hace, y quería ver cómo manejaba ese tipo de trabajo. Así que les di a ambos modelos el mismo informe trimestral ficticio y les pedí un deck para la junta directiva.

Ambos son competentes, y la diferencia está en la presentación, no en el análisis. 4.5 se limita a poner los números en las diapositivas, mientras que 4.6 dedica un trabajo real a la estructura y la jerarquía, de modo que se lee como un deck hecho por alguien en lugar de un volcado de datos.
Video como código
Remotion es video como código: cada frame es un componente de React que se renderiza a partir del número de frame actual, y todo se compila a un MP4 mediante Chromium headless y FFmpeg. Tu video vive en git. ¡Es una forma genuinamente divertida de trabajar! También es algo extraño de entregar a un modelo, porque no puedes saber si lo logró comprobando que se ejecute. Este merece más espacio, porque últimamente le he estado dedicando mucho tiempo.
Le pedí un video de lanzamiento de 60 a 90 segundos para el SDK de TypeScript de X y le di la documentación como base.

Los juzgo según si hay una historia y si el ritmo se mantiene. La mayoría de los modelos fallan de la misma manera aquí, con títulos en mayúsculas, texto en recuadros y todo apareciendo en pantalla a la vez. Ambos videos evitan la mayor parte de eso, y 4.6 es el más atractivo de ver.
Después de probar esto durante varios días con distintos modelos, el video es donde veo la brecha más amplia. Dos modelos que se sienten igual de capaces en una app web pueden estar a años luz el uno del otro aquí.
Dónde hay que guiarlo
Casi todo lo que tuve que corregir se reducía a una cosa: lo fácil que le resulta al modelo verificar su propio trabajo.
Un sitio web es el caso fácil. El DOM es texto, así que puede leer la página, tomar una captura de pantalla y comparar con lo que pretendía. Por eso el bucle de verificación funciona tan bien en el trabajo de interfaz.
El 3D es más difícil, porque hay toda una dimensión que no puedes inspeccionar leyendo. El video es aún más difícil, ya que el tiempo es la dimensión extra y revisar tu trabajo significa capturar una secuencia de frames y razonar sobre la diferencia entre ellos. La física tiene el mismo tipo de problema. El modelo tiene un buen sentido de cómo debería comportarse el mundo, pero confirmar que efectivamente se comportó así no es algo que una sola captura pueda responder.
La respuesta práctica es darle una forma de mirar, o aceptar que eres tú quien revisa.
Por qué es mi opción por defecto
Hay un valor real en los modelos con picos de habilidad, esos que son extraordinarios en una cosa concreta. Pero la mayor parte de mi trabajo no es una sola cosa. Lo que quiero en el día a día es un modelo que conozco bien: uno con el que he desarrollado una intuición de cómo se comporta, que es lo bastante confiable para delegarle cosas y cuyas limitaciones entiendo lo bastante bien como para sortearlas sin pensarlo.
Eso es exactamente en lo que se ha convertido 4.6 para mí. En el lado de la programación, maneja trabajo interactivo y visual donde voy reaccionando sobre la marcha, además de sesiones largas en un repositorio real. En el lado del trabajo de conocimiento, está la bandeja de entrada, el QA en el navegador y las tareas de hacer clic sin ninguna API detrás. No es el mejor modelo imaginable en ninguna de esas cosas, pero es bueno en todas y sé qué esperar.
Todavía me mantengo involucrado cuando el resultado se juzga por cómo se ve. El movimiento, el 3D y el pulido final quieren una referencia y un bucle de capturas de pantalla en lugar de una descripción. Y anoto los criterios de aceptación en lugar de confiar en un resumen que dice que está listo.
Pruébalo
¡Grok 4.6 ya está disponible en Cursor, en SpaceXAI API, en OpenRouter y en cualquier otro lugar donde consigas tus tokens!
Pruébalo y cuéntame qué te parece. Vamos a seguir mejorándolo, así que deja tu opinión, sea buena o mala, porque es lo que nos dice hacia dónde empujar a continuación.
¡Tengo curiosidad por saber qué terminas construyendo con él!





