¡Grok 4.6 ya está disponible! Lo he usado durante unas semanas como mi herramienta principal del día a día en la mezcla habitual de programación y trabajo de conocimiento, y construí algunos proyectos con él específicamente para probar hasta dónde aguanta.
Es bueno en todo. Lo que más destaca es cómo se comunica y lo rápido que es, más que cualquier salto puntual en capacidad.
https://x.com/SpaceXAI/status/2087562800982077492
Comunicación densa en información
Es colaborativo de una forma que facilita trabajar a su lado. Los resúmenes están llenos de información real en lugar de repetirme la tarea, y las actualizaciones breves mientras trabaja me dicen lo suficiente para saber si debo interrumpir.
Se mantiene callado ante cambios pequeños y empieza a narrar cuando toca muchos archivos. Lograr ese equilibrio tomó más ajustes de lo que uno pensaría. Todavía me dice cosas que no necesito a veces, y en eso estamos trabajando.
Velocidad encantadora
4.5 también era rápido. 4.6 es rápido y notablemente más inteligente, y esa combinación me empujó hacia una forma de trabajar más sincrónica. En lugar de cargar mucho contexto por adelantado y esperar, pido algo pequeño, lo reviso y sigo adelante. La misma sesión puede pasar a una tarea de mayor alcance con solo pedirlo.
Me muevo entre lo sincrónico y lo asincrónico según lo que los mejores modelos resulten hacer bien ese mes. Lo asincrónico logra más mientras estoy en otra cosa, pero pierdo el hilo y termino revisando un diff enorme en frío. 4.6 me atrae de vuelta a lo sincrónico, que es donde prefiero estar cuando me importa el resultado.
, y armé un video de lanzamiento para ambos con Remotion! La mayor parte de esas semanas fue trabajo ordinario. Navegó sitios web por mí, incluida la creación de claves de API haciendo clic en la consola de un proveedor. Hizo QA funcional y visual en aplicaciones en ejecución. Redujo mi bandeja de entrada a los pocos hilos que realmente necesitaban respuesta, algo que nunca deja de sentirse bien. Me ayudó a redactar las publicaciones de lanzamiento para Cursor SDK Bridge y /rename-chat
Instrucciones cortas, verificación estricta
Pasé parte de esas semanas probando estilos de instrucciones unos contra otros. Largas versus cortas, y si frases específicas como "trabaja muy duro" cambian el resultado. Lo que encontré es que la redacción casi no hizo ninguna diferencia.
La extensión sí importó, aunque no como suponía. Una instrucción larga compra especificidad, así que si sabes exactamente lo que quieres, escríbelo. Una instrucción corta le entrega más decisiones al gusto del modelo. Ese equilibrio antes abogaba por escribirlo todo. Con 4.6, el gusto es lo bastante bueno como para que una instrucción corta más una preferencia clara normalmente aterrice en un buen lugar.
con captura de sesión, un manejador de servidor y despacho de agentes en la nube, y siguió todo el proceso de principio a fin con una estructura sensata. Se repite en los componentes a menos que le pidas que los separe. Las especificaciones largas siguen funcionando bien cuando tienes una. Le di una especificación detallada para un widget de feedback
Uno de los proyectos que construí fue una aplicación de hojas de cálculo, y se la di a ambos modelos dos veces. En una de las ejecuciones recibió una especificación de dos páginas que cubría cada elemento de la barra de herramientas, atajo de teclado y fórmula que pude imaginar. En la otra, tres oraciones.
1Construye una aplicación pulida estilo Sheets/Excel en Next.js y un chat de IA que pueda analizar la hoja. Usa el Cursor SDK para todas las funciones de IA. Precarga un libro de trabajo de muestra realista para que se vea bien de inmediato.
Las dos aplicaciones resultaron casi idénticas. Lo que realmente cambió el resultado fue agregar una oración:
1Verifica la función y el diseño después de la implementación, y sigue iterando y verificando hasta que esté listo para producción.
¡Esa sola línea fue lo de mayor impacto que encontré en esas semanas! Con ella, el modelo abre la app, hace clic a través de rutas reales de usuario, verifica que las fórmulas anidadas se evalúen correctamente y corrige lo que encuentra. Nada de eso funciona sin un uso sólido del navegador, que es lo que hace posible el ciclo en primer lugar.
El mismo principio aplica cuando el resultado es más difícil de inspeccionar. "Mejora las texturas" en una escena 3D no me llevó a nada, mientras que "captura el fotograma actual, enumera qué está mal y corrige solo esas cosas" funcionó de inmediato.
Cada comparación de aquí en adelante ejecutó la misma instrucción en ambos modelos en espacios de trabajo aislados, así que nada de esto es mi memoria del mes pasado.

Tampoco necesitas decirle que trabaje duro o que siga empujando hasta terminar. Va a seguir solo durante bastante tiempo. Lo que importa mucho más es decir qué significa "terminado", porque si no, lo decide por ti.
Un paso más allá
De niño jugué una cantidad irracional de Age of Empires 2. Miles de horas. Así que recrearlo fue el primer proyecto que quise probar. Pedí un juego de estrategia en el navegador con economía, construcción, combate, niebla de guerra, objetivos y un HUD que un jugador nuevo pudiera entender sin instrucciones.

4.5 construyó un prototipo plano funcional. 4.6 respondió con un mundo 3D isométrico al primer intento, con HUD y minimapa ya incluidos. ¡Mucho más cerca del original!
Siguiendo con el viaje nostálgico, luego hice MSN Messenger.

Ambos modelos claramente conocían la referencia e hicieron un buen trabajo. 4.6 simplemente tiene más pulido, hasta en las ventanas de conversación separadas y los guiños.
Uso Excalidraw constantemente y es de código abierto, lo que lo hizo el lugar obvio para ver cómo los modelos manejan una base de código real en lugar de una carpeta vacía. Les pedí a ambos un modo de presentación: guardar vistas con nombre, reordenarlas y presentarlas como un recorrido guiado. La instrucción fue deliberadamente vaga sobre cómo construirlo.

Ambos llegan más o menos al mismo lugar, ¡lo cual es impresionante para una instrucción tan vaga! 4.6 simplemente presta más atención al detalle en la primera pasada, lo que en la práctica significa menos rondas de mí señalando cosas.
Esto también es donde saltarse la verificación pasa factura. En una ejecución anterior, el resumen parecía terminado y agregar una vista no funcionó en realidad. Una ronda de "ejecútalo y muéstramelo" sacó a la luz la importación rota.
Trabajo cotidiano
No armo presentaciones e informes todos los días, pero mucha gente sí, y quería ver cómo manejaba ese tipo de trabajo. Así que les di a ambos modelos el mismo informe trimestral ficticio y les pedí una presentación para el directorio.

Ambos son competentes, y la diferencia está en la presentación más que en el análisis. 4.5 principalmente pone los números en diapositivas, mientras que 4.6 dedica trabajo real a la estructura y la jerarquía, así que se lee como una presentación que alguien hizo de verdad en lugar de un volcado de datos.
El video como código
es video como código: cada fotograma es un componente de React que se renderiza según el número de fotograma actual, y todo se compila a un MP4 mediante Chromium headless y FFmpeg. Tu video vive en git. ¡Es una forma genuinamente divertida de trabajar! También es algo extraño de entregarle a un modelo, porque no puedes saber si tuvo éxito verificando que se ejecute. Este merece más espacio, porque he estado dedicándole mucho tiempo últimamente. Remotion
para que trabajara desde ahí. Le pedí un video de lanzamiento de 60 a 90 segundos para el SDK de TypeScript de X y le di la documentación

Juzgo estos según si hay una trama y si el ritmo se mantiene. La mayoría de los modelos fallan de la misma manera aquí, con títulos en mayúsculas, texto en recuadros y todo apareciendo en pantalla a la vez. Ambos videos evitan la mayor parte de eso, y 4.6 es el más cautivador de ver.
Después de unos días probando esto en diferentes modelos, el video es donde veo la mayor brecha. Dos modelos que se sienten igualmente capaces en una aplicación web pueden no estar ni cerca el uno del otro aquí.
Dónde necesita guía
Casi todo lo que tuve que guiar se redujo a una cosa: qué tan fácilmente puede el modelo verificar su propio trabajo.
Un sitio web es el caso fácil. El DOM es texto, así que puede leer la página, tomar una captura de pantalla y comparar contra lo que pretendía. Por eso el ciclo de verificación funciona tan bien en el trabajo de interfaz.
El 3D es más difícil, porque hay toda una dimensión que no puedes inspeccionar leyendo. El video es aún más difícil, ya que el tiempo es la dimensión extra y verificar tu trabajo significa capturar una secuencia de fotogramas y razonar sobre la diferencia entre ellos. La física tiene el mismo tipo de problema. El modelo tiene un buen sentido de cómo debería comportarse el mundo, pero confirmar que sí se comportó así no es algo que una captura de pantalla pueda responder.
La respuesta práctica es darle una forma de mirar, o aceptar que eres tú quien revisa.
Por qué es mi opción predeterminada
Hay un valor real en los modelos con picos de capacidad, esos que son extraordinarios en una cosa en particular. Pero la mayor parte de mi trabajo no es una sola cosa. Lo que quiero en el día a día es un modelo que conozco bien: uno sobre el que he desarrollado intuición de cómo se comporta, que es lo bastante confiable como para entregarle algo, y cuyas limitaciones entiendo lo bastante bien como para sortearlas sin pensar.
Eso es exactamente en lo que 4.6 se ha convertido para mí. En el lado del código maneja trabajo interactivo y visual donde voy reaccionando sobre la marcha, además de sesiones largas en un repositorio real. En el lado del trabajo de conocimiento están la bandeja de entrada, el QA en el navegador y las tareas de hacer clic sin una API detrás. No es el mejor modelo imaginable en ninguna de esas cosas, pero es bueno en todas y sé qué esperar.
Todavía me mantengo involucrado donde el resultado se juzga por cómo se ve. El movimiento, el 3D y el pulido final quieren una referencia y un ciclo de capturas de pantalla en lugar de una descripción. Y escribo los criterios de aceptación en lugar de confiar en un resumen que dice que está terminado.
Pruébalo
¡Grok 4.6 ya está disponible en Cursor, API de SpaceXAI en OpenRouter y en cualquier otro lugar donde consigas tus tokens!
Pruébalo y cuéntame qué te parece. Vamos a seguir mejorándolo, así que deja tu opinión, sea buena o mala, porque es lo que nos dice hacia dónde empujar a continuación.
¡Me da curiosidad saber qué terminas construyendo con él!





