El modelo abierto más grande del mundo acaba de ser lanzado. Programa al nivel de Fable 5, cuesta 5 veces menos y consume una fracción de los tokens al hacerlo. Aquí están las siete cosas que destacan.
El 16 de julio, un modelo abierto chino se convirtió silenciosamente en el modelo de programación más capaz que puedes ejecutar sin pagar precios de frontera.
Moonshot AI lanzó Kimi K3 con 2.8 billones de parámetros, el modelo de pesos abiertos más grande del mundo. Bloomberg, Forbes y Fortune lo cubrieron en 48 horas, y la razón es simple: en los benchmarks de programación, intercambia golpes con Claude Fable 5 y GPT-5.5, y lo hace aproximadamente a una quinta parte del costo.

Para entender por qué esto importa, recuerda lo que los últimos dos años nos enseñaron a creer. Capacidad de frontera significaba precio de frontera. Si querías el mejor código, pagabas la tarifa más alta de su clase, medida por token, en un punto final que no controlabas. Ese era simplemente el trato. Cada equipo serio presupuestaba en torno a eso.
K3 rompe esa suposición con un solo lanzamiento. La combinación que ofrece—resultados de nivel fronterizo a precios de commodity, con los pesos publicados para que cualquiera los descargue—es a lo que reaccionó la prensa de negocios. A continuación, las siete características que hacen que el resto del campo se sienta una generación atrás. La primera es la razón por la que tu factura de API está a punto de bajar.

A continuación, las siete características que hacen que el resto del campo se sienta una generación atrás. La primera es la razón por la que tu factura de API está a punto de bajar.
1. El titular
Programación backend de nivel Fable a 5 veces menos costo
Esta es la característica que reencuadra todo lo demás. En pruebas independientes, Kimi K3 se sitúa a la par de Claude Fable 5 en tareas reales de programación backend: diseño de API, esquemas de bases de datos, lógica de servicios, refactorizaciones en una base de código grande. No fragmentos de juguete. El tipo de trabajo que solía justificar una suscripción de frontera.
El backend es donde la diferencia se muestra más claramente, porque el código backend castiga los atajos. Un componente de frontend que se ve bien, generalmente está bien. Un manejador de pagos que se ve bien aún puede corromper el estado bajo carga, filtrar una condición de carrera o eliminar silenciosamente un caso límite. Calificar un modelo en trabajo backend significa calificarlo en corrección bajo presión, y es exactamente aquí donde los modelos más débiles salen de la banda de frontera. K3 se mantiene en ella.
La diferencia es la factura. K3 produce ese mismo nivel de código a aproximadamente una quinta parte del precio, y debido a que es más eficiente en tokens, la brecha en el mundo real en un proyecto completo suele ser más amplia de lo que sugiere el precio nominal por sí solo.

Mira dónde aterrizan las barras. K3 está dentro de la banda de frontera, no persiguiéndola. Y ahora mantén esa calidad constante y mira lo que cuesta llegar allí:

No estás intercambiando calidad por precio. Estás manteniendo la salida backend de nivel Fable y eliminando el 80% de la factura.
Multiplica eso a lo largo de un mes real de ingeniería y el número deja de ser abstracto. Un equipo que ejecuta miles de tareas de programación agéntica a la semana no está eligiendo entre $1.00 y $0.20 una vez. Lo está eligiendo decenas de miles de veces, y la brecha se acumula en una partida que el liderazgo realmente nota.

2. El multiplicador
Dice más con menos tokens
El precio por token es solo la mitad de la economía. La otra mitad es cuántos tokens gasta un modelo para llegar a la misma respuesta. K3 es inusualmente ajustado aquí. Razona hacia una solución funcional con menos idas y vueltas, menos suposiciones reafirmadas y menos relleno alrededor del código real.
Hay una razón sutil por la que esto importa más para los agentes que para el chat. En una conversación única, un modelo hablador solo se siente lento. En un bucle agéntico, cada token desperdiciado se gasta de nuevo en el siguiente paso, y en el siguiente, porque el contexto se arrastra. Un modelo que es un 60% más ligero por paso no es un 60% más barato en una ejecución. Se está volviendo compuestamente más ligero, porque también deja un rastro más pequeño para que cada paso subsiguiente lo relea.
En un solo prompt, eso parece un error de redondeo. En una ejecución agéntica real de miles de pasos, se acumula en la diferencia entre un proyecto que cuesta dólares y uno que cuesta centavos. Esta es la razón por la que la brecha de costo efectiva versus Fable 5 en una construcción completa suele ser mayor que el titular de 5x.

3. La escala
2.8 billones de parámetros, y puedes descargarlos
K3 es el modelo de pesos abiertos más grande jamás lanzado. Moonshot lo llama el primer modelo abierto de clase 3T, arrebatándole esa corona a DeepSeek. Para contexto, ni OpenAI ni Anthropic divulgan sus recuentos de parámetros en absoluto. Aquí hay un laboratorio publicando un modelo de 2.8T y entregándote los pesos.
La escala por sí sola no es el punto. Lo que importa es que esta cantidad de capacidad ahora es algo que puedes ejecutar, inspeccionar, ajustar finamente y alojar por ti mismo, en lugar de alquilar a través de un punto final medido que no controlas. Para un equipo de backend, esa distinción no es académica. Significa que puedes poner el modelo detrás de tu propio cortafuegos, ajustarlo en tu propia base de código y convenciones, y nunca enviar una línea de código propietaria a una API de terceros. El lanzamiento de pesos abiertos llega antes del 27 de julio.

4. La memoria
1 millón de tokens de contexto de una sola vez
K3 mantiene un millón de tokens de contexto en una sola ventana. En términos prácticos, eso es una base de código backend completa, sus pruebas, sus documentos y su historial de migración, todo cargado a la vez, con espacio de sobra.
Esto es lo que hace que la historia de la programación sea real, en lugar de un artefacto de benchmark. Un modelo que programa como Fable es útil. Un modelo que programa como Fable y puede ver todo tu repositorio a la vez es un tipo diferente de herramienta. Refactoriza con conocimiento completo de cada llamante, cada tipo, cada dependencia downstream, en lugar de adivinar a partir de los tres archivos que lograste pegar.
Cualquiera que haya visto a un modelo capaz romper con confianza una base de código conoce el modo de fallo: escribió código correcto para el archivo que podía ver, y código incorrecto para los doce archivos que no podía. Una ventana de un millón de tokens no hace al modelo más inteligente. Le quita la venda de los ojos. El mismo razonamiento de nivel Fable ahora opera sobre la imagen completa, que es donde se esconden la mayoría de los errores reales de backend.

5. El paralelismo
K3 Swarm Max ejecuta el trabajo en paralelo
K3 se lanzó en dos variantes. K3 Max maneja tareas de chat y agente. K3 Swarm Max está construido para procesamiento paralelo a gran escala: muchos agentes trabajando a la vez en lugar de un solo modelo moliendo a través de una cola.
Para el trabajo backend, esto es el desbloqueo. En lugar de un agente implementando cuarenta endpoints en secuencia, el enjambre los asigna a través de trabajadores paralelos, cada uno con su propio segmento de la base de código, y llegan juntos. La calidad de nivel Fable ahora también es rápida, porque el rendimiento escala con el número de agentes en lugar de la longitud de una sola conversación.
La economía se acumula sobre la velocidad. Debido a que cada agente en el enjambre es un agente K3, toda la ejecución paralela hereda la misma ventaja de costo de 5x. No estás pagando tarifas de frontera por el privilegio del paralelismo, como lo harías si desplegaras cuarenta agentes Fable a la vez. Obtienes el rendimiento de un enjambre y la factura de un modelo commodity al mismo tiempo.

6. El alcance
Construido para trabajo agéntico de largo horizonte
K3 fue entrenado específicamente para programación de largo horizonte y cargas de trabajo agénticas, no adaptado para ellas. Mantiene un plan a lo largo de miles de pasos, usa herramientas sin perder el hilo y se recupera cuando un paso falla en lugar de descarrilar toda la ejecución.
Combina eso con la ventana de un millón de tokens y obtienes un agente que puede poseer una característica backend completa de principio a fin: leer la base de código, planificar el cambio, implementar en todos los servicios, ejecutar las pruebas, leer los fallos y corregirlos. El tipo de bucle que solo funcionaba en modelos de frontera ahora funciona en uno que cuesta una quinta parte.
La parte de recuperación de fallos es lo que separa una demo de una herramienta. La mayoría de los agentes se ven impresionantes hasta que una prueba falla en el paso 900, momento en el cual uno frágil tira el plan y comienza a improvisar. K3 fue ajustado para tratar un paso fallido como información en lugar de un callejón sin salida. Lee el error, se ajusta y continúa, que es la única forma en que una ejecución de largo horizonte realmente termina.

7. El cambio
Pesos abiertos, y reinicia el precio de la frontera
La séptima característica no es una especificación. Es lo que suman las otras seis. Cuando un modelo tan capaz tiene pesos abiertos, el precio de cada modelo cerrado se convierte en una pregunta en lugar de un hecho.
Si K3 envía código backend de nivel Fable a una quinta parte del costo, con una ventana de un millón de tokens y un enjambre paralelo, la carga se desplaza a los laboratorios cerrados para justificar su prima. Ese es el mismo patrón que la industria vio con DeepSeek, y es la razón por la que este lanzamiento llegó a la portada de tres medios de negocios en dos días.
Moonshot no tropezó con esto. La empresa cerró una ronda de $500M en enero con una valoración de $4.3B, destinada explícitamente a K3 y la computación para entrenarlo. Este es un impulso financiado y deliberado para poner un modelo de clase fronteriza en abierto, y el precio no es un accidente tampoco. Es la estrategia. Subcotizar a los laboratorios cerrados en costo mientras se igualan en el eje que paga las cuentas de los desarrolladores: código que funciona.

Los siete, de un vistazo:
- Programación backend de nivel Fable a aproximadamente 5 veces menos costo.
- Eficiente en tokens, por lo que la brecha en el mundo real es aún mayor.
- 2.8T parámetros, el modelo de pesos abiertos más grande del mundo.
- Contexto de 1M tokens, un repositorio backend completo de una sola vez.
- K3 Swarm Max para construcciones paralelas de alto rendimiento.
- Cargas de trabajo agénticas de largo horizonte, poseídas de principio a fin.
- Pesos abiertos, redefiniendo lo que se permite costar a la frontera.
Código de nivel Fable. Un quinto del precio. Pesos abiertos.
La frontera solía ser un lugar al que pagabas para visitar. Kimi K3 acaba de convertir el mejor nivel de programación en algo que puedes ejecutar, poseer y permitirte. Cada otro modelo ahora tiene que explicar por qué cuesta cinco veces más por el mismo resultado.





