Este es un desglose completo de la A a la Z de lo que realmente es Kimi K3, qué puede hacer y por qué se está convirtiendo silenciosamente en el modelo de codificación más importante del que nadie habla todavía.
Guarda esta página para no perder este artículo.
2.8 billones de parámetros. 1 millón de tokens de contexto.
Aquí tienes todo lo que incluye.
Antes de Hablar de Benchmarks, Hablemos de lo que Acaba de Pasar
Durante los últimos tres años la historia ha sido la misma: los laboratorios estadounidenses construyen la frontera, los laboratorios chinos construyen la copia barata seis meses después.
El 16 de julio, Moonshot AI lanzó Kimi K3.
https://x.com/Kimi_Moonshot/status/2077830229968683203
2.8 billones de parámetros totales — aproximadamente un 75% más grande que DeepSeek V4 Pro y casi 4 veces la serie GLM 5 de Zhipu. El modelo de código abierto más grande jamás lanzado.
Supera a Claude Opus 4.8. Supera a GPT-5.6 Sol. Y según los benchmarks de Moonshot, está a la par con Fable 5, el modelo más capaz disponible para el público hoy.
La historia de la copia terminó.
Los Números

Esa última fila es la que la gente está malinterpretando. Vamos a abordarla correctamente.
La Realidad de los Precios — Léelo con Atención
Kimi K3 no es un modelo de descuento. A $3/$15 por millón de tokens, tiene un precio similar al de Claude Sonnet, no los grandes descuentos que ofrecían los lanzamientos anteriores de Moonshot.
Entonces, ¿de dónde viene lo de "5 veces más barato que Fable 5"?
Costo por tarea, no precio por token.
K3 usa sustancialmente menos tokens de salida para completar el mismo trabajo. En una tarea de codificación representativa: Fable 5 cuesta alrededor de $1.30. K3 cuesta alrededor de $0.25.
Mismo nivel de salida. Menos tokens. Factura total más baja.
El marco honesto: precio de Sonnet, experiencia de nivel Fable. No estás comprando los tokens más baratos del mercado. Estás comprando capacidad fronteriza a un precio de gama media, y llegando allí en menos pasos.
Si comparas precios de tokens en bruto, K3 parece poco notable. Si comparas lo que cuesta completar un trabajo, es una conversación completamente diferente.
Donde Kimi K3 es Estado del Arte
Según los benchmarks publicados por Moonshot, K3 establece SOTA en:
- HLE con herramientas — El Examen Final de la Humanidad, aumentado con herramientas
- SWE-Bench Pro — ingeniería de software del mundo real
- SWE-Bench Multilingüe — ingeniería en múltiples idiomas
- BrowseComp — navegación web e investigación
- Toolathlon — uso de herramientas a escala
- CharXiv con Python — razonamiento sobre gráficos y figuras
- MathVision con Python — matemáticas visuales

Frente a la competencia: supera a Opus 4.8 y GPT-5.6 Sol, a la par con Fable 5.
En pruebas ciegas realizadas por el evaluador de IA Arena, los desarrolladores prefirieron a Kimi sobre todos los modelos estadounidenses líderes.
Las Dos Innovaciones de Arquitectura que Realmente Importan
Esta es la parte que la mayoría de la cobertura está omitiendo, y es lo más interesante del lanzamiento.

- Atención Delta de Kimi (KDA)
Un mecanismo de atención lineal híbrido. El resultado: hasta 6.3 veces más rápido en decodificación en contextos de un millón de tokens.
Una ventana de contexto de 1M solo es útil si realmente puedes trabajar en ella sin esperar una eternidad. KDA es lo que hace que la ventana de contexto sea práctica en lugar de teórica.
- Residuales de Atención (AttnRes)
Un reemplazo directo para las conexiones residuales. Ofrece aproximadamente un 25% más de eficiencia en el entrenamiento con menos del 2% de costo adicional.
Ambas técnicas fueron publicadas como investigación abierta por el equipo de Moonshot en GitHub antes de que el modelo se lanzara. Esto no es marketing, es trabajo que puede ser inspeccionado por pares.
Y combinadas, explican la eficiencia de tokens: K3 usa un 21% menos de tokens de salida que K2.6 en tareas equivalentes.
La Parte que Debería Hacerte Prestar Atención: K3 Optimizó su Propia Arquitectura
Moonshot le dio a K3 la implementación de Residuales de Atención (su propio componente arquitectónico) y un objetivo: hacerlo más rápido en hardware H200 sin cambiar el comportamiento numérico.
Luego lo dejaron solo.
20 horas de experimentos. Cero intervención humana. Aceleración de 1.6x.
En una ejecución separada, K3 redujo el tiempo de avance/retroceso de FLA Triton AttnRes de 283.6ms a 114.4ms, una aceleración de 2.48x, nuevamente sin cambiar los números.

Y fue más rápido que Fable 5 haciendo la misma tarea.
Léelo de nuevo. El modelo mejoró el mecanismo que hace que el modelo funcione. Autónomamente. Durante la noche.
Esto es lo que significa "auto-mejora recursiva" en la práctica, no un escenario de ciencia ficción, sino un trabajo de 20 horas con un resultado medible. Es la misma capacidad que Anthropic señaló como motivo de cautela hace semanas, ejecutándose en un modelo de pesos abiertos que cualquiera puede descargar el 27 de julio.
La Codificación de Largo Plazo es el Punto Central
El propio marco de Moonshot: "K3 se presenta como el modelo de codificación de código abierto más potente de Moonshot AI hasta la fecha. Operando con una supervisión humana mínima, puede mantener sesiones largas de ingeniería, navegar por repositorios masivos y orquestar herramientas de terminal."
Las tres cosas que importan para el trabajo real de ingeniería:
- Sesiones sostenidas — el experimento autónomo de 20 horas no es una demostración. Es el objetivo de diseño.
- Repositorios masivos — una ventana de contexto de 1M con decodificación 6.3x más rápida significa que puedes poner un código base real en contexto y trabajar realmente en él.
- Orquestación de herramientas — SOTA en Toolathlon y BrowseComp significa que maneja la terminal, el navegador y las llamadas API sin desmoronarse.
La codificación de frontend se sitúa al nivel de Fable 5. Escenas de juegos de calidad AAA a partir de un solo prompt. WebGPU, Three.js, shaders, física: lo que solía requerir un estudio.
Vibe Coding con Kimi K3
Aquí es donde el modelo deja de ser un número de benchmark y comienza a ser claramente útil.
La codificación de frontend de K3 está al nivel de Fable 5. En la práctica, eso significa que la pared entre una descripción y un producto 3D funcional ahora es un solo prompt.
Lo que la gente realmente ha lanzado desde prompts individuales:
Juegos — Arenas de combate WebGPU con efectos visuales. Recorrido de ciudad 3D en navegador con mecánicas de agarre.
- FPS de zombis.
- Carreras multijugador.
- Un emulador de GBA 3D funcional.
- Andamiaje completo de MMORPG.
No es "una demo parecida a un juego": escenas jugables con reacciones a impactos, retroalimentación de impacto y física que se comporta correctamente.

Objetos 3D con trabajo de materiales real — Un Rolex con brillo y comportamiento de luz correctos. Un arma de CSGO que se ensambla y desensambla en 33 piezas modeladas individualmente. Un despiece de una cámara Sony. Un agujero negro con lente gravitacional. Simulación de océano con dinámica de olas real.

Escenas de física — Simulación de telas. Colapso estructural. Colisiones de vehículos con transferencia de momento que se ve correcta en lugar de parecer guionizada.
Lo que hace que esto sea diferente de las demostraciones anteriores de "IA construye un sitio web": K3 maneja los detalles que normalmente fallan. Iluminación. Sombras. Brillo de materiales. Las 20 pequeñas cosas que separan "claramente generado por IA" de "alguien construyó esto".
Un solo prompt. Cuatro millones de tokens. Una escena que solía necesitar un equipo.
4 Prompts Probados en Batalla (Listos para Copiar y Pegar)
Están estructurados para explotar lo que K3 realmente hace bien: trabajo de largo plazo, uso de herramientas y mantener un contexto grande sin desviarse.
Prompt 1 — La Prueba de Esfuerzo de Física
Este es el prompt que separa la capacidad real del pulido de demostración. Si un modelo puede hacer las tres escenas con calidad, es real.
1Crea tres escenas HTML5 autónomas con física real.2Sin librerías externas. Todo en un archivo por escena.34Escena 1: Un tren descarrilando de un puente roto hacia el agua.5Incluye: momento del vagón, fallo estructural del puente,6desplazamiento de agua en el impacto.78Escena 2: Dos coches saltando desde rampas y chocando en el aire9sobre un cañón. Incluye: arcos de trayectoria correctos,10transferencia de momento en la colisión, escombros.1112Escena 3: Un monstruo truck aplastando una fila de coches aparcados.13Incluye: compresión de suspensión, deformación de chapa metálica,14distribución de peso.1516Requisitos para las tres:17- La física debe ser calculada, no animada18- Objetivo de 60fps19- Incluye un botón de reinicio20- Comenta las matemáticas de la física para que pueda verificarlas2122Construye las tres. No hagas preguntas aclaratorias.
Prompt 2 — La Tarea de Repositorio de Largo Plazo
Esto es para lo que realmente se construyó K3. Apúntalo a un código base real y dale un resultado, no una tarea.
1Lee todo este código base antes de escribir nada.23[pega tu repo, o apúntalo al directorio]45Objetivo: [indica un resultado medible — ej. "reducir6el tiempo de respuesta p95 de la API en un 30%" o "eliminar7todas las consultas N+1 en la capa de datos"]89Reglas:10- Perfila primero. Muéstrame dónde va realmente el tiempo11 antes de cambiar nada.12- No cambies interfaces públicas ni el comportamiento numérico.13- Ejecuta el conjunto de pruebas existente después de cada cambio.14- Si un cambio empeora las cosas, reviértelo y dime por qué.15- Trabaja hasta que se alcance el objetivo o puedas demostrar que16 no es alcanzable sin romper las reglas.1718Informe al final: qué cambiaste, qué ganaste,19qué intentaste que no funcionó.
La línea de "qué intentaste que no funcionó" es importante. Es lo que convierte la salida de un diff en un registro de ingeniería.
Prompt 3 — La Construcción de Producto 3D
Para cualquiera que haga frontend, páginas de aterrizaje o visualización de productos.
1Construye un [objeto] 3D interactivo en el navegador.2Un solo archivo HTML. Three.js.34El objeto: [descríbelo con precisión — materiales,5número de piezas, qué se mueve]67Debe incluir:8- Propiedades de material correctas (brillo, rugosidad,9 metalicidad donde corresponda)10- Iluminación de tres puntos con sombras reales11- Controles de órbita12- [Cualquier interacción — ensamblaje/desensamblaje, animación,13 estados de hover]1415Nivel de calidad: esto debe parecer un render de producto,16no una demo de WebGL. Si un detalle sería visible en la vida17real, modelalo.1819Construye todo. Muéstrame el archivo.
La línea de "nivel de calidad" hace más trabajo que cualquier otra cosa en el prompt. K3 responde a estándares, no solo a instrucciones.
Prompt 4 — Función en Tiempo Real con una Parte Móvil
CRUD full-stack es una forma de aplicación. El tiempo real es una forma completamente diferente: el estado debe mantenerse sincronizado entre los clientes, no solo persistir en una base de datos. Aquí es donde muchos modelos fallan silenciosamente.
1Añade una función en tiempo real a una aplicación existente: un sistema2de cursor colaborativo en vivo + comentarios, como el de Figma.34REQUISITOS:5- Conexión WebSocket (usa Socket.io o ws nativo)6- Muestra las posiciones del cursor de otros usuarios conectados en tiempo real7- Haz clic en cualquier lugar para dejar un pin de comentario8- Los comentarios se actualizan en vivo para todos los clientes conectados9- Maneja la desconexión/reconexión correctamente — sin cursores fantasma10- Debounce de las actualizaciones del cursor para no saturar el socket1112CONSTRUYE:131. Configura el servidor WebSocket142. Construye la conexión del lado del cliente con reconexión automática153. Implementa la transmisión del cursor con debouncing164. Implementa el sistema de pines de comentarios175. Añade un indicador de presencia simple (quién está en línea)186. Prueba con al menos 2 clientes simulados para confirmar que la sincronización funciona1920Muéstrame cómo probaste la sincronización multi-cliente antes de dar esto por terminado.
Resultado esperado: Una capa en tiempo real funcional en 15–30 minutos, con evidencia visible de que se probó con más de un cliente.

La última línea es la parte importante. Los errores en tiempo real no aparecen con una sola pestaña del navegador abierta, aparecen con dos. Un modelo que omite las pruebas multi-cliente te entregará código que parece terminado y no lo está.
Cuando K3 Falla: Guía de Solución de Problemas
Es un modelo nuevo con bordes ásperos reales. Aquí está lo que falla y qué hacer.
- Problema: Quema tokens en tareas triviales
Este es el grande, y es estructural.
K3 actualmente viene con solo un nivel de esfuerzo de razonamiento: 'máximo'. No hay un modo de "solo responde rápido". Evaluadores independientes registraron 13,241 tokens de razonamiento para generar un SVG simple — aproximadamente $0.25 por algo que debería costar fracciones de centavo.
La solución:
no envíes trabajo simple a K3. Es un modelo fronterizo con una sola marcha, y esa marcha es "piensa mucho en todo". Usa K2.7 o un modelo más pequeño para plantillas, formato y cualquier cosa mecánica. Reserva K3 para trabajos que justifiquen el razonamiento.
Este es el error más grande que la gente cometerá en el primer mes: hacer de K3 el predeterminado para todo y luego sorprenderse con la factura.
- Problema: La ventana de contexto se llena de todas formas
1M de tokens suena infinito hasta que pones un repo real y no lo es.
La solución:
no vuelques todo. Apúntalo a los directorios que importan. La fortaleza de K3 en trabajos de largo plazo proviene de la concentración sostenida, no de tener todos los archivos en contexto. Unos 200K ajustados del código correcto superan a unos 900K inflados de todo el monorepo.
- Problema: Se desvía en ejecuciones autónomas muy largas
El experimento autónomo de 20 horas es real, pero funcionó porque el objetivo era medible — "haz esto más rápido en H200 sin cambiar los números". Dale un objetivo vago y una larga correa y se desviará.
La solución:
cada prompt de largo plazo necesita una condición de éxito verificable. No "mejora el código". Un número, una prueba que pase, un benchmark que se mueva. Si no puedes decir cómo comprobarías si tuvo éxito, se desviará.
- Problema: No puedes reproducir el resultado de benchmark de alguien
Nadie fuera de Moonshot ha auditado este modelo. Los pesos no se publican hasta el 27 de julio. Cada número que circula ahora, incluyendo en este artículo, es reportado por el proveedor.
La solución:
espera al 27 de julio, o prueba en tus propias tareas y confía en eso. Tus cinco tareas reales valen más que la tabla de benchmarks de cualquiera.
- Problema: Errores de integración después de cambiar de OpenAI o Anthropic
K3 es compatible con el SDK de OpenAI, lo que cubre el 90% de la migración. El 10% restante suele ser el comportamiento de razonamiento: K3 piensa por defecto y devuelve tokens de razonamiento que quizás no esperes en el manejo de tu respuesta.
La solución:
revisa tu contabilidad de tokens y tu análisis de respuesta antes de asumir que el modelo está roto. La mayoría de las quejas de "K3 es caro" son en realidad "olvidé que los tokens de razonamiento son tokens de salida".
El Contexto que Nadie Debería Ignorar
Moonshot tiene su sede en Pekín, fundada por Yang Zhilin, ex investigador de Google, y respaldada por Alibaba.
https://x.com/kirillk_web3/status/2057528102368977328
Construyeron un modelo fronterizo de 2.8 billones de parámetros bajo tres años de crecientes controles de exportación de EE. UU. sobre chips avanzados.
Los analistas de Bank of America lo dijeron directamente: "A pesar de las persistentes limitaciones de hardware/capacidad de cómputo en China, K3 demuestra que el escalado del pre-entrenamiento, junto con la innovación arquitectónica, aún puede ofrecer mejoras radicales para los modelos chinos emblemáticos."
Y el momento no es accidental: K3 aterrizó días antes de la Conferencia Mundial de Inteligencia Artificial de 2026 en Shanghái.
La Pregunta del 27 de Julio
Los pesos se publican el 27 de julio. Esa fecha importa más que la fecha de lanzamiento.
Hasta entonces, K3 es un modelo fronterizo que puedes usar a través de una API — impresionante.
El 27 de julio, se convierte en otra cosa: un modelo de clase fronteriza que cualquiera puede descargar, inspeccionar, modificar y ejecutar en su propio hardware. Sin API. Sin límites de uso. Sin términos de servicio. Sin retención de prompts de 30 días.
Esa es la historia real. No "China se puso al día".
China se puso al día y lo regaló.

Vale la pena señalar: los reguladores chinos han estado discutiendo controles de exportación de IA propios. No está claro si K3 es el último lanzamiento de pesos abiertos fronterizos de China o el primero de muchos.
Cómo Probarlo
Chat: kimi.com — K3 está activo ahora
API: Compatible con el SDK de OpenAI, así que si ya estás construyendo en cadenas de herramientas de OpenAI o Anthropic, la integración es un cambio de configuración, no una reescritura
Pesos: 27 de julio
La compatibilidad con el SDK es más importante de lo que parece. Cambiar de modelo normalmente significa reescribir tu capa de integración. Aquí significa cambiar una URL base y una cadena de modelo.
Cómo Instalar Kimi Code (El Agente de Terminal)
Si quieres que K3 se ejecute dentro de tu código base real en lugar de una ventana de chat, esta es la configuración.

Requisitos:
- Una computadora (Mac, Windows o Linux)
- Acceso a terminal
- Cuenta de Kimi — kimi.com
Paso 1 — Instalar Kimi Code
Mac/Linux:
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
Windows (PowerShell):
1irm https://code.kimi.com/kimi-code/install.ps1 | iex
En Windows, instala Git for Windows primero — la CLI de Kimi Code usa su Git Bash integrado como entorno de shell.
Verifica la instalación:
1kimi --version
Debido a Gatekeeper de macOS, la primera ejecución puede tardar notablemente más. Añade tu aplicación de terminal en Configuración del Sistema → Privacidad y Seguridad → Herramientas de Desarrollador para acelerar los lanzamientos posteriores.
Si ya tienes uv instalado, puedes instalar directamente:
1uv tool install --python 3.13 kimi-cli
La CLI de Kimi Code es compatible con Python 3.12–3.14, recomendándose 3.13 para la mejor compatibilidad.
Paso 2 — Navega a tu proyecto e inicia
1cd tu-proyecto2kimi
En el primer inicio, ejecuta /login dentro de la sesión para configurar tu fuente de API — se abre una ventana del navegador para OAuth.
Paso 3 — Dale una tarea
Kimi Code ahora se ejecuta dentro de tu proyecto, con acceso de lectura/escritura directo a cada archivo. Describe una tarea en español simple — planea los pasos, edita el código, ejecuta pruebas e informa lo que hizo.
Lo que Esto Realmente Significa
Si estás ejecutando cargas de trabajo de producción:
Pruébalo antes de cambiar. Los benchmarks de los proveedores y el rendimiento del mundo real divergen constantemente. Elige cinco tareas reales, ejecuta K3 y tu modelo actual uno al lado del otro, mide el costo por trabajo completado, no el costo por token.

El cálculo por tarea es todo el argumento. A $3/$15, K3 no es barato en papel. Con un 21% menos de tokens y resultados a nivel de Fable, es barato donde importa.
El 27 de julio cambia las reglas del juego. Los pesos abiertos significan auto-hosting, fine-tuning y dependencia cero de que la API de alguien siga en línea o de que los términos de alguien sigan siendo favorables. Para cualquier cosa sensible, eso no es poca cosa.
Conclusión
La frontera solía ser un lugar que los laboratorios estadounidenses construían y todos los demás visitaban seis meses después.
2.8 billones de parámetros. 1M de contexto. Codificación a nivel de Fable 5 a precio de Sonnet. Construido bajo controles de exportación, por el laboratorio con la valoración más baja de la sala, y regalado el 27 de julio.
La pregunta interesante no es si K3 supera a Fable 5 en algún benchmark. Es qué sucede con la economía de los modelos fronterizos cerrados cuando uno de pesos abiertos los iguala.
Enlaces
- Kimi K3: https://www.kimi.com
- Mi Telegram: https://t.me/kirillk_web3
- Mi Twitter/X: https://x.com/kirillk_web3
- Hosting de socio: https://ishosting.com/affiliate/NzE0MiM2
Sigue para más información sobre Vibe Coding. ¡Gracias por leer!





