Esta es una guía completa de la A a la Z sobre qué es realmente Kimi K3, qué puede hacer y por qué se está convirtiendo silenciosamente en el modelo de codificación más importante del que nadie habla todavía.
Guarda esta página para no perder este artículo.
2.8 billones de parámetros. Un contexto de 1 millón de tokens.
Aquí tienes todo lo que incluye.
Antes de hablar de benchmarks, hablemos de lo que acaba de pasar
Durante los últimos tres años, la historia ha sido la misma: los laboratorios estadounidenses construyen la frontera, los laboratorios chinos construyen la copia barata seis meses después.
El 16 de julio, Moonshot AI lanzó Kimi K3.
https://x.com/Kimi_Moonshot/status/2077830229968683203
2.8 billones de parámetros totales — aproximadamente un 75 % más grande que DeepSeek V4 Pro y casi 4 veces más que la serie GLM 5 de Zhipu. El modelo de código abierto más grande jamás lanzado.
Supera a Claude Opus 4.8. Supera a GPT-5.6 Sol. Y en los benchmarks de Moonshot, está a la par de Fable 5, el modelo más capaz disponible para el público hoy en día.
La historia de la copia ha terminado.
Los números

Esa última fila es la que la gente está malinterpretando. Abordémosla correctamente.
La realidad de los precios: léelo con atención
Kimi K3 no es un modelo de descuento. A $3/$15 por millón de tokens, tiene un precio similar al de Claude Sonnet, no los profundos descuentos que ofrecían los lanzamientos anteriores de Moonshot.
Entonces, ¿de dónde viene eso de "5 veces más barato que Fable 5"?
Costo por tarea, no precio por token.
K3 utiliza sustancialmente menos tokens de salida para completar el mismo trabajo. En una tarea de codificación representativa: Fable 5 cuesta alrededor de $1.30. K3 cuesta alrededor de $0.25.
Mismo nivel de salida. Menos tokens. Factura total más baja.
El marco honesto: Precio de Sonnet, experiencia de nivel Fable. No estás comprando los tokens más baratos del mercado. Estás comprando capacidad de frontera a un precio de gama media, y llegando allí en menos pasos.
Si comparas precios de tokens en bruto, K3 parece mediocre. Si comparas lo que cuesta completar un trabajo, es una conversación completamente diferente.
Dónde Kimi K3 es estado del arte
Según los benchmarks publicados por Moonshot, K3 establece SOTA en:
- HLE con herramientas — El examen final de la humanidad, aumentado con herramientas
- SWE-Bench Pro — ingeniería de software del mundo real
- SWE-Bench Multilingüe — ingeniería en varios idiomas
- BrowseComp — navegación web e investigación
- Toolathlon — uso de herramientas a escala
- CharXiv con Python — razonamiento sobre gráficos y figuras
- MathVision con Python — matemáticas visuales

Frente a la competencia: supera a Opus 4.8 y GPT-5.6 Sol, a la par de Fable 5.
En pruebas ciegas realizadas por el evaluador de IA Arena, los desarrolladores prefirieron a Kimi sobre todos los modelos estadounidenses líderes.
Las dos innovaciones de arquitectura que realmente importan
Esta es la parte que la mayoría de la cobertura está omitiendo, y es lo más interesante del lanzamiento.

- Kimi Delta Attention (KDA)
Un mecanismo de atención lineal híbrido. El resultado: hasta 6.3 veces más rápido en decodificación en contextos de un millón de tokens.
Una ventana de contexto de 1M solo es útil si puedes trabajar realmente en ella sin esperar eternamente. KDA es lo que hace que la ventana de contexto sea práctica en lugar de teórica.
- Residuos de Atención (AttnRes)
Un reemplazo directo para las conexiones residuales. Ofrece aproximadamente un 25% más de eficiencia de entrenamiento con un costo adicional inferior al 2%.
Ambas técnicas fueron publicadas como investigación abierta por el equipo de Moonshot en GitHub antes de que el modelo se enviara. Esto no es marketing, es un trabajo que puede ser inspeccionado por pares.
Y combinadas, explican la eficiencia de tokens: K3 utiliza un 21% menos de tokens de salida que K2.6 en tareas equivalentes.
La parte que debería hacerte prestar atención: K3 optimizó su propia arquitectura
Moonshot le dio a K3 la implementación de Attention Residuals (su propio componente arquitectónico) y un objetivo: hacerlo más rápido en hardware H200 sin cambiar el comportamiento numérico.
Luego lo dejaron solo.
20 horas de experimentos. Cero intervención humana. Aceleración de 1.6x.
En una ejecución separada, K3 redujo el tiempo de avance/retroceso de FLA Triton AttnRes de 283.6 ms a 114.4 ms, una aceleración de 2.48x — nuevamente sin cambiar los números.

Y mejoró más rápido que Fable 5 haciendo la misma tarea.
Léelo de nuevo. El modelo mejoró el mecanismo que hace que el modelo funcione. Autónomamente. Durante la noche.
Esto es lo que parece la "automejora recursiva" en la práctica — no un escenario de ciencia ficción, sino un trabajo de 20 horas con un resultado medible. Es la misma capacidad que Anthropic señaló como motivo de precaución hace semanas, ejecutándose en un modelo de pesos abiertos que cualquiera puede descargar el 27 de julio.
La codificación de largo horizonte es el objetivo principal
El propio marco de Moonshot: "K3 se presenta como el modelo de codificación de código abierto más potente de Moonshot AI hasta la fecha. Operando con una supervisión humana mínima, puede mantener sesiones de ingeniería largas, navegar por repositorios masivos y orquestar herramientas de terminal."
Las tres cosas que importan para el trabajo de ingeniería real:
- Sesiones sostenidas — el experimento autónomo de 20 horas no es una demostración. Es el objetivo de diseño.
- Repositorios masivos — una ventana de contexto de 1M con decodificación 6.3x más rápida significa que puedes poner un código base real en contexto y trabajar realmente en él.
- Orquestación de herramientas — SOTA en Toolathlon y BrowseComp significa que maneja la terminal, el navegador y las llamadas API sin desmoronarse.
La codificación de frontend alcanza el nivel de Fable 5. Escenas de juegos de calidad AAA a partir de un solo prompt. WebGPU, Three.js, shaders, física — lo que solía requerir un estudio.
Vibe Coding con Kimi K3
Aquí es donde el modelo deja de ser un número de benchmark y empieza a ser claramente útil.
La codificación de frontend de K3 está al nivel de Fable 5. En la práctica, eso significa que la pared entre una descripción y un producto 3D funcional es ahora un solo prompt.
Lo que la gente ha lanzado realmente a partir de prompts individuales:
Juegos — Arenas de combate WebGPU con efectos visuales. Recorrido 3D en el navegador por una ciudad con mecánicas de agarre.
- Zombie FPS.
- Carreras multijugador.
- Un emulador de GBA 3D funcional.
- Andamio completo de MMORPG.
No es una "demo parecida a un juego" — son escenas jugables con reacciones a impactos, retroalimentación de golpes y física que se comporta correctamente.

Objetos 3D con trabajo de materiales reales — Un Rolex con brillo y comportamiento de luz correctos. Un arma de CSGO que se ensambla y desensambla en 33 piezas modeladas individualmente. Un despiece de una cámara Sony. Un agujero negro con lente gravitacional. Simulación oceánica con dinámica de olas real.

Escenas de física — Simulación de telas. Colapso estructural. Colisiones de vehículos con transferencia de momento que se ve correcta, no como si estuviera guionizada.
Lo que hace que esto sea diferente de las demostraciones anteriores de "IA construye un sitio web": K3 maneja los detalles que normalmente fallan. Iluminación. Sombras. Brillo de materiales. Las 20 pequeñas cosas que separan "claramente generado por IA" de "alguien construyó esto".
Un solo prompt. Cuatro millones de tokens. Una escena que solía necesitar un equipo.
4 Prompts probados en batalla (listos para copiar y pegar)
Están estructurados para explotar lo que K3 realmente sabe hacer: trabajo de largo horizonte, uso de herramientas y mantener un contexto grande sin desviarse.
Prompt 1 — La prueba de estrés de física
Este es el prompt que separa la capacidad real de la demo pulida. Si un modelo puede hacer las tres escenas con calidad, es real.
1Construye tres escenas autónomas en canvas HTML5 con física real.2Sin librerías externas. Todo en un solo archivo por escena.34Escena 1: Un tren descarrilando desde un puente roto hacia el agua.5Incluye: momento de los vagones, fallo estructural del puente,6desplazamiento del agua al impactar.78Escena 2: Dos coches saltando desde rampas y colisionando en el aire9sobre un cañón. Incluye: trayectorias correctas,10transferencia de momento en la colisión, escombros.1112Escena 3: Un monster truck aplastando una fila de coches aparcados.13Incluye: compresión de la suspensión, deformación de la chapa,14distribución del peso.1516Requisitos para las tres:17- La física debe ser calculada, no animada18- Objetivo de 60fps19- Incluye un botón de reinicio20- Comenta las matemáticas de la física para que pueda verificarlas2122Construye las tres. No hagas preguntas aclaratorias.
Prompt 2 — La tarea de repositorio de largo horizonte
Esto es para lo que realmente se construyó K3. Apúntalo a un código base real y dale un resultado, no una tarea.
1Lee todo este código base antes de escribir nada.23[Pega tu repositorio, o apúntalo al directorio]45Objetivo: [indica un resultado medible — ej. "reducir el tiempo de6respuesta p95 de la API en un 30%" o "eliminar todas las consultas N+17en la capa de datos"]89Reglas:10- Perfila primero. Muéstrame dónde va realmente el tiempo11 antes de cambiar nada.12- No cambies interfaces públicas ni comportamiento numérico.13- Ejecuta el conjunto de pruebas existente después de cada cambio.14- Si un cambio empeora las cosas, reviértelo y dime por qué.15- Trabaja hasta alcanzar el objetivo o puedas demostrar que16 no es alcanzable sin romper las reglas.1718Informa al final: qué cambiaste, qué aportó,19qué intentaste que no funcionó.
La línea "qué intentaste que no funcionó" es importante. Es lo que convierte la salida de un diff en un registro de ingeniería.
Prompt 3 — La construcción de producto 3D
Para cualquiera que haga frontend, páginas de aterrizaje o visualización de productos.
1Construye un [objeto] 3D interactivo en el navegador.2Un solo archivo HTML. Three.js.34El objeto: [descríbelo con precisión — materiales,5número de piezas, qué se mueve]67Debe incluir:8- Propiedades de material correctas (brillo, rugosidad,9 metalicidad cuando corresponda)10- Iluminación de tres puntos con sombras reales11- Controles de órbita12- [Cualquier interacción — ensamblaje/desensamblaje, animación,13 estados de hover]1415Estándar de calidad: esto debe parecer un render de producto,16no una demo de WebGL. Si un detalle sería visible en la vida real,17módelo.1819Construye todo. Muéstrame el archivo.
La línea "estándar de calidad" hace más trabajo que cualquier otra cosa en el prompt. K3 responde a estándares, no solo a instrucciones.
Prompt 4 — Funcionalidad en tiempo real con una parte móvil
CRUD completo es una forma de aplicación. El tiempo real es una forma completamente diferente: el estado debe mantenerse sincronizado entre clientes, no solo persistir en una base de datos. Aquí es donde muchos modelos fallan silenciosamente.
1Añade una funcionalidad en tiempo real a una aplicación existente: un sistema2de cursor colaborativo en vivo + comentarios, como el de Figma.34REQUISITOS:5- Conexión WebSocket (usa Socket.io o ws nativo)6- Muestra las posiciones del cursor de otros usuarios conectados en tiempo real7- Haz clic en cualquier lugar para soltar un pin de comentario8- Los comentarios se actualizan en vivo para todos los clientes conectados9- Maneja desconexión/reconexión con elegancia — sin cursores fantasma10- Debouncea las actualizaciones del cursor para que no inunden el socket1112CONSTRUYE:131. Configura el servidor WebSocket142. Construye la conexión del lado del cliente con reconexión automática153. Implementa la transmisión del cursor con debouncing164. Implementa el sistema de pines de comentarios175. Añade un indicador de presencia simple (quién está en línea)186. Prueba con al menos 2 clientes simulados para confirmar la sincronización1920Muéstrame cómo probaste la sincronización multi-cliente antes de dar esto por terminado.
Resultado esperado: Una capa en tiempo real funcional en 15–30 minutos, con evidencia visible de que se probó con más de un cliente.

La última línea es la parte importante. Los errores en tiempo real no aparecen con una sola pestaña del navegador, aparecen con dos. Un modelo que omite las pruebas con múltiples clientes te dará código que parece terminado pero no lo está.
Cuando K3 falla: guía de solución de problemas
Es un modelo nuevo con bordes ásperos reales. Aquí está lo que falla y qué hacer.
- Problema: Quema tokens en tareas triviales
Este es el grande, y es estructural.
K3 actualmente solo viene con un nivel de esfuerzo de razonamiento: 'max'. No hay un modo de "solo responder rápido". Evaluadores independientes midieron 13,241 tokens de razonamiento para generar un SVG simple — aproximadamente $0.25 por algo que debería costar fracciones de un centavo.
La solución:
no envíes trabajo simple a K3. Es un modelo de frontera con una sola marcha, y esa marcha es "piensa mucho en todo". Usa K2.7 o un modelo más pequeño para boilerplate, formato y cualquier cosa mecánica. Reserva K3 para el trabajo que justifique el razonamiento.
Este es el error más grande que la gente cometerá en el primer mes: hacer de K3 el predeterminado para todo y luego sorprenderse con la factura.
- Problema: La ventana de contexto se llena de todas formas
1M de tokens suena infinito hasta que pones un repositorio real y no lo es.
La solución:
no lo vuelques todo. Apúntalo a los directorios que importan. La fortaleza de K3 en trabajos de largo horizonte proviene de la atención sostenida, no de tener todos los archivos en contexto. Un ajustado 200K del código correcto supera a un inflado 900K de todo el monorepo.
- Problema: Se desvía en ejecuciones autónomas muy largas
El experimento autónomo de 20 horas es real, pero funcionó porque el objetivo era medible — "haz esto más rápido en H200 sin cambiar los números". Dale un objetivo vago y una correa larga y divagará.
La solución:
cada prompt de largo horizonte necesita una condición de éxito verificable. No es "mejora el código". Un número, una prueba que pase, un benchmark que se mueva. Si no puedes indicar cómo comprobarías si tuvo éxito, se desviará.
- Problema: No puedes reproducir el resultado de un benchmark de alguien
Nadie fuera de Moonshot ha auditado este modelo. Los pesos no se publican hasta el 27 de julio. Cada número que circula ahora — incluyendo los de este artículo — son reportados por el proveedor.
La solución:
espera al 27 de julio, o prueba en tus propias tareas y confía en eso. Tus cinco tareas reales valen más que cualquier tabla de benchmarks de alguien.
- Problema: Errores de integración después de cambiar de OpenAI o Anthropic
K3 es compatible con el SDK de OpenAI, lo que cubre el 90% de la migración. El 10% restante suele ser el comportamiento de razonamiento: K3 piensa por defecto y devuelve tokens de razonamiento que quizás no esperes en el manejo de tu respuesta.
La solución:
revisa tu contabilidad de tokens y el análisis de tu respuesta antes de asumir que el modelo está roto. La mayoría de las quejas de "K3 es caro" son en realidad "olvidé que los tokens de razonamiento son tokens de salida".
El contexto que nadie debería ignorar
Moonshot tiene su sede en Pekín, fundada por Yang Zhilin, ex investigador de Google, y respaldada por Alibaba.
https://x.com/kirillk_web3/status/2057528102368977328
Construyeron un modelo de frontera de 2.8 billones de parámetros bajo tres años de crecientes controles de exportación de Estados Unidos sobre chips avanzados.
Los analistas de Bank of America lo dijeron directamente: "A pesar de las persistentes restricciones de capacidad de hardware/computación en China, K3 demuestra que el escalado del preentrenamiento, junto con la innovación arquitectónica, aún puede ofrecer mejoras transformadoras para los modelos chinos emblemáticos".
Y el momento no es accidental: K3 llegó días antes de la Conferencia Mundial de Inteligencia Artificial de 2026 en Shanghái.
La pregunta del 27 de julio
Los pesos se publican el 27 de julio. Esa fecha importa más que la fecha de lanzamiento.
Hasta entonces, K3 es un modelo de frontera que puedes usar a través de una API — impresionante.
El 27 de julio, se convierte en otra cosa: un modelo de clase fronteriza que cualquiera puede descargar, inspeccionar, modificar y ejecutar en su propio hardware. Sin API. Sin límites de uso. Sin términos de servicio. Sin retención de prompts de 30 días.
Esa es la verdadera historia. No es "China se puso al día".
China se puso al día y lo regaló.

Vale la pena señalar: los reguladores chinos han estado discutiendo sus propios controles de exportación de IA. No está claro si K3 es la última versión de pesos abiertos de frontera de China o la primera de muchas.
Cómo probarlo
Chat: kimi.com — K3 está activo ahora
API: Compatible con el SDK de OpenAI, así que si ya estás construyendo con cadenas de herramientas de OpenAI o Anthropic, la integración es un cambio de configuración, no una reescritura
Pesos: 27 de julio
La compatibilidad con el SDK es más importante de lo que parece. Cambiar de modelos normalmente significa reescribir tu capa de integración. Aquí significa cambiar una URL base y una cadena de modelo.
Cómo instalar Kimi Code (el agente de terminal)
Si quieres que K3 funcione dentro de tu código base real en lugar de una ventana de chat, esta es la configuración.

Requisitos:
- Un ordenador (Mac, Windows o Linux)
- Acceso a terminal
- Cuenta de Kimi — kimi.com
Paso 1 — Instalar Kimi Code
Mac/Linux:
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
Windows (PowerShell):
1irm https://code.kimi.com/kimi-code/install.ps1 | iex
En Windows, instala Git for Windows primero — la CLI de Kimi Code usa su Git Bash incluido como entorno de shell.
Verifica la instalación:
1kimi --version
Debido a Gatekeeper de macOS, la primera ejecución puede tardar notablemente más. Añade tu aplicación de terminal en Ajustes del Sistema → Privacidad y Seguridad → Herramientas de Desarrollo para acelerar los lanzamientos posteriores.
Si ya tienes uv instalado, puedes instalarlo directamente:
1uv tool install --python 3.13 kimi-cli
La CLI de Kimi Code es compatible con Python 3.12–3.14, recomendándose 3.13 para una mejor compatibilidad.
Paso 2 — Navega a tu proyecto y ejecuta
1cd tu-proyecto2kimi
En el primer inicio, ejecuta /login dentro de la sesión para configurar tu fuente de API — se abre una ventana del navegador para OAuth.
Paso 3 — Dale una tarea
Kimi Code ahora se ejecuta dentro de tu proyecto, con acceso directo de lectura/escritura a todos los archivos. Describe una tarea en inglés simple — planifica los pasos, edita el código, ejecuta pruebas e informa lo que hizo.
Lo que esto realmente significa
Si estás ejecutando cargas de trabajo de producción:
Pruébalo antes de cambiar. Los benchmarks de los proveedores y el rendimiento del mundo real divergen constantemente. Elige cinco tareas reales, ejecuta K3 y tu modelo actual lado a lado, mide el costo por trabajo completado — no el costo por token.

La matemática por tarea es todo el argumento. A $3/$15, K3 no es barato sobre el papel. Con un 21% menos de tokens y salida de nivel Fable, es barato donde importa.
El 27 de julio cambia el cálculo. Los pesos abiertos significan autoalojamiento, ajuste fino y cero dependencia de que la API de alguien se mantenga en línea o de que los términos de alguien sigan siendo favorables. Para cualquier cosa sensible, eso no es poca cosa.
Conclusión
La frontera solía ser un lugar que los laboratorios estadounidenses construían y todos los demás visitaban seis meses después.
2.8 billones de parámetros. 1M de contexto. Codificación de nivel Fable 5 a precio de Sonnet. Construido bajo controles de exportación, por el laboratorio con la valoración más baja de la sala, y regalado el 27 de julio.
La pregunta interesante no es si K3 supera a Fable 5 en algún benchmark. Es qué sucede con la economía de los modelos cerrados de frontera cuando uno de pesos abiertos los iguala.
Enlaces
- Kimi K3: https://www.kimi.com
- Mi Telegram: https://t.me/kirillk_web3
- Mi Twitter/X: https://x.com/kirillk_web3
- Alojamiento asociado: https://ishosting.com/affiliate/NzE0MiM2
Sígueme para más información sobre Vibe Coding. ¡Gracias por leer!





