Kimi K3 acaba de terminar con la era de las suscripciones de IA

@0xDominiqq
INGLÉShace 3 días · 18 jul 2026
275K
83
12
4
176

TL;DR

Kimi K3 de Moonshot AI presenta un modelo de pesos abiertos de 2.8 billones de parámetros con una ventana de contexto de un millón de tokens, aprovechando la arquitectura de mezcla de expertos (MoE) y mecanismos de atención innovadores para reducir costos y desafiar el dominio de las API cerradas.

El número del titular no es la historia

El 27 de julio, Moonshot AI publica los pesos completos de Kimi K3 bajo una licencia MIT modificada. La ficha técnica parece un alarde: 2,8 billones de parámetros, una ventana de contexto de un millón de tokens y el título del modelo de pesos abiertos más grande jamás lanzado, aproximadamente un 75% más grande que DeepSeek V4 Pro.

Pero el tamaño es un señuelo. La verdadera historia es un cambio en quién controla el acceso a la inteligencia de nivel fronterizo. Durante tres años, los mejores modelos vivieron detrás de una API. Pagabas un alquiler, el casero establecía las condiciones, y si el proveedor volvía a fijar el precio del endpoint o cambiaba silenciosamente el comportamiento del modelo, tu producto absorbía el daño.

Los pesos abiertos rompen ese acuerdo. Una vez que los archivos son públicos, ningún laboratorio puede recuperar la capacidad. Ese simple hecho cambia la economía para todos, incluyendo a las personas que nunca descargarán ni un solo fragmento.

La ficha técnica de un vistazo

Especificación

Valor

Parámetros

2,8 billones

Expertos

896 en total, 16 activos por token

Ventana de contexto

1.048.576 tokens

Licencia

MIT modificada

Publicación de pesos

27 de julio

Tamaño vs DeepSeek V4 Pro

~75% más grande

Eficiencia de escalado vs K2

~2,5x

Precio

Tarifa

Entrada (acierto de caché)

$0,30 / 1M tokens

Entrada (fallo de caché)

$3,00 / 1M tokens

Salida

$15,00 / 1M tokens

Cómo un modelo de 2,8T evita una factura de 2,8T

Un modelo denso de este tamaño sería inutilizable. Ejecutar cada parámetro en cada token es el muro contra el que chocan todos los modelos a escala de billones: demasiado lento, demasiado caro, sin forma de sortear la física.

K3 lo evita con un diseño agresivo de Mezcla de Expertos. Dentro del modelo viven 896 subredes especializadas. En cualquier token dado, solo 16 de ellas se activan. Obtienes el conocimiento almacenado de 2,8 billones de parámetros mientras pagas el costo de inferencia de un modelo de una fracción de ese tamaño.

Esto es dispersión, y K3 se apoya en ello más que cualquier modelo abierto antes. K2 demostró que el enfoque funcionaba. K3 lo convierte en la apuesta central.

Dominique - inline image

Dos artículos de investigación que hicieron el trabajo pesado

Dos cambios arquitectónicos hacen posible el resto, y ambos fueron publicados como investigación abierta antes de que el modelo se lanzara, lo que le dio credibilidad a Moonshot entre los investigadores antes de que apareciera un solo punto de referencia.

El primero es Kimi Delta Attention, un mecanismo de atención lineal híbrido. Los costos de atención estándar crecen de forma cuadrática a medida que el contexto se alarga, razón por la cual las ventanas de un millón de tokens suelen quedarse en las diapositivas de marketing. KDA escala de manera diferente, y esa diferencia es la única razón por la que existe una ventana de 1M a un precio que cualquiera pueda pagar.

El segundo son los Residuales de Atención, un reemplazo para las conexiones residuales estándar. Moonshot lo atribuye a las ganancias constantes de escalado, permitiéndoles construir modelos más profundos sin la degradación habitual. Según sus propios números, la combinación ofrece aproximadamente 2,5 veces la eficiencia de escalado de K2.

Lo que mata un millón de tokens

Dominique - inline image

La mayor parte de la infraestructura de recuperación en la IA de producción existe como una solución provisional. Fragmentación, incrustaciones, bases de datos vectoriales, tuberías RAG: todo ello compensa a los modelos que no pueden retener suficiente en la memoria de trabajo de una sola vez.

Un millón de tokens cambia el valor predeterminado. Un código base completo entra en un solo prompt. Un año de documentos internos. Cincuenta transcripciones de video. Todo se sienta en la atención simultáneamente, y el modelo razona a través de todo el corpus en lugar de unir fragmentos recuperados y esperar que las costuras aguanten.

La visión nativa amplía aún más la superficie de entrada. Capturas de pantalla, fotos de pizarras, diagramas de arquitectura y gráficos se pueden leer en el mismo contexto que el código y el texto que los rodea. No es casualidad que las victorias más fuertes de K3 en los puntos de referencia se produjeran en la codificación de front-end: el modelo ve el diseño y escribe la implementación dentro de una sola ventana de contexto.

La tabla de precios que importa más que los puntos de referencia

Las tarifas indicadas: $0,30 por millón de tokens de entrada en acierto de caché, $3,00 en fallo de caché, $15,00 por millón de tokens de salida, con un contexto de 1.048.576 tokens.

El número de caché es en el que hay que fijarse. Moonshot reporta tasas de acierto de caché superiores al 90% en sesiones largas de codificación. Piensa en lo que realmente hace un agente: relee el mismo repositorio una y otra vez durante horas. Sin almacenamiento en caché, paga el precio completo de entrada en cada pasada. Con él, el costo de una sesión larga se reduce aproximadamente 4 veces.

Los agentes de horizonte largo viven o mueren exactamente con estas matemáticas. K3 está construido para sesiones que duran horas con una supervisión mínima, navegando por un repositorio, orquestando herramientas de terminal, verificando su propio trabajo. La estructura de precios es el producto.

La trampa que nadie debería pasar por alto

K3 no tiene modo económico. El razonamiento está permanentemente activado y fijado al máximo. Evaluadores independientes lo vieron quemar más de 13.000 tokens de pensamiento en una solicitud de SVG trivial, aproximadamente $0,25 por una consulta desechable.

La lección es el enrutamiento. Las llamadas rápidas, baratas y de alto volumen pertenecen a modelos más pequeños. K3 gana su costo solo cuando el tamaño del contexto y la complejidad de la tarea justifican un razonamiento siempre activo. Usarlo como un endpoint de chat de propósito general es quemar dinero.

Conectarlo lleva cinco minutos

La API es compatible con OpenAI. Cambia la base_url y la clave, mantén tu código existente:

text
1from openai import OpenAI
2import os
3
4client = OpenAI(
5 api_key=os.environ["MOONSHOT_API_KEY"],
6 base_url="https://api.moonshot.ai/v1",
7)
8
9completion = client.chat.completions.create(
10 model="kimi-k3",
11 messages=[{"role": "user", "content": "Presenta a Kimi K3 en una frase."}],
12)
13print(completion.choices[0].message.content)

El razonamiento se configura a través de un campo de nivel superior, que actualmente solo acepta "max":

text
1completion = client.chat.completions.create(
2 model="kimi-k3",
3 reasoning_effort="max",
4 messages=[{"role": "user", "content": "Demuestra que la raíz cuadrada de 2 es irracional."}],
5)
6print(completion.choices[0].message.content)

El streaming funciona de manera estándar, con el razonamiento llegando en un campo delta separado para que puedas renderizar el pensamiento y la respuesta de forma independiente:

text
1stream = client.chat.completions.create(
2 model="kimi-k3",
3 messages=[{"role": "user", "content": "Explica por qué el cielo es azul."}],
4 stream=True,
5)
6
7for chunk in stream:
8 delta = chunk.choices[0].delta
9 reasoning = getattr(delta, "reasoning_content", None)
10 if reasoning:
11 print(reasoning, end="", flush=True)
12 if delta.content:
13 print(delta.content, end="", flush=True)

La entrada de visión toma imágenes codificadas en base64 junto con el texto en el mismo mensaje. Este es el flujo de trabajo de captura de pantalla a código en su totalidad:

text
1import base64
2from pathlib import Path
3
4image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()
5
6completion = client.chat.completions.create(
7 model="kimi-k3",
8 messages=[
9 {
10 "role": "user",
11 "content": [
12 {
13 "type": "image_url",
14 "image_url": {"url": f"data:image/png;base64,{image_data}"},
15 },
16 {"type": "text", "text": "Reconstruye esta página de aterrizaje en HTML y Tailwind."},
17 ],
18 }
19 ],
20)
21print(completion.choices[0].message.content)

Por qué esto llega a personas que nunca tocan los pesos

Aquí está la parte honesta: casi nadie alojará por sí mismo 2,8 billones de parámetros. Incluso con dispersión, la factura de hardware está muy por encima del rango de aficionados, y también más allá de la mayoría de las empresas.

Ese nunca fue el punto. Los pesos públicos ponen un techo a lo que los laboratorios cerrados pueden cobrar por una capacidad comparable. Los anfitriones de terceros competirán entre sí para servir a K3 con márgenes de commodity, la misma dinámica que se ha desarrollado con cada gran lanzamiento abierto anterior. Los precios en todo el mercado se desplazan hacia la línea base abierta.

El beneficio te llega a través de la factura del proveedor que ya uses, ya sea que descargues un archivo o no.

Un manual práctico

Aliméntalo con cosas completas. Repositorios enteros para revisión, carpetas de contratos completas, una biblioteca de contenido completa. Deja de fragmentar lo que ya no necesita fragmentación.

Ejecútalo durante mucho tiempo. Pon en cola sesiones de ingeniería de varias horas y revisa los resultados más tarde. El caché se come el costo de cada relectura.

Apunta una cámara a los problemas. Toma una captura de pantalla de una página de aterrizaje y pide la reconstrucción. Fotografía una pizarra y pide la implementación.

Mantén el tráfico trivial fuera de él. Un modelo que siempre razona al máximo es la herramienta equivocada para llamadas rápidas y de alto volumen. Enrútalas a otro lado y guarda a K3 para el trabajo que lo merece.

La cuenta atrás de diez días

Durante tres años, la frontera fue algo que alquilabas, en términos que no establecías, a precios que podían cambiar sin previo aviso.

El 27 de julio se convierte en un archivo. Y un archivo, a diferencia de una suscripción, es algo que posees.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales