Análisis de Kimi K3: Jóvenes de pueblos pequeños frente a los capitalistas de la IA

@0xcherry
CHINOhace 2 días · 19 jul 2026
159K
308
49
23
289

TL;DR

Kimi K3 marca un cambio hacia el escalado masivo (2.8T de parámetros) para competir con los modelos estadounidenses de primer nivel. Al liberar los pesos, crea una competencia asimétrica que socava los modelos de negocio de alto margen de los laboratorios de código cerrado.

**

车厘子 - inline image

Los Tres Carros de la IA China

Durante mucho tiempo, los modelos de IA chinos han seguido aproximadamente tres caminos.

El primer camino es reducir intencionalmente el tamaño. Algunos ejemplos son minimax-m3, Kimi K2.5 e hy3, que limitan activamente los parámetros activados a alrededor de 20B. Si 20B es realmente "pequeño" es una cuestión sutil, pero en términos de ingeniería, generalmente lo consideramos así.

Los parámetros activados más pequeños suelen ser una restricción económica dura. Maximizar el rendimiento dentro de estas limitaciones es una mentalidad típica de "modelo pequeño".

El segundo camino es DeepSeek, y los fabricantes con pilas técnicas y tamaños similares que surgieron después. La característica distintiva de la ruta de DeepSeek no es solo ser completamente de código abierto, sino más importante aún, que DeepSeek-V3/R1 fueron modelos a gran escala desde el principio, comparándose con los modelos de primer nivel de OpenAI.

Con la explosión de popularidad de R1, DeepSeek añadió una vasta pila técnica centrada en la eficiencia económica. Por lo tanto, la ruta de DeepSeek se caracteriza por "alto rendimiento mientras se asegura la economía de inferencia". GLM-5 es un sucesor y practicante sistemático de este camino, siendo GLM-5.2 uno de sus resultados más conocidos.

El tercer camino es Kimi. La pila técnica de Kimi siempre ha sido independiente y está distantemente relacionada con DeepSeek. Mientras que la serie K2.5 a K2.7 absorbió significativamente la pila técnica de DeepSeek, la nueva serie K3 ha vuelto a su tecnología propietaria.

K3 ha llevado los parámetros totales a 2.8T, con parámetros activados estimados en 50B, utilizando tecnología completamente propia. La ley de escala del tamaño ha surtido efecto, pero también ha hecho que la eficiencia económica de Kimi K3 disminuya significativamente, entrando en el rango de precios de Claude Sonnet.

Aunque sigue siendo muy barato en comparación con Claude, los clústeres de inferencia de Kimi están ubicados dentro de China. Dadas las limitaciones en la cantidad de GPU, Kimi probablemente no priorizó la economía al construir K3.

En otras palabras, K3 es el producto de una pila técnica independiente, un tamaño masivo y una búsqueda decidida de alto rendimiento.

A diferencia de los modelos en la ruta de DeepSeek que equilibran rendimiento y economía, el objetivo de K3 desde el principio no fue hacer un mejor R1, sino compararse con los modelos de vanguardia y ultra grandes de OpenAI y Anthropic.

¿Por qué es K3 tan Grande?

Describir a Kimi como una ruta técnica independiente nunca relacionada con DeepSeek no es del todo exacto.

El artículo de Kimi K2 lo dejó claro: K2 utilizó una arquitectura MoE ultra dispersa y MLA similar a DeepSeek-V3. Ambos tienen 61 capas y expertos compartidos, activando cada token 8 expertos enrutados. K2 mejoró esta base aumentando el número de expertos a 384, reduciendo a la mitad las cabezas de atención, y utilizando MuonClip, recetas de datos, entrenamiento posterior agéntico e infraestructura independiente de desarrollo propio para crear su propia bifurcación.

Por lo tanto, K2 era más como una rama de Kimi sobre un chasis estilo DeepSeek-V3 que una especie diferente desde cero.

Lo que es realmente digno de mención es que el tamaño base de K2.5 a K2.7 no continuó expandiéndose: los parámetros totales se mantuvieron alrededor de 1T, los parámetros activados alrededor de 32B, todavía con 8 expertos seleccionados de 384.

En otras palabras, Kimi demostró que podía exprimir muchas generaciones del mismo chasis utilizando entrenamiento posterior y sistemas agénticos sin expandir la base.

Pero K3 es diferente. K3 no es solo una actualización de versión rutinaria. Marca la decisión activa de Kimi de poner fin a la fase de "continuar el entrenamiento posterior en una base existente" y volver a la expansión de escala del preentrenamiento.

车厘子 - inline image

K3 utiliza en gran medida tecnologías propietarias previamente dispersas, como su propia base de entrenamiento, mecanismo de atención y estructura de enrutamiento de expertos. En esta etapa, el parentesco de K3 con DeepSeek se ha vuelto bastante distante.

K3 pretende demostrar dos cosas: primero, que Kimi puede definir su propio paradigma técnico; segundo, que Kimi está calificado para usar nueva tecnología y entrenar modelos completamente nuevos y ultra grandes que compitan con OpenAI y Anthropic.

Como resultado, K3 tuvo éxito.

Del Servicio Público al Monopolio Privilegiado

Antes de DeepSeek, China no carecía de modelos utilizables, pero apenas eran funcionales.

La aparición de DeepSeek trajo por primera vez un modelo de alto rendimiento disponible en China, convirtiéndose en un servicio público para una generación de IA china. La misión principal de un servicio público es la Adopción: ¿cómo promover capacidades "buenas" a gran escala, especialmente en una base de inferencia que no es precisamente abundante?

Por lo tanto, el papel de DeepSeek no fue solo un avance en el rendimiento, sino también una gran responsabilidad en la optimización económica.

De V3 a V4, DeepSeek ha mantenido precios de API casi benéficos, respaldados por una pila técnica madura orientada a la optimización de la inferencia.

En esta etapa, el problema que enfrentaba la IA china era: primero, satisfacer las necesidades de rendimiento del servicio público, luego reducir los costos de cómputo de ese servicio.

Para los fabricantes chinos distintos de DeepSeek, la tarea se volvió repentinamente doble: primero, el rendimiento debía alcanzar a R1, o el modelo no tenía una posición competitiva; segundo, el precio, el rendimiento y la eficiencia de implementación debían acercarse lo más posible a DeepSeek, o la adopción simplemente no ocurriría.

La transición gradual de la pila de GLM es el microcosmos más claro de esta presión industrial.

En este sentido, DeepSeek llevó a los modelos chinos a la fase de Adopción. La pregunta central de esta fase es: ¿cómo permitir que más personas usen inteligencia suficientemente fuerte y cómo manejar la explosión resultante en el volumen de llamadas?

Pero un laboratorio fronterizo debe eventualmente responder otra pregunta: si solo buscas ser una versión más barata de otros, ¿de dónde vendrán los modelos de mayor rendimiento?

Todas las grandes empresas de internet tomaron una decisión: encontrar formas de eludir las prohibiciones e importar de EE. UU. Por ejemplo, la famosa entidad de Alibaba en Singapur permitía a los usuarios ejecutar Claude Code mediante inicio de sesión remoto en máquinas de Singapur.

Luego fueron bloqueados. Si el Tío Sam no hubiera asestado rápidamente el golpe 5.6-Sol, Dario podría haber publicado algunos artículos más pisoteando a los chinos.

A través de una extensa optimización de ingeniería, China ha realizado gradualmente la base para el servicio público de la IA. Pero sin modelos fronterizos más grandes y de mayor rendimiento, siempre estará un paso atrás, cayendo en una desventajosa "competencia privilegiada" a largo plazo.

La Danza de la Espada de Xiang Zhuang: Apuntando Más Allá de la Superficie

El 2.8T de K3 es la respuesta de Moonshot a este problema.

K2.5 a K2.7 aún pueden entenderse como una mejora de la relación costo-rendimiento en una base de 1T-A32B a través de preentrenamiento continuo, RL, entornos de herramientas y sistemas agénticos.

K3, sin embargo, lleva la capacidad total directamente a 2.8T, aceptando requisitos de implementación de más de 64 tarjetas de aceleración y elevando los precios de API de $0.95/$4 de K2.7 Code a $3/$15. Aunque este precio solo es comparable a Sonnet, sigue siendo muy caro.

La clave son las 64 tarjetas de aceleración. ¿Dónde vas a encontrar tantos nodos de 64 tarjetas en los clústeres de inferencia de China?

K3 podría aún esperar mantener la economía, pero eso es casi imposible para K3. Un modelo gigante de 2.8T es una gran prueba incluso para las empresas de inferencia estadounidenses. Por lo tanto, la intención de K3 claramente no es la adopción generalizada, sino abrir un estándar de modelo que pueda ser ampliamente adoptado en los campos de batalla más avanzados.

En comparación con la mayoría de los comunicados de prensa que afirman aplastar a los modelos estadounidenses, el lenguaje oficial de Kimi es más moderado: K3 en general todavía está por detrás de Fable 5 y GPT-5.6 Sol.

Por supuesto, desde otra perspectiva, es muy agresivo: solo está ligeramente por detrás de los modelos de primer nivel de OpenAI y Anthropic.

Una vez que entra en este grupo, K3 primero desestabiliza la narrativa comercial más importante de Anthropic del año pasado.

La Historia del Movimiento Perpetuo de Anthropic

La metodología de Anthropic siempre ha sido clara: creamos un modelo irreemplazable, y una vez que los usuarios descubren que puede completar tareas que otros modelos no pueden, estarán dispuestos a pagar una prima por un mayor rendimiento.

Fable 5 es el producto más extremo de esta metodología. Se dirige al trabajo de conocimiento más difícil, la codificación y las tareas asíncronas complejas que pueden durar días, con precios de API que alcanzan los $10 por millón de tokens de entrada y $50 por millón de tokens de salida, el doble del precio regular de Opus 4.8.

Anthropic no está vendiendo tokens más caros; está vendiendo un nuevo intervalo de tareas: proyectos que antes no podían completarse de manera estable ahora pueden ser manejados por Fable. En estos escenarios, Fable tiene un valor irreemplazable.

Mientras exista esta irreemplazabilidad, la prima de precio es perfectamente razonable. Después de todo, los modelos de alto rendimiento reemplazan la mano de obra de alto conocimiento, y el salario de esta última es mucho más caro que el modelo.

Después del lanzamiento de Fable, el mercado formó brevemente una ilusión de que OpenAI ya no podía alcanzar a Anthropic. La proyección súper alcista de SemiAnalysis incluso estimó que el ARR de Anthropic podría alcanzar los $300 mil millones para finales de 2027, con un valor empresarial de $6 billones a un múltiplo de ARR de 20x.

Esta predicción se basaba en un conjunto de suposiciones: API representando el 75%–85% de los ingresos, altos márgenes brutos de API, retención de ingresos netos extremadamente alta y penetración continua de Claude Code.

Parado en el momento del 18 de julio, parecía que SemiAnalysis estaba alucinando. Pero el 8 de julio, muchos lo encontraron bastante plausible.

La realidad organizó una línea de tiempo altamente dramática para esta narrativa. La proyección de valoración de $6 billones se difundió ampliamente el 8 de julio, y GPT-5.6 Sol se lanzó oficialmente el 9 de julio.

La historia del movimiento perpetuo de Anthropic duró menos de un mes antes de ser derrocada. Durante ese tiempo, también se lanzaron algunos artículos criticando la destilación de los modelos chinos.

¿Quién Mató a Cock Robin?

Después del lanzamiento de GLM-5.2, escribí un análisis sistemático de su significado, que fue aclamado por el público como una "obra maestra".

Considerando que Zhipu nunca me ha pagado por promoción, sigo siendo un investigador independiente (risas).

Sin embargo, GLM-5.2 efectivamente sacudió los cimientos de Anthropic; la gente simplemente no se dio cuenta de la gravedad de la situación en ese momento.

GLM-5.2 funciona mejor que Opus 4.8 en la mayoría de las tareas, solo superado por Opus 4.7. Leíste bien: mejor que 4.8 mientras que solo superado por 4.7, lo que hace preguntarse cuánta agua diluyó Anthropic en 4.8.

Mientras tanto, el precio de GLM-5.2 es solo una quinta parte del de Opus, y no sufre los problemas de limitación de velocidad de los planes de suscripción de Anthropic. La aparición de GLM-5.2 ya ha amenazado significativamente el ancla de precios del segmento de modelos principales de Anthropic.

Como resultado, el mercado esperaba valorar a Anthropic por "modelos más avanzados", lo que llevó a la predicción de valoración de $6 billones de SemiAnalysis.

Inmediatamente después, Sol chocó de frente con Fable en el nivel de capacidad más alto. Anthropic posteriormente extendió los límites de suscripción de Fable varias veces y finalmente anunció que se convertiría en un beneficio permanente para los planes Max y Team Premium.

车厘子 - inline image

Luego salió K3. Su capacidad integral está por detrás de Fable y Sol, y solo por detrás de Fable y Sol. Mientras tanto, K3 es de código abierto, y cualquier clúster de inferencia puede implementarlo.

Niños, los modelos de IA avanzada realmente crecen en los campos.

Competencia Asimétrica

En el pasado, la lógica de los controles de chips de computación avanzada de EE. UU. sobre China era directa: ralentizar el entrenamiento de modelos fronterizos de China y la construcción de un ecosistema de semiconductores independiente limitando la potencia de cómputo upstream. La seguridad nacional, los usos militares y de vigilancia eran las razones legales públicas, mientras que mantener el liderazgo de EE. UU. en tecnologías clave era un objetivo industrial concurrente.

Por supuesto, el problema más grande era que los propios chips avanzados de EE. UU. no eran suficientes. EE. UU. no solo estaba preocupado de que China obtuviera potencia de cómputo, sino que tampoco quería que las empresas chinas participaran en las licitaciones, desplazando la capacidad de compra de tarjetas de los laboratorios y centros de datos estadounidenses.

Estos controles ciertamente aumentaron la dificultad para que China entrenara modelos fronterizos, pero también crearon un sutil efecto contrario: privaron a las empresas de IA chinas de la capacidad de obtener ganancias excesivas, mientras que simultáneamente convirtieron esta desventaja en un arma en el juego.

Ya que no me dejas obtener ganancias excesivas y no quiero que mi tecnología sea bloqueada, simplemente la regalaré una vez que la haga.

Y los modelos de código abierto no son exigentes con las tarjetas gráficas. Las tarjetas chinas pueden implementarlos, y los clústeres de cómputo de EE. UU. también. Fireworks, TogetherAI y un montón de NeoClouds tienen muchas GPU.

Por lo tanto, ha surgido una combinación altamente abstracta en la competencia de IA entre EE. UU. y China:

Modelos Chinos + Clústeres de Inferencia de EE. UU. y Globales vs Laboratorios de IA de Código Cerrado de EE. UU.

Los laboratorios chinos asumen el costoso I+D de modelos, intercambiando pesos abiertos por adopción y estatus fronterizo; los proveedores de nube y plataformas de inferencia de EE. UU. utilizan GPU locales para manejar las llamadas, fijando precios basados en el costo y obteniendo grandes ganancias.

Los que realmente pierden ganancias son los laboratorios fronterizos de EE. UU. que dependen de pesos cerrados y escasez de capacidad para cobrar precios premium.

Para los laboratorios chinos, sacrificar pesos abiertos significa perder la posible renta de API que ya estaba limitada por su propia capacidad de inferencia.

Para los laboratorios cerrados de EE. UU., lo que se sacrifica es la ganancia excesiva real construida sobre la abundante potencia de cómputo local y la escasez global de capacidad.

Por lo tanto, EE. UU. enfrenta no una simple elección de "continuar las sanciones o abrir las ventas", sino una trinidad imposible:

  • Sancionar a China, y China continuará lanzando modelos de código abierto, por lo que nadie gana dinero.
  • Dejar que China compre tarjetas, y la licitación colectiva podría dejar a los laboratorios locales sin tarjetas.
  • Dar a China algunas tarjetas de manera adecuada para lograr un compromiso, pero ¿cuántas son adecuadas? Nadie lo sabe y nadie se atreve a hablar.

Esto es una competencia asimétrica típica. A Washington le encanta hablar de competencia asimétrica; ahora el término ha vuelto para perseguir a Washington.

¡Lealtad a Micron!

Llevando esta cadena un paso más arriba, toca toda la narrativa de CapEx de IA.

En el pasado, los altos márgenes brutos de inferencia de los modelos fronterizos de código cerrado eran el amortiguador más importante para la cadena de CapEx de IA. Mientras las capacidades del modelo fueran escasas, las API y suscripciones podían mantener precios altos; los laboratorios y proveedores de nube obtenían altos márgenes brutos, lo que les permitía tolerar GPU más caras, una depreciación más rápida e inversiones más agresivas en centros de datos; el upstream continuaría expandiendo la producción y manteniendo precios altos.

Esta cadena se puede escribir simplemente como:

Escasez de Capacidad del Modelo → Precios Altos de API → Altos Márgenes Brutos Downstream → Capacidad de Soportar Primas de GPU → Expansión de CapEx → Prosperidad Continua Upstream.

Cuando múltiples plataformas pueden implementar el mismo peso, los precios de inferencia pasan de "cuánto está dispuesto a cobrar el laboratorio fronterizo" a "cuánto le cuesta a un clúster eficiente ejecutar una tarea exitosa".

Los pesos abiertos no cambian el hecho de que la potencia de cómputo cuesta dinero; eliminan el "impuesto del modelo" adjunto al consumo de cómputo. Fireworks no tiene que soportar los costos de preentrenamiento de K3 para Moonshot, ni tiene que pagar una renta completa del modelo a un modelo de código cerrado upstream por cada token.

Todavía tiene que soportar los costos de GPU, motores de inferencia, cuantización, almacenamiento en caché, redes, financiamiento, SLA y ventas empresariales, pero solo necesita cotizar en función de los costos de cómputo reales, la utilización, los costos de servicio y el beneficio competitivo. Esta es una lógica típica de fijación de precios basada en costos, y para una industria dependiente de la prosperidad, la fijación de precios basada en costos tiene un impacto desastroso en el upstream.

Esto cambiará inversamente el cálculo de retorno de capital para cada GPU.

En el pasado, los proveedores de servicios podían poner los costos de hardware caros en las API de modelos de alto precio y trasladarlos a los clientes finales.

Cuando las plataformas de inferencia compiten en torno a los mismos pesos abiertos, se vuelve más difícil para cualquiera de ellas continuar trasladando esta prima. Por lo tanto, la adquisición de GPU requiere una mayor utilización, períodos de recuperación más cortos, costos de financiamiento más bajos y contratos de clientes más seguros.

A corto plazo, los compradores downstream más dispersos no debilitarán el poder de negociación de los productores de cómputo (especialmente NVDA). Pero a largo plazo, la disminución sistémica de los márgenes brutos downstream inevitablemente conducirá a una peor elasticidad de negociación para el upstream, lo cual es un riesgo incontrolable y enorme para toda la narrativa de CapEx de IA.

Demasiado Grande para Fracasar

En este punto, el 2.8T de K3 ha revelado dos significados aparentemente contradictorios.

Por un lado, K3 no es un modelo muy económico, llevando los modelos al rango de precios de Sonnet y al grupo de implementación de 64+ tarjetas.

Por otro lado, es precisamente este "no priorizar la economía" lo que califica a K3 para entrar en el grupo de mayor capacidad, desestabilizar la renta del modelo de Anthropic, reestructurar las ganancias de inferencia entre EE. UU. y China, e influir en la narrativa de CapEx de IA.

En el pasado, a muchas empresas les gustaba hablar de lado del borde, tamaños pequeños y "suficientemente bueno". Estas rutas son ciertamente importantes; determinan hasta dónde puede extenderse la inteligencia existente a dispositivos, usuarios e industrias.

Pero el término "suficientemente bueno" es muy aburrido; solo se aplica a mercados donde los límites de capacidad ya están fijos.

La IA fronteriza nunca se enfrenta a un conjunto fijo de tareas: un modelo que hoy acaba de aprender la programación de un solo archivo mañana tendrá que manejar bases de código completas; uno que acaba de aprender la llamada a herramientas tendrá que trabajar continuamente durante horas o incluso días en la próxima generación.

Los modelos de tamaño moderado responden a "cómo ser utilizados por más personas", mientras que los modelos más grandes compiten por "quién tiene el derecho de entregar el oráculo".

Un modelo que ya es fuerte pero caro puede luego hacerse más rápido y más barato a través de escasez, cuantización, almacenamiento en caché, destilación e ingeniería de inferencia; también puede servir como modelo maestro para toda una línea de modelos pequeños.

Un modelo pequeño que no aprendió una determinada capacidad desde el principio, sin embargo, es difícil de complementar de la nada a través de pensamiento extendido u optimización de implementación.

Esta asimetría hace que "hacerse grande para no perder" sea una metodología fronteriza cruda pero a menudo efectiva.

En 2024, OpenAI lanzó o1, cambiando el enfoque de la escala de bases de preentrenamiento más grandes al aprendizaje por refuerzo en tiempo de entrenamiento y al cómputo de pensamiento en tiempo de prueba.

o1 en sí mismo es un modelo de inferencia más pequeño. Demostró que "base más pequeña + más pensamiento" puede crear un progreso asombroso en matemáticas, código y razonamiento formal, iniciando así un ciclo de hacer los parámetros más pequeños.

Cuanto más pequeña es la base, más depende de la compensación de cómputo en tiempo de prueba; cuanto más exitosos son los trucos de inferencia, menos motivación tiene la organización para expandir la base. En consecuencia, los modelos de OpenAI comenzaron a deteriorarse rápidamente.

En 2025, Anthropic fue por el camino opuesto. Anthropic insistió en hacer modelos más grandes y caros, y luego usó Claude Code para convertir las capacidades en productos.

La lealtad del usuario a Claude no es porque sea barato, sino porque en las tareas de ingeniería de software del mundo real más difíciles, se sienten más seguros al darle el trabajo a Opus. A finales de 2025, Anthropic afirmó que Claude Code ocupaba más de la mitad del mercado de codificación de IA, con su participación en el mercado empresarial aumentando del 24% al 40%. Los ingresos también superaron a los de OpenAI.

OpenAI posteriormente se dio cuenta de que la eficiencia de inferencia y el enrutamiento no pueden reemplazar la base de mayor capacidad. GPT-5 restableció una escalera completa de main, thinking, mini y Pro; para GPT-5.6, estableció claramente tres tamaños de modelo—Sol, Terra y Luna—y puso a Sol, a gran escala, de vuelta en la posición insignia para el trabajo más difícil.

Como resultado, los usuarios de Codex superaron rápidamente los 10 millones, obligando a Anthropic a agregar Fable de nuevo a sus planes de suscripción.

Ahora, se lanza K3, solo superado por Sol y Fable, incluso provocando discusiones sobre si la IA fronteriza de EE. UU. todavía está a la altura.

Cuando realmente estás dispuesto a competir por el primer lugar, el resultado generalmente no es demasiado malo. Esto es Demasiado Grande para Fracasar.

Conclusión: Jóvenes de Pueblo Golpeando a Capitalistas

Las empresas de modelos de IA chinas a menudo son descritas como jóvenes de pueblo: recursos limitados, mala ubicación, una reputación internacional aún peor, y afortunadas si sus GPU pueden sostener la inferencia, y mucho menos el entrenamiento, siempre y cuando no se queden atrás.

Mientras tanto, los laboratorios de IA avanzada de EE. UU. tienen un aire capitalista: discutiendo antropología y seguridad, discutiendo máquinas benevolentes, discutiendo si el mundo futuro pertenece a la libertad o la no libertad, si la IA pertenece a la tierra o al cielo.

Bajo una brecha tan dramática, una obra donde los jóvenes de pueblo golpean a los capitalistas puede realmente escenificarse. No importa cómo lo mires, es suficiente para hacer reír a cualquiera.

—En realidad, no hay que apresurarse. Lo mejor está por venir.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales