Esta fue mi primera entrevista con Yang Zhilin, realizada a principios de 2024 y publicada el 1 de marzo de 2024, exactamente el primer aniversario de la fundación de Kimi. En ese momento, Kimi solo tenía 80 personas, trabajando en su primera oficina, algo deteriorada. No había logotipo en la entrada. Solo un piano blanco hacía guardia junto a la puerta.
Este artículo generó bastante revuelo en la comunidad tecnológica china en ese momento.
En aquel entonces, yo todavía era periodista de prensa escrita, por lo que esta entrevista existe solo como texto y como podcast de audio.
Como podemos ver, muchas de las opiniones expresadas en este artículo se han confirmado desde entonces.
Solo con releer estas palabras de hace dos años, ¡no puedes evitar maravillarte de lo dramáticamente que ha cambiado el mundo!
(Esta traducción fue generada por Kimi K3).
Yang Zhilin: «Si todos piensan que eres normal —si tu sueño es uno que cualquiera podría tener— no añade nada a la suma total de los sueños de la humanidad.»
Por Zhang Xiaojun
Hace apenas un año, el científico de IA Yang Zhilin hizo un cálculo preciso en Silicon Valley. Se dio cuenta de que si decidía lanzar una startup de modelos fundacionales orientada a la AGI, necesitaría recaudar más de 100 millones de dólares en los próximos meses.
Sin embargo, eso era solo un billete para entrar al juego. Un año después, esa cifra se había multiplicado por trece.
Para las empresas de modelos fundacionales, la competencia es menos una contienda científica que, ante todo, una brutal contienda de dinero. Con los inversores apretando sus bolsillos, hay que adelantarse a los rivales en recaudar más dinero, comprar más GPU y captar más talento.
«Requiere una concentración de talento y una concentración de capital», dice Yang Zhilin, fundador y CEO de Moonshot AI, la empresa de modelos fundacionales establecida el 1 de marzo de 2023.
Durante el último año, las empresas chinas de modelos fundacionales han parecido vivir al borde de una tensa y estrecha supervivencia. En superficie, cada una tiene grandes sumas de efectivo. Pero, por un lado, deben invertir inmediatamente el dinero recién recaudado en una investigación extremadamente costosa para perseguir a OpenAI —primero alcanzar a GPT-3.5, y antes de llegar a GPT-4, llega Sora. Por otro lado, deben competir sin descanso para encontrar casos de uso viables en el mundo real, para validar que son empresas, no institutos de investigación que solo devoran capital. Y eso no es suficiente: para cada una de estas empresas, ya sea que la salida sea una OPI o una adquisición, el camino de salida sigue siendo cualquier cosa menos claro.
Entre los fundadores de las empresas chinas de modelos fundacionales, Yang Zhilin es el más joven, nacido en 1992. La industria lo describe como un firme creyente de la AGI y un fundador con un carisma técnico poco común. Gran parte de su trayectoria académica y profesional está vinculada a la IA de propósito general, y sus artículos han sido citados más de 22,000 veces.
A mediados de 2023, la comunidad tecnológica china pasó abruptamente de la euforia al desánimo con los modelos fundacionales, y acelerar la implementación en el mundo real se convirtió en la melodía mainstream pragmática. Esto inevitablemente dejó a los CEOs de modelos fundacionales desgarrados entre el ideal y la realidad. En un ecosistema de IA chino donde todos corean PMF (product/market fit) y todos corean comercialización, este fundador —formado como investigador de IA— no tiene ninguna prisa particular.
Con 80 personas, Moonshot AI tiene la menor plantilla entre las principales empresas chinas de modelos fundacionales. A diferencia de sus rivales, Yang no optó por el negocio B2B más seguro ni buscó implementación en sectores verticales como salud o juegos. Construyó uno —y solo uno— producto de consumo: el asistente de IA Kimi, que acepta entradas de hasta 200,000 caracteres chinos. Kimi es también el nombre inglés de Yang Zhilin.
Yang prefiere ver su empresa como un sistema que combina ciencia, ingeniería y negocio. Podrías imaginarlo así: sobre el mundo humano, está construyendo un banco de laboratorio de IA —con una mano realiza experimentos, y con la otra acerca la tecnología de punta al mundo real, descubriendo aplicaciones a través de la interacción con las personas y poniendo esas aplicaciones en manos de los consumidores. Idealmente, el primero quema miles de millones y decenas de miles de millones de dólares de capital; el segundo gana ese dinero cientos o miles de veces. Como sea que lo escuches, suena tan emocionante —y tan peligroso— como caminar sobre la cuerda floja.
«La IA no se trata de qué PMF pueda encontrar en el próximo año o dos; se trata de cómo cambiar el mundo en los próximos diez a veinte años», dice.
Un pensamiento tan abstracto e idealista pone nervioso a cualquiera en su nombre: ¿puede un joven científico de IA labrarse un espacio para sobrevivir en una China realista?
En febrero de 2024, Moonshot AI cerró una gran ronda de financiación en contra de la tendencia del mercado. Se sabe que la empresa recaudó una Serie B de más de mil millones de dólares con una valoración pre-money de 1.5 mil millones de dólares, liderada por Alibaba con participación posterior de Monolith Management, Xiaohongshu y otros. Al completarse el acuerdo, la valoración post-money de Moonshot AI se situó en aproximadamente 2.5 mil millones de dólares —lo que la convierte, en esta etapa, en el unicornio de mayor valoración en la carrera de modelos fundacionales de China. (La empresa se negó a responder o comentar sobre el asunto).
En medio de esta tercera ronda de financiación, nos sentamos con Yang Zhilin para hablar sobre su primer año de emprendimiento —una sección transversal, en miniatura, de un año en el que las empresas chinas de modelos fundacionales avanzaron desde la línea de salida.
Su empresa no se instaló en Sohu Network Plaza en Pekín, el centro donde se concentran las empresas de modelos fundacionales. Para una empresa con una financiación total de unos 9.000 millones de RMB, esta oficina en el edificio Liangzi Xinzuo parece rudimentaria y deteriorada. Ni siquiera hay un logotipo de la empresa en la entrada —solo un piano blanco haciendo guardia junto a la puerta.
La sala de reuniones está en una esquina; con sus pequeñas ventanas está oscura, y el calentador zumba mientras sopla aire caliente contra el frío invernal. En la tenue luz, Yang describe cómo le ha parecido el año pasado: «Es un poco como conducir por una carretera con una cadena de montañas nevadas extendiéndose adelante. No sabes lo que hay dentro. Solo sigues caminando hacia adelante, paso a paso.»
A continuación se presenta la entrevista completa con Yang Zhilin. (Para facilitar la lectura, el autor ha realizado algunas ediciones textuales).

Esta foto fue tomada a principios de 2024 en la primera oficina de Kimi en Pekín. Ya se han mudado de esta ubicación. No había logotipos en la entrada, solo un piano blanco permanecía en silencio junto a la puerta.
**
Parte 1
En el Principio
«Hay que Montar la Ola»
**
Zhang Xiaojun: ¿Cómo has estado últimamente?
Yang Zhilin: Ocupado, hay muchas cosas. Pero sigo emocionado. Estamos al principio de una industria y hay un enorme espacio para la imaginación.
Zhang Xiaojun: Cuando entré hace un momento, vi un piano blanco puro en la entrada de tu empresa.
Yang Zhilin: También hay un álbum de Pink Floyd sobre él. No tengo idea de quién los puso allí; los noté de repente hace un par de días y no he tenido oportunidad de preguntar. (Pink Floyd es la banda de rock británica que lanzó el álbum The Dark Side of the Moon).
Zhang Xiaojun: El día que se lanzó ChatGPT en noviembre de 2022, ¿qué estabas haciendo?
Yang Zhilin: Ya me estaba preparando para esto: reclutando gente, formando un equipo, intercambiando nuevas ideas. Ver ChatGPT fue emocionante. Tres a cinco años antes, incluso en 2021, habría sido inconcebible. Ese tipo de razonamiento de orden superior había sido muy difícil de lograr.
Sentí que muchas variables estaban a punto de cambiar en el mercado: el capital por un lado, el talento por el otro, los factores de producción centrales para la IA. Si esas variables se alineaban, sería posible construir una empresa adecuada para hacer esto, una organización construida para la AGI podría pasar de 0 a 1. Esa fue una gran revelación. Una empresa independiente tenía más sentido, pero no era algo que pudieras hacer en el momento que quisieras; ChatGPT agitó las variables y reunió los factores de producción. Hay que montar la ola.
Zhang Xiaojun: Después de que decidiste fundar una empresa de AGI, ¿qué preparativos hiciste? ¿Cómo reuniste los dos factores de producción, capital y talento?
Yang Zhilin: Fue un proceso sinuoso. ChatGPT tardó en difundirse. Algunos se enteraron temprano, otros tarde; algunos dudaron al principio, luego se sorprendieron, luego se convirtieron en creyentes. Encontrar personas y encontrar dinero estaban estrechamente ligados al momento.
Comenzamos a enfocarnos en nuestra primera ronda de financiación en febrero de 2023. Si nos hubiéramos retrasado hasta abril, básicamente no habríamos tenido oportunidad. Pero hacerlo en diciembre de 2022 o enero de 2023 tampoco habría funcionado, la pandemia todavía estaba activa y la gente aún no lo había procesado. Así que la ventana real fue solo de un mes.
Una noche en Estados Unidos, hice un cálculo preciso. Cuando terminé, concluí que necesitábamos recaudar al menos 100 millones de dólares en unos meses. Muchos en el mercado no habían comenzado a recaudar fondos todavía, y muchos no creían que se pudiera recaudar tanto. Pero resultó ser posible, incluso más que eso.
El mercado de talento también comenzó a moverse. Inspirados por ChatGPT, muchos tuvieron esta revelación en marzo o abril de 2023: esto es lo único que vale la pena hacer en la próxima década. Hay que contactar a las personas adecuadas en el momento adecuado. Un año o dos antes, el talento no se habría agrupado en este grado. En ese entonces, más personas estaban haciendo IA tradicional o negocios relacionados con la IA, nada de IA de propósito general.
Zhang Xiaojun: Para resumir: febrero fue la ventana para recaudar fondos, y marzo y abril fueron la ventana para contratar?
Yang Zhilin: Más o menos.
Zhang Xiaojun: Esa noche en EE. UU., ¿dónde estabas cuando hiciste las cuentas? ¿Cómo calculaste exactamente?
Yang Zhilin: Desde finales de 2022 hasta principios de 2023, pasé uno o dos meses en EE. UU., hablando con gente. Lo hice donde estaba viviendo. Calculas cuántos FLOPs necesitas, el costo de entrenamiento, inferencia y el número de usuarios.
Zhang Xiaojun: En ese momento, ¿cuál era el estado de ánimo predominante en Silicon Valley?
Yang Zhilin: El producto comenzó a atraer a muchos usuarios tempranos, concentrados en el círculo tecnológico. Nosotros mismos estábamos en ese círculo, así que lo sentimos más intensamente. En las grandes empresas de Silicon Valley, la gente tiene que escribir evaluaciones de desempeño cada seis meses, y muchos comenzaron a escribirlas con ChatGPT. Algunas personas cuya escritura normalmente no era muy profesional entregaron evaluaciones escritas con ChatGPT, y todos sonaban muy serios.
Había corrientes subterráneas agitándose. Mucha gente estaba pensando en su próximo trabajo o en fundar una empresa. Bastantes amigos que hablaron con nosotros luego se fueron a fundar startups. Y había un intenso FOMO, miedo a perderse algo. Nadie podía dormir. Ya fuera medianoche, la 1 a.m. o las 2 a.m., si contactabas, la gente siempre estaba allí. Un poco ansiosos, un poco con FOMO, y muy emocionados.
Zhang Xiaojun: La noche que calculaste que necesitabas recaudar 100 millones de dólares, ¿hasta qué hora te quedaste despierto?
Yang Zhilin: Estaba bien, el cálculo en sí no tomó mucho tiempo. Pero después, no podía decírselo a demasiada gente. Si lo hubiera hecho, nadie habría creído que se podía lograr.
Parte 2
Linaje Técnico
«Libérate del Tallado Infinito»
**
Zhang Xiaojun: Cuando el mundo del capital riesgo habla de ti, dicen: «El fundador es brillante, tiene carisma técnico y el equipo está lleno de estrellas técnicas». Así que antes de discutir tu empresa de modelos fundacionales, me gustaría empezar con tu formación académica. Estudiaste ciencias de la computación en Tsinghua como licenciatura y obtuviste tu doctorado en la Escuela de Ciencias de la Computación de Carnegie Mellon. ¿La IA ha sido siempre tu enfoque?
Yang Zhilin: Nací en 1992 y comencé mi licenciatura en 2011. Desde mi segundo año hasta ahora, más de una década, he estado en este campo. Al principio exploré de manera más divergente, mirando a todas partes; hice algunos trabajos relacionados con grafos y multimodalidad. En 2017, convergí en los modelos de lenguaje. En ese momento sentí que los modelos de lenguaje eran un problema relativamente importante; luego llegué a sentir que era el único problema importante.
Zhang Xiaojun: En 2017, ¿cómo entendía generalmente la industria de la IA los modelos de lenguaje, y cómo evolucionó ese entendimiento?
Yang Zhilin: En ese entonces era un modelo usado para clasificar resultados de reconocimiento de voz. (Risas.) Después de que se reconocía un segmento de voz, obtenías muchos resultados candidatos, y usabas el modelo de lenguaje para ver cuál tenía la mayor probabilidad y generar el más probable. Sus aplicaciones eran muy limitadas.
Pero te das cuenta de que es un problema fundamental, porque estás modelando las probabilidades del mundo. El lenguaje es limitado, pero es una proyección del mundo; en teoría, si haces que el espacio de tokens —el espacio de todos los tokens posibles— sea lo suficientemente grande, puedes construir un modelo mundial general. Cómo surge y se desarrolla todo en el mundo puede asignarse una probabilidad. Cada problema puede reducirse a cómo estimar probabilidades.
Zhang Xiaojun: Tus mentores académicos son muy destacados: tus asesores de doctorado fueron Ruslan Salakhutdinov, jefe de IA en Apple, y William W. Cohen, científico jefe de Google AI. Ambos se mueven entre la industria y la academia.
Yang Zhilin: En años anteriores, la industria y la academia se unían más, pero la tendencia ahora está cambiando: los avances más valiosos ocurrirán en la industria. Esa es una ley inevitable del desarrollo. Comienza con investigación exploratoria y gradualmente se desplaza hacia un proceso de industrialización más maduro. Eso no significa que la investigación sea innecesaria durante la industrialización, solo que la investigación pura tendrá dificultades para producir avances valiosos.
Zhang Xiaojun: ¿Qué aprendiste de estos renombrados mentores?
Yang Zhilin: Aprendí más en Google, donde hice prácticas durante mucho tiempo. Comencé a trabajar en modelos de lenguaje basados en Transformer a finales de 2018. Mi mayor aprendizaje fue liberarme del interminable "tallado" —el refinamiento obsesivo de detalles superficiales. Eso fue crucial.
Debes mirar cuál es la gran dirección, el gran gradiente. Cuando tienes diez caminos por delante, la persona promedio se preocupa por cómo frenar ante un peatón en un camino específico, detalles a corto plazo. Pero cuál de los diez caminos tomar es lo que más importa.
Este campo anteriormente tenía exactamente ese problema. Por ejemplo, en un conjunto de datos de solo uno o dos millones de tokens, buscabas cómo reducir la perplejidad, cómo reducir la pérdida, cómo mejorar la precisión, y caías en un tallado interminable. La gente inventó muchas arquitecturas extrañas; estos eran trucos de tallado. Después de tallar, podrías mejorar en ese tipo de conjunto de datos, pero te pierdes la esencia del problema.
La esencia es analizar qué le falta al campo. ¿Cuál es el primer principio? ¿Por qué la ley de escalado puede servir como primer principio? Solo necesitas encontrar una estructura que satisfaga dos condiciones: primero, que sea suficientemente general; segundo, que sea escalable. General significa que puedes modelar todos los problemas dentro de este marco; escalable significa que mientras inviertas suficiente cómputo, sigue mejorando.
Este es el pensamiento que aprendí en Google: si algo puede explicarse por algo más fundamental, no deberías tallar en exceso en las capas superiores. Hay una línea importante con la que estoy muy de acuerdo: si puedes resolver un problema con escala, no lo resuelvas con un nuevo algoritmo. El mayor valor de un nuevo algoritmo es cómo te permite escalar mejor. Cuando te liberas del tallado, puedes ver mucho más.
Zhang Xiaojun: ¿Era Google también seguidor de la ley de escalado en ese entonces? ¿Cómo implementaba el pensamiento de primeros principios?
Yang Zhilin: Muchas de esas ideas ya existían allí, pero Google no las implementó especialmente bien. Tenía esta forma de pensar, pero no podía organizarse en un verdadero proyecto ambicioso. Era más como: aquí hay cinco personas persiguiendo mis primeros principios, y allá cinco personas persiguiendo los suyos. No había nada de arriba hacia abajo.
Zhang Xiaojun: Durante tu doctorado, publicaste artículos en colaboración con los ganadores del Premio Turing Yann LeCun y Yoshua Bengio, y fuiste el primer autor en esos artículos. ¿Cómo surgieron esas colaboraciones? Quiero decir, son laureados con el Premio Turing y no eran tus asesores, ¿en qué te basaste para atraerlos?
Yang Zhilin: La academia es muy abierta. Siempre que tengas una buena idea y un problema significativo, está bien. Lo que producen dos cerebros, o n cerebros, es más que un solo cerebro. Esto también se aplica al desarrollar AGI. Una estrategia importante en IA se llama "ensamblaje" (ensembling): usar múltiples modelos o métodos diferentes y combinar sus predicciones para obtener un mejor rendimiento. Esencialmente es hacer lo mismo: cuando tienes puntos de vista diversos, puedes generar muchas cosas nuevas. La colaboración es enormemente beneficiosa.
Zhang Xiaojun: ¿Primero tenías una idea y luego les preguntabas si estaban interesados?
Yang Zhilin: Más o menos así fue.
Zhang Xiaojun: ¿Qué es más difícil: convencer a pesos pesados académicos en investigación, o convencer a pesos pesados del capital en la recaudación de fondos? ¿Cuáles son las similitudes?
Yang Zhilin: "Convencer" no es una buena frase; la esencia detrás de eso es la cooperación. Cooperación significa que ambas partes ganan, porque el beneficio mutuo es la condición previa para la cooperación. Así que en realidad no hay diferencia: debes ofrecer a otros un valor único.
Zhang Xiaojun: ¿Cómo te ganas su confianza? ¿Cuál crees que es tu don?
Yang Zhilin: No hay un don particular, solo trabajar duro.
Parte 3
El Viejo Sistema Ya No Funciona
«La AGI Necesita un Nuevo Tipo de Organización»
**
Zhang Xiaojun: Acabas de decir que "los avances más valiosos ocurrirán en la industria", ¿eso incluye las startups y los laboratorios de IA de los gigantes?
Yang Zhilin: Los laboratorios son historia. Google Brain solía ser el laboratorio de IA más grande de la industria, pero era una organización de investigación integrada dentro de una gran empresa. Ese tipo de organización puede explorar nuevas ideas, pero es muy difícil que produzca un gran sistema; podría producir el Transformer, pero no podría producir ChatGPT.
La forma en que ahora evoluciona el desarrollo es que estás construyendo un sistema enorme, que requiere nuevos algoritmos, ingeniería sólida, e incluso mucho trabajo de producto y comercialización. Es como a principios de los 2000: no podías investigar la recuperación de información en un laboratorio; tenía que vivir en el mundo real, como un gran sistema, un producto con usuarios —como Google. Así que los sistemas de investigación y educación cambiarán su función hacia la formación de talento principalmente.
Zhang Xiaojun: ¿Cómo describirías esta nueva forma de sistema? ¿Es OpenAI su prototipo?
Yang Zhilin: Es la organización más madura de este tipo hoy en día, y todavía está evolucionando gradualmente.
Zhang Xiaojun: Entonces, ¿se puede entender como una organización establecida para los grandes objetivos científicos de la humanidad?
Yang Zhilin: Quiero enfatizar: no es ciencia pura —es una combinación de ciencia, ingeniería y negocio. Tiene que ser una organización comercial, una empresa, no un instituto de investigación. Pero esta empresa se construye desde cero, porque la AGI necesita un nuevo tipo de organización. Primero, el modo de producción difiere de la era de internet; segundo, se desplaza de la investigación pura a una combinación de investigación, ingeniería, producto y negocio.
En su núcleo, debería ser un programa ambicioso, con una gran cantidad de planificación de arriba hacia abajo, pero dentro de esa planificación hay espacio para la innovación, porque no toda la tecnología está predeterminada. Existen elementos de abajo hacia arriba dentro de un marco de arriba hacia abajo. Ese tipo de organización no existía antes, pero la organización debe adaptarse a la tecnología, porque la tecnología determina el modo de producción; si no coinciden, no puedes producir eficazmente. Creemos que muy probablemente necesitará ser rediseñada desde cero.
Zhang Xiaojun: Durante el golpe de la sala de juntas de OpenAI el año pasado, una opción para Sam Altman era unirse a Microsoft y liderar un nuevo equipo de IA de Microsoft. ¿Cuál es la diferencia esencial entre eso y ser CEO de OpenAI?
Yang Zhilin: Tendrías que hacer crecer una nueva organización dentro de una cultura antigua, y eso es extremadamente difícil.
Zhang Xiaojun: Quieres construir "el OpenAI de China", ¿podemos decirlo así?
Yang Zhilin: No es del todo preciso. No queremos ser el algo de China, y no necesariamente queremos ser OpenAI.
Primero, la AGI real será definitivamente global. No existe, al menos a largo plazo, una empresa de AGI confinada a algún mercado regional debido a mecanismos de protección del mercado. La globalización, la AGI y tener un producto con una base de usuarios muy grande: estos tres son finalmente condiciones necesarias.
Segundo, ¿debería ser OpenAI? Si miras 2017-2018, OpenAI tenía una pésima reputación. Cuando la gente de nuestro círculo buscaba trabajo, generalmente consideraban lugares como Google. Muchas personas que hablaron con Ilya Sutskever, el científico jefe de OpenAI, pensaron que el hombre estaba loco y demasiado engreído; OpenAI era o locos o estafadores. Pero se comprometieron muy temprano, encontraron el no-consenso, y encontraron lo que ahora es el único primer principio que funciona en IA: escalar a través de la predicción del siguiente token.
Creo que habrá una empresa más grande que OpenAI. Una empresa verdaderamente grande puede combinar idealismo tecnológico con un gran producto, co-creando con sus usuarios; la AGI será finalmente algo producido por el trabajo conjunto con todos sus usuarios. Así que no se trata solo de tecnología; también requiere pragmatismo y búsquedas en el mundo real, finalmente una combinación perfecta de ambos.
Aun así, debemos aprender del idealismo tecnológico de OpenAI. Si todos piensan que eres normal —si tu sueño es uno que cualquiera podría tener— no añade nada a la suma total de los sueños de la humanidad.
Parte 4
El Primer Paso de Moonshot es el "Contexto Largo" — ¿Cuál es el Segundo?
«Se Acercan Dos Grandes Hitos»
**
Zhang Xiaojun: Volviendo al momento en que decidiste fundar la empresa, ¿lanzaste la primera ronda de financiación inmediatamente después de regresar a China?
Yang Zhilin: Comenzó en EE. UU. en febrero (del año pasado), parte de forma remota. Al final, los inversores nacionales constituyeron la mayoría.
Zhang Xiaojun: ¿La primera ronda recaudó 100 millones de dólares?
Yang Zhilin: La primera ronda no fue tanto; rondas posteriores superaron esa cifra. Completamos dos rondas en 2023, totalizando casi 2 mil millones de RMB.
Esta es ahora la tercera ronda. No hemos anunciado formalmente la financiación, así que no puedo comentar en este momento.
Zhang Xiaojun: Algunos dicen que desde la segunda mitad de 2023, nadie ha estado dispuesto a invertir en empresas de modelos fundacionales. ¿Están equivocados?
Yang Zhilin: Todavía hay. Puedes ver el cambio de sentimiento, pero no es que nadie invierta, al menos por ahora, hay bastante interés de inversión en el mercado.
Zhang Xiaojun: Además del capital y las personas, ¿qué otras decisiones clave tomaste en 2023?
Yang Zhilin: Decidir qué hacer. Esa es la ventaja de empresas como la nuestra: tener una visión técnica para las decisiones al más alto nivel.
Nosotros hacemos contexto largo. Eso requiere juicio sobre el futuro: necesitas saber qué es fundamental y hacia dónde se dirigen las cosas. Una vez más, son primeros principios: el proceso de "des-tallar". Si te enfocas en tallar, solo puedes mirar lo que OpenAI ya ha hecho y descubrir cómo reproducirlo.
Descubrirás que hacer compresión de texto largo sin pérdidas en Kimi le da al producto una experiencia única. Cuando lees artículos en inglés, te ayuda a entenderlos notablemente bien. Usando Claude o GPT-4 hoy, no necesariamente lo harás tan bien; esto requirió sentar las bases con anticipación. Trabajamos en ello durante más de medio año. Eso es muy diferente de detectar una tendencia de contexto largo hoy, reunir apresuradamente dos equipos y desarrollarlo a máxima velocidad.
Por supuesto, la maratón apenas comienza; llegará más diferenciación, y eso exige que anticipes de antemano qué cuenta como "un no consenso que se mantiene verdadero".
Zhang Xiaojun: ¿En qué mes se tomó esta decisión?
Yang Zhilin: Febrero o marzo; se decidió nada más fundar la empresa.
Zhang Xiaojun: ¿Por qué el contexto largo es el primer paso del moonshot?
Yang Zhilin: Porque es fundamental. Es la memoria del nuevo ordenador.
La memoria del viejo ordenador creció varios órdenes de magnitud en las últimas décadas, y lo mismo ocurrirá con el nuevo ordenador. Puede resolver muchos problemas actuales. Por ejemplo, las arquitecturas multimodales actuales aún necesitan un tokenizador, pero con un contexto largo comprimido sin pérdidas, no hace falta: puedes meter la entrada en bruto directamente. Llevado más lejos, es la base para hacer que el nuevo paradigma informático sea más general.
El viejo ordenador podía representarlo todo con ceros y unos; todo podía digitalizarse. Pero el nuevo ordenador de hoy aún no puede: no hay suficiente contexto, así que no es tan general. Para convertirse en un modelo mundial general, necesitas contexto largo.
Segundo, permite la personalización. El valor central de la IA es la interacción personalizada; el valor termina recayendo en la personalización, y la AGI será más personalizada que la generación anterior de motores de recomendación.
Pero la personalización no se logra mediante el ajuste fino (fine-tuning), sino mediante el soporte de un contexto muy largo. Todo tu historial con la máquina es contexto, y ese contexto define el proceso de personalización. No se puede replicar, y permite un diálogo más directo, un diálogo que genera información.
Zhang Xiaojun: ¿Cuánto margen hay para escalar esto?
Yang Zhilin: Enorme. Por un lado, expandir la ventana en sí misma aún tiene un largo camino por recorrer, varios órdenes de magnitud.
Por otro lado, no puedes solo expandir la ventana, y no puedes mirar solo el número; si la ventana es de unos pocos millones de tokens o varios miles de millones hoy, carece de sentido en sí mismo. Tienes que observar la capacidad de razonamiento que permite dentro de esa ventana, la fidelidad a la información original, y la capacidad de seguir instrucciones. No debes perseguir una sola métrica; tienes que combinar métricas con capacidades.
Si estas dos dimensiones siguen mejorando, se puede hacer muchísimo. Podría seguir una instrucción de decenas de miles de palabras, y la instrucción misma podría definir muchos agentes, altamente personalizados.
Zhang Xiaojun: ¿Las tecnologías detrás del contexto largo y la recuperación del terreno frente a GPT-4 son reutilizables entre sí? ¿Son lo mismo?
Yang Zhilin: No lo creo. Se trata más bien de añadir una nueva dimensión, una dimensión que GPT-4 no tiene.
Zhang Xiaojun: Mucha gente dice que las principales empresas chinas de modelos fundacionales están haciendo todas más o menos lo mismo: perseguir a GPT-3.5 en 2023, perseguir a GPT-4 en 2024. ¿Estás de acuerdo?
Yang Zhilin: Mejorar las capacidades generales ciertamente tiene hitos clave, así que esa afirmación es correcta hasta cierto punto: como recién llegado, inevitablemente pasas por un proceso de recuperación. Pero también es unilateral. Más allá de las capacidades generales, hay mucho espacio para desarrollar capacidades distintivas y alcanzar el estado del arte en ciertas direcciones. El contexto largo es una. La generación de imágenes de DALL-E 3 está completamente superada por Midjourney V6. Así que tienes que trabajar en ambos frentes.
Zhang Xiaojun: ¿Qué proporción de tiempo y recursos se dedica a las capacidades generales frente a las nuevas dimensiones?
Yang Zhilin: Tienen que combinarse. Una nueva dimensión no puede existir aparte de las capacidades generales, así que es difícil dar una proporción directa. Pero se requiere una inversión suficiente para hacer bien la nueva dimensión.
Zhang Xiaojun: ¿Todas estas nuevas dimensiones serán llevadas por Kimi?
Yang Zhilin: Kimi es ciertamente un producto muy importante para nosotros, y también tendremos algunos otros intentos.
Zhang Xiaojun: ¿Qué opinas del comentario de Li Guangmi, fundador de Shixiang, de que la diferenciación tecnológica de las empresas chinas de modelos fundacionales sigue siendo hoy bastante baja?
Yang Zhilin: Creo que está bien; ya hemos producido bastante diferenciación hoy. Es cuestión de tiempo; este año deberías ver más dimensiones. El año pasado, todo el mundo estaba poniendo el andamio y haciendo que las cosas funcionaran primero.
Zhang Xiaojun: Si el primer paso del moonshot es el contexto largo, ¿cuál es el segundo?
Yang Zhilin: Habrá dos grandes hitos por delante. Primero, un modelo mundial verdaderamente unificado, uno que unifique todas las modalidades diferentes, una arquitectura verdaderamente escalable y general.
Segundo, permitir que la IA siga evolucionando sin entrada de datos humanos.
Zhang Xiaojun: ¿Cuánto tiempo llevará alcanzar estos dos hitos?
Yang Zhilin: Dos o tres años, posiblemente más rápido.
Zhang Xiaojun: Así que dentro de tres años, ya estaremos mirando un mundo completamente diferente al de hoy.
Yang Zhilin: Al ritmo actual de desarrollo, sí. La tecnología está ahora en una etapa incipiente y de rápido crecimiento.
Zhang Xiaojun: ¿Puedes imaginar qué existirá dentro de tres años?
Yang Zhilin: Habrá un cierto grado de AGI. Muchas de las cosas que hacemos hoy, la IA también podrá hacerlas, incluso mejor que nosotros. Pero la clave es cómo la usamos.
Zhang Xiaojun: ¿Y para ti, para Moonshot AI como empresa, cuál es el segundo paso?
Yang Zhilin: Iremos a hacer esas dos cosas. Todos los problemas restantes se derivan de estos dos factores. El razonamiento y los agentes de los que la gente habla hoy son subproductos de resolver estos dos problemas. Se necesita un tallado adicional, pero no hay un obstáculo fundamental.
Zhang Xiaojun: ¿Te volcarás en recuperar el terreno frente a GPT-4?
Yang Zhilin: GPT-4 es una parada necesaria en el camino hacia la AGI. La clave es no conformarse con simplemente igualar a GPT-4. Primero, tienes que preguntarte cuál es el verdadero no consenso ahora: más allá de GPT-4, ¿qué viene después? ¿Cómo deberían ser GPT-5 y GPT-6? Segundo, tienes que ver qué capacidades distintivas tienes dentro de eso, y eso es lo que más importa.
Zhang Xiaojun: Otras empresas de modelos fundacionales publican sus





