Uma conversa com Yang Zhilin, da Kimi: Avançando em direção às montanhas nevadas infinitas e desconhecidas

@zhang_benita
CHINÊShá 2 dias · 19/07/2026
159K
249
25
13
248

TL;DR

O fundador da Moonshot AI, Yang Zhilin, discute a filosofia técnica por trás da Kimi, enfatizando o contexto longo como um caminho para a AGI e o futuro dos modelos de mundo unificados.

Esta foi minha primeira entrevista com Yang Zhilin, realizada no início de 2024 e publicada em 1º de março de 2024 — exatamente no primeiro aniversário da fundação da Kimi. Na época, a Kimi tinha apenas 80 pessoas, trabalhando em seu primeiro escritório, um tanto degradado. Não havia logotipo na entrada. Apenas um piano branco fazia guarda junto à porta.

Este artigo gerou uma considerável agitação na comunidade tecnológica chinesa na época.

Naquela época, eu ainda era jornalista impresso, então esta entrevista existe apenas como texto e um podcast de áudio.

Como podemos ver, muitas das opiniões expressas neste artigo foram confirmadas desde então.

Apenas reler estas palavras de dois anos atrás, você realmente não pode deixar de se maravilhar com o quão dramaticamente o mundo mudou!

(Esta tradução foi gerada pela Kimi K3.)

Yang Zhilin: "Se todos acham que você é normal — se o seu sonho é um que qualquer um poderia ter — isso não acrescenta nada à soma total dos sonhos da humanidade."

Por Zhang Xiaojun

Há apenas um ano, o cientista de IA Yang Zhilin fez um cálculo preciso no Vale do Silício. Ele percebeu que, se decidisse lançar uma startup de modelo de fundação visando a AGI, precisaria levantar mais de 100 milhões de dólares nos próximos meses.

No entanto, isso era apenas um bilhete de entrada para o jogo. Um ano depois, esse valor havia se multiplicado por treze.

Para empresas de modelo de fundação, a competição é menos uma disputa científica do que, antes de tudo, uma disputa brutal de dinheiro. Com os investidores segurando apertados os cordões da bolsa, você precisa ficar à frente dos seus rivais em angariar mais dinheiro, comprar mais GPUs e atrair mais talentos.

"Requer uma concentração de talentos e uma concentração de capital", diz Yang Zhilin, fundador e CEO da Moonshot AI, a empresa de modelo de fundação estabelecida em 1º de março de 2023.

No ano passado, as empresas chinesas de modelo de fundação pareciam viver em uma corda bamba tensa e constrita de sobrevivência. Na superfície, cada uma delas detém somas consideráveis de dinheiro. Mas, por um lado, elas devem imediatamente colocar o dinheiro recém-levantado em pesquisas extremamente caras para perseguir a OpenAI — primeiro alcançando o GPT-3.5, e antes mesmo de o GPT-4 ser alcançado, surge a Sora. Por outro lado, elas devem competir sem parar para encontrar casos de uso viáveis no mundo real, para validar para si mesmas que são empresas, não institutos de pesquisa que apenas devoram capital. E isso não é suficiente: para cada um desses empreendimentos, seja a saída um IPO ou uma aquisição, o caminho para sair permanece tudo menos claro.

Entre os fundadores das empresas de modelo de fundação da China, Yang Zhilin é o mais jovem, nascido em 1992. A indústria o descreve como um defensor ferrenho da AGI e um fundador com carisma técnico raro. Grande parte de seu currículo acadêmico e profissional está ligada à IA de propósito geral, e seus artigos foram citados mais de 22.000 vezes.

Em meados de 2023, a comunidade tecnológica chinesa mudou abruptamente da euforia para o frio em relação aos modelos de fundação, e acelerar a implementação no mundo real tornou-se a melodia mainstream pragmática. Isso inevitavelmente deixou os CEOs de modelo de fundação dilacerados violentamente entre o ideal e a realidade. Em um ecossistema de IA chinês onde todos cantam PMF (product/market fit) e todos cantam comercialização, este fundador — um pesquisador de IA de formação — não está com pressa particular.

Com 80 pessoas, a Moonshot AI tem o menor número de funcionários entre as principais empresas de modelo de fundação da China. Ao contrário de seus rivais, Yang não optou pelo negócio B2B mais seguro ou buscou implantação em verticais como saúde ou jogos. Ele construiu um — e apenas um — produto de consumo: o assistente de IA Kimi, que aceita entradas de até 200.000 caracteres chineses. Kimi também é o nome em inglês de Yang Zhilin.

Yang prefere ver sua empresa como um sistema que combina ciência, engenharia e negócios. Você pode imaginar assim: acima do mundo humano, ele está erguendo uma bancada de laboratório de IA — com uma mão ele realiza experimentos, e com a outra ele traz tecnologia de ponta para o mundo real, descobrindo aplicações através da interação com as pessoas e entregando essas aplicações nas mãos dos consumidores. Idealmente, o primeiro queima bilhões e dezenas de bilhões de dólares de capital; o último ganha esse dinheiro de volta centenas ou milhares de vezes. Não importa como você ouça, parece tão emocionante — e tão perigoso — quanto andar em uma corda bamba.

"IA não é sobre qual PMF posso encontrar no próximo ano ou dois; é sobre como mudar o mundo nos próximos dez a vinte anos", diz ele.

Um pensamento tão abstrato e idealista faz a gente suar nervosamente por ele: será que um jovem cientista de IA pode esculpir espaço para sobreviver em uma China realista?

Em fevereiro de 2024, a Moonshot AI fechou uma grande rodada de financiamento contra a maré do mercado. Sabe-se que a empresa levantou uma Série B de mais de 1 bilhão de dólares com uma avaliação pré-money de 1,5 bilhão de dólares, liderada pela Alibaba com participação adicional da Monolith Management, Xiaohongshu e outros. Após a conclusão do negócio, a avaliação pós-money da Moonshot AI era de aproximadamente 2,5 bilhões de dólares — tornando-a, nesta fase, o unicórnio de maior valor na corrida de modelo de fundação da China. (A empresa se recusou a responder ou comentar sobre o assunto.)

No meio desta terceira rodada de financiamento, nos sentamos com Yang Zhilin para conversar sobre seu primeiro ano de empreendedorismo — um corte transversal, em miniatura, de um ano em que as empresas chinesas de modelo de fundação correram à frente da linha de partida.

Sua empresa não se instalou na Sohu Network Plaza em Pequim, o centro onde as empresas de modelo de fundação se aglomeram. Para uma empresa com financiamento total de cerca de 9 bilhões de RMB, este escritório no edifício Liangzi Xinzuo parece rústico e degradado. Não há nem mesmo um logotipo da empresa na entrada — apenas um piano branco fazendo guarda junto à porta.

A sala de reunião fica em um canto; com suas pequenas janelas, é escura por dentro, e o aquecedor zumbe enquanto sopra ar quente contra o frio do inverno. Na luz fraca, Yang descreve como o ano passado foi para ele: "É um pouco como dirigir por uma estrada com uma série de montanhas nevadas se estendendo à frente. Você não sabe o que há dentro delas. Você apenas continua andando para frente, um passo de cada vez."

Abaixo está a entrevista completa com Yang Zhilin. (Para legibilidade, o autor fez algumas edições textuais.)

张小珺 Xiaojun Zhang - inline image

Esta foto foi tirada no início de 2024 no primeiro escritório da Kimi em Pequim. Eles já se mudaram deste local. Nenhum logotipo alinhava a entrada — apenas um piano branco ficava quieto junto à porta.

**

Parte 1

De Pé no Início

"Você Tem que Pegar a Onda"

**

Zhang Xiaojun: Como você tem passado ultimamente?

Yang Zhilin: Ocupado — há muita coisa acontecendo. Mas ainda estou animado. Estamos no início de uma indústria, e há um enorme espaço para imaginação.

Zhang Xiaojun: Quando entrei agora há pouco, vi um piano branco puro na entrada da sua empresa.

Yang Zhilin: Há também um álbum do Pink Floyd em cima dele. Não faço ideia de quem os colocou lá — notei-os de repente há alguns dias e não tive a chance de perguntar. (Pink Floyd é a banda de rock britânica que lançou o álbum The Dark Side of the Moon.)

Zhang Xiaojun: No dia em que o ChatGPT foi lançado, em novembro de 2022, o que você estava fazendo?

Yang Zhilin: Eu já estava me preparando para isso — recrutando pessoas, montando uma equipe, trocando novas ideias. Ver o ChatGPT foi emocionante. Três a cinco anos antes — mesmo em 2021 — teria sido inconcebível. Esse tipo de raciocínio de ordem superior era muito difícil de alcançar.

Senti que muitas variáveis estavam prestes a mudar no mercado: capital de um lado, talento do outro — os fatores centrais de produção para IA. Se essas variáveis se encaixassem, seria possível construir uma empresa adequada para fazer isso — uma organização construída para AGI poderia ir do 0 ao 1. Essa foi uma grande epifania. Uma empresa independente fazia mais sentido, mas não era algo que você pudesse fazer no momento em que quisesse; o ChatGPT chocou as variáveis e trouxe os fatores de produção juntos. Você tem que pegar a onda.

Zhang Xiaojun: Depois que você decidiu fundar uma empresa de AGI, que preparações você fez? Como você montou os dois fatores de produção — capital e talento?

Yang Zhilin: Foi um processo tortuoso. O ChatGPT levou tempo para se difundir. Algumas pessoas souberam dele cedo, outras tarde; algumas duvidaram no início, depois ficaram chocadas, depois se tornaram crentes. Encontrar pessoas e encontrar dinheiro estavam intimamente ligados ao timing.

Começamos a focar em nossa primeira rodada de financiamento em fevereiro de 2023. Se tivéssemos adiado para abril, basicamente não teríamos tido chance. Mas fazer em dezembro de 2022 ou janeiro de 2023 também não teria funcionado — a pandemia ainda estava em andamento, e as pessoas ainda não tinham processado isso. Então, a janela real foi de apenas um mês.

Uma noite nos Estados Unidos, fiz um cálculo preciso. Quando terminei, concluí que precisávamos levantar pelo menos 100 milhões de dólares em alguns meses. Muitos no mercado não tinham começado a captação de recursos ainda, e muitos não acreditavam que você pudesse necessariamente levantar tanto. Mas acabou sendo possível — até mais do que isso.

O mercado de talentos também começou a se mover. Inspiradas pelo ChatGPT, muitas pessoas tiveram essa percepção em março ou abril de 2023: esta é a única coisa que vale a pena fazer na próxima década. Você tem que alcançar as pessoas certas no momento certo. Um ou dois anos antes, o talento não teria se aglomerado a esse ponto. Naquela época, mais pessoas estavam fazendo IA tradicional ou negócios adjacentes à IA — nada disso era IA de propósito geral.

Zhang Xiaojun: Para resumir: fevereiro foi a janela para captação de recursos, e março e abril foram a janela para contratação?

Yang Zhilin: Mais ou menos.

Zhang Xiaojun: Naquela noite nos EUA — onde você estava quando fez essa conta? Como exatamente você calculou?

Yang Zhilin: Do final de 2022 ao início de 2023, passei um ou dois meses nos EUA, conversando com pessoas. Fiz isso onde estava morando. Você calcula quantos FLOPs precisa, o custo de treinamento, inferência e o número de usuários.

Zhang Xiaojun: Naquele momento, qual era o clima predominante no Vale do Silício?

Yang Zhilin: O produto começou a atrair muitos primeiros adotantes, concentrados no círculo tecnológico. Nós mesmos estávamos naquele círculo, então sentimos isso mais intensamente. Nas grandes empresas do Vale do Silício, as pessoas têm que escrever avaliações de desempenho a cada seis meses, e muitas começaram a escrevê-las com o ChatGPT. Algumas pessoas cuja escrita geralmente não era tão profissional entregaram avaliações escritas com o ChatGPT, e todos pareciam muito sérios.

Correntes subterrâneas estavam se agitando. Muitas pessoas estavam pensando em seu próximo emprego ou em abrir uma empresa. Muitos amigos que conversaram conosco depois foram fundar startups. E havia um intenso FOMO — medo de ficar de fora. Ninguém conseguia dormir. Seja meia-noite, 1h da manhã ou 2h da manhã, se você entrasse em contato, as pessoas estavam sempre lá. Um pouco ansiosos, um pouco com FOMO e muito animados.

Zhang Xiaojun: Na noite em que você calculou que precisava levantar 100 milhões de dólares — até que horas você ficou acordado?

Yang Zhilin: Foi tranquilo — o cálculo em si não demorou muito. Mas depois, eu não podia contar para muitas pessoas. Se tivesse contado, ninguém teria acreditado que era possível.

Parte 2

Linhagem Técnica

"Liberte-se do Entalhe Infinito"

Zhang Xiaojun: Quando o mundo do capital de risco fala de você, eles dizem: "O fundador é brilhante, tem carisma técnico, e a equipe está cheia de estrelas técnicas." Então, antes de discutirmos seu empreendimento de modelo de fundação, gostaria de começar com sua formação acadêmica. Você estudou ciência da computação na Tsinghua como graduação e fez seu doutorado na Escola de Ciência da Computação de Carnegie Mellon. A IA sempre foi seu foco?

Yang Zhilin: Nasci em 1992 e comecei minha graduação em 2011. Do meu segundo ano até agora — mais de uma década — estou neste campo. No começo, explorei de forma mais divergente, olhando ao redor por toda parte; fiz alguns trabalhos relacionados a grafos e multimodalidade. Em 2017, convergi para modelos de linguagem. Na época, senti que modelos de linguagem eram um problema relativamente importante; mais tarde, passei a sentir que era o único problema importante.

Zhang Xiaojun: Em 2017, como a indústria de IA geralmente entendia os modelos de linguagem, e como esse entendimento evoluiu?

Yang Zhilin: Naquela época, era um modelo usado para classificar resultados de reconhecimento de fala. (Risos.) Depois que um segmento de fala era reconhecido, você obtinha muitos resultados candidatos, e usava o modelo de linguagem para ver qual tinha a maior probabilidade e gerar o mais provável. Suas aplicações eram muito limitadas.

Mas você percebe que é um problema fundamental, porque você está modelando as probabilidades do mundo. A linguagem é limitada, mas é uma projeção do mundo; em teoria, se você tornar o espaço de tokens — o espaço de todos os tokens possíveis — grande o suficiente, pode construir um modelo de mundo geral. Como tudo no mundo surge e se desenvolve pode receber uma probabilidade. Todo problema pode ser reduzido a como estimar probabilidades.

Zhang Xiaojun: Seus mentores acadêmicos são muito proeminentes: seus orientadores de doutorado foram Ruslan Salakhutdinov, chefe de IA da Apple, e William W. Cohen, cientista-chefe do Google AI. Ambos transitam entre a indústria e a academia.

Yang Zhilin: Em anos anteriores, indústria e academia se uniam mais, mas a tendência agora está mudando: avanços mais valiosos ocorrerão na indústria. Essa é uma lei inevitável do desenvolvimento. Começa com pesquisa exploratória e gradualmente muda para um processo de industrialização mais maduro. Isso não significa que a pesquisa seja desnecessária durante a industrialização — apenas que a pesquisa pura terá dificuldade em produzir avanços valiosos.

Zhang Xiaojun: O que você aprendeu com esses renomados mentores?

Yang Zhilin: Aprendi mais no Google, onde estagiei por muito tempo. Comecei a trabalhar em modelos de linguagem baseados em Transformer no final de 2018. Meu maior aprendizado foi me libertar do "entalhe" infinito — o refinamento obsessivo de detalhes superficiais. Isso foi crucial.

Você deve olhar para qual é a grande direção, o grande gradiente. Quando dez estradas estão diante de você, a pessoa média se preocupa em como frear para um pedestre à frente nesta estrada específica — detalhes de curto prazo. Mas qual das dez estradas tomar é o que mais importa.

Este campo anteriormente tinha exatamente esse problema. Por exemplo, em um conjunto de dados de apenas um ou dois milhões de tokens, você olhava como reduzir a perplexidade, como reduzir a perda, como melhorar a precisão — e caía em um entalhe infinito. As pessoas inventaram muitas arquiteturas bizarras; estes eram truques de entalhe. Depois de entalhar, você poderia se sair melhor naquele tipo de conjunto de dados, mas perdia a essência do problema.

A essência é analisar o que está faltando no campo. Qual é o primeiro princípio? Por que a lei de escalonamento pode servir como um primeiro princípio? Você só precisa encontrar uma estrutura que satisfaça duas condições: primeiro, é suficientemente geral; segundo, é escalável. Geral significa que você pode modelar todos os problemas dentro desta estrutura; escalável significa que, desde que você despeje poder computacional suficiente, ela continua melhorando.

Este é o pensamento que aprendi no Google: se algo pode ser explicado por algo mais fundamental, você não deve "entalhar" excessivamente nas camadas superiores. Há uma linha importante com a qual concordo fortemente: se você pode resolver um problema com escala, não o resolva com um novo algoritmo. O maior valor de um novo algoritmo é como ele permite que você escale melhor. Quando você se liberta do entalhe, pode ver muito mais.

Zhang Xiaojun: O Google também era um seguidor da lei de escalonamento naquela época? Como ele implementou o pensamento de primeiros princípios?

Yang Zhilin: Muitas dessas ideias já existiam lá, mas o Google não as implementou especialmente bem. Tinha essa forma de pensar, mas não conseguia se organizar em um verdadeiro moonshot. Era mais como: aqui estão cinco pessoas perseguindo meus primeiros princípios, e ali cinco pessoas perseguindo os deles. Não havia nada de cima para baixo.

Zhang Xiaojun: Durante seu doutorado, você publicou artigos em colaboração com os vencedores do Prêmio Turing Yann LeCun e Yoshua Bengio — e você era o primeiro autor desses artigos. Como essas colaborações aconteceram? O que quero dizer é: eles são laureados com o Prêmio Turing e não eram seus orientadores — no que você se baseou para atraí-los?

Yang Zhilin: A academia é muito aberta. Contanto que você tenha uma boa ideia e um problema significativo, está tudo bem. O que dois cérebros — ou n cérebros — produzem é mais do que um cérebro sozinho. Isso se aplica também ao desenvolvimento de AGI. Uma estratégia importante em IA é chamada de "ensemble" — usar vários modelos ou métodos diferentes e combinar suas previsões para melhor desempenho. É essencialmente fazer a mesma coisa: quando você tem pontos de vista diversos, pode gerar muitas coisas novas. A colaboração é extremamente benéfica.

Zhang Xiaojun: Você teria primeiro uma ideia e depois perguntaria a eles se estavam interessados?

Yang Zhilin: Foi mais ou menos assim.

Zhang Xiaojun: O que é mais difícil: convencer pesos-pesados acadêmicos em pesquisa, ou convencer pesos-pesados do capital em captação de recursos? Quais são as semelhanças?

Yang Zhilin: "Convencer" não é uma boa palavra — a essência por trás disso é cooperação. Cooperação significa que ambos os lados ganham, porque o benefício mútuo é a pré-condição para a cooperação. Então, não há realmente diferença: você precisa oferecer aos outros valor único.

Zhang Xiaojun: Como você ganha a confiança deles? O que você acha que é seu dom?

Yang Zhilin: Não há dom particular — apenas trabalhar duro.

Parte 3

O Sistema Antigo Não Funciona Mais

"AGI Precisa de um Novo Tipo de Organização"

**

Zhang Xiaojun: Você acabou de dizer "avanços mais valiosos ocorrerão na indústria" — isso inclui startups e os laboratórios de IA dos gigantes?

Yang Zhilin: Laboratórios são coisa do passado. O Google Brain costumava ser o maior laboratório de IA na indústria, mas era uma organização de pesquisa embutida dentro de uma grande empresa. Esse tipo de organização pode explorar novas ideias, mas é muito difícil para ela produzir um grande sistema — poderia produzir o Transformer, mas não poderia produzir o ChatGPT.

A forma como o desenvolvimento agora evolui é que você está construindo um sistema enorme, que requer novos algoritmos, engenharia sólida e até mesmo muito trabalho de produto e comercialização. É como no início dos anos 2000: você não podia pesquisar recuperação de informação em um laboratório; tinha que viver no mundo real, como um grande sistema, um produto com usuários — como o Google. Portanto, os sistemas de pesquisa e educação mudarão sua função para cultivar principalmente talentos.

Zhang Xiaojun: Como você descreveria esta nova forma de sistema? A OpenAI é seu protótipo?

Yang Zhilin: É a organização mais madura deste tipo hoje, e ainda está evoluindo gradualmente.

Zhang Xiaojun: Então, pode ser entendida como uma organização estabelecida para os grandes objetivos científicos da humanidade?

Yang Zhilin: Quero enfatizar: não é ciência pura — é uma combinação de ciência, engenharia e negócios. Tem que ser uma organização comercial, uma empresa, não um instituto de pesquisa. Mas esta empresa é construída do zero ao um, porque a AGI precisa de um novo tipo de organização. Primeiro, o modo de produção difere da era da internet; segundo, muda da pesquisa pura para uma combinação de pesquisa, engenharia, produto e negócios.

Em seu núcleo, deve ser um programa moonshot, com uma grande quantidade de planejamento de cima para baixo — mas dentro desse planejamento há espaço para inovação, porque nem toda a tecnologia é predeterminada. Elementos de baixo para cima existem dentro de uma estrutura de cima para baixo. Tal organização não existia antes, mas a organização deve se adaptar à tecnologia, porque a tecnologia determina o modo de produção; se eles não combinam, você não pode produzir efetivamente. Acreditamos que muito provavelmente precisará ser redesenhada do zero.

Zhang Xiaojun: Durante o golpe no conselho da OpenAI no ano passado, uma opção para Sam Altman era se juntar à Microsoft e liderar uma nova equipe de IA da Microsoft. Qual é a diferença essencial entre isso e ser CEO da OpenAI?

Yang Zhilin: Você teria que cultivar uma nova organização dentro de uma cultura antiga — e isso é extremamente difícil.

Zhang Xiaojun: Você quer construir "a OpenAI da China" — podemos colocar dessa forma?

Yang Zhilin: Não é bem preciso. Não queremos ser a China de ninguém, e não queremos necessariamente ser a OpenAI.

Primeiro, a AGI real será definitivamente global. Não existe tal coisa — pelo menos não a longo prazo — como uma empresa de AGI confinada a algum mercado regional devido a mecanismos de proteção de mercado. Globalização, AGI e ter um produto com uma base de usuários muito grande: esses três são, em última análise, condições necessárias.

Segundo, deveria ser a OpenAI? Se você olhar para 2017-2018, a OpenAI tinha uma péssima reputação. Quando as pessoas do nosso círculo procuravam empregos, geralmente consideravam lugares como o Google. Muitas pessoas que conversaram com Ilya Sutskever, cientista-chefe da OpenAI, saíram pensando que o homem era louco e muito cheio de si — a OpenAI era de loucos ou vigaristas. Mas eles se comprometeram muito cedo, encontraram o não-consenso e encontraram o que é agora o único primeiro princípio que funciona em IA: escalonamento através da previsão do próximo token.

Acredito que haverá uma empresa maior que a OpenAI. Uma empresa verdadeiramente grande pode combinar idealismo tecnológico com um grande produto, cocriando com seus usuários — a AGI será, em última análise, algo produzido pelo trabalho conjunto com todos os seus usuários. Portanto, não é apenas sobre tecnologia; também requer pragmatismo e buscas no mundo real — em última análise, uma combinação perfeita dos dois.

Ainda assim, devemos aprender com o idealismo tecnológico da OpenAI. Se todos acham que você é normal — se o seu sonho é um que qualquer um poderia ter — isso não acrescenta nada à soma total dos sonhos da humanidade.

Parte 4

O Primeiro Passo do Moonshot é "Contexto Longo" — Qual é o Segundo?

"Dois Grandes Marcos Estão Por Vir"

**

Zhang Xiaojun: Voltando ao momento em que você decidiu abrir a empresa — você lançou a primeira rodada de financiamento imediatamente após retornar à China?

Yang Zhilin: Começou nos EUA em fevereiro (ano passado), parte dela remotamente. No final, os investidores domésticos constituíram a maioria.

Zhang Xiaojun: A primeira rodada levantou 100 milhões de dólares?

Yang Zhilin: A primeira rodada não foi tanto; rodadas posteriores excederam esse valor. Completamos duas rodadas em 2023, totalizando quase 2 bilhões de RMB.

Esta é agora a terceira rodada. Não anunciamos formalmente o financiamento, então não posso comentar neste momento.

Zhang Xiaojun: Algumas pessoas dizem que desde o segundo semestre de 2023, ninguém mais está disposto a investir em empresas de modelo de fundação. Elas estão erradas?

Yang Zhilin: Ainda há. Você pode realmente ver a mudança de sentimento, mas não é que ninguém está investindo — pelo menos por enquanto, há bastante interesse de investimento no mercado.

Zhang Xiaojun: Além de capital e pessoas, que outras decisões-chave você tomou em 2023?

Yang Zhilin: Decidir o que fazer. Essa é a vantagem de empresas como a nossa — ter uma visão técnica para decisões no nível mais alto.

Nós fazemos contexto longo. Isso requer julgamento sobre o futuro: você precisa saber o que é fundamental e para onde as coisas estão indo a seguir. Novamente, são primeiros princípios — o processo de "desentalhe". Se você focar no entalhe, só pode olhar para o que a OpenAI já fez e descobrir como reproduzir.

Você descobrirá que fazer compressão de texto longo sem perdas no Kimi dá ao produto uma experiência única. Quando você lê artigos em inglês, ele ajuda a compreendê-los notavelmente bem. Usando Claude ou GPT-4 hoje, você não necessariamente se sairá tão bem; isso exigiu preparar o terreno com antecedência. Trabalhamos nisso por mais de meio ano. Isso é muito diferente de identificar uma tendência de contexto longo hoje, montar apressadamente duas equipes e desenvolvê-lo na velocidade máxima.

Claro, a maratona apenas começou; mais diferenciação virá, e isso exige que você antecipe o que conta como "uma visão não consensual que se revela verdadeira".

Zhang Xiaojun: Em que mês essa decisão foi tomada?

Yang Zhilin: Fevereiro ou março — foi decidida assim que a empresa foi fundada.

Zhang Xiaojun: Por que o contexto longo é o primeiro passo do moonshot?

Yang Zhilin: Porque é fundamental. É a memória do novo computador.

A memória do computador antigo cresceu várias ordens de magnitude nas últimas décadas, e o mesmo acontecerá com o novo computador. Isso pode resolver muitos problemas atuais. Por exemplo, as arquiteturas multimodais atuais ainda precisam de um tokenizer, mas com um contexto longo comprimido sem perdas, você não precisa de um — você pode colocar a entrada bruta diretamente. Indo além, é a base para tornar o novo paradigma computacional mais geral.

O computador antigo podia representar tudo com 0s e 1s; tudo podia ser digitalizado. Mas o novo computador de hoje ainda não consegue — não há contexto suficiente, então não é tão geral. Para se tornar um modelo de mundo geral, você precisa de contexto longo.

Segundo, isso permite a personalização. O valor central da IA é a interação personalizada; o valor, em última análise, recai na personalização, e a AGI será mais personalizada do que a geração anterior de mecanismos de recomendação.

Mas a personalização não é alcançada através de fine-tuning — é alcançada suportando um contexto muito longo. Todo o seu histórico com a máquina é contexto, e esse contexto define o processo de personalização. Ele não pode ser replicado e possibilita um diálogo mais direto — um diálogo que gera informação.

Zhang Xiaojun: Quanto espaço há para escalar isso?

Yang Zhilin: Enorme. Por um lado, expandir a janela em si ainda tem um longo caminho a percorrer — várias ordens de magnitude.

Por outro lado, você não pode apenas expandir a janela, e não pode olhar apenas para o número; se a janela é de alguns milhões de tokens ou vários bilhões hoje é sem sentido em si. Você tem que olhar para a capacidade de raciocínio que ela permite dentro dessa janela, a fidelidade — fidelidade à informação original — e a capacidade de seguir instruções. Você não deve perseguir uma única métrica; você tem que combinar métricas com capacidades.

Se essas duas dimensões continuarem melhorando, você pode fazer muito. Poderia seguir uma instrução de dezenas de milhares de palavras, e a própria instrução poderia definir muitos agentes — altamente personalizados.

Zhang Xiaojun: As tecnologias por trás do contexto longo e de alcançar o GPT-4 são reutilizáveis entre si? São a mesma coisa?

Yang Zhilin: Acho que não. É mais sobre adicionar uma nova dimensão — uma dimensão que o GPT-4 não tem.

Zhang Xiaojun: Muitos dizem que as principais empresas chinesas de modelos de base estão todas fazendo aproximadamente a mesma coisa — perseguindo o GPT-3.5 em 2023, perseguindo o GPT-4 em 2024. Você concorda?

Yang Zhilin: Melhorar as capacidades gerais certamente tem marcos importantes, então essa afirmação está correta até certo ponto — como retardatário, você inevitavelmente passa por um processo de recuperação. Mas também é unilateral. Além das capacidades gerais, há muito espaço para desenvolver capacidades distintivas e alcançar o estado da arte em certas direções. Contexto longo é uma. A geração de imagens do DALL-E 3 é completamente superada pelo Midjourney V6. Então você tem que trabalhar em ambas as frentes.

Zhang Xiaojun: Qual proporção de tempo e recursos vai para capacidades gerais versus novas dimensões?

Yang Zhilin: Elas têm que ser combinadas. Uma nova dimensão não pode existir separada das capacidades gerais, então é difícil dar uma proporção direta. Mas é necessário investimento suficiente para fazer bem a nova dimensão.

Zhang Xiaojun: Todas essas novas dimensões serão carregadas pelo Kimi?

Yang Zhilin: Kimi é certamente um produto muito importante para nós, e também teremos algumas outras tentativas.

Zhang Xiaojun: O que você acha do comentário de Li Guangmi, fundador da Shixiang, de que a distintividade tecnológica das empresas chinesas de modelos de base ainda não é muito alta hoje?

Yang Zhilin: Acho que está tudo bem — já produzimos bastante diferenciação hoje. É uma questão de tempo; este ano você deve ver mais dimensões. No ano passado, todos estavam apenas montando o andaime e fazendo as coisas funcionarem primeiro.

Zhang Xiaojun: Se o primeiro passo do moonshot é o contexto longo, qual é o segundo?

Yang Zhilin: Haverá dois grandes marcos pela frente. Primeiro, um modelo de mundo verdadeiramente unificado — um que unifique todas as diferentes modalidades, uma arquitetura verdadeiramente escalável e geral.

Segundo, permitir que a IA continue evoluindo sem a entrada de dados humanos.

Zhang Xiaojun: Quanto tempo levará para atingir esses dois marcos?

Yang Zhilin: Dois a três anos — possivelmente mais rápido.

Zhang Xiaojun: Então, daqui a três anos, já estaremos olhando para um mundo completamente diferente do de hoje.

Yang Zhilin: No ritmo atual de desenvolvimento, sim. A tecnologia está agora em um estágio de brotamento, de crescimento rápido.

Zhang Xiaojun: Você consegue imaginar o que existirá daqui a três anos?

Yang Zhilin: Haverá um certo grau de AGI. Muitas das coisas que fazemos hoje, a IA também será capaz de fazer — até melhor do que nós. Mas a chave é como a usamos.

Zhang Xiaojun: E para você — para a Moonshot AI como empresa — qual é o segundo passo?

Yang Zhilin: Nós vamos fazer essas duas coisas. Todos os problemas restantes são derivados desses dois fatores. O raciocínio e os agentes de que as pessoas falam hoje são subprodutos da resolução desses dois problemas. É necessária alguma escultura adicional, mas não há nenhum bloqueio fundamental.

Zhang Xiaojun: Você vai se dedicar totalmente a alcançar o GPT-4?

Yang Zhilin: GPT-4 é uma parada necessária no caminho para a AGI. O segredo é não se contentar em apenas igualar o GPT-4. Primeiro, você tem que perguntar qual é o verdadeiro não consenso agora: além do GPT-4, o que vem a seguir? Como o GPT-5 e o GPT-6 deveriam ser? Segundo, você tem que ver quais capacidades distintivas você tem dentro disso — e isso importa mais.

Zhang Xiaojun: Outras empresas de modelos de base publicam seus

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais