Uma conversa com Yang Zhilin, da Kimi: Avançando em direção às montanhas nevadas infinitas e desconhecidas

@zhang_benita
CHINÊShá 2 dias · 19 de jul. de 2026
159K
249
25
13
248

TL;DR

O fundador da Moonshot AI, Yang Zhilin, discute a filosofia técnica por trás da Kimi, enfatizando o contexto longo como um caminho para a AGI e o futuro dos modelos de mundo unificados.

Esta foi minha primeira entrevista com Yang Zhilin, realizada no início de 2024 e publicada em 1º de março de 2024 — exatamente no primeiro aniversário da fundação da Kimi. Na época, a Kimi tinha apenas 80 pessoas, trabalhando em seu primeiro escritório, um pouco degradado. Não havia logotipo na entrada. Apenas um piano branco montava guarda ao lado da porta.

Este artigo gerou bastante repercussão na comunidade tech da China na época.

Naquela época, eu ainda era jornalista impresso, então esta entrevista existe apenas como texto e um podcast de áudio.

Como podemos ver, muitas das opiniões expressas neste artigo foram corroboradas desde então.

Reler estas palavras de dois anos atrás realmente nos faz admirar o quanto o mundo mudou dramaticamente!

(Esta tradução foi gerada por Kimi K3.)

Yang Zhilin: "Se todo mundo acha que você é normal — se seu sonho é um sonho que qualquer um poderia ter — isso não acrescenta nada à soma total dos sonhos da humanidade."

Por Zhang Xiaojun

Há apenas um ano, o cientista de IA Yang Zhilin fez um cálculo preciso no Vale do Silício. Ele percebeu que, se decidisse lançar uma startup de modelos de fundação visando a AGI, precisaria levantar mais de 100 milhões de dólares nos próximos meses.

No entanto, isso era apenas um bilhete de entrada para o jogo. Um ano depois, esse valor havia se multiplicado em treze vezes.

Para empresas de modelos de fundação, a competição é menos um concurso científico e, acima de tudo, uma disputa brutal de dinheiro. Com os investidores apertando os cordões da bolsa, você tem que ficar à frente dos seus rivais em arrecadar mais dinheiro, comprar mais GPUs e atrair mais talentos.

"Isso requer uma concentração de talentos e uma concentração de capital", diz Yang Zhilin, fundador e CEO da Moonshot AI, a empresa de modelos de fundação estabelecida em 1º de março de 2023.

No ano passado, as empresas chinesas de modelos de fundação pareciam viver em uma corda bamba tensa e apertada de sobrevivência. Na superfície, cada uma delas detém quantias vultosas de dinheiro. Mas, por um lado, elas devem imediatamente investir o dinheiro recém-captado em pesquisas extremamente caras para perseguir a OpenAI — primeiro alcançando o GPT-3.5, e antes mesmo de chegar ao GPT-4, surge o Sora. Por outro lado, elas devem correr sem parar para encontrar casos de uso viáveis no mundo real, para validar para si mesmas que são empresas, e não institutos de pesquisa que apenas devoram capital. E isso não é suficiente: para cada um desses empreendimentos, seja a saída um IPO ou uma aquisição, o caminho permanece obscuro.

Entre os fundadores das empresas chinesas de modelos de fundação, Yang Zhilin é o mais jovem, nascido em 1992. A indústria o descreve como um crente ferrenho na AGI e um fundador com carisma técnico raro. Grande parte de seu currículo acadêmico e profissional está ligada à IA de uso geral, e seus artigos foram citados mais de 22.000 vezes.

Em meados de 2023, a comunidade tech da China passou abruptamente da euforia ao gelo em relação aos modelos de fundação, e acelerar a implementação no mundo real tornou-se a melodia mainstream pragmática. Isso inevitavelmente deixou os CEOs de modelos de fundação dilacerados entre o ideal e a realidade. Em um ecossistema de IA chinês onde todos cantam PMF (product/market fit) e todos cantam comercialização, este fundador — um pesquisador de IA de formação — não está com pressa.

Com 80 pessoas, a Moonshot AI tem o menor número de funcionários entre as principais empresas chinesas de modelos de fundação. Diferente de seus concorrentes, Yang não optou pelo negócio B2B mais seguro ou buscou implementação em verticais como saúde ou jogos. Ele construiu um — e apenas um — produto de consumo: o assistente de IA Kimi, que aceita entradas de até 200.000 caracteres chineses. Kimi também é o nome em inglês de Yang Zhilin.

Yang prefere ver sua empresa como um sistema que combina ciência, engenharia e negócios. Você pode imaginar assim: acima do mundo humano, ele está erguendo uma bancada de laboratório de IA — com uma mão ele realiza experimentos, e com a outra ele traz tecnologia de ponta para o mundo real, descobrindo aplicações através da interação com as pessoas e entregando essas aplicações nas mãos dos consumidores. Idealmente, o primeiro queima bilhões e dezenas de bilhões de dólares de capital; o segundo ganha esse dinheiro de volta centenas ou milhares de vezes. Por mais que você ouça, parece tão emocionante — e tão perigoso — quanto andar na corda bamba.

"IA não é sobre qual PMF posso encontrar no próximo ano ou dois; é sobre como mudar o mundo nos próximos dez a vinte anos", diz ele.

Esse pensamento abstrato e idealista faz a gente suar nervoso por ele: será que um jovem cientista de IA pode abrir espaço para sobreviver em uma China realista?

Em fevereiro de 2024, a Moonshot AI fechou uma grande rodada de financiamento contra a maré do mercado. Sabe-se que a empresa levantou uma Série B de mais de 1 bilhão de dólares com uma avaliação pré-money de 1,5 bilhão de dólares, liderada pela Alibaba com participação subsequente da Monolith Management, Xiaohongshu e outros. Após a conclusão do negócio, a avaliação pós-money da Moonshot AI era de aproximadamente 2,5 bilhões de dólares — tornando-a, nesta fase, o unicórnio de maior valor na corrida chinesa de modelos de fundação. (A empresa se recusou a responder ou comentar sobre o assunto.)

No meio desta terceira rodada de financiamento, conversamos com Yang Zhilin sobre seu primeiro ano de empreendedorismo — um corte transversal, em miniatura, de um ano em que as empresas chinesas de modelos de fundação correram desde a linha de partida.

Sua empresa não se instalou na Sohu Network Plaza em Pequim, o centro onde as empresas de modelos de fundação se aglomeram. Para uma empresa com financiamento total de cerca de 9 bilhões de RMB, este escritório no edifício Liangzi Xinzuo parece rústico e degradado. Não há nem mesmo um logotipo da empresa na entrada — apenas um piano branco montando guarda ao lado da porta.

A sala de reuniões fica em um canto; com suas janelas pequenas, é escura por dentro, e o aquecedor zumbe enquanto sopra ar quente contra o frio do inverno. Na luz fraca, Yang descreve como o ano passado foi para ele: "É um pouco como dirigir por uma estrada com uma série de montanhas nevadas se estendendo à frente. Você não sabe o que há dentro delas. Você apenas continua andando para frente, um passo de cada vez."

Abaixo está a entrevista completa com Yang Zhilin. (Para facilitar a leitura, o autor fez algumas edições textuais.)

张小珺 Xiaojun Zhang - inline image

Esta foto foi tirada no início de 2024 no primeiro escritório da Kimi em Pequim. Eles já se mudaram deste local. Nenhum logotipo alinhava a entrada — apenas um piano branco ficava quieto ao lado da porta.

**

Parte 1

No Começo

"Você Tem Que Pegar a Onda"

**

Zhang Xiaojun: Como você tem passado ultimamente?

Yang Zhilin: Ocupado — tem muita coisa acontecendo. Mas ainda estou animado. Estamos no começo de uma indústria, e há um espaço enorme para imaginação.

Zhang Xiaojun: Quando entrei agora, vi um piano branco puro na entrada da sua empresa.

Yang Zhilin: Tem um álbum do Pink Floyd em cima dele também. Não faço ideia de quem os colocou lá — notei de repente alguns dias atrás e não tive chance de perguntar. (Pink Floyd é a banda de rock britânica que lançou o álbum The Dark Side of the Moon.)

Zhang Xiaojun: No dia em que o ChatGPT foi lançado, em novembro de 2022, o que você estava fazendo?

Yang Zhilin: Eu já estava me preparando para isso — recrutando pessoas, montando uma equipe, trocando novas ideias. Ver o ChatGPT foi emocionante. Três a cinco anos antes — mesmo em 2021 — teria sido inconcebível. Esse tipo de raciocínio de ordem superior era muito difícil de alcançar.

Senti que muitas variáveis estavam prestes a mudar no mercado: capital de um lado, talento do outro — os fatores centrais de produção para IA. Se essas variáveis se encaixassem, se tornaria possível construir uma empresa adequada para fazer isso — uma organização construída para AGI poderia ir do 0 ao 1. Essa foi uma grande epifania. Uma empresa independente fazia mais sentido, mas não era algo que você pudesse fazer no momento em que quisesse; o ChatGPT abalou as variáveis e juntou os fatores de produção. Você tem que pegar a onda.

Zhang Xiaojun: Depois que decidiu fundar uma empresa de AGI, quais preparativos você fez? Como você reuniu os dois fatores de produção — capital e talento?

Yang Zhilin: Foi um processo tortuoso. O ChatGPT levou tempo para se difundir. Algumas pessoas souberam dele cedo, outras tarde; algumas duvidaram no início, depois ficaram chocadas, depois se tornaram crentes. Encontrar pessoas e encontrar dinheiro estavam fortemente ligados ao timing.

Começamos a focar em nossa primeira rodada de financiamento em fevereiro de 2023. Se tivéssemos adiado para abril, basicamente não teríamos tido chance. Mas fazer em dezembro de 2022 ou janeiro de 2023 também não teria funcionado — a pandemia ainda estava em andamento, e as pessoas ainda não tinham processado isso. Então a janela real foi de apenas um mês.

Uma noite nos Estados Unidos, fiz um cálculo preciso. Quando terminei, concluí que precisávamos levantar pelo menos 100 milhões de dólares em alguns meses. Muitos no mercado não tinham começado a captar recursos ainda, e muitos não acreditavam que você pudesse necessariamente levantar essa quantia. Mas acabou sendo possível — até mais do que isso.

O mercado de talentos também começou a se mover. Inspiradas pelo ChatGPT, muitas pessoas tiveram essa percepção em março ou abril de 2023: esta é a única coisa que vale a pena fazer na próxima década. Você tem que alcançar as pessoas certas no momento certo. Um ou dois anos antes, o talento não teria se aglomerado nesse grau. Naquela época, mais pessoas estavam fazendo IA tradicional ou negócios adjacentes à IA — nada disso era IA de uso geral.

Zhang Xiaojun: Resumindo: fevereiro foi a janela para captação de recursos, e março e abril foram a janela para contratação?

Yang Zhilin: Mais ou menos isso.

Zhang Xiaojun: Naquela noite nos EUA — onde você estava quando fez essa conta? Como exatamente você calculou?

Yang Zhilin: Do final de 2022 até o início de 2023, passei um ou dois meses nos EUA, conversando com pessoas. Fiz isso onde eu estava morando. Você calcula quantos FLOPs precisa, o custo de treinamento, inferência e o número de usuários.

Zhang Xiaojun: Naquele momento, qual era o clima predominante no Vale do Silício?

Yang Zhilin: O produto começou a atrair muitos primeiros usuários, concentrados no círculo tech. Nós mesmos estávamos nesse círculo, então sentimos isso mais intensamente. Nas grandes empresas do Vale do Silício, as pessoas têm que escrever avaliações de desempenho a cada seis meses, e muitas começaram a escrevê-las com o ChatGPT. Algumas pessoas cuja escrita geralmente não era tão profissional entregaram avaliações escritas com o ChatGPT, e todos soavam muito sérios.

Correntes subterrâneas estavam se agitando. Muitas pessoas estavam pensando em seu próximo emprego ou em abrir uma empresa. Vários amigos que conversaram conosco depois foram fundar startups. E havia um intenso FOMO — medo de ficar de fora. Ninguém conseguia dormir. Fosse meia-noite, 1h da manhã ou 2h da manhã, se você contactasse alguém, as pessoas estavam sempre lá. Um pouco ansiosas, um pouco com FOMO e muito animadas.

Zhang Xiaojun: A noite em que você calculou que precisava levantar 100 milhões de dólares — até que horas você ficou acordado?

Yang Zhilin: Foi de boa — o cálculo em si não demorou muito. Mas depois, não pude contar para muitas pessoas. Se eu tivesse contado, ninguém teria acreditado que era possível.

Parte 2

Linhagem Técnica

"Liberte-se do Entalhe Infinito"

Zhang Xiaojun: Quando o mundo do capital de risco fala sobre você, eles dizem: "O fundador é brilhante, tem carisma técnico e a equipe está cheia de estrelas técnicas." Então, antes de discutirmos seu empreendimento de modelo de fundação, gostaria de começar com sua formação acadêmica. Você estudou ciência da computação na Tsinghua como graduação e fez seu doutorado na Escola de Ciência da Computação da Carnegie Mellon. A IA sempre foi seu foco?

Yang Zhilin: Nasci em 1992 e comecei minha graduação em 2011. Do segundo ano até agora — mais de uma década — estou neste campo. No começo, explorei de forma mais divergente, olhando ao redor; fiz alguns trabalhos relacionados a grafos e multimodalidade. Em 2017, convergi para modelos de linguagem. Na época, senti que modelos de linguagem eram um problema relativamente importante; depois, passei a sentir que era o único problema importante.

Zhang Xiaojun: Em 2017, como a indústria de IA geralmente entendia os modelos de linguagem, e como essa compreensão evoluiu?

Yang Zhilin: Naquela época, era um modelo usado para classificar resultados de reconhecimento de fala. (Risos.) Após um segmento de fala ser reconhecido, você obtinha muitos resultados candidatos e usava o modelo de linguagem para ver qual tinha a maior probabilidade e gerar o mais provável. Suas aplicações eram muito limitadas.

Mas você percebe que é um problema fundamental, porque você está modelando as probabilidades do mundo. A linguagem é limitada, mas é uma projeção do mundo; em teoria, se você tornar o espaço de tokens — o espaço de todos os tokens possíveis — grande o suficiente, pode construir um modelo de mundo geral. Como tudo no mundo surge e se desenvolve pode receber uma probabilidade. Todo problema pode ser reduzido a como estimar probabilidades.

Zhang Xiaojun: Seus orientadores acadêmicos são muito proeminentes: seus orientadores de doutorado foram Ruslan Salakhutdinov, chefe de IA da Apple, e William W. Cohen, cientista-chefe do Google AI. Ambos transitam entre indústria e academia.

Yang Zhilin: Em anos anteriores, a indústria e a academia se uniam mais, mas a tendência agora está mudando: avanços mais valiosos acontecerão na indústria. Essa é uma lei inevitável do desenvolvimento. Começa com pesquisa exploratória e gradualmente se desloca para um processo de industrialização mais maduro. Isso não significa que a pesquisa seja desnecessária durante a industrialização — apenas que a pesquisa pura terá dificuldade em produzir avanços valiosos.

Zhang Xiaojun: O que você aprendeu com esses renomados orientadores?

Yang Zhilin: Aprendi mais no Google, onde estagiei por muito tempo. Comecei a trabalhar em modelos de linguagem baseados em Transformer no final de 2018. Meu maior aprendizado foi me libertar do "entalhe" infinito — o refinamento obsessivo de detalhes superficiais. Isso foi crucial.

Você deve olhar para qual é a grande direção, o grande gradiente. Quando dez estradas estão diante de você, a pessoa média se preocupa em como frear para um pedestre à frente nesta estrada — detalhes de curto prazo. Mas qual das dez estradas pegar é o que mais importa.

Este campo tinha exatamente esse problema anteriormente. Por exemplo, em um conjunto de dados de apenas um ou dois milhões de tokens, você olhava como reduzir a perplexidade, como reduzir a perda, como melhorar a precisão — e caía em um entalhe infinito. As pessoas inventaram muitas arquiteturas bizarras; estes eram truques de entalhe. Depois de entalhar, você poderia se sair melhor naquele tipo de conjunto de dados, mas perdia a essência do problema.

A essência é analisar o que está faltando no campo. Qual é o primeiro princípio? Por que a lei de escala pode servir como um primeiro princípio? Você só precisa encontrar uma estrutura que satisfaça duas condições: primeiro, ela é suficientemente geral; segundo, ela é escalável. Geral significa que você pode modelar todos os problemas dentro desta estrutura; escalável significa que, desde que você despeje poder computacional suficiente, ela continua melhorando.

Este é o pensamento que aprendi no Google: se algo pode ser explicado por algo mais fundamental, você não deve entalhar excessivamente nas camadas superiores. Há uma linha importante com a qual concordo fortemente: se você pode resolver um problema com escala, não o resolva com um novo algoritmo. O maior valor de um novo algoritmo é como ele permite que você escale melhor. Quando você se liberta do entalhe, pode ver muito mais.

Zhang Xiaojun: O Google também era um seguidor da lei de escala naquela época? Como ele implementou o pensamento de primeiros princípios?

Yang Zhilin: Muitas dessas ideias já existiam lá, mas o Google não as implementou especialmente bem. Tinha essa forma de pensar, mas não conseguia se organizar em um verdadeiro moonshot. Era mais como: aqui estão cinco pessoas perseguindo meus primeiros princípios, e ali cinco pessoas perseguindo os delas. Não havia nada de cima para baixo.

Zhang Xiaojun: Durante seu doutorado, você publicou artigos em colaboração com os vencedores do Prêmio Turing Yann LeCun e Yoshua Bengio — e você foi o primeiro autor desses artigos. Como essas colaborações aconteceram? O que quero dizer é: eles são laureados com o Prêmio Turing e não eram seus orientadores — no que você se baseou para atraí-los?

Yang Zhilin: A academia é muito aberta. Contanto que você tenha uma boa ideia e um problema significativo, tudo bem. O que dois cérebros — ou n cérebros — produzem é mais do que um cérebro sozinho. Isso se aplica também ao desenvolvimento de AGI. Uma estratégia importante em IA é chamada de "ensemble" — usar vários modelos ou métodos diferentes e combinar suas previsões para melhor desempenho. É essencialmente fazer a mesma coisa: quando você tem pontos de vista diversos, pode gerar muitas coisas novas. A colaboração é imensamente benéfica.

Zhang Xiaojun: Você primeiro teria uma ideia e depois perguntaria a eles se estavam interessados?

Yang Zhilin: Mais ou menos isso.

Zhang Xiaojun: O que é mais difícil: convencer pesos-pesados acadêmicos em pesquisa, ou convencer pesos-pesados do capital em captação de recursos? Quais são as semelhanças?

Yang Zhilin: "Convencer" não é uma boa palavra — a essência por trás disso é cooperação. Cooperação significa que ambos os lados ganham, porque o benefício mútuo é a pré-condição para a cooperação. Então, não há realmente diferença: você precisa oferecer aos outros valor único.

Zhang Xiaojun: Como você ganha a confiança deles? O que você acha que é seu dom?

Yang Zhilin: Não há dom particular — apenas trabalhar duro.

Parte 3

O Sistema Antigo Não Funciona Mais

"AGI Precisa de um Novo Tipo de Organização"

**

Zhang Xiaojun: Você acabou de dizer "avanços mais valiosos acontecerão na indústria" — isso inclui startups e os laboratórios de IA dos gigantes?

Yang Zhilin: Laboratórios são coisa do passado. O Google Brain costumava ser o maior laboratório de IA da indústria, mas era uma organização de pesquisa embutida dentro de uma grande empresa. Esse tipo de organização pode explorar novas ideias, mas é muito difícil produzir um grande sistema — poderia produzir o Transformer, mas não poderia produzir o ChatGPT.

A forma como o desenvolvimento agora evolui é que você está construindo um sistema enorme, que requer novos algoritmos, engenharia sólida e até mesmo muito trabalho de produto e comercialização. É como no início dos anos 2000: você não podia pesquisar recuperação de informação em um laboratório; tinha que viver no mundo real, como um grande sistema, um produto com usuários — como o Google. Então, os sistemas de pesquisa e educação mudarão sua função para principalmente cultivar talentos.

Zhang Xiaojun: Como você descreveria esta nova forma de sistema? A OpenAI é seu protótipo?

Yang Zhilin: É a organização mais madura deste tipo hoje, e ainda está evoluindo gradualmente.

Zhang Xiaojun: Então pode ser entendida como uma organização estabelecida para os grandes objetivos científicos da humanidade?

Yang Zhilin: Quero enfatizar: não é ciência pura — é uma combinação de ciência, engenharia e negócios. Tem que ser uma organização comercial, uma empresa, não um instituto de pesquisa. Mas esta empresa é construída do zero ao um, porque a AGI precisa de um novo tipo de organização. Primeiro, o modo de produção difere da era da internet; segundo, muda de pesquisa pura para uma combinação de pesquisa, engenharia, produto e negócios.

Em seu núcleo, deve ser um programa moonshot, com uma grande quantidade de planejamento de cima para baixo — ainda assim, dentro desse planejamento há espaço para inovação, porque nem toda a tecnologia é predeterminada. Existem elementos de baixo para cima dentro de uma estrutura de cima para baixo. Tal organização não existia antes, mas a organização deve se adaptar à tecnologia, porque a tecnologia determina o modo de produção; se não corresponderem, você não pode produzir eficazmente. Acreditamos que muito provavelmente precisará ser redesenhada do zero.

Zhang Xiaojun: Durante o golpe no conselho da OpenAI no ano passado, uma opção para Sam Altman era se juntar à Microsoft e liderar uma nova equipe de IA da Microsoft. Qual é a diferença essencial entre isso e ser CEO da OpenAI?

Yang Zhilin: Você teria que cultivar uma nova organização dentro de uma cultura antiga — e isso é extremamente difícil.

Zhang Xiaojun: Você quer construir "a OpenAI da China" — podemos colocar dessa forma?

Yang Zhilin: Não é preciso. Não queremos ser a China de ninguém, e não necessariamente queremos ser a OpenAI.

Primeiro, a AGI real será definitivamente global. Não existe, pelo menos a longo prazo, uma empresa de AGI confinada a algum mercado regional devido a mecanismos de proteção de mercado. Globalização, AGI e ter um produto com uma base de usuários muito grande: estas três são, em última análise, condições necessárias.

Segundo, deveria ser a OpenAI? Se você olhar para 2017-2018, a OpenAI tinha uma reputação terrível. Quando as pessoas do nosso círculo procuravam empregos, geralmente consideravam lugares como o Google. Muitas pessoas que conversaram com Ilya Sutskever, cientista-chefe da OpenAI, saíram pensando que o homem era maluco e cheio de si demais — a OpenAI era ou de malucos ou de golpistas. Mas eles se comprometeram muito cedo, encontraram o não-consenso e encontraram o que agora é o único primeiro princípio que funciona em IA: escalar através da previsão do próximo token.

Acredito que haverá uma empresa maior que a OpenAI. Uma empresa verdadeiramente grande pode combinar idealismo tecnológico com um grande produto, co-criando com seus usuários — a AGI será, em última análise, algo produzido pelo trabalho conjunto com todos os seus usuários. Então não é apenas sobre tecnologia; também requer pragmatismo e buscas no mundo real — em última análise, uma combinação perfeita dos dois.

Ainda assim, devemos aprender com o idealismo tecnológico da OpenAI. Se todo mundo acha que você é normal — se seu sonho é um sonho que qualquer um poderia ter — isso não acrescenta nada à soma total dos sonhos da humanidade.

Parte 4

O Primeiro Passo do Moonshot é "Contexto Longo" — Qual é o Segundo?

"Dois Grandes Marcos Estão por Vir"

**

Zhang Xiaojun: Voltando ao momento em que você decidiu abrir a empresa — você lançou a primeira rodada de financiamento imediatamente após retornar à China?

Yang Zhilin: Começou nos EUA em fevereiro (ano passado), parte dela remotamente. No final, investidores domésticos constituíram a maioria.

Zhang Xiaojun: A primeira rodada levantou 100 milhões de dólares?

Yang Zhilin: A primeira rodada não foi tanto; rodadas posteriores excederam esse valor. Completamos duas rodadas em 2023, totalizando quase 2 bilhões de RMB.

Esta é agora a terceira rodada. Não anunciamos formalmente o financiamento, então não posso comentar neste momento.

Zhang Xiaojun: Algumas pessoas dizem que desde o segundo semestre de 2023, ninguém mais está disposto a investir em empresas de modelos de fundação. Elas estão erradas?

Yang Zhilin: Ainda existem. Você pode certamente ver a mudança no sentimento, mas não é que ninguém está investindo — pelo menos por enquanto, há bastante interesse de investimento no mercado.

Zhang Xiaojun: Além de capital e pessoas, que outras decisões-chave você tomou em 2023?

Yang Zhilin: Decidir o que fazer. Essa é a vantagem de empresas como a nossa — ter uma visão técnica para decisões no mais alto nível.

Fazemos contexto longo. Isso requer julgamento sobre o futuro: você precisa saber o que é fundamental e para onde as coisas estão indo a seguir. Novamente, são primeiros princípios — o processo de "desentalhe". Se você focar no entalhe, só pode olhar para o que a OpenAI já fez e descobrir como reproduzir.

Você descobrirá que fazer compressão de texto longo sem perdas no Kimi dá ao produto uma experiência única. Quando você lê artigos em inglês, ele ajuda a entendê-los notavelmente bem. Usar Claude ou GPT-4 hoje, você não necessariamente se sairá tão bem; isso exigiu preparar o terreno com antecedência. Trabalhamos nisso por mais de meio ano. Isso é muito diferente de identificar uma tendência de contexto longo hoje, montar às pressas duas equipes e desenvolvê-la na velocidade máxima.

Claro, a maratona apenas começou; mais diferenciação virá, e isso exige que você antecipe com antecedência o que conta como "um não consenso que se confirma".

Zhang Xiaojun: Em que mês essa decisão foi tomada?

Yang Zhilin: Fevereiro ou março — foi decidida assim que a empresa foi fundada.

Zhang Xiaojun: Por que o contexto longo é o primeiro passo do moonshot?

Yang Zhilin: Porque é fundamental. É a memória do novo computador.

A memória do antigo computador cresceu várias ordens de grandeza nas últimas décadas, e o mesmo acontecerá com o novo computador. Isso pode resolver muitos dos problemas atuais. Por exemplo, as arquiteturas multimodais atuais ainda precisam de um tokenizador, mas com um contexto longo comprimido sem perdas, você não precisa de um — você pode colocar a entrada bruta diretamente. Indo além, é a base para tornar o novo paradigma computacional mais geral.

O antigo computador podia representar tudo com 0s e 1s; tudo podia ser digitalizado. Mas o novo computador de hoje ainda não consegue — não há contexto suficiente, então não é tão geral. Para se tornar um modelo de mundo geral, você precisa de contexto longo.

Segundo, ele permite a personalização. O valor central da IA é a interação personalizada; o valor, em última análise, recai sobre a personalização, e a AGI será mais personalizada do que a geração anterior de mecanismos de recomendação.

Mas a personalização não é alcançada através de fine-tuning — é alcançada suportando um contexto muito longo. Todo o seu histórico com a máquina é contexto, e esse contexto define o processo de personalização. Não pode ser replicado e proporciona um diálogo mais direto — um diálogo que gera informações.

Zhang Xiaojun: Quanto espaço há para escalar isso?

Yang Zhilin: Enorme. Por um lado, expandir a janela em si ainda tem um longo caminho a percorrer — várias ordens de grandeza.

Por outro lado, você não pode apenas expandir a janela, e não pode apenas olhar para o número; se a janela é de alguns milhões de tokens ou vários bilhões hoje é insignificante em si. Você tem que olhar para a capacidade de raciocínio que ela possibilita dentro dessa janela, a fidelidade — fidelidade à informação original — e a capacidade de seguir instruções. Você não deve perseguir uma única métrica; você tem que combinar métricas com capacidades.

Se essas duas dimensões continuarem a melhorar, você pode fazer muito. Ela poderia seguir uma instrução com dezenas de milhares de palavras, e a própria instrução poderia definir muitos agentes — altamente personalizados.

Zhang Xiaojun: As tecnologias por trás do contexto longo e de alcançar o GPT-4 são reutilizáveis entre si? São a mesma coisa?

Yang Zhilin: Acho que não. É mais sobre adicionar uma nova dimensão — uma dimensão que o GPT-4 não tem.

Zhang Xiaojun: Muitos dizem que as principais empresas chinesas de modelos de base estão todas fazendo mais ou menos a mesma coisa — perseguindo o GPT-3.5 em 2023, perseguindo o GPT-4 em 2024. Você concorda?

Yang Zhilin: Melhorar as capacidades gerais certamente tem marcos importantes, então essa afirmação está correta até certo ponto — como um retardatário, você inevitavelmente passa por um processo de recuperação. Mas também é unilateral. Além das capacidades gerais, há muito espaço para desenvolver capacidades distintas e alcançar o estado da arte em certas direções. Contexto longo é uma. A geração de imagens do DALL-E 3 é completamente superada pelo Midjourney V6. Então você tem que trabalhar em ambas as frentes.

Zhang Xiaojun: Qual proporção de tempo e recursos vai para capacidades gerais versus novas dimensões?

Yang Zhilin: Elas têm que ser combinadas. Uma nova dimensão não pode existir separada das capacidades gerais, então é difícil dar uma proporção direta. Mas é necessário um investimento suficiente para fazer bem a nova dimensão.

Zhang Xiaojun: Todas essas novas dimensões serão suportadas pelo Kimi?

Yang Zhilin: O Kimi é certamente um produto muito importante para nós, e também teremos algumas outras tentativas.

Zhang Xiaojun: O que você acha do comentário de Li Guangmi, fundador da Shixiang, de que a distintividade tecnológica das empresas chinesas de modelos de base ainda não é muito alta hoje?

Yang Zhilin: Acho que está tudo bem — já produzimos bastante diferenciação hoje. É uma questão de tempo; este ano você deve ver mais dimensões. No ano passado, todos estavam apenas montando o andaime e fazendo as coisas funcionarem primeiro.

Zhang Xiaojun: Se o primeiro passo do moonshot é o contexto longo, qual é o segundo?

Yang Zhilin: Haverá dois grandes marcos pela frente. Primeiro, um modelo de mundo verdadeiramente unificado — que unifica todas as diferentes modalidades, uma arquitetura verdadeiramente escalável e geral.

Segundo, permitir que a IA continue evoluindo sem dados de entrada humanos.

Zhang Xiaojun: Quanto tempo levará para atingir esses dois marcos?

Yang Zhilin: Dois a três anos — possivelmente mais rápido.

Zhang Xiaojun: Então, daqui a três anos, já estaremos olhando para um mundo completamente diferente do de hoje.

Yang Zhilin: No ritmo atual de desenvolvimento, sim. A tecnologia está agora em um estágio inicial e de rápido crescimento.

Zhang Xiaojun: Você consegue imaginar o que existirá daqui a três anos?

Yang Zhilin: Haverá um certo grau de AGI. Muitas das coisas que fazemos hoje, a IA também será capaz de fazer — até melhor do que nós. Mas a chave é como a usamos.

Zhang Xiaojun: E para você — para a Moonshot AI como empresa — qual é o segundo passo?

Yang Zhilin: Nós iremos fazer essas duas coisas. Todos os problemas restantes são derivados desses dois fatores. O raciocínio e os agentes de que as pessoas falam hoje são subprodutos da resolução desses dois problemas. É necessária alguma esculpida adicional, mas não há um obstáculo fundamental.

Zhang Xiaojun: Você vai investir tudo para alcançar o GPT-4?

Yang Zhilin: O GPT-4 é uma parada necessária no caminho para a AGI. O segredo é não se contentar em apenas igualar o GPT-4. Primeiro, você tem que perguntar qual é o verdadeiro não consenso agora: além do GPT-4, o que vem a seguir? Como o GPT-5 e o GPT-6 devem ser? Segundo, você tem que ver quais capacidades distintas você tem dentro disso — e isso é o que mais importa.

Zhang Xiaojun: Outras empresas de modelos de base publicam seus

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais