O que foi dito na gravação da reunião de investidores do fundador da DeepSeek, Liang Wenfeng

@vista8
CHINÊS23 de jul. de 2026
213K
220
43
19
424

TL;DR

Um resumo detalhado de uma reunião de investidores de 4 horas com o fundador da DeepSeek, Liang Wenfeng, destacando suas visões não convencionais sobre a contenção de lucros, o roteiro para a AGI e os ecossistemas nacionais de chips.

Desde ontem à noite, as contas públicas do WeChat têm republicado freneticamente a gravação de Liang Wenfeng, da DeepSeek, usando IA para resumir e escrever artigos.

Baixe o PDF da transcrição original da gravação

📎

https://xiangyangqiaomu.feishu.cn/wiki/Ojsuw8gE6ieBZJkYOMtcOcaenwq

A DeepSeek tem um modelo chamado DDCP. No dia em que seu preço foi cortado para um quarto do original, o grupo da empresa no chat foi tomado por comemorações.

Numa reunião financeira de uma empresa normal, um corte de preço significa queda na receita e é uma má notícia que leva a uma bronca.

A DeepSeek tratou isso como um momento digno de celebração.

Nesta reunião de três horas e quarenta e quatro minutos, Liang Wenfeng repetiu uma coisa: Eles não têm dinheiro, não têm cartas na manga, não têm fama, não têm talentos de primeira linha no time, e nem ele mesmo se formou na melhor escola.

Como um grupo de pessoas comuns criou algo em dois anos que deixou o mundo inteiro tenso?

O julgamento contraintuitivo de Liang Wenfeng: Na questão da IA, quem quer pegar mais vai perder primeiro.

Quanto Mais Você Pega, Mais Rápido Morre

Liang Wenfeng fez um cálculo. Suponha que a IA possa eventualmente consumir 10% do PIB global, e a OpenAI queira pegar 5% disso; esse cálculo é teoricamente sólido.

Mas, assim que surgir um concorrente disposto a pegar apenas 1%, eles podem esmagar o primeiro com um preço mais baixo.

Então, outro aparecerá que só quer 0,1%, esmagando o anterior também.

Essa cadeia continuará rolando para baixo até atingir um ponto de equilíbrio: se você pegar muito pouco, o modelo de negócio não se sustenta e você é naturalmente eliminado; se pegar demais, será espremido camada por camada por aqueles que pegam menos.

Liang Wenfeng foi direto: Ele não tem dúvidas de que a AGI terá um enorme valor comercial, mas, em vez de se preocupar em como obter uma fatia maior, ele se importa mais em como aumentar a probabilidade de torná-la realidade.

E a maneira de aumentar essa probabilidade é precisamente encolher ativamente a porção que ele quer pegar.

Aplicando essa lógica ao preço, a API da DeepSeek é projetada para atingir o ponto de equilíbrio em dez meses, correspondendo a aproximadamente seis vezes o lucro.

Isso não é maximização de lucro. Se realmente quisessem maximizar o lucro, o preço deveria ser mais alto, porque a demanda do usuário na faixa atual é inelástica; um aumento de preço não reduziria significativamente o consumo.

Mas o lucro de seis vezes é ativamente fixado nesse limite superior por uma razão muito prática: Ao manter a margem de lucro baixa o suficiente, torna-se não lucrativo para terceiros roubarem negócios implantando eles mesmos modelos de código aberto.

Código aberto e baixo lucro são dois lados da mesma moeda.

Em vez de depender de código fechado para garantir lucros, eles dependem de comprimir os lucros a um nível que outros não podem pagar para replicar, preservando assim o próprio mercado.

Liang Wenfeng calculou que, se realmente quisessem ganhar cem vezes o lucro, o código aberto se tornaria uma brecha, já que os custos de implantação de terceiros poderiam ser apenas um vigésimo dos deles.

Mas a DeepSeek nunca pretendeu seguir esse caminho desde o início.

Ele não está preocupado com o código aberto porque nunca pensou em ganhar cem vezes o lucro por meio de um monopólio vertical.

Essa lógica de "ganhar intencionalmente menos" explica quase todas as decisões aparentemente não lucrativas que essa empresa toma.

Gergelim na Frente, Melancias Atrás

No último Ano Novo Chinês, a base de usuários finais (lado C) da DeepSeek explodiu de repente.

Isso não estava no plano. A equipe até considerou não manter esses usuários, mas os usuários "não podiam ser afastados" e acabaram ficando.

A explicação de Liang Wenfeng para esse fenômeno é direta: Tratar as coisas que você pode pegar bem na sua frente como a prioridade máxima fará você perder oportunidades maiores.

Ele chama isso de "pegar gergelim". O tráfego do lado C do ano passado e a receita do lado empresarial (lado B) deste ano são, na visão dele, apenas gergelim — pegá-los de passagem é suficiente; não vale a pena parar para isso.

A verdadeira melancia é a AGI, e a oportunidade para a AGI é sempre grande o suficiente para que não haja necessidade de calcular precisamente quanta participação se pode ocupar agora.

Isso leva a um resultado interessante: A DeepSeek faz produtos quase por acidente.

Liang Wenfeng disse que o ponto de partida para o treinamento e a API da empresa nunca foi atender bem aos usuários, mas porque essa etapa precisa ser superada no caminho para a AGI. Usuários e receita são apenas subprodutos gerados ao longo do caminho.

Essa estratégia é, aos olhos dele, uma forma de ataque por redução de dimensionalidade: uma organização com a AGI como objetivo coloca muito menos pensamento em produtos do lado C e B do que empresas que tratam o próprio produto como objetivo, mas os resultados não são necessariamente piores.

A explicação dele é que uma visão maior pode unir melhor os talentos de ponta; a vantagem de talento resultante transbordará naturalmente para o nível do produto, tornando-se um ataque por redução de dimensionalidade.

Por outro lado, uma empresa que trata "fazer um bom produto" como objetivo final terá vantagens na experiência do produto, tráfego e atendimento ao usuário, mas, em termos de capacidades técnicas a montante, pode nunca alcançar uma empresa que trata a própria tecnologia como objetivo final.

A mesma moderação também determina as coisas que a DeepSeek escolhe não fazer.

Sem Fabricação de Chips, Sem Cadeia Industrial Completa

Um investidor perguntou a Liang Wenfeng se ele iria se mover para upstream para fabricar chips ou para downstream em aplicações verticais como finanças ou saúde.

A resposta dele foi não.

A razão é uma metáfora de usina de energia: a pessoa que opera a usina não precisa construir o gerador. Contanto que possa comprá-lo a um preço razoável, por que construí-lo?

Isso é uma extensão da mesma lógica de "moderação".

Liang Wenfeng disse que o bolo da IA é grande o suficiente para que muitas empresas de trilhões de dólares surjam no futuro. A DeepSeek só precisa ser uma delas, comendo apenas a parte em que é melhor, sem precisar engolir toda a cadeia industrial.

Comer demais levará, em vez disso, a uma saída precoce.

A mesma atitude se aplica aos concorrentes.

Liang Wenfeng disse que a DeepSeek está disposta a ajudar a Alibaba, Zhipu e Moonshot AI a reproduzir modelos de código aberto melhores, porque isso não prejudica seus próprios interesses.

Parece educado, mas o algoritmo subjacente é consistente: Se o mercado é grande o suficiente, os outros se saírem bem não é uma ameaça; os outros se saírem mal e arruinarem a confiança de todo o ecossistema é a verdadeira perda.

A moderação explica o que a DeepSeek não faz.

Quanto ao que fará, a resposta é uma escada técnica que já foi pensada há muito tempo.

Uma Escada Que Pode Ser Subida Sem Hora Extra

Liang Wenfeng descreve a evolução da tecnologia de IA como subir uma escada camada por camada, onde cada passo é construído sobre o anterior e nenhum passo é desperdiçado.

O passo do ano passado foi a Cadeia de Pensamento (CoT), deixando o modelo aprender a pensar por si mesmo, empurrando o limite superior da inteligência um passo adiante, já superando humanos de ponta em codificação e problemas de Olimpíada de Matemática.

O passo deste ano são os Agentes, empurrando os limites da capacidade ainda mais através da execução de tarefas de múltiplas etapas.

Mas o caminho dos Agentes também chegará ao fim.

Depois de chegar ao fim, o modelo ainda não pode substituir um funcionário real.

Liang Wenfeng deu um exemplo muito adequado: Quando um novo funcionário entra, ele passa dois meses se familiarizando com o ambiente. Depois disso, se você disser "chame o João aqui", ele entende.

A IA carece desses dois meses de acúmulo; você tem que explicar quem é o João, onde ele está e qual é o cargo dele antes que ela possa executar.

Essa limitação de "deve fornecer contexto completo" é a parede invisível entre a IA atual e a inteligência verdadeira.

O próximo passo a superar é a aprendizagem contínua: O modelo pode, como um novo funcionário, acumular experiência por conta própria através do contato contínuo com o ambiente, em vez de depender de humanos para alimentar contexto em sua boca toda vez?

Uma vez que a aprendizagem contínua seja resolvida, aparecerá um estágio que Liang Wenfeng chama de "singularidade": A capacidade do modelo será forte o suficiente para iterar a próxima versão do próprio modelo, fazer sua própria pesquisa e desenvolver uma próxima geração mais avançada.

Ele enfatizou especificamente que essa singularidade não é uma mutação súbita, mas um processo gradual e contínuo, embora seja convencionalmente chamada de singularidade.

Só depois disso vem a inteligência incorporada, onde os robôs realmente entram no mundo físico para fazer tarefas domésticas e cuidar de idosos.

Quanto à razão de seguirem essa ordem, Liang Wenfeng disse: Este é o caminho que economiza mais trabalho.

Ao resolver a aprendizagem contínua primeiro, a IA pode ajudar a acelerar cada etapa subsequente de pesquisa e desenvolvimento, para que os humanos não tenham que carregar tudo sozinhos.

Por outro lado, se fizessem a inteligência incorporada primeiro, esse seria um caminho amargo e cansativo construído sobre o trabalho humano, que a DeepSeek não quer escolher.

Há um detalhe aqui que vale a pena considerar: O objetivo principal da DeepSeek ao treinar a próxima versão do modelo não é para que usuários externos o usem bem, mas para que sua própria equipe se desenvolva mais rápido.

O modelo atende primeiro à eficiência interna de P&D, e depois beneficia incidentalmente os usuários externos.

Essa ordem de prioridade, até certo ponto, determina a sequência de quase todas as alocações de recursos nesta empresa.

20.000 Cartões e um Fosso em Dissolução

Ao falar sobre a diferença entre a China e os EUA, o julgamento de Liang Wenfeng foi muito direto: Talento não é o gargalo; poder computacional é.

A China não carece de talento em IA; a base é grande o suficiente, e a distribuição de pessoas inteligentes é aleatória. Não existe tal coisa como "todas as pessoas mais inteligentes foram para os EUA."

O verdadeiro gargalo são os recursos.

Os números são muito diretos: A DeepSeek atualmente tem cerca de 20.000 cartões de computação equivalentes à série H, a maioria dos quais chegou apenas no último mês ou dois.

Para treinar um modelo da mesma categoria que os maiores modelos atuais (com cerca de 800B de parâmetros ativados), são necessários 50.000 cartões GB300, ou 200.000 dos cartões mais recentes da Huawei. Isso é apenas para o treinamento em si, sem incluir os enormes custos experimentais durante a fase de pesquisa.

Os recursos atuais da DeepSeek podem suportar experimentos na escala de dezenas de bilhões de parâmetros ativados, o que ainda está uma ordem de magnitude longe de 800B.

Em relação aos chips domésticos, o julgamento de Liang Wenfeng foi inesperadamente otimista.

Ele acredita que o fosso ecológico da CUDA está sendo desmantelado por três forças simultaneamente: a própria IA pode ajudar a escrever código, reduzindo significativamente a barreira para construir um ecossistema; linguagens de alto nível como TileLang podem reescrever rapidamente todo o sistema de operadores da CUDA; placas de jogo e placas de computação originalmente compartilhavam uma arquitetura porque o mercado de computação de IA era menor que o de jogos, mas agora o mercado de computação é maior, e os dois não precisam mais estar amarrados — chips especializados estão se tornando mainstream.

Ele deu um julgamento de tempo específico: Dentro do próximo ano, o fato de que o ecossistema de chips doméstico é bom será provado por fatos.

O único obstáculo restante é a capacidade de produção.

A comparação específica de custo-benefício também é muito direta: O super-nó 950 da Huawei pode substituir o GB200 e GB300 da NVIDIA em termos de desempenho e preço, ao custo de precisar de quatro cartões para igualar um, enquanto está dois anos atrasado. Não importa se é 50% a 200% mais caro, desde que possa ser comprado.

A DeepSeek atualmente obtém cerca de 16.000 cartões de capacidade da Huawei. Esse volume equivale a apenas 4.000 cartões NVIDIA, o que nem é suficiente para treinar a próxima geração de modelos, mas é suficiente para ajudar a Huawei a fazer o ecossistema funcionar primeiro.

Liang Wenfeng chama isso de "ajudar a Huawei a fazer isso bem primeiro." Ele não espera depender desses cartões para treinar modelos maiores; ele está pavimentando o caminho para o futuro.

Ainda mais interessante é a narrativa de recuperação que ele fornece: No passado, a IA chinesa usava um vigésimo do poder computacional de outros para produzir coisas comparáveis, enquanto estava um a dois anos atrasada.

No futuro, esse "tempo de atraso" precisa ser comprimido de um ou dois anos para três a seis meses, enquanto a diferença de poder computacional permanece igualmente grande.

Não confiando em mais recursos, mas confiando em métodos mais inteligentes.

Essa abordagem de "usar a força inteligente para preencher a lacuna" também se reflete em como a empresa se gerencia.

Metade dos Pesquisadores Principais Estão Rotulando Dados

Alguém perguntou a Liang Wenfeng se o problema de alucinação dos modelos grandes afetaria a experiência do usuário. A resposta dele foi muito franca: Alucinação não é um problema insolúvel. Pode ser melhorada com um pós-treinamento melhor; é só que ninguém colocou muito esforço para fazer isso ainda.

Dentro da DeepSeek, isso é classificado como um problema de produto; será resolvido, mas não é o foco.

Um detalhe mais digno de lembrar do que o problema da alucinação é: Metade dos pesquisadores principais da DeepSeek estão rotulando dados.

Isso não é porque rotular dados é barato na China. Pelo contrário, Liang Wenfeng disse que o custo da rotulagem de dados de alta qualidade na China não é diferente do dos EUA, especialmente para dados de ponta, onde não há vantagem de custo alguma.

Então, a estratégia atual é uma abordagem de duas frentes: rotular primeiro os de baixo custo e deixar os de alto custo de lado por enquanto.

Ele julga que isso é uma questão de tempo, não de capital.

A OpenAI e a Anthropic começaram mais cedo e estão em execução há muito tempo. A China só começou a investir seriamente cerca de seis meses atrás, mas espera-se que a maior parte da lacuna possa ser fechada dentro de um ano.

Uma Empresa Sem Organização: O Que Mantém as Pessoas Unidas?

Liang Wenfeng disse que a DeepSeek "não tem organização" e é movida pela visão.

A operação específica: A gestão da empresa é dividida em duas linhas. Uma é de cima para baixo para projetos coletivos, como lançar o V4, que requer colaboração e divisão de trabalho de toda a equipe; esta parte é chamada de "formal". A outra é de baixo para cima, onde cada um pesquisa o que quiser; ninguém os gerencia, e não há KPIs.

O padrão que Liang Wenfeng estabelece para si mesmo é: O trabalho formal não deve ocupar mais da metade do tempo de um funcionário.

Há duas considerações por trás disso.

Primeiro, a pesquisa requer um ambiente relaxado. Pressionar demais torna impossível explorar coisas novas. Como o objetivo é estimular o interesse espontâneo, deve-se deixar espaço para "pensamento livre".

Segundo, a DeepSeek é focada o suficiente para que haja poucas coisas a fazer. Os produtos da empresa são geralmente imperfeitos, e eles não colocaram esforço para consertá-los, o que é em si uma escolha ativa.

Esse estilo organizacional não tem modelo para copiar.

Liang Wenfeng disse que a DeepSeek não imitou nenhuma empresa, incluindo os Laboratórios Bell, que são frequentemente usados como comparação, porque os Laboratórios Bell não precisavam ser responsáveis por seus próprios lucros e perdas, enquanto a DeepSeek é, em última análise, uma empresa que deve considerar como sobreviver. O governo não dará um centavo para eles.

Cada escolha é um resultado calculado com base na situação real em questão, não uma resposta copiada.

Voltando àquela Comemoração

Olhando agora para a comemoração no dia do corte de preço do DDCP: Aquela não foi uma história isolada; foi um microcosmo de todo o algoritmo de sobrevivência desta empresa.

Moderação em não buscar a participação máxima é porque, num mercado grande o suficiente, aqueles que são gananciosos serão espremidos primeiro.

Pegar gergelim sem parar é porque ficar olhando para ganhos imediatos impedirá que você veja as melancias maiores atrás.

Não fabricar chips ou aplicações verticais é porque comer demais leva a uma saída precoce.

Escolher a ordem que economiza mais trabalho para a rota técnica é porque a energia economizada pode ser usada onde os verdadeiros gargalos estão.

Ter metade dos pesquisadores rotulando dados é porque a lacuna que o poder computacional não pode preencher só pode ser preenchida com uma base mais sólida.

Essas decisões parecem não relacionadas na superfície, mas são, na verdade, diferentes maneiras de escrever a mesma frase: Num campo grande o suficiente, não calcular precisamente quanto você pode obter agora é o pré-requisito para obter mais.

Este é um método de julgamento que pode ser usado diretamente por qualquer pessoa em uma indústria competitiva.

Da próxima vez que você enfrentar uma escolha entre "quanto posso ganhar agora" e "quanto posso ganhar no futuro", não se apresse em calcular a conta imediata.

Faça uma pergunta mais fundamental: Este assunto, porque você está pegando demais agora, atrairá prematuramente um concorrente disposto a pegar menos?

Se a resposta for sim, então, por mais tentador que seja o ganho de curto prazo, não vale a pena trocar a probabilidade de sobrevivência por ele.

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais