Este é um guia A–Z completo sobre o que o Kimi K3 realmente é, o que ele pode fazer e por que está se tornando silenciosamente o modelo de codificação mais importante sobre o qual ninguém está falando ainda.
Marque esta página para não perder este artigo.
2,8 trilhões de parâmetros. 1 milhão de tokens de contexto.
Aqui está tudo sobre ele.
Antes de Falarmos sobre Benchmarks, Vamos Falar sobre o que Acabou de Acontecer
Nos últimos três anos, a história tem sido a mesma: laboratórios americanos constroem a fronteira, laboratórios chineses constroem a cópia barata seis meses depois.
Em 16 de julho, a Moonshot AI lançou o Kimi K3.
https://x.com/Kimi_Moonshot/status/2077830229968683203
2,8 trilhões de parâmetros totais — aproximadamente 75% maior que o DeepSeek V4 Pro e quase 4x a série GLM 5 da Zhipu. O maior modelo de código aberto já lançado.
Ele supera o Claude Opus 4.8. Supera o GPT-5.6 Sol. E nos benchmarks da Moonshot, está no mesmo nível do Fable 5 — o modelo mais capaz disponível ao público hoje.
A história da cópia acabou.
Os Números

Aquela última linha é a que as pessoas estão interpretando errado. Vamos lidar com ela corretamente.
A Realidade dos Preços — Leia Isto com Atenção
O Kimi K3 não é um modelo de desconto. A $3/$15 por milhão de tokens, seu preço é aproximadamente o nível do Claude Sonnet — não os grandes descontos que os lançamentos anteriores da Moonshot ofereciam.
Então, de onde vem o "5x mais barato que o Fable 5"?
Custo por tarefa, não preço por token.
O K3 usa substancialmente menos tokens de saída para concluir o mesmo trabalho. Em uma tarefa de codificação representativa: o Fable 5 custa cerca de $1,30. O K3 custa cerca de $0,25.
Mesmo nível de saída. Menos tokens. Conta total mais baixa.
O enquadramento honesto: Preço de Sonnet, experiência de nível Fable. Você não está comprando os tokens mais baratos do mercado. Você está comprando capacidade de fronteira a um preço médio, e chegando lá em menos etapas.
Se você está comparando preços brutos de tokens, o K3 parece comum. Se você está comparando quanto custa para concluir um trabalho, é uma conversa completamente diferente.
Onde o Kimi K3 é State of the Art
De acordo com os benchmarks publicados pela Moonshot, o K3 define SOTA em:
- HLE com ferramentas — O Último Exame da Humanidade, aumentado com ferramentas
- SWE-Bench Pro — engenharia de software do mundo real
- SWE-Bench Multilíngue — engenharia em vários idiomas
- BrowseComp — navegação na web e pesquisa
- Toolathlon — uso de ferramentas em escala
- CharXiv com Python — raciocínio com gráficos e figuras
- MathVision com Python — matemática visual

Contra a concorrência: supera Opus 4.8 e GPT-5.6 Sol, no mesmo nível do Fable 5.
Em testes cegos pelo avaliador de IA Arena, os desenvolvedores preferiram o Kimi a todos os principais modelos dos EUA.
As Duas Inovações de Arquitetura que Realmente Importam
Esta é a parte que a maioria das coberturas está pulando, e é a coisa mais interessante do lançamento.

- Kimi Delta Attention (KDA)
Um mecanismo de atenção linear híbrido. O resultado: até 6,3x mais rápido na decodificação em contextos de milhões de tokens.
Uma janela de contexto de 1M só é útil se você puder realmente trabalhar nela sem esperar para sempre. A KDA é o que torna a janela de contexto prática, em vez de teórica.
- Residuais de Atenção (AttnRes)
Um substituto drop-in para conexões residuais. Oferece aproximadamente 25% mais eficiência de treinamento a um custo adicional inferior a 2%.
Ambas as técnicas foram publicadas como pesquisa aberta pela equipe da Moonshot no GitHub antes do modelo ser lançado. Isso não é marketing — é trabalho inspecionável por pares.
E, combinadas, elas explicam a eficiência de tokens: o K3 usa 21% menos tokens de saída que o K2.6 em tarefas equivalentes.
A Parte que Deveria Te Deixar Atento: K3 Otimizou Sua Própria Arquitetura
A Moonshot deu ao K3 a implementação dos Residuais de Atenção — seu próprio componente arquitetônico — e um objetivo: torná-lo mais rápido no hardware H200 sem alterar o comportamento numérico.
Então eles o deixaram sozinho.
20 horas de experimentos. Zero intervenção humana. Aceleração de 1,6x.
Em uma execução separada, o K3 reduziu o tempo de ida/volta do FLA Triton AttnRes de 283,6ms para 114,4ms — uma aceleração de 2,48x — novamente sem alterar a parte numérica.

E ele iterou mais rápido que o Fable 5 fazendo a mesma tarefa.
Leia isso de novo. O modelo melhorou o mecanismo que faz o modelo funcionar. Autonomamente. Da noite para o dia.
Isto é o que "autoaperfeiçoamento recursivo" parece na prática — não um cenário de ficção científica, um trabalho de 20 horas com um resultado mensurável. É a mesma capacidade que a Anthropic sinalizou como motivo de cautela semanas atrás, rodando em um modelo de pesos abertos que qualquer um pode baixar em 27 de julho.
Codificação de Longo Horizonte é o Ponto Central
O próprio enquadramento da Moonshot: "O K3 se destaca como o modelo de codificação de código aberto mais poderoso da Moonshot AI até o momento. Operando com supervisão humana mínima, ele pode sustentar longas sessões de engenharia, navegar em repositórios massivos e orquestrar ferramentas de terminal."
As três coisas que importam para o trabalho real de engenharia:
- Sessões sustentadas — o experimento autônomo de 20 horas não é uma demonstração. É o alvo do design.
- Repositórios massivos — uma janela de contexto de 1M com decodificação 6,3x mais rápida significa que você pode colocar uma base de código real no contexto e realmente trabalhar nela.
- Orquestração de ferramentas — SOTA em Toolathlon e BrowseComp significa que ele lida com o terminal, o navegador e as chamadas de API sem desmoronar.
A codificação frontend atinge o nível do Fable 5. Cenas de jogos de qualidade AAA a partir de um único prompt. WebGPU, Three.js, shaders, física — coisas que costumavam exigir um estúdio.
Vibe Coding com Kimi K3
É aqui que o modelo deixa de ser um número de benchmark e começa a ser obviamente útil.
A codificação frontend do K3 está no nível do Fable 5. Na prática, isso significa que a parede entre uma descrição e um produto 3D funcional agora é um único prompt.
O que as pessoas realmente lançaram a partir de prompts únicos:
Jogos — Arenas de combate WebGPU com VFX. Travessia de cidade 3D baseada em navegador com mecânica de gancho.
- FPS de zumbis.
- Corrida multiplayer.
- Um emulador GBA 3D funcional.
- Estrutura completa de MMORPG.
Não é uma "demo parecida com um jogo" — cenas jogáveis com reações a acertos, feedback de impacto e física que se comporta.

Objetos 3D com trabalho de material real — Um Rolex com brilho e comportamento de luz corretos. Uma arma de CSGO que se monta e desmonta em 33 peças modeladas individualmente. Uma desmontagem de câmera Sony. Um buraco negro com lente gravitacional. Simulação oceânica com dinâmica de ondas real.

Cenas de física — Simulação de tecido. Colapso estrutural. Colisões de veículos com transferência de momento que parece correta, em vez de parecer roteirizada.
O que torna isso diferente das demos anteriores de "IA constrói um site": o K3 lida com os detalhes que normalmente quebram. Iluminação. Sombras. Brilho do material. As 20 pequenas coisas que separam "claramente gerado por IA" de "alguém construiu isso."
Um prompt. Quatro milhões de tokens. Uma cena que costumava precisar de uma equipe.
4 Prompts Testados em Batalha (Prontos para Copiar e Colar)
Estes são estruturados para explorar no que o K3 é realmente bom: trabalho de longo horizonte, uso de ferramentas e manter um grande contexto sem se desviar.
Prompt 1 — O Teste de Estresse de Física
Este é o prompt que separa a capacidade real do polimento de demonstração. Se um modelo conseguir fazer as três cenas com qualidade, é real.
1Construa três cenas HTML5 autônomas em canvas com física real.2Sem bibliotecas externas. Tudo em um arquivo por cena.34Cena 1: Um trem descarrilando de uma ponte quebrada na água.5Inclua: momento dos vagões, falha estrutural da ponte,6deslocamento de água no impacto.78Cena 2: Dois carros saltando de rampas e colidindo no ar9sobre um desfiladeiro. Inclua: arcos de trajetória corretos,10transferência de momento de colisão, detritos.1112Cena 3: Um caminhão monstro esmagando uma fileira de carros estacionados.13Inclua: compressão da suspensão, deformação da chapa metálica,14distribuição de peso.1516Requisitos para todas as três:17- A física deve ser calculada, não animada18- Alvo de 60fps19- Inclua um botão de reset20- Comente a matemática da física para que eu possa verificar2122Construa todas as três. Não faça perguntas de esclarecimento.
Prompt 2 — A Tarefa de Repositório de Longo Horizonte
Isto é para o que o K3 foi realmente construído. Aponte-o para uma base de código real e dê a ele um resultado, não uma tarefa.
1Leia toda esta base de código antes de escrever qualquer coisa.23[cole seu repositório, ou aponte para o diretório]45Objetivo: [declare um resultado mensurável — por exemplo, "reduzir6o tempo de resposta p95 da API em 30%" ou "eliminar todas as consultas7N+1 na camada de dados"]89Regras:10- Crie um perfil primeiro. Mostre-me onde o tempo realmente vai11 antes de mudar qualquer coisa.12- Não altere interfaces públicas ou comportamento numérico.13- Execute o conjunto de testes existente após cada alteração.14- Se uma alteração piorar as coisas, reverta-a e me diga por quê.15- Trabalhe até que o objetivo seja atingido ou você possa provar que16 não é alcançável sem quebrar as regras.1718Relatório no final: o que você mudou, o que ganhou com isso,19o que tentou que não funcionou.
A linha "o que você tentou que não funcionou" é importante. É o que transforma a saída de um diff em um registro de engenharia.
Prompt 3 — A Construção de Produto 3D
Para quem trabalha com frontend, landing pages ou visualização de produtos.
1Construa um [objeto] 3D interativo no navegador.2Arquivo HTML único. Three.js.34O objeto: [descreva-o precisamente — materiais,5número de peças, o que se move]67Deve incluir:8- Propriedades de material corretas (brilho, rugosidade,9 metalicidade onde relevante)10- Iluminação de três pontos com sombras reais11- Controles de órbita12- [Qualquer interação — montagem/desmontagem, animação,13 estados de hover]1415Padrão de qualidade: deve parecer um render de produto,16não uma demo WebGL. Se um detalhe fosse visível na vida17real, modele-o.1819Construa a coisa toda. Mostre-me o arquivo.
A linha "padrão de qualidade" faz mais trabalho do que qualquer outra coisa no prompt. O K3 responde a padrões, não apenas a instruções.
Prompt 4 — Recurso em Tempo Real com uma Parte Móvel
CRUD full-stack é uma forma de aplicativo. Tempo real é uma forma completamente diferente — o estado tem que permanecer sincronizado entre os clientes, não apenas persistir em um banco de dados. É aqui que muitos modelos silenciosamente desmoronam.
1Adicione um recurso em tempo real a um aplicativo existente: um sistema2de cursor + comentário colaborativo ao vivo, como o do Figma.34REQUISITOS:5- Conexão WebSocket (use Socket.io ou ws nativo)6- Mostre as posições do cursor de outros usuários conectados em tempo real7- Clique em qualquer lugar para soltar um pino de comentário8- Comentários são atualizados ao vivo para todos os clientes conectados9- Lide com desconexão/reconexão graciosamente — sem cursores fantasmas10- Debounce nas atualizações de cursor para não sobrecarregar o socket1112CONSTRUÇÃO:131. Configure o servidor WebSocket142. Construa a conexão do lado do cliente com reconexão automática153. Implemente a transmissão de cursor com debouncing164. Implemente o sistema de pinos de comentário175. Adicione um indicador de presença simples (quem está online)186. Teste com pelo menos 2 clientes simulados para confirmar que a sincronização funciona1920Mostre-me como você testou a sincronização multi-cliente antes de considerar isso pronto.
Resultado esperado: Uma camada de tempo real funcional em 15–30 minutos, com prova visível de que foi testada contra mais de um cliente.

A última linha é a parte importante. Bugs de tempo real não aparecem com uma única aba do navegador aberta — eles aparecem com duas. Um modelo que pula o teste multi-cliente lhe entregará um código que parece pronto e não está.
Quando o K3 Dá Errado: Guia de Solução de Problemas
É um modelo novo com arestas reais. Aqui está o que quebra e o que fazer.
- Problema: Ele queima tokens em tarefas triviais
Este é o grande problema, e é estrutural.
O K3 atualmente vem com apenas um nível de esforço de raciocínio — 'máximo'. Não há um modo "apenas responda rapidamente." Testadores independentes mediram 13.241 tokens de raciocínio para gerar um SVG simples — aproximadamente $0,25 por algo que deveria custar frações de centavo.
A correção:
não direcione trabalhos simples para o K3. É um modelo de fronteira com uma marcha, e essa marcha é "pense profundamente em tudo." Use o K2.7 ou um modelo menor para boilerplate, formatação e qualquer coisa mecânica. Guarde o K3 para trabalhos que justifiquem o raciocínio.
Este é o maior erro que as pessoas cometerão no primeiro mês: tornar o K3 o padrão para tudo e depois se surpreender com a conta.
- Problema: A janela de contexto enche de qualquer maneira
1M de tokens parece infinito até você colocar um repositório real e ele não ser.
A correção:
não despeje tudo. Aponte-o para os diretórios que importam. A força do K3 no trabalho de longo horizonte vem do foco sustentado, não de ter todos os arquivos no contexto. Um conjunto enxuto de 200K do código certo supera um inchado de 900K do monorepo inteiro.
- Problema: Ele se desvia em execuções autônomas muito longas
O experimento autônomo de 20 horas é real, mas funcionou porque o objetivo era mensurável — "tornar isso mais rápido no H200 sem alterar a parte numérica." Dê a ele um objetivo vago e muita liberdade, e ele vagará.
A correção:
todo prompt de longo horizonte precisa de uma condição de sucesso verificável. Não "melhore o código." Um número, um teste que passa, um benchmark que se move. Se você não puder declarar como verificaria se ele teve sucesso, ele se desviará.
- Problema: Você não consegue reproduzir o resultado de benchmark de alguém
Ninguém fora da Moonshot auditou este modelo. Os pesos não serão lançados até 27 de julho. Cada número circulando agora — incluindo neste artigo — é relatado pelo fornecedor.
A correção:
espere até 27 de julho, ou teste em suas próprias tarefas e confie nisso. Suas cinco tarefas reais valem mais do que a tabela de benchmark de qualquer um.
- Problema: Erros de integração após mudar da OpenAI ou Anthropic
O K3 é compatível com o SDK da OpenAI, o que cobre 90% da migração. Os 10% restantes geralmente são o comportamento de raciocínio — o K3 pensa por padrão e retorna tokens de raciocínio que você pode não estar esperando no tratamento da sua resposta.
A correção:
verifique sua contabilidade de tokens e seu parsing de resposta antes de assumir que o modelo está quebrado. A maioria das reclamações "K3 é caro" são, na verdade, "esqueci que tokens de raciocínio são tokens de saída."
O Contexto que Ninguém Deve Ignorar
A Moonshot está sediada em Pequim, fundada por Yang Zhilin, um ex-pesquisador do Google, e apoiada pela Alibaba.
https://x.com/kirillk_web3/status/2057528102368977328
Eles construíram um modelo de fronteira de 2,8 trilhões de parâmetros sob três anos de crescentes controles de exportação dos EUA sobre chips avançados.
Os analistas do Bank of America disseram diretamente: "Apesar das persistentes restrições de hardware/capacidade de computação na China, o K3 demonstra que o scaling de pré-treinamento, combinado com inovação arquitetônica, ainda pode entregar ganhos transformacionais para os modelos chineses de ponta."
E o momento não é acidental: o K3 foi lançado dias antes da Conferência Mundial de Inteligência Artificial de 2026 em Xangai.
A Pergunta de 27 de Julho
Os pesos serão lançados em 27 de julho. Essa data importa mais do que a data de lançamento.
Até lá, o K3 é um modelo de fronteira que você pode usar através de uma API — impressionante.
Em 27 de julho, ele se torna outra coisa: um modelo de classe de fronteira que qualquer um pode baixar, inspecionar, modificar e executar em seu próprio hardware. Sem API. Sem limites de uso. Sem termos de serviço. Sem retenção de prompt de 30 dias.
Essa é a história real. Não "China alcançou."
A China alcançou e o deu de graça.

Vale notar: reguladores chineses têm discutido controles de exportação de IA próprios. Se o K3 é o último lançamento de fronteira de peso aberto da China ou o primeiro de muitos, é genuinamente incerto neste momento.
Como Experimentar
Chat: kimi.com — K3 está online agora
API: Compatível com o SDK da OpenAI, então se você já está construindo com as toolchains da OpenAI ou Anthropic, a integração é uma mudança de configuração, não uma reescrita
Pesos: 27 de julho
A compatibilidade com o SDK é um negócio maior do que parece. Trocar modelos geralmente significa reescrever sua camada de integração. Aqui significa mudar uma URL base e uma string de modelo.
Como Instalar o Kimi Code (O Agente de Terminal)
Se você quiser o K3 rodando dentro da sua base de código real em vez de uma janela de chat, esta é a configuração.

Requisitos:
- Um computador (Mac, Windows ou Linux)
- Acesso ao terminal
- Conta Kimi — kimi.com
Passo 1 — Instalar o Kimi Code
Mac/Linux:
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
Windows (PowerShell):
1irm https://code.kimi.com/kimi-code/install.ps1 | iex
No Windows, instale o Git for Windows primeiro — o Kimi Code CLI usa o Git Bash agrupado como ambiente de shell.
Verifique a instalação:
1kimi --version
Devido ao Gatekeeper do macOS, a primeira execução pode demorar consideravelmente mais. Adicione seu aplicativo de terminal em Ajustes do Sistema → Privacidade e Segurança → Ferramentas de Desenvolvedor para acelerar os lançamentos posteriores.
Se você já tiver o uv instalado, pode instalar diretamente:
1uv tool install --python 3.13 kimi-cli
O Kimi Code CLI suporta Python 3.12–3.14, com 3.13 recomendado para melhor compatibilidade.
Passo 2 — Navegue até seu projeto e inicie
1cd seu-projeto2kimi
No primeiro lançamento, execute /login dentro da sessão para configurar sua fonte de API — ele abre uma janela do navegador para OAuth.
Passo 3 — Dê a ele uma tarefa
O Kimi Code agora está rodando dentro do seu projeto, com acesso direto de leitura/escrita a todos os arquivos. Descreva uma tarefa em inglês simples — ele planeja as etapas, edita o código, executa testes e relata o que fez.
O Que Isso Realmente Significa
Se você está executando cargas de trabalho de produção:
Teste antes de mudar. Benchmarks de fornecedores e desempenho no mundo real divergem constantemente. Escolha cinco tarefas reais, execute o K3 e seu modelo atual lado a lado, meça o custo por trabalho concluído — não o custo por token.

A matemática por tarefa é todo o argumento. A $3/$15, o K3 não é barato no papel. Com 21% menos tokens e saída de nível Fable, é barato onde importa.
27 de julho muda o cálculo. Pesos abertos significam auto-hospedagem, fine-tuning e dependência zero de a API de alguém ficar online ou os termos de alguém permanecerem favoráveis. Para qualquer coisa sensível, isso não é pouca coisa.
Conclusão
A fronteira costumava ser um lugar que laboratórios americanos construíam e todos os outros visitavam seis meses depois.
2,8 trilhões de parâmetros. 1M de contexto. Codificação de nível Fable 5 a preço de Sonnet. Construído sob controles de exportação, pelo laboratório de menor valor na sala, e dado de graça em 27 de julho.
A pergunta interessante não é se o K3 supera o Fable 5 em algum benchmark. É o que acontece com a economia dos modelos de fronteira fechados quando um de peso aberto os iguala.
Links
- Kimi K3: https://www.kimi.com
- Meu Telegram: https://t.me/kirillk_web3
- Meu Twitter/X: https://x.com/kirillk_web3
- Hospedagem Parceira: https://ishosting.com/affiliate/NzE0MiM2
Siga para mais informações sobre Vibe Coding. Obrigado por ler!





