O número principal não é a história
Em 27 de julho, a Moonshot AI publica os pesos completos do Kimi K3 sob uma licença MIT Modificada. A ficha técnica parece uma provocação: 2,8 trilhões de parâmetros, uma janela de contexto de um milhão de tokens e o título de maior modelo de pesos abertos já lançado, aproximadamente 75% maior que o DeepSeek V4 Pro.
Mas o tamanho é uma isca. A verdadeira história é uma mudança em quem controla o acesso à inteligência de nível de fronteira. Por três anos, os melhores modelos viveram atrás de uma API. Você pagava aluguel, o proprietário definia os termos e, se o fornecedor reajustasse o endpoint ou alterasse silenciosamente o comportamento do modelo, seu produto absorvia o dano.
Pesos abertos quebram esse acordo. Uma vez que os arquivos são públicos, nenhum laboratório pode retirar a capacidade. Esse único fato muda a economia para todos, incluindo pessoas que nunca baixarão um único fragmento.
A ficha técnica de relance
Especificação
Valor
Parâmetros
2,8 trilhões
Especialistas
896 no total, 16 ativos por token
Janela de contexto
1.048.576 tokens
Licença
MIT Modificada
Lançamento dos pesos
27 de julho
Tamanho vs DeepSeek V4 Pro
~75% maior
Eficiência de escala vs K2
~2,5x
Precificação
Taxa
Entrada (cache hit)
$0,30 / 1M tokens
Entrada (cache miss)
$3,00 / 1M tokens
Saída
$15,00 / 1M tokens
Como um modelo de 2,8T evita uma conta de 2,8T
Um modelo denso desse tamanho seria inutilizável. Executar todos os parâmetros em cada token é o muro que todos os modelos em escala de trilhões enfrentam: muito lento, muito caro, sem como contornar a física.
O K3 contorna isso com um design agressivo de Mistura de Especialistas. Dentro do modelo vivem 896 sub-redes especializadas. Em qualquer token dado, apenas 16 delas são ativadas. Você obtém o conhecimento armazenado de 2,8 trilhões de parâmetros enquanto paga o custo de inferência de um modelo de uma fração desse tamanho.
Isso é esparsidade, e o K3 aposta nisso mais fortemente do que qualquer modelo aberto antes dele. O K2 provou que a abordagem funcionava. O K3 a transforma na aposta central.

Dois artigos de pesquisa que fizeram o trabalho pesado
Duas mudanças arquiteturais tornam o resto possível, e ambas foram publicadas como pesquisa aberta antes do modelo ser lançado, o que rendeu à Moonshot credibilidade entre pesquisadores antes mesmo de qualquer benchmark aparecer.
A primeira é a Kimi Delta Attention, um mecanismo de atenção linear híbrido. Os custos da atenção padrão crescem quadraticamente à medida que o contexto fica mais longo, razão pela qual janelas de um milhão de tokens geralmente ficam em apresentações de marketing. A KDA escala de forma diferente, e essa diferença é a única razão pela qual uma janela de 1M existe a um preço que qualquer um pode realmente pagar.
A segunda é a Atenção Residual, um substituto para as conexões residuais padrão. A Moonshot a credita pelos ganhos consistentes de escala, permitindo construir modelos mais profundos sem a degradação usual. Pelos próprios números, a combinação oferece aproximadamente 2,5x a eficiência de escala do K2.
O que um milhão de tokens elimina

A maior parte da infraestrutura de recuperação em IA de produção existe como uma solução paliativa. Fragmentação, embeddings, bancos de dados vetoriais, pipelines RAG: tudo isso compensa modelos que não conseguem reter o suficiente na memória de trabalho de uma só vez.
Um milhão de tokens muda o padrão. Uma base de código inteira vai em um único prompt. Um ano de documentos internos. Cinquenta transcrições de vídeo. Tudo está na atenção simultaneamente, e o modelo raciocina sobre todo o corpus em vez de costurar fragmentos recuperados e esperar que as emendas segurem.
A visão nativa amplia ainda mais a superfície de entrada. Capturas de tela, fotos de quadros brancos, diagramas de arquitetura e gráficos são legíveis no mesmo contexto que o código e o texto ao redor. Não é acidente que as maiores vitórias do K3 em benchmarks vieram em codificação de front-end: o modelo vê o design e escreve a implementação dentro de uma janela de contexto.
A tabela de preços que importa mais que os benchmarks
As taxas listadas: $0,30 por milhão de tokens de entrada em cache hit, $3,00 em cache miss, $15,00 por milhão de tokens de saída, com um contexto de 1.048.576 tokens.
O número do cache é o que precisa ser observado. A Moonshot relata taxas de cache hit acima de 90% em longas sessões de codificação. Pense no que um agente realmente faz: ele relê o mesmo repositório repetidamente por horas. Sem cache, ele paga o preço total de entrada em cada passagem. Com ele, o custo de uma sessão longa colapsa aproximadamente 4x.
Agentes de horizonte longo vivem ou morrem exatamente nessa matemática. O K3 é construído para sessões que duram horas com supervisão mínima, navegando em um repositório, orquestrando ferramentas de terminal, verificando seu próprio trabalho. A estrutura de preços é o produto.
A pegadinha que ninguém deve ignorar
O K3 não tem modo econômico. O raciocínio está permanentemente ligado e fixado no máximo. Testadores independentes o viram queimar mais de 13.000 tokens de pensamento em uma solicitação trivial de SVG, aproximadamente $0,25 por uma consulta descartável.
A lição é o roteamento. Chamadas rápidas, baratas e de alto volume pertencem a modelos menores. O K3 justifica seu custo apenas quando o tamanho do contexto e a complexidade da tarefa justificam o raciocínio sempre ativo. Usá-lo como um endpoint de chat de propósito geral é jogar dinheiro fora.
Conectá-lo leva cinco minutos
A API é compatível com OpenAI. Troque a base_url e a chave, mantenha seu código existente:
1from openai import OpenAI2import os34client = OpenAI(5 api_key=os.environ["MOONSHOT_API_KEY"],6 base_url="https://api.moonshot.ai/v1",7)89completion = client.chat.completions.create(10 model="kimi-k3",11 messages=[{"role": "user", "content": "Apresente o Kimi K3 em uma frase."}],12)13print(completion.choices[0].message.content)
O raciocínio é configurado através de um campo de nível superior, atualmente aceitando apenas "max":
1completion = client.chat.completions.create(2 model="kimi-k3",3 reasoning_effort="max",4 messages=[{"role": "user", "content": "Prove que a raiz quadrada de 2 é irracional."}],5)6print(completion.choices[0].message.content)
O streaming funciona da maneira padrão, com o raciocínio chegando em um campo delta separado para que você possa renderizar o pensamento e a resposta de forma independente:
1stream = client.chat.completions.create(2 model="kimi-k3",3 messages=[{"role": "user", "content": "Explique por que o céu é azul."}],4 stream=True,5)67for chunk in stream:8 delta = chunk.choices[0].delta9 reasoning = getattr(delta, "reasoning_content", None)10 if reasoning:11 print(reasoning, end="", flush=True)12 if delta.content:13 print(delta.content, end="", flush=True)
A entrada de visão aceita imagens codificadas em base64 junto com texto na mesma mensagem. Este é o fluxo de trabalho de captura de tela para código em sua totalidade:
1import base642from pathlib import Path34image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()56completion = client.chat.completions.create(7 model="kimi-k3",8 messages=[9 {10 "role": "user",11 "content": [12 {13 "type": "image_url",14 "image_url": {"url": f"data:image/png;base64,{image_data}"},15 },16 {"type": "text", "text": "Reconstrua esta página de destino em HTML e Tailwind."},17 ],18 }19 ],20)21print(completion.choices[0].message.content)
Por que isso alcança pessoas que nunca tocam nos pesos
Aqui está a parte honesta: quase ninguém vai auto-hospedar 2,8 trilhões de parâmetros. Mesmo com esparsidade, a conta de hardware está muito além do alcance de hobbyistas, e também além da maioria das empresas.
Esse nunca foi o objetivo. Pesos públicos colocam um teto no que laboratórios fechados podem cobrar por capacidade comparável. Hospedeiros terceiros vão competir entre si para servir o K3 com margens de commodity, a mesma dinâmica que ocorreu com todos os grandes lançamentos abertos antes dele. Os preços em todo o mercado tendem à linha de base aberta.
O benefício chega até você através da fatura de qualquer provedor que você já usa, quer você baixe um arquivo ou não.
Um guia prático
Alimente-o com coisas inteiras. Repositórios completos para revisão, pastas de contratos inteiras, uma biblioteca de conteúdo inteira. Pare de fragmentar o que não precisa mais de fragmentação.
Execute-o por muito tempo. Enfileire sessões de engenharia de várias horas e verifique os resultados depois. O cache absorve o custo de cada releitura.
Aponte uma câmera para os problemas. Tire uma captura de tela de uma página de destino e peça a reconstrução. Fotografe um quadro branco e peça a implementação.
Mantenha o tráfego trivial longe dele. Um modelo que sempre raciocina no máximo é a ferramenta errada para chamadas rápidas e de alto volume. Roteie essas para outro lugar e guarde o K3 para trabalhos que merecem.
A contagem regressiva de dez dias
Por três anos, a fronteira foi algo que você alugava, em termos que você não definia, a preços que podiam mudar sem aviso.
Em 27 de julho, ela se torna um arquivo. E um arquivo, ao contrário de uma assinatura, é algo que você possui.





