O número principal não é a história
Em 27 de julho, a Moonshot AI publica os pesos completos do Kimi K3 sob uma licença MIT modificada. A ficha técnica parece um exibicionismo: 2,8 trilhões de parâmetros, uma janela de contexto de um milhão de tokens e o título de maior modelo de peso aberto já lançado, aproximadamente 75% maior que o DeepSeek V4 Pro.
Mas o tamanho é uma isca. A verdadeira história é uma mudança em quem controla o acesso à inteligência de ponta. Por três anos, os melhores modelos viveram atrás de uma API. Você pagava aluguel, o locador definia os termos e, se o fornecedor remarcasse o endpoint ou alterasse silenciosamente o comportamento do modelo, seu produto absorvia o dano.
Os pesos abertos quebram esse acordo. Uma vez que os arquivos são públicos, nenhum laboratório pode retirar a capacidade de volta. Esse único fato muda a economia para todos, incluindo pessoas que nunca baixarão um único fragmento.
A ficha técnica em resumo
Especificação
Valor
Parâmetros
2,8 trilhões
Especialistas
896 total, 16 ativos por token
Janela de contexto
1.048.576 tokens
Licença
MIT modificada
Lançamento dos pesos
27 de julho
Tamanho vs DeepSeek V4 Pro
~75% maior
Eficiência de escalonamento vs K2
~2,5x
Precificação
Taxa
Entrada (cache hit)
US$ 0,30 / 1M tokens
Entrada (cache miss)
US$ 3,00 / 1M tokens
Saída
US$ 15,00 / 1M tokens
Como um modelo de 2,8T evita uma conta de 2,8T
Um modelo denso desse tamanho seria inutilizável. Executar cada parâmetro em cada token é o muro que todos os modelos em escala de trilhões enfrentam: muito lento, muito caro, sem como contornar a física.
O K3 o contorna com um design agressivo de Mixture-of-Experts. Dentro do modelo vivem 896 sub-redes especialistas. Em qualquer token, apenas 16 delas são ativadas. Você obtém o conhecimento armazenado de 2,8 trilhões de parâmetros enquanto paga o custo de inferência de um modelo de fração desse tamanho.
Isso é esparsidade, e o K3 depende dela mais do que qualquer modelo aberto antes dele. O K2 provou que a abordagem funcionava. O K3 a transforma na aposta central.

Dois artigos de pesquisa que fizeram o trabalho pesado
Duas mudanças arquiteturais tornam o resto possível, e ambas foram publicadas como pesquisa aberta antes do modelo ser lançado, o que rendeu à Moonshot credibilidade entre pesquisadores antes mesmo de qualquer benchmark aparecer.
A primeira é a Kimi Delta Attention, um mecanismo de atenção linear híbrida. Os custos de atenção padrão crescem quadraticamente à medida que o contexto fica mais longo, e é por isso que janelas de um milhão de tokens geralmente ficam apenas em apresentações de marketing. O KDA escala de forma diferente, e essa diferença é a única razão pela qual uma janela de 1M existe a um preço que alguém pode realmente pagar.
A segunda é a Attention Residuals, uma substituição para conexões residuais padrão. A Moonshot a credita pelos ganhos consistentes de escalonamento, permitindo construir modelos mais profundos sem a degradação usual. Pelos próprios números, a combinação oferece aproximadamente 2,5x a eficiência de escalonamento do K2.
O que um milhão de tokens elimina

A maior parte da infraestrutura de recuperação em IA de produção existe como uma solução alternativa. Fragmentação, embeddings, bancos de dados vetoriais, pipelines RAG: tudo isso compensa modelos que não conseguem armazenar o suficiente na memória de trabalho de uma só vez.
Um milhão de tokens muda o padrão. Uma base de código inteira vai em um único prompt. Um ano de documentos internos. Cinquenta transcrições de vídeo. Tudo está na atenção simultaneamente, e o modelo raciocina sobre todo o corpus em vez de costurar fragmentos recuperados e esperar que as emendas segurem.
A visão nativa amplia ainda mais a superfície de entrada. Capturas de tela, fotos de quadro branco, diagramas de arquitetura e gráficos são legíveis no mesmo contexto que o código e o texto ao redor. Não é acidente que as vitórias de benchmark mais fortes do K3 vieram em codificação de front-end: o modelo vê o design e escreve a implementação dentro de uma janela de contexto.
A tabela de preços que importa mais que os benchmarks
As taxas listadas: US$ 0,30 por milhão de tokens de entrada em cache hit, US$ 3,00 em cache miss, US$ 15,00 por milhão de tokens de saída, com um contexto de 1.048.576 tokens.
O número do cache é o que deve ser observado. A Moonshot relata taxas de cache hit acima de 90% em longas sessões de codificação. Pense no que um agente realmente faz: ele relê o mesmo repositório repetidamente por horas. Sem cache, ele paga o preço total de entrada em cada passagem. Com ele, o custo de uma sessão longa cai aproximadamente 4x.
Agentes de horizonte longo vivem ou morrem exatamente por essa matemática. O K3 é construído para sessões que duram horas com supervisão mínima, navegando em um repositório, orquestrando ferramentas de terminal, verificando seu próprio trabalho. A estrutura de preços é o produto.
A pegadinha que ninguém deve ignorar
O K3 não tem modo econômico. O raciocínio está permanentemente ligado e fixado no máximo. Testadores independentes o viram queimar mais de 13.000 tokens de raciocínio em uma solicitação trivial de SVG, aproximadamente US$ 0,25 para uma consulta descartável.
A lição é o roteamento. Chamadas rápidas, baratas e de alto volume pertencem a modelos menores. O K3 ganha seu custo apenas quando o tamanho do contexto e a complexidade da tarefa justificam o raciocínio sempre ativo. Usá-lo como um endpoint de chat de uso geral é queimar dinheiro.
Conectá-lo leva cinco minutos
A API é compatível com a OpenAI. Troque a base_url e a chave, mantenha seu código existente:
1from openai import OpenAI2import os34client = OpenAI(5 api_key=os.environ["MOONSHOT_API_KEY"],6 base_url="https://api.moonshot.ai/v1",7)89completion = client.chat.completions.create(10 model="kimi-k3",11 messages=[{"role": "user", "content": "Apresente o Kimi K3 em uma frase."}],12)13print(completion.choices[0].message.content)
O raciocínio é configurado através de um campo de nível superior, atualmente aceitando apenas "max":
1completion = client.chat.completions.create(2 model="kimi-k3",3 reasoning_effort="max",4 messages=[{"role": "user", "content": "Prove que a raiz quadrada de 2 é irracional."}],5)6print(completion.choices[0].message.content)
O streaming funciona da maneira padrão, com o raciocínio chegando em um campo delta separado para que você possa renderizar o pensamento e a resposta de forma independente:
1stream = client.chat.completions.create(2 model="kimi-k3",3 messages=[{"role": "user", "content": "Explique por que o céu é azul."}],4 stream=True,5)67for chunk in stream:8 delta = chunk.choices[0].delta9 reasoning = getattr(delta, "reasoning_content", None)10 if reasoning:11 print(reasoning, end="", flush=True)12 if delta.content:13 print(delta.content, end="", flush=True)
A entrada de visão usa imagens codificadas em base64 junto com texto na mesma mensagem. Este é o fluxo de trabalho de captura de tela para código em sua totalidade:
1import base642from pathlib import Path34image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()56completion = client.chat.completions.create(7 model="kimi-k3",8 messages=[9 {10 "role": "user",11 "content": [12 {13 "type": "image_url",14 "image_url": {"url": f"data:image/png;base64,{image_data}"},15 },16 {"type": "text", "text": "Recrie esta página de destino em HTML e Tailwind."},17 ],18 }19 ],20)21print(completion.choices[0].message.content)
Por que isso atinge pessoas que nunca tocam nos pesos
Aqui está a parte honesta: quase ninguém hospedará por conta própria 2,8 trilhões de parâmetros. Mesmo com esparsidade, a conta de hardware está muito além do alcance de amadores, e além da maioria das empresas também.
Esse nunca foi o ponto. Pesos públicos colocam um teto sobre o que os laboratórios fechados podem cobrar por capacidade comparável. Hosts terceiros competirão entre si para servir o K3 com margens de commodity, a mesma dinâmica que ocorreu com todos os grandes lançamentos abertos antes dele. Os preços em todo o mercado se aproximam da linha de base aberta.
O benefício chega até você através da fatura do provedor que você já usa, quer você baixe um arquivo ou não.
Um guia prático
Alimente-o com coisas inteiras. Repositórios completos para revisão, pastas de contratos inteiras, uma biblioteca de conteúdo inteira. Pare de fragmentar o que não requer mais fragmentação.
Execute-o por muito tempo. Enfileire sessões de engenharia de várias horas e verifique os resultados depois. O cache absorve o custo de cada releitura.
Aponte uma câmera para os problemas. Capture uma página de destino e peça a reconstrução. Fotografe um quadro branco e peça a implementação.
Mantenha o tráfego trivial longe dele. Um modelo que sempre raciocina no máximo é a ferramenta errada para chamadas rápidas e de alto volume. Roteie-as para outro lugar e guarde o K3 para trabalhos que o merecem.
A contagem regressiva de dez dias
Por três anos, a fronteira era algo que você alugava, em termos que você não definia, a preços que podiam mudar sem aviso.
Em 27 de julho, ela se torna um arquivo. E um arquivo, ao contrário de uma assinatura, é algo que você possui.





