O Kimi K3 acabou com a era das assinaturas de IA

@0xDominiqq
INGLÊShá 3 dias · 18 de jul. de 2026
275K
83
12
4
176

TL;DR

O Kimi K3 da Moonshot AI apresenta um modelo de pesos abertos com 2,8 trilhões de parâmetros e uma janela de contexto de um milhão de tokens, utilizando Mixture-of-Experts e mecanismos de atenção inovadores para reduzir custos e desafiar o domínio de APIs fechadas.

O número principal não é a história

Em 27 de julho, a Moonshot AI publica os pesos completos do Kimi K3 sob uma licença MIT modificada. A ficha técnica parece um exibicionismo: 2,8 trilhões de parâmetros, uma janela de contexto de um milhão de tokens e o título de maior modelo de peso aberto já lançado, aproximadamente 75% maior que o DeepSeek V4 Pro.

Mas o tamanho é uma isca. A verdadeira história é uma mudança em quem controla o acesso à inteligência de ponta. Por três anos, os melhores modelos viveram atrás de uma API. Você pagava aluguel, o locador definia os termos e, se o fornecedor remarcasse o endpoint ou alterasse silenciosamente o comportamento do modelo, seu produto absorvia o dano.

Os pesos abertos quebram esse acordo. Uma vez que os arquivos são públicos, nenhum laboratório pode retirar a capacidade de volta. Esse único fato muda a economia para todos, incluindo pessoas que nunca baixarão um único fragmento.

A ficha técnica em resumo

Especificação

Valor

Parâmetros

2,8 trilhões

Especialistas

896 total, 16 ativos por token

Janela de contexto

1.048.576 tokens

Licença

MIT modificada

Lançamento dos pesos

27 de julho

Tamanho vs DeepSeek V4 Pro

~75% maior

Eficiência de escalonamento vs K2

~2,5x

Precificação

Taxa

Entrada (cache hit)

US$ 0,30 / 1M tokens

Entrada (cache miss)

US$ 3,00 / 1M tokens

Saída

US$ 15,00 / 1M tokens

Como um modelo de 2,8T evita uma conta de 2,8T

Um modelo denso desse tamanho seria inutilizável. Executar cada parâmetro em cada token é o muro que todos os modelos em escala de trilhões enfrentam: muito lento, muito caro, sem como contornar a física.

O K3 o contorna com um design agressivo de Mixture-of-Experts. Dentro do modelo vivem 896 sub-redes especialistas. Em qualquer token, apenas 16 delas são ativadas. Você obtém o conhecimento armazenado de 2,8 trilhões de parâmetros enquanto paga o custo de inferência de um modelo de fração desse tamanho.

Isso é esparsidade, e o K3 depende dela mais do que qualquer modelo aberto antes dele. O K2 provou que a abordagem funcionava. O K3 a transforma na aposta central.

Dominique - inline image

Dois artigos de pesquisa que fizeram o trabalho pesado

Duas mudanças arquiteturais tornam o resto possível, e ambas foram publicadas como pesquisa aberta antes do modelo ser lançado, o que rendeu à Moonshot credibilidade entre pesquisadores antes mesmo de qualquer benchmark aparecer.

A primeira é a Kimi Delta Attention, um mecanismo de atenção linear híbrida. Os custos de atenção padrão crescem quadraticamente à medida que o contexto fica mais longo, e é por isso que janelas de um milhão de tokens geralmente ficam apenas em apresentações de marketing. O KDA escala de forma diferente, e essa diferença é a única razão pela qual uma janela de 1M existe a um preço que alguém pode realmente pagar.

A segunda é a Attention Residuals, uma substituição para conexões residuais padrão. A Moonshot a credita pelos ganhos consistentes de escalonamento, permitindo construir modelos mais profundos sem a degradação usual. Pelos próprios números, a combinação oferece aproximadamente 2,5x a eficiência de escalonamento do K2.

O que um milhão de tokens elimina

Dominique - inline image

A maior parte da infraestrutura de recuperação em IA de produção existe como uma solução alternativa. Fragmentação, embeddings, bancos de dados vetoriais, pipelines RAG: tudo isso compensa modelos que não conseguem armazenar o suficiente na memória de trabalho de uma só vez.

Um milhão de tokens muda o padrão. Uma base de código inteira vai em um único prompt. Um ano de documentos internos. Cinquenta transcrições de vídeo. Tudo está na atenção simultaneamente, e o modelo raciocina sobre todo o corpus em vez de costurar fragmentos recuperados e esperar que as emendas segurem.

A visão nativa amplia ainda mais a superfície de entrada. Capturas de tela, fotos de quadro branco, diagramas de arquitetura e gráficos são legíveis no mesmo contexto que o código e o texto ao redor. Não é acidente que as vitórias de benchmark mais fortes do K3 vieram em codificação de front-end: o modelo vê o design e escreve a implementação dentro de uma janela de contexto.

A tabela de preços que importa mais que os benchmarks

As taxas listadas: US$ 0,30 por milhão de tokens de entrada em cache hit, US$ 3,00 em cache miss, US$ 15,00 por milhão de tokens de saída, com um contexto de 1.048.576 tokens.

O número do cache é o que deve ser observado. A Moonshot relata taxas de cache hit acima de 90% em longas sessões de codificação. Pense no que um agente realmente faz: ele relê o mesmo repositório repetidamente por horas. Sem cache, ele paga o preço total de entrada em cada passagem. Com ele, o custo de uma sessão longa cai aproximadamente 4x.

Agentes de horizonte longo vivem ou morrem exatamente por essa matemática. O K3 é construído para sessões que duram horas com supervisão mínima, navegando em um repositório, orquestrando ferramentas de terminal, verificando seu próprio trabalho. A estrutura de preços é o produto.

A pegadinha que ninguém deve ignorar

O K3 não tem modo econômico. O raciocínio está permanentemente ligado e fixado no máximo. Testadores independentes o viram queimar mais de 13.000 tokens de raciocínio em uma solicitação trivial de SVG, aproximadamente US$ 0,25 para uma consulta descartável.

A lição é o roteamento. Chamadas rápidas, baratas e de alto volume pertencem a modelos menores. O K3 ganha seu custo apenas quando o tamanho do contexto e a complexidade da tarefa justificam o raciocínio sempre ativo. Usá-lo como um endpoint de chat de uso geral é queimar dinheiro.

Conectá-lo leva cinco minutos

A API é compatível com a OpenAI. Troque a base_url e a chave, mantenha seu código existente:

text
1from openai import OpenAI
2import os
3
4client = OpenAI(
5 api_key=os.environ["MOONSHOT_API_KEY"],
6 base_url="https://api.moonshot.ai/v1",
7)
8
9completion = client.chat.completions.create(
10 model="kimi-k3",
11 messages=[{"role": "user", "content": "Apresente o Kimi K3 em uma frase."}],
12)
13print(completion.choices[0].message.content)

O raciocínio é configurado através de um campo de nível superior, atualmente aceitando apenas "max":

text
1completion = client.chat.completions.create(
2 model="kimi-k3",
3 reasoning_effort="max",
4 messages=[{"role": "user", "content": "Prove que a raiz quadrada de 2 é irracional."}],
5)
6print(completion.choices[0].message.content)

O streaming funciona da maneira padrão, com o raciocínio chegando em um campo delta separado para que você possa renderizar o pensamento e a resposta de forma independente:

text
1stream = client.chat.completions.create(
2 model="kimi-k3",
3 messages=[{"role": "user", "content": "Explique por que o céu é azul."}],
4 stream=True,
5)
6
7for chunk in stream:
8 delta = chunk.choices[0].delta
9 reasoning = getattr(delta, "reasoning_content", None)
10 if reasoning:
11 print(reasoning, end="", flush=True)
12 if delta.content:
13 print(delta.content, end="", flush=True)

A entrada de visão usa imagens codificadas em base64 junto com texto na mesma mensagem. Este é o fluxo de trabalho de captura de tela para código em sua totalidade:

text
1import base64
2from pathlib import Path
3
4image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()
5
6completion = client.chat.completions.create(
7 model="kimi-k3",
8 messages=[
9 {
10 "role": "user",
11 "content": [
12 {
13 "type": "image_url",
14 "image_url": {"url": f"data:image/png;base64,{image_data}"},
15 },
16 {"type": "text", "text": "Recrie esta página de destino em HTML e Tailwind."},
17 ],
18 }
19 ],
20)
21print(completion.choices[0].message.content)

Por que isso atinge pessoas que nunca tocam nos pesos

Aqui está a parte honesta: quase ninguém hospedará por conta própria 2,8 trilhões de parâmetros. Mesmo com esparsidade, a conta de hardware está muito além do alcance de amadores, e além da maioria das empresas também.

Esse nunca foi o ponto. Pesos públicos colocam um teto sobre o que os laboratórios fechados podem cobrar por capacidade comparável. Hosts terceiros competirão entre si para servir o K3 com margens de commodity, a mesma dinâmica que ocorreu com todos os grandes lançamentos abertos antes dele. Os preços em todo o mercado se aproximam da linha de base aberta.

O benefício chega até você através da fatura do provedor que você já usa, quer você baixe um arquivo ou não.

Um guia prático

Alimente-o com coisas inteiras. Repositórios completos para revisão, pastas de contratos inteiras, uma biblioteca de conteúdo inteira. Pare de fragmentar o que não requer mais fragmentação.

Execute-o por muito tempo. Enfileire sessões de engenharia de várias horas e verifique os resultados depois. O cache absorve o custo de cada releitura.

Aponte uma câmera para os problemas. Capture uma página de destino e peça a reconstrução. Fotografe um quadro branco e peça a implementação.

Mantenha o tráfego trivial longe dele. Um modelo que sempre raciocina no máximo é a ferramenta errada para chamadas rápidas e de alto volume. Roteie-as para outro lugar e guarde o K3 para trabalhos que o merecem.

A contagem regressiva de dez dias

Por três anos, a fronteira era algo que você alugava, em termos que você não definia, a preços que podiam mudar sem aviso.

Em 27 de julho, ela se torna um arquivo. E um arquivo, ao contrário de uma assinatura, é algo que você possui.

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais