Kimi K3 + Engenharia de Grafos: 85% de redução nos custos de tokens e 18% mais precisão

@noisyb0y1
INGLÊShá 1 dia · 22/07/2026
100K
160
20
12
330

TL;DR

Um guia abrangente para construir arquiteturas de IA usando Kimi K3 e Engenharia de Grafos, alcançando 85% menos custos de tokens e 18% mais precisão em comparação com o RAG tradicional.

A maioria das pessoas usa IA como um motor de busca caro. Abre um chat, faz uma pergunta, obtém uma resposta, fecha o separador. No dia seguinte, começam do zero porque a IA não se lembra de nada.

Mas há programadores a ganhar 10.000 a 20.000 dólares por mês simplesmente porque o seu sistema de IA responde duas vezes mais rápido, dá respostas mais precisas e custa 85% menos que os concorrentes. Eles não estão a usar nenhum modelo secreto. Construíram a arquitetura certa em torno de um modelo normal.

Chama-se Kimi K3 + Graph Engineering. A Microsoft passou anos a provar que funciona - 85% menos custos, 18% melhor precisão.

Eis como construir isto do zero numa semana.

Porque é que o RAG normal deixa de funcionar a certa altura

A maioria dos programadores constrói sistemas de IA da mesma maneira. O utilizador pergunta algo, o sistema pesquisa documentos, encontra fragmentos de texto semelhantes, o modelo gera uma resposta. Funciona bem para perguntas simples. Desmorona-se completamente para perguntas complexas.

Pergunta "porque é que as nossas vendas caíram em março?" e o RAG normal encontra documentos com as palavras "vendas" e "março". Encontra fragmentos. Não encontra a cadeia de causas.

text
1Resposta do RAG normal:
2Aqui estão 5 documentos que mencionam vendas em março.
3
4Resposta do Graph Engineering:
5As vendas caíram devido a um atraso no lançamento
6causado por um problema de fornecedor
7desencadeado por uma falha no armazém
8que gerou críticas negativas
9que reduziu a conversão em 23%.

Mesmo modelo. Mesmos dados. Resultado completamente diferente - porque um sistema pesquisa texto e o outro pesquisa conexões entre factos reais.

Isto é o que a Microsoft, Stanford e a Anthropic descobriram de forma independente. E é por isso que os programadores que entendem isto estão a avançar mais rápido que todos os outros.

O que é realmente um grafo de conhecimento

Um grafo de conhecimento armazena informação como triplos:

text
1Sujeito → Relação → Objeto

Exemplos reais:

text
1Kimi K3 → desenvolvido por → Moonshot AI
2Kimi K3 → janela de contexto → 1 milhão de tokens
3Microsoft → construiu → GraphRAG
4GraphRAG → reduz custos em → 85%
5Anthropic → criou → Claude
6Claude → suporta → MCP

Cada pedaço de informação é uma conexão explícita entre duas entidades. Não é um parágrafo de texto que pode conter esta informação algures - é um facto estruturado que podes consultar diretamente.

text
1Base de dados normal:
2Tabela de empresas
3Tabela de produtos
4Sem conexões explícitas entre eles
5
6Grafo de conhecimento:
7Empresa → criou → Produto
8Produto → compete com → Outro Produto
9Outro Produto → propriedade de → Outra Empresa
10Empresa → investiu em → Outra Empresa

O grafo não armazena apenas factos. Armazena como os factos se conectam uns aos outros. É isso que torna o raciocínio complexo possível - e o que o RAG normal nunca consegue fazer, por melhor que seja o modelo.

O Stanford AI Lab define um grafo de conhecimento como uma base de dados estruturada onde a informação é representada como uma rede de entidades e relações em triplos sujeito-relação-objeto. Usado em pesquisa, recomendações e tarefas onde precisas de encontrar conexões indiretas.

ai.stanford.edu/blog/introduction-to-knowledge-graphs

Noisy - inline image

Porque é que o Kimi K3 é o modelo certo para esta arquitetura

A maioria dos modelos tem janelas de contexto de 128.000 a 200.000 tokens. O Kimi K3 tem um milhão. Isto não é apenas um número impressionante - é uma vantagem arquitetónica especificamente para Graph Engineering.

Um grafo devolve subgrafos, cadeias de evidência, listas de entidades conectadas. Tudo isto ocupa espaço na janela de contexto. Com um contexto pequeno, tens de cortar o grafo. Com um milhão de tokens, a parte relevante do grafo cabe numa sessão.

text
1Arquitetura do Kimi K3:
22,8 biliões de parâmetros totais
3896 especialistas em MoE, 16 ativos por token
4Janela de contexto de 1.048.576 tokens
5Análise de imagem nativa
6Kimi Delta Attention para sequências longas
7Resíduos de Atenção para preservar sinais entre camadas

kimi.com/blog/kimi-k3

Noisy - inline image

Kimi Delta Attention é um mecanismo híbrido que reduz o custo de trabalhar com sequências longas. Para Graph Engineering, isto significa que o sistema pode passar ao modelo grandes subgrafos, longas listas de evidências, dezenas de documentos e estrutura de repositório sem aumentos de custo catastróficos.

Mas mesmo um milhão de tokens é memória temporária. Após a sessão, tudo desaparece.

text
1Contexto de 1M tokens = grande superfície de trabalho por sessão
2Grafo de conhecimento = memória estruturada permanente entre sessões

O Kimi K3 dá escala e raciocínio. O Graph Engineering dá memória e estrutura. Juntos, resolvem problemas diferentes ao mesmo tempo.

Documento 1 - Microsoft GraphRAG

github.com/microsoft/graphrag

arxiv.org/abs/2603.22528

Noisy - inline image

A Microsoft construiu o GraphRAG e tornou-o open-source. Os números da sua investigação são a evidência mais concreta disponível sobre o que o Graph Engineering realmente entrega versus o RAG normal.

A arquitetura converte texto não estruturado num grafo de conhecimento completo:

text
1Carregar documentos
2
3Fragmentar documentos
4
5Extrair entidades e relações
6
7Construir grafo
8
9Detetar comunidades
10
11Gerar relatórios de comunidade
12
13Incorporar entidades e relatórios
14
15Pesquisa Local / Pesquisa Global

Ideia chave da Microsoft: o RAG normal responde bem a perguntas locais - encontra informação sobre esta entidade específica. Falha em perguntas globais - quais são os principais padrões nestes 10.000 documentos, o que conecta estes eventos em todo o conjunto de dados.

O Graph Engineering responde a ambas.

text
1Pesquisa Local | o que aconteceu com o fornecedor X em março
2 | encontra o nó específico e as suas conexões
3
4Pesquisa Global | quais são os principais padrões de risco
5 | em todas as nossas relações com fornecedores
6 | encontra padrões em todo o grafo

Números reais da pesquisa ChatP&ID:

text
1Melhoria de precisão | 18% superior à abordagem de documento bruto
2Redução de custo de token | 85% inferior ao carregar ficheiros estruturados diretamente
3Custo por tarefa | aproximadamente $0,004 na configuração testada

Documento 2 - Três modos de combinar LLM e Grafo de Conhecimento

arxiv.org/abs/2306.08302

Um dos artigos teóricos mais fortes sobre a combinação de modelos de linguagem e grafos de conhecimento descreve três modos:

text
1Modo 1 - LLM aprimorado por KG
2O grafo dá ao modelo factos e estrutura
3O modelo gera melhores respostas
4
5Modo 2 - KG aumentado por LLM
6O modelo cria, limpa e expande o grafo
7O grafo melhora com o tempo
8
9Modo 3 - LLM + KG em sinergia
10O grafo e o modelo melhoram-se mutuamente
11Modo mais poderoso

Para Kimi K3 + Graph Engineering, o terceiro modo funciona melhor. O Kimi K3 extrai novos factos e adiciona-os ao grafo. O grafo dá ao Kimi K3 contexto estruturado para raciocínio. O ciclo repete-se e o sistema melhora a cada iteração.

Documento 3 - Memória Relacional para modelos de linguagem

direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00476

MIT Press, Transactions of the Association for Computational Linguistics.

A investigação mostra o que acontece quando conectas um modelo de linguagem a uma memória relacional - um grafo de conhecimento de relações em vez de fragmentos de texto.

text
1Contexto de texto
2
3Extrair relações relevantes do grafo
4
5Memória Relacional
6
7Modelo de linguagem
8
9Geração mais coerente e precisa

Descoberta chave: modelos com acesso a estruturas de relação explícitas produzem texto mais coerente e cometem menos erros lógicos do que modelos que trabalham apenas com texto.

Esta é a explicação científica para o porquê do Graph Engineering funcionar. O modelo não tem de inferir relações a partir do texto. As relações são explícitas no grafo. O modelo usa-as diretamente.

Publicado sob CC BY 4.0 - pode ser usado livremente com atribuição.

Documento 4 - Leis de Escala para Engenharia de Grafos de Conhecimento

arxiv.org/abs/2505.16276

Investigação que comparou 26 modelos open-source em tarefas de engenharia de grafos de conhecimento. A conclusão é uma das descobertas mais importantes no campo:

text
1Modelo maior + grafo mau | piores resultados
2Modelo menor + grafo bom | melhores resultados

O grafo certo vence o modelo maior. Sempre.

A mesma conclusão a que a Microsoft chegou com o GraphRAG e a Anthropic com o Claude Code - o sistema em torno do modelo determina o resultado mais do que o próprio modelo. O Graph Engineering é a implementação mais concreta desse princípio.

Documento 5 - Agente-como-Grafo

arxiv.org/abs/2511.18194

Este artigo mostra como representar não apenas conhecimento, mas agentes e ferramentas como nós num grafo.

text
1Pergunta do utilizador
2
3Grafo de capacidades
4
5Selecionar agente de pesquisa
6
7Selecionar ferramenta GitHub
8
9Selecionar ferramenta ArXiv
10
11Selecionar ferramenta de base de dados gráfica
12
13Kimi K3 coordena a execução

Os autores reportam uma melhoria de Recall@5 de 14,9% e de nDCG@5 de 14,6% em comparação com retrievers comparáveis no LiveMCPBenchmark.

Para o Kimi K3, isto significa que o grafo pode gerir não apenas conhecimento, mas também qual agente e qual ferramenta usar para cada tarefa específica.

Documento 6 - Kimi Code e Agent SDK

github.com/MoonshotAI/kimi-code

github.com/MoonshotAI/kimi-agent-sdk

Kimi Code é um agente de terminal que pode:

text
1Ler e editar código
2Executar comandos de shell
3Pesquisar ficheiros
4Buscar páginas web
5Analisar o resultado de cada passo
6Escolher independentemente a próxima ação
7Suporta MCP
8Hooks de ciclo de vida
9Modos de aprovação

O Kimi Agent SDK permite-te usar o Kimi Code como base do teu próprio agente. Reutiliza as ferramentas, habilidades e configuração do servidor MCP do Kimi Code.

Para Graph Engineering, esta é uma camada de execução pronta a usar. O grafo fornece conhecimento estruturado e caminhos de raciocínio. O Kimi Code toma ações no ambiente real. O SDK une tudo.

A arquitetura completa do sistema

text
1Passo 1 - Camada de Ingestão
2PDFs, sites, bases de dados, APIs, Slack, Notion
3
4
5Passo 2 - Camada de Extração
6Kimi K3 extrai entidades e relações
7
8{
9 "entity": "Kimi K3",
10 "type": "AI model",
11 "relations": [
12 {
13 "predicate": "developed_by",
14 "object": "Moonshot AI",
15 "confidence": 0.98
16 }
17 ]
18}
19
20
21
22Passo 3 - Camada de Resolução
23O sistema resolve se estas são a mesma entidade:
24Moonshot AI / Moonshot / Beijing Moonshot / 月之暗面
25
26
27
28Passo 4 - Armazenamento do Grafo
29Neo4j / Memgraph / Amazon Neptune / PostgreSQL
30
31
32
33Passo 5 - Camada de Recuperação
34Pesquisa vetorial + Pesquisa de entidade + Pesquisa de caminho
35Pesquisa de comunidade + Filtragem temporal
36
37
38
39Passo 6 - Camada de Agente
40Kimi K3:
41Planeia a abordagem
42Escolhe a ferramenta certa
43Gera consultas Cypher ou SPARQL
44Analisa subgrafo
45Executa pesquisa web
46Tira conclusões
47Identifica a próxima lacuna de conhecimento
48
49
50
51Passo 7 - Camada de Verificação
52Verifica a cobertura de evidências
53Encontra contradições
54Avalia a confiança
55Verifica fontes
56
57
58
59Passo 8 - Atualização do Grafo
60Novos factos adicionados ao grafo
61Contradições sinalizadas
62Informação antiga recebe timestamp

Este é um ciclo fechado de conhecimento-ação. O Kimi K3 não lê apenas o grafo. Identifica o que está em falta, forma sub-perguntas, seleciona um nó ou subgrafo, executa uma pesquisa, verifica o resultado, adiciona um novo facto e reavalia a hipótese.

Cinco prompts que executam todo o pipeline

Graph Engineering não substitui prompts. Usa-os em cada fase específica.

Prompt 1 - Extração

text
1Extraia todas as organizações, pessoas, produtos e eventos.
2
3Para cada entidade, retorne:
4- canonical_name
5- type
6- description
7- source
8
9Para cada relação, retorne:
10- source_entity
11- relation_type
12- target_entity
13- evidence
14- confidence_score

Prompt 2 - Normalização

text
1Compare as seguintes entidades.
2Determine se se referem a:
3- a mesma entidade
4- entidades relacionadas mas diferentes
5- entidades não relacionadas
6
7Retorne o nome canónico e a explicação.
8Não fundir entidades sem evidência clara.

Prompt 3 - Consulta ao Grafo

text
1Traduza a pergunta do utilizador para uma consulta Cypher.
2Use apenas relações presentes no esquema.
3Não invente etiquetas ou propriedades.
4Retorne a consulta e a explicação da lógica.

Prompt 4 - Resposta Fundamentada

text
1Responda usando apenas os caminhos do grafo recuperados.
2Para cada conclusão:
3- identifique os nós de suporte
4- identifique o caminho da relação
5- declare a incerteza claramente
6- não infira causalidade de correlação

Prompt 5 - Manutenção do Grafo

text
1Compare novos factos com o grafo existente.
2Classifique cada facto como:
3- novo
4- duplicado
5- contradição
6- atualização
7- incerto
8
9Não substitua factos existentes sem evidência.

Cinco negócios que podes construir neste sistema

1 - Pesquisa de Investimento

text
1Empresa
2├── fundadores e os seus projetos anteriores
3├── investidores e o seu portfólio
4├── concorrentes e as suas estratégias
5├── riscos legais
6├── patentes
7├── vagas de emprego como sinal de estratégia
8└── métricas financeiras ao longo do tempo

O Kimi K3 lê relatórios e notícias. O grafo mostra conexões ocultas entre empresas, investidores partilhados, dependências de fornecedores e sinais de pessoal. Clientes: fundos de investimento, escritórios de advogados, consultores de M&A. $2.000 a $10.000 por cliente por mês.

2 - Inteligência de Engenharia

text
1Commits do GitHub + tickets Jira + tarefas Linear
2
3Grafo do Trabalho de Engenharia
4
5Detecção de incidentes 5x mais rápida
650% menos tempo de reunião
7Notas de lançamento automáticas

anthropic.com/customers/graph

A LaunchNotes já vende isto. O mercado é todas as equipas de engenharia que usam mais do que uma ferramenta de gestão de projetos.

3 - Motor de Pesquisa Científica

text
1Artigo → autor → instituição → método → conjunto de dados → resultado
2
3Quais métodos GraphRAG usam deteção de comunidades,
4em que conjuntos de dados foram testados
5e quais artigos se contradizem

A pesquisa normal dá uma lista de documentos. Um sistema de grafo constrói um mapa de evidências e contradições.

4 - Grafo de Ameaças Cibernéticas

text
1IP → domínio → certificado → malware → campanha → ator
2
3Kimi K3 analisa relatórios de ameaças
4Mapeia indicadores entre fontes
5Explica caminhos de ataque
6Atualiza o grafo de ameaças automaticamente

5 - Sistema Operacional de Conhecimento Pessoal

text
1Pessoas ↔ Reuniões ↔ Projetos ↔ Documentos ↔ Decisões ↔ Promessas
2
3Perguntas que o Kimi K3 pode responder:
4Quem está a bloquear esta tarefa?
5Que decisão tomámos e em que se baseava?
6O que prometi fazer este mês?
7Que suposições antigas já não são válidas?

Por onde começar esta semana

text
1Dia 1 | instalar Neo4j localmente
2 | ler o README do DSPy
3 | github.com/stanfordnlp/dspy
4 | entender a diferença entre fazer prompting
5 | e programar um sistema
6
7Dia 2 | pegar num conjunto de documentos
8 | executar Kimi K3 via API
9 | extrair primeiras entidades e relações
10 | guardar no Neo4j
11
12Dia 3 | construir primeira camada de recuperação
13 | combinar pesquisa vetorial e pesquisa no grafo
14 | testar numa pergunta complexa que o RAG não consegue responder
15
16Dia 4 | conectar o Kimi Code via MCP
17 | github.com/MoonshotAI/kimi-code
18 | deixar o agente ler o grafo e adicionar novos factos
19 | executar primeiro ciclo conhecimento-ação
20
21Dia 5 | medir o resultado
22 | comparar precisão vs RAG normal
23 | comparar custos de token
24 | encontrar primeiro caso de uso real de cliente

O que a Microsoft, Stanford e a Anthropic descobriram juntas

text
1Microsoft GraphRAG | grafo reduz custos 85%, melhora precisão 18%
2Stanford DSPy | modelo é um nó num grafo, não o centro
3Stanford Leis de Escala | modelo menor + grafo bom vence modelo maior
4Investigação MIT Press | relações explícitas melhoram coerência e precisão
5Anthropic LaunchNotes | deteção de incidentes 5x mais rápida, 50% menos tempo de reunião

O Kimi K3 é o motor. O Graph Engineering é o mapa, a memória e o sistema de coordenadas. Sem o motor, o grafo não age. Sem o grafo, o motor move-se muito rápido mas nem sempre sabe para onde vai.

A maioria dos programadores continuará a construir RAG normal e perguntar-se-á porque é que perguntas complexas dão más respostas. Alguns passarão uma semana a construir um sistema de grafo e nunca mais voltarão a pesquisar texto.

Constróis a tua própria vida - por isso, escolhe o caminho certo.

/ Se isto foi útil - segue /

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais