Kimi K3 + Graph Engineering: 85% menos en costes de tokens y 18% más de precisión

@noisyb0y1
INGLÉShace 1 día · 22 jul 2026
100K
160
20
12
330

TL;DR

Una guía completa para construir arquitecturas de IA utilizando Kimi K3 y Graph Engineering, logrando una reducción del 85% en los costes de tokens y un 18% más de precisión en comparación con el RAG tradicional.

La mayoría de la gente usa la IA como un motor de búsqueda caro. Abren un chat, hacen una pregunta, obtienen una respuesta, cierran la pestaña. Al día siguiente empiezan desde cero porque la IA no recuerda nada.

Pero hay desarrolladores que ganan entre $10,000 y $20,000 al mes simplemente porque su sistema de IA responde el doble de rápido, da respuestas más precisas y cuesta un 85% menos que el de sus competidores. No están usando algún modelo secreto. Construyeron la arquitectura correcta alrededor de un modelo normal.

Se llama Kimi K3 + Graph Engineering. Microsoft pasó años demostrando que funciona: un 85% menos de costos, un 18% más de precisión.

Así es como puedes construir esto tú mismo desde cero en una semana.

Por qué el RAG normal deja de funcionar en algún momento

La mayoría de los desarrolladores construyen sistemas de IA de la misma manera. El usuario pregunta algo, el sistema busca en documentos, encuentra fragmentos de texto similares, el modelo genera una respuesta. Funciona bien para preguntas simples. Se desmorona por completo para las complejas.

Pregunta "¿por qué cayeron nuestras ventas en marzo?" y el RAG normal encuentra documentos con las palabras "ventas" y "marzo". Encuentra fragmentos. No encuentra la cadena de causas.

text
1Respuesta de RAG normal:
2Aquí hay 5 documentos que mencionan ventas en marzo.
3
4Respuesta de Graph Engineering:
5Las ventas cayeron debido a un retraso en el lanzamiento
6causado por un problema de proveedor
7provocado por una falla en el almacén
8que generó reseñas negativas
9que redujeron la conversión en un 23%.

Mismo modelo. Mismos datos. Resultado completamente diferente: porque un sistema busca texto y el otro busca conexiones entre hechos reales.

Esto es lo que Microsoft, Stanford y Anthropic descubrieron por separado. Y es por eso que los desarrolladores que entienden esto se mueven más rápido que todos los demás.

Qué es realmente un grafo de conocimiento

Un grafo de conocimiento almacena información como tripletes:

text
1Sujeto → Relación → Objeto

Ejemplos reales:

text
1Kimi K3 → desarrollado por → Moonshot AI
2Kimi K3 → ventana de contexto → 1 millón de tokens
3Microsoft → construyó → GraphRAG
4GraphRAG → reduce costos en → 85%
5Anthropic → creó → Claude
6Claude → admite → MCP

Cada pieza de información es una conexión explícita entre dos entidades. No un párrafo de texto que podría contener esta información en algún lado, sino un hecho estructurado que puedes consultar directamente.

text
1Base de datos normal:
2Tabla de empresas
3Tabla de productos
4Sin conexiones explícitas entre ellos
5
6Grafo de conocimiento:
7Empresa → creó → Producto
8Producto → compite con → Otro Producto
9Otro Producto → propiedad de → Otra Empresa
10Empresa → invirtió en → Otra Empresa

El grafo no solo almacena hechos. Almacena cómo se conectan los hechos entre sí. Eso es lo que hace posible el razonamiento complejo, y lo que el RAG normal nunca podrá hacer, por muy bueno que sea el modelo.

El Stanford AI Lab define un grafo de conocimiento como una base de datos estructurada donde la información se representa como una red de entidades y relaciones en tripletes sujeto-relación-objeto. Se utiliza en búsquedas, recomendaciones y tareas donde necesitas encontrar conexiones indirectas.

ai.stanford.edu/blog/introduction-to-knowledge-graphs

Noisy - inline image

Por qué Kimi K3 es el modelo adecuado para esta arquitectura

La mayoría de los modelos tienen ventanas de contexto de 128,000 a 200,000 tokens. Kimi K3 tiene un millón. Esto no es solo un número impresionante, es una ventaja arquitectónica específicamente para Graph Engineering.

Un grafo devuelve subgrafos, cadenas de evidencia, listas de entidades conectadas. Todo esto ocupa espacio en la ventana de contexto. Con una ventana pequeña tienes que recortar el grafo. Con un millón de tokens, toda la parte relevante del grafo cabe en una sesión.

text
1Arquitectura de Kimi K3:
22.8 billones de parámetros totales
3896 expertos en MoE, 16 activos por token
4Ventana de contexto de 1,048,576 tokens
5Análisis de imágenes nativo
6Kimi Delta Attention para secuencias largas
7Attention Residuals para preservar señales entre capas

kimi.com/blog/kimi-k3

Noisy - inline image

Kimi Delta Attention es un mecanismo híbrido que reduce el costo de trabajar con secuencias largas. Para Graph Engineering, esto significa que el sistema puede pasar al modelo subgrafos grandes, listas de evidencia largas, docenas de documentos y estructura de repositorio sin aumentos catastróficos de costo.

Pero incluso un millón de tokens es memoria temporal. Después de la sesión, todo desaparece.

text
1Contexto de 1M tokens = gran superficie de trabajo por sesión
2Grafo de conocimiento = memoria estructurada permanente entre sesiones

Kimi K3 proporciona escala y razonamiento. Graph Engineering proporciona memoria y estructura. Juntos resuelven diferentes problemas al mismo tiempo.

Documento 1 - Microsoft GraphRAG

github.com/microsoft/graphrag

arxiv.org/abs/2603.22528

Noisy - inline image

Microsoft construyó GraphRAG y lo lanzó como código abierto. Los números de su investigación son la evidencia más concreta disponible de lo que Graph Engineering realmente ofrece en comparación con el RAG normal.

La arquitectura convierte texto no estructurado en un grafo de conocimiento completo:

text
1Cargar documentos
2
3Fragmentar documentos
4
5Extraer entidades y relaciones
6
7Construir grafo
8
9Detectar comunidades
10
11Generar informes de comunidad
12
13Incrustar entidades e informes
14
15Búsqueda local / Búsqueda global

Información clave de Microsoft: el RAG normal responde bien preguntas locales (encontrar información sobre esta entidad específica). Falla en preguntas globales (cuáles son los patrones principales en estos 10,000 documentos, qué conecta estos eventos en todo el conjunto de datos).

Graph Engineering responde ambas.

text
1Búsqueda local | qué pasó con el proveedor X en marzo
2 | encuentra el nodo específico y sus conexiones
3
4Búsqueda global | cuáles son los principales patrones de riesgo
5 | en todas nuestras relaciones con proveedores
6 | encuentra patrones en todo el grafo

Números reales de la investigación ChatP&ID:

text
1Mejora de precisión | 18% más que el enfoque de documentos sin procesar
2Reducción de costo de tokens | 85% menos que cargar archivos estructurados directamente
3Costo por tarea | aproximadamente $0.004 en la configuración probada

Documento 2 - Tres modos de combinar LLM y Grafo de Conocimiento

arxiv.org/abs/2306.08302

Uno de los artículos teóricos más sólidos sobre la combinación de modelos de lenguaje y grafos de conocimiento describe tres modos:

text
1Modo 1 - LLM mejorado por KG
2El grafo proporciona hechos y estructura al modelo
3El modelo genera mejores respuestas
4
5Modo 2 - KG aumentado por LLM
6El modelo crea, limpia y expande el grafo
7El grafo mejora con el tiempo
8
9Modo 3 - LLM + KG sinergizados
10El grafo y el modelo se mejoran mutuamente
11Modo más poderoso

Para Kimi K3 + Graph Engineering, el tercer modo funciona mejor. Kimi K3 extrae nuevos hechos y los añade al grafo. El grafo proporciona a Kimi K3 contexto estructurado para el razonamiento. El ciclo se repite y el sistema mejora con cada iteración.

Documento 3 - Memoria relacional para modelos de lenguaje

direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00476

MIT Press, Transactions of the Association for Computational Linguistics.

La investigación muestra lo que sucede cuando conectas un modelo de lenguaje a una memoria relacional (un grafo de conocimiento de relaciones en lugar de fragmentos de texto).

text
1Contexto de texto
2
3Extraer relaciones relevantes del grafo
4
5Memoria relacional
6
7Modelo de lenguaje
8
9Generación más coherente y precisa

Hallazgo clave: los modelos con acceso a estructuras de relación explícitas producen texto más coherente y cometen menos errores lógicos que los modelos que trabajan solo con texto.

Esta es la explicación científica de por qué funciona Graph Engineering. El modelo no tiene que inferir relaciones a partir del texto. Las relaciones son explícitas en el grafo. El modelo las usa directamente.

Publicado bajo CC BY 4.0: se puede usar libremente con atribución.

Documento 4 - Leyes de escalado para la ingeniería de grafos de conocimiento

arxiv.org/abs/2505.16276

Investigación que comparó 26 modelos de código abierto en tareas de ingeniería de grafos de conocimiento. La conclusión es uno de los hallazgos más importantes del campo:

text
1Modelo más grande + grafo malo | peores resultados
2Modelo más pequeño + grafo bueno | mejores resultados

El grafo correcto vence al modelo más grande. Siempre.

La misma conclusión a la que llegaron Microsoft con GraphRAG y Anthropic con Claude Code: el sistema alrededor del modelo determina la salida más que el modelo mismo. Graph Engineering es la implementación más concreta de ese principio.

Documento 5 - Agente como Grafo

arxiv.org/abs/2511.18194

Este artículo muestra cómo representar no solo conocimiento, sino también agentes y herramientas como nodos en un grafo.

text
1Pregunta del usuario
2
3Grafo de capacidades
4
5Seleccionar agente de investigación
6
7Seleccionar herramienta de GitHub
8
9Seleccionar herramienta de ArXiv
10
11Seleccionar herramienta de base de datos de grafos
12
13Kimi K3 coordina la ejecución

Los autores reportan una mejora de Recall@5 del 14.9% y una mejora de nDCG@5 del 14.6% frente a recuperadores comparables en LiveMCPBenchmark.

Para Kimi K3, esto significa que el grafo puede gestionar no solo el conocimiento, sino también qué agente y qué herramienta usar para cada tarea específica.

Documento 6 - Kimi Code y Agent SDK

github.com/MoonshotAI/kimi-code

github.com/MoonshotAI/kimi-agent-sdk

Kimi Code es un agente de terminal que puede:

text
1Leer y editar código
2Ejecutar comandos de shell
3Buscar archivos
4Obtener páginas web
5Analizar el resultado de cada paso
6Elegir independientemente la siguiente acción
7Admite MCP
8Hooks de ciclo de vida
9Modos de aprobación

Kimi Agent SDK te permite usar Kimi Code como base de tu propio agente. Reutiliza las herramientas, habilidades y configuración del servidor MCP de Kimi Code.

Para Graph Engineering, esta es una capa de ejecución ya preparada. El grafo proporciona conocimiento estructurado y rutas de razonamiento. Kimi Code toma acciones en el entorno real. El SDK lo une todo.

La arquitectura completa del sistema

text
1Paso 1 - Capa de ingesta
2PDFs, sitios web, bases de datos, APIs, Slack, Notion
3
4
5Paso 2 - Capa de extracción
6Kimi K3 extrae entidades y relaciones
7
8{
9 "entity": "Kimi K3",
10 "type": "modelo de IA",
11 "relations": [
12 {
13 "predicate": "desarrollado_por",
14 "object": "Moonshot AI",
15 "confidence": 0.98
16 }
17 ]
18}
19
20
21
22Paso 3 - Capa de resolución
23El sistema resuelve si estas son la misma entidad:
24Moonshot AI / Moonshot / Beijing Moonshot / 月之暗面
25
26
27
28Paso 4 - Almacenamiento en grafo
29Neo4j / Memgraph / Amazon Neptune / PostgreSQL
30
31
32
33Paso 5 - Capa de recuperación
34Búsqueda vectorial + Búsqueda de entidades + Búsqueda de rutas
35Búsqueda de comunidades + Filtrado temporal
36
37
38
39Paso 6 - Capa de agente
40Kimi K3:
41Planifica el enfoque
42Elige la herramienta correcta
43Genera consultas Cypher o SPARQL
44Analiza el subgrafo
45Realiza investigación web
46Saca conclusiones
47Identifica la próxima brecha de conocimiento
48
49
50
51Paso 7 - Capa de verificación
52Verifica la cobertura de evidencia
53Encuentra contradicciones
54Evalúa la confianza
55Verifica las fuentes
56
57
58
59Paso 8 - Actualización del grafo
60Nuevos hechos añadidos al grafo
61Contradicciones marcadas
62La información antigua recibe una marca de tiempo

Este es un bucle cerrado de conocimiento-acción. Kimi K3 no solo lee el grafo. Identifica lo que falta, forma subpreguntas, selecciona un nodo o subgrafo, ejecuta una búsqueda, verifica el resultado, añade un nuevo hecho y reevalúa la hipótesis.

Cinco prompts que ejecutan todo el pipeline

Graph Engineering no reemplaza los prompts. Los utiliza en cada etapa específica.

Prompt 1 - Extracción

text
1Extrae todas las organizaciones, personas, productos y eventos.
2
3Para cada entidad devuelve:
4- canonical_name
5- type
6- description
7- source
8
9Para cada relación devuelve:
10- source_entity
11- relation_type
12- target_entity
13- evidence
14- confidence_score

Prompt 2 - Normalización

text
1Compara las siguientes entidades.
2Determina si se refieren a:
3- la misma entidad
4- entidades relacionadas pero diferentes
5- entidades no relacionadas
6
7Devuelve el nombre canónico y la explicación.
8No fusiones entidades sin evidencia clara.

Prompt 3 - Consulta al grafo

text
1Traduce la pregunta del usuario a una consulta Cypher.
2Usa solo las relaciones presentes en el esquema.
3No inventes etiquetas ni propiedades.
4Devuelve la consulta y la explicación de la lógica.

Prompt 4 - Respuesta fundamentada

text
1Responde usando solo las rutas del grafo recuperadas.
2Para cada conclusión:
3- identifica los nodos de apoyo
4- identifica la ruta de relación
5- indica claramente la incertidumbre
6- no infieras causalidad a partir de correlación

Prompt 5 - Mantenimiento del grafo

text
1Compara los nuevos hechos con el grafo existente.
2Clasifica cada hecho como:
3- nuevo
4- duplicado
5- contradicción
6- actualización
7- incierto
8
9No sobrescribas hechos existentes sin evidencia.

Cinco negocios que puedes construir con este sistema

1 - Investigación de inversiones

text
1Empresa
2├── fundadores y sus proyectos anteriores
3├── inversores y su cartera
4├── competidores y sus estrategias
5├── riesgos legales
6├── patentes
7├── ofertas de empleo como señal de estrategia
8└── métricas financieras a lo largo del tiempo

Kimi K3 lee informes y noticias. El grafo muestra conexiones ocultas entre empresas, inversores compartidos, dependencias de proveedores y señales de personal. Clientes: fondos de inversión, bufetes de abogados, consultores de fusiones y adquisiciones. $2,000-10,000 por cliente al mes.

2 - Inteligencia de ingeniería

text
1Commits de GitHub + tickets de Jira + tareas de Linear
2
3Grafo del trabajo de ingeniería
4
5Detección de incidentes 5x más rápida
650% menos tiempo de reuniones
7Notas de versión automáticas

anthropic.com/customers/graph

LaunchNotes ya vende esto. El mercado es cada equipo de ingeniería que use más de una herramienta de gestión de proyectos.

3 - Motor de investigación científica

text
1Artículo → autor → institución → método → conjunto de datos → resultado
2
3¿Qué métodos de GraphRAG usan detección de comunidades,
4en qué conjuntos de datos se probaron
5y qué artículos se contradicen entre sí?

La búsqueda normal da una lista de documentos. Un sistema de grafos construye un mapa de evidencia y contradicciones.

4 - Grafo de amenazas de ciberseguridad

text
1IP → dominio → certificado → malware → campaña → actor
2
3Kimi K3 analiza informes de amenazas
4Mapea indicadores entre fuentes
5Explica rutas de ataque
6Actualiza el grafo de amenazas automáticamente

5 - Sistema operativo de conocimiento personal

text
1Personas ↔ Reuniones ↔ Proyectos ↔ Documentos ↔ Decisiones ↔ Promesas
2
3Preguntas que Kimi K3 puede responder:
4¿Quién está bloqueando esta tarea?
5¿Qué decisión tomamos y en qué se basaba?
6¿Qué prometí hacer este mes?
7¿Qué suposiciones antiguas ya no son válidas?

Por dónde empezar esta semana

text
1Día 1 | instala Neo4j localmente
2 | lee el README de DSPy
3 | github.com/stanfordnlp/dspy
4 | comprende la diferencia entre hacer prompting
5 | y programar un sistema
6
7Día 2 | toma un conjunto de documentos
8 | ejecuta Kimi K3 a través de la API
9 | extrae las primeras entidades y relaciones
10 | guárdalas en Neo4j
11
12Día 3 | construye la primera capa de recuperación
13 | combina búsqueda vectorial y búsqueda en grafo
14 | prueba con una pregunta compleja que el RAG no pueda responder
15
16Día 4 | conecta Kimi Code a través de MCP
17 | github.com/MoonshotAI/kimi-code
18 | deja que el agente lea el grafo y añada nuevos hechos
19 | ejecuta el primer bucle conocimiento-acción
20
21Día 5 | mide el resultado
22 | compara precisión vs RAG normal
23 | compara costos de tokens
24 | encuentra el primer caso de uso real con un cliente

Lo que Microsoft, Stanford y Anthropic descubrieron juntos

text
1Microsoft GraphRAG | el grafo reduce costos un 85%, mejora precisión un 18%
2Stanford DSPy | el modelo es un nodo en un grafo, no el centro
3Stanford Scaling Laws | modelo más pequeño + buen grafo vence a modelo más grande
4MIT Press Research | las relaciones explícitas mejoran coherencia y precisión
5Anthropic LaunchNotes | detección de incidentes 5x más rápida, 50% menos tiempo de reuniones

Kimi K3 es el motor. Graph Engineering es el mapa, la memoria y el sistema de coordenadas. Sin el motor, el grafo no actúa. Sin el grafo, el motor se mueve muy rápido pero no siempre sabe hacia dónde va.

La mayoría de los desarrolladores seguirán construyendo RAG normal y se preguntarán por qué las preguntas complejas dan malas respuestas. Unos pocos dedicarán una semana a construir un sistema de grafos y nunca volverán a buscar texto.

Tú construyes tu propia vida, así que elige el camino correcto.

/ Si esto te fue útil, sígueme /

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales