Kimi K3 + Ingeniería de grafos: 85% menos en costos de tokens y 18% más de precisión

@noisyb0y1
INGLÉShace 1 día · 22 jul 2026
100K
160
20
12
330

TL;DR

Una guía completa para construir arquitecturas de IA utilizando Kimi K3 e ingeniería de grafos, logrando costos de tokens un 85% más bajos y un 18% más de precisión en comparación con el RAG tradicional.

La mayoría de la gente usa la IA como un motor de búsqueda caro. Abres un chat, haces una pregunta, obtienes una respuesta, cierras la pestaña. Al día siguiente empiezan desde cero porque la IA no recuerda nada.

Pero hay desarrolladores que ganan entre $10,000 y $20,000 al mes simplemente porque su sistema de IA responde el doble de rápido, da respuestas más precisas y cuesta un 85% menos que el de sus competidores. No están usando un modelo secreto. Construyeron la arquitectura correcta alrededor de un modelo normal.

Se llama Kimi K3 + Graph Engineering. Microsoft pasó años demostrando que funciona: un 85% menos de costos, un 18% más de precisión.

Así es como puedes construir esto tú mismo desde cero en una semana.

Por qué el RAG normal deja de funcionar en algún momento

La mayoría de los desarrolladores construyen sistemas de IA de la misma manera. El usuario pregunta algo, el sistema busca en documentos, encuentra fragmentos de texto similares, el modelo genera una respuesta. Funciona bien para preguntas simples. Se desmorona por completo con las complejas.

Pregunta "¿por qué cayeron nuestras ventas en marzo?" y el RAG normal encuentra documentos con las palabras "ventas" y "marzo". Encuentra fragmentos. No encuentra la cadena de causas.

text
1Respuesta de RAG normal:
2Aquí hay 5 documentos que mencionan ventas en marzo.
3
4Respuesta de Graph Engineering:
5Las ventas cayeron debido a un retraso en el lanzamiento
6causado por un problema con un proveedor
7desencadenado por una falla en el almacén
8que generó reseñas negativas
9que redujeron la conversión en un 23%.

Mismo modelo. Mismos datos. Resultado completamente diferente: porque un sistema busca texto y el otro busca conexiones entre hechos reales.

Esto es lo que Microsoft, Stanford y Anthropic descubrieron de forma independiente. Y es por eso que los desarrolladores que entienden esto avanzan más rápido que todos los demás.

Qué es realmente un grafo de conocimiento

Un grafo de conocimiento almacena información como tripletes:

text
1Sujeto → Relación → Objeto

Ejemplos reales:

text
1Kimi K3 → desarrollado por → Moonshot AI
2Kimi K3 → ventana de contexto → 1 millón de tokens
3Microsoft → construyó → GraphRAG
4GraphRAG → reduce costos en → 85%
5Anthropic → creó → Claude
6Claude → soporta → MCP

Cada pieza de información es una conexión explícita entre dos entidades. No es un párrafo de texto que podría contener esta información en algún lado, sino un hecho estructurado que puedes consultar directamente.

text
1Base de datos normal:
2Tabla de empresas
3Tabla de productos
4Sin conexiones explícitas entre ellas
5
6Grafo de conocimiento:
7Empresa → creó → Producto
8Producto → compite con → Otro Producto
9Otro Producto → propiedad de → Otra Empresa
10Empresa → invirtió en → Otra Empresa

El grafo no solo almacena hechos. Almacena cómo los hechos se conectan entre sí. Eso es lo que hace posible el razonamiento complejo, y lo que el RAG normal nunca puede hacer, sin importar lo bueno que sea el modelo.

El Laboratorio de IA de Stanford define un grafo de conocimiento como una base de datos estructurada donde la información se representa como una red de entidades y relaciones en tripletes sujeto-relación-objeto. Se utiliza en búsquedas, recomendaciones y tareas donde necesitas encontrar conexiones indirectas.

ai.stanford.edu/blog/introduction-to-knowledge-graphs

Noisy - inline image

Por qué Kimi K3 es el modelo adecuado para esta arquitectura

La mayoría de los modelos tienen ventanas de contexto de 128,000 a 200,000 tokens. Kimi K3 tiene un millón. Esto no es solo un número impresionante, es una ventaja arquitectónica específicamente para Graph Engineering.

Un grafo devuelve subgrafos, cadenas de evidencia, listas de entidades conectadas. Todo esto ocupa espacio en la ventana de contexto. Con un contexto pequeño, tienes que recortar el grafo. Con un millón de tokens, toda la parte relevante del grafo cabe en una sola sesión.

text
1Arquitectura de Kimi K3:
22.8 billones de parámetros totales
3896 expertos en MoE, 16 activos por token
4Ventana de contexto de 1,048,576 tokens
5Análisis de imágenes nativo
6Kimi Delta Attention para secuencias largas
7Residuos de Atención para preservar señales entre capas

kimi.com/blog/kimi-k3

Noisy - inline image

Kimi Delta Attention es un mecanismo híbrido que reduce el costo de trabajar con secuencias largas. Para Graph Engineering, esto significa que el sistema puede pasarle al modelo subgrafos grandes, listas largas de evidencia, decenas de documentos y la estructura del repositorio sin aumentos catastróficos en los costos.

Pero incluso un millón de tokens es memoria temporal. Después de la sesión, todo desaparece.

text
1Contexto de 1M de tokens = superficie de trabajo amplia por sesión
2Grafo de conocimiento = memoria estructurada permanente entre sesiones

Kimi K3 proporciona escala y razonamiento. Graph Engineering proporciona memoria y estructura. Juntos resuelven diferentes problemas al mismo tiempo.

Documento 1 - Microsoft GraphRAG

github.com/microsoft/graphrag

arxiv.org/abs/2603.22528

Noisy - inline image

Microsoft construyó GraphRAG y lo publicó como código abierto. Los números de su investigación son la evidencia más concreta disponible de lo que Graph Engineering realmente ofrece en comparación con el RAG normal.

La arquitectura convierte texto no estructurado en un grafo de conocimiento completo:

text
1Cargar documentos
2
3Fragmentar documentos
4
5Extraer entidades y relaciones
6
7Construir grafo
8
9Detectar comunidades
10
11Generar informes de comunidad
12
13Incorporar entidades e informes
14
15Búsqueda Local / Búsqueda Global

Información clave de Microsoft: el RAG normal responde bien preguntas locales (encontrar información sobre esta entidad específica). Falla en preguntas globales (cuáles son los patrones principales en estos 10,000 documentos, qué conecta estos eventos en todo el conjunto de datos).

Graph Engineering responde ambas.

text
1Búsqueda Local | qué pasó con el proveedor X en marzo
2 | encuentra el nodo específico y sus conexiones
3
4Búsqueda Global | cuáles son los principales patrones de riesgo
5 | en todas nuestras relaciones con proveedores
6 | encuentra patrones en todo el grafo

Números reales de la investigación ChatP&ID:

text
1Mejora en precisión | 18% más que el enfoque de documentos sin procesar
2Reducción en costo de tokens | 85% menos que cargar archivos estructurados directamente
3Costo por tarea | aproximadamente $0.004 en la configuración probada

Documento 2 - Tres modos de combinar LLM y Grafo de Conocimiento

arxiv.org/abs/2306.08302

Uno de los artículos teóricos más sólidos sobre la combinación de modelos de lenguaje y grafos de conocimiento describe tres modos:

text
1Modo 1 - LLM mejorado con KG
2El grafo le da al modelo hechos y estructura
3El modelo genera mejores respuestas
4
5Modo 2 - KG aumentado con LLM
6El modelo crea, limpia y expande el grafo
7El grafo mejora con el tiempo
8
9Modo 3 - LLM + KG sinergizados
10El grafo y el modelo se mejoran mutuamente
11El modo más potente

Para Kimi K3 + Graph Engineering, el tercer modo funciona mejor. Kimi K3 extrae nuevos hechos y los agrega al grafo. El grafo le da a Kimi K3 un contexto estructurado para el razonamiento. El ciclo se repite y el sistema mejora con cada iteración.

Documento 3 - Memoria Relacional para modelos de lenguaje

direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00476

MIT Press, Transactions of the Association for Computational Linguistics.

La investigación muestra lo que sucede cuando conectas un modelo de lenguaje a una memoria relacional: un grafo de conocimiento de relaciones en lugar de fragmentos de texto.

text
1Contexto de texto
2
3Extraer relaciones relevantes del grafo
4
5Memoria Relacional
6
7Modelo de lenguaje
8
9Generación más coherente y precisa

Hallazgo clave: los modelos con acceso a estructuras de relaciones explícitas producen texto más coherente y cometen menos errores lógicos que los modelos que trabajan solo con texto.

Esta es la explicación científica de por qué funciona Graph Engineering. El modelo no tiene que inferir relaciones a partir del texto. Las relaciones son explícitas en el grafo. El modelo las usa directamente.

Publicado bajo CC BY 4.0 - se puede usar libremente con atribución.

Documento 4 - Leyes de Escalado para la Ingeniería de Grafos de Conocimiento

arxiv.org/abs/2505.16276

Investigación que comparó 26 modelos de código abierto en tareas de ingeniería de grafos de conocimiento. La conclusión es uno de los hallazgos más importantes en el campo:

text
1Modelo más grande + grafo deficiente | peores resultados
2Modelo más pequeño + grafo bueno | mejores resultados

El grafo adecuado vence al modelo más grande. Siempre.

La misma conclusión a la que llegaron Microsoft con GraphRAG y Anthropic con Claude Code: el sistema alrededor del modelo determina el resultado más que el modelo en sí. Graph Engineering es la implementación más concreta de ese principio.

Documento 5 - Agente como Grafo

arxiv.org/abs/2511.18194

Este artículo muestra cómo representar no solo el conocimiento, sino también los agentes y las herramientas como nodos en un grafo.

text
1Pregunta del usuario
2
3Grafo de capacidades
4
5Seleccionar agente de investigación
6
7Seleccionar herramienta de GitHub
8
9Seleccionar herramienta de ArXiv
10
11Seleccionar herramienta de base de datos de grafos
12
13Kimi K3 coordina la ejecución

Los autores reportan una mejora de Recall@5 del 14.9% y una mejora de nDCG@5 del 14.6% en comparación con recuperadores similares en LiveMCPBenchmark.

Para Kimi K3, esto significa que el grafo puede gestionar no solo el conocimiento, sino también qué agente y qué herramienta usar para cada tarea específica.

Documento 6 - Kimi Code y Agent SDK

github.com/MoonshotAI/kimi-code

github.com/MoonshotAI/kimi-agent-sdk

Kimi Code es un agente de terminal que puede:

text
1Leer y editar código
2Ejecutar comandos de shell
3Buscar archivos
4Obtener páginas web
5Analizar el resultado de cada paso
6Elegir de forma independiente la siguiente acción
7Soporta MCP
8Ganchos de ciclo de vida
9Modos de aprobación

Kimi Agent SDK te permite usar Kimi Code como base para tu propio agente. Reutiliza las herramientas, habilidades y la configuración del servidor MCP de Kimi Code.

Para Graph Engineering, esta es una capa de ejecución lista para usar. El grafo proporciona conocimiento estructurado y rutas de razonamiento. Kimi Code realiza acciones en el entorno real. El SDK lo une todo.

La arquitectura completa del sistema

text
1Paso 1 - Capa de Ingesta
2PDFs, sitios web, bases de datos, APIs, Slack, Notion
3
4
5Paso 2 - Capa de Extracción
6Kimi K3 extrae entidades y relaciones
7
8{
9 "entity": "Kimi K3",
10 "type": "Modelo de IA",
11 "relations": [
12 {
13 "predicate": "desarrollado_por",
14 "object": "Moonshot AI",
15 "confidence": 0.98
16 }
17 ]
18}
19
20
21
22Paso 3 - Capa de Resolución
23El sistema resuelve si estas son la misma entidad:
24Moonshot AI / Moonshot / Beijing Moonshot / 月之暗面
25
26
27
28Paso 4 - Almacenamiento del Grafo
29Neo4j / Memgraph / Amazon Neptune / PostgreSQL
30
31
32
33Paso 5 - Capa de Recuperación
34Búsqueda vectorial + Búsqueda de entidades + Búsqueda de rutas
35Búsqueda de comunidades + Filtrado temporal
36
37
38
39Paso 6 - Capa de Agente
40Kimi K3:
41Planifica el enfoque
42Elige la herramienta adecuada
43Genera consultas Cypher o SPARQL
44Analiza el subgrafo
45Ejecuta investigación web
46Saca conclusiones
47Identifica la siguiente brecha de conocimiento
48
49
50
51Paso 7 - Capa de Verificación
52Verifica la cobertura de la evidencia
53Encuentra contradicciones
54Evalúa la confianza
55Verifica las fuentes
56
57
58
59Paso 8 - Actualización del Grafo
60Nuevos hechos agregados al grafo
61Contradicciones señaladas
62Información antigua recibe marca de tiempo

Este es un bucle cerrado de conocimiento-acción. Kimi K3 no solo lee el grafo. Identifica lo que falta, formula subpreguntas, selecciona un nodo o subgrafo, ejecuta una búsqueda, verifica el resultado, agrega un nuevo hecho y reevalúa la hipótesis.

Cinco prompts que ejecutan todo el pipeline

Graph Engineering no reemplaza los prompts. Los usa en cada etapa específica.

Prompt 1 - Extracción

text
1Extrae todas las organizaciones, personas, productos y eventos.
2
3Para cada entidad, devuelve:
4- nombre_canónico
5- tipo
6- descripción
7- fuente
8
9Para cada relación, devuelve:
10- entidad_origen
11- tipo_relación
12- entidad_destino
13- evidencia
14- puntuación_de_confianza

Prompt 2 - Normalización

text
1Compara las siguientes entidades.
2Determina si se refieren a:
3- la misma entidad
4- entidades relacionadas pero diferentes
5- entidades no relacionadas
6
7Devuelve el nombre canónico y la explicación.
8No fusiones entidades sin evidencia clara.

Prompt 3 - Consulta al Grafo

text
1Traduce la pregunta del usuario a una consulta Cypher.
2Usa solo las relaciones presentes en el esquema.
3No inventes etiquetas ni propiedades.
4Devuelve la consulta y la explicación de la lógica.

Prompt 4 - Respuesta Fundamentada

text
1Responde usando solo las rutas del grafo recuperadas.
2Para cada conclusión:
3- identifica los nodos de apoyo
4- identifica la ruta de la relación
5- indica la incertidumbre claramente
6- no infieras causalidad a partir de correlación

Prompt 5 - Mantenimiento del Grafo

text
1Compara nuevos hechos con el grafo existente.
2Clasifica cada hecho como:
3- nuevo
4- duplicado
5- contradicción
6- actualización
7- incierto
8
9No sobrescribas hechos existentes sin evidencia.

Cinco negocios que puedes construir sobre este sistema

1 - Investigación de Inversiones

text
1Empresa
2├── fundadores y sus proyectos anteriores
3├── inversores y su cartera
4├── competidores y sus estrategias
5├── riesgos legales
6├── patentes
7├── ofertas de trabajo como señal de estrategia
8└── métricas financieras a lo largo del tiempo

Kimi K3 lee informes y noticias. El grafo muestra conexiones ocultas entre empresas, inversores compartidos, dependencias de proveedores y señales de personal. Clientes: fondos de inversión, bufetes de abogados, consultores de fusiones y adquisiciones. $2,000-10,000 por cliente al mes.

2 - Inteligencia de Ingeniería

text
1Commits de GitHub + Tickets de Jira + Tareas de Linear
2
3Grafo del Trabajo de Ingeniería
4
5Detección de incidentes 5 veces más rápida
650% menos tiempo en reuniones
7Notas de versión automáticas

anthropic.com/customers/graph

LaunchNotes ya vende esto. El mercado son todos los equipos de ingeniería que usan más de una herramienta de gestión de proyectos.

3 - Motor de Investigación Científica

text
1Artículo → autor → institución → método → conjunto de datos → resultado
2
3Qué métodos de GraphRAG usan detección de comunidades,
4en qué conjuntos de datos se probaron
5y qué artículos se contradicen entre sí

La búsqueda normal da una lista de documentos. Un sistema de grafos construye un mapa de evidencia y contradicciones.

4 - Grafo de Amenazas de Ciberseguridad

text
1IP → dominio → certificado → malware → campaña → actor
2
3Kimi K3 analiza informes de amenazas
4Mapea indicadores entre fuentes
5Explica rutas de ataque
6Actualiza el grafo de amenazas automáticamente

5 - Sistema Operativo de Conocimiento Personal

text
1Personas ↔ Reuniones ↔ Proyectos ↔ Documentos ↔ Decisiones ↔ Compromisos
2
3Preguntas que Kimi K3 puede responder:
4¿Quién está bloqueando esta tarea?
5¿Qué decisión tomamos y en qué se basó?
6¿Qué prometí hacer este mes?
7¿Qué suposiciones antiguas ya no son válidas?

Por dónde empezar esta semana

text
1Día 1 | instala Neo4j localmente
2 | lee el README de DSPy
3 | github.com/stanfordnlp/dspy
4 | entiende la diferencia entre usar prompts
5 | y programar un sistema
6
7Día 2 | toma un conjunto de documentos
8 | ejecuta Kimi K3 a través de la API
9 | extrae las primeras entidades y relaciones
10 | guárdalas en Neo4j
11
12Día 3 | construye la primera capa de recuperación
13 | combina búsqueda vectorial y búsqueda en grafos
14 | pruébala con una pregunta compleja que el RAG no pueda responder
15
16Día 4 | conecta Kimi Code a través de MCP
17 | github.com/MoonshotAI/kimi-code
18 | deja que el agente lea el grafo y agregue nuevos hechos
19 | ejecuta el primer bucle de conocimiento-acción
20
21Día 5 | mide el resultado
22 | compara la precisión con el RAG normal
23 | compara los costos de tokens
24 | encuentra el primer caso de uso para un cliente real

Lo que Microsoft, Stanford y Anthropic descubrieron juntos

text
1Microsoft GraphRAG | el grafo reduce costos un 85%, mejora la precisión un 18%
2Stanford DSPy | el modelo es un nodo en un grafo, no el centro
3Stanford Scaling Laws | modelo más pequeño + grafo bueno vence al modelo más grande
4MIT Press Research | las relaciones explícitas mejoran la coherencia y precisión
5Anthropic LaunchNotes | detección de incidentes 5 veces más rápida, 50% menos tiempo en reuniones

Kimi K3 es el motor. Graph Engineering es el mapa, la memoria y el sistema de coordenadas. Sin el motor, el grafo no actúa. Sin el grafo, el motor se mueve muy rápido pero no siempre sabe hacia dónde va.

La mayoría de los desarrolladores seguirán construyendo RAG normal y se preguntarán por qué las preguntas complejas dan malas respuestas. Unos pocos se tomarán una semana para construir un sistema de grafos y nunca volverán a buscar texto.

Tú construyes tu propia vida, así que elige el camino correcto.

/ Si te fue útil, sígueme /

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales