Siéntate con un sistema RAG plano que ha estado funcionando en producción durante un año e intenta hacerle cuatro preguntas. "¿Por qué dijiste eso?" El modelo produjo una respuesta segura sobre la fecha de renovación del contrato del cliente, pero el rastro de vuelta a la cláusula original no existe. "Vuelve a validar esta afirmación: la fuente cambió." El contrato se modificó la semana pasada. Cada hecho derivado de él es sospechoso. No puedes encontrarlos porque no saben de qué documento provienen. "Decide entre estos dos hechos contradictorios." Uno dice que Alex trabaja en Google, otro dice que en Stripe. Ninguno tiene una puntuación de confianza ni una marca de tiempo de la fuente. La actualidad de la escritura no tiene nada que ver con la actualidad de la evidencia. "Atribuye esta alucinación." El modelo dijo que la reunión era el jueves. No hubo reunión el jueves. No puedes distinguir si el LLM inventó la fecha o si lo engañaron datos incorrectos en la memoria.
Estos cuatro fallos comparten una sola causa. Cada uno es una columna faltante. Un identificador de fuente, una marca de tiempo de captura, una puntuación de confianza, un registro de citas de respuesta. Cada uno cuesta unos pocos bytes al momento de escribir. El costo de no tenerlos es ilimitado: cada afirmación no es auditables, cada contradicción es irresoluble, cada alucinación es imposible de rastrear.
En 19 sistemas el patrón es consistente. Las implementaciones más sólidas tratan la procedencia como un tribunal trata la evidencia: cada afirmación llega con una cadena de custodia ininterrumpida o no llega en absoluto. Las más débiles no cargan ninguna y pagan por ello cada vez que algo sale mal en producción. Este artículo recorre los seis niveles de procedencia que el corpus ha revelado, los tres niveles de madurez de implementación que los separan y el costo honesto de construir esto correctamente desde el principio.
Seis niveles, una disciplina
Al leer 19 sistemas uno tras otro, se distinguen seis niveles distintos de procedencia. No son una jerarquía; son ortogonales. Un sistema puede tener procedencia de fuente sin procedencia causal. Puede tener versionado sin puntuación de confianza. Las implementaciones más sólidas cubren los seis. Ninguna de las más débiles cubre alguno.
Identidad responde "¿qué hecho, exactamente?" OpenContext genera UUIDs para cada pieza de contexto al momento de la ingesta y los expone como un esquema de citas que el agente puede usar directamente en las respuestas. El identificador sobrevive a cambios de nombre, movimientos y reorganizaciones porque está vinculado al contenido, no a la ruta. mem9 lleva un ID de memoria estable en cada fila más un contador de versión explícito con protección de concurrencia If-Match. Sin procedencia de identidad ni siquiera puedes nombrar de qué estás hablando cuando algo sale mal.
Fuente responde "¿de dónde vino?" Hindsight registra el tipo de fuente y el identificador en cada observación, para que el sistema pueda responder qué conversación o documento produjo un hecho determinado. mem9 lleva fuente, ID de agente e ID de sesión en cada fila. Supermemory almacena IDs de documentos junto con los recuerdos. Sin procedencia de fuente no puedes actualizar en cascada cuando una fuente cambia, porque no sabes qué hechos dependen de ella.
Causal responde "¿qué paso del agente usó esto?" Hindsight captura cada hecho recuperado y utilizado en un nivel de observación con contexto completo de recuperación: qué recuperador lo mostró, qué rango alcanzó y si el agente realmente lo consumió. Moraine trata cada paso de traza como su propio registro de procedencia, haciendo que la ejecución completa del agente sea recuperable como una secuencia de eventos direccionables por fuente. Sin procedencia causal no puedes distinguir entre "el sistema recuperó este hecho" y "el agente usó este hecho para producir esa respuesta".
Confianza de captura responde "¿qué tan seguros estábamos cuando lo escribimos?" Graphify marca cada borde en su grafo de conocimiento con confianza de captura de tres niveles: CONFIRMADO para extracciones deterministas, PROBABLE para inferencias de LLM de alta confianza y AMBIGUO para afirmaciones inciertas. Los bordes AMBIGUOS se muestran como "brechas de conocimiento" para revisión humana en lugar de tratarse silenciosamente como hechos. Hindsight lleva una puntuación de confianza en cada observación que se degrada con el tiempo a través de su ciclo de vida de frescura: las observaciones recientes se confían, las obsoletas se ponderan a la baja o se retiran. mem9 ejecuta detección de duplicados cercanos en modo sombra primero, registrando puntuaciones sin actuar sobre ellas hasta que el ingeniero haya calibrado el umbral con datos reales. Sin confianza de captura, los hechos inciertos y los ciertos se recuperan con el mismo peso, y el agente no puede discriminar entre una afirmación sólida y una suposición fundamentada.
Versionado responde "¿qué creíamos antes?" Supermemory trata la memoria como un DAG versionado con bordes tipificados (actualizaciones, extensiones, derivaciones), dando a cada creencia un historial de confirmación. mem9 divide la ruta de escritura: mutación in situ para ediciones humanas, añadir y archivar para reescrituras impulsadas por LLM donde el nuevo contenido reemplaza semánticamente al anterior. Tolaria deja que Git maneje el historial de versiones por completo, tratando los diffs de una línea como un artefacto de primera clase orientado al usuario. Sin procedencia versionada no puedes retroceder a lo que el sistema creía el martes, porque las creencias antiguas se eliminan en lugar de archivarse.
Recíproca responde "¿qué otros hechos comparten este origen?" llm-wiki pondera la superposición de fuentes por encima del enlace directo en su grafo de relevancia de cuatro señales: dos páginas que provienen del mismo documento fuente se presumen más relacionadas que dos páginas con un enlace wiki directo, porque el LLM es poco fiable para enlaces cruzados pero los metadatos de la fuente se mantienen mecánicamente. EdgeQuake acumula IDs de fuente en entidades y relaciones en todo el corpus, por lo que las menciones repetidas de la misma entidad desde diferentes fuentes fortalecen su peso de procedencia. second-brain lleva la fuente como parte de su clave compuesta de índice léxico, permitiendo que un solo documento sea indexado desde múltiples canalizaciones de forma independiente. Sin procedencia recíproca no puedes responder "muéstrame todo lo que hay en este sistema que vino de la misma conversación" o "¿qué más aprendimos de ese documento?"
Los seis son ortogonales pero se refuerzan mutuamente. La procedencia de fuente es inútil sin identidad (necesitas nombrar el hecho antes de poder rastrearlo). El versionado es más débil sin confianza (conoces el linaje de las ediciones pero no qué tan seguro estaba el sistema sobre ninguna de ellas). Las consultas recíprocas dependen de que la fuente esté presente primero. Los sistemas que tienen los seis son aquellos cuya memoria no se pudre silenciosamente.
Tres niveles de madurez de implementación
El corpus se divide en tres niveles según dónde vive la procedencia y qué puede hacer en el momento de la lectura.
El nivel 1 es RAG sin procedencia, el punto de partida para la mayoría de los equipos. Almacenes vectoriales planos con contenido y un embedding. Sin columna de fuente, sin puntuación de confianza, sin historial de versiones. Cuando se recupera un hecho, obtienes texto y una puntuación de similitud. No puedes rastrear de dónde vino, qué tan seguro estaba el sistema al respecto, o si ha sido reemplazado. Todos los sistemas que empezaron aquí se han movido hacia el nivel 2 con el tiempo.
El nivel 2 lleva procedencia en la fila. ID de fuente, confianza, versión: todos presentes como columnas junto al hecho. mem9 está aquí con fuente, ID de agente, ID de sesión y versión en cada fila. El DAG versionado de Supermemory es estructura de nivel 2. La confianza de borde de tres niveles de Graphify es disciplina de nivel 2. La procedencia está disponible para consultas, pero no decora automáticamente los resultados de recuperación. Tienes que escribir la consulta que la use.
El nivel 3 decora los resultados de lectura con contexto de procedencia sin que el llamante tenga que pedirlo. Hindsight es la referencia aquí: cada hecho recuperado llega con su tipo de fuente, puntuación de confianza, estado de frescura y clasificación por recuperador ya adjuntos. El agente que consume el resultado ve la procedencia como parte del hecho, no como una búsqueda separada. La decoración de turno de fuente de mem9 está a medio camino entre el nivel 2 y el nivel 3, injertando contexto de tiempo de lectura en un esquema de nivel 2.
La migración es unidireccional. Ningún sistema comienza en el nivel 3 y decide eliminar la disciplina de procedencia. Las columnas demuestran su valor tan pronto como están presentes. Si estás diseñando un sistema de memoria hoy, la pregunta no es "¿necesito procedencia?" sino "¿en qué nivel quiero empezar, sabiendo que cada nivel por encima del que elijo es más difícil de alcanzar más tarde que de incorporar ahora?"
El caso de advertencia: calculado y descartado
Understand-Anything ilustra lo que sucede cuando existe el sustrato para la confianza pero no la columna para registrarlo. El sistema distingue bordes deterministas (resueltos por un escáner de proyecto a partir de archivos fuente) de bordes inferidos (adivinados por un LLM durante el análisis semántico). Esa información es real y significativa: un borde de importación estructural merece mayor confianza que una inferencia no basada en código. Pero ambos se almacenan con peso 0.7, idénticos en el grafo. La señal de confianza se calcula en el momento de la escritura y se descarta antes de la persistencia.
Agregar un campo de confianza sería un cambio pequeño con una gran recompensa en calidad de información. El sistema ya sabe qué bordes son sólidos y cuáles son suposiciones. Simplemente no registra la distinción donde importa: en la fila que se recupera más tarde, cuando el agente necesita discriminar entre ellos. Este patrón aparece en varios sistemas del corpus: la información está disponible en el momento de la escritura, es barata de capturar y luego se pierde porque nadie agregó la columna.
El costo honesto de hacerlo bien desde el principio
La procedencia cuesta bytes. Un ID de fuente, una puntuación de confianza, un contador de versión: cada uno agrega unos pocos campos por fila. A escala eso importa, pero importa mucho menos que el costo de no tenerlos cuando algo sale mal en producción y no puedes rastrear por qué el sistema produjo una respuesta incorrecta.
El costo computacional es menor de lo esperado. La puntuación de confianza generalmente requiere una llamada adicional al LLM en el momento de la escritura (o una heurística determinista para hechos estructurales), que se amortiza en cada lectura posterior. El seguimiento de fuente no cuesta nada más allá de registrar un identificador que ya existe. El versionado cuesta una columna extra o una adición por escritura, no una instantánea completa. El nivel de observación de Hindsight agrega almacenamiento proporcional al número de hechos recuperados y utilizados, pero solo registra lo que el agente realmente consumió, no todo lo que vio.
El costo operativo es la verdadera cuestión. La decoración de nivel 3 significa más datos fluyendo en cada recuperación, lo que aumenta ligeramente el uso de la ventana de contexto y la latencia de respuesta. Los sistemas que implementan esto lo manejan manteniendo las decoraciones concisas: un enumerado de tipo de fuente, un flotante de confianza, un estado de frescura, en lugar de árboles de procedencia completos en línea. El agente obtiene suficiente para discriminar sin ahogarse en metadatos.
Lo que comparten las implementaciones más sólidas
Los ejemplos en todo el corpus merecen ser repetidos porque ninguno resuelve la misma parte del problema:
OpenContext genera UUIDs que sobreviven a cualquier reorganización del sistema de archivos y los expone como un esquema de citas que el agente puede usar directamente. mem9 lleva fuente, ID de agente, ID de sesión en cada fila, versión en cada actualización y decora los resultados de búsqueda con contexto de turno de fuente gobernado por un presupuesto explícito. Supermemory trata la memoria como un DAG versionado con bordes tipificados, dando a cada creencia un historial de confirmación. Hindsight captura cada hecho recuperado y utilizado en un nivel de observación con procedencia de fuente completa, historial de evolución y clasificación por recuperador. Graphify marca cada borde con confianza de captura de tres niveles, mostrando bordes inciertos para revisión humana en lugar de tratarlos como hechos.
La observación unificadora es simple: la procedencia no es metadato, es parte del hecho. Los sistemas que la tratan así son aquellos cuya memoria no se pudre silenciosamente, cuyas contradicciones pueden ser adjudicadas, cuyas alucinaciones pueden ser rastreadas y cuyo historial de creencias puede retrocederse a cualquier punto del pasado sin haber anticipado la necesidad.
Los sistemas que no lo hacen son aquellos cuyos usuarios eventualmente aprenden que la memoria en la que confiaban era una isla todo el tiempo.
La procedencia es el seguro más barato que puedes comprar en el momento de la escritura. La disciplina es comprarlo antes de descubrir que lo necesitas.
¿Te resultó útil este artículo? Compártelo para que otros también puedan beneficiarse :)
El próximo artículo trata sobre recuperación híbrida y RRF, el patrón que te permite combinar señales vectoriales y de palabras clave sin que una ahogue a la otra, lo cual importa más cuando la procedencia te dice que un hecho es sólido pero la relevancia por sí sola lo enterraría. Ese artículo está por venir.





