Siéntate con un sistema flat-RAG que ha estado funcionando en producción durante un año e intenta hacerle cuatro preguntas. "¿Por qué dijiste eso?" El modelo produjo una respuesta segura sobre la fecha de renovación del contrato del cliente, pero el rastro hasta la cláusula original no existe. "Revalida esta afirmación — la fuente cambió". El contrato se modificó la semana pasada. Cada hecho derivado de él es sospechoso. No puedes encontrarlos porque no sabes de qué documento provienen. "Decide entre estos dos hechos contradictorios". Uno dice que Alex trabaja en Google, el otro en Stripe. Ninguno lleva una puntuación de confianza ni una marca de tiempo de la fuente. La actualidad de la escritura no tiene nada que ver con la actualidad de la evidencia. "Atribuye esta alucinación". El modelo dijo que la reunión era el jueves. No hubo ninguna reunión el jueves. No puedes distinguir si el LLM inventó la fecha o si fueron datos incorrectos en la memoria los que lo engañaron.
Estos cuatro fallos comparten una única causa. Cada uno es una columna que falta. Un identificador de fuente, una marca de tiempo de captura, una puntuación de confianza, un registro de citas de la respuesta. Cada uno cuesta unos pocos bytes en el momento de escribir. El coste de no tenerlos es ilimitado: cada afirmación no es auditable, cada contradicción es irresoluble, cada alucinación es intrazable.
En 19 sistemas, el patrón es consistente. Las implementaciones más sólidas tratan la procedencia como un tribunal trata la evidencia: cada afirmación llega con una cadena de custodia ininterrumpida o no llega en absoluto. Las más débiles no llevan ninguna y pagan por ello cada vez que algo sale mal en producción. Este artículo recorre los seis niveles de procedencia que ha revelado el corpus, los tres niveles de madurez de implementación que los separan y el coste real de construir esto correctamente desde el principio.
Seis niveles, una disciplina
Tras leer 19 sistemas de principio a fin, se distinguen seis niveles distintos de procedencia. No son una jerarquía; son ortogonales. Un sistema puede tener procedencia de fuente sin procedencia causal. Puede tener versionado sin puntuación de confianza. Las implementaciones más robustas cubren los seis. Ninguna de las más débiles cubre ninguna.
Identidad responde "¿qué hecho, exactamente?" OpenContext genera UUIDs para cada pieza de contexto en el momento de la ingesta y los expone como un esquema de citas que el agente puede usar directamente en las respuestas. El identificador sobrevive a renombrados, movimientos y reorganizaciones porque está vinculado al contenido, no a la ruta. mem9 lleva un ID de memoria estable en cada fila, más un contador de versión explícito con protección de concurrencia If-Match. Sin procedencia de identidad, ni siquiera puedes nombrar de qué estás hablando cuando algo sale mal.
Fuente responde "¿de dónde vino?" Hindsight registra el tipo de fuente y el identificador en cada observación, para que el sistema pueda responder de qué conversación o documento proviene un hecho dado. mem9 lleva fuente, ID de agente e ID de sesión en cada fila. Supermemory almacena IDs de documento junto con los recuerdos. Sin procedencia de fuente, no puedes actualizar en cascada cuando una fuente cambia, porque no sabes qué hechos dependen de ella.
Causal responde "¿qué paso del agente usó esto?" Hindsight captura cada hecho recuperado y utilizado en un nivel de observación con contexto de recuperación completo — qué recuperador lo mostró, qué rango alcanzó y si el agente realmente lo consumió. Moraine trata cada paso de traza como su propio registro de procedencia, haciendo que toda la ejecución del agente sea recuperable como una secuencia de eventos direccionables por fuente. Sin procedencia causal no puedes distinguir entre "el sistema recuperó este hecho" y "el agente usó este hecho para producir esa respuesta".
Confianza de captura responde "¿qué seguridad teníamos cuando lo escribimos?" Graphify marca cada arista en su grafo de conocimiento con tres niveles de confianza de captura: CONFIRMED para extracciones deterministas, LIKELY para inferencias LLM de alta confianza y AMBIGUOUS para afirmaciones inciertas. Las aristas AMBIGUOUS aparecen como "vacíos de conocimiento" para revisión humana en lugar de tratarse silenciosamente como hechos. Hindsight lleva una puntuación de confianza en cada observación que decae con el tiempo a través de su ciclo de vida de frescura: las observaciones recientes son fiables, las obsoletas se ponderan a la baja o se retiran. mem9 ejecuta detección de casi-duplicados en modo oculto primero, registrando puntuaciones sin actuar sobre ellas hasta que el ingeniero haya calibrado el umbral con datos reales. Sin confianza de captura, los hechos inciertos y los ciertos se recuperan con el mismo peso, y el agente no puede discriminar entre una afirmación sólida y una suposición fundamentada.
Versionado responde "¿qué creíamos antes?" Supermemory trata la memoria como un DAG versionado con aristas tipadas — actualiza, extiende, deriva — dando a cada creencia un historial de confirmación. mem9 divide la ruta de escritura: mutación in situ para ediciones humanas, añadir y archivar para reescrituras impulsadas por LLM donde el nuevo contenido reemplaza semánticamente al antiguo. Tolaria deja que Git lleve todo el historial de versiones, tratando los diffs de una línea como un artefacto de primera clase orientado al usuario. Sin procedencia versionada no puedes retroceder a lo que el sistema creía el martes, porque las creencias antiguas se eliminan en lugar de archivarse.
Recíproca responde "¿qué otros hechos comparten este origen?" llm-wiki pondera la superposición de fuentes por encima del enlace directo en su grafo de relevancia de cuatro señales: dos páginas que provienen del mismo documento en bruto se consideran más relacionadas que dos páginas con un enlace wiki directo, porque el LLM no es fiable para los enlaces cruzados, pero los metadatos de las fuentes se mantienen mecánicamente. EdgeQuake acumula IDs de fuente en entidades y relaciones a lo largo del corpus, de modo que las menciones repetidas de la misma entidad desde diferentes fuentes fortalecen su peso de procedencia. second-brain lleva la fuente como parte de su clave compuesta del índice léxico, permitiendo que un solo documento sea indexado desde múltiples canalizaciones de forma independiente. Sin procedencia recíproca no puedes responder "muéstrame todo en este sistema que proviene de la misma conversación" o "¿qué más aprendimos de ese documento?"
Los seis son ortogonales pero se refuerzan mutuamente. La procedencia de fuente es inútil sin identidad (necesitas nombrar el hecho antes de poder rastrearlo). El versionado es más débil sin confianza (conoces el linaje de las ediciones, pero no la seguridad que el sistema tenía sobre cada una). Las consultas recíprocas dependen de que la fuente esté presente primero. Los sistemas que llevan los seis son aquellos cuya memoria no se pudre silenciosamente.
Tres niveles de madurez de implementación
El corpus se divide en tres niveles según dónde reside la procedencia y qué puede hacer en el momento de la lectura.
El nivel 1 es RAG sin procedencia, el punto de partida de la mayoría de los equipos. Almacenes vectoriales planos con contenido y un embedding. Sin columna de fuente, sin puntuación de confianza, sin historial de versiones. Cuando se recupera un hecho, obtienes texto y una puntuación de similitud. No puedes rastrear de dónde vino, qué seguridad tenía el sistema al respecto, ni si ha sido reemplazado. Todos los sistemas que empezaron aquí se han movido hacia el nivel 2 con el tiempo.
El nivel 2 lleva procedencia en la fila. ID de fuente, confianza, versión — todo presente como columnas junto al hecho. mem9 está aquí con fuente, ID de agente, ID de sesión y versión en cada fila. El DAG versionado de Supermemory es estructura de nivel 2. La confianza de arista de tres niveles de Graphify es disciplina de nivel 2. La procedencia está disponible para las consultas, pero no decora automáticamente los resultados de recuperación. Tienes que escribir la consulta que la use.
El nivel 3 decora los resultados de lectura con contexto de procedencia sin que la persona que llama tenga que pedirlo. Hindsight es la referencia aquí — cada hecho recuperado llega con su tipo de fuente, puntuación de confianza, estado de frescura y clasificación por recuperador ya adjuntos. El agente que consume el resultado ve la procedencia como parte del hecho, no como una consulta separada. La decoración de turno de fuente de mem9 se sitúa a medio camino entre el nivel 2 y el nivel 3, injertando contexto de tiempo de lectura en un esquema de nivel 2.
La migración es unidireccional. Ningún sistema comienza en el nivel 3 y decide eliminar la disciplina de procedencia. Las columnas demuestran su valor tan pronto como están presentes. Si estás diseñando un sistema de memoria hoy, la pregunta no es "¿necesito procedencia?" sino "¿en qué nivel quiero empezar, sabiendo que cada nivel por encima del que elijo es más difícil de alcanzar más tarde que de integrar ahora?"
El caso de advertencia: calculado y descartado
Understand-Anything ilustra lo que ocurre cuando el sustrato para la confianza existe pero la columna para registrarlo no. El sistema distingue entre aristas deterministas (resueltas por un escáner de proyecto a partir de archivos fuente) y aristas inferidas (adivinadas por un LLM durante el análisis semántico). Esa información es real y significativa: una arista de importación estructural merece mayor confianza que una inferencia sin código. Pero ambas se almacenan con un peso de 0,7, idénticas en el grafo. La señal de confianza se calcula en el momento de la escritura y se descarta antes de la persistencia.
Añadir un campo de confianza sería un cambio pequeño con una gran recompensa en calidad de información. El sistema ya sabe qué aristas son sólidas y cuáles son suposiciones. Simplemente no registra la distinción donde importa — en la fila que se recupera más tarde, cuando el agente necesita discriminar entre ellas. Este patrón aparece en múltiples sistemas del corpus: la información está disponible en el momento de la escritura, es barata de capturar y luego se pierde porque nadie añadió la columna.
El coste real de hacerlo bien
La procedencia cuesta bytes. Un ID de fuente, una puntuación de confianza, un contador de versión — cada uno añade unos pocos campos por fila. A escala eso importa, pero importa mucho menos que el coste de no tenerlos cuando algo sale mal en producción y no puedes rastrear por qué el sistema produjo una respuesta incorrecta.
El coste de cómputo es menor de lo esperado. La puntuación de confianza normalmente requiere una llamada LLM adicional en el momento de escritura (o una heurística determinista para hechos estructurales), que se amortiza en cada lectura posterior. El rastreo de fuente no cuesta nada más que registrar un identificador que ya existe. El versionado cuesta una columna extra o una adición por escritura, no una instantánea completa. El nivel de observación de Hindsight añade almacenamiento proporcional al número de hechos recuperados y utilizados, pero solo registra lo que el agente realmente consumió, no todo lo que vio.
El coste operativo es la verdadera cuestión. La decoración de nivel 3 significa más datos fluyendo en cada recuperación, lo que aumenta ligeramente el uso del contexto y la latencia de la respuesta. Los sistemas que implementan esto lo manejan manteniendo las decoraciones concisas — un enum de tipo de fuente, un float de confianza, un estado de frescura — en lugar de árboles de procedencia completos en línea. El agente obtiene suficiente para discriminar sin ahogarse en metadatos.
Qué comparten las implementaciones más sólidas
Los ejemplos destacados en el corpus merecen ser reafirmados porque ninguno resuelve la misma porción del problema:
OpenContext genera UUIDs que sobreviven a cualquier reorganización del sistema de archivos y los expone como un esquema de citas que el agente puede usar directamente. mem9 lleva fuente, ID de agente, ID de sesión en cada fila, versión en cada actualización, y decora los resultados de búsqueda con contexto de turno de fuente gobernado por un presupuesto explícito. Supermemory trata la memoria como un DAG versionado con aristas tipadas, dando a cada creencia un historial de confirmación. Hindsight captura cada hecho recuperado y utilizado en un nivel de observación con procedencia de fuente completa, historial de evolución y clasificación por recuperador. Graphify marca cada arista con confianza de captura de tres niveles, exponiendo aristas inciertas para revisión humana en lugar de tratarlas como hechos.
La observación unificadora es clara: la procedencia no es metadato, es parte del hecho. Los sistemas que la tratan así son aquellos cuya memoria no se pudre silenciosamente, cuyas contradicciones pueden resolverse, cuyas alucinaciones pueden rastrearse y cuyo historial de creencias puede rebobinarse a cualquier punto del pasado sin haber anticipado la necesidad.
Los sistemas que no lo hacen son aquellos cuyos usuarios aprenden eventualmente que la memoria en la que confiaban era una isla desde el principio.
La procedencia es el seguro más barato que puedes comprar en el momento de escribir. La disciplina es comprarlo antes de descubrir que lo necesitas.
¿Te ha parecido útil este artículo? Compártelo para que otros también puedan beneficiarse :)
El próximo artículo trata sobre la recuperación híbrida y RRF, el patrón que te permite combinar señales vectoriales y de palabras clave sin que una ahogue a la otra — algo que importa sobre todo cuando la procedencia te dice que un hecho es sólido pero la relevancia por sí sola lo enterraría. Ese artículo está por venir.





