Sente-se com um sistema RAG puro que está rodando em produção há um ano e tente fazer quatro perguntas. "Por que você disse isso?" O modelo produziu uma resposta confiante sobre a data de renovação do contrato do cliente, mas o rastro de volta para a cláusula de origem não existe. "Revalide essa afirmação -- a fonte mudou." O contrato foi alterado na semana passada. Todo fato derivado dele é suspeito. Você não consegue encontrá-los porque eles não sabem de qual documento vieram. "Decida entre esses dois fatos contraditórios." Um diz que Alex trabalha no Google, outro diz que trabalha no Stripe. Nenhum vem com pontuação de confiança ou timestamp de origem. A recência da escrita não tem nada a ver com a recência da evidência. "Atribua essa alucinação." O modelo disse que a reunião foi na quinta-feira. Não houve reunião na quinta-feira. Você não consegue dizer se o LLM inventou a data ou se dados ruins na memória o enganaram.
Essas quatro falhas compartilham uma única causa. Cada uma é uma coluna faltante. Um identificador de fonte, um timestamp de captura, uma pontuação de confiança, um log de citação de resposta. Cada uma custa alguns bytes no momento da escrita. O custo de não tê-las é ilimitado: toda afirmação não é auditável, toda contradição é insolúvel, toda alucinação é intraceável.
Em 19 sistemas, o padrão é consistente. As implementações mais robustas tratam a proveniência como um tribunal trata evidências -- toda afirmação chega com uma cadeia de custódia ininterrupta ou não chega de jeito nenhum. As mais fracas não carregam nenhuma e pagam por isso toda vez que algo dá errado em produção. Este artigo percorre os seis níveis de proveniência que o corpus revelou, os três níveis de maturidade de implementação que os separam e o custo honesto de construir isso certo desde o início.
Seis níveis, uma disciplina
Lendo 19 sistemas consecutivamente, seis níveis distintos de proveniência se destacam. Eles não são uma hierarquia; são ortogonais. Um sistema pode ter proveniência de fonte sem proveniência causal. Pode ter versionamento sem pontuação de confiança. As implementações mais fortes cobrem todos os seis. Nenhuma das mais fracas cobre nenhum.
Identidade responde "qual fato exatamente?" O OpenContext gera UUIDs para cada pedaço de contexto no momento da ingestão e os expõe como um esquema de citação que o agente pode usar diretamente nas respostas. O identificador sobrevive a renomeações, movimentações e reorganizações porque está vinculado ao conteúdo, não ao caminho. O mem9 carrega um ID de memória estável em cada linha, além de um contador de versão explícito com proteção de concorrência If-Match. Sem proveniência de identidade, você não consegue nem nomear sobre o que está falando quando algo dá errado.
Fonte responde "de onde veio?" O Hindsight registra o tipo de fonte e o identificador em cada observação, para que o sistema possa responder qual conversa ou documento produziu um determinado fato. O mem9 carrega fonte, ID do agente e ID da sessão em cada linha. O Supermemory armazena IDs de documentos junto com as memórias. Sem proveniência de fonte, você não consegue atualizar em cascata quando uma fonte é alterada, porque não sabe quais fatos dependem dela.
Causal responde "qual passo do agente usou isso?" O Hindsight captura todo fato recuperado e usado em um nível de observação com contexto completo de recuperação -- qual recuperador o trouxe à tona, qual classificação ele alcançou e se o agente realmente o consumiu. O Moraine trata cada passo de rastreamento como seu próprio registro de proveniência, tornando toda a execução do agente recuperável como uma sequência de eventos endereçáveis por fonte. Sem proveniência causal, você não consegue distinguir "o sistema recuperou este fato" de "o agente usou este fato para produzir aquela resposta."
Confiança de captura responde "quão certos estávamos quando escrevemos isso?" O Graphify marca cada aresta em seu grafo de conhecimento com confiança de captura em três níveis: CONFIRMED para extrações determinísticas, LIKELY para inferências de LLM de alta confiança e AMBIGUOUS para afirmações incertas. As arestas AMBIGUOUS emergem como "lacunas de conhecimento" para revisão humana, em vez de serem tratadas silenciosamente como fato. O Hindsight carrega uma pontuação de confiança em cada observação que decai ao longo do tempo por meio de seu ciclo de vida de frescor -- observações recentes são confiáveis, as obsoletas são rebaixadas ou aposentadas. O mem9 executa detecção de quase duplicatas em modo oculto primeiro, registrando pontuações sem agir sobre elas até que o engenheiro calibre o limite a partir de dados reais. Sem confiança de captura, fatos incertos e certos são recuperados com o mesmo peso, e o agente não consegue discriminar entre uma afirmação sólida e um palpite fundamentado.
Versionamento responde "no que acreditávamos antes?" O Supermemory trata a memória como um DAG versionado com arestas tipadas -- atualiza, estende, deriva -- dando a cada crença um histórico de commit. O mem9 divide o caminho de escrita: mutação in-place para edições humanas, anexar-e-arquivar para reescritas orientadas por LLM, onde o novo conteúdo substitui semanticamente o antigo. O Tolaria deixa o Git carregar todo o histórico de versões, tratando diffs de uma linha como um artefato de primeira classe voltado para o usuário. Sem proveniência versionada, você não pode retroceder para o que o sistema acreditava na terça-feira, porque crenças antigas são deletadas em vez de arquivadas.
Reciprocidade responde "que outros fatos compartilham esta origem?" O llm-wiki pondera a sobreposição de fontes acima da vinculação direta em seu grafo de relevância de quatro sinais -- duas páginas que vieram do mesmo documento bruto são consideradas mais fortemente relacionadas do que duas páginas com um wikilink direto, porque o LLM não é confiável em links cruzados, mas o frontmatter das fontes é mantido mecanicamente. O EdgeQuake acumula IDs de fonte em entidades e relacionamentos em todo o corpus, de modo que menções repetidas da mesma entidade de fontes diferentes fortalecem seu peso de proveniência. O second-brain carrega a fonte como parte de sua chave composta de índice lexical, permitindo que um único documento seja indexado a partir de múltiplos pipelines de forma independente. Sem proveniência recíproca, você não pode responder "mostre-me tudo neste sistema que veio da mesma conversa" ou "o que mais aprendemos com aquele documento?"
Os seis são ortogonais, mas se reforçam mutuamente. A proveniência de fonte é inútil sem identidade (você precisa nomear o fato antes de poder rastreá-lo). O versionamento é mais fraco sem confiança (você conhece a linhagem das edições, mas não o quão certo o sistema estava sobre qualquer uma delas). Consultas recíprocas dependem da fonte estar presente primeiro. Os sistemas que carregam todos os seis são aqueles cuja memória não apodrece silenciosamente.
Três níveis de maturidade de implementação
O corpus se separa em três níveis com base em onde a proveniência vive e o que ela pode fazer no momento da leitura.
Nível 1 é RAG sem proveniência, o ponto de partida para a maioria das equipes. Armazenamentos vetoriais planos com conteúdo e um embedding. Nenhuma coluna de fonte, nenhuma pontuação de confiança, nenhum histórico de versão. Quando um fato é recuperado, você obtém texto e uma pontuação de similaridade. Você não consegue rastrear de onde veio, o quão certo o sistema estava sobre ele ou se foi substituído. Todo sistema que começou aqui migrou para o Nível 2 com o tempo.
Nível 2 carrega proveniência na linha. ID da fonte, confiança, versão -- todos presentes como colunas junto com o fato. O mem9 está aqui com fonte, ID do agente, ID da sessão e versão em cada linha. O DAG versionado do Supermemory é estrutura de Nível 2. A confiança de aresta de três níveis do Graphify é disciplina de Nível 2. A proveniência está disponível para consultas, mas não decora automaticamente os resultados da recuperação. Você tem que escrever a consulta que a utiliza.
Nível 3 decora os resultados de leitura com contexto de proveniência sem que o chamador precise solicitá-lo. O Hindsight é a referência aqui -- todo fato recuperado chega com seu tipo de fonte, pontuação de confiança, estado de frescor e classificação por recuperador já anexados. O agente que consome o resultado vê a proveniência como parte do fato, não como uma consulta separada. A decoração de turno de fonte do mem9 fica a meio caminho entre o Nível 2 e o Nível 3, agregando contexto de tempo de leitura a um esquema de Nível 2.
A migração é unidirecional. Nenhum sistema começa no Nível 3 e decide remover a disciplina de proveniência. As colunas provam seu valor assim que estão presentes. Se você está projetando um sistema de memória hoje, a pergunta não é "preciso de proveniência?" mas "em qual nível quero começar, sabendo que todo nível acima do que eu escolher é mais difícil de alcançar depois do que incorporar agora?"
O caso de advertência: computado e descartado
O Understand-Anything ilustra o que acontece quando o substrato para confiança existe, mas a coluna para registrá-lo não. O sistema distingue arestas determinísticas (resolvidas por um scanner de projeto a partir de arquivos fonte) de arestas inferidas (adivinhadas por um LLM durante análise semântica). Essa informação é real e significativa -- uma aresta de importação estrutural merece maior confiança do que uma inferência de não código. Mas ambas são armazenadas com peso 0,7, idênticas no grafo. O sinal de confiança é computado no momento da escrita e descartado antes da persistência.
Adicionar um campo de confiança seria uma pequena mudança com um grande retorno em qualidade de informação. O sistema já sabe quais arestas são sólidas e quais são palpites. Só não registra a distinção onde importa -- na linha que é recuperada depois, quando o agente precisa discriminar entre elas. Esse padrão aparece em vários sistemas do corpus: a informação está disponível no momento da escrita, é barata de capturar e depois é perdida porque ninguém adicionou a coluna.
O custo honesto de construir isso certo
Proveniência custa bytes. Um ID de fonte, uma pontuação de confiança, um contador de versão -- cada um adiciona alguns campos por linha. Em escala, isso importa, mas importa muito menos do que o custo de não tê-los quando algo dá errado em produção e você não consegue rastrear por que o sistema produziu uma resposta errada.
O custo computacional é menor do que o esperado. A pontuação de confiança normalmente requer uma chamada adicional de LLM no momento da escrita (ou uma heurística determinística para fatos estruturais), que é amortizada em cada leitura subsequente. O rastreamento de fonte não custa nada além de registrar um identificador que já existe. O versionamento custa uma coluna extra ou um anexo por escrita, não um snapshot completo. O nível de observação do Hindsight adiciona armazenamento proporcional ao número de fatos recuperados e usados, mas registra apenas o que o agente realmente consumiu, não tudo o que viu.
O custo operacional é a verdadeira questão. A decoração de Nível 3 significa mais dados fluindo em cada recuperação, o que aumenta ligeiramente o uso da janela de contexto e a latência da resposta. Os sistemas que implementam isso lidam com a situação mantendo as decorações concisas -- um enum de tipo de fonte, um float de confiança, um estado de frescor -- em vez de árvores de proveniência completas inline. O agente obtém o suficiente para discriminar sem se afogar em metadados.
O que as implementações mais fortes compartilham
Os exemplos do corpus merecem ser reafirmados porque nenhum par resolve a mesma fatia do problema:
O OpenContext gera UUIDs que sobrevivem a qualquer reorganização do sistema de arquivos e os expõe como um esquema de citação que o agente pode usar diretamente. O mem9 carrega fonte, ID do agente, ID da sessão em cada linha, versão em cada atualização e decora os resultados da pesquisa com contexto de turno de fonte governado por um orçamento explícito. O Supermemory trata a memória como um DAG versionado com arestas tipadas, dando a cada crença um histórico de commit. O Hindsight captura todo fato recuperado e usado em um nível de observação com proveniência completa da fonte, histórico de evolução e classificação por recuperador. O Graphify marca cada aresta com confiança de captura em três níveis, expondo arestas incertas para revisão humana em vez de tratá-las como fato.
A observação unificadora é simples: proveniência não é metadado, é parte do fato. Os sistemas que a tratam dessa forma são aqueles cuja memória não apodrece silenciosamente, cujas contradições podem ser julgadas, cujas alucinações podem ser rastreadas e cujo histórico de crenças pode ser rebobinado para qualquer ponto no passado sem ter antecipado a necessidade.
Os sistemas que não o fazem são aqueles cujos usuários aprendem eventualmente que a memória em que confiavam era uma ilha o tempo todo.
Proveniência é o seguro mais barato que você pode comprar no momento da escrita. A disciplina é comprá-lo antes de descobrir que precisava dele.
Achou este artigo útil? Por favor, compartilhe para que outros também possam :)
O próximo artigo aborda recuperação híbrida e RRF, o padrão que permite combinar sinais vetoriais e de palavra-chave sem que um sobreponha o outro -- o que é mais importante quando a proveniência diz que um fato é sólido, mas a relevância sozinha o enterraria. Esse artigo está a caminho.





