Sente-se com um sistema RAG simples que está rodando em produção há um ano e tente fazer quatro perguntas. "Por que você disse isso?" O modelo deu uma resposta confiante sobre a data de renovação do contrato do cliente, mas o rastro de volta à cláusula de origem não existe. "Revalide essa afirmação — a fonte mudou." O contrato foi alterado na semana passada. Todos os fatos derivados dele são suspeitos. Você não consegue encontrá-los porque eles não sabem de qual documento vieram. "Decida entre esses dois fatos contraditórios." Um diz que Alex trabalha no Google, outro diz que trabalha no Stripe. Nenhum carrega uma pontuação de confiança ou um timestamp de origem. A recência da gravação não tem relação com a recência da evidência. "Atribua essa alucinação." O modelo disse que a reunião era na quinta-feira. Não houve reunião na quinta-feira. Você não consegue dizer se o LLM inventou a data ou se dados ruins na memória o enganaram.
Essas quatro falhas compartilham uma única causa. Cada uma é uma coluna ausente. Um identificador de fonte, um timestamp de captura, uma pontuação de confiança, um log de citação de resposta. Cada um custa alguns bytes no momento da gravação. O custo de não tê-los é ilimitado: toda afirmação é inauditável, toda contradição é irresolvível, toda alucinação é intraceável.
Em 19 sistemas, o padrão é consistente. As implementações mais fortes tratam a proveniência como um tribunal trata evidências — toda afirmação chega com uma cadeia de custódia ininterrupta ou não chega de forma alguma. As mais fracas não carregam nenhuma e pagam por isso toda vez que algo dá errado em produção. Este artigo percorre os seis níveis de proveniência que o corpus revelou, os três níveis de maturidade de implementação que os separam e o custo real de construir isso certo desde o início.
Seis níveis, uma disciplina
Lendo 19 sistemas consecutivamente, seis níveis distintos de proveniência se destacam. Eles não são uma hierarquia; são ortogonais. Um sistema pode ter proveniência de fonte sem proveniência causal. Pode ter versionamento sem pontuação de confiança. As implementações mais fortes cobrem todos os seis. Nenhuma das mais fracas cobre qualquer um.
Identidade responde "qual fato, exatamente?" O OpenContext gera UUIDs para cada pedaço de contexto no momento da ingestão e os expõe como um esquema de citação que o agente pode usar diretamente nas respostas. O identificador sobrevive a renomeações, movimentações e reorganizações porque está vinculado ao conteúdo, não ao caminho. O mem9 carrega um ID de memória estável em cada linha, além de um contador de versão explícito com proteção de concorrência If-Match. Sem proveniência de identidade, você não consegue nem nomear sobre o que está falando quando as coisas dão errado.
Fonte responde "de onde veio?" O Hindsight registra o tipo de fonte e o identificador em cada observação, para que o sistema possa responder qual conversa ou documento produziu um determinado fato. O mem9 carrega fonte, ID do agente e ID da sessão em cada linha. O Supermemory armazena IDs de documentos junto com as memórias. Sem proveniência de fonte, você não pode atualizar em cascata quando uma fonte muda, porque não sabe de quais fatos ela depende.
Causal responde "qual etapa do agente usou isso?" O Hindsight captura todo fato recuperado e usado em um nível de observação com contexto de recuperação completo — qual recuperador o trouxe à tona, qual classificação ele alcançou e se o agente realmente o consumiu. O Moraine trata cada etapa de rastreamento como seu próprio registro de proveniência, tornando toda a execução do agente recuperável como uma sequência de eventos endereçáveis por fonte. Sem proveniência causal, você não consegue distinguir "o sistema recuperou este fato" de "o agente usou este fato para produzir aquela resposta."
Confiança de captura responde "quão certos estávamos quando registramos?" O Graphify marca cada aresta em seu grafo de conhecimento com três níveis de confiança de captura: CONFIRMADO para extrações determinísticas, PROVÁVEL para inferências de LLM de alta confiança e AMBÍGUO para alegações incertas. As arestas AMBÍGUAS aparecem como "lacunas de conhecimento" para revisão humana, em vez de serem tratadas silenciosamente como fato. O Hindsight carrega uma pontuação de confiança em cada observação que decai ao longo do tempo através de seu ciclo de vida de frescor — observações recentes são confiáveis, as obsoletas são despriorizadas ou aposentadas. O mem9 executa detecção de quase duplicatas em modo oculto primeiro, registrando pontuações sem agir sobre elas até que o engenheiro calibre o limite com dados reais. Sem confiança de captura, fatos incertos e certos são recuperados com o mesmo peso, e o agente não consegue discriminar entre uma alegação sólida e um palpite fundamentado.
Versionado responde "no que acreditávamos antes?" O Supermemory trata a memória como um DAG versionado com arestas tipadas — atualiza, estende, deriva — dando a cada crença um histórico de commit. O mem9 divide o caminho de gravação: mutação in-place para edições humanas, anexar-e-arquivar para reescritas orientadas por LLM onde o novo conteúdo substitui semanticamente o antigo. O Tolaria deixa o Git carregar todo o histórico de versões, tratando diffs de uma linha como um artefato de primeira classe voltado para o usuário. Sem proveniência versionada, você não pode voltar ao que o sistema acreditava na terça-feira, porque crenças antigas são excluídas em vez de arquivadas.
Recíproca responde "que outros fatos compartilham esta origem?" O llm-wiki pondera a sobreposição de fontes acima da vinculação direta em seu grafo de relevância de quatro sinais — duas páginas que vieram do mesmo documento bruto são consideradas mais fortemente relacionadas do que duas páginas com um wikilink direto, porque o LLM não é confiável em cross-linking, mas o frontmatter das fontes é mantido mecanicamente. O EdgeQuake acumula IDs de fonte em entidades e relacionamentos em todo o corpus, de modo que menções repetidas da mesma entidade de fontes diferentes fortalecem seu peso de proveniência. O second-brain carrega a fonte como parte de sua chave composta de índice lexical, permitindo que um único documento seja indexado de vários pipelines independentemente. Sem proveniência recíproca, você não pode responder "mostre-me tudo neste sistema que veio da mesma conversa" ou "o que mais aprendemos com aquele documento?"
Os seis são ortogonais, mas se reforçam mutuamente. A proveniência de fonte é inútil sem identidade (você precisa nomear o fato antes de rastreá-lo). O versionamento é mais fraco sem confiança (você conhece a linhagem das edições, mas não o quão certo o sistema estava sobre qualquer uma delas). Consultas recíprocas dependem da presença da fonte primeiro. Os sistemas que carregam todos os seis são aqueles cuja memória não apodrece silenciosamente.
Três níveis de maturidade de implementação
O corpus se divide em três níveis com base em onde a proveniência vive e o que ela pode fazer no momento da leitura.
Nível 1 é RAG sem proveniência, o ponto de partida para a maioria das equipes. Armazenamentos vetoriais simples com conteúdo e um embedding. Sem coluna de fonte, sem pontuação de confiança, sem histórico de versão. Quando um fato é recuperado, você recebe texto e uma pontuação de similaridade. Você não consegue rastrear de onde veio, o quão certo o sistema estava sobre ele ou se foi substituído. Todo sistema que começou aqui migrou para o Nível 2 com o tempo.
Nível 2 carrega proveniência na linha. ID da fonte, confiança, versão — todos presentes como colunas junto com o fato. O mem9 está aqui com fonte, ID do agente, ID da sessão e versão em cada linha. O DAG versionado do Supermemory é uma estrutura de Nível 2. A confiança de aresta de três níveis do Graphify é uma disciplina de Nível 2. A proveniência está disponível para consultas, mas não decora automaticamente os resultados da recuperação. Você precisa escrever a consulta que a utiliza.
Nível 3 decora os resultados em tempo de leitura com contexto de proveniência sem que quem chama precise solicitá-lo. O Hindsight é a referência aqui — todo fato recuperado chega com seu tipo de fonte, pontuação de confiança, estado de frescor e classificação por recuperador já anexados. O agente que consome o resultado vê a proveniência como parte do fato, não como uma consulta separada. A decoração source-turn do mem9 fica em algum lugar entre o Nível 2 e o Nível 3, agregando contexto de tempo de leitura a um esquema de Nível 2.
A migração é unidirecional. Nenhum sistema começa no Nível 3 e decide remover a disciplina de proveniência. As colunas provam seu valor assim que estão presentes. Se você está projetando um sistema de memória hoje, a pergunta não é "preciso de proveniência?" mas "em qual nível quero começar, sabendo que todo nível acima daquele que eu escolher é mais difícil de alcançar depois do que de incorporar agora?"
O caso de alerta: calculado e descartado
O Understand-Anything ilustra o que acontece quando o substrato para confiança existe, mas a coluna para registrá-lo não. O sistema distingue arestas determinísticas (resolvidas por um scanner de projeto a partir de arquivos de origem) de arestas inferidas (adivinhadas por um LLM durante a análise semântica). Essa informação é real e significativa — uma aresta de importação estrutural merece maior confiança do que uma inferência não relacionada a código. Mas ambas são armazenadas com peso 0.7, idênticas no grafo. O sinal de confiança é calculado no momento da gravação e descartado antes da persistência.
Adicionar um campo de confiança seria uma pequena mudança com um grande retorno em qualidade da informação. O sistema já sabe quais arestas são sólidas e quais são palpites. Só não registra a distinção onde importa — na linha que será recuperada depois, quando o agente precisar discriminar entre elas. Esse padrão aparece em vários sistemas do corpus: a informação está disponível no momento da gravação, é barata de capturar e depois se perde porque ninguém adicionou a coluna.
O custo real de construir isso certo
Proveniência custa bytes. Um ID de fonte, uma pontuação de confiança, um contador de versão — cada um adiciona alguns campos por linha. Em escala, isso importa, mas importa muito menos do que o custo de não tê-los quando algo dá errado em produção e você não consegue rastrear por que o sistema produziu uma resposta errada.
O custo computacional é menor do que o esperado. A pontuação de confiança normalmente requer uma chamada adicional de LLM no momento da gravação (ou uma heurística determinística para fatos estruturais), que é amortizada em cada leitura subsequente. O rastreamento de fonte não custa nada além de registrar um identificador que já existe. O versionamento custa uma coluna extra ou um anexo por gravação, não um snapshot completo. O nível de observação do Hindsight adiciona armazenamento proporcional ao número de fatos recuperados e usados, mas registra apenas o que o agente realmente consumiu, não tudo o que viu.
O custo operacional é a verdadeira questão. A decoração de Nível 3 significa mais dados fluindo em cada recuperação, o que aumenta ligeiramente o uso do contexto da janela e a latência da resposta. Os sistemas que implementam isso lidam com a situação mantendo as decorações concisas — um enum de tipo de fonte, um float de confiança, um estado de frescor — em vez de árvores de proveniência completas inline. O agente recebe o suficiente para discriminar sem se afogar em metadados.
O que as implementações mais fortes compartilham
Os exemplares em todo o corpus merecem ser reafirmados porque nenhum dois resolve a mesma fatia do problema:
O OpenContext gera UUIDs que sobrevivem a qualquer reorganização do sistema de arquivos e os expõe como um esquema de citação que o agente pode usar diretamente. O mem9 carrega fonte, ID do agente, ID da sessão em cada linha, versão em cada atualização e decora os resultados da pesquisa com contexto source-turn governado por um orçamento explícito. O Supermemory trata a memória como um DAG versionado com arestas tipadas, dando a cada crença um histórico de commit. O Hindsight captura todo fato recuperado e usado em um nível de observação com proveniência de fonte completa, histórico de evolução e classificação por recuperador. O Graphify marca cada aresta com três níveis de confiança de captura, exibindo arestas incertas para revisão humana em vez de tratá-las como fato.
A observação unificadora é simples: proveniência não é metadado, é parte do fato. Os sistemas que a tratam dessa forma são aqueles cuja memória não apodrece silenciosamente, cujas contradições podem ser julgadas, cujas alucinações podem ser rastreadas e cujo histórico de crenças pode ser rebobinado para qualquer ponto do passado sem ter antecipado a necessidade.
Os sistemas que não o fazem são aqueles cujos usuários aprendem, eventualmente, que a memória em que confiavam era uma ilha o tempo todo.
Proveniência é o seguro mais barato que você pode comprar no momento da gravação. A disciplina é comprá-lo antes de descobrir que precisava dele.
Achou este artigo útil? Compartilhe para que outros também possam :)
O próximo artigo aborda recuperação híbrida e RRF, o padrão que permite combinar sinais vetoriais e de palavras-chave sem que um sufogue o outro — o que é mais importante quando a proveniência diz que um fato é sólido, mas a relevância sozinha o enterraria. Esse artigo está a caminho.





