YouMind
Đăng nhập

Một sự thật không có nguồn gốc giống như một hòn đảo. Tại sao mọi bộ nhớ phải mang theo xuất xứ của nó.

@S_BatMan
TIẾNG ANH18 thg 5, 2026
1.2M
265
18
6
133

TL;DR

Bài viết này khám phá vai trò quan trọng của nguồn gốc dữ liệu trong các hệ thống RAG, trình bày chi tiết sáu cấp độ theo dõi dữ liệu và ba giai đoạn trưởng thành để ngăn chặn ảo giác và đảm bảo bộ nhớ AI có thể kiểm chứng.

Hãy ngồi xuống với một hệ thống RAG phẳng đã chạy production suốt một năm và thử đặt cho nó bốn câu hỏi. "Tại sao bạn lại nói thế?" Mô hình đưa ra câu trả lời đầy tự tin về ngày gia hạn hợp đồng của khách hàng, nhưng đường mòn ngược trở lại điều khoản gốc không tồn tại. "Xác thực lại thông tin này -- nguồn đã thay đổi." Hợp đồng đã được sửa đổi vào tuần trước. Mọi dữ liệu suy ra từ nó đều đáng nghi. Bạn không thể tìm thấy chúng vì bạn không biết chúng đến từ tài liệu nào. "Quyết định giữa hai thông tin mâu thuẫn này." Một nguồn nói Alex làm việc tại Google, nguồn khác nói Stripe. Cả hai đều không có điểm số tin cậy hay dấu thời gian của nguồn. Độ mới của bản ghi không liên quan gì đến độ mới của bằng chứng. "Quy trách nhiệm cho hallucination này." Mô hình nói cuộc họp diễn ra vào thứ Năm. Nhưng không có cuộc họp nào vào thứ Năm. Bạn không thể biết liệu LLM đã bịa ra ngày hay do dữ liệu xấu trong bộ nhớ đã dẫn nó đi sai.

Bốn thất bại này có chung một nguyên nhân. Mỗi cái đều thiếu một cột. Một định danh nguồn, một dấu thời gian chụp, một điểm số tin cậy, một nhật ký trích dẫn phản hồi. Mỗi cái chỉ tốn vài byte tại thời điểm ghi. Cái giá của việc không có chúng là vô hạn: mọi tuyên bố đều không thể kiểm toán, mọi mâu thuẫn đều không thể giải quyết, mọi hallucination đều không thể truy vết.

Xuyên suốt 19 hệ thống, mô hình này là nhất quán. Các triển khai mạnh nhất coi provenance giống như cách tòa án coi bằng chứng -- mọi tuyên bố phải đi kèm với một chuỗi lưu giữ không gián đoạn, nếu không thì nó sẽ không được chấp nhận. Các triển khai yếu nhất không mang theo gì, và phải trả giá mỗi khi có sự cố trong production. Bài viết này sẽ đi qua sáu cấp độ provenance mà kho dữ liệu đã phát hiện, ba mức độ trưởng thành triển khai để phân biệt chúng, và chi phí thực tế để xây dựng điều này đúng từ đầu.

Sáu cấp độ, một kỷ luật

Đọc liên tiếp 19 hệ thống, sáu cấp độ provenance riêng biệt hiện ra. Chúng không phải là một hệ thống phân cấp; chúng trực giao với nhau. Một hệ thống có thể có provenance nguồn mà không có provenance nhân quả. Nó có thể có phiên bản mà không có điểm số tin cậy. Các triển khai mạnh nhất bao phủ cả sáu. Không có triển khai yếu nào bao phủ bất kỳ cái nào.

Định danh trả lời "chính xác là sự kiện nào?" OpenContext tạo UUID cho mọi phần ngữ cảnh tại thời điểm nhập vào và phơi bày chúng như một cơ chế trích dẫn mà agent có thể sử dụng trực tiếp trong các phản hồi. Định danh tồn tại qua các lần đổi tên, di chuyển và tổ chức lại vì nó được gắn với nội dung, không phải đường dẫn. mem9 mang một ID bộ nhớ ổn định trên mọi hàng cùng với một bộ đếm phiên bản rõ ràng với cơ chế đồng thời If-Match. Nếu không có provenance định danh, bạn thậm chí không thể đặt tên cho thứ bạn đang nói đến khi có sự cố.

Nguồn trả lời "nó đến từ đâu?" Hindsight ghi lại loại nguồn và định danh trên mọi quan sát, để hệ thống có thể trả lời cuộc hội thoại hoặc tài liệu nào đã tạo ra một sự kiện nhất định. mem9 mang nguồn, ID agent và ID phiên trên mọi hàng. Supermemory lưu trữ ID tài liệu cùng với các ký ức. Nếu không có provenance nguồn, bạn không thể cập nhật theo tầng khi một nguồn thay đổi, vì bạn không biết sự kiện nào phụ thuộc vào nó.

Nhân quả trả lời "bước nào của agent đã sử dụng cái này?" Hindsight ghi lại mọi sự kiện đã được truy xuất và sử dụng trong một tầng quan sát với đầy đủ ngữ cảnh truy xuất -- bộ truy xuất nào đã đưa nó lên, thứ hạng nó đạt được và liệu agent có thực sự tiêu thụ nó không. Moraine coi mọi bước trace như một bản ghi provenance riêng, làm cho toàn bộ quá trình thực thi của agent có thể phục hồi như một chuỗi các sự kiện có thể địa chỉ theo nguồn. Nếu không có provenance nhân quả, bạn không thể phân biệt "hệ thống đã truy xuất sự kiện này" khỏi "agent đã sử dụng sự kiện này để tạo ra phản hồi đó."

Độ tin cậy khi chụp trả lời "chúng ta chắc chắn đến mức nào khi ghi lại nó?" Graphify đánh dấu mọi cạnh trong đồ thị tri thức của nó với độ tin cậy khi chụp ba cấp độ: CONFIRMED cho các trích xuất xác định, LIKELY cho các suy luận LLM độ tin cậy cao và AMBIGUOUS cho các tuyên bố không chắc chắn. Các cạnh AMBIGUOUS nổi lên như "khoảng trống tri thức" để con người xem xét thay vì bị coi là sự thật một cách âm thầm. Hindsight mang một điểm số tin cậy trên mọi quan sát mà giảm dần theo thời gian thông qua vòng đời độ tươi của nó -- các quan sát mới được tin cậy, các quan sát cũ bị giảm trọng số hoặc loại bỏ. mem9 chạy phát hiện gần trùng lặp ở chế độ ẩn trước, ghi lại điểm số mà không hành động cho đến khi kỹ sư đã hiệu chỉnh ngưỡng từ dữ liệu thực. Nếu không có độ tin cậy khi chụp, các sự kiện không chắc chắn và chắc chắn được truy xuất với trọng số bằng nhau, và agent không thể phân biệt giữa một tuyên bố vững chắc và một phỏng đoán có cơ sở.

Phiên bản trả lời "chúng ta đã tin gì trước đây?" Supermemory coi bộ nhớ như một DAG có phiên bản với các cạnh được định kiểu -- cập nhật, mở rộng, suy ra -- cung cấp lịch sử commit cho mọi niềm tin. mem9 phân chia đường ghi: đột biến tại chỗ cho các chỉnh sửa của con người, nối thêm và lưu trữ cho các viết lại do LLM điều khiển khi nội dung mới thay thế về mặt ngữ nghĩa nội dung cũ. Tolaria để Git mang toàn bộ lịch sử phiên bản, coi các khác biệt một dòng như một tạo tác hướng đến người dùng hạng nhất. Nếu không có provenance phiên bản, bạn không thể quay lại trạng thái hệ thống đã tin vào thứ Ba, vì các niềm tin cũ bị xóa thay vì lưu trữ.

Tương hỗ trả lời "có những sự kiện nào khác chia sẻ cùng nguồn gốc này?" llm-wiki cân đo sự chồng lấp nguồn cao hơn liên kết trực tiếp trong đồ thị liên quan bốn tín hiệu của nó -- hai trang đến từ cùng một tài liệu thô được cho là có liên quan mạnh hơn hai trang có liên kết wiki trực tiếp, vì LLM không đáng tin cậy trong việc liên kết chéo nhưng phần frontmatter của nguồn được duy trì một cách cơ học. EdgeQuake tích lũy ID nguồn trên các thực thể và quan hệ trên toàn bộ kho dữ liệu, để các đề cập lặp lại của cùng một thực thể từ các nguồn khác nhau củng cố trọng số provenance của nó. second-brain mang nguồn như một phần của khóa tổng hợp chỉ mục từ vựng, cho phép một tài liệu duy nhất được lập chỉ mục từ nhiều pipeline độc lập. Nếu không có provenance tương hỗ, bạn không thể trả lời "cho tôi xem mọi thứ trong hệ thống này đến từ cùng một cuộc hội thoại" hoặc "chúng ta đã học được gì khác từ tài liệu đó?"

Sáu cấp độ này trực giao nhưng chúng củng cố lẫn nhau. Provenance nguồn vô dụng nếu không có định danh (bạn cần đặt tên cho sự kiện trước khi có thể truy vết nó). Phiên bản yếu hơn nếu không có độ tin cậy (bạn biết dòng dõi của các chỉnh sửa nhưng không biết hệ thống chắc chắn đến mức nào về bất kỳ cái nào trong số chúng). Các truy vấn tương hỗ phụ thuộc vào nguồn có mặt trước đó. Các hệ thống mang cả sáu cấp độ là những hệ thống có bộ nhớ không bị mục nát một cách âm thầm.

Ba mức độ trưởng thành triển khai

Kho dữ liệu phân chia thành ba mức độ dựa trên nơi provenance sống và nó có thể làm gì tại thời điểm đọc.

Mức 1 là RAG không provenance, điểm khởi đầu cho hầu hết các nhóm. Các kho vector phẳng với nội dung và embedding. Không có cột nguồn, không có điểm số tin cậy, không có lịch sử phiên bản. Khi một sự kiện được truy xuất, bạn nhận được văn bản và điểm số tương đồng. Bạn không thể truy vết nó đến từ đâu, hệ thống chắc chắn đến mức nào về nó, hoặc liệu nó đã bị thay thế chưa. Mọi hệ thống bắt đầu ở đây đều đã di chuyển lên Mức 2 theo thời gian.

Mức 2 mang provenance trên hàng. ID nguồn, độ tin cậy, phiên bản -- tất cả đều có mặt như các cột bên cạnh sự kiện. mem9 nằm ở đây với nguồn, ID agent, ID phiên và phiên bản trên mọi hàng. DAG có phiên bản của Supermemory là cấu trúc Mức 2. Độ tin cậy cạnh ba cấp độ của Graphify là kỷ luật Mức 2. Provenance có sẵn cho các truy vấn, nhưng nó không tự động trang trí kết quả truy xuất. Bạn phải viết truy vấn sử dụng nó.

Mức 3 trang trí kết quả thời gian đọc với ngữ cảnh provenance mà người gọi không cần phải yêu cầu. Hindsight là tài liệu tham khảo ở đây -- mọi sự kiện được truy xuất đều đến kèm với loại nguồn, điểm số tin cậy, trạng thái độ tươi và thứ hạng theo từng bộ truy xuất đã được gắn kèm. Agent tiêu thụ kết quả thấy provenance như một phần của sự kiện, không phải là một tra cứu riêng biệt. Trang trí nguồn-lượt của mem9 nằm giữa Mức 2 và Mức 3, ghép ngữ cảnh thời gian đọc vào một lược đồ Mức 2.

Việc di chuyển là một chiều. Không có hệ thống nào bắt đầu ở Mức 3 và quyết định loại bỏ kỷ luật provenance. Các cột chứng minh giá trị của chúng ngay khi chúng có mặt. Nếu bạn đang thiết kế một hệ thống bộ nhớ hôm nay, câu hỏi không phải là "tôi có cần provenance không?" mà là "tôi muốn bắt đầu ở mức độ nào, biết rằng mọi mức độ trên mức tôi chọn sẽ khó đạt được sau này hơn là xây dựng ngay bây giờ?"

Trường hợp cảnh báo: được tính toán và loại bỏ

Understand-Anything minh họa điều gì xảy ra khi nền tảng cho độ tin cậy tồn tại nhưng cột để ghi lại nó thì không. Hệ thống phân biệt các cạnh xác định (được giải quyết bởi một trình quét dự án từ các tệp nguồn) khỏi các cạnh suy luận (được LLM đoán trong quá trình phân tích ngữ nghĩa). Thông tin đó là thực và có ý nghĩa -- một cạnh nhập khẩu cấu trúc xứng đáng có độ tin cậy cao hơn một suy luận phi mã. Nhưng cả hai đều được lưu trữ với trọng số 0.7, giống hệt nhau trong đồ thị. Tín hiệu độ tin cậy được tính toán tại thời điểm ghi và bị loại bỏ trước khi lưu trữ.

Thêm một trường độ tin cậy sẽ là một thay đổi nhỏ với lợi ích chất lượng thông tin lớn. Hệ thống đã biết cạnh nào là vững chắc và cạnh nào là phỏng đoán. Nó chỉ không ghi lại sự khác biệt ở nơi quan trọng -- trên hàng được truy xuất sau đó, khi agent cần phân biệt giữa chúng. Mô hình này xuất hiện trên nhiều hệ thống trong kho dữ liệu: thông tin có sẵn tại thời điểm ghi, rẻ để thu thập, và sau đó bị mất vì không ai thêm cột.

Chi phí thực tế để xây dựng đúng

Provenance tốn byte. Một ID nguồn, một điểm số tin cậy, một bộ đếm phiên bản -- mỗi cái thêm một vài trường trên mỗi hàng. Ở quy mô lớn, điều đó quan trọng, nhưng nó quan trọng ít hơn nhiều so với cái giá của việc không có chúng khi có sự cố trong production và bạn không thể truy vết tại sao hệ thống tạo ra câu trả lời sai.

Chi phí tính toán thấp hơn dự kiến. Điểm số tin cậy thường yêu cầu một lần gọi LLM bổ sung tại thời điểm ghi (hoặc một heuristic xác định cho các sự kiện cấu trúc), được phân bổ trên mọi lần đọc sau đó. Theo dõi nguồn không tốn gì ngoài việc ghi lại một định danh đã tồn tại. Phiên bản tốn một cột bổ sung hoặc một lần nối thêm trên mỗi lần ghi, không phải một snapshot đầy đủ. Tầng quan sát của Hindsight thêm dung lượng lưu trữ tỷ lệ thuận với số lượng sự kiện được truy xuất và sử dụng, nhưng chỉ ghi lại những gì agent thực sự tiêu thụ, không phải mọi thứ nó thấy.

Chi phí vận hành mới là câu hỏi thực sự. Trang trí Mức 3 có nghĩa là nhiều dữ liệu chảy hơn trên mọi lần truy xuất, làm tăng nhẹ việc sử dụng cửa sổ ngữ cảnh và độ trễ phản hồi. Các hệ thống triển khai điều này xử lý bằng cách giữ các trang trí ngắn gọn -- một enum loại nguồn, một float độ tin cậy, một trạng thái độ tươi -- thay vì các cây provenance đầy đủ nội tuyến. Agent nhận đủ để phân biệt mà không bị ngập trong siêu dữ liệu.

Điểm chung của các triển khai mạnh nhất

Các hệ thống mẫu mực trong kho dữ liệu xứng đáng được nhắc lại vì không có hai hệ thống nào giải quyết cùng một phần của vấn đề:

OpenContext tạo UUID tồn tại qua mọi sự tổ chức lại hệ thống tệp và phơi bày chúng như một cơ chế trích dẫn mà agent có thể sử dụng trực tiếp. mem9 mang nguồn, ID agent, ID phiên trên mọi hàng, phiên bản trên mọi cập nhật và trang trí kết quả tìm kiếm với ngữ cảnh nguồn-lượt được điều chỉnh bởi một ngân sách rõ ràng. Supermemory coi bộ nhớ như một DAG có phiên bản với các cạnh được định kiểu, cung cấp lịch sử commit cho mọi niềm tin. Hindsight ghi lại mọi sự kiện được truy xuất và sử dụng trong một tầng quan sát với đầy đủ provenance nguồn, lịch sử tiến hóa và thứ hạng theo từng bộ truy xuất. Graphify đánh dấu mọi cạnh với độ tin cậy khi chụp ba cấp độ, đưa các cạnh không chắc chắn lên để con người xem xét thay vì coi chúng là sự thật.

Quan sát thống nhất là rõ ràng: provenance không phải là siêu dữ liệu, nó là một phần của sự kiện. Các hệ thống coi nó như vậy là những hệ thống có bộ nhớ không bị mục nát một cách âm thầm, những mâu thuẫn có thể được phân xử, những hallucination có thể được truy vết, và lịch sử niềm tin có thể được tua lại bất kỳ điểm nào trong quá khứ mà không cần phải đoán trước nhu cầu.

Các hệ thống không làm điều đó là những hệ thống mà người dùng cuối cùng sẽ học được rằng bộ nhớ họ đang tin tưởng hóa ra chỉ là một hòn đảo.

Provenance là bảo hiểm rẻ nhất bạn có thể mua tại thời điểm ghi. Kỷ luật là mua nó trước khi bạn phát hiện ra mình cần nó.

Thấy bài viết này hữu ích, hãy chia sẻ để người khác cũng có thể đọc :)

Bài viết tiếp theo sẽ đi qua hybrid retrieval và RRF, mô hình cho phép bạn kết hợp tín hiệu vector và từ khóa mà không để cái này lấn át cái kia -- điều quan trọng nhất khi provenance cho bạn biết một sự kiện là vững chắc nhưng chỉ riêng sự liên quan sẽ chôn vùi nó. Bài viết đó sắp ra mắt.

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral