REALM là gì? Cách AI Agent tái tổ chức bộ nhớ dài hạn sau mỗi lần truy xuất
REALM là framework bộ nhớ dài hạn cho AI Agent, dùng cognitive graph, adaptive retrieval và memory reconsolidation để tự tái tổ chức ký ức dựa trên chính lịch sử truy xuất.

REALM trong bài viết này là viết tắt của reconsolidation-evolution agentic long-term memory: một framework bộ nhớ dài hạn cho LLM Agent được thiết kế để memory không chỉ “ghi rồi đọc”, mà còn tự tái tổ chức sau mỗi lần truy xuất.
Theo paper Retrieval-Driven Memory Reconsolidation for Long-Term LLM Agents công bố ngày 13/09/2026, REALM tổ chức memory thành heterogeneous cognitive graph, truy xuất bằng các graph-search atom được ghép thích nghi và dùng feedback từ retrieval để reconsolidate memory cho những lần truy xuất sau.
Điểm mới của REALM nằm ở vòng lặp sau retrieval. Với nhiều memory system, lấy được context phù hợp là điểm kết thúc. REALM coi chính việc “đã truy xuất cái gì, cái gì hữu ích, các memory nào thường xuất hiện cùng nhau” là tín hiệu để thay đổi cấu trúc bộ nhớ.
REALM là gì?
REALM là framework nghiên cứu cho long-term memory của LLM Agent. Nó mô hình hóa memory như một lifecycle liên tục gồm ba hoạt động chính: tổ chức memory, truy xuất evidence và tái củng cố memory sau truy xuất.
Framework này nhắm tới một hạn chế phổ biến của agent memory: memory thường chỉ thay đổi khi có thông tin mới được ghi vào. Khi agent đọc lại memory cũ, cấu trúc lưu trữ gần như giữ nguyên, dù lịch sử truy xuất có thể cho thấy cách tổ chức hiện tại chưa tối ưu.
Tên REALM từng được Google dùng cho một hướng nghiên cứu khác về Retrieval-Augmented Language Model pre-training. Bài này chỉ nói về REALM 2026 dành cho agentic long-term memory, không phải model retrieval pre-training trước đó.
Vấn đề của bộ nhớ AI Agent kiểu “ghi rồi tìm lại”
Một memory pipeline đơn giản thường có ba bước: chuyển hội thoại hoặc sự kiện thành memory, lưu vào vector database, sau đó dùng similarity search để lấy top-k memory gần query. Cách này hữu ích, nhưng cấu trúc memory và retrieval policy thường được cố định từ trước.
Khi lịch sử tương tác kéo dài, một fact có thể liên quan tới nhiều project, thời điểm hoặc người khác nhau. Nếu các memory được lưu như những mảnh độc lập, retrieval dễ lấy về các mẩu gần nghĩa nhưng thiếu mối quan hệ cần thiết để reasoning.
REALM đặt câu hỏi khác: nếu một số memory liên tục được truy xuất cùng nhau để trả lời đúng, hệ thống có nên học từ pattern đó và tái tổ chức memory để lần sau lấy được cả cụm evidence hiệu quả hơn không?
REALM hoạt động qua ba lớp chính
1. Autonomous organization thành heterogeneous cognitive graph
Thay vì coi memory là danh sách document phẳng, REALM tổ chức chúng thành một heterogeneous cognitive graph. “Heterogeneous” ở đây có nghĩa graph có thể biểu diễn nhiều loại memory unit và quan hệ khác nhau thay vì chỉ một vector cho mỗi đoạn text.
Mục tiêu của graph là giữ lại cấu trúc liên hệ giữa evidence để agent có thể tìm theo đường quan hệ, không chỉ theo độ gần embedding. Đây là nền tảng để các memory liên quan có thể dần hội tụ thành local structure mạch lạc hơn qua thời gian.
2. Adaptive retrieval bằng graph-search atoms
REALM không cố định một chiến lược graph search duy nhất. Paper mô tả các primitive tìm kiếm dưới dạng graph-search atoms; agent có thể ghép chúng theo cách thích nghi để tìm evidence phù hợp với query hiện tại.
Có thể hiểu graph-search atom như những thao tác tìm kiếm nhỏ có thể kết hợp lại. Với query đơn giản, retrieval có thể chỉ cần đi từ một node gần nhất. Với câu hỏi cần nhiều evidence, pipeline có thể mở rộng sang các node liên quan và gom nhiều mảnh memory trước khi reasoning.
3. Post-retrieval reconsolidation
Đây là phần tạo nên tên gọi REALM. Sau khi retrieval kết thúc, framework sử dụng feedback của quá trình truy xuất để reconsolidate memory — tức cập nhật cách các memory được tổ chức cho những lần truy xuất sau.
Ý tưởng lấy cảm hứng từ memory reconsolidation trong cognitive neuroscience: một ký ức khi được gọi lại có thể bước vào trạng thái cho phép được củng cố hoặc cập nhật. REALM chuyển ý tưởng đó thành cơ chế tính toán cho agent memory.
Retrieval-driven reconsolidation khác gì việc ghi thêm memory mới?
Ghi memory mới chỉ mở rộng kho dữ liệu. Reconsolidation thay đổi cách evidence cũ được tổ chức và liên kết dựa trên kinh nghiệm sử dụng thực tế. Hai thao tác này giải quyết hai vấn đề khác nhau.
- Memory write: thêm fact, event hoặc summary mới vào hệ thống.
- Retrieval: tìm evidence có khả năng liên quan tới query hiện tại.
- Reconsolidation: dùng tín hiệu từ retrieval để điều chỉnh cấu trúc memory cho tương lai.
Điểm này khiến REALM khác với một vector store chỉ append document. Một memory có giá trị không phải chỉ vì nội dung của nó giống query, mà còn vì nó thường xuyên kết hợp với các memory khác để hoàn thành reasoning.
Một ví dụ dễ hình dung về REALM
Giả sử một coding agent làm việc nhiều tuần trên cùng project. Agent có memory về quyết định chọn PostgreSQL, một lỗi timeout sau khi bật connection pooling và một thay đổi cấu hình trên production. Ba memory xuất hiện ở ba thời điểm khác nhau.
Nếu một query mới về database latency luôn cần cả ba evidence, retrieval history đang cung cấp tín hiệu rằng chúng thuộc cùng một local structure. Một framework kiểu REALM có thể dùng feedback đó để làm quan hệ giữa chúng rõ hơn, thay vì mỗi lần đều bắt đầu từ ba vector rời rạc.
Ví dụ này là cách diễn giải cơ chế, không phải một case study được paper công bố. Giá trị của nó là cho thấy vì sao retrieval feedback có thể trở thành dữ liệu huấn luyện cho chính memory organization.
REALM đạt kết quả gì trên benchmark bộ nhớ dài hạn?
Nhóm tác giả báo cáo REALM đạt 75,97% average accuracy trên LoCoMo và 65,11% trên LongMemEval. So với baseline mạnh nhất trong thiết lập của paper, mức tăng được báo cáo lần lượt là 7,17 và 1,31 điểm.
Ablation study của paper cho thấy memory reconsolidation đóng góp nhất quán vào kết quả. Phân tích cấu trúc cũng cho thấy các memory liên quan dần được tổ chức thành local structure chặt hơn, hỗ trợ collective evidence recall khi reasoning.
Đây vẫn là kết quả do nhóm nghiên cứu báo cáo trên benchmark. LoCoMo và LongMemEval đo những khía cạnh quan trọng của long-term memory, nhưng không đại diện cho mọi workload production, đặc biệt là privacy, permission, multi-user isolation hay memory poisoning.
REALM khác RAG và vector memory ở đâu?
RAG truyền thống tập trung vào việc lấy document liên quan để bổ sung context cho model. Vector memory của agent thường áp dụng ý tưởng tương tự lên lịch sử hội thoại hoặc event: encode, store, similarity search, retrieve.
REALM không phủ nhận retrieval. Nó thêm một vòng memory evolution phía sau retrieval. Vì vậy, khác biệt cốt lõi không phải “graph thay vector”, mà là memory system được phép học từ chính lịch sử sử dụng của nó.
Khái niệm này cũng khác với Persistent AI Agent. Persistent agent nói về khả năng tiếp tục công việc qua thời gian; REALM tập trung cụ thể vào cách bộ nhớ dài hạn được tổ chức, truy xuất và tái cấu trúc.
REALM có ý nghĩa gì cho thiết kế AI Agent?
REALM gợi ý rằng memory architecture của agent không nên chỉ được thiết kế như một database phụ trợ. Khi agent hoạt động lâu dài, memory management có thể trở thành một quá trình học liên tục: hệ thống theo dõi evidence nào thường hữu ích, quan hệ nào cần củng cố và cách retrieval nên thay đổi theo workload.
Điều này đặc biệt phù hợp với coding agent, research agent, personal assistant hoặc enterprise agent phải quay lại cùng project nhiều lần. Những hệ thống đó dễ gặp vấn đề “có lưu nhưng không tìm đúng”, hoặc lấy đúng từng fact nhưng thiếu chuỗi quan hệ cần thiết.
Những giới hạn REALM chưa tự giải quyết
Reconsolidation giúp memory tiến hóa, nhưng cũng tạo thêm trách nhiệm quản trị. Nếu retrieval feedback sai hoặc memory ban đầu chứa thông tin lỗi, việc tái tổ chức có thể làm cấu trúc sai trở nên bền hơn. Vì vậy production system vẫn cần kiểm soát provenance, quyền ghi, conflict resolution và cơ chế xóa memory.
Graph memory cũng có chi phí vận hành lớn hơn vector search đơn giản: phải duy trì node, relation và quá trình cập nhật sau retrieval. Lợi ích benchmark cần được cân với latency, token cost và độ phức tạp của workload thực tế.
Ngoài ra, benchmark accuracy không thay thế evaluation theo nhiệm vụ. Bot.io.vn có bài về Agent Evaluation Metric, trong đó nhấn mạnh việc tìm đúng lượt hoặc hành động làm agent thất bại thay vì chỉ nhìn một điểm tổng.
Điểm cốt lõi của REALM
REALM đưa ra một thay đổi tư duy rõ ràng: retrieval không phải điểm cuối của memory access, mà là nguồn feedback để bộ nhớ tiếp tục tiến hóa. Cognitive graph, adaptive graph search và reconsolidation được ghép thành một lifecycle thay vì ba module tách rời.
Nếu kết quả tiếp tục được tái lập trên workload dài hạn thực tế, hướng retrieval-driven reconsolidation có thể trở thành một lớp quan trọng của agent memory thế hệ mới. Nhưng ở thời điểm hiện tại, REALM nên được xem là một framework nghiên cứu có cơ chế và benchmark rõ, chưa phải bằng chứng rằng mọi AI Agent đều cần thay vector memory bằng cognitive graph.



