Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

Lemmalog biến bộ nhớ tác nhân LLM thành công cụ Datalog

Dự án Rust mã nguồn mở thay thế bộ nhớ tác nhân kiểu cửa hàng vector bằng các sự kiện, quy tắc và lý luận gia tăng được theo dõi xuất xứ. README của nó báo cáo kết quả điểm chuẩn và hiệu quả mã thông báo mạnh mẽ, đồng thời cũng ghi lại các giới hạn trích xuất và đo lường.

5 min readRead the primary source
Source-page capture accompanying Lemmalog turns LLM agent memory into a Datalog engine
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
github.com
Liên kết nguồn
github.comhttps://github.com/JordyZomer/lemmalog
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Mô hình ngôn ngữ lớn (LLM)
Một mô hình ngôn ngữ được đào tạo trên kho văn bản lớn để tạo và phân tích văn bản.
Bộ nhớ (Bộ nhớ tác nhân)
Bối cảnh được lưu trữ mà tác nhân AI sử dụng qua các bước hoặc phiên để cải thiện tính liên tục.
MCP (Giao thức bối cảnh mô hình)
Một giao thức mở cho phép các ứng dụng AI kết nối với các công cụ, nguồn dữ liệu và nhà cung cấp bối cảnh bên ngoài theo cách tiêu chuẩn.
Tự kiểm traCâu đố về đại lý AI

Chuyện gì đã xảy ra

Kho lưu trữ GitHub Lemmalog trình bày một công cụ Datalog nguồn mở được thiết kế để phục vụ như bộ nhớ có cấu trúc cho các tác nhân LLM. Nó lưu trữ các sự kiện được trích xuất, rút ​​ra kết luận thông qua các quy tắc, theo dõi nguồn gốc, hỗ trợ cập nhật gia tăng và hiển thị hệ thống thông qua máy chủ MCP.

Lemmalog được trình bày dưới dạng thùng Rust, REPL dòng lệnh, kỹ năng tác nhân và máy chủ MCP cho bộ nhớ tác nhân LLM. Tuyên bố thiết kế trung tâm của nó là bộ nhớ của tác nhân phải hoạt động giống như một cơ sở dữ liệu suy diễn chứ không phải là một tập hợp các đoạn văn tương tự về mặt ngữ nghĩa. Hệ thống chấp nhận các sự kiện cơ sở tại một ranh giới trích xuất, sau đó áp dụng các quy tắc Datalog phân tầng để rút ra các quan điểm tạm thời, các ứng cử viên mâu thuẫn, các mối quan hệ phù hợp và các kết luận khác. README mô tả mọi sự kiện đều mang nguồn gốc xuất xứ trở lại các tập nguồn, cho phép một đặc vụ kiểm tra lý do tại sao đưa ra kết luận.

Kho lưu trữ cho biết công cụ được triển khai của nó bao gồm Datalog phân tầng được phân tích theo thời gian chạy, xử lý phủ định, đánh giá điểm cố định cơ bản, bảo trì delta gia tăng, dữ kiện hai thời gian và chú thích độ tin cậy cộng với nguồn gốc. Nó cũng liệt kê các cây bằng chứng thông qua truy vấn tại sao (), truy vấn hỏi () chỉ đọc, truy vấn hỏi_deep () tập trung vào nhu cầu bằng cách sử dụng bộ ma thuật, tính bền vững, lô quy tắc, chế độ xem phân giải thực thể, tổng hợp và truy vấn giả thuyết giả định. Nguồn tin cho biết việc rút lại và các dữ kiện bị thay thế sẽ kích hoạt việc tính toán lại trong phạm vi những người phụ thuộc bị ảnh hưởng thay vì xây dựng lại các mối quan hệ dẫn xuất không liên quan.

Dự án đặt LLM ngay tại ranh giới khai thác. Theo README, mô hình máy chủ chuyển đổi tài liệu hội thoại thành định dạng dữ kiện dựa trên dòng, chẳng hạn như chủ đề, mối quan hệ và đối tượng với giá trị độ tin cậy tùy chọn. Lemmalog sau đó áp dụng các chính sách cập nhật xác định: thêm các sự kiện không nhìn thấy, coi các bản sao là không hoạt động, thay thế các giá trị cho các mối quan hệ độc quyền hoặc leo thang các thay đổi mơ hồ không độc quyền. Hệ thống cũng ghi lại các dòng trích xuất bị mất hoặc không đúng định dạng thay vì âm thầm coi chúng là quá trình nhập thành công.

Nguồn báo cáo một số đánh giá. Trong lần chạy LongMemEval gồm 30 câu hỏi sử dụng Claude Opus 4.8, kho lưu trữ báo cáo bộ nhớ tổng thể F1 là 0,48 so với 0,51 đối với chế độ bản ghi thô, đồng thời khẳng định hiệu suất tốt hơn khi cập nhật kiến ​​thức và các ngữ cảnh nhỏ hơn đáng kể. Khi so sánh MemEval 102 câu hỏi, nó báo cáo F1 là 0,463 cộng hoặc trừ 0,010 trong ba lần chạy và độ chính xác nhị phân là 0,575, so với mức 0,197 được báo cáo cho lần chạy toàn ngữ cảnh của chính nó. Trên LoCoMo, nó báo cáo F1 là 0,533 cộng hoặc trừ 0,001 trong ba lần chạy. Đây là những kết quả được báo cáo từ kho lưu trữ, không phải những phát hiện được thiết lập độc lập.

Chi tiết nguồn: github.com ↗

Tại sao nó quan trọng

Dự án giải quyết một điểm yếu thực tế trong các tác nhân AI hoạt động lâu dài: lưu giữ thông tin trong khi bảo quản bằng chứng, xử lý các bản cập nhật và hạn chế lượng ngữ cảnh được gửi đến một mô hình. Các kết quả điểm chuẩn riêng của nó gợi ý sự cân bằng có thể có giữa chất lượng câu trả lời, kích thước ngữ cảnh và chi phí trích xuất.

Các đại lý hoạt động lâu dài thường cần trả lời các câu hỏi về thông tin thay đổi theo thời gian. Thiết kế của Lemmalog nhắm trực tiếp vào vấn đề đó bằng cách tách các sự kiện được khẳng định khỏi các quan điểm dẫn xuất. Một thay đổi chẳng hạn như người sử dụng lao động hoặc người quản lý mới có thể thay thế giá trị trước đó, trong khi các quy tắc chỉ có thể tính toán lại các kết luận phụ thuộc vào mối quan hệ đã thay đổi. Nếu quá trình triển khai diễn ra như mô tả, điều này có thể làm cho bộ nhớ tác nhân dễ kiểm tra hơn và ít phụ thuộc hơn vào việc liên tục yêu cầu mô hình ngôn ngữ tái tạo lại lịch sử từ bản ghi thô.

Xuất xứ là một sự khác biệt thực tế khác. README cho biết cây chứng minh tại sao() có thể kết nối một thực tế dẫn xuất với các quy tắc và các tập nguồn hỗ trợ nó. Điều đó không chứng minh rằng trích xuất cơ bản là chính xác, nhưng nó có thể giúp xác định lỗi dễ dàng hơn: một kết luận sai có thể bắt nguồn từ một sự thật tồi tệ, một bí danh mơ hồ, một quy tắc sai sót hoặc một tình tiết chưa hoàn chỉnh. Đối với các hệ thống được sử dụng trong nghiên cứu, vận hành hoặc điều tra, việc phân tách đó có thể giúp người dùng xem xét bằng chứng thay vì chấp nhận truy xuất bộ nhớ không rõ ràng.

Việc tiết kiệm bối cảnh được báo cáo có khả năng quan trọng đối với chi phí và độ tin cậy. Kho lưu trữ cho biết đường dẫn truy xuất của nó tập hợp một bối cảnh tập trung từ các sự kiện được xếp hạng và các tập nguồn, thay vì loại bỏ toàn bộ cuộc trò chuyện. Nó báo cáo khoảng 2.300 mã thông báo giai đoạn trả lời cho mỗi câu hỏi LongMemEval so với khoảng 104.000 cho bối cảnh đầy đủ và khoảng 3.200 so với 18.900 trên LoCoMo. Nguồn tiếp tục mô hình hóa chi phí ngữ cảnh không đổi cho mỗi câu hỏi cho một cuộc trò chuyện ngày càng tăng, đồng thời cảnh báo rằng việc trích xuất phong phú hơn sẽ làm tăng kích thước bộ nhớ và bản thân việc trích xuất đó cũng mang lại chi phí mô hình một lần.

Các tuyên bố cũng được giới hạn bởi bằng chứng riêng của dự án. README cho biết các câu hỏi ưu tiên vẫn còn yếu, lý luận tạm thời phụ thuộc vào việc trích xuất cả hai sự kiện có liên quan và một số câu trả lời trong nhiều phiên không thành công vì dữ kiện không bao giờ được trích xuất. Nó báo cáo rằng kết quả điểm chuẩn có thể thay đổi đáng kể khi không thể kiểm soát được nhiệt độ của mô hình trả lời. Những hạn chế đó rất quan trọng vì lớp lý luận biểu tượng có thể đảm bảo tính nhất quán đối với các sự kiện được lưu trữ mà không đảm bảo rằng các sự kiện được lưu trữ là đầy đủ, được quy kết chính xác hoặc được trích xuất chính xác từ ngôn ngữ tự nhiên.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Xem gì tiếp theo

Các câu hỏi chính là liệu các kết quả được báo cáo có tái tạo bên ngoài thiết lập thử nghiệm của kho lưu trữ hay không, hiệu suất phụ thuộc bao nhiêu vào mô hình được sử dụng để trích xuất và trả lời cũng như liệu việc triển khai hiện tại của dự án có đủ hoàn thiện cho khối lượng công việc bộ nhớ sản xuất hay không. Nguồn được cung cấp không hiển thị dấu thời gian xuất bản rõ ràng hoặc đánh giá độc lập.

Khả năng tái tạo là vấn đề đầu tiên cần theo dõi. Kho lưu trữ mô tả các khai thác thử nghiệm, kết quả trích xuất được lưu trong bộ nhớ đệm và cấu hình điểm chuẩn, nhưng nguồn được cung cấp không cung cấp bản sao độc lập, tài liệu chính thức hoặc ngày phát hành rõ ràng. Sự giám sát kỹ lưỡng trong tương lai nên kiểm tra xem các kết quả F1, mã thông báo và độ trễ được báo cáo có đúng trên các mô hình, bộ dữ liệu, phần cứng và các lần chạy lặp lại với lấy mẫu có kiểm soát hay không.

Ranh giới khai thác có thể vẫn là điểm lỗi chính của hệ thống. Công cụ xác định của Lemmalog có thể áp dụng các quy tắc cho các dữ kiện mà nó nhận được, nhưng README quy định rõ ràng một số lỗi là do các dữ kiện bị bỏ sót, số lượng không được nhận dạng hoặc trích xuất sự kiện không đầy đủ. Việc triển khai thực tế sẽ cần phải đo lường khả năng thu hồi trích xuất, độ chính xác phân bổ và hiệu chuẩn độ tin cậy một cách riêng biệt với tính chính xác của công cụ Datalog.

Quy mô và hành vi khối lượng công việc cũng cần được chú ý. Nguồn báo cáo quá trình đóng chuỗi 500 nút mất khoảng 17 giây trên máy tính xách tay dòng M, một lượt tăng dần mất khoảng 50 mili giây và quá trình đóng chuyển tiếp dày đặc đạt 3,9 triệu sự kiện. Nó trình bày các truy vấn nhu cầu như một cách để tránh hiện thực hóa các đóng cửa dày đặc một cách mù quáng, nhưng không thiết lập cách sử dụng bộ nhớ, tính bền vững, quyền truy cập đồng thời hoặc độ phức tạp của quy tắc hoạt động trong các hệ thống sản xuất lớn.

Cuối cùng, người dùng nên xem giao diện MCP và mô hình cài đặt quy tắc được quản lý như thế nào. Kho lưu trữ cho biết các tác nhân có thể cài đặt và gỡ cài đặt các lô quy tắc được phiên bản và sử dụng công cụ này làm bộ não chung thông qua Claude Code hoặc Kimi CLI. Điều đó tạo ra sự linh hoạt hữu ích nhưng cũng đặt ra các câu hỏi vận hành chưa được trả lời trong nguồn được cung cấp: ai phê duyệt các quy tắc, cách xem xét các lược đồ xung đột, cách bảo vệ các tập nhạy cảm và cách người dùng phân biệt các xác nhận được trích xuất từ ​​mô hình với các kết luận có nguồn gốc máy móc.

Hướng dẫn và câu hỏi liên quan

Đại lý AIChatGPT & LLMĐào tạo AIKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?