Назад до новин
ІнноваціяAI Understanding брифінг

Lemmalog перетворює пам'ять агента LLM на механізм Datalog

Проект Rust із відкритим вихідним кодом замінює пам’ять агента у стилі векторного сховища фактами, правилами та поступовими міркуваннями з відстеженням походження. Його README повідомляє про сильні результати тестування та ефективності маркерів, а також документує обмеження вилучення та вимірювання.

5 min readRead the primary source
Source-page capture accompanying Lemmalog turns LLM agent memory into a Datalog engine
Першоджерельний документДжерело записано
Видавець
github.com
Посилання на джерело
github.comhttps://github.com/JordyZomer/lemmalog
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

Велика мовна модель (LLM)
Мовна модель, навчена на масивних текстових корпусах для створення та аналізу тексту.
Пам'ять (Пам'ять агента)
Збережений контекст агент штучного інтелекту використовує на етапах або сеансах для покращення безперервності.
MCP (протокол моделі контексту)
Відкритий протокол, який дозволяє додаткам штучного інтелекту підключатися до зовнішніх інструментів, джерел даних і постачальників контексту стандартним способом.
Перевір себеВікторина агентів ШІ

Що сталося

Репозиторій GitHub Lemmalog представляє механізм Datalog з відкритим вихідним кодом, призначений для роботи в якості структурованої пам’яті для агентів LLM. Він зберігає витягнуті факти, робить висновки за допомогою правил, відстежує походження, підтримує поступове оновлення та відкриває систему через сервер MCP.

Lemmalog представлений у вигляді ящика Rust, REPL командного рядка, навичок агента та сервера MCP для пам’яті агента LLM. Основна вимога його дизайну полягає в тому, що пам’ять агента повинна вести себе як дедуктивна база даних, а не набір семантично подібних уривків. Система приймає базові факти на межі вилучення, а потім застосовує стратифіковані правила Datalog для отримання часових представлень, кандидатів на протиріччя, зв’язків релевантності та інших висновків. README описує кожен факт як повернення до вихідних епізодів, дозволяючи агенту перевірити, чому було зроблено висновок.

Репозиторій каже, що його реалізований механізм включає стратифікований журнал даних, аналізований під час виконання, обробку заперечень, оцінку напівфіксованих точок, поступове обслуговування дельти, двочасові факти та анотації достовірності плюс походження. Він також перераховує дерева доказів через запит why(), запити ask() лише для читання, запити ask_deep(), орієнтовані на попит, з використанням магічних наборів, постійності, пакетів правил, переглядів розв’язання об’єктів, агрегації та гіпотетичних запитів «що-якщо». Джерело каже, що відкликання та замінені факти призводять до повторного обчислення постраждалих утриманців, а не до відновлення непов’язаних похідних відносин.

Проект ставить LLM строго на межі видобутку. Відповідно до README, модель хосту перетворює матеріал розмови у формат фактів на основі рядків, такий як суб’єкт, відношення та об’єкт із необов’язковим значенням надійності. Потім Lemmalog застосовує детерміновану політику оновлення: додавання невидимих ​​фактів, обробка дублікатів як безопераційних, заміна значень для ексклюзивних відносин або посилення неоднозначних невиключних змін. Система також записує випущені або деформовані лінії екстракції замість того, щоб мовчки розглядати їх як успішне ковтання.

Джерело повідомляє кілька оцінок. Під час запуску LongMemEval із 30 запитань із використанням Claude Opus 4.8 репозиторій повідомляє про загальний F1 пам’яті 0,48 проти 0,51 для режиму необробленої транскрипції, водночас заявляючи про кращу продуктивність при оновленні знань і значно менших контекстах. У порівнянні зі 102 запитаннями MemEval він повідомляє про F1 0,463 плюс-мінус 0,010 за три прогони та двійкову точність 0,575 у порівнянні з повідомленими 0,197 для його власного повноконтекстного прогону. На LoCoMo він повідомляє F1 0,533 плюс-мінус 0,001 за три прогони. Це результати, надані в сховищах, а не незалежно встановлені результати.

Деталі джерела: github.com ↗

Чому це важливо

Проект усуває практичну слабкість довготривалих агентів штучного інтелекту: збереження інформації при збереженні доказів, обробка оновлень і обмеження обсягу контексту, який надсилається моделі. Результати його власного порівняльного тесту свідчать про можливий компроміс між якістю відповіді, розміром контексту та вартістю вилучення.

Довгопрацюючим агентам часто потрібно відповідати на запитання про інформацію, яка змінюється з часом. Дизайн Lemmalog безпосередньо спрямований на цю проблему, відокремлюючи стверджувані факти від похідних поглядів. Така зміна, як новий роботодавець або керівник, може замінити попереднє значення, тоді як правила можуть повторно обчислити лише висновки, які залежать від зміненого відношення. Якщо реалізація поводиться, як описано, це може зробити пам’ять агента більш доступною для аудиту та меншою залежністю від повторних запитів мовної моделі реконструювати історію з необроблених стенограм.

Походження – ще одна практична відмінність. README говорить, що дерево доказів why() може зв’язати отриманий факт із правилами та вихідними епізодами, які його підтримують. Це не вказує на правильність базового вилучення, але може полегшити пошук помилок: неправильний висновок може бути пов’язаний із поганим фактом, неоднозначним псевдонімом, неправильним правилом або неповним епізодом. Для систем, які використовуються в дослідженнях, операціях або розслідуваннях, таке розділення може допомогти користувачам переглядати докази замість того, щоб приймати непрозорий пошук пам’яті.

Повідомлена економія контексту потенційно важлива для вартості та надійності. Репозиторій каже, що його пошуковий шлях збирає цілеспрямований контекст із ранжованих фактів і вихідних епізодів, а не викидає всю розмову. Він повідомляє про приблизно 2300 токенів фази відповіді на запитання LongMemEval проти приблизно 104 000 для повного контексту та приблизно 3200 проти 18 900 на LoCoMo. Далі джерело моделює постійну вартість контексту на запитання для розмови, що зростає, водночас попереджаючи, що багатше вилучення збільшує розмір пам’яті, а саме вилучення несе одноразову вартість моделі.

Претензії також обмежені власними доказами проекту. У README сказано, що питання про переваги залишаються слабкими, міркування в часі залежало від вилучення обох відповідних датованих подій, а деякі відповіді на кілька сеансів не вдавалися, оскільки факти ніколи не вилучалися. У ньому повідомляється, що результати порівняльного тесту можуть суттєво відрізнятися, якщо температуру моделі, що відповідає, неможливо контролювати. Ці обмеження мають значення, оскільки символічний рівень міркування може гарантувати узгодженість збережених фактів, не гарантуючи, що збережені факти повні, правильно присвоєні або точно витягнуті з природної мови.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Інтерактивна перевірка концепції+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Що дивитися далі

Основні питання полягають у тому, чи відтворюються отримані результати за межами тестових налаштувань сховища, наскільки продуктивність залежить від моделі, що використовується для вилучення та відповідей, і чи достатньо зріла поточна реалізація проекту для робочих навантажень робочої пам’яті. У наданому джерелі немає чіткої позначки часу публікації чи незалежної оцінки.

Відтворюваність – це перше питання, яке потрібно контролювати. Репозиторій описує тестові пакети, кешовані результати вилучення та порівняльні конфігурації, але надане джерело не надає незалежної реплікації, офіційного документа чи чітко видимої дати випуску. Майбутня перевірка має перевірити, чи зареєстровані результати F1, токени та затримки відповідають моделям, наборам даних, апаратному забезпеченню та повторним запускам із контрольованою вибіркою.

Імовірно, межа вилучення залишиться головною точкою збою системи. Детермінований механізм Lemmalog може застосовувати правила до фактів, які він отримує, але README явно приписує кілька помилок пропущеним фактам, нерозпізнаним обсягам або неповному виділенню подій. Практичні розгортання повинні вимірювати запам’ятовування вилучення, точність атрибуції та калібрування достовірності окремо від правильності механізму Datalog.

Поведінка масштабу та робочого навантаження також вимагає уваги. Джерело повідомляє, що закриття ланцюга з 500 вузлів займає приблизно 17 секунд на ноутбуці серії M, поступовий поворот займає приблизно 50 мілісекунд, а щільне транзитивне закриття досягає 3,9 мільйона фактів. Він представляє запити попиту як спосіб уникнути сліпої матеріалізації щільних замикань, але не встановлює, як використання пам’яті, постійність, одночасний доступ або складність правил поводяться у великих виробничих системах.

Нарешті, користувачі повинні спостерігати за тим, як керується інтерфейс MCP і модель встановлення правил. У репозиторії сказано, що агенти можуть встановлювати та видаляти версії пакетів правил і використовувати механізм як спільний мозок через Claude Code або Kimi CLI. Це створює корисну гнучкість, але також піднімає робочі питання, на які немає відповіді в наданому джерелі: хто затверджує правила, як розглядаються суперечливі схеми, як захищаються чутливі епізоди та як користувачі відрізняють витягнуті з моделі твердження від механічно отриманих висновків.

Пов’язані посібники та вікторини

Агенти ШІChatGPT і LLMНавчання ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосаріїСлідкуйте за відстеженням випуску моделі AI
Знайшли це корисним?