ماذا حدث
يقدم مستودع GitHub Lemmalog محرك Datalog مفتوح المصدر مصمم ليكون بمثابة ذاكرة منظمة لوكلاء LLM. يقوم بتخزين الحقائق المستخرجة، واستخلاص النتائج من خلال القواعد، وتتبع المصدر، ودعم التحديثات المتزايدة، وكشف النظام من خلال خادم MCP.
يتم تقديم Lemmalog على شكل صندوق Rust، وسطر أوامر REPL، ومهارة الوكيل، وخادم MCP لذاكرة وكيل LLM. ادعاء التصميم المركزي لها هو أن ذاكرة العميل يجب أن تتصرف مثل قاعدة بيانات استنتاجية بدلاً من مجموعة من المقاطع المتشابهة لغويًا. يقبل النظام الحقائق الأساسية عند حدود الاستخراج، ثم يطبق قواعد Datalog الطبقية لاستخلاص وجهات النظر الزمنية ومرشحي التناقض وعلاقات الصلة والاستنتاجات الأخرى. يصف README كل حقيقة على أنها تحمل المصدر إلى حلقات المصدر، مما يسمح للوكيل بفحص سبب التوصل إلى الاستنتاج.
يقول المستودع إن محركه المطبق يشتمل على سجل البيانات الطبقي الذي تم تحليله في وقت التشغيل، والتعامل مع النفي، وتقييم نقطة التثبيت شبه الواضحة، وصيانة الدلتا المتزايدة، والحقائق الثنائية الزمنية، والشروح التوضيحية للثقة بالإضافة إلى المصدر. كما يسرد أيضًا أشجار الأدلة من خلال استعلام لماذا() واستعلامات Ask() للقراءة فقط واستعلامات Ask_deep() التي تركز على الطلب باستخدام المجموعات السحرية والثبات ودفعات القواعد وطرق عرض دقة الكيان والتجميع واستعلامات ماذا لو الافتراضية. يقول المصدر إن التراجعات والحقائق التي تم استبدالها تؤدي إلى إعادة حساب واسعة النطاق للمعالين المتأثرين بدلاً من إعادة بناء العلاقات المشتقة غير ذات الصلة.
يضع المشروع LLM بشكل صارم على حدود الاستخراج. وفقًا لـ README، يقوم النموذج المضيف بتحويل مادة المحادثة إلى تنسيق حقيقة قائم على سطر مثل الموضوع والعلاقة والكائن بقيمة ثقة اختيارية. يطبق Lemmalog بعد ذلك سياسات التحديث الحتمية: إضافة حقائق غير مرئية، أو التعامل مع التكرارات على أنها محظورة، أو استبدال قيم العلاقات الحصرية أو تصعيد التغييرات الغامضة غير الحصرية. يسجل النظام أيضًا خطوط الاستخراج المسقطة أو المشوهة بدلاً من التعامل معها بصمت على أنها ابتلاع ناجح.
المصدر تقارير عدة التقييمات. في تشغيل LongMemEval المكون من 30 سؤالًا باستخدام Claude Opus 4.8، أبلغ المستودع عن ذاكرة إجمالية F1 تبلغ 0.48 مقابل 0.51 لوضع النص الأولي، مع المطالبة بأداء أفضل في تحديثات المعرفة وسياقات أصغر بكثير. في مقارنة MemEval المكونة من 102 سؤال، أبلغت F1 عن 0.463 زائد أو ناقص 0.010 عبر ثلاث عمليات تشغيل ودقة ثنائية تبلغ 0.575، مقارنة بـ 0.197 المبلغ عنها لتشغيل السياق الكامل الخاص بها. في LoCoMo، يُبلغ عن F1 بمقدار 0.533 زائد أو ناقص 0.001 عبر ثلاثة أشواط. هذه هي النتائج التي تم الإبلاغ عنها من قبل المستودع، وليست نتائج مثبتة بشكل مستقل.
لماذا يهم
يعالج المشروع نقطة ضعف عملية في عوامل الذكاء الاصطناعي طويلة الأمد: الاحتفاظ بالمعلومات مع الحفاظ على الأدلة، والتعامل مع التحديثات والحد من مقدار السياق المرسل إلى النموذج. تشير نتائجها المعيارية الخاصة إلى وجود مفاضلة محتملة بين جودة الإجابة وحجم السياق وتكلفة الاستخراج.
غالبًا ما يحتاج الوكلاء الذين يعملون لفترة طويلة إلى الإجابة على أسئلة حول المعلومات التي تتغير بمرور الوقت. يستهدف تصميم Lemmalog هذه المشكلة بشكل مباشر من خلال فصل الحقائق المؤكدة عن وجهات النظر المشتقة. يمكن أن يحل تغيير مثل صاحب عمل أو مدير جديد محل قيمة سابقة، في حين يمكن للقواعد إعادة حساب الاستنتاجات التي تعتمد على العلاقة المتغيرة فقط. إذا كان التنفيذ يتصرف كما هو موضح، فقد يؤدي ذلك إلى جعل ذاكرة الوكيل أكثر قابلية للتدقيق وأقل اعتمادًا على الطلب المتكرر من نموذج اللغة لإعادة بناء السجل من النصوص الأولية.
المصدر هو تمييز عملي آخر. يقول README أن شجرة إثبات السبب () يمكنها ربط حقيقة مشتقة بالقواعد وحلقات المصدر التي تدعمها. وهذا لا يثبت صحة الاستخراج الأساسي، ولكنه يمكن أن يجعل تحديد الأخطاء أسهل: فقد يتم إرجاع الاستنتاج الخاطئ إلى حقيقة سيئة، أو اسم مستعار غامض، أو قاعدة معيبة، أو حلقة غير مكتملة. بالنسبة للأنظمة المستخدمة في الأبحاث أو العمليات أو التحقيقات، يمكن أن يساعد هذا الفصل المستخدمين على مراجعة الأدلة بدلاً من قبول استرجاع ذاكرة مبهمة.
من المحتمل أن تكون وفورات السياق المبلغ عنها مهمة بالنسبة للتكلفة والموثوقية. يقول المستودع إن مسار الاسترجاع الخاص به يجمع سياقًا مركّزًا من الحقائق المرتبة وحلقات المصدر، بدلاً من التخلص من المحادثة بأكملها. يُبلغ عن ما يقرب من 2300 رمز مميز لمرحلة الإجابة لكل سؤال LongMemEval مقابل حوالي 104000 للسياق الكامل، وحوالي 3200 مقابل 18900 على LoCoMo. يقوم المصدر أيضًا بوضع نماذج لتكلفة سياق ثابتة لكل سؤال لمحادثة متنامية، مع التحذير من أن الاستخراج الأكثر ثراءً يزيد من حجم الذاكرة وأن الاستخراج نفسه يحمل تكلفة نموذجية لمرة واحدة.
وتقتصر المطالبات أيضًا على الأدلة الخاصة بالمشروع. يقول README أن أسئلة التفضيل ظلت ضعيفة، وأن المنطق الزمني يعتمد على استخراج الأحداث المؤرخة ذات الصلة، وفشلت بعض الإجابات متعددة الجلسات لأنه لم يتم استخلاص الحقائق مطلقًا. تشير إلى أن النتائج المعيارية يمكن أن تختلف بشكل كبير عندما لا يمكن التحكم في درجة حرارة نموذج الإجابة. هذه القيود مهمة لأن طبقة الاستدلال الرمزي يمكن أن تضمن الاتساق بين الحقائق المخزنة دون ضمان أن الحقائق المخزنة كاملة أو منسوبة بشكل صحيح أو مستخرجة بدقة من اللغة الطبيعية.
الآلية التفاعلية: كيف تعمل فعليًا
استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
ماذا تشاهد بعد ذلك
الأسئلة الرئيسية هي ما إذا كانت النتائج المبلغ عنها تتكاثر خارج إعداد اختبار المستودع، وما مدى اعتماد الأداء على النموذج المستخدم للاستخراج والإجابة، وما إذا كان التنفيذ الحالي للمشروع ناضجًا بما يكفي لأحمال عمل ذاكرة الإنتاج. لا يُظهر المصدر المقدم طابعًا زمنيًا واضحًا للنشر أو تقييمًا مستقلاً.
التكاثر هو القضية الأولى التي يجب مراقبتها. يصف المستودع أدوات الاختبار ونتائج الاستخراج المخزنة مؤقتًا والتكوينات المعيارية، لكن المصدر المتوفر لا يوفر نسخة متماثلة مستقلة أو ورقة رسمية أو تاريخ إصدار مرئي بوضوح. يجب أن يفحص التدقيق المستقبلي ما إذا كانت نتائج F1 والرمز المميز وزمن الاستجابة المُبلغ عنها تنطبق على النماذج ومجموعات البيانات والأجهزة وعمليات التشغيل المتكررة مع أخذ العينات الخاضعة للرقابة.
ومن المرجح أن تظل حدود الاستخراج نقطة الفشل الرئيسية للنظام. يمكن للمحرك الحتمي الخاص بـ Lemmalog تطبيق القواعد على الحقائق التي يتلقاها، لكن الملف التمهيدي (README) يعزو بشكل واضح العديد من الأخطاء إلى الحقائق المفقودة، أو المبالغ غير المعروفة أو استخلاص الأحداث غير الكامل. ستحتاج عمليات النشر العملية إلى قياس استدعاء الاستخراج ودقة الإسناد ومعايرة الثقة بشكل منفصل عن صحة محرك Datalog.
كما أن سلوك الحجم وعبء العمل يستحق الاهتمام أيضًا. أفاد المصدر أن إغلاق سلسلة مكونة من 500 عقدة يستغرق حوالي 17 ثانية على كمبيوتر محمول من السلسلة M، ويستغرق دورة تدريجية حوالي 50 مللي ثانية وإغلاق انتقالي كثيف يصل إلى 3.9 مليون حقيقة. إنه يقدم استعلامات الطلب كوسيلة لتجنب التجسيد الأعمى لعمليات الإغلاق الكثيفة، لكنه لا يحدد كيفية سلوك استخدام الذاكرة أو الاستمرارية أو الوصول المتزامن أو تعقيد القواعد في أنظمة الإنتاج الكبيرة.
وأخيرًا، يجب على المستخدمين مراقبة كيفية إدارة واجهة MCP ونموذج تثبيت القواعد. يقول المستودع أن الوكلاء يمكنهم تثبيت وإلغاء تثبيت مجموعات القواعد ذات الإصدار واستخدام المحرك كعقل مشترك من خلال Claude Code أو Kimi CLI. وهذا يخلق مرونة مفيدة، ولكنه يثير أيضًا أسئلة تشغيلية لم تتم الإجابة عليها في المصدر المقدم: من يوافق على القواعد، وكيف تتم مراجعة المخططات المتضاربة، وكيف تتم حماية الحلقات الحساسة، وكيف يميز المستخدمون التأكيدات المستخرجة من النموذج من الاستنتاجات المشتقة ميكانيكيًا.