ماذا حدث
أفاد المؤلفون أن أنظمة نماذج اللغة المعززة بالاسترجاع يمكن أن تصبح غير مستقرة عندما تتضمن نتائج البحث محتوى تم إنشاؤه مسبقًا بواسطة نفس النماذج. عبر ثلاثة أنواع من المحاكاة، وثلاث عائلات نموذجية، و1019 مطالبة للبحث عن المعلومات، أفادت التقارير أن 1216 من أصل 1528 عملية محاكاة انتهت بالانهيار.
المصدر عبارة عن ورقة بحثية arXiv تم تقديمها في 22 أغسطس 2026 بعنوان "RAG Collapse: انهيار استجابات LLM عندما تكون المستندات المستردة ذاتية التأليف." ادعاءها المركزي هو أن نظام نموذج اللغة قد يتدهور عندما تقوم أداة الاسترجاع بإرجاع المراجع التي تم إنشاؤها بواسطة نفس النظام. يميز المؤلفون هذا عن التدريب العودي على مخرجات النموذج: هنا، يتم تقديم حلقة التغذية الراجعة أثناء استرجاع المعلومات، عندما تصبح المستندات التي تم إنشاؤها متاحة كمراجع للاستجابات اللاحقة. تُطلق الورقة على النموذج الناتج اسم "انهيار RAG".
يقول المؤلفون إنهم اختبروا ثلاثة أنواع من عمليات المحاكاة التي تتضمن أنظمة الذكاء الاصطناعي التي تستعيد المراجع التي أنشأتها. يحدد الملخص المقدم ثلاث عائلات نموذجية، و1019 مطالبة للبحث عن المعلومات، و1528 عملية محاكاة، وأكثر من مليون استدعاء لواجهة برمجة التطبيقات (API) لنموذج اللغة. وتشير التقارير إلى أن 1216 عملية محاكاة، أو 79.6%، انتهت بالانهيار. لا يذكر المصدر عائلات النماذج، أو يصف المطالبات بالتفصيل، أو يحدد تكوينات الاسترجاع، أو يقدم الاختبار التشغيلي المستخدم لتحديد انهيار المحاكاة.
تشير الورقة أيضًا إلى أن مرجعًا واحدًا مكتوبًا ذاتيًا قد يكون كافيًا لتحفيز التأثير. وفقًا للمؤلفين، استشهدت نماذج اللغة بالمحتوى الخاص بها بشكل غير متناسب، وظل هذا التحيز الذاتي موجودًا بعد أن سيطر الباحثون على الجودة المرجعية. وهذا التمييز مهم: فالآلية المبلغ عنها ليست مجرد أن المستندات الرديئة تلوث مجموعة الاسترجاع. يقدم المصدر بدلاً من ذلك التأليف الذاتي كعامل مستقل في كيفية اختيار المراجع المستردة أو استخدامها.
تظل هذه النتائج مطالبات من تقديم arXiv بدلاً من الحقائق المثبتة بشكل مستقل في المواد المقدمة. يحدد المصدر العمل على أنه بحث مكون من 36 صفحة يحتوي على 31 شكلاً وأربعة جداول، لكن النص المقدم يحتوي فقط على المعلومات المجردة والببليوغرافية. ولا يبلغ عن مراجعة النظراء، أو النسخ المتماثل الخارجي، أو اختبار النظام المباشر، أو النتائج التجريبية الكاملة. يضع الطابع الزمني المرئي الإرسال خلال النافذة الحالية البالغة 96 ساعة، لكن المصدر لا يوفر أي تحديث لاحق بعد الإرسال الأولي.
لماذا يهم
تحدد النتيجة مشكلة ردود الفعل المحتملة للأنظمة التي تستخدم البحث أو استرجاع المستندات للحصول على إجابات أساسية. وتشير إلى أن المواد التي تم إنشاؤها بواسطة النموذج قد تتلقى تأثيرًا غير متناسب حتى عندما لا تكون أفضل من المراجع الأخرى، على الرغم من أن المصدر المقدم لا يحدد عدد مرات حدوث ذلك في الأنظمة المنشورة.
يهدف الجيل المعزز بالاسترجاع إلى ربط نموذج اللغة بالمراجع الخارجية بدلاً من الاعتماد فقط على المعلومات المخزنة في معلماته. إذا كانت المادة المستردة تتكون بشكل متزايد من نص تم إنشاؤه بواسطة النموذج، فيمكن للنظام تغذية الصياغة أو السهو أو الأخطاء الخاصة به مرة أخرى في الإجابات اللاحقة. وبالتالي، تتعلق النتيجة التي تم الإبلاغ عنها في الورقة بمخاطر موثوقية مباشرة لأنظمة الذكاء الاصطناعي التي تبحث في مجموعات المستندات أو تلخصها أو تعيد استخدامها.
يعتبر التحيز الذاتي المبلغ عنه ذا أهمية خاصة لأنه يمكن أن يستمر حتى عندما تكون المراجع الأخرى ذات جودة مماثلة أو أعلى. إذا تم تأكيد ذلك خارج عمليات المحاكاة البحثية، فإن ذلك من شأنه أن يعقد الافتراضات الشائعة بأن إضافة المزيد من المواد المستردة يؤدي تلقائيًا إلى تحسين التأريض. قد يحتاج نظام الاسترجاع إلى تتبع المصدر ومعالجة المستندات التي تم تأليفها بالنموذج بشكل مختلف عن المصادر المنتجة بشكل مستقل، بدلاً من تقييم المستندات فقط حسب الملاءمة أو الجودة الواضحة.
من المحتمل أن تكون الآثار العملية واسعة النطاق ولكن لا ينبغي المبالغة فيها. لا يُظهر المصدر أن محركات البحث المنتشرة أو قواعد المعرفة المؤسسية أو مساعدي المستهلكين تتعرض حاليًا للانهيار. كما أنها لا تثبت أن جميع المستندات التي تم إنشاؤها بواسطة النموذج غير موثوقة، أو أن أنظمة الاسترجاع تفضل بشكل روتيني المحتوى الذاتي التأليف، أو أن المعدل المبلغ عنه ينطبق خارج عمليات المحاكاة التي تم اختبارها. تقدم الورقة تحذيرًا بشأن آلية ردود الفعل المحتملة، وليس تقديرًا مُقاسًا لانتشارها في النظام البيئي الأوسع للذكاء الاصطناعي.
وتكشف النتيجة أيضًا عن مشكلة الإدارة والقياس. عندما تدخل المواد التي ينشئها الذكاء الاصطناعي إلى بيئة المعلومات، قد تواجه الأنظمة اللاحقة صعوبة في التمييز بين الأدلة الأصلية والنص المشتق. لا يقترح المصدر المقدم حلاً كاملاً، ولكن النتائج التي توصل إليها تجعل المصدر واستقلال المصدر والكشف المتكرر عن المحتوى مشكلات عملية للمطورين والمؤسسات التي تستخدم الذكاء الاصطناعي القائم على الاسترجاع. تتبع هذه الآثار بشكل مشروط ادعاء المؤلفين، وتتطلب اختبارها مقابل خطوط استرجاع حقيقية قبل أن تتمكن من دعم الاستنتاجات التشغيلية الواسعة.
الآلية التفاعلية: كيف تعمل فعليًا
استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.
What is a common training objective for an autoregressive language model?
ماذا تشاهد بعد ذلك
وتتمثل أسئلة المتابعة الرئيسية في كيفية تعريف الورقة للانهيار، وما إذا كانت النتيجة تتكرر عبر النماذج وأنظمة الاسترجاع في العالم الحقيقي، وما هي الضمانات التي تقلل من التأثير. ولا يقدم المصدر هذه التفاصيل، ولا يبلغ عن أي تدخل أو دراسة نشر أو تكرار خارجي.
القضية الأولى التي يجب فحصها هي تعريف الورقة لمصطلح "الانهيار". يستخدم الملخص المصطلح ويربطه بالعمل السابق على التدريب النموذجي العودي، حيث تصبح المخرجات أقل تنوعًا وتتوقف في النهاية عن التشابه مع البيانات الأصلية. لكن المصدر المقدم لا يذكر ما إذا كانت التجارب الجديدة قد قامت بقياس التنوع، أو دقة الحقائق، أو تداخل المصدر، أو سلوك الاقتباس، أو تشابه الإجابات، أو نتيجة أخرى. سيحدد معيار الورقة الكاملة مدى ارتباط النتائج بشكل مباشر بفشل الموثوقية المرئي للمستخدم.
النسخ المتماثل هو الاختبار المهم التالي. ذكر المؤلفون ثلاث عائلات نموذجية وثلاثة أنواع محاكاة، لكن المصدر لم يحددها أو يشرح مدى تمثيلها لأنظمة الاسترجاع المعززة الحالية. سيحتاج الباحثون المستقلون إلى اختبار أحجام نماذج مختلفة، وخوارزميات الاسترجاع، ومزيج المستندات، واستراتيجيات التحفيز، ونسب المواد التي يولدها الذكاء الاصطناعي. وسيحتاجون أيضًا إلى فصل التأثيرات الناجمة عن التأليف الذاتي عن أخطاء الاسترجاع العادية، أو المستندات المكررة، أو المراجع منخفضة الجودة.
انتشار العالم الحقيقي هو أمر آخر غير معروف. تشير الورقة إلى أن 79.6% من عمليات المحاكاة تنتهي بالانهيار، لكن هذا الرقم ليس تقديرًا لعدد السكان للبحث على الإنترنت، أو قواعد بيانات المؤسسات، أو أي نظام آخر منتشر. لا يذكر المصدر عدد المرات التي تظهر فيها المستندات الخاصة بالنموذج في نتائج الاسترجاع ذات الصلة، أو المدة التي تستغرقها حلقة التعليقات، أو ما إذا كانت المواد التي تم تحريرها بواسطة الإنسان والتي تم التحقق منها بشكل مستقل تقاطعها. وهذه القياسات ضرورية قبل ترجمة نتيجة المحاكاة إلى توقعات بالتأثير العام.
وأخيرا، ينبغي لأعمال المتابعة أن تختبر الضمانات. قد تشمل المقارنات المفيدة تسميات المصدر، واستبعاد المستندات التي تم إنشاؤها بواسطة نفس النموذج أو النظام، ومتطلبات تنوع المصدر، والتصنيف المستقل، والمراجعة البشرية للاستخدامات عالية المخاطر. لا يُبلغ المصدر المتوفر عن أي تجربة تخفيف ولا يقدم أي توفر أو مطالبة بالمنتج. وإلى أن يتم نشر مثل هذه الاختبارات، يجب على المطورين والمستخدمين التعامل مع الورقة البحثية كدليل على وضع فشل محتمل مهم، مع الاعتراف بأن خطورته وعلاجاته تظل دون حل.