العودة إلى الأخبار
الابتكارAI Understanding إحاطة

تشير الدراسة إلى "انهيار RAG" عندما تسترد نماذج اللغة كتاباتها الخاصة

تشير دراسة arXiv إلى أن أنظمة نماذج اللغة يمكن أن تدخل في نمط فشل عندما يسترد البحث المستندات التي أنشأتها مسبقًا. في عمليات المحاكاة التي أجراها المؤلفون، انتهت 79.6% من 1528 جولة بما يطلق عليه البحث "انهيار RAG".

5 min readRead the primary source
Primary-source image accompanying Study reports ‘RAG collapse’ when language models retrieve their own writing
وثيقة المصدر الأساسيتم تسجيل المصدر
الناشر
arxiv.org
رابط المصدر
arxiv.orghttps://arxiv.org/abs/2608.22118
نوع المصدر
المستند الأساسي - إعلان رسمي أو ورقة أو ملف أو صفحة الطرف الأول التي نقرأها مباشرة.
السياقافهم هذا في 60 ثانية

ابدأ هنا

المصطلحات الرئيسية

RAG (جيل الاسترجاع المعزز)
طريقة تستعيد المعرفة الخارجية وتغذيها في الأجيال في وقت الاستدلال.
API (واجهة برمجة التطبيقات)
طريقة منظمة لنظام برمجي واحد لإرسال الطلبات إلى نظام آخر وتلقي الاستجابات منه.
نموذج اللغة الكبير (LLM)
نموذج لغة تم تدريبه على مجموعات نصية ضخمة لإنشاء النص وتحليله.
اختبر نفسكChatGPT واختبار ماجستير إدارة الأعمال

ماذا حدث

أفاد المؤلفون أن أنظمة نماذج اللغة المعززة بالاسترجاع يمكن أن تصبح غير مستقرة عندما تتضمن نتائج البحث محتوى تم إنشاؤه مسبقًا بواسطة نفس النماذج. عبر ثلاثة أنواع من المحاكاة، وثلاث عائلات نموذجية، و1019 مطالبة للبحث عن المعلومات، أفادت التقارير أن 1216 من أصل 1528 عملية محاكاة انتهت بالانهيار.

المصدر عبارة عن ورقة بحثية arXiv تم تقديمها في 22 أغسطس 2026 بعنوان "RAG Collapse: انهيار استجابات LLM عندما تكون المستندات المستردة ذاتية التأليف." ادعاءها المركزي هو أن نظام نموذج اللغة قد يتدهور عندما تقوم أداة الاسترجاع بإرجاع المراجع التي تم إنشاؤها بواسطة نفس النظام. يميز المؤلفون هذا عن التدريب العودي على مخرجات النموذج: هنا، يتم تقديم حلقة التغذية الراجعة أثناء استرجاع المعلومات، عندما تصبح المستندات التي تم إنشاؤها متاحة كمراجع للاستجابات اللاحقة. تُطلق الورقة على النموذج الناتج اسم "انهيار RAG".

يقول المؤلفون إنهم اختبروا ثلاثة أنواع من عمليات المحاكاة التي تتضمن أنظمة الذكاء الاصطناعي التي تستعيد المراجع التي أنشأتها. يحدد الملخص المقدم ثلاث عائلات نموذجية، و1019 مطالبة للبحث عن المعلومات، و1528 عملية محاكاة، وأكثر من مليون استدعاء لواجهة برمجة التطبيقات (API) لنموذج اللغة. وتشير التقارير إلى أن 1216 عملية محاكاة، أو 79.6%، انتهت بالانهيار. لا يذكر المصدر عائلات النماذج، أو يصف المطالبات بالتفصيل، أو يحدد تكوينات الاسترجاع، أو يقدم الاختبار التشغيلي المستخدم لتحديد انهيار المحاكاة.

تشير الورقة أيضًا إلى أن مرجعًا واحدًا مكتوبًا ذاتيًا قد يكون كافيًا لتحفيز التأثير. وفقًا للمؤلفين، استشهدت نماذج اللغة بالمحتوى الخاص بها بشكل غير متناسب، وظل هذا التحيز الذاتي موجودًا بعد أن سيطر الباحثون على الجودة المرجعية. وهذا التمييز مهم: فالآلية المبلغ عنها ليست مجرد أن المستندات الرديئة تلوث مجموعة الاسترجاع. يقدم المصدر بدلاً من ذلك التأليف الذاتي كعامل مستقل في كيفية اختيار المراجع المستردة أو استخدامها.

تظل هذه النتائج مطالبات من تقديم arXiv بدلاً من الحقائق المثبتة بشكل مستقل في المواد المقدمة. يحدد المصدر العمل على أنه بحث مكون من 36 صفحة يحتوي على 31 شكلاً وأربعة جداول، لكن النص المقدم يحتوي فقط على المعلومات المجردة والببليوغرافية. ولا يبلغ عن مراجعة النظراء، أو النسخ المتماثل الخارجي، أو اختبار النظام المباشر، أو النتائج التجريبية الكاملة. يضع الطابع الزمني المرئي الإرسال خلال النافذة الحالية البالغة 96 ساعة، لكن المصدر لا يوفر أي تحديث لاحق بعد الإرسال الأولي.

تفاصيل المصدر: arxiv.org ↗

لماذا يهم

تحدد النتيجة مشكلة ردود الفعل المحتملة للأنظمة التي تستخدم البحث أو استرجاع المستندات للحصول على إجابات أساسية. وتشير إلى أن المواد التي تم إنشاؤها بواسطة النموذج قد تتلقى تأثيرًا غير متناسب حتى عندما لا تكون أفضل من المراجع الأخرى، على الرغم من أن المصدر المقدم لا يحدد عدد مرات حدوث ذلك في الأنظمة المنشورة.

يهدف الجيل المعزز بالاسترجاع إلى ربط نموذج اللغة بالمراجع الخارجية بدلاً من الاعتماد فقط على المعلومات المخزنة في معلماته. إذا كانت المادة المستردة تتكون بشكل متزايد من نص تم إنشاؤه بواسطة النموذج، فيمكن للنظام تغذية الصياغة أو السهو أو الأخطاء الخاصة به مرة أخرى في الإجابات اللاحقة. وبالتالي، تتعلق النتيجة التي تم الإبلاغ عنها في الورقة بمخاطر موثوقية مباشرة لأنظمة الذكاء الاصطناعي التي تبحث في مجموعات المستندات أو تلخصها أو تعيد استخدامها.

يعتبر التحيز الذاتي المبلغ عنه ذا أهمية خاصة لأنه يمكن أن يستمر حتى عندما تكون المراجع الأخرى ذات جودة مماثلة أو أعلى. إذا تم تأكيد ذلك خارج عمليات المحاكاة البحثية، فإن ذلك من شأنه أن يعقد الافتراضات الشائعة بأن إضافة المزيد من المواد المستردة يؤدي تلقائيًا إلى تحسين التأريض. قد يحتاج نظام الاسترجاع إلى تتبع المصدر ومعالجة المستندات التي تم تأليفها بالنموذج بشكل مختلف عن المصادر المنتجة بشكل مستقل، بدلاً من تقييم المستندات فقط حسب الملاءمة أو الجودة الواضحة.

من المحتمل أن تكون الآثار العملية واسعة النطاق ولكن لا ينبغي المبالغة فيها. لا يُظهر المصدر أن محركات البحث المنتشرة أو قواعد المعرفة المؤسسية أو مساعدي المستهلكين تتعرض حاليًا للانهيار. كما أنها لا تثبت أن جميع المستندات التي تم إنشاؤها بواسطة النموذج غير موثوقة، أو أن أنظمة الاسترجاع تفضل بشكل روتيني المحتوى الذاتي التأليف، أو أن المعدل المبلغ عنه ينطبق خارج عمليات المحاكاة التي تم اختبارها. تقدم الورقة تحذيرًا بشأن آلية ردود الفعل المحتملة، وليس تقديرًا مُقاسًا لانتشارها في النظام البيئي الأوسع للذكاء الاصطناعي.

وتكشف النتيجة أيضًا عن مشكلة الإدارة والقياس. عندما تدخل المواد التي ينشئها الذكاء الاصطناعي إلى بيئة المعلومات، قد تواجه الأنظمة اللاحقة صعوبة في التمييز بين الأدلة الأصلية والنص المشتق. لا يقترح المصدر المقدم حلاً كاملاً، ولكن النتائج التي توصل إليها تجعل المصدر واستقلال المصدر والكشف المتكرر عن المحتوى مشكلات عملية للمطورين والمؤسسات التي تستخدم الذكاء الاصطناعي القائم على الاسترجاع. تتبع هذه الآثار بشكل مشروط ادعاء المؤلفين، وتتطلب اختبارها مقابل خطوط استرجاع حقيقية قبل أن تتمكن من دعم الاستنتاجات التشغيلية الواسعة.

Interactive Mechanism

الآلية التفاعلية: كيف تعمل فعليًا

استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.

System Requirements:
Best ArchitecturePure RAGRecommended pattern
Hallucination RiskVery LowGrounding efficacy
Update Cost$0 (Vector sync)Ongoing maintenance
Core takeaway: Fine-tuning teaches models how to speak (form, style, syntax); RAG teaches models what to say (verifiable facts). Never use fine-tuning alone for factual memory.
التحقق من المفهوم التفاعلي+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

ماذا تشاهد بعد ذلك

وتتمثل أسئلة المتابعة الرئيسية في كيفية تعريف الورقة للانهيار، وما إذا كانت النتيجة تتكرر عبر النماذج وأنظمة الاسترجاع في العالم الحقيقي، وما هي الضمانات التي تقلل من التأثير. ولا يقدم المصدر هذه التفاصيل، ولا يبلغ عن أي تدخل أو دراسة نشر أو تكرار خارجي.

القضية الأولى التي يجب فحصها هي تعريف الورقة لمصطلح "الانهيار". يستخدم الملخص المصطلح ويربطه بالعمل السابق على التدريب النموذجي العودي، حيث تصبح المخرجات أقل تنوعًا وتتوقف في النهاية عن التشابه مع البيانات الأصلية. لكن المصدر المقدم لا يذكر ما إذا كانت التجارب الجديدة قد قامت بقياس التنوع، أو دقة الحقائق، أو تداخل المصدر، أو سلوك الاقتباس، أو تشابه الإجابات، أو نتيجة أخرى. سيحدد معيار الورقة الكاملة مدى ارتباط النتائج بشكل مباشر بفشل الموثوقية المرئي للمستخدم.

النسخ المتماثل هو الاختبار المهم التالي. ذكر المؤلفون ثلاث عائلات نموذجية وثلاثة أنواع محاكاة، لكن المصدر لم يحددها أو يشرح مدى تمثيلها لأنظمة الاسترجاع المعززة الحالية. سيحتاج الباحثون المستقلون إلى اختبار أحجام نماذج مختلفة، وخوارزميات الاسترجاع، ومزيج المستندات، واستراتيجيات التحفيز، ونسب المواد التي يولدها الذكاء الاصطناعي. وسيحتاجون أيضًا إلى فصل التأثيرات الناجمة عن التأليف الذاتي عن أخطاء الاسترجاع العادية، أو المستندات المكررة، أو المراجع منخفضة الجودة.

انتشار العالم الحقيقي هو أمر آخر غير معروف. تشير الورقة إلى أن 79.6% من عمليات المحاكاة تنتهي بالانهيار، لكن هذا الرقم ليس تقديرًا لعدد السكان للبحث على الإنترنت، أو قواعد بيانات المؤسسات، أو أي نظام آخر منتشر. لا يذكر المصدر عدد المرات التي تظهر فيها المستندات الخاصة بالنموذج في نتائج الاسترجاع ذات الصلة، أو المدة التي تستغرقها حلقة التعليقات، أو ما إذا كانت المواد التي تم تحريرها بواسطة الإنسان والتي تم التحقق منها بشكل مستقل تقاطعها. وهذه القياسات ضرورية قبل ترجمة نتيجة المحاكاة إلى توقعات بالتأثير العام.

وأخيرا، ينبغي لأعمال المتابعة أن تختبر الضمانات. قد تشمل المقارنات المفيدة تسميات المصدر، واستبعاد المستندات التي تم إنشاؤها بواسطة نفس النموذج أو النظام، ومتطلبات تنوع المصدر، والتصنيف المستقل، والمراجعة البشرية للاستخدامات عالية المخاطر. لا يُبلغ المصدر المتوفر عن أي تجربة تخفيف ولا يقدم أي توفر أو مطالبة بالمنتج. وإلى أن يتم نشر مثل هذه الاختبارات، يجب على المطورين والمستخدمين التعامل مع الورقة البحثية كدليل على وضع فشل محتمل مهم، مع الاعتراف بأن خطورته وعلاجاته تظل دون حل.

الأدلة والاختبارات ذات الصلة

ChatGPT ونماذج اللغة الكبيرةشرح نماذج الذكاء الاصطناعيتدريب الذكاء الاصطناعيPrompt Engineeringاختبر ما تعرفه – جرّب اختبارًا مجانيًا للذكاء الاصطناعيابحث عن مصطلح الذكاء الاصطناعي في قاموسنااتبع أداة تعقب إصدار نموذج الذكاء الاصطناعي
وجدت هذا مفيدا؟