دليل التطبيقات

عوامل الانعكاس والتصحيح الذاتي

الانعكاس هو أسلوب يعكس فيه وكيل الذكاء الاصطناعي كتابيًا إخفاقاته ويغذي هذه الدروس مرة أخرى في محاولته التالية.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because it lets agents improve on a task without retraining the underlying model.

الغوص العميق

يمنح الانعكاس، الذي قدمه شين وزملاؤه في بحث عام 2023، العميل حلقة: فهو يحاول تنفيذ مهمة، ويتلقى إشارة حول كيفية تنفيذها (نتيجة اختبار، أو مكافأة، أو نقد)، ثم يكتب "انعكاسًا" قصيرًا باللغة الطبيعية يشرح الخطأ الذي حدث وما يجب تجربته بعد ذلك. يتم تخزين هذا الانعكاس في الذاكرة وإضافته إلى مطالبة المحاولة التالية. والأهم من ذلك أن أوزان النموذج لا تتغير أبدًا؛ يحدث التعلم بالكامل في نافذة السياق كنص. يتيح "التعلم المعزز اللفظي" للوكلاء تكرار مشاكل البرمجة والتنقل عبر الويب ومهام التفكير. في معيار ترميز HumanEval، أدى التصحيح الذاتي بأسلوب الانعكاس إلى رفع معدلات النجاح بشكل كبير عن المحاولات الفردية، وذلك ببساطة عن طريق السماح للعميل بتصحيح أخطائه عبر بضع محاولات.

البصيرة الفنية

يفصل الانعكاس بين ثلاثة أدوار: الممثل الذي يولد الإجراءات، والمقيم الذي يسجل النتيجة (اختبارات الوحدة، أو فحص المطابقة التامة، أو حكم LLM)، ونموذج التأمل الذاتي الذي يحول تلك النتيجة إلى درس نصي. يتم وضع الدرس في مخزن مؤقت للذاكرة العرضية يُعاد استخدامه في التجربة التالية. نظرًا لأن التعليقات عبارة عن لغة وليست تدرجات، فلا حاجة إلى تدريب على وحدة معالجة الرسومات، ولكنها تعتمد بشكل كبير على إشارة تقييم موثوقة لتجنب تعزيز الانعكاسات الواثقة ولكن الخاطئة.

التأثير الاستراتيجي

خيارات البناء

يحدد التصميم على مستوى التطبيق ما إذا كان الذكاء الاصطناعي سيحسن النتائج الحقيقية.

الفريق وسير العمل

يؤدي التكامل الجيد لسير العمل إلى تحقيق مكاسب إنتاجية يمكن للمستخدمين الوثوق بها.

المخاطر والسلامة

تعمل حالات الاستخدام ذات النطاق الجيد على تقليل إجهاد التغيير ومخاطر التنفيذ.

مستقبل الانعكاس وعوامل التصحيح الذاتي

أصبح التصحيح الذاتي طبقة افتراضية في أطر عمل الوكلاء بدلاً من كونه خدعة بحثية. توقع تكاملًا أكثر إحكامًا مع أدوات التحقق الآلية، مثل صناديق اختبار الكود، والمدققين الرسميين، وعمليات الاسترجاع التي تؤكد الحقائق، بحيث ترتكز الانعكاسات على إشارات موضوعية بدلاً من التخمين الثاني للنموذج نفسه. وتتمثل التحديات المفتوحة في تجنب الحلقات التي يقوم فيها الوكيل "بإصلاح" مخرجات العمل إلى ما لا نهاية، وتحديد متى يتوقف عن التكرار، ومنع الأفكار من الانجراف إلى مبررات تبدو معقولة ولكن لم يتم التحقق منها.

التنفيذ في العالم الحقيقي

وكيل ترميز يقوم بإجراء اختبارات الوحدة، ويقرأ التأكيد الفاشل، ويكتب ملاحظة حول الخطأ، ويحرر التعليمات البرمجية الخاصة به قبل إعادة تشغيل المجموعة.

مساعد بحث يلتقط اقتباسًا مهلوسًا عندما يفشل فحص الاسترجاع، ثم يقوم بمراجعة الإجابة لاستخدام المصادر التي تم التحقق منها فقط.

وكيل التنقل عبر الويب (على سبيل المثال، في معايير AlfWorld أو WebShop) الذي يسجل "لقد قمت بالنقر فوق عامل التصفية الخاطئ" ويتجنب هذا الخطأ عند إعادة المحاولة.

أداة حل مسائل رياضية تتحقق من إجابتها النهائية مقابل أحد القيود، وتلاحظ وجود خطأ في الإشارة، وتعيد صياغة الخطوة ذات الصلة.

المخاطر والدرابزين

يمكن أن تؤدي أتمتة عملية معطلة إلى تضخيم المشاكل الموجودة.

قد تقوم الفرق بالإفراط في أتمتة وإزالة الحكم البشري المطلوب.

يمكن أن تنحرف الجودة إذا لم يتم تقييم المخرجات بشكل مستمر.

خارطة طريق التنفيذ

1

قم بتخطيط سير العمل الحالي وحدد خطوة الاحتكاك الأعلى.

2

تحديد نقاط التفتيش البشرية قبل الأتمتة الكاملة.

3

تدريب المستخدمين على المطالبات ومسارات التصعيد ومعايير الجودة.

4

تتبع النتائج على مستوى المهمة لتأكيد القيمة المستدامة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reflexion and Self-Correcting Agents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

التأمل الذاتي في حلقات الوكيل

الأسئلة المتداولة

What is Reflexion and Self-Correcting Agents?

الانعكاس هو أسلوب يعكس فيه وكيل الذكاء الاصطناعي كتابيًا إخفاقاته ويغذي هذه الدروس مرة أخرى في محاولته التالية. إنه أمر مهم لأنه يتيح للوكلاء تحسين المهمة دون إعادة تدريب النموذج الأساسي.

ما هي السمة المميزة لكيفية "تعلم" وكيل الانعكاس؟

يسمى الانعكاس أحيانًا "التعلم المعزز اللفظي" لأنه يتم تخزين الدروس كنص باللغة الطبيعية في الذاكرة، ولا يتم ترميزه في معلمات النموذج.

في إطار التفكير، ماذا يفعل المقيم؟

يقوم المقيم (اختبار الوحدة، أو فحص المطابقة التامة، أو محكم LLM) بإنتاج إشارة مفادها أن خطوة التأمل الذاتي تتحول إلى درس نصي.

لماذا تعتبر جودة إشارة التقييم مهمة جدًا في الانعكاس؟

إذا كان المقيم غير جدير بالثقة، فقد يكتب الوكيل أفكارًا واثقة بناءً على ردود فعل سيئة، مما يؤدي إلى توجيه المحاولات المستقبلية في الاتجاه الخاطئ.

ما هو المعيار الذي أدى فيه التصحيح الذاتي بأسلوب الانعكاس إلى تحسين معدلات نجاح البرمجة بشكل ملحوظ؟

يعد HumanEval معيارًا لإنشاء التعليمات البرمجية، كما أن السماح للوكيل بتصحيح الأخطاء عبر محاولات متعددة يؤدي إلى رفع معدلات النجاح أعلى بكثير من أداء اللقطة الواحدة.

ما هي المخاطر المفتوحة الحقيقية مع عوامل التصحيح الذاتي؟

بدون قاعدة إيقاف جيدة، قد يستمر الوكيل في مراجعة الإجابات الصحيحة، مما يؤدي إلى إهدار الحوسبة وفي بعض الأحيان تدهور المخرجات الجيدة.