العودة إلى الأخبار
الابتكارAI Understanding إحاطة

تشير ورقة NC-GRPO إلى تفكير أقوى في لغة الرؤية من خلال تنوع طرح الفضاء الكامن

تقدم النسخة الأولية من arXiv طريقة NC-GRPO، وهي طريقة للتعلم المعزز تشوش التمثيل المخفي لنموذج لغة الرؤية بدلاً من صورة الإدخال الخاصة به. أبلغ المؤلفون عن تحسن في التفكير الرياضي خارج المجال وقوة الهلوسة في Qwen2.5-VL-7B، مع ملاحظة المفاضلات بين...

5 min readRead the primary source
Primary-source image accompanying NC-GRPO paper reports stronger vision-language reasoning from latent-space rollout diversity
وثيقة المصدر الأساسيتم تسجيل المصدر
الناشر
arxiv.org
رابط المصدر
arxiv.orghttps://arxiv.org/abs/2608.21595
نوع المصدر
المستند الأساسي - إعلان رسمي أو ورقة أو ملف أو صفحة الطرف الأول التي نقرأها مباشرة.
السياقافهم هذا في 60 ثانية

ابدأ هنا

المصطلحات الرئيسية

نموذج لغة الرؤية (VLM)
نموذج متعدد الوسائط يقوم بمعالجة المعلومات المرئية والنصية بشكل مشترك.
التعلم المعزز
التدريب من خلال إشارات المكافأة حيث يتعلم الوكيل الإجراءات التي تزيد من العائد على المدى الطويل.
الذاكرة (ذاكرة الوكيل)
السياق المُخزن الذي يستخدمه وكيل الذكاء الاصطناعي عبر الخطوات أو الجلسات لتحسين الاستمرارية.
اختبر نفسكوأوضح نماذج الذكاء الاصطناعي مسابقة

ماذا حدث

تقدم ورقة بحثية arXiv GRPO ذات الضوضاء المتناقضة، أو NC-GRPO، وهي طريقة لتدريب نماذج لغة الرؤية مع التعلم المعزز والمكافآت التي يمكن التحقق منها. فهو يضيف ضوضاء غاوسية مُعايرة إلى الطبقة المخفية الأخيرة للنموذج أثناء التشفير الفوري لنصف كل مجموعة طرح، مما يؤدي إلى إنشاء مسارات تفكير بديلة دون تغيير الصورة أو المكافأة أو الهدف أو بروتوكول الاستدلال. تم اختباره على Qwen2.5-VL-7B المدرب على Geometry3K، أفاد المؤلفون بأداء أقوى داخل المجال، وتحسين التفكير الرياضي خارج المجال عبر خمسة معايير ثابتة، وقوة هلوسة أفضل من Vanilla GRPO.

تدرس الورقة التعلم المعزز بمكافآت يمكن التحقق منها لنماذج لغة الرؤية، حيث يمكن التحقق من مخرجات المرشح مقابل إجابة معروفة أو إشارة موضوعية أخرى. اقتراحها المركزي هو GRPO المتناقض للضوضاء، أو NC-GRPO. بدلاً من زيادة التنوع عن طريق تغيير درجة حرارة فك التشفير أو تغيير الصورة المدخلة في مساحة البكسل، تقوم الطريقة بحقن ضوضاء غاوسية معايرة على نطاق واسع في الطبقة المخفية الأخيرة التي تم إنتاجها أثناء تشفير الموجه. تتلقى نصف عمليات الطرح في كل مجموعة تحسين الاضطراب، بينما توفر الفروع المتبقية مقارنة غير مضطربة.

يصف المؤلفون الاضطراب كوسيلة لإنشاء فروع من حالة المغادرة الداخلية النازحة. الفرع الذي لا يزال يصل إلى الإجابة الصحيحة بعد هذا الإزاحة يتلقى تعزيزًا مقارنةً بالفرع الذي خرج عن مساره. في إطار البحث، تصبح حساسية النموذج عند نقطة التفرع الداخلية بمثابة إشارة لتدرج السياسة. يقول الملخص أن هذا يترك هدف التدريب وتعريف المكافأة وبروتوكول الاستدلال دون تغيير، وأنه يمكن دمج الطريقة في مسار التعلم المعزز القياسي من خلال تغيير محرك الاستدلال المكون من 50 سطرًا تقريبًا. هذه ادعاءات قدمها المؤلفون، وليست تقييم تنفيذ تم التحقق منه بشكل مستقل.

تستخدم التجربة المبلغ عنها Qwen2.5-VL-7B المدربة على Geometry3K. ضد الفانيليا GRPO، تقول الورقة إن NC-GRPO يحسن بشكل كبير التفكير الرياضي خارج المجال في خمسة معايير محتجزة، مع اختبار McNemar المجمع لـ p أقل من أو يساوي 0.001. كما يُبلغ عن تحسينات في المهمة داخل المجال وعلى قوة الهلوسة. يقول الملخص إن ضوضاء مساحة الصورة أنتجت متوسطًا أكبر لنتائج خارج النطاق على معايير ثقيلة الإدراك ولكنها تراجعت في قوة الهلوسة. تعزو عمليات الاستئصال الآلية التأثير إلى التنوع العشوائي المستقل بدلاً من مجرد مقدار أو اتجاه الضوضاء، في حين تحدد دراسة مقياس الضوضاء المفاضلة بين التخصص في التفكير والقدرة العامة.

تفاصيل المصدر: arxiv.org ↗

لماذا يهم

يتناول العمل مشكلة عملية في التعلم المعزز للنماذج متعددة الوسائط: كيفية إنتاج مسارات تفكير مرشحة متنوعة بما فيه الكفاية دون تشويه المدخلات البصرية. إذا تم تعميم النتائج المبلغ عنها، فإن تنويع الفضاء الكامن يمكن أن يوفر تغييرًا هندسيًا صغيرًا نسبيًا لتحسين نقل الاستدلال مع الحفاظ على المهمة الأصلية وإعداد المكافأة. تشير النتائج أيضًا إلى أن التدريب على التخصص الرياضي والقوة قد يتضمن مقايضة يمكن التحكم فيها بدلاً من مستوى ضوضاء مثالي عالميًا.

يعتبر البحث ذا صلة لأن التنوع في الطرح هو جزء من كيفية بحث التعلم المعزز عن سلوك أفضل. إذا اتبع كل مرشح في مجموعة التحسين نفس المسار الداخلي تقريبًا، فقد تقدم إشارة التدريب معلومات محدودة حول القرارات القوية. يختبر NC-GRPO ما إذا كان من الممكن إدخال التنوع داخل تمثيل النموذج مع ترك الصورة المرصودة والمكافأة الخارجية للمهمة دون تغيير. قد يكون هذا التمييز مهمًا بالنسبة لأنظمة لغة الرؤية، حيث قد يؤدي تغيير وحدات البكسل إلى إنشاء أعمال فنية أو تغيير المشكلة نفسها بدلاً من اختبار المرونة في التفكير.

من المحتمل أن يكون التباين المبلغ عنه مع اضطراب مساحة الصورة مفيدًا. يقول المؤلفون إن الضوضاء على مستوى البكسل كان أداؤها أفضل في المتوسط ​​بالنسبة لمعايير الإدراك الثقيلة خارج المجال، ولكنها أضرت بقوة الهلوسة، في حين حسّن NC-GRPO تلك القوة في تجربتهم. يشير هذا إلى مواقع اضطراب مختلفة تنتج قدرات مختلفة: قد تختبر تغييرات المدخلات التسامح البصري، في حين أن التغييرات الكامنة قد تشجع مسارات التفكير التي تظل مستقرة بعد الاختلاف الداخلي. لا يُظهر المصدر تفاصيل كافية لتحديد ما إذا كان هذا التفسير سببيًا يتجاوز اجتثاث المؤلفين.

تأتي الجاذبية العملية لهذه الطريقة من توافقها المزعوم مع إعداد RLVR الحالي. يقول الملخص إن إجراءات المكافأة والهدف والاستدلال لم تمس، وأن التنفيذ يتطلب ما يقرب من 50 سطرًا من تغييرات محرك الاستدلال. إذا تم إثبات هذه الادعاءات، فيمكن للباحثين تقييم التقنية دون إعادة تصميم حزمة التدريب الكاملة. هذا لا يعني أن النهج رخيص بشكل عام: فالمصدر لا يقدم ميزانية حسابية أو مدة تدريب أو تأثير الذاكرة أو قياس الإنتاجية. ولذلك فإن أهميتها العامة تعتمد على ما إذا كانت مكاسب الجودة المبلغ عنها تبرر أي تكلفة إضافية للتشغيل أو التحسين.

Interactive Mechanism

الآلية التفاعلية: كيف تعمل فعليًا

استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
التحقق من المفهوم التفاعلي+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

ماذا تشاهد بعد ذلك

الأسئلة الرئيسية المفتوحة هي ما إذا كانت المكاسب ستتحقق عبر المزيد من أحجام النماذج، والمهام المرئية، ومجموعات بيانات التدريب، وما إذا كانت ستنجو من التكرار المستقل. لا يوفر المصدر تغييرات دقيقة في الدقة أو أحجام مجموعات البيانات أو النتائج لكل معيار أو تكاليف الحوسبة أو تفاصيل التنفيذ الكاملة. كما أنها لا تحدد مدى توفر الإنتاج أو الموثوقية في العالم الحقيقي. يجب أن تختبر أعمال المتابعة ما إذا كانت الاضطرابات الكامنة تعمل على تحسين المهام بما يتجاوز الرياضيات وما إذا كانت فوائد الهلوسة المبلغ عنها تظل تحت صور غير مألوفة ومطالبات وظروف نشر.

تظل الأدلة مقتصرة على مصدر واحد وإعداد تدريب مسمى: Qwen2.5-VL-7B المدرب على Geometry3K. لا يحدد الملخص المعايير الخمسة المعتمدة، أو يبلغ عن درجاتها الفردية، أو يعطي أعدادًا للعينات، أو يذكر حجم التحسن في قوة الهلوسة. كما أنها لا توضح ما إذا كانت المقارنات استخدمت الحوسبة المتطابقة، أو نفس عدد عمليات الطرح أو جهد ضبط المعلمات الفائقة المتطابقة. هذه التفاصيل ضرورية للحكم على ما إذا كانت النتيجة تعكس طريقة مفيدة على نطاق واسع أو تكوينًا تجريبيًا مناسبًا.

يجب أن يفحص النسخ المتماثل مقياس النموذج وعائلة النموذج ونوع المهمة والطريقة. يصف المؤلفون NC-GRPO بأنه لا حيادي للطريقة، لكن المصدر لا يقدم أي تجربة توضح هذا الادعاء خارج إعداد لغة الرؤية المذكور. يمكن أن تشمل الاختبارات الإضافية المهام ذات الإدراك الثقيل، والتفكير البصري التركيبي، والأسئلة غير الرياضية، والمطالبات المصممة للحث على إجابات غير مدعومة. يجب على الباحثين أيضًا فصل المكاسب الناتجة عن الاضطراب نفسه عن المكاسب الناجمة عن أخذ عينات عشوائية إضافية أو اختلافات التدريب الأخرى.

إن نتيجة مقياس الضوضاء للورقة تجعل سلوك النشر أمرًا مجهولًا مهمًا. يصف الملخص العلاقة بين التخصص في الاستدلال والقدرة العامة، لكنه لا يحدد كيف ينبغي للممارسين اختيار هذا الإعداد أو مدى استقرار المقايضة بين المهام. لا توجد مطالبة بالنموذج الذي تم إصداره أو تكامل المنتج أو تقييم الإنتاج. يجب على القراء التعامل مع النتائج كنتيجة بحثية مبكرة من طبعة arXiv المسبقة حتى تتوفر المقاييس الدقيقة أو الكود أو تفاصيل التنفيذ والنسخ المتماثل المستقل.

الأدلة والاختبارات ذات الصلة

شرح نماذج الذكاء الاصطناعيتدريب الذكاء الاصطناعيالمحولاتChatGPT ونماذج اللغة الكبيرةاختبر ما تعرفه – جرّب اختبارًا مجانيًا للذكاء الاصطناعيابحث عن مصطلح الذكاء الاصطناعي في قاموسنااتبع أداة تعقب إصدار نموذج الذكاء الاصطناعي
وجدت هذا مفيدا؟