ماذا حدث
نشرت MIT Technology Review ميزة تفاعلية تتمحور حول سبعة ألغاز تستكشف كيفية تفكير نماذج الذكاء الاصطناعي. تشير المقالة إلى أن النماذج قد تحسنت بسرعة في بعض المهام ولكنها لا تزال تعاني من التلاعب المكاني، والاختلافات الدقيقة في المشكلات المألوفة، والتجريد البصري، والتفكير متعدد الخطوات المعقد بشكل متزايد.
تشير تقارير MIT Technology Review إلى أن ميزتها تقدم سبعة اختبارات تغطي التفكير المكاني، والذاكرة والقدرة على التكيف، والتفكير المجرد والبصري، والحدس البشري، والتعقيد المتزايد. تضع المقالة حل الألغاز ضمن التاريخ الأطول لتقييم الذكاء الاصطناعي، مع الإشارة إلى أن ألعابًا مثل لعبة الداما والشطرنج ولعبة Go قد تم استخدامها كأساس اختبار منذ السنوات الأولى لهذا المجال. وتقول إن أداء الألغاز قد تحسن بشكل كبير: وجد فريق من جامعة كولومبيا في أواخر عام 2024 أن النماذج الرائدة حلت 18٪ فقط من ألغاز New York Times Connections، بينما بحلول أوائل عام 2025، تمكنت بعض النماذج من حلها بشكل مثالي تقريبًا في كل مرة. لا يحدد المصدر النماذج أو يقدم مقارنة موحدة عبر الأمثلة الموجودة في الميزة.
يقول معهد ماساتشوستس للتكنولوجيا MIT Technology Review إن الاستدلال المكاني لا يزال يشكل نقطة ضعف كبيرة. ويطلب قسم التدوير الذهني من القراء تحديد كائن ثلاثي الأبعاد يظهر من زاوية أخرى، وتشير المقالة إلى أن النماذج اللغوية ذات إمكانات الإدخال المرئي لا تزال تؤدي أداءً سيئًا للغاية في مثل هذه المهام. تربط هذه الميزة هذه الصعوبة بالادعاءات المتعلقة بنماذج العالم النامية لأنظمة الذكاء الاصطناعي، بحجة أن نماذج اللغات الكبيرة الحالية لا يبدو أنها تتعامل مع الكائنات ثلاثية الأبعاد بنفس الطريقة التي قد يفعلها المتخصصون المكانيون من البشر. تصف المقالة أيضًا مشكلة الذاكرة والقدرة على التكيف: فالنماذج المدربة على كميات كبيرة من المعلومات قد تتعرف على نمط ألغاز مألوف وتتجاهل تغييرًا بسيطًا. يستشهد بدراسة Google وجامعة إلينوي أوربانا شامبين لعام 2024 تتضمن أشكالًا مختلفة من ألغاز Knights and Knaves كدليل على هذا القلق.
تتحول الميزة بعد ذلك إلى التجريد ثنائي الأبعاد والتفكير البصري. تشير تقارير MIT Technology Review إلى أن النماذج تؤدي أداءً أفضل في ألغاز ARC-AGI عندما يتم توفير الشبكات كسلاسل رقمية تشفر ألوان الخلايا بدلاً من الصور. وتقول أيضًا إن الأبحاث وجدت أن النماذج يمكنها أحيانًا الوصول إلى الإجابة الصحيحة من خلال قواعد معقدة وغير قابلة للتعميم، بينما قد يعتمد البشر على مفاهيم بصرية أبسط. تعرض المقالة أسئلة SimpleBench، ومسائل Knights and Knaves، وألغاز تحويل ARC-AGI كأمثلة للمهام التي يمكن أن تكشف هذه الاختلافات.
It separately describes intuition tests in which people often give rapid but incorrect answers, while models may respond more deliberately. يتساءل أحد الأمثلة عن المدة التي سيستغرقها الكهف ليصبح نصف ممتلئ عندما يتضاعف عدد الخفافيش يوميًا؛ ويطلب آخر من القراء تحديد شخصية مرتبطة بأليس.
أخيرًا، تشير تقارير MIT Technology Review إلى أن الأداء غالبًا ما يتدهور عندما تصبح المشكلات أكثر تعقيدًا. ويستشهد بدراسة Apple التي وجدت أن النماذج اللغوية يمكن أن تحل إصدارات بسيطة من برج هانوي ومشكلات عبور النهر ولكنها بدأت تتعثر عندما يصل عدد الأقراص أو الأشخاص إلى ستة أو أكثر. ويستشهد أيضًا بالعمل الذي قام به باحثون في جامعة واشنطن، وجامعة ستانفورد، ومعهد ألين، حيث وجدوا صعوبات مماثلة في ألغاز الشبكة المنطقية. تشير الميزة إلى أن المعلقين تساءلوا عما إذا كانت هذه النتائج تكشف عن قيود تفكير تشبه الآلة بشكل فريد أو تعكس ببساطة حقيقة أن الأشخاص يرتكبون أيضًا المزيد من الأخطاء مع زيادة التعقيد. ومن ثم فإن أمثلة عبور النهر والشبكة المنطقية لا تختبر فقط ما إذا كان النموذج قادرًا على تقديم إجابة، بل ما إذا كان يمكنه الحفاظ على القيود عبر استنتاجات متعددة متصلة.
تفاصيل المصدر: technologyreview.com ↗
لماذا يهم
توضح هذه الميزة لماذا يمكن أن تكون الادعاءات العامة حول ذكاء الذكاء الاصطناعي مضللة. قد يكون أداء النموذج جيدًا في الأمور التافهة أو المعيار المألوف بينما يفشل في إجراء تغيير بسيط في الصياغة أو التحول البصري أو مشكلة تتطلب عدة خطوات تابعة. هذه الاختلافات مهمة عندما يتم استخدام الأنظمة لاتخاذ القرارات بدلاً من الإثباتات.
الدرس الرئيسي هو أن الأداء في فئة واحدة من الاختبارات لا ينبغي أن يعامل كمقياس عام للذكاء. تشمل أمثلة MIT Technology Review المهام التي تبدو بسيطة ظاهريًا ولكنها تتطلب قدرات مختلفة: تدوير كائن عقليًا، أو تتبع الحقيقة والباطل عبر البيانات، أو استنتاج قاعدة بصرية، أو مقاومة الحدس المضلل، أو التخطيط لتسلسل تحت قيود. يمكن أن يكون النظام قويًا بشكل غير عادي في منطقة واحدة وغير موثوق به في منطقة أخرى. يكون هذا التفاوت ذا أهمية خاصة عندما يفسر المستخدمون الإجابات بطلاقة كدليل على أن النموذج قد فهم المشكلة الأساسية.
تسلط المقالة الضوء أيضًا على مشكلة التقييم: يمكن أن يؤثر تنسيق المهمة بشكل مادي على النتيجة. تشير تقارير MIT Technology Review إلى أن أداء ARC-AGI يتحسن عندما يتم تحويل الشبكات المرئية إلى تمثيلات رقمية. يشير هذا إلى أن النتيجة قد لا تعكس فقط قدرة النموذج على الاستدلال ولكن أيضًا الطريقة التي يتم بها ترميز المشكلة وعرضها. The same concern applies to familiar puzzles. إذا واجه النموذج متغيرًا قريبًا أثناء التدريب، فقد تعكس الإجابة الصحيحة التعرف على الأنماط أو استرجاعها بدلاً من القدرة على تكييف القاعدة مع حالة جديدة. لا يحدد المصدر مدى تكرار حدوث أي من الآليتين عبر الأنظمة المنشورة.
هذه القيود لها آثار عملية على أي شخص يستخدم الذكاء الاصطناعي في التعليم أو البرامج أو البحث أو الإدارة أو غيرها من الإعدادات التي تنطوي على حالات غير مألوفة. قد يظل النموذج الذي ينجح في الأمثلة الروتينية يفشل عندما تتغير الصياغة، أو تتفاعل عدة قيود، أو تكون المعلومات ذات الصلة مرئية وليست نصية. ولا تُبلغ هذه الميزة عن إطلاق منتج جديد، أو إصدار نموذج جديد، أو تقييم خاضع للرقابة لنظام تجاري محدد. قيمته توضيحية: فهو يمنح القراء طرقًا ملموسة لمعرفة السبب في أن المكاسب المعيارية واللغة المصقولة لا تنشئ في حد ذاتها تفكيرًا قويًا. تحتفظ المقالة أيضًا بمؤهل مهم: البشر لديهم تحيزاتهم الخاصة ويمكن أن يكونوا أبطأ أو أقل موثوقية في بعض المشكلات.
الآلية التفاعلية: كيف تعمل فعليًا
استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.
Which component of an AI application is the machine-learning model itself?
ماذا تشاهد بعد ذلك
ستحتاج التقييمات المستقبلية إلى اختبار ما هو أكثر من النتائج الرئيسية. تتضمن الأسئلة المهمة ما إذا كانت النماذج يمكنها التعميم على المشكلات غير المألوفة، وما إذا كانت إجاباتها تعتمد على كيفية تمثيل المعلومات، وكيف يتغير الأداء مع ارتفاع التعقيد، وما إذا كان النجاح يعكس استراتيجية قابلة لإعادة الاستخدام أو أنماطًا محفوظة.
سيكون التطور المفيد التالي هو إجراء اختبارات أوسع نطاقًا وقابلة للتكرار عبر النماذج وتنسيقات المهام. لا توفر ميزة MIT Technology Review بطاقة أداء واحدة تغطي جميع الاختبارات السبعة، ولا يحدد المصدر أسماء النماذج، أو الإصدارات، أو أحجام العينات، أو شروط المطالبة، أو معدلات الخطأ لمعظم الأمثلة. ستكون هذه التفاصيل ضرورية لتحديد ما إذا كانت نقاط الضعف المبلغ عنها منتشرة على نطاق واسع، أو مركزة في عائلات نموذجية معينة، أو حساسة لكيفية إدارة الاختبارات.
يجب أن تفصل التقييمات المستقلة أيضًا حالات فشل الإدراك البصري عن حالات فشل الاستدلال عن طريق الحفاظ على ثبات اللغز الأساسي مع تغيير تمثيله. ويجب على الباحثين والمقيمين أيضًا مراقبة ما إذا كانت النماذج تتحسن من خلال التعميم الحقيقي أو من خلال التعرض بشكل أكبر لمواد تشبه المعايير. توضح مناقشة المقالة لألغاز Connections واختلافات Knights and Knaves سبب أهمية التلوث والألفة. النموذج الذي يؤدي أداءً جيدًا في الأسئلة المنشورة أو ذات الصلة الوثيقة قد لا يكون قادرًا بنفس القدر على حل المشكلات التي تم إنشاؤها حديثًا والتي لها نفس البنية الأساسية. ولذلك يجب أن يشمل الاختبار الألغاز المعلقة، والصياغة المتغيرة، والتخطيطات المرئية غير المألوفة، والمهام التي تتطلب شرح أو التحقق من القيود المتوسطة دون افتراض أن الإجابة المقنعة صحيحة.
يظل التعقيد والنقل في العالم الحقيقي من الأسئلة المفتوحة. تشير تقارير MIT Technology Review إلى أن الأداء يمكن أن ينهار مع زيادة عدد العناصر أو الخطوات المطلوبة، لكن المصدر لا يحدد كيفية ترجمة هذه النتائج إلى أنظمة عملية باستخدام الأدوات، أو الاسترجاع، أو الذاكرة الخارجية، أو الإشراف البشري. يجب أن تتتبع التقارير المستقبلية ما إذا كانت هذه الإضافات تعمل على تحسين الموثوقية، أو مجرد مساعدة النماذج في البحث بشكل أكثر فعالية، أو تقديم أوضاع فشل جديدة. وينبغي للقراء أيضاً أن ينتبهوا إلى التقييمات التي تقيس جودة الاستراتيجية، وليس فقط الإجابة النهائية، لأن النتيجة الصحيحة التي يتم التوصل إليها من خلال قاعدة هشة أو غير قابلة للتعميم قد لا تنجو من تغيير بسيط في المشكلة.