ماذا حدث
أفاد MarkTechPost أن Generalist AI قد أصدر GEN-1.5، وهو نموذج أساسي للروبوت متعدد الوسائط يستخدم عرضًا حسيًا حركيًا مدته من 3 إلى 12 ثانية داخل نافذة سياق مدتها 30 ثانية لأداء مهمة مادية. يقول التقرير إن النموذج حقق متوسط نجاح بنسبة 59% عبر 10 مهام معالجة دون ضبط دقيق، ووصل إلى 83% بعد 10 خطوات متدرجة في خمس دقائق من بيانات المهمة. ولم يتم تأكيد هذه المزاعم بشكل مستقل من المصدر المقدم.
يفيد MarkTechPost أن GEN-1.5 الخاص بـ Generalist AI يقبل الفيديو وأجهزة الاستشعار واللغة ومدخلات التحسس، ويحتفظ بنافذة سياق مدتها 30 ثانية، ويصدر مسارات عمل عند 100 هرتز. تضع الآلية المركزية، التي تسميها الشركة "التحفيز الجسدي"، مثالًا حسيًا قصيرًا في هذا السياق. يمكن أن يتضمن المثال تدفقات الكاميرا وأجهزة الاستشعار إلى جانب مسار العمل الموضح. وفقًا لـ MarkTechPost، يستنتج النموذج بعد ذلك المهمة المقصودة من العرض التوضيحي ويعمل بدون تعليمات لغة، أو تحديث متدرج، أو خطوة ضبط دقيقة، أو برنامج خاص بالمهمة. يقول التقرير إن النموذج تم تدريبه مسبقًا بشكل مستمر لأكثر من ثمانية أشهر على بيانات التفاعل الجسدي التي تم التقاطها في المنازل والمستودعات والمصانع.
تشير MarkTechPost إلى متوسط معدل نجاح يبلغ 59%، مع انحراف معياري قدره 10 نقاط مئوية، عبر 10 مهام معالجة متنوعة عندما تلقى النموذج المُدرب مسبقًا عرضًا توضيحيًا واحدًا. تقول المقالة أن 10 خطوات متدرجة باستخدام خمس دقائق من البيانات لكل مهمة رفعت متوسط النجاح إلى 83%، مع انحراف معياري قدره 9 نقاط مئوية. وتشير أيضًا إلى أن خطوة متدرجة واحدة باستخدام دقيقة واحدة من البيانات وصلت إلى 66.5% في مهمة مؤجلة. تصف المقالة هذه النتائج بأنها نموذج منخفض البيانات للتدريب في وقت الاختبار وتقول إن تغيرات الوزن المُبلغ عنها بعد 10 خطوات كانت أقل من 0.15٪. لا يوفر المصدر المقدم قائمة المهام، أو أعداد العينات، أو تفاصيل الأجهزة، أو تعريفات خط الأساس، أو بروتوكول التقييم الكامل اللازم لتقييم هذه الأرقام بشكل مستقل.
يصف التقرير العديد من سلوكيات النقل التي يعزوها MarkTechPost إلى تقييم Generalist AI. يمكن ربط اثنين من المطالبات المسجلة بشكل مستقل في سلوك واحد مستمر، حيث يقوم النموذج بتوليد حركات متداخلة مثل إعادة التموضع، وإعادة الفهم، واستعادة الأخطاء. تم نقل العرض التوضيحي المسجل في المحاكاة إلى روبوت حقيقي على الرغم من أن بيانات التدريب المسبق لا تحتوي على فيديو أو ديناميكيات محاكاة. ويصف المقال أيضًا العروض التوضيحية التي يتم إجراؤها بأيدي الشخص أمام كاميرات الروبوت، يليها الاستنساخ باستخدام أيدي الروبوت. بعد ضبط الضوء، يقول MarkTechPost إن النظام يمكنه استخدام موزة كفرشاة، واستخدام مجرفة لتحريك كتلة، وإزالة الورق الذي يغطي الوعاء، والعمل بشكل يمكن استخدامه بكلتا اليدين. ويقول التقرير أيضًا إن السلوكيات المدفوعة تظل أكثر هشاشة من السلوكيات المضبوطة بدقة.
تفاصيل المصدر: marktechpost.com ↗
لماذا يهم
يصف التقرير تحولًا مهمًا محتملاً في تكيف الروبوتات: يمكن أن تكون العروض التوضيحية بمثابة مطالبات في السياق بدلاً من أن تتطلب تدريبًا مكثفًا خاصًا بالمهمة. إذا تجاوزت النتائج التقييم المحدود للشركة، فيمكنها تقليل عبء البيانات والهندسة الذي ينطوي عليه تعليم الروبوتات سلوكيات جديدة. لا تزال الأدلة مبكرة، وكانت المهام بسيطة، وقصيرة الأفق، ولم يتم التحقق من صحتها بشكل مستقل.
تكمن الأهمية العملية للتقرير في أنه يضع تعلم الروبوت كمشكلة سياقية بالإضافة إلى مشكلة تحديث الوزن. يمكن أن يتطلب التكيف التقليدي للمهام جمع البيانات وتنفيذ العديد من خطوات التحسين لكل سلوك جديد. تفيد تقارير MarkTechPost أن GEN-1.5 يمكنه استخدام عرض توضيحي قصير على الفور، بينما يعمل قدر صغير من التدريب الإضافي على تحسين الأداء بشكل كبير. بالنسبة لمشغلي الروبوتات، قد يسهل ذلك في النهاية تكييف نظام للأغراض العامة مع تغيير الكائنات أو التخطيطات أو الإجراءات دون بناء سياسة منفصلة لكل مهمة. وتظل هذه نتيجة بحثية تم الإبلاغ عنها، وليست دليلاً على أن هذا النهج جاهز للاستخدام الصناعي الروتيني.
إن أمثلة النقل المبلغ عنها مهمة لأنها تختبر أكثر من مجرد النسخ المباشر. يقول MarkTechPost إن النموذج أنتج حركات ربط بين العروض التوضيحية المنفصلة، وانتقل من العروض التوضيحية المحاكاة إلى التنفيذ الجسدي، وقام بتكييف العروض البشرية مع عمل الروبوت. إذا تم إعادة إنتاج هذه السلوكيات، فإنها تشير إلى أن النموذج قد تعلم انتظامات فيزيائية واسعة النطاق بدلاً من حفظ مسار ثابت واحد فقط. ومع ذلك، لا يحدد المصدر عدد المرات التي نجحت فيها عمليات النقل هذه، أو مقدار التدخل البشري المسموح به، أو ما إذا كانت الشركة قد اختارت العروض التوضيحية وبيئات الاختبار. وبالتالي فإن الأمثلة المذكورة تشير إلى اتجاه بحثي وليس ضمانًا مُقاسًا للاستدلال المادي للأغراض العامة.
تسلط النتائج الضوء أيضًا على التمييز بين القدرة والتوافر. أفاد MarkTechPost أن GEN-1.5 هو إصدار بحثي يتم تشغيله على أسطول الروبوتات ومحرك البيانات الخاص بشركة Generalist AI. يُقال إنه لا توجد أوزان عامة، أو واجهة برمجة تطبيقات، أو صفحة تسعير، أو منتج للخدمة الذاتية، ويجب على المستخدمين المحتملين متابعة شراكة مباشرة. وهذا يحد من التكرار المستقل ويجعل من الصعب على المنظمات الخارجية مقارنة النموذج بأنظمة التعلم الآلي الأخرى. وهذا يعني أيضًا أن التأثير العام المباشر هو علمي واستراتيجي في المقام الأول: قد يؤثر العمل على كيفية تصميم الباحثين لنماذج الروبوتات متعددة الوسائط، لكن القراء لا يستطيعون بعد اختبار النظام بشكل مباشر أو تقييم تكلفته أو موثوقيته أو متطلباته التشغيلية.
الآلية التفاعلية: كيف تعمل فعليًا
استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.
Which component of an AI application is the machine-learning model itself?
ماذا تشاهد بعد ذلك
الأسئلة الرئيسية هي ما إذا كان GEN-1.5 يعمم بما يتجاوز المهام المبلغ عنها، وكيفية أدائه في ظل ظروف حرجة تتعلق بالسلامة أو غير مألوفة، وما إذا كان يمكن إعادة إنتاج النتائج خارج أسطول Generalist AI والبنية التحتية للبيانات. تشير MarkTechPost إلى أن النظام لا يحتوي على أوزان عامة أو واجهة برمجة تطبيقات (API) أو تسعير أو وصول للخدمة الذاتية، لذلك يظل الاختبار المستقل والنشر العملي غير متاحين.
الأولوية الأولى هي التحقق المستقل. لا يقدم تقرير MarkTechPost هويات المهام العشر، أو عدد التجارب لكل مهمة، أو فئات الفشل، أو فترات الثقة، أو أنظمة المقارنة، أو المنصات المادية المستخدمة. هذه التفاصيل ضرورية لتفسير المتوسطين المذكورين بنسبة 59% و83%. يجب أن تختبر تقييمات المتابعة الكائنات الجديدة، وتخطيطات الإضاءة ومساحة العمل المختلفة، وتسلسلات المهام الأطول، والعروض التوضيحية التي يسجلها الأشخاص أو الروبوتات خارج خط بيانات Generalist AI. من شأن الاستنساخ من قبل باحثين مستقلين أن يساعد في تحديد ما إذا كانت القدرة المبلغ عنها هي خاصية واسعة للنموذج أو نتيجة حساسة لخيارات المجموعة والتقييم الخاصة بالشركة.
السلامة والمتانة مجال آخر لم يتم حله. يشير MarkTechPost إلى أن النموذج يعمل بحلقة مغلقة، ويمكنه تحمل بعض الاضطرابات، والتعافي من الأخطاء، والارتجال، بينما يظل أيضًا أكثر هشاشة من الإصدارات المضبوطة بدقة. لا يصف المصدر معدلات الاصطدام، أو حدود القوة، أو التوقف في حالات الطوارئ، أو حالات الفشل التي تشمل الأشخاص، أو الأداء في البيئات المزدحمة والتي لا يمكن التنبؤ بها. قبل النشر في المنازل أو المستودعات أو المصانع، سيحتاج المقيِّمون إلى أدلة حول ما يحدث عندما يكون العرض التوضيحي غامضًا، أو يكون الكائن مفقودًا، أو يفقد الروبوت مسار المهمة، أو قد يتسبب خطأ ما في حدوث إصابة أو ضرر. لا يقدم التقرير أي دليل على أن GEN-1.5 قد تم تقييمه لهذه الظروف.
سيحدد الوصول والحوكمة ما إذا كان البحث مفيدًا من الناحية العملية. تشير MarkTechPost إلى أن Generalist AI لم يصدر أوزانًا أو واجهة برمجة تطبيقات أو تسعيرًا أو منتجًا للخدمة الذاتية، مما يترك النظام متاحًا فقط من خلال الشراكات المباشرة. ويجب أن توضح التحديثات المستقبلية ما إذا كان الباحثون الخارجيون سيحصلون على حق الوصول إلى التقييم، وما هي قيود إدارة البيانات التي تنطبق على تسجيلات التفاعل الجسدي، وما إذا كان من الممكن تدقيق النموذج دون الكشف عن لقطات حساسة من المنازل أو أماكن العمل. سيكون من المهم أيضًا معرفة ما إذا كان التكيف المزعوم للبيانات المنخفضة ينطبق على نطاق أوسع وعبر المهام التي تتطلب تخطيطًا مستدامًا. وإلى أن تتم الإجابة على هذه الأسئلة، ينبغي التعامل مع GEN-1.5 كإشارة بحثية مبكرة وليس كنظام روبوتي للأغراض العامة قابل للنشر.