ماذا حدث
تقدم النسخة الأولية من arXiv طريقة لتقدير مهام مكان العمل التي قد تكون مناسبة للذكاء الاصطناعي أو العاملين من البشر أو التعاون بين الاثنين. فهو يقارن قدرات الذكاء الاصطناعي ومتطلبات الوظيفة باستخدام نفس مجموعة الأبعاد المعرفية.
تصف ورقة arXiv مشكلة تحديد النطاق التي تواجهها المؤسسات التي تستخدم الذكاء الاصطناعي: تحديد المهام التي يمكن أتمتتها، والتي يجب أن تظل مع الأشخاص، وأيها يجب مشاركتها. يجادل المؤلفون بأن الدرجات المعيارية الإجمالية غير مناسبة لهذا القرار لأن النتيجة الإجمالية الواحدة لا تظهر أنواع العمل الذي يتعامل معه نظام الذكاء الاصطناعي بشكل جيد أو سيئ. ويجادلون أيضًا بأن الأحكام البشرية حول قدرات النموذج يمكن أن تصبح قديمة مع تغير الأنظمة.
يستخدم خط الأنابيب المقترح ملفًا مشتركًا للقدرات المعرفية الأساسية. يتم تعريف أنظمة الذكاء الاصطناعي من خلال قياس أدائها على بطارية معيارية يتم شرح عناصرها الفردية وفقًا للمتطلبات المعرفية التي تنطوي عليها. يتم تحديد مهام مكان العمل بشكل منفصل من خلال مطالبة خبراء المجال بتقييم الأهمية النسبية لتلك القدرات نفسها في عملهم. نظرًا لأن كلا الجانبين يستخدمان مجموعة مشتركة من الأبعاد، تقول الورقة إنه يمكن تحديث ملفات تعريف النماذج ومتطلبات المهام بشكل مستقل ثم دمجها.
تقرير المؤلفين ثلاث خطوات التحقق من الصحة في الملخص. إنهم يختبرون ما إذا كانت الطريقة يمكنها استعادة ملفات تعريف القدرات للعوامل الاصطناعية، وتعريف ستة أنظمة للذكاء الاصطناعي، وجمع تقييمات متطلبات المهام من 410 موظفًا عبر ستة مجالات مهنية. ولا يحدد الملخص تلك المجالات، أو يسمي أنظمة الذكاء الاصطناعي، أو يصف البطارية المرجعية بالتفصيل، أو يقدم النتائج الأساسية. إن هذه الإغفالات تحد مما يمكن استخلاصه من المصدر وحده حول تغطية الدراسة ونتائجها المقارنة.
تشير الورقة إلى أن أنظمة الذكاء الاصطناعي الستة تختلف بشكل أكبر عبر الأبعاد المعرفية الفردية مقارنة بالعائلات النموذجية. وتقول أيضًا أن أنشطة مكان العمل تتقارب على جوهر معرفي مشترك. يتم تقديم النتائج الناتجة كأداة تحديد نطاق مقارنة لاختيار المرشحين الواعدين للمشاريع التجريبية وتحديد المجالات التي من غير المرجح أن تكون فيها الأنظمة الحالية مناسبة تمامًا. يناقش المؤلفون كذلك توسيع النهج ليشمل العاملين من البشر جنبًا إلى جنب مع أنظمة الذكاء الاصطناعي، بهدف طويل المدى يتمثل في دعم توزيع المهام بين الإنسان والآلة.
لماذا يهم
يمكن أن يمنح الإطار المؤسسات طريقة أكثر تحديدًا لتحديد نطاق عمليات نشر الذكاء الاصطناعي بدلاً من الاعتماد على نتائج النماذج الواسعة أو الأحكام غير الرسمية. وستعتمد قيمته على ما إذا كانت الملفات الشخصية تتنبأ بالأداء في أماكن العمل الحقيقية وما إذا كانت تقييمات الخبراء تلتقط بدقة متطلبات أدوار معينة.
تتمثل المساهمة العملية في التحول من التساؤل عما إذا كان نموذج الذكاء الاصطناعي قادرًا بشكل عام على التساؤل عما إذا كان نمط قدرته يتطابق مع واجب معين. قد يكون أداء النموذج قويًا في بعض الأبعاد وضعيفًا في أبعاد أخرى، في حين أن الوظيفة قد تضع وزنًا مختلفًا جدًا على تلك الأبعاد. يمكن لملف التعريف المشترك أن يجعل عدم التطابق هذا مرئيًا قبل أن تلتزم المؤسسة بالنشر أو إعادة تصميم دور حول نظام الذكاء الاصطناعي.
ويمكن لهذا النهج أيضًا أن يحسن جودة التجارب المبكرة في مكان العمل. وبدلاً من التعامل مع الأداء المعياري الرئيسي للنموذج كدليل على أنه جاهز لوظيفة كاملة، يمكن لأصحاب العمل استخدام الإطار لتحديد المهام الأضيق للطيارين الخاضعين للإشراف. يعرض المصدر الدرجات على أنها مقارنة ومناسبة لتحديد النطاق؛ ولا تدعي أنها تثبت أن نظام الذكاء الاصطناعي يمكنه أداء العمل المحدد في الإنتاج بأمان أو بفعالية.
من المحتمل أن يكون استبيان الموظفين مهمًا لأنه يحاول ربط تقييم النموذج بمتطلبات العمل الفعلي عبر مجالات مهنية متعددة. وفي الوقت نفسه، لا يشرح الملخص كيف تم تعيين المشاركين البالغ عددهم 410، أو مدى تمثيلهم، أو كيفية اختيار المهام، أو ما إذا كان الموظفون قد اتفقوا مع بعضهم البعض حول القدرات التي يتطلبها عملهم. هذه التفاصيل مهمة لأن اختيارات ترجيح المهام يمكن أن تغير تقديرات الملاءمة الناتجة.
يثير اقتراح البحث لتعريف البشر وأنظمة الذكاء الاصطناعي مسألة حوكمة أوسع نطاقًا. إذا تم استخدام مثل هذه الملفات لتخصيص الواجبات، فإنها يمكن أن تدعم تقسيما أكثر وضوحا للعمل، ولكنها يمكن أيضا أن تحول تقديرات القدرات غير المؤكدة إلى أحكام عالية المخاطر حول العمال. ولا يصف المصدر الضمانات أو إجراءات المساءلة أو حماية الخصوصية أو قواعد الاعتراض على التخصيص. هذه هي القضايا التي لم يتم حلها بدلا من الاستنتاجات التي وضعتها النسخة الأولية.
الآلية التفاعلية: كيف تعمل فعليًا
استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
ماذا تشاهد بعد ذلك
الاختبار التالي للورقة هو التحقق العملي: ما إذا كانت درجات ملاءمتها تتوافق مع نتائج الطيارين في أماكن العمل الحية. تشمل الأمور المجهولة المهمة المجالات المهنية الستة التي تمت دراستها، والمهام المعيارية المستخدمة، وهوية وأداء أنظمة الذكاء الاصطناعي الستة، وكيفية تعامل الإطار مع تدفقات العمل المتغيرة، والمساءلة، والحكم البشري.
المتابعة الأكثر أهمية هي الأدلة من الاستخدام الحقيقي في مكان العمل. يشير المصدر إلى التحقق من صحة العامل الاصطناعي، وستة ملفات تعريف لنظام الذكاء الاصطناعي، والمتطلبات المستمدة من الموظفين، لكنه لا يذكر اختبارًا محتملاً يوضح أن الدرجات تتنبأ بأداء المهام، أو معدلات الخطأ، أو الإنتاجية، أو نتائج العمال. من شأن التقييمات المستقلة أن تساعد في تحديد ما إذا كان الإطار مفيدًا خارج نطاق تصميم دراسة المؤلفين.
يجب على القراء أيضًا البحث عن التفاصيل المنهجية في الورقة الكاملة: الأبعاد المعرفية، وبناء المعايير، وإجراءات التسجيل، والهويات النموذجية، والمجالات المهنية، وعدم اليقين بشأن كل تقدير. وبدون هذه المعلومات، لا يمكن تقييم الاختلافات المبلغ عنها بين أنظمة الذكاء الاصطناعي والعائلات النموذجية بشكل مستقل من الملخص وحده.
وأخيرًا، يجب أن يأخذ الإطار في الاعتبار النماذج المتغيرة والوظائف المتغيرة. يقول المؤلفون إنه يمكن تحديث الملفات الشخصية بشكل مستقل، مما قد يساعد في حل هذه المشكلة، لكن المصدر لا يوضح عدد المرات التي تكون فيها التحديثات مطلوبة أو كيف يجب أن تستجيب المؤسسات عندما تتغير قدرات النموذج أو سير العمل أو عواقب الفشل. وينبغي تقييم التمديد المقترح لتخصيص الإنسان والآلة بعناية خاصة عندما تؤثر القرارات على التوظيف، أو السلامة، أو الوصول إلى الخدمات، أو المسؤولية المهنية.