Apa yang berlaku
Pracetak arXiv memperkenalkan kaedah untuk menganggarkan tugas tempat kerja yang mungkin sesuai untuk AI, pekerja manusia atau kerjasama antara kedua-duanya. Ia membandingkan keupayaan AI dan keperluan kerja menggunakan set dimensi kognitif yang sama.
Kertas arXiv menerangkan masalah skop yang dihadapi oleh organisasi yang menggunakan AI: memutuskan tugas yang mungkin diautomasikan, yang harus kekal dengan orang ramai dan yang harus dikongsi. Penulis berpendapat bahawa skor penanda aras agregat kurang sesuai dengan keputusan ini kerana skor keseluruhan tunggal tidak menunjukkan jenis kerja yang dikendalikan oleh sistem AI dengan baik atau buruk. Mereka juga berpendapat bahawa pertimbangan manusia tentang keupayaan model boleh menjadi lapuk apabila sistem berubah.
Saluran paip yang dicadangkan menggunakan profil bersama keupayaan kognitif teras. Sistem AI diprofilkan dengan mengukur prestasinya pada bateri penanda aras yang item individunya diberi penjelasan untuk tuntutan kognitif yang terlibat. Tugas di tempat kerja diprofilkan secara berasingan dengan meminta pakar domain untuk menimbang kepentingan relatif keupayaan yang sama dalam kerja mereka. Oleh kerana kedua-dua pihak menggunakan set dimensi yang sama, kertas itu mengatakan profil model dan keperluan tugas boleh dikemas kini secara bebas dan kemudian digabungkan.
Penulis melaporkan tiga langkah pengesahan dalam abstrak. Mereka menguji sama ada kaedah itu boleh memulihkan profil keupayaan untuk ejen sintetik, memprofilkan enam sistem AI, dan mengumpul penilaian keperluan tugas daripada 410 pekerja merentas enam domain pekerjaan. Abstrak tidak mengenal pasti domain tersebut, menamakan sistem AI, menerangkan bateri penanda aras secara terperinci atau memberikan skor asas. Peninggalan tersebut mengehadkan apa yang boleh disimpulkan daripada sumber sahaja tentang liputan kajian dan hasil perbandingan.
Makalah itu melaporkan bahawa enam sistem AI lebih berbeza merentas dimensi kognitif individu berbanding merentasi keluarga model. Ia juga mengatakan bahawa aktiviti di tempat kerja tertumpu pada teras kognitif yang dikongsi. Markah yang terhasil dibentangkan sebagai alat skop perbandingan untuk memilih calon yang menjanjikan untuk projek perintis dan mengenal pasti kawasan di mana sistem semasa mungkin tidak sesuai. Penulis selanjutnya membincangkan meluaskan pendekatan untuk profil pekerja manusia bersama sistem AI, dengan matlamat jangka panjang untuk menyokong peruntukan tugas manusia-mesin.
Mengapa ia penting
Rangka kerja ini boleh memberi organisasi cara yang lebih khusus untuk merangkumi penggunaan AI daripada bergantung pada skor model yang luas atau pertimbangan tidak formal. Nilainya akan bergantung pada sama ada profil meramalkan prestasi di tempat kerja sebenar dan sama ada penilaian pakar menangkap dengan tepat tuntutan peranan tertentu.
Sumbangan praktikal adalah perubahan daripada bertanya sama ada model AI secara amnya mampu kepada bertanya sama ada corak keupayaannya sepadan dengan tugas tertentu. Model mungkin berprestasi kuat pada beberapa dimensi dan lemah pada yang lain, manakala kerja mungkin meletakkan berat yang sangat berbeza pada dimensi tersebut. Profil yang dikongsi boleh menjadikan ketidakpadanan itu kelihatan sebelum organisasi komited pada penempatan atau mereka bentuk semula peranan di sekitar sistem AI.
Pendekatan itu juga boleh meningkatkan kualiti percubaan tempat kerja peringkat awal. Daripada menganggap prestasi penanda aras tajuk utama model sebagai bukti bahawa ia bersedia untuk keseluruhan pekerjaan, majikan boleh menggunakan rangka kerja untuk mengenal pasti tugas yang lebih sempit untuk juruterbang yang diselia. Sumber membentangkan skor sebagai perbandingan dan sesuai untuk skop; ia tidak mendakwa bahawa mereka membuktikan sistem AI boleh dengan selamat atau berkesan melaksanakan kerja terpilih dalam pengeluaran.
Tinjauan pekerja berpotensi penting kerana ia cuba menghubungkan penilaian model dengan keperluan kerja sebenar merentas berbilang domain pekerjaan. Pada masa yang sama, abstrak tidak menerangkan bagaimana 410 peserta direkrut, bagaimana mereka mewakili, cara tugas dipilih, atau sama ada pekerja bersetuju antara satu sama lain tentang keupayaan yang diperlukan oleh kerja mereka. Butiran tersebut penting kerana pilihan pemberat tugasan boleh mengubah anggaran kesesuaian yang terhasil.
Cadangan kertas untuk memprofilkan manusia serta sistem AI menimbulkan persoalan tadbir urus yang lebih luas. Jika profil sedemikian digunakan untuk memperuntukkan tugas, mereka boleh menyokong pembahagian kerja yang lebih jelas, tetapi mereka juga boleh menukar anggaran keupayaan yang tidak pasti menjadi pertimbangan yang berisiko tinggi tentang pekerja. Sumber itu tidak menerangkan perlindungan, prosedur akauntabiliti, perlindungan privasi atau peraturan untuk mempertandingkan peruntukan. Itu adalah isu yang tidak dapat diselesaikan dan bukannya kesimpulan yang ditetapkan oleh pracetak.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Ujian seterusnya kertas itu ialah pengesahan praktikal: sama ada skor kesesuaiannya sepadan dengan hasil dalam juruterbang di tempat kerja secara langsung. Perkara yang tidak diketahui penting termasuk enam domain pekerjaan yang dikaji, tugas penanda aras yang digunakan, identiti dan prestasi enam sistem AI, dan cara rangka kerja mengendalikan perubahan aliran kerja, akauntabiliti dan pertimbangan manusia.
Tindakan susulan yang paling penting ialah bukti daripada penggunaan tempat kerja sebenar. Sumber melaporkan pengesahan ejen sintetik, enam profil sistem AI dan keperluan yang ditimbulkan daripada pekerja, tetapi ia tidak melaporkan ujian prospektif yang menunjukkan bahawa skor meramalkan prestasi tugas, kadar ralat, produktiviti atau hasil pekerja. Penilaian bebas akan membantu menentukan sama ada rangka kerja itu berguna di luar reka bentuk kajian pengarang.
Pembaca juga harus mencari perincian metodologi dalam kertas penuh: dimensi kognitif, pembinaan penanda aras, prosedur pemarkahan, identiti model, domain pekerjaan dan ketidakpastian di sekitar setiap anggaran. Tanpa maklumat itu, perbezaan yang dilaporkan antara sistem AI dan keluarga model tidak boleh dinilai secara bebas daripada abstrak sahaja.
Akhir sekali, rangka kerja itu perlu mengambil kira perubahan model dan menukar kerja. Pengarang mengatakan profil boleh dikemas kini secara bebas, yang boleh membantu masalah itu, tetapi sumber tidak menunjukkan kekerapan kemas kini diperlukan atau cara organisasi harus bertindak balas apabila keupayaan model, aliran kerja atau akibat kegagalan berubah. Sambungan peruntukan mesin manusia yang dicadangkan harus dinilai dengan teliti apabila keputusan mempengaruhi pekerjaan, keselamatan, akses kepada perkhidmatan atau tanggungjawab profesional.