Що сталося
Препринт arXiv представляє метод для оцінки того, які робочі завдання можуть бути придатними для штучного інтелекту, людей або співпраці між ними. Він порівнює можливості штучного інтелекту та вимоги до роботи, використовуючи той самий набір когнітивних параметрів.
Документ arXiv описує проблему визначення обсягу, з якою стикаються організації, що розгортають штучний інтелект: вирішити, які завдання можуть бути автоматизовані, які мають залишатися для людей, а які мають бути спільними. Автори стверджують, що сукупні показники тестів погано підходять для цього рішення, оскільки один загальний бал не показує види роботи, з якими система ШІ справляється добре чи погано. Вони також стверджують, що людські судження про можливості моделі можуть застаріти у міру зміни систем.
Запропонований конвеєр використовує спільний профіль основних когнітивних можливостей. Системи штучного інтелекту профілюються шляхом вимірювання їх продуктивності за допомогою еталонної батареї, окремі елементи якої анотовані для когнітивних вимог, які вони включають. Завдання на робочому місці профілюються окремо, просячи експертів у галузі зважити відносну важливість тих самих можливостей у їхній роботі. Оскільки обидві сторони використовують загальний набір параметрів, у документі сказано, що профілі моделей і вимоги до завдань можна оновлювати незалежно, а потім комбінувати.
Автори описують три етапи перевірки в анотації. Вони перевіряють, чи може цей метод відновити профілі можливостей для синтетичних агентів, профіль шести систем штучного інтелекту та зібрати оцінки вимог до завдань від 410 співробітників у шести сферах діяльності. Анотація не визначає ці домени, не називає системи штучного інтелекту, не описує детально еталонну батарею та не надає базові бали. Ці упущення обмежують те, що можна зробити лише з джерела щодо охоплення дослідження та порівняльних результатів.
У документі повідомляється, що шість систем штучного інтелекту відрізнялися більше за окремими когнітивними параметрами, ніж за сімействами моделей. У ньому також сказано, що діяльність на робочому місці об’єдналася в спільне когнітивне ядро. Отримані бали представлені як порівняльний інструмент для відбору перспективних кандидатів для пілотних проектів і визначення сфер, де поточні системи навряд чи підійдуть. Далі автори обговорюють розширення підходу до профільних робітників разом із системами штучного інтелекту з довгостроковою метою підтримки розподілу завдань між людиною та машиною.
Чому це важливо
Структура може дати організаціям більш конкретний спосіб охоплення розгортання штучного інтелекту, ніж покладатися на широкі оцінки моделі чи неофіційні судження. Його значення залежатиме від того, чи прогнозують профілі продуктивність на реальних робочих місцях і чи точно оцінки експертів відображають вимоги до конкретних ролей.
Практичний внесок полягає в переході від питання про те, чи загалом здатна модель штучного інтелекту, до питання про те, чи модель її можливостей відповідає певному обов’язку. Модель може мати високі показники в одних параметрах і слабко в інших, тоді як робота може надавати дуже різну вагу цим параметрам. Спільний профіль може зробити цю невідповідність видимою до того, як організація прийме на себе зобов’язання щодо розгортання або змінить роль навколо системи ШІ.
Такий підхід може також покращити якість експериментів на робочому місці на ранніх стадіях. Замість того, щоб розглядати заголовний еталонний показник моделі як доказ того, що вона готова до цілої професії, роботодавці можуть використовувати структуру для визначення більш вузьких завдань для підконтрольних пілотів. Джерело представляє бали як порівняльні та придатні для визначення обсягу; він не стверджує, що вони доводять, що система штучного інтелекту може безпечно або ефективно виконувати вибрану роботу у виробництві.
Опитування працівників є потенційно важливим, оскільки воно намагається пов’язати модельну оцінку з вимогами фактичної роботи в багатьох професійних сферах. При цьому в анотації не пояснюється, як набиралися 410 учасників, наскільки вони були репрезентативними, як відбиралися завдання, чи погоджувалися співробітники між собою щодо здібностей, які вимагає їх робота. Ці деталі важливі, оскільки вибір ваги завдання може змінити кінцеві оцінки придатності.
Пропозиція в документі профілювати людей, а також системи ШІ піднімає ширше питання управління. Якщо такі профілі використовувати для розподілу обов’язків, вони могли б сприяти більш чіткому розподілу праці, але вони також могли б перетворити невизначені оцінки здібностей на серйозні судження про працівників. Джерело не описує гарантії, процедури підзвітності, захист конфіденційності або правила оскарження розподілу. Це радше невирішені питання, ніж висновки, встановлені препринтом.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Що дивитися далі
Наступним тестом статті є практична перевірка: чи відповідають оцінки придатності результатам пілотних робіт на робочому місці. До важливих невідомих відомостей належать шість досліджуваних професійних областей, використовувані контрольні завдання, ідентичність і продуктивність шести систем штучного інтелекту, а також те, як структура обробляє мінливі робочі процеси, підзвітність і людське судження.
Найважливішим подальшим спостереженням є докази реального використання на робочому місці. Джерело повідомляє про перевірку синтетичних агентів, шість профілів систем штучного інтелекту та вимоги, отримані від співробітників, але не повідомляє про проспективний тест, який показує, що оцінки передбачають виконання завдань, рівень помилок, продуктивність або результати роботи. Незалежні оцінки допоможуть визначити, чи є структура корисною поза планом дослідження авторів.
Читачі також повинні шукати методологічні деталі в повній статті: когнітивні виміри, побудова еталонних показників, процедура оцінки, ідентичності моделі, професійні області та невизначеність навколо кожної оцінки. Без цієї інформації повідомлені відмінності між системами штучного інтелекту та сімействами моделей не можна незалежно оцінити лише за анотацією.
Нарешті, структура повинна враховувати зміни моделей і робочих місць. Автори кажуть, що профілі можна оновлювати незалежно, що може допомогти вирішити цю проблему, але джерело не показує, як часто потрібні оновлення або як організації повинні реагувати, коли змінюються можливості моделі, робочий процес або наслідки збою. Запропоноване розширення розподілу «людина-машина» слід оцінювати особливо ретельно, якщо рішення стосуються зайнятості, безпеки, доступу до послуг або професійної відповідальності.