Что случилось
Препринт arXiv представляет метод оценки того, какие задачи на рабочем месте могут подходить для ИИ, людей или сотрудничества между ними. Он сравнивает возможности ИИ и требования к работе, используя один и тот же набор когнитивных измерений.
В документе arXiv описывается проблема определения масштаба, с которой сталкиваются организации, внедряющие ИИ: решение, какие задачи могут быть автоматизированы, какие должны оставаться за людьми, а какие должны быть общими. Авторы утверждают, что совокупные контрольные оценки плохо подходят для этого решения, поскольку единая общая оценка не показывает, с какими видами работы система ИИ справляется хорошо или плохо. Они также утверждают, что человеческие суждения о возможностях модели могут устареть по мере изменения систем.
Предлагаемый конвейер использует общий профиль основных когнитивных способностей. Системы искусственного интеллекта профилируются путем измерения их производительности на эталонной батарее, отдельные элементы которой аннотированы в соответствии с когнитивными потребностями, которые они предъявляют. Задачи на рабочем месте профилируются отдельно, и экспертам в предметной области предлагается взвесить относительную важность тех же возможностей в их работе. Поскольку обе стороны используют общий набор измерений, в документе говорится, что профили модели и требования к задачам могут обновляться независимо, а затем комбинироваться.
Авторы сообщают о трех этапах проверки в аннотации. Они проверяют, может ли этот метод восстановить профили возможностей синтетических агентов, профилировать шесть систем искусственного интеллекта и собрать оценки требований к задачам от 410 сотрудников в шести профессиональных областях. В аннотации не указаны эти области, не названы системы искусственного интеллекта, подробно не описана батарея тестов и не приведены основные оценки. Эти упущения ограничивают то, что можно сделать на основе одного только источника выводов об охвате исследования и сравнительных результатах.
В документе сообщается, что шесть систем ИИ больше различались по отдельным когнитивным измерениям, чем по семействам моделей. В нем также говорится, что деятельность на рабочем месте объединена общим когнитивным ядром. Полученные оценки представлены в качестве инструмента сравнительного анализа для выбора перспективных кандидатов для пилотных проектов и определения областей, в которых существующие системы вряд ли будут хорошо подходить. Авторы далее обсуждают расширение подхода к профилированию работников-людей наряду с системами искусственного интеллекта с долгосрочной целью поддержки распределения задач между человеком и машиной.
Подробности об источнике: arxiv.org ↗
Почему это важно
Эта структура может дать организациям более конкретный способ определения масштабов развертывания ИИ, чем полагаться на общие оценки моделей или неформальные суждения. Его ценность будет зависеть от того, предсказывают ли профили производительность на реальных рабочих местах и точно ли экспертные оценки отражают требования конкретных должностей.
Практический вклад заключается в переходе от вопроса о том, способна ли модель ИИ в целом к вопросу о том, соответствует ли ее модель возможностей конкретной задаче. Модель может работать хорошо по одним параметрам и плохо по другим, в то время как работа может придавать очень разный вес этим измерениям. Общий профиль может сделать это несоответствие видимым до того, как организация приступит к развертыванию или перепроектированию роли системы ИИ.
Такой подход также может улучшить качество экспериментов на ранних стадиях на рабочем месте. Вместо того, чтобы рассматривать основные показатели производительности модели как свидетельство того, что она готова к работе в целом, работодатели могли бы использовать эту структуру для определения более узких задач для контролируемых пилотов. Источник представляет оценки как сравнительные и подходящие для оценки; он не утверждает, что они доказывают, что система ИИ может безопасно и эффективно выполнять выбранную работу на производстве.
Опрос сотрудников потенциально важен, поскольку он пытается связать оценку модели с требованиями реальной работы в нескольких профессиональных областях. В то же время в аннотации не объясняется, как были набраны 410 участников, насколько они были репрезентативными, как отбирались задачи и договаривались ли сотрудники друг с другом о способностях, которые требуются для их работы. Эти детали имеют значение, поскольку выбор взвешивания задач может изменить итоговые оценки пригодности.
Предложение статьи о профилировании людей, а также систем искусственного интеллекта поднимает более широкий вопрос управления. Если такие профили используются для распределения обязанностей, они могут способствовать более четкому разделению труда, но они также могут превратить неопределенные оценки возможностей в важные суждения о работниках. Источник не описывает гарантии, процедуры подотчетности, защиту конфиденциальности или правила оспаривания распределения. Это скорее нерешенные вопросы, чем выводы, сделанные в препринте.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Что посмотреть дальше
Следующим тестом статьи является практическая проверка: соответствуют ли ее оценки пригодности результатам пилотных испытаний на реальных рабочих местах. Важные неизвестные включают шесть изученных профессиональных областей, используемые эталонные задачи, идентичность и производительность шести систем искусственного интеллекта, а также то, как структура обрабатывает изменяющиеся рабочие процессы, подотчетность и человеческое суждение.
Самым важным последующим наблюдением являются данные реального использования на рабочем месте. Источник сообщает о проверке синтетического агента, шести профилях ИИ-систем и требованиях, полученных от сотрудников, но не сообщает о проспективном тесте, показывающем, что оценки прогнозируют производительность задач, частоту ошибок, производительность или результаты работы сотрудников. Независимые оценки помогут определить, полезна ли эта схема помимо дизайна исследования авторов.
Читателям также следует ознакомиться с методологическими подробностями в полной версии статьи: когнитивные аспекты, построение критериев, процедура оценки, идентичность моделей, профессиональные области и неопределенность вокруг каждой оценки. Без этой информации сообщения о различиях между системами ИИ и семействами моделей невозможно оценить независимо, исходя только из абстрактных данных.
Наконец, в этой системе необходимо будет учитывать изменение моделей и смену рабочих мест. Авторы говорят, что профили можно обновлять независимо, что могло бы помочь решить эту проблему, но источник не показывает, как часто необходимы обновления или как организации должны реагировать, когда изменяются возможности модели, рабочий процесс или последствия сбоя. Предлагаемое расширение распределения человек-машина должно оцениваться особенно тщательно, когда решения влияют на занятость, безопасность, доступ к услугам или профессиональную ответственность.