Что случилось
Препринт, представленный arXiv 24 августа, исследует, могут ли автоматические системы надежно оценивать креативность в историях, созданных с помощью больших языковых моделей. Авторы сравнивают человеческие оценки с объективными показателями и оценками, выдаваемыми судьями LLM.
В статье под названием «Пределы автоматической оценки креативности в больших языковых моделях» исследуется разрыв между вычислительными показателями креативности и человеческим суждением. Авторы используют короткие рассказы из набора данных WritePrompts, в том числе рассказы, написанные людьми, и рассказы, созданные системами искусственного интеллекта, и собирают человеческие оценки по 11 измерениям творчества. Источник не называет оценщиков и не указывает количество историй в аннотации. В этом смысле сравнение в исследовании касается взаимоотношений между различными видами оценки, а не замены одного окончательного определения творчества другим. Аннотация представляет работу как исследование надежности и согласованности.
Эти человеческие оценки сравниваются с двумя широкими классами автоматизированной оценки: объективными показателями и системами LLM как судьи. В документе сообщается о «существенном несоответствии» между автоматическими результатами и человеческими оценками. В нем также сообщается, что широко используемые автоматические показатели показали почти нулевую корреляцию с человеческими суждениями как для историй, написанных людьми, так и для историй, созданных искусственным интеллектом. Результат представлен на уровне соответствия баллов и оценок. В прилагаемом тексте не указан ни один показатель, ответственный за несоответствие, поэтому широкую категорию объективных показателей не следует рассматривать как суждение по каждому показателю.
Наиболее конкретный вывод касается судей, имеющих степень магистра права. Согласно аннотации, эти судьи систематически отдавали предпочтение историям, созданным искусственным интеллектом, отдавая предпочтение их стилистическим характеристикам непредсказуемости и другим качествам, связанным с текстами, написанными людьми. Источник представляет это как результат экспериментов авторов; он не устанавливает, что каждый судья LLM ведет себя таким образом или что результат применим ко всем творческим произведениям. Эта оговорка сохраняет связь результатов с сообщаемым сравнением. Это также отделяет предпочтение, наблюдаемое в эксперименте, от общего вывода о литературной ценности любого источника, чего не делает аннотация.
Подробности об источнике: arxiv.org ↗
Почему это важно
Полученные результаты бросают вызов распространенному предположению о том, что качество креатива можно надежно измерить только с помощью автоматизированной оценки. Если системы оценки будут поощрять стилистические сигналы, связанные с письмом, созданным ИИ, но при этом будут отсутствовать качества, которые ценят читатели-люди, они могут исказить сравнения между людьми и языковыми моделями.
Креативность часто рассматривается как единое качество, которое можно обобщить с помощью оценки, но в статье она описывается как многомерная и субъективная. Сообщения о почти нулевой корреляции позволяют предположить, что метрика может давать числа, не отражая те аспекты творческой работы, которые читатели-люди считают важными. Это различие имеет значение, когда автоматизированные оценки используются для сравнения моделей, руководства разработкой или оценки создаваемого контента. Это также означает, что кажущуюся точность автоматизированного результата следует рассматривать отдельно от того, отражает ли результат те качества, которые читателей просят оценить.
Сообщения о том, что предпочтение отдается историям, созданным ИИ, вызывают особую обеспокоенность в области измерения. Если судья LLM с большей готовностью поощряет узнаваемые стилистические образцы, чем удивление или непредсказуемость, система может показаться более креативной, потому что она соответствует предпочтениям судьи, а не потому, что она создает текст, который читатели-люди ценят больше. Источник не описывает развертывание или задокументированное институциональное решение, поэтому это практические последствия результатов исследования, а не сообщаемые о реальных последствиях. Поэтому беспокойство вызывает то, как оценка может влиять на интерпретацию, особенно когда ее оценка рассматривается как прямое обобщение творческого качества.
Работа также актуальна для утверждений о том, что языковые модели приближаются к человеческим возможностям в творческих задачах или превосходят их. Высокая оценка, полученная автоматическим оценщиком, не обязательно является свидетельством широкого творческого превосходства, если оценщик плохо согласуется с человеческим суждением. В то же время источник не говорит, что люди являются надежными и беспристрастными судьями, а также не показывает, что истории, созданные ИИ, в целом менее креативны. В нем сообщается о разногласиях между методами оценки. Это разногласие оставляет место для более внимательного прочтения сравнительных результатов, в которых поведение оценщика рассматривается как часть доказательств, а не как нейтральный фон.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
Which component of an AI application is the machine-learning model itself?
Что посмотреть дальше
Статья представляет собой препринт, и исходный текст не содержит подробностей об оценщиках, моделях судей, подсказках, статистических методах, а также о размере и составе выборки историй. Последующая работа должна проверить, сохраняется ли указанное несоответствие между жанрами, языками, моделями и независимыми группами читателей.
Главное неизвестное — как детально проводились эксперименты. В предоставленном источнике не указано, сколько историй, созданных людьми и ИИ, было оценено, какие языковые модели создали истории ИИ, как были определены 11 измерений творчества или как агрегировались человеческие рейтинги. Эти детали важны для оценки силы и масштаба представленных выводов. Они также помогут читателям понять, насколько точно результаты сравнения отражают условия, при которых результаты могут быть позже интерпретированы или воспроизведены.
Дальнейшее изучение должно изучить объективные показатели и судей LLM, использованных в сравнении. В аннотации они не называются, не описываются их подсказки и не указывается, проверялась ли надежность судей при повторных оценках. Результаты могут зависеть от выбора показателя, модели оценки, инструкций, длины рассказа или стиля письма. Без этих подробностей общий вывод будет информативным, но его трудно связать с конкретной схемой оценки. Уточнение настройки облегчит различие между общим ограничением и результатом, связанным с конкретными инструментами или инструкциями.
Репликация покажет, выходит ли указанный шаблон за пределы набора данных и коротких рассказов WritePrompts. Полезные тесты будут включать в себя другие жанры, языки, модельные семейства, группы читателей и творческие форматы. Источник также оставляет открытым вопрос о том, смогут ли усовершенствованные методы оценки лучше отражать человеческие суждения, или некоторые аспекты творчества останутся устойчивыми к какой-либо одной автоматической оценке. Эти открытые вопросы определяют следующий этап интерпретации: определение того, насколько устойчиво несоответствие и какие виды оценки могут его устранить.