Что случилось
Исследователи из Университета Боккони, работающие с OpenAI Economic Research, случайным образом распределили более 1000 студентов первого курса для получения доступа к ChatGPT, обучения причинно-следственным связям, либо того и другого, либо ни одного из них. Студенты выполнили маркетинговый проект для университетского магазина товаров. По данным источника, доступ к ChatGPT повысил баллы по рубрикам почти на один балл по пятибалльной шкале, а обучение критическому мышлению увеличило разнообразие и оригинальность идей.
Отчет OpenAI от 27 августа 2026 года описывает рандомизированный эксперимент, проведенный исследователями из Университета Боккони в сотрудничестве с OpenAI Economic Research. Более 1000 студентов первого курса бакалавриата работали над реальным бизнес-кейсом, включающим маркетинговые рекомендации для магазина товаров Bocconi. Студенты были распределены в зависимости от периода занятий в одну из четырех групп: доступ к ChatGPT с использованием GPT-4o, обучение причинно-следственным рассуждениям, оба вмешательства или ни одно из них. Источник представляет дизайн как способ разделения эффектов доступа ChatGPT, обучения критическому мышлению и их комбинации.
Работы учащихся оценивались обученными оценщиками по пятибалльной шкале. Рубрика измеряла, насколько хорошо рекомендации соответствуют двум заявленным маркетинговым целям: повышению осведомленности и расширению использования университетского магазина. Источник сообщает, что студенты с доступом к ChatGPT набрали по этой шкале почти на один балл выше. Автоматический анализ текста также показал, что их материалы содержали больше идей, следовали более четкой логике и были больше похожи на рекомендации, написанные тремя экспертами. Источник характеризует это как помощь менее опытным студентам в выполнении работ, которые кажутся более профессиональными.
Причинно-разумное вмешательство имело другой измеряемый эффект. Упражнение не было связано с искусственным интеллектом и обучало концепциям посредством игры, примеров, вопросов и обратной связи. Студенты, завершившие его, более четко объяснили, почему их предложения могут сработать, а когда могут потерпеть неудачу, но не получили более высоких баллов по основной рубрике исследования. Автоматизированный анализ показал, что их идеи охватывают более широкий диапазон и более отличаются от идей коллег. Студенты, получившие оба вмешательства, продемонстрировали сочетание эффектов по всем показателям исследования, включая более сильную логическую последовательность, больше идей и больше доказательств сомнительных предположений. В источнике не указывается продолжительность эксперимента, подробные статистические результаты, демографические данные участников или то, как учащиеся использовали ChatGPT во время выполнения задания.
Подробности об источнике: openai.com ↗
Почему это важно
Эксперимент показывает, что безупречная работа с помощью ИИ и независимые рассуждения не являются взаимозаменяемыми результатами. ChatGPT позволил улучшить результаты по общепринятым критериям оценки, а обучение причинно-следственным рассуждениям помогло студентам генерировать более четкие идеи и объяснять, когда рекомендации могут быть успешными, а когда нет. Результаты также ставят под сомнение, может ли оценка только окончательных ответов показать, что учащиеся понимают.
Главный вывод заключается в том, что высококачественный окончательный ответ может отражать нечто большее, чем просто знание предмета. В этом эксперименте доступ ChatGPT улучшил характеристики, которые вознаграждались по обычным критериям: согласованность, количество идей, сходство с рекомендациями экспертов и эффективность в соответствии с указанными маркетинговыми целями. Это может сделать работу с использованием ИИ более убедительной, даже если оценка не показывает, какая часть рассуждений основана на собственном предыдущем опыте студента. Источник сообщает, что студентам все еще нужно было решить, о чем спросить ChatGPT, оценить его ответы и выбрать материал для своих заявок, но он не дает количественной оценки этой деятельности.
Исследование также отличает оригинальность от полировки. Обучение причинно-следственным рассуждениям не увеличило баллы по указанному маркетинговому критерию, однако оно было связано с более широким и более четким набором идей и более четкими объяснениями возможного успеха или неудачи. Этот результат важен для преподавателей, поскольку задание может вознаградить за хорошо структурированный традиционный ответ, но при этом не учитывать, рассмотрел ли ученик несколько подходов или выдвинул идею, которую не сделали его сверстники. Этот вывод представлен как свидетельство того, что критическое мышление может влиять на аспекты успеваемости, которые обычные оценки не могут уловить.
Объединенная группа показала, почему источник описывает вмешательства как дополнительные, а не как альтернативные. Учащиеся, получившие оба варианта, продемонстрировали более широкое разнообразие идей, связанных с упражнением, а также более высокую производительность по рубрикам и количество идей, связанных с доступом к ChatGPT. Источник сообщает, что эта группа также продемонстрировала более сильную логическую последовательность и больше доказательств поиска объяснений и сомнений в предположениях. Эти результаты могли бы помочь в разработке дизайна оценивания, но они не доказывают, что ChatGPT улучшает обучение в любом контексте или что обучение причинно-следственным рассуждениям всегда повышает оригинальность. В эксперименте измерялась работа над одним бизнес-кейсом, а не долгосрочное обучение, удержание или независимая производительность без ИИ.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
What is a common training objective for an autoregressive language model?
Что посмотреть дальше
Выводы исследования следует интерпретировать в его контексте: студенты первого курса одного университета выполняют одно бизнес-кейс с распределением по группам, организованным по периодам занятий. Источник не предоставляет полные методы статьи, демографические данные участников, продолжительность обучения, записи об использовании ChatGPT или данные других субъектов. Дальнейшие исследования должны проверить, сохраняется ли эта закономерность в разных дисциплинах и могут ли обновленные тесты более непосредственно измерить рассуждение и оригинальность.
Ключевой вопрос заключается в том, проявляется ли та же самая закономерность за пределами университетского маркетинга товаров. Источник не дает результатов по математике, естественным наукам, письму, профессиональной подготовке или другим видам заданий. Исследователям и преподавателям потребуются сопоставимые эксперименты по субъектам, возрастным группам, учреждениям и уровням предшествующего опыта, прежде чем рассматривать результаты как поддающиеся широкому обобщению. Также неизвестно, зависят ли преимущества, приписываемые ChatGPT, конкретно от GPT-4o, от того, как учащимся было поручено его использовать, или от структуры задания.
Изменение оценок является еще одним практическим вопросом. Если учащиеся смогут предоставлять полные, экспертные ответы с помощью ИИ, преподаватели смогут уделять больше внимания черновикам, устным объяснениям, оценке источников, записям рассуждений или новым приложениям. Эти подходы могли бы сделать понимание учениками более заметным, но источник не тестирует какие-либо измененные методы оценивания. В нем также не сообщается, содержала ли итоговая работа учащихся фактические ошибки, знали ли оценщики, какие учащиеся имели доступ к ChatGPT, или как автоматизированные меры оригинальности проверялись на основе человеческих суждений.
Структура заданий исследования заслуживает внимания при будущих отчетах и тиражировании. Студенты были распределены случайным образом по периодам занятий, и источник не описывает, сколько классов было задействовано, насколько были сбалансированы группы или различались ли условия в классе. Источник также оставляет открытым, сколько времени студенты провели с ChatGPT, какие подсказки они использовали и насколько самостоятельно выполнили работу. Последующие исследования могли бы изучить долгосрочные последствия, производительность при выполнении задач без посторонней помощи, а также то, влияет ли обучение студентов подвергать сомнению результаты работы ИИ качеству и оригинальности их работы. Пока на эти вопросы не будут даны ответы, результаты подтверждают целенаправленный вывод: в этом эксперименте помощь ИИ и обучение причинно-следственным рассуждениям улучшили различные аспекты одного студенческого задания.