返回新闻
创新AI Understanding 简报

博科尼实验发现 ChatGPT 和批判性思维训练可以改善学生作业的各个方面

一项涉及 1,000 多名博科尼大学学生的随机实验发现,ChatGPT 访问提高了商业建议的质量和连贯性,而因果推理训练产生了更多原创想法。

5 min readRead the primary source
Primary-source image accompanying Bocconi experiment finds ChatGPT and critical-thinking training improve different aspects of student work
主要来源文件来源记录
出版商
openai.com
来源链接
openai.comhttps://openai.com/index/what-students-gain-from-chatgpt-critical-thinking-training
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

重量
一个学习的数值,用于缩放通过神经网络的信号。
测试一下自己ChatGPT 和法学硕士测验

发生了什么

博科尼大学的研究人员与 OpenAI 经济研究中心合作,随机分配 1,000 多名一年级学生接受 ChatGPT 访问、因果推理培训,或者两者都接受或都不接受。学生们完成了大学商品店的营销案例。据消息人士称,ChatGPT 访问将评分标准分数提高了近 1 分(满分制),而批判性思维训练则增加了想法的多样性和原创性。

OpenAI 的账户日期为 2026 年 8 月 27 日,描述了博科尼大学研究人员与 OpenAI 经济研究中心合作进行的一项随机实验。超过 1,000 名一年级本科生参与了一个真实的商业案例,其中涉及为博科尼的商品店提供营销建议。学生按课时分配到四组之一:使用 GPT-4o 访问 ChatGPT、因果推理培训、两种干预措施或两者都不干预。来源将该设计作为一种分离 ChatGPT 访问、批判性思维指令及其组合的效果的方法。

学生提交的作品由经过培训的人工评分员使用五分制进行评估。该标题衡量了建议如何满足两个既定营销目标:提高认识和增加大学商店的使用。消息人士称,拥有 ChatGPT 访问权限的学生在该量表上的得分几乎高出一分。自动文本分析还发现,他们提交的内容包含更多想法,遵循更清晰的逻辑,并且与三位专家撰写的建议更相似。消息人士将此描述为帮助经验不足的学生创作出看起来更专业的作品。

因果推理干预具有不同的测量效果。该练习与人工智能无关,通过游戏、示例、问题和反馈来教授概念。完成该研究的学生更清楚地解释了为什么他们的提案可能有效以及何时可能失败,但在该研究的主要评分标准上并没有获得更高的分数。自动分析发现,他们的想法涵盖范围更广,并且与同行的想法更加不同。接受这两种干预措施的学生表现出了研究措施的综合效果,包括更强的逻辑连贯性、更多的想法以及更多质疑假设的证据。该消息来源没有说明实验的持续时间、详细的统计结果、参与者的人口统计数据或学生在作业期间如何使用 ChatGPT。

来源详情: openai.com ↗

为什么这很重要

该实验表明,完善的人工智能辅助工作和独立推理并不是可以互换的结果。 ChatGPT 提高了该研究传统评分标准的表现,而因果推理训练帮助学生产生更独特的想法,并解释建议何时可能成功或失败。研究结果还质疑仅对最终答案进行评分是否可以显示学生的理解程度。

核心含义是,高质量的最终答案可能反映的不仅仅是学科知识。在此实验中,ChatGPT 访问改进了传统评分标准奖励的功能:连贯性、想法计数、与专家建议的相似性以及针对指定营销目标的绩效。即使评估没有揭示有多少推理来自学生自己先前的专业知识,这也可以使人工智能辅助的工作看起来更强大。消息人士称,学生们仍然必须决定向 ChatGPT 问什么,评估其回答,并选择提交的材料,但它没有量化这些活动。

该研究还将原创性与精美性区分开来。因果推理训练并没有提高所述营销标准的分数,但它与更广泛、更独特的想法以及对可能成功或失败的更清晰解释相关。这一结果对教育工作者来说很重要,因为作业可以奖励结构良好的传统答案,同时忽略学生是否考虑了多种方法或提出了同龄人没有提出的想法。这一发现证明批判性思维可以影响普通评分可能无法捕捉到的表现维度。

合并后的小组表明了为什么消息来源将干预措施描述为补充而不是替代。接受这两种方法的学生表现出与练习相关的更广泛的想法多样性,以及与 ChatGPT 访问相关的更强的标题表现和想法计数。消息人士称,该群体还表现出更强的逻辑连贯性,以及更多寻找解释和质疑假设的证据。这些发现可以为评估设计提供信息,但它们并不能证明 ChatGPT 可以改善每种情况下的学习,也不能证明因果推理教学总是会增加原创性。该实验衡量的是一个业务案例的工作情况,而不是在没有人工智能的情况下的长期学习、保留或独立绩效。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
交互式概念检查+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

接下来看什么

该研究的结论需要在其背景下进行解释:一所大学的一年级学生完成一个商业案例,并分配给按课堂时间组织的小组。来源没有提供论文的完整方法、参与者人口统计数据、培训持续时间、ChatGPT 使用记录或其他主题的证据。进一步的研究应该测试该模式是否适用于跨学科,以及重新设计的评估是否可以更直接地衡量推理和原创性。

一个关键问题是,同样的模式是否也出现在大学商品营销案例之外。该来源没有给出数学、科学、写作、专业培训或其他类型作业的结果。研究人员和教育工作者需要在不同学科、年龄组、机构和先前专业知识水平之间进行可比较的实验,然后才能将研究结果广泛推广。尚不清楚 ChatGPT 带来的好处是否具体取决于 GPT-4o、指示学生使用它的方式或任务的结构。

评估变化是另一个实际问题。如果学生能够在人工智能的帮助下提交精美的、专家般的答案,教育工作者可能会更加重视草稿、口头解释、来源评估、推理记录或新颖的应用程序。这些方法可以使学生的理解更加明显,但来源并未测试任何重新设计的评估。它还没有报告学生的期末作业是否包含事实错误,评分者是否知道哪些学生具有 ChatGPT 访问权限,或者如何根据人类判断来验证自动化的原创性衡量标准。

该研究的任务结构值得在未来的报告和复制中关注。学生是按上课时间随机分配的,消息来源没有描述涉及多少个班级、小组如何平衡,或者教室条件是否不同。该消息来源还没有透露学生们在 ChatGPT 上花费了多少时间、他们使用了什么提示以及他们如何独立完成作业。后续研究可以检验长期影响、无辅助任务的表现,以及训练学生质疑人工智能输出是否会改变他们工作的质量和原创性。在这些问题得到解答之前,结果支持一个有针对性的结论:在这项实验中,人工智能辅助和因果推理指导改善了一项学生作业的不同方面。

相关指南和测验

ChatGPT 与大语言模型AI 伦理人工智能培训Prompt Engineering测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?