Terug naar Nieuws
InnovatieAI Understanding-briefing

Uit het Bocconi-experiment blijkt dat ChatGPT en training in kritisch denken verschillende aspecten van het werk van studenten verbeteren

Uit een gerandomiseerd experiment onder meer dan duizend studenten van de Bocconi Universiteit bleek dat toegang tot ChatGPT de kwaliteit en samenhang van bedrijfsaanbevelingen verbeterde, terwijl training in causaal redeneren originelere ideeën opleverde.

5 min readRead the primary source
Primary-source image accompanying Bocconi experiment finds ChatGPT and critical-thinking training improve different aspects of student work
Primair brondocumentBron opgenomen
Uitgever
openai.com
Bronlink
openai.comhttps://openai.com/index/what-students-gain-from-chatgpt-critical-thinking-training
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Gewicht
Een geleerde numerieke waarde die signalen schaalt die door een neuraal netwerk gaan.
Test jezelfChatGPT & LLM's Quiz

Wat is er gebeurd

Onderzoekers van de Bocconi Universiteit hebben in samenwerking met OpenAI Economic Research willekeurig meer dan 1.000 eerstejaarsstudenten toegewezen aan ChatGPT-toegang, training in causaal redeneren, beide, of geen van beide. Studenten voltooiden een marketingcase voor de merchandisewinkel van de universiteit. Volgens de bron verhoogde de toegang tot ChatGPT de rubriekscores met bijna één punt op een vijfpuntsschaal, terwijl training in kritisch denken de verscheidenheid en originaliteit van ideeën verhoogde.

Het verslag van OpenAI, gedateerd 27 augustus 2026, beschrijft een gerandomiseerd experiment uitgevoerd door onderzoekers van Bocconi University in samenwerking met OpenAI Economic Research. Ruim duizend eerstejaarsstudenten werkten aan een praktijkgerichte businesscase met marketingaanbevelingen voor de merchandisewinkel van Bocconi. Studenten werden per lesperiode toegewezen aan een van de vier groepen: toegang tot ChatGPT met behulp van GPT-4o, training in causaal redeneren, beide interventies, of geen van beide. De bron presenteert het ontwerp als een manier om de effecten van ChatGPT-toegang, instructie voor kritisch denken en de combinatie daarvan te scheiden.

De inzendingen van studenten werden beoordeeld door getrainde menselijke beoordelaars met behulp van een vijfpuntsrubriek. In de rubriek werd gemeten hoe goed de aanbevelingen tegemoetkwamen aan twee gestelde marketingdoelen: het vergroten van het bewustzijn en het vergroten van het gebruik van de universiteitswinkel. De bron zegt dat studenten met toegang tot ChatGPT bijna één punt hoger scoorden op die schaal. Uit geautomatiseerde tekstanalyse bleek ook dat hun inzendingen meer ideeën bevatten, een duidelijkere logica volgden en meer leken op de aanbevelingen van drie experts. De bron typeert dit als het helpen van minder ervaren studenten om werk te produceren dat er professioneler uitziet.

De causaal redenerende interventie had een ander gemeten effect. De oefening had geen betrekking op AI en leerde concepten door middel van een spel, voorbeelden, vragen en feedback. Studenten die het hadden afgerond, legden duidelijker uit waarom hun voorstellen zouden kunnen werken en wanneer ze zouden kunnen mislukken, maar scoorden niet hoger op de hoofdrubriek van het onderzoek. Uit geautomatiseerde analyse bleek dat hun ideeën een breder bereik bestreken en duidelijker verschilden van de ideeën van collega's. Studenten die beide interventies ontvingen, lieten de combinatie van effecten zien in alle metingen van het onderzoek, waaronder een sterkere logische samenhang, meer ideeën en meer bewijs van het in twijfel trekken van aannames. De bron vermeldt niet de duur van het experiment, gedetailleerde statistische resultaten, demografische gegevens van de deelnemers of hoe studenten ChatGPT tijdens de opdracht gebruikten.

Brongegevens: openai.com ↗

Waarom het ertoe doet

Het experiment suggereert dat gepolijst AI-ondersteund werk en onafhankelijk redeneren geen onderling verwisselbare uitkomsten zijn. ChatGPT zorgde voor verbeterde prestaties op de conventionele beoordelingsmaatstaf van het onderzoek, terwijl training in causaal redeneren studenten hielp meer onderscheidende ideeën te genereren en uit te leggen wanneer aanbevelingen zouden kunnen slagen of mislukken. De bevindingen vragen zich ook af of het beoordelen van alleen eindantwoorden kan aantonen wat studenten begrijpen.

De centrale implicatie is dat een kwalitatief hoogstaand eindantwoord meer kan weerspiegelen dan alleen vakkennis. In dit experiment verbeterde de toegang tot ChatGPT de kenmerken die een conventionele rubriek beloonde: samenhang, aantal ideeën, gelijkenis met aanbevelingen van experts en prestaties ten opzichte van gespecificeerde marketingdoelen. Dat zou het door AI ondersteunde werk er sterker uit kunnen laten zien, zelfs als uit de beoordeling niet blijkt hoeveel van de redenering voortkwam uit de eigen eerdere expertise van de student. De bron zegt dat studenten nog steeds moesten beslissen wat ze ChatGPT moesten vragen, de antwoorden moesten evalueren en materiaal moesten selecteren voor hun inzendingen, maar het kwantificeert die activiteiten niet.

De studie scheidt ook originaliteit van Pools. Training in causaal redeneren verhoogde de scores op de genoemde marketingrubriek niet, maar werd wel geassocieerd met een bredere en meer onderscheidende reeks ideeën en duidelijkere verklaringen voor mogelijk succes of falen. Dat resultaat is van belang voor docenten omdat een opdracht een goed gestructureerd, conventioneel antwoord kan belonen, terwijl het voorbijgaat aan de vraag of een leerling meerdere benaderingen heeft overwogen of een idee heeft geproduceerd dat collega's niet hebben bedacht. De bevinding wordt gepresenteerd als bewijs dat kritisch denken invloed kan hebben op prestatiedimensies die met gewone beoordeling mogelijk niet worden vastgelegd.

De gecombineerde groep liet zien waarom de bron de interventies eerder als complementair dan als alternatief beschrijft. Studenten die beide ontvingen, vertoonden de grotere verscheidenheid aan ideeën die verband hield met de oefening en de sterkere prestaties van de rubrieken en het aantal ideeën die verband hielden met de toegang tot ChatGPT. De bron meldt dat deze groep ook een sterkere logische coherentie vertoonde en meer bewijs van het zoeken naar verklaringen en het in twijfel trekken van aannames. Deze bevindingen zouden het beoordelingsontwerp kunnen beïnvloeden, maar ze bewijzen niet dat ChatGPT het leren in elke context verbetert of dat causaal redeneren altijd de originaliteit vergroot. Het experiment mat het werk op basis van één business case, en niet op het gebied van leren op lange termijn, retentie of onafhankelijke prestaties zonder AI.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

Wat je nu moet bekijken

De conclusies van het onderzoek moeten worden geïnterpreteerd binnen de context ervan: eerstejaarsstudenten aan één universiteit die één business case voltooien, met toewijzing aan groepen georganiseerd per lesperiode. De bron verstrekt niet de volledige methoden van het artikel, de demografische gegevens van de deelnemers, de duur van de training, gegevens over ChatGPT-gebruik of bewijsmateriaal van andere onderwerpen. Verder onderzoek zou moeten testen of dit patroon geldt voor alle disciplines en of herontworpen beoordelingen de redenering en originaliteit directer kunnen meten.

Een belangrijke vraag is of hetzelfde patroon zich ook voordoet buiten een universitaire merchandise-marketingzaak. De bron geeft geen resultaten voor wiskunde, natuurwetenschappen, schrijven, beroepsopleiding of andere soorten opdrachten. Onderzoekers en docenten zouden vergelijkbare experimenten nodig hebben over onderwerpen, leeftijdsgroepen, instellingen en niveaus van eerdere expertise heen voordat ze de bevindingen als breed generaliseerbaar zouden kunnen beschouwen. Het is ook niet bekend of de voordelen die aan ChatGPT worden toegeschreven specifiek afhankelijk zijn van GPT-4o, van de manier waarop leerlingen werden geïnstrueerd om het te gebruiken, of van de structuur van de taak.

Een ander praktisch probleem zijn beoordelingswijzigingen. Als leerlingen met behulp van AI gepolijste, deskundige antwoorden kunnen geven, kunnen docenten meer gewicht toekennen aan concepten, mondelinge toelichtingen, bronevaluatie, redeneringsdocumenten of nieuwe toepassingen. Deze benaderingen zouden het begrip van studenten beter zichtbaar kunnen maken, maar de bron test geen opnieuw ontworpen beoordeling. Het rapport rapporteert ook niet of het eindwerk van studenten feitelijke fouten bevatte, of beoordelaars wisten welke studenten toegang hadden tot ChatGPT, of hoe geautomatiseerde metingen van originaliteit werden gevalideerd op basis van menselijke oordelen.

De opdrachtstructuur van het onderzoek verdient aandacht in toekomstige rapportage en replicatie. De leerlingen werden willekeurig ingedeeld per lesperiode, en de bron beschrijft niet om hoeveel klassen het ging, hoe de groepen in evenwicht waren en of de omstandigheden in de klas verschilden. De bron laat ook open hoeveel tijd leerlingen met ChatGPT hebben doorgebracht, welke aanwijzingen ze hebben gebruikt en hoe zelfstandig ze het werk hebben voltooid. Vervolgonderzoek zou de effecten op langere termijn kunnen onderzoeken, de prestaties bij taken zonder hulp en of het trainen van studenten om AI-outputs in twijfel te trekken de kwaliteit en originaliteit van hun werk verandert. Totdat deze vragen zijn beantwoord, ondersteunen de resultaten een gerichte conclusie: in dit experiment verbeterden AI-ondersteuning en instructie over causaal redeneren verschillende aspecten van één leerlingopdracht.

Gerelateerde gidsen en quizzen

ChatGPT & LLM'sAI-ethiekAI-trainingPrompt EngineeringTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?