Terug naar Nieuws
InnovatieAI Understanding-briefing

Preprint zegt dat de deelname van studenten een nieuwe vorm moet geven aan de manier waarop LLM-metingen van gesprekken in de klas worden gevalideerd

Een preprint meldt dat vier meertalige leerlingen uit de achtste klas de LLM-classificaties van hun wiskundediscussies in twijfel trokken, met het argument dat annotaties en standaardscores voor volwassenen de eigen interpretaties van leerlingen kunnen missen.

6 min readRead the primary source
Primary-source image accompanying Preprint says student participation should reshape how LLM measures of classroom talk are validated
Primair brondocumentBron opgenomen
Uitgever
arxiv.org
Bronlink
arxiv.orghttps://arxiv.org/abs/2608.23780
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Groot taalmodel (LLM)
Een taalmodel dat is getraind op enorme tekstcorpora om tekst te genereren en te analyseren.
Evaluatieset
Een vastgehouden dataset die wordt gebruikt om de modelkwaliteit na training te meten.
Annotatie
Door mensen toegevoegde labels of metagegevens die worden gebruikt om machine learning-modellen te trainen of evalueren.
Test jezelfWat is AI? Quiz

Wat is er gebeurd

Een nieuwe arXiv-voordruk onderzoekt hoe grote taalmodellen worden gebruikt om het discours van studenten te meten, inclusief spreekbewegingen, samenwerking en gelijkheid van stem. De auteurs beweren dat het evalueren van deze systemen alleen aan de hand van annotaties van volwassen deskundigen en lange testsets de taal in de klas uit zijn context kan halen en de leerlingen wier ervaringen worden gemeten, kan uitsluiten. In een casestudy waarbij meertalige jongeren betrokken waren in een wiskundelokaal van groep acht, combineerden de onderzoekers participerende observatie, interviews, focusgroepen en ledencontroles met vier focusstudenten. Ze melden dat de interpretaties van studenten van hun eigen klasgesprek soms niet overeenkwamen met de op LLM gebaseerde metingen. De studenten stelden ook zowel de classificaties van het model als het coderingsschema ter discussie dat werd gebruikt om het gemeten gedrag te definiëren.

Het artikel richt zich op LLM-gebaseerde metingen van studentenpraat. Volgens de auteurs analyseren deze systemen steeds vaker transcripties van gesprekken in de klas om kenmerken als gespreksbewegingen, samenwerking en gelijkheid van stem te identificeren. De auteurs zeggen dat transcripties gewoonlijk alleen verbale bijdragen bevatten, waardoor de omringende context kan worden verwijderd en de taal van studenten moeilijker te interpreteren is.

De auteurs stellen twee veel voorkomende validatiepraktijken in vraag: het vergelijken van LLM-resultaten met annotaties van volwassen experts, en het evalueren van de prestaties met bestaande datasets en F1-scores. Ze beweren dat deze procedures overeenstemming kunnen tonen met een door volwassenen gedefinieerde norm zonder aan te tonen dat de resulterende maatregel zinvol of rechtvaardig is voor het lesgeven en leren. Het artikel presenteert dit als een epistemisch probleem: de mensen die worden geanalyseerd, kunnen worden uitgesloten van de beslissing wat hun woorden betekenen.

Voor zijn casestudy onderzocht het onderzoeksteam meertalige jongeren in een wiskundelokaal van groep acht. In de samenvatting staat dat de onderzoekers meerdere etnografisch georiënteerde methoden hebben gebruikt, waaronder participerende observaties, interviews, focusgroepen en member checks. Ze werkten met vier focusstudenten en brachten die studenten in gesprek met onderzoekers en LLM's tijdens het proces van het interpreteren van klassikale gesprekken.

De gerapporteerde bevinding is dat de interpretaties van de leerlingen van hun eigen ervaringen met wiskundegesprekken niet altijd overeenkwamen met de op LLM gebaseerde metingen. De studenten betwistten niet alleen de individuele classificaties die door de LLM waren gegenereerd, maar ook het coderingsschema dat werd gebruikt om hun gesprekken te meten. De bron identificeert niet het model of de geteste modellen, geeft geen numerieke prestatieresultaten, geeft geen opsomming van de betwiste classificaties of beschrijft hoe meningsverschillen uiteindelijk werden beslecht.

Brongegevens: arxiv.org ↗

Waarom het ertoe doet

De preprint werpt een praktische vraag op voor scholen en onderzoekers die LLM's adopteren om discussies in de klas te evalueren: of een systeem sterke overeenstemming kan bereiken met volwassen annotators, terwijl het toch de studenten die het moet beschrijven verkeerd begrijpt. De centrale claim is dat leerlingen moeten deelnemen aan het produceren en valideren van kennis over hun eigen taalgebruik, vooral wanneer taal en ras van invloed kunnen zijn op de manier waarop communicatie in de klas wordt geïnterpreteerd. Het bewijsmateriaal is beperkt tot één klaslokaal en vier focusstudenten, en het artikel wordt gemarkeerd als 'wordt beoordeeld'. Het stelt daarom niet vast hoe wijdverspreid de gerapporteerde onjuiste afstemmingen zijn en of op jongeren gerichte validatie de nauwkeurigheid van een bepaald model verbetert. Het identificeert echter wel een concreet bestuurs- en evaluatieprobleem voor de inzet van AI in het onderwijs.

Het onderzoek is van belang omdat op LLM gebaseerde klasanalyse van invloed kan zijn op de manier waarop docenten participatie en interactie begrijpen. Een maatstaf die de bijdrage van een leerling bestempelt als een bepaalde praatbeweging of evalueert wiens stem wordt vertegenwoordigd, kan onderzoeksconclusies, instructiebeslissingen of oordelen over de gelijkheid in de klas bepalen. Als de categorieën de ervaringen van leerlingen niet weerspiegelen, kan schijnbare precisie een inhoudelijke interpretatiefout verbergen.

Het argument van de auteurs betwist ook een enge definitie van validatie. Overeenstemming met volwassen deskundigen kan nuttig zijn, maar het kan de aannames reproduceren die in het annotatieproces voor volwassenen zijn ingebouwd. Op dezelfde manier kunnen een bestaande evaluatieset en een F1-score de consistentie met labels kwantificeren zonder aan te tonen dat de labels de sociale en taalkundige context van gesprekken in de klas weergeven. De preprint beweert niet dat deze statistieken nutteloos zijn; zij stelt dat ze op zichzelf onvoldoende zijn.

De focus op meertalige en raciaal en taalkundig gemarginaliseerde jongeren maakt deze kwestie bijzonder belangrijk. De bron zegt dat volwassen onderzoekers, deskundige annotators en LLM's niet alle nuance kunnen bieden die nodig is om de gesprekken van studenten te begrijpen. Er wordt niet vastgesteld dat het systeem slechter presteert voor een bepaalde demografische groep, en er wordt ook geen schatting van de prevalentie gegeven. De relevante bevinding is beperkter: in dit geval identificeerden de leerlingen discrepanties tussen hun eigen interpretaties en de metingen van het systeem.

De meest concrete implicatie van het artikel is procedureel. Studenten kunnen een rol nodig hebben bij het definiëren van categorieën, het beoordelen van classificaties en het uitdagen van interpretaties voordat een op LLM gebaseerde meting wordt behandeld als betekenisvol bewijs over interactie in de klas. Of die aanpak op grote schaal haalbaar is, hoeveel tijd het kost en of het betrouwbaardere onderwijsbeslissingen oplevert, blijft door de bron onbeantwoord.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

Wat je nu moet bekijken

De belangrijkste volgende vraag is of de door de auteurs voorgestelde aanpak kan worden getest in meer klaslokalen, leeftijdsgroepen, talen en schoolomgevingen. Toekomstig werk zou moeten uitwijzen wanneer de interpretaties van leerlingen afwijken van de modelresultaten, of deze verschillen fouten in het model, beperkingen in het coderingsschema of legitieme verschillen in perspectief weerspiegelen, en hoe onderzoekers deze moeten oplossen. Scholen en leveranciers die op LLM gebaseerde metingen gebruiken, moeten ook duidelijk maken wat er wordt gemeten, wie de categorieën definieert en of studenten de resultaten kunnen betwisten. De bron rapporteert geen productinzet, een aanbeveling voor een specifiek model, een vergelijkende benchmark of een gemeten effect op lesgeven en leren. Deze onbekenden beperken onmiddellijke conclusies over de operationele prestaties.

Replicatie is de belangrijkste volgende stap. Bij deze casestudy zijn één wiskundeklas van de achtste klas en vier leerlingen betrokken, zodat niet kan worden aangetoond hoe vaak vergelijkbare meningsverschillen elders voorkomen. Onderzoekers zouden verschillende onderwerpen, leeftijdsgroepen, talen, klassenculturen en vormen van studentenparticipatie moeten onderzoeken voordat ze bredere conclusies kunnen trekken.

Toekomstige studies zouden de specifieke LLM's, aanwijzingen, transcripties, coderingscategorieën en gebruikte evaluatieprocedures moeten rapporteren. Ze moeten ook onderscheid maken tussen verschillende soorten meningsverschillen: een transcriptieprobleem, een modelfout, een te brede of cultureel beperkte categorie, en een legitiem verschil tussen de interpretatie van een waarnemer en de geleefde ervaring van een student. De huidige samenvatting biedt niet voldoende details om dit onderscheid te maken.

Het is ook niet bekend of het betrekken van jongeren veranderingen in de prestaties van het model oplevert, de validiteit van de categorieën verbetert, of vooral meningsverschillen aan het licht brengt die niet tot één enkel correct label kunnen worden herleid. Vergelijkend onderzoek zou de validatie voor volwassenen kunnen toetsen aan processen zoals studenteninterviews, focusgroepen en ledencontroles, terwijl de effecten op classificaties en onderwijsbeslissingen worden gevolgd.

De preprint is gemarkeerd als 'wordt beoordeeld' en de bron geeft geen informatie over de uitkomsten van peer-review, institutionele adoptie of implementatie in de klas. Lezers moeten de bevindingen daarom beschouwen als een argument en een vroege case study, en niet als bewijs dat alle LLM-metingen van studentenpraat onbetrouwbaar zijn. De directe vraag van publiek belang is of scholen en ontwikkelaars leerlingen een zinvolle manier zullen bieden om door AI gegenereerde interpretaties van hun ervaringen in de klas te inspecteren en te betwisten.

Gerelateerde gidsen en quizzen

Wat is AI?ChatGPT & LLM'sAI-ethiekAI-modellen uitgelegdTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?