Terug naar Nieuws
InnovatieAI Understanding-briefing

Uit onderzoek blijkt dat automatische creativiteitsscores kunnen afwijken van menselijke oordelen over LLM-verhalen

Een nieuwe arXiv-voordruk meldt dat geautomatiseerde statistieken en LLM-juryleden er vaak niet in slagen de menselijke beoordeling van creativiteit in korte verhalen te evenaren, waarbij juryleden systematisch de voorkeur geven aan door AI gegenereerde schrijfstijlen.

5 min readRead the primary source
Source-provided image accompanying Study finds automatic creativity scores can diverge from human judgments of LLM stories
Primair brondocumentBron opgenomen
Uitgever
arxiv.org
Bronlink
arxiv.orghttps://arxiv.org/abs/2608.23705
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Groot taalmodel (LLM)
Een taalmodel dat is getraind op enorme tekstcorpora om tekst te genereren en te analyseren.
Precisie
Het percentage voorspelde positieve uitkomsten dat daadwerkelijk correct is.
Gegevensset
Een verzameling gestructureerde of ongestructureerde voorbeelden die worden gebruikt voor training, validatie of testen.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er gebeurd

Een preprint die op 24 augustus bij arXiv werd ingediend, onderzoekt of automatische systemen op betrouwbare wijze creativiteit kunnen evalueren in verhalen die worden gegenereerd door grote taalmodellen. De auteurs vergelijken menselijke beoordelingen met objectieve statistieken en evaluaties geproduceerd door op LLM gebaseerde juryleden.

Het artikel, getiteld ‘The Limits of Automatic Evaluation of Creativity in Large Language Models’, onderzoekt de kloof tussen computationele metingen van creativiteit en menselijk oordeel. De auteurs gebruiken korte verhalen uit de WritingPrompts-, inclusief verhalen geschreven door mensen en verhalen gegenereerd door AI-systemen, en verzamelen menselijke evaluaties over elf dimensies van creativiteit. De bron identificeert de beoordelaars niet en geeft ook niet het aantal verhalen in samenvatting weer. In die zin gaat de vergelijking van het onderzoek over de relatie tussen verschillende soorten evaluatie, en niet over het vervangen van de ene definitieve definitie van creativiteit door een andere. De samenvatting omlijst het werk als een onderzoek naar betrouwbaarheid en afstemming.

Deze menselijke beoordelingen worden vergeleken met twee brede klassen van geautomatiseerde evaluatie: objectieve statistieken en LLM-als-een-rechter-systemen. Het artikel rapporteert een “substantiële discrepantie” tussen de geautomatiseerde resultaten en menselijke beoordelingen. Het rapport meldt ook dat veelgebruikte automatische statistieken een vrijwel nulcorrelatie vertoonden met menselijke oordelen voor zowel door mensen geschreven als door AI gegenereerde verhalen. Het resultaat wordt gepresenteerd op het niveau van overeenstemming tussen scores en beoordelingen. In de meegeleverde tekst wordt niet één enkele metriek geïdentificeerd die verantwoordelijk is voor de mismatch, dus de brede categorie van objectieve metrieken mag niet worden gelezen als een oordeel over elke metriek.

De meest specifieke bevinding betreft rechters die op een LLM-basis werken. Volgens de samenvatting gaven deze juryleden systematisch de voorkeur aan door AI gegenereerde verhalen, waarbij ze de voorkeur gaven aan hun stilistische kenmerken boven onvoorspelbaarheid en andere kwaliteiten die verband houden met door mensen geschreven teksten. De bron presenteert dit als het resultaat van de experimenten van de auteurs; er wordt niet aangetoond dat elke LLM-rechter zich op deze manier gedraagt, of dat het resultaat van toepassing is op al het creatieve schrijven. Die kwalificatie zorgt ervoor dat de bevinding verbonden blijft met de gerapporteerde vergelijking. Het scheidt ook een in het experiment waargenomen voorkeur van een algemene conclusie over de literaire waarde van beide bronnen, die de samenvatting niet maakt.

Brongegevens: arxiv.org ↗

Waarom het ertoe doet

De bevindingen dagen de algemene veronderstelling uit dat creatieve kwaliteit alleen betrouwbaar kan worden gemeten door geautomatiseerde scores. Als evaluatiesystemen stilistische signalen belonen die verband houden met door AI gegenereerd schrijven, terwijl ze kwaliteiten missen die menselijke lezers waarderen, zouden ze vergelijkingen tussen mensen en taalmodellen kunnen vertekenen.

Creativiteit wordt vaak behandeld als een enkele kwaliteit die kan worden samengevat in een partituur, maar het artikel beschrijft het als multidimensionaal en subjectief. De gerapporteerde correlaties van bijna nul suggereren dat een metriek een getal kan opleveren zonder de aspecten van creatief werk vast te leggen die menselijke lezers belangrijk vinden. Dat onderscheid is van belang wanneer geautomatiseerde evaluaties worden gebruikt om modellen te vergelijken, de ontwikkeling te begeleiden of gegenereerde inhoud te beoordelen. Het betekent ook dat de schijnbare nauwkeurigheid van een geautomatiseerd resultaat los moet worden gezien van de vraag of het resultaat de kwaliteiten weerspiegelt die van lezers worden gevraagd te beoordelen.

De gerapporteerde voorkeur voor door AI gegenereerde verhalen roept een specifiek meetprobleem op. Als een LLM-rechter herkenbare stilistische patronen eerder beloont dan verrassing of onvoorspelbaarheid, zou een systeem creatiever kunnen lijken omdat het aansluit bij de voorkeuren van de rechter, niet omdat het schrijven voortbrengt dat menselijke lezers meer waarderen. De bron beschrijft geen inzet of een gedocumenteerd institutioneel besluit, dus dit zijn praktische implicaties van de bevindingen van het onderzoek en niet de gerapporteerde gevolgen in de echte wereld. De zorg gaat daarom over de manier waarop een evaluatie de interpretatie kan beïnvloeden, vooral wanneer de score ervan wordt behandeld als een directe samenvatting van de creatieve kwaliteit.

Het werk is ook relevant voor beweringen dat taalmodellen menselijke prestaties bij creatieve taken benaderen of zelfs overtreffen. Een sterke score van een geautomatiseerde beoordelaar is niet noodzakelijkerwijs een bewijs van brede creatieve superioriteit als de beoordelaar slecht is afgestemd op het menselijk oordeel. Tegelijkertijd zegt de bron niet dat mensen betrouwbare of onpartijdige rechters zijn, en laat het ook niet zien dat door AI gegenereerde verhalen over het algemeen minder creatief zijn. Het rapporteert een meningsverschil tussen de evaluatiemethoden. Dat meningsverschil laat ruimte voor een zorgvuldiger lezing van vergelijkende resultaten, waarbij het gedrag van de beoordelaar wordt behandeld als onderdeel van het bewijsmateriaal in plaats van als een neutrale achtergrond.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

Het artikel is een voordruk en de brontekst geeft geen details over de beoordelaars, jurymodellen, aanwijzingen, statistische methoden of de omvang en samenstelling van de verhaalsteekproef. Vervolgwerk moet testen of de gerapporteerde mismatch geldt voor genres, talen, modellen en onafhankelijke groepen lezers.

De belangrijkste onbekende is hoe de experimenten in detail werden uitgevoerd. De verstrekte bron vermeldt niet hoeveel menselijke en door AI gegenereerde verhalen zijn beoordeeld, welke taalmodellen de AI-verhalen hebben voortgebracht, hoe de elf creativiteitsdimensies zijn gedefinieerd of hoe menselijke beoordelingen zijn samengevoegd. Deze details zijn belangrijk voor het beoordelen van de kracht en reikwijdte van de gerapporteerde conclusies. Ze zouden de lezers ook helpen begrijpen hoe nauw de gerapporteerde vergelijking de omstandigheden weerspiegelt waaronder de resultaten later zouden kunnen worden geïnterpreteerd of gereproduceerd.

Bij verder onderzoek zou moeten worden gekeken naar de objectieve maatstaven en LLM-juryleden die bij de vergelijking zijn gebruikt. De samenvatting noemt ze niet, beschrijft hun aanwijzingen niet, en geeft niet aan of de juryleden tijdens herhaalde evaluaties op betrouwbaarheid zijn getest. Resultaten kunnen afhangen van de keuze van de metriek, het beoordelingsmodel, de instructies, de lengte van het verhaal of de schrijfstijl. Zonder deze bijzonderheden is de algemene bevinding informatief, maar moeilijk te koppelen aan een specifieke evaluatieopzet. Door de opzet te verduidelijken, zou het gemakkelijker worden om een ​​algemene beperking te onderscheiden van een resultaat dat aan bepaalde hulpmiddelen of instructies is gekoppeld.

Replicatie zal laten zien of het gerapporteerde patroon verder reikt dan de WritingPrompts- en korte verhalen. Nuttige tests zijn onder meer andere genres, talen, modelfamilies, menselijke lezerspopulaties en creatieve formaten. De bron laat ook open of verbeterde evaluatiemethoden menselijke oordelen beter kunnen weerspiegelen, of dat sommige aspecten van creativiteit resistent zullen blijven tegen een enkele automatische score. Deze open vragen definiëren de volgende fase van de interpretatie: bepalen hoe duurzaam de mismatch is en welke soorten beoordelingen deze kunnen aanpakken.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdChatGPT & LLM'sAI-ethiekAI-trainingTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?