Wat is er gebeurd
Een preprint die op 24 augustus bij arXiv werd ingediend, onderzoekt of automatische systemen op betrouwbare wijze creativiteit kunnen evalueren in verhalen die worden gegenereerd door grote taalmodellen. De auteurs vergelijken menselijke beoordelingen met objectieve statistieken en evaluaties geproduceerd door op LLM gebaseerde juryleden.
Het artikel, getiteld ‘The Limits of Automatic Evaluation of Creativity in Large Language Models’, onderzoekt de kloof tussen computationele metingen van creativiteit en menselijk oordeel. De auteurs gebruiken korte verhalen uit de WritingPrompts-, inclusief verhalen geschreven door mensen en verhalen gegenereerd door AI-systemen, en verzamelen menselijke evaluaties over elf dimensies van creativiteit. De bron identificeert de beoordelaars niet en geeft ook niet het aantal verhalen in samenvatting weer. In die zin gaat de vergelijking van het onderzoek over de relatie tussen verschillende soorten evaluatie, en niet over het vervangen van de ene definitieve definitie van creativiteit door een andere. De samenvatting omlijst het werk als een onderzoek naar betrouwbaarheid en afstemming.
Deze menselijke beoordelingen worden vergeleken met twee brede klassen van geautomatiseerde evaluatie: objectieve statistieken en LLM-als-een-rechter-systemen. Het artikel rapporteert een “substantiële discrepantie” tussen de geautomatiseerde resultaten en menselijke beoordelingen. Het rapport meldt ook dat veelgebruikte automatische statistieken een vrijwel nulcorrelatie vertoonden met menselijke oordelen voor zowel door mensen geschreven als door AI gegenereerde verhalen. Het resultaat wordt gepresenteerd op het niveau van overeenstemming tussen scores en beoordelingen. In de meegeleverde tekst wordt niet één enkele metriek geïdentificeerd die verantwoordelijk is voor de mismatch, dus de brede categorie van objectieve metrieken mag niet worden gelezen als een oordeel over elke metriek.
De meest specifieke bevinding betreft rechters die op een LLM-basis werken. Volgens de samenvatting gaven deze juryleden systematisch de voorkeur aan door AI gegenereerde verhalen, waarbij ze de voorkeur gaven aan hun stilistische kenmerken boven onvoorspelbaarheid en andere kwaliteiten die verband houden met door mensen geschreven teksten. De bron presenteert dit als het resultaat van de experimenten van de auteurs; er wordt niet aangetoond dat elke LLM-rechter zich op deze manier gedraagt, of dat het resultaat van toepassing is op al het creatieve schrijven. Die kwalificatie zorgt ervoor dat de bevinding verbonden blijft met de gerapporteerde vergelijking. Het scheidt ook een in het experiment waargenomen voorkeur van een algemene conclusie over de literaire waarde van beide bronnen, die de samenvatting niet maakt.
Waarom het ertoe doet
De bevindingen dagen de algemene veronderstelling uit dat creatieve kwaliteit alleen betrouwbaar kan worden gemeten door geautomatiseerde scores. Als evaluatiesystemen stilistische signalen belonen die verband houden met door AI gegenereerd schrijven, terwijl ze kwaliteiten missen die menselijke lezers waarderen, zouden ze vergelijkingen tussen mensen en taalmodellen kunnen vertekenen.
Creativiteit wordt vaak behandeld als een enkele kwaliteit die kan worden samengevat in een partituur, maar het artikel beschrijft het als multidimensionaal en subjectief. De gerapporteerde correlaties van bijna nul suggereren dat een metriek een getal kan opleveren zonder de aspecten van creatief werk vast te leggen die menselijke lezers belangrijk vinden. Dat onderscheid is van belang wanneer geautomatiseerde evaluaties worden gebruikt om modellen te vergelijken, de ontwikkeling te begeleiden of gegenereerde inhoud te beoordelen. Het betekent ook dat de schijnbare nauwkeurigheid van een geautomatiseerd resultaat los moet worden gezien van de vraag of het resultaat de kwaliteiten weerspiegelt die van lezers worden gevraagd te beoordelen.
De gerapporteerde voorkeur voor door AI gegenereerde verhalen roept een specifiek meetprobleem op. Als een LLM-rechter herkenbare stilistische patronen eerder beloont dan verrassing of onvoorspelbaarheid, zou een systeem creatiever kunnen lijken omdat het aansluit bij de voorkeuren van de rechter, niet omdat het schrijven voortbrengt dat menselijke lezers meer waarderen. De bron beschrijft geen inzet of een gedocumenteerd institutioneel besluit, dus dit zijn praktische implicaties van de bevindingen van het onderzoek en niet de gerapporteerde gevolgen in de echte wereld. De zorg gaat daarom over de manier waarop een evaluatie de interpretatie kan beïnvloeden, vooral wanneer de score ervan wordt behandeld als een directe samenvatting van de creatieve kwaliteit.
Het werk is ook relevant voor beweringen dat taalmodellen menselijke prestaties bij creatieve taken benaderen of zelfs overtreffen. Een sterke score van een geautomatiseerde beoordelaar is niet noodzakelijkerwijs een bewijs van brede creatieve superioriteit als de beoordelaar slecht is afgestemd op het menselijk oordeel. Tegelijkertijd zegt de bron niet dat mensen betrouwbare of onpartijdige rechters zijn, en laat het ook niet zien dat door AI gegenereerde verhalen over het algemeen minder creatief zijn. Het rapporteert een meningsverschil tussen de evaluatiemethoden. Dat meningsverschil laat ruimte voor een zorgvuldiger lezing van vergelijkende resultaten, waarbij het gedrag van de beoordelaar wordt behandeld als onderdeel van het bewijsmateriaal in plaats van als een neutrale achtergrond.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
Which component of an AI application is the machine-learning model itself?
Wat je nu moet bekijken
Het artikel is een voordruk en de brontekst geeft geen details over de beoordelaars, jurymodellen, aanwijzingen, statistische methoden of de omvang en samenstelling van de verhaalsteekproef. Vervolgwerk moet testen of de gerapporteerde mismatch geldt voor genres, talen, modellen en onafhankelijke groepen lezers.
De belangrijkste onbekende is hoe de experimenten in detail werden uitgevoerd. De verstrekte bron vermeldt niet hoeveel menselijke en door AI gegenereerde verhalen zijn beoordeeld, welke taalmodellen de AI-verhalen hebben voortgebracht, hoe de elf creativiteitsdimensies zijn gedefinieerd of hoe menselijke beoordelingen zijn samengevoegd. Deze details zijn belangrijk voor het beoordelen van de kracht en reikwijdte van de gerapporteerde conclusies. Ze zouden de lezers ook helpen begrijpen hoe nauw de gerapporteerde vergelijking de omstandigheden weerspiegelt waaronder de resultaten later zouden kunnen worden geïnterpreteerd of gereproduceerd.
Bij verder onderzoek zou moeten worden gekeken naar de objectieve maatstaven en LLM-juryleden die bij de vergelijking zijn gebruikt. De samenvatting noemt ze niet, beschrijft hun aanwijzingen niet, en geeft niet aan of de juryleden tijdens herhaalde evaluaties op betrouwbaarheid zijn getest. Resultaten kunnen afhangen van de keuze van de metriek, het beoordelingsmodel, de instructies, de lengte van het verhaal of de schrijfstijl. Zonder deze bijzonderheden is de algemene bevinding informatief, maar moeilijk te koppelen aan een specifieke evaluatieopzet. Door de opzet te verduidelijken, zou het gemakkelijker worden om een algemene beperking te onderscheiden van een resultaat dat aan bepaalde hulpmiddelen of instructies is gekoppeld.
Replicatie zal laten zien of het gerapporteerde patroon verder reikt dan de WritingPrompts- en korte verhalen. Nuttige tests zijn onder meer andere genres, talen, modelfamilies, menselijke lezerspopulaties en creatieve formaten. De bron laat ook open of verbeterde evaluatiemethoden menselijke oordelen beter kunnen weerspiegelen, of dat sommige aspecten van creativiteit resistent zullen blijven tegen een enkele automatische score. Deze open vragen definiëren de volgende fase van de interpretatie: bepalen hoe duurzaam de mismatch is en welke soorten beoordelingen deze kunnen aanpakken.