Wat is er gebeurd
Onderzoekers van de Wharton School publiceerden een studie in Nature Computational Science waaruit blijkt dat de zelfbeoordeling van auteurs van hun eigen AI-papers een sterkere voorspeller is van toekomstige academische citaten dan standaard peer-review-scores. De studie analyseerde gegevens van de Internationale Conferentie over Machine Learning van 2023 (ICML) en ontdekte dat ICML deze methode voor zelfbeoordeling van discrepantie sindsdien heeft opgenomen in het beoordelingsproces van 2026 om papieren te markeren voor nader onderzoek door gebiedsvoorzitters.
Wharton School-onderzoekers, waaronder professoren Weijie Su en Bingxin Zhao en promovendus Buxin Su, publiceerden op 24 augustus een onderzoek in Nature Computational Science. In het onderzoek werd onderzocht of de zelfbeoordeling van auteurs van hun eigen artikelen zou kunnen dienen als een betrouwbare indicator van de wetenschappelijke impact op het gebied van kunstmatige intelligentie.
Het onderzoeksteam analyseerde gegevens van de Internationale Conferentie over Machine Learning van 2023 (ICML). Ze verzamelden zelfranglijsten van 1.342 auteurs met 2.592 inzendingen. Auteurs werd gevraagd hun artikelen te rangschikken op basis van waargenomen wetenschappelijke kwaliteit voordat peer reviews werden vrijgegeven. De uiteindelijke analyse omvatte 797 auteurs en 1.527 unieke artikelen na matching met citatiegegevens.
Uit het onderzoek bleek dat artikelen die door hun auteurs het hoogst waren gerangschikt, in de daaropvolgende 16 maanden gemiddeld twee keer zoveel citaties ontvingen als artikelen die het laagst waren gerangschikt. Dit patroon gold voor zowel geaccepteerde als afgewezen papieren. Bovendien voorspelden auteursranglijsten toekomstige citatietellingen nauwkeuriger dan scores van peer-reviews. Van de 22 artikelen in de steekproef die meer dan 150 citaties ontvingen, werden er 17 door ten minste één auteur op de eerste plaats gezet.
Op basis van deze bevindingen stelden de onderzoekers een systeem voor waarbij verschillen tussen auteursranglijsten en recensentenscores worden gebruikt om artikelen te markeren voor nader onderzoek. ICML heeft deze aanpak opgenomen in het beoordelingsproces van 2026. In een gerandomiseerd experiment schreven gebiedsvoorzitters die de discrepantiecategorieën konden zien, ongeveer 71% meer commentaartekst per paper en communiceerden ze vaker met recensenten vergeleken met degenen die de categorieën niet konden zien.
Waarom het ertoe doet
Het AI-onderzoeksveld groeit sneller dan de pool van ervaren peer reviewers, waardoor een knelpunt ontstaat bij het identificeren van werk met een grote impact. Deze studie biedt een praktisch, datagestuurd mechanisme om beperkte beoordelingsmiddelen effectiever toe te wijzen. Door zelfrangschikkingen te gebruiken om discrepanties met de scores van recensenten te signaleren, kunnen conferenties de aandacht vestigen op artikelen die anders over het hoofd zouden worden gezien of verkeerd zouden worden beoordeeld. Deze aanpak pakt een structurele inefficiëntie in academisch publiceren aan zonder het menselijk oordeel te vervangen, waardoor mogelijk de algehele kwaliteit en relevantie van geaccepteerd AI-onderzoek wordt verbeterd.
De snelle groei van AI-onderzoek heeft de beschikbaarheid van ervaren peer reviewers overtroffen, waardoor het moeilijk wordt om werk met een hoge impact alleen via traditionele methoden te identificeren. Deze studie biedt een schaalbare oplossing door gebruik te maken van de eigen beoordelingen van auteurs om prioriteit te geven aan artikelen die extra onderzoek vereisen.
De methode vervangt peer review niet, maar breidt deze uit door discrepanties te benadrukken die erop kunnen wijzen dat een artikel door reviewers onder- of overgewaardeerd wordt. Hierdoor kunnen gebiedsvoorzitters hun beperkte tijd effectiever indelen, waarbij ze zich kunnen concentreren op gevallen waarin in het beoordelingsproces mogelijk belangrijke nuances ontbreken.
Het onderzoek erkent dat het aantal citaties een onvolmaakte maatstaf is voor kwaliteit, omdat ze kunnen worden beïnvloed door de populariteit van het onderwerp, de timing en de zichtbaarheid van de auteur. De sterke correlatie tussen zelfbeoordeling en citaties suggereert echter dat auteurs een redelijk beeld hebben van de potentiële impact van hun werk, die kan worden aangewend om de efficiëntie van het beoordelingsproces te verbeteren.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
Which component of an AI application is the machine-learning model itself?
Wat je nu moet bekijken
Controleer of andere grote AI- en machine learning-conferenties soortgelijke mechanismen voor zelfrangschikking in hun beoordelingsprocessen toepassen. Kijk uit naar vervolgstudies die evalueren of deze methode daadwerkelijk de kwaliteit van geaccepteerde artikelen verbetert of dat het alleen maar de werklast van de reviewer verhoogt. Kijk daarnaast of de academische gemeenschap gestandaardiseerde protocollen ontwikkelt voor zelfrangschikking om consistentie te garanderen en manipulatie op verschillende locaties te voorkomen.
Het is onduidelijk of deze methode zal worden overgenomen door andere grote AI-conferenties zoals NeurIPS of ICLR. Het succes van de implementatie van ICML kan dienen als proof of concept voor de bredere academische gemeenschap.
Toekomstig onderzoek zal moeten uitwijzen of het toegenomen toezicht op gemarkeerde artikelen leidt tot betere acceptatiebeslissingen of dat het eenvoudigweg de lasten voor voorzitters en beoordelaars vergroot. In het huidige onderzoek werd de deelname aan het beoordelingsproces gemeten, maar werd geen verbetering in de kwaliteit van de uiteindelijke beslissingen vastgesteld.
Er is een potentieel risico op manipulatie, hoewel de onderzoekers het systeem hebben ontworpen om dergelijke prikkels te verminderen door de richting van de discrepantie voor gebiedsstoelen te verbergen. Het zal de komende jaren belangrijk zijn om te monitoren hoe auteurs en reviewers zich aan dit nieuwe proces aanpassen.