Wat is er gebeurd
The Guardian meldt dat de inzendingen van het Australische parlementaire onderzoek worden beïnvloed door door AI gegenereerde verkeerde informatie, waaronder verzonnen onderzoeken en onjuiste citaten die worden toegeschreven aan echte academici en auteurs. Uit de analyse kwamen ten minste 39 inzendingen naar voren die referenties bevatten die niet leken te bestaan, terwijl meer dan 100 artikelen ChatGPT URL-tags in referentielinks bevatten.
The Guardian meldt dat tientallen inzendingen over het hele politieke spectrum naar de huidige parlementaire onderzoeken van Australië verwijzingen bevatten die leken te zijn gegenereerd of gewijzigd door grote taalmodellen. De gerapporteerde fouten omvatten verzonnen onderzoeken, niet-bestaande artikelen, onjuiste paginagegevens en echte onderzoekers die in verband werden gebracht met werk dat ze niet hadden geproduceerd. De inzendingen hadden betrekking op beleidsterreinen als huiselijk geweld, zelfmoord, ongelijkheid op het gebied van huisvesting en desinformatie over het klimaat.
Het rapport beschrijft een onderwerping aan een onderzoek naar familiegeweld en zelfmoord, waarbij een niet-bestaande referentie en onjuiste onderzoeksresultaten werden toegeschreven aan Divna Haslam, universitair hoofddocent en klinisch psycholoog aan de Universiteit van Queensland. Haslam vertelde de Guardian dat het citaat voldoende plausibel leek om iemand te misleiden die slechts een vluchtige beoordeling uitvoerde. De indienende organisatie, Drilldown Reports, zei dat ze AI in haar onderzoeksproces had gebruikt en later de fouten had geïdentificeerd, maar de deadline voor het corrigeren van de oorspronkelijke indiening had gemist.
The Guardian zegt dat het een aangepast programma heeft gebouwd dat referenties uit onderzoeksdocumenten haalde en deze doorzocht met Crossref en Google Scholar. Het controleerde ook digitale objectidentificatoren indien beschikbaar en beoordeelde handmatig documenten waarin ten minste 20% van de referenties niet kon worden gematcht. Het resulterende cijfer was minstens 39 inzendingen met schijnbaar gehallucineerde referenties. The Guardian karakteriseerde dat aantal als conservatief omdat de methode alleen fouten kon detecteren in documenten die referenties bevatten, en niet in niet-ondersteunde tekst die zonder citaten was geproduceerd.
Uit het onderzoek zijn ook meer dan 100 artikelen gebleken die URL-tags ChatGPT in referentielinks bevatten. The Guardian waarschuwt dat dergelijke tags niet bewijzen dat iemand ChatGPT rechtstreeks heeft gebruikt, omdat materiaal mogelijk is gekopieerd van een externe bron. Het zegt ook dat niet-overeenkomende citaten kunnen duiden op AI-gebruik, maar dit niet in alle gevallen aantonen. Het rapport presenteert zijn bevindingen daarom als bewijs van schijnbare door AI gegenereerde of door AI ondersteunde fouten, en niet als een definitieve meting van al het AI-gebruik in parlementaire inzendingen.
Brongegevens: theguardian.com ↗
Waarom het ertoe doet
Parlementaire onderzoeken zijn bedoeld om wetgevers getuigenissen te geven van deskundigen, organisaties en leden van het publiek. Als verzonnen citaten in dat proces terechtkomen en als geloofwaardig worden behandeld, kunnen beslissingen worden gebaseerd op niet-bestaand onderzoek en kan het vertrouwen van het publiek in democratische instellingen worden verzwakt.
Inzendingen voor parlementaire onderzoeken kunnen bepalen hoe commissies publieke problemen begrijpen en voorgestelde wetten of programma's beoordelen. The Guardian meldt dat in sommige commissierapporten inzendingen werden geciteerd die verwijzingen bevatten die verzonnen leken. Dat schept een risico dat een niet-ondersteunde claim institutioneel gewicht kan winnen, simpelweg omdat deze een officieel proces voor het verzamelen van bewijsmateriaal is ingegaan.
De praktische schade beperkt zich niet tot één enkele onjuiste voetnoot. Onderzoekers geciteerd door de Guardian zeggen dat verzonnen citaten de keten kunnen doorbreken tussen een beleidsclaim en het bewijsmateriaal dat deze zogenaamd ondersteunt. Op gebieden als huiselijk geweld, gezondheidszorg, immigratie en klimaatbeleid kunnen beslissingen op basis van niet-bestaand onderzoek de aandacht verkeerd richten, het debat verdraaien of de bescherming van getroffen mensen ondermijnen. De bron stelt niet vast dat enig specifiek Australisch beleid tot stand is gekomen vanwege een hallucinerend citaat, zodat de consequentie eerder een risico dan een aangetoonde uitkomst blijft.
De aflevering illustreert ook een feedbacklus waarbij generatieve AI en zoeksystemen betrokken zijn. The Guardian meldt dat de AI-samenvatting van Google een valse referentie soms als authentiek beschouwde, terwijl de ChatGPT- en Google-systemen de onderzoeksinzending met de fout konden aanhalen. Dat kan ervoor zorgen dat een onnauwkeurig document onafhankelijk geverifieerd lijkt, zelfs als het onderliggende onderzoek niet bestaat. Het rapport toetst niet op onafhankelijke wijze de volledige reeks omstandigheden waarin deze systemen dergelijke samenvattingen produceren, maar documenteert het risico aan de hand van de onderzochte voorbeelden.
Het bredere institutionele vraagstuk is verantwoording. De richtlijnen van de Australische Senaat waarschuwen indieners naar verluidt dat AI de informatiekwaliteit kan beïnvloeden en dat nauwkeurigheid de verantwoordelijkheid van de indiener blijft. De door The Guardian geciteerde commissievoorzitter zei dat commissies materiaal van wisselende kwaliteit ontvangen en tijdens het onderzoeksproces bewijsmateriaal moeten ondervragen. De bron laat in het midden of commissies momenteel over het personeel, de technische hulpmiddelen of de procedures beschikken die nodig zijn om dat onderzoek consistent uit te voeren.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
Why can ethical evaluation not be reduced to one model score?
Wat je nu moet bekijken
De directe vragen zijn of parlementaire commissies strengere regels voor verificatie of openbaarmaking zullen invoeren, hoe indieners reeds ingediend materiaal corrigeren en of overheidsinstanties voldoende middelen hebben om referenties te controleren. The Guardian vroeg ook om antwoorden van OpenAI en Google over hun rol bij het versterken van onnauwkeurige verwijzingen via AI-systemen en zoeksamenvattingen.
Let op formele wijzigingen in de richtlijnen voor indiening en de beoordelingspraktijken van commissies. The Guardian meldt dat Christian Downie, een professor aan de Australian National University, opriep tot nieuwe richtlijnen die waarheidsgetrouwheid zouden aanmoedigen en tegelijkertijd een open onderzoeksproces zouden behouden. Mogelijke maatregelen zijn onder meer een duidelijkere openbaarmaking van AI-hulp, verplichte controles op geciteerde bronnen, correctieperioden na indiening of strengere eisen voor organisaties die op onderzoek gebaseerd bewijsmateriaal indienen. De bron zegt niet dat dergelijke hervormingen al zijn doorgevoerd.
Kijk of betrokken onderzoekers en indieners om correcties of publieke opheldering vragen. The Guardian meldt dat Nicole Gurran in verband werd gebracht met werk dat niet bestond en dat Margaret Simons blijkbaar in verband werd gebracht met een niet-bestaand artikel. Drilldown Reports zei dat het fouten had gevonden in een vervolginzending, terwijl het National Rational Energy Network niet reageerde op het verzoek van de Guardian om commentaar. De status van elke betwiste inzending en of commissies hun rapporten wijzigen, blijft een belangrijke onopgeloste vraag.
Kijk uit naar bewijsmateriaal over de omvang en verspreiding van het probleem buiten documenten met formele referenties. Het programma van The Guardian kan geen door AI gegenereerd proza identificeren dat geen citaten bevat, en waarschuwt dat het aantal van 39 inzendingen het gebruik van AI onderschat. Tegelijkertijd kunnen commerciële AI-detectoren valse positieven opleveren, dus elk toekomstig handhavingssysteem zal niet-ondersteunde beschuldigingen moeten onderscheiden van verifieerbare citatiefouten.
Bekijk hoe OpenAI en Google reageren op de gerapporteerde feedbacklus. OpenAI vertelde de Guardian dat het verminderen van hallucinaties een voortdurend onderzoeksgebied blijft en adviseerde gebruikers om ChatGPT als een eerste versie te beschouwen in plaats van als een definitieve bron, waarbij citaten, gegevens en externe referenties worden geverifieerd. Google zei dat zijn AI-overzichten erop gericht zijn webinhoud te matchen met zoektermen, vergelijkbaar met traditioneel zoeken. Deze antwoorden geven geen oplossing voor de vraag of AI-samenvattingen beweringen uit documenten met verzonnen referenties naar boven moeten halen of reproduceren, waardoor de effectiviteit van bestaande waarborgen onzeker blijft.