Mi történt
A arXiv-hez augusztus 24-én benyújtott előnyomat azt vizsgálja, hogy az automatikus rendszerek képesek-e megbízhatóan értékelni a kreativitást a nagy nyelvi modellek által generált történetekben. A szerzők az emberi értékeléseket objektív mérőszámokkal és LLM-alapú bírák által készített értékelésekkel hasonlítják össze.
A „A kreativitás automatikus értékelésének határai nagy nyelvi modellekben” című tanulmány a kreativitás számítási mérőszámai és az emberi ítélőképesség közötti szakadékot vizsgálja. A szerzők a WritingPrompts adatkészletből származó novellákat használnak, beleértve az emberek által írt történeteket és az AI-rendszerek által generált történeteket, és emberi értékeléseket gyűjtenek a kreativitás 11 dimenziójáról. A forrás nem azonosítja az értékelőket, és absztraktjában nem adja meg a történetek számát. Ebben az értelemben a tanulmány összehasonlítása a különböző értékelési formák közötti kapcsolatról szól, nem pedig a kreativitás egyik végső meghatározásának másikkal való helyettesítéséről. Az absztrakt a megbízhatóság és az összhang vizsgálataként fogalmazza meg a munkát.
Ezeket az emberi értékeléseket az automatizált értékelés két széles osztályával hasonlítják össze: az objektív mérőszámokkal és az LLM-mint bíró rendszerekkel. A cikk „lényeges eltérésekről” számol be az automatizált eredmények és az emberi értékelések között. Arról is beszámol, hogy a széles körben használt automatikus mérőszámok közel nulla korrelációt mutattak az emberi ítéletekkel mind az ember által írt, mind a mesterséges intelligencia által generált történetek esetében. Az eredményt a pontszámok és az értékelések közötti megfelelés szintjén mutatjuk be. A mellékelt szövegben egyetlen mérőszámot sem azonosít az eltérésért felelősként, ezért az objektív mérőszámok széles kategóriája nem értelmezhető minden mérőszámra vonatkozó ítéletként.
A legspecifikusabb megállapítás az LLM-alapú bírókra vonatkozik. Az absztrakt szerint ezek a bírák szisztematikusan előnyben részesítették a mesterséges intelligencia által generált történeteket, előnyben részesítve azok stílusjegyeit a kiszámíthatatlanság és az ember által írt szövegekhez kapcsolódó egyéb tulajdonságok helyett. A forrás ezt a szerzők kísérleteinek eredményeként mutatja be; nem állapítja meg, hogy minden LLM-bíró így viselkedik, vagy hogy az eredmény minden kreatív írásra vonatkozik. Ez a minősítés köti a megállapítást a jelentett összehasonlításhoz. Ezenkívül elválasztja a kísérletben megfigyelt preferenciát az egyik forrás irodalmi értékére vonatkozó általános következtetéstől, amelyet az absztrakt nem tesz.
Miért számít
Az eredmények megkérdőjelezik azt az általános feltevést, hogy a kreatív minőség megbízhatóan mérhető egyedül az automatizált pontozással. Ha az értékelő rendszerek az AI által generált íráshoz kapcsolódó stilisztikai jeleket díjazzák, miközben hiányoznak az emberi olvasók által értékelt tulajdonságok, akkor torzíthatják az emberek és a nyelvi modellek összehasonlítását.
A kreativitást gyakran egyetlen minőségként kezelik, amelyet egy pontszámmal össze lehet foglalni, de a tanulmány többdimenziósnak és szubjektívnek írja le. A közölt, nullához közeli korrelációk arra utalnak, hogy egy metrika képes számot adni anélkül, hogy megragadná a kreatív munka azon szempontjait, amelyeket az emberi olvasók fontosnak tartanak. Ez a megkülönböztetés akkor számít, ha automatizált értékeléseket használnak a modellek összehasonlítására, a fejlesztés irányítására vagy a generált tartalom értékelésére. Ez azt is jelenti, hogy az automatizált eredmény látszólagos pontosságát külön kell vizsgálni attól, hogy az eredmény tükrözi-e azokat a tulajdonságokat, amelyeket az olvasóknak értékelniük kell.
A mesterséges intelligencia által generált történetek preferenciája sajátos mérési aggályt vet fel. Ha egy LLM-bíró könnyebben jutalmazza a felismerhető stilisztikai mintákat, mint a meglepetést vagy a kiszámíthatatlanságot, akkor egy rendszer kreatívabbnak tűnhet, mert megfelel a bíró preferenciáinak, nem pedig azért, mert olyan írásokat készít, amelyeket az emberi olvasók jobban értékelnek. A forrás nem ír le telepítést vagy dokumentált intézményi döntést, így ezek inkább a tanulmány eredményeinek gyakorlati vonatkozásai, mint a jelentett valós következmények. Ezért az aggodalomra ad okot, hogy egy értékelés hogyan alakíthatja az értelmezést, különösen akkor, ha a pontszámot a kreatív minőség közvetlen összegzéseként kezelik.
A munka azokra az állításokra is vonatkozik, amelyek szerint a nyelvi modellek megközelítik vagy meghaladják az emberi teljesítményt a kreatív feladatokban. Az automatizált értékelő erős pontszáma nem feltétlenül a széles körű kreatív felsőbbrendűség bizonyítéka, ha az értékelő rosszul igazodik az emberi ítélőképességhez. Ugyanakkor a forrás nem állítja, hogy az emberek megbízható vagy elfogulatlan bírók lennének, és azt sem, hogy az AI által generált történetek összességében kevésbé kreatívak. Az értékelési módszerek közötti nézeteltérésről számol be. Ez a nézeteltérés teret enged az összehasonlító eredmények alaposabb olvasatának, amelyben az értékelő viselkedését a bizonyíték részeként kezelik, nem pedig semleges háttérként.
Interaktív mechanizmus: Hogyan működik valójában
Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.
Which component of an AI application is the machine-learning model itself?
Mit nézzünk ezután
A dolgozat előzetes nyomtatott, a forrásszöveg nem ad részleteket az értékelőkről, a bírálati modellekről, a felszólításokról, a statisztikai módszerekről vagy a történetminta méretéről és összetételéről. A nyomon követési munkának meg kell vizsgálnia, hogy a jelentett eltérés fennáll-e a műfajok, nyelvek, modellek és független olvasói csoportok között.
A fő ismeretlen az, hogy a kísérleteket hogyan végezték el részletesen. A megadott forrásból nem derül ki, hogy hány ember és mesterséges intelligencia által generált történetet értékeltek, mely nyelvi modellek hozták létre a mesterséges intelligencia történeteket, hogyan határozták meg a 11 kreativitásdimenziót, vagy hogyan összesítették az emberi értékeléseket. Ezek a részletek fontosak a közölt következtetések erősségének és terjedelmének megítéléséhez. Segítenek az olvasóknak abban is, hogy megértsék, a közölt összehasonlítás mennyire tükrözi azokat a feltételeket, amelyek mellett az eredmények később értelmezhetők vagy reprodukálhatók.
A további vizsgálatnak meg kell vizsgálnia az összehasonlítás során használt objektív mérőszámokat és LLM-bírókat. Az absztrakt nem nevezi meg őket, nem írja le az utasításaikat, és nem jelzi, hogy a bírák megbízhatóságát tesztelték-e ismételt értékelések során. Az eredmények függhetnek a mérőszámtól, a bírói modelltől, az utasításoktól, a történet hosszától vagy az írásmódtól. Ezen adatok nélkül az átfogó megállapítás informatív, de nehéz összekapcsolni egy konkrét értékelési rendszerrel. A beállítás tisztázása megkönnyítené az általános korlátozás és az adott eszközökhöz vagy utasításokhoz kötött eredmény megkülönböztetését.
A replikáció megmutatja, hogy a jelentett minta túlmutat-e a WritingPrompts adatkészleten és a rövid történeteken. A hasznos tesztek között szerepelnének más műfajok, nyelvek, modellcsaládok, olvasói populációk és kreatív formátumok is. A forrás azt is nyitva hagyja, hogy a továbbfejlesztett értékelési módszerek jobban tükrözik-e az emberi ítéleteket, vagy a kreativitás egyes aspektusai ellenállnak-e egyetlen automatikus pontszámnak is. Ezek a nyitott kérdések határozzák meg az értelmezés következő szakaszát: annak meghatározását, hogy mennyire tartós az eltérés, és milyen értékelésekkel lehet kezelni.