Co se stalo
Předtisk předložený arXiv 24. srpna zkoumá, zda automatické systémy dokážou spolehlivě vyhodnotit kreativitu v příbězích generovaných velkými jazykovými modely. Autoři porovnávají lidské hodnocení s objektivními metrikami a hodnoceními vytvořenými soudci založenými na LLM.
Článek s názvem „Meze automatického hodnocení kreativity ve velkých jazykových modelech“ zkoumá propast mezi výpočetními měřítky kreativity a lidským úsudkem. Autoři využívají krátké příběhy z datového souboru WritingPrompts, včetně příběhů napsaných lidmi a příběhů generovaných systémy AI, a shromažďují lidská hodnocení napříč 11 dimenzemi kreativity. Zdroj neidentifikuje hodnotitele ani neuvádí počet článků v abstraktu. V tomto smyslu je srovnání studie o vztahu mezi různými druhy hodnocení, nikoli o nahrazení jedné konečné definice kreativity jinou. Abstrakt rámuje práci jako zkoumání spolehlivosti a souladu.
Tato lidská hodnocení jsou srovnávána se dvěma širokými třídami automatizovaného hodnocení: objektivní metriky a systémy LLM-as-a-Judge. Dokument uvádí „podstatný nesoulad“ mezi automatizovanými výsledky a lidskými hodnoceními. Uvádí také, že široce používané automatické metriky vykazovaly téměř nulovou korelaci s lidskými úsudky pro příběhy vytvořené lidmi i vytvořené AI. Výsledek je prezentován na úrovni korespondence mezi skóre a hodnocením. V dodaném textu neidentifikuje jedinou metriku jako odpovědnou za nesoulad, takže široká kategorie objektivních metrik by neměla být chápána jako posouzení každé metriky.
Nejkonkrétnější zjištění se týká soudců působících v LLM. Podle abstraktu tito porotci systematicky upřednostňovali příběhy generované umělou inteligencí, přičemž upřednostňovali jejich stylistické vlastnosti před nepředvídatelností a dalšími kvalitami spojenými s texty vytvořenými lidmi. Zdroj to uvádí jako výsledek experimentů autorů; nestanoví, že se takto chová každý soudce LLM nebo že výsledek platí pro veškeré tvůrčí psaní. Tato kvalifikace udržuje zjištění vázané na uvedené srovnání. Odděluje také preferenci pozorovanou v experimentu od obecného závěru o literární hodnotě obou zdrojů, což abstrakt nečiní.
Podrobnosti o zdroji: arxiv.org ↗
Proč na tom záleží
Zjištění zpochybňují běžný předpoklad, že kvalitu kreativy lze spolehlivě měřit pouze pomocí automatického bodování. Pokud hodnotící systémy odměňují stylistické signály spojené s psaním generovaným umělou inteligencí, zatímco postrádají vlastnosti, které lidé oceňují, mohly by zkreslit srovnání mezi lidmi a jazykovými modely.
Kreativita je často považována za jedinou kvalitu, kterou lze shrnout do skóre, ale článek ji popisuje jako multidimenzionální a subjektivní. Jeho hlášené téměř nulové korelace naznačují, že metrika může produkovat číslo, aniž by zachycovala aspekty kreativní práce, které lidští čtenáři považují za důležité. Tento rozdíl je důležitý, když se automatizovaná hodnocení používají k porovnávání modelů, vedení vývoje nebo hodnocení generovaného obsahu. Znamená to také, že zdánlivá přesnost automatizovaného výsledku by měla být posuzována odděleně od toho, zda výsledek odráží vlastnosti, které mají čtenáři posoudit.
Hlášená preference příběhů generovaných umělou inteligencí vyvolává konkrétní obavy ohledně měření. Pokud soudce LLM odměňuje rozpoznatelné stylistické vzory snadněji než překvapení nebo nepředvídatelnost, systém se může zdát kreativnější, protože odpovídá preferencím porotce, nikoli proto, že vytváří psaní, které si lidští čtenáři více cení. Zdroj nepopisuje nasazení ani zdokumentované institucionální rozhodnutí, takže se jedná spíše o praktické důsledky zjištění studie než o hlášené důsledky v reálném světě. Jde tedy o to, jak může hodnocení utvářet interpretaci, zvláště když je jeho skóre považováno za přímé shrnutí kvality kreativy.
Práce je relevantní i pro tvrzení, že jazykové modely se přibližují nebo převyšují lidský výkon v tvůrčích úkolech. Silné skóre od automatizovaného hodnotitele nemusí být nutně důkazem široké tvůrčí převahy, pokud je hodnotitel špatně sladěn s lidským úsudkem. Zdroj zároveň neříká, že lidé jsou spolehliví nebo nezaujatí soudci, ani neukazuje, že příběhy generované AI jsou celkově méně kreativní. Uvádí neshodu mezi metodami hodnocení. Tento nesouhlas ponechává prostor pro pečlivější čtení srovnávacích výsledků, ve kterých je chování hodnotitele považováno spíše za součást důkazů než za neutrální pozadí.
Interaktivní mechanismus: Jak to vlastně funguje
Interaktivně prozkoumejte základní technologii tohoto vývoje.
Which component of an AI application is the machine-learning model itself?
Na co se dále dívat
Příspěvek je předtisk a zdrojový text neuvádí podrobnosti o hodnotitelích, modelech posuzovatelů, výzvách, statistických metodách ani velikosti a složení vzorku příběhu. Následná práce by měla otestovat, zda nahlášený nesoulad platí napříč žánry, jazyky, modely a nezávislými skupinami čtenářů.
Hlavní neznámou je, jak byly experimenty provedeny podrobně. Poskytnutý zdroj neuvádí, kolik lidských příběhů a příběhů vytvořených umělou inteligencí bylo hodnoceno, které jazykové modely vytvořily příběhy umělé inteligence, jak bylo definováno 11 dimenzí kreativity nebo jak byla agregována lidská hodnocení. Tyto podrobnosti jsou důležité pro posouzení síly a rozsahu uvedených závěrů. Čtenářům by také pomohly pochopit, jak přesně uvedené srovnání odráží podmínky, za kterých by mohly být výsledky později interpretovány nebo reprodukovány.
Další kontrola by měla prozkoumat objektivní metriky a soudce LLM použité při srovnání. Abstrakt je nejmenuje, nepopisuje jejich podněty ani neuvádí, zda byli porotci testováni na spolehlivost v rámci opakovaných hodnocení. Výsledky mohou záviset na volbě metriky, modelu posuzovatele, instrukcích, délce příběhu nebo stylu psaní. Bez těchto podrobností je široké zjištění informativní, ale je obtížné jej propojit s konkrétním nastavením hodnocení. Vyjasnění nastavení by usnadnilo odlišení obecného omezení od výsledku vázaného na konkrétní nástroje nebo pokyny.
Replikace ukáže, zda nahlášený vzor přesahuje datovou sadu WritingPrompts a krátké příběhy. Užitečné testy by zahrnovaly další žánry, jazyky, modelové rodiny, populace lidských čtenářů a kreativní formáty. Zdroj také ponechává otevřenou otázku, zda vylepšené metody hodnocení mohou lépe odrážet lidské úsudky, nebo zda některé aspekty kreativity zůstanou odolné vůči jakémukoli automatickému skóre. Tyto otevřené otázky definují další fázi interpretace: určení, jak trvalý nesoulad je a jaké druhy hodnocení jej mohou řešit.