Co se stalo
Tým vědců Microsoft Research provedl rozsáhlou randomizovanou studii během Mezinárodní konference o strojovém učení v roce 2026 (ICML) v Soulu. Recenzenti byli rozděleni mezi přísnou zásadu, která zakazovala použití velkých jazykových modelů (LLM) pro jakoukoli část procesu hodnocení, a tolerantní zásadu, která umožňovala LLM pro úkoly na pozadí, ale ne pro posuzování papírových zásluh. Studie zahrnovala 24 661 přihlášených prací a 17 886 recenzentů. Míra přijetí byla prakticky identická (27 % vs. 26,5 %) a průměrné hodnocení hodnocení se lišilo pouze o 0,01 bodu. Anonymní pokonferenční průzkum mezi 1 486 recenzenty odhalil, že 22,5 % z těch, kteří byli instruováni, aby nepoužívali AI, přiznalo, že tak učinilo, a to především kvůli řízení pracovní zátěže a vytváření konceptu textu. Analýza detekce textu ukázala, že pouze 52,2 % recenzí v rámci přísné politiky vypadalo jako plně napsaných lidmi, ve srovnání s 37,0 % v rámci tolerantní politiky.
Experiment byl začleněn do pracovního postupu revize ICML 2026. Recenzenti se mohli rozhodnout buď pro „konzervativní“ cestu, která zakazovala jakoukoli pomoc LLM, nebo „povolenou“ cestu, která umožňovala LLM pro vyhledávání literatury, shrnutí a vylepšování jazyka recenze, ale ne pro hodnocení vědeckého přínosu.
Statistická analýza neprokázala žádný významný rozdíl v míře přijetí (27 % vs. 26,5 %) ani v průměrném skóre (3,31 vs. 3,32 ze 6). Délka recenze se v rámci permisivní politiky prodloužila o 5,5–7 % a experti hodnotili tyto recenze v kvalitě mírně vyšší, i když srovnání mezi recenzenty nenalezlo žádnou smysluplnou výhodu.
Průzkum po konferenci s 1 486 respondenty odhalil, že 22,5 % přísných recenzentů stejně používá LLM, přičemž jako primární motivaci uvedli velké pracovní vytížení a nejasná pravidla. Výzkumníci použili detektor textu AI Pangram, který pouze asi polovinu přísných recenzí klasifikoval jako plně psané lidmi, ve srovnání s 37 % v rámci permisivní politiky, což podtrhuje nedokonalosti detektoru.
Podrobnosti o zdroji: newscientist.com ↗
Proč na tom záleží
Zjištění naznačují, že přímé zákazy pomoci umělé inteligence při akademickém vzájemném hodnocení je obtížné vynutit, což vyvolává obavy o integritu vědeckého hodnocení na konferencích o počítačové vědě a potenciálně v dalších oborech. Pokud recenzenti běžně spoléhají na LLM při shrnutí článků nebo návrhů zpětné vazby, jemné předsudky nebo chyby způsobené modely by mohly ovlivnit rozhodnutí o přijetí, i když se celková míra přijetí nezmění. Studie také zdůrazňuje omezení současných detektorů AI-textu, které nesprávně klasifikují podstatnou část recenzí. Tyto poznatky jsou relevantní pro organizátory konferencí, redaktory časopisů a finanční agentury, které zvažují, jak regulovat používání umělé inteligence při vzájemném hodnocení, aby byla zachována transparentnost a odpovědnost.
Problémy s prosazováním naznačují, že jednoduché zákazy zásad nemusí stačit k tomu, aby zabránily přezkoumání za pomoci umělé inteligence, což může ohrozit vnímanou spravedlnost procesu vzájemného hodnocení.
Mírný dopad na metriky přijetí naznačuje, že asistence AI dramaticky nemění výsledky, ale nedostatek transparentnosti v používání AI by mohl maskovat jemné vlivy na úsudky recenzentů.
Omezení detektorů znamenají, že spoléhání se na automatické nástroje při označování obsahu generovaného umělou inteligencí může vést k falešným pozitivním výsledkům nebo může chybět mnoho kontrol za pomoci umělé inteligence, což komplikuje sledování souladu.
Interaktivní mechanismus: Jak to vlastně funguje
Interaktivně prozkoumejte základní technologii tohoto vývoje.
crm_get_transaction(id='4092').Why can ethical evaluation not be reduced to one model score?
Na co se dále dívat
Budoucí politické experimenty na velkých konferencích, vývoj spolehlivějších nástrojů pro detekci textu AI a veškeré formální pokyny vydané odbornými společnostmi o pomoci umělé inteligence při vzájemném hodnocení. Sledování toho, zda konference přijímají hybridní modely – jako je povinné zveřejňování používání AI nebo omezený rozsah nástrojů AI – ukáže, jak komunita vyvažuje zvýšení efektivity s rizikem skryté automatizace.
Ať už velké konference přijmou požadavky na zveřejňování pro recenze s pomocí AI nebo vypracují standardizované pokyny pro použití AI.
Pokroky v přesnosti detekce AI-textu, které by mohly umožnit spolehlivější prosazování zásad revize.
Potenciální politická prohlášení od společností, jako je Asociace pro výpočetní stroje (ACM) nebo Institut elektrických a elektronických inženýrů (IEEE), která se zabývají používáním umělé inteligence ve vědeckém hodnocení.