Mi történt
A arXiv-hez augusztus 23-án benyújtott tanulmány arról számol be, hogy egy felmérés-észlelési csatorna nagyobb hatást gyakorolhat az AION-1 kimenetére, mint a csillagászati képadatok, amelyeket értelmezni hivatott. A szerzők azt mondják, hogy csak egy felmérés szegmentációs térképének szerkesztése változtatta meg a jelentett fluxust, méretet, ellipticitást és vöröseltolódást, annak ellenére, hogy a képi tokenek bájtjaik azonosak maradtak.
A cikk az AION-1-et vizsgálja, amelyet szerzője 39 modalitású transzformátorként ír le, amelyet több mint 200 millió csillagászati objektumon képeztek ki. Központi kísérlete ok-okozati beavatkozásokat alkalmaz a modell bemenetein: a képi tokenek bájt-azonosságát tartják, miközben csak a felmérés szegmentációs térképét szerkesztik. A lap arról számol be, hogy ez a változás minden vizsgált mennyiséget – fluxust, méretet, ellipticitást és vöröseltolódást – 110-4400-szor módosítja, mint a megfelelő placebó. Ezek az újság által közölt eredmények, nem pedig független ellenőrzött megállapítások.
A bejelentett mechanizmus az észlelési kapuzás. A cikk szerint a modell viselkedése nyomon követi, hogy van-e észlelés a terepi központban, a közölt r = 0,47 korrelációval erősebben, mint a maszk által bezárt fény, amelynek r = 0,30. Egy 322 valódi keverékből álló halmazban a szerzők arról számoltak be, hogy a modell nagyrészt figyelmen kívül hagyta, hogy a csővezeték hogyan particionálta a fényt, R = -0,006. A lap azt is elmondja, hogy az ellentmondó katalógusfotometria kilencszer rosszabbá tette a modellt, mintha egyáltalán nem szolgáltatott volna metaadatokat.
A tanulmány összekapcsolja a modell viselkedését a felmérési adatok hiányzó észleléseivel. Beszámol arról, hogy a Legacy Survey folyamat a célpontok 3,68%-át hagyja meg a pozíciójukat lefedő szegmens nélkül. Amikor ezt az arányt 40 feladaton keresztül terjesztették, a szerzők a tomográfiás átlagos vöröseltolódások medián eltolódásáról számoltak be, amely megegyezik az LSST DESC követelmény 0,71-szeresével, és az eltolódás 12 feladatnál meghaladja ezt a követelményt. A kihagyások mért nagyságrendi függésének alkalmazása, nem pedig egységes rajzolásuk nem változtatta meg a közölt eredményt.
Számos technikai korlátot is ismertetünk. A cikk szerint a spektroszkópia eltávolítja a hatást, míg az észlelési csatorna visszatartása mérhető költség nélkül eltávolítja azt, és a hatás a modell léptékével nő. Beszámol arról, hogy a képkodek 28 hatékony állapotot old fel a forrásfoltokon, szemben a spektrumkodek 934-gyel, és hogy a vöröseltolódás kiolvasása kvantálásra korlátozott. Arra is figyelmeztet, hogy a ritka szótárak megbízhatatlanok az ok-okozati összefüggésekre: a helyreállítás 26% és 75% között mozgott, és akár 18 százalékponttal is elmozdult a véletlen magtól függően.
Miért számít
A lelet azonosítja a tudományos mesterséges intelligencia lehetséges következményes meghibásodásának módját: a modell szisztematikus hibákat örökölhet a katalógusból és az észlelési folyamatokból, ahelyett, hogy elsősorban a mögöttes megfigyelésekre hagyatkozna. A cikk beszámol arról, hogy a mért hibaarány szimulált terjedése lényegesen eltolhatja a felmérés elemzésénél használt tomográfiás átlag vöröseltolódásokat.
A cikk tágabb jelentősége az, hogy a tudományos mérésekre használt mesterséges intelligencia rendszer az adatfeldolgozási döntést magára az objektumra vonatkozó bizonyítékként kezelheti. A szegmentációs térkép olyan származtatott termék, amely az észlelt vagy elkülönített forrásokat jelzi; A közölt kísérletek azt sugallják, hogy az AION-1 ezt a jelet kapuként tudja használni annak meghatározására, hogy elemzi-e a pixeleket, és hogyan. Ha megismételjük, ez a felmérési folyamatot a modell hatékony mérési rendszerének részévé tenné, még akkor is, ha a kutatók úgy vélik, hogy a megfigyelések értelmezésére kérik a modellt.
A tomográfiás átlagos vöröseltolódások összesített becslései arra vonatkozóan, hogy az objektumok hogyan oszlanak el a vöröseltolódási tartályok között. A cikk arról számol be, hogy a 3,68%-os hiányzó szegmensek aránya, a modell viselkedésével kombinálva, ezeket az aggregátumokat a megállapított LSST DESC-követelmény jelentős töredékével, sőt néha túl is tolhatja. A gyakorlati aggodalom nemcsak az, hogy az egyéni előrejelzések tévesek lehetnek, hanem az is, hogy egy ismétlődő, csővezetékhez kapcsolódó hiba populációs szintű tudományos következtetésekké is átterjedhet.
Az eredmény a multimodális alapozási modellekre vonatkozó általános feltételezést is megkérdőjelezi: több csatorna hozzáadása nem teszi automatikusan robusztusabbá vagy tájékozottabbá a rendszert. Itt a lap arról számol be, hogy az egymásnak ellentmondó katalógusfotometria károsabb lehet, mint a metaadatok teljes eltávolítása. Megállapítása, hogy az észlelési csatorna visszatartása nem kerül mérhető teljesítménybe a jelentett tesztekben, potenciálisan egyszerű enyhítésre utal, bár a forrás nem állapítja meg, hogy ez a kompromisszum minden feladatra vagy működési körülményre érvényes-e.
A tanulmány bizonyítékai különösen fontosak, mert ellenőrzött beavatkozásokat alkalmaz, ahelyett, hogy csak az előrejelzéseket hasonlítaná össze a címkékkel. Egy bemeneti csatorna megváltoztatásával a képjelzők megőrzése mellett a szerzők megpróbálják elkülöníteni az ok-okozati hatást. Ez a megközelítés önmagában nem állapítja meg, hogy az AION-1 minden csillagászati munkafolyamatban meghibásodik, de konkrét módot kínál annak ellenőrzésére, hogy a modell bemenetei fizikai információkat, mérési műtermékeket vagy feltételezéseket tükröznek-e, amelyek az upstream szoftverbe vannak beágyazva.
Interaktív mechanizmus: Hogyan működik valójában
Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Mit nézzünk ezután
Az eredmény egyetlen arXiv v1 papírból származik, és független replikációt igényel a modellek, felmérések és adatfeldolgozási folyamatok között. A nyomon követési munkának meg kell vizsgálnia, hogy az észlelési metaadatok visszatartása megőrzi-e a tudományos teljesítményt, megjelenik-e a jelentett hatás az operációs rendszerekben, és a vöröseltolódás kvantálási és tokenizálási határértékei mennyire befolyásolják a következtetéseket.
Az azonnali kérdés a replikáció. A forrás leírja egy szerző auditálását egy modellen, és nem számol be szakértői értékelésről, független újraelemzésről vagy más csillagászati alapmodellek eredményeiről. A kutatóknak ugyanazokat a beavatkozásokat kell tesztelniük különböző felméréseken, szegmentációs csővezetékeken és modellarchitektúrákon, beleértve a katalógustermékek nélkül kiképzett rendszereket, vagy explicit származást és hiányzó adatok mutatóit.
A jelentett mérséklést is gondosan értékelni kell. Az észlelési csatorna visszatartása mérhető költség nélkül eltávolította a mért hatást a dolgozat tesztjeiben, de a forrás nem adja meg a teljes feladatcsomagot, az értékelési mintát vagy az összehasonlítás körüli bizonytalanságot. A nyomon követési vizsgálatoknak meg kell határozniuk, hogy a csatorna eltávolítása hatással van-e a ritka tárgyakra, zsúfolt mezőkre, halvány forrásokra vagy olyan feladatokra, amelyekre az audit nem terjed ki.
A vöröseltolódás eredménye működési ellenőrzést igényel. A cikk a hiányzó szegmensek jelentett arányát terjeszti 40 hozzárendelésen keresztül, és összehasonlítja az eredményül kapott eltolódásokat az LSST DESC követelményével, de a forrás nem állítja, hogy ezeket az eltolódásokat megfigyelték volna egy telepített felmérési elemzés során. A független csapatoknak reprodukálniuk kell a hozzárendelési eljárást, számszerűsíteniük kell a konfidenciaintervallumokat, és meg kell vizsgálniuk, hogy a valós felmérési megfigyelések ugyanazt a populációszintű torzítást mutatják-e.
A további munkának el kell különítenie a modell észlelési metaadatokra való támaszkodását a tokenizálás és a kimeneti reprezentáció korlátaitól. A cikk arról számol be, hogy a képfoltoknak sokkal kevesebb hatékony kodekállapotuk van, mint a spektrumfoltoknak, és a vöröseltolódás kiolvasása kvantálásra korlátozott. Továbbra sem világos, hogy az egyes korlátozások mennyiben járulnak hozzá a főcím-hatáshoz, hogy a skálázás következetesen rontja-e a teljesítményt, és hogy az alternatív tokenizálók vagy kiolvasások megváltoztatják-e a következtetéseket.