Mi történt
Az MIT Technology Review hét rejtvény köré épített interaktív funkciót tett közzé, amely megvizsgálja, hogyan érvelnek az AI-modellek. A cikk arról számol be, hogy a modellek gyorsan fejlődtek egyes feladatokban, de még mindig küzdenek a térbeli manipulációval, az ismert problémák finom variációival, a vizuális absztrakcióval és az egyre bonyolultabb többlépcsős érveléssel.
Az MIT Technology Review jelentése szerint szolgáltatása hét tesztet mutat be, amelyek a térbeli gondolkodást, a memóriát és az alkalmazkodóképességet, az absztrakt és vizuális érvelést, az emberi intuíciót és a növekvő összetettséget fedik le. A cikk a rejtvényfejtést a mesterséges intelligencia értékelésének hosszabb történetébe helyezi, megjegyezve, hogy az olyan játékokat, mint a dáma, a sakk és a Go, a mezőny kezdete óta tesztágyként használták. Azt mondja, hogy a rejtvények teljesítménye jelentősen javult: a Columbia Egyetem csapata 2024 végén megállapította, hogy a vezető modellek a New York Times Connections feladványainak csak 18%-át oldották meg, míg 2025 elejére egyes modellek szinte minden alkalommal tökéletesen meg tudják oldani azokat. A forrás nem azonosítja a modelleket, és nem nyújt szabványosított összehasonlítást a szolgáltatásban szereplő példák között.
Az MIT Technology Review szerint a térbeli érvelés továbbra is a fő gyengeség. A mentális forgatás rész arra kéri az olvasókat, hogy azonosítsanak egy háromdimenziós objektumot, amely más szögből látható, és a cikk arról számol be, hogy a vizuális beviteli képességekkel rendelkező nyelvi modellek még mindig nagyon rosszul teljesítenek az ilyen feladatokban. Ez a funkció összekapcsolja ezt a nehézséget a világmodelleket fejlesztő mesterséges intelligencia-rendszerekkel kapcsolatos állításokkal, azzal érvelve, hogy a jelenlegi nagy nyelvi modellek úgy tűnik, hogy nem úgy manipulálnak háromdimenziós objektumokat, ahogyan azt az emberi térbeli szakemberek tennék. A cikk leír egy memória- és alkalmazkodóképesség-problémát is: a nagy mennyiségű információra képzett modellek felismerhetnek egy ismerős rejtvénymintát, és figyelmen kívül hagyhatnak egy kis változást. Ennek bizonyítékaként hivatkozik egy 2024-es Google és az Illinois Egyetem Urbana-Champaign tanulmányára, amely a Knights and Knaves rejtvények variációival foglalkozik.
A funkció ezután a kétdimenziós absztrakció és a vizuális érvelés felé fordul. Az MIT Technology Review jelentése szerint a modellek jobban teljesítenek az ARC-AGI rejtvényeken, ha a rácsok cellaszíneket kódoló numerikus karakterláncok, nem pedig képek. Azt is elmondja, hogy a kutatások azt találták, hogy a modellek néha bonyolult, nem általánosítható szabályokon keresztül juthatnak el a helyes válaszhoz, míg az emberek egyszerűbb vizuális fogalmakra hagyatkozhatnak. A cikk a SimpleBench kérdéseket, a Knights and Knaves-problémákat, valamint egy ARC-AGI transzformációs rejtvényt mutat be példaként azokra a feladatokra, amelyek feltárhatják ezeket a különbségeket.
Külön ismerteti az intuíciós teszteket, amelyekben az emberek gyakran gyors, de helytelen válaszokat adnak, míg a modellek megfontoltabban reagálnak. Az egyik példa azt kérdezi, hogy mennyi ideig tart egy barlang félig megtelni, ha a denevérállomány naponta megduplázódik; egy másik arra kéri az olvasókat, hogy azonosítsanak egy Alice-hez kapcsolódó idézetet.
Végül az MIT Technology Review arról számol be, hogy a teljesítmény gyakran romlik, ahogy a problémák összetettebbé válnak. Idéz egy Apple tanulmányt, amely szerint a nyelvi modellek meg tudták oldani a Tower of Hanoi egyszerű változatait és a folyók átkelésével kapcsolatos problémákat, de ha a lemezek vagy az emberek száma elérte a hatot, akkor akadozni kezdett. Idézi a Washingtoni Egyetem, a Stanford Egyetem és az Allen Intézet kutatóinak munkáját is, akik hasonló nehézségeket tapasztaltak a logikai rácsos rejtvényeknél. A funkció megjegyzi, hogy a kommentátorok megkérdőjelezték, hogy ezek az eredmények egyedülállóan gépszerű érvelési korlátot mutatnak-e, vagy egyszerűen azt a tényt tükrözik, hogy az emberek a bonyolultság növekedésével több hibát is elkövetnek. A folyók átkelésére és a logikai rácsra vonatkozó példái ezért nemcsak azt tesztelik, hogy egy modell képes-e választ adni, hanem azt is, hogy képes-e fenntartani a megszorításokat több összefüggő következtetésen keresztül.
Forrás részletei: technologyreview.com ↗
Miért számít
A funkció megmutatja, hogy az AI-intelligenciával kapcsolatos széles körű állítások miért lehetnek félrevezetőek. Egy modell jól teljesíthet apróságokon vagy egy ismert benchmarkon, miközben nem sikerül egy kis szövegmódosítás, egy vizuális átalakítás vagy egy több függő lépést igénylő probléma. Ezek a különbségek akkor számítanak, ha a rendszereket döntéshozatalra használják, nem pedig demonstrációra.
A központi tanulság az, hogy egy tesztosztályon végzett teljesítményt nem szabad az intelligencia általános mérőszámaként kezelni. Az MIT Technology Review példái olyan feladatokat ölelnek fel, amelyek felületesen egyszerűnek tűnnek, de különböző képességeket igényelnek: egy objektum mentális elforgatása, az igazság és a hamisság követése állítások között, a vizuális szabály kikövetkeztetése, a félrevezető intuíciónak való ellenállás vagy a sorozat megtervezése korlátok mellett. Egy rendszer szokatlanul erős lehet az egyik területen, és megbízhatatlan egy másik területen. Ez az egyenetlenség különösen akkor releváns, ha a felhasználók a gördülékeny válaszokat annak bizonyítékaként értelmezik, hogy a modell megértette a mögöttes problémát.
A cikk egy értékelési problémára is rávilágít: a feladat formátuma érdemben befolyásolhatja az eredményt. Az MIT Technology Review jelentése szerint az ARC-AGI teljesítménye javul, ha a vizuális rácsokat numerikus reprezentációkká alakítják. Ez arra utal, hogy a pontszám nemcsak a modell érvelési képességét tükrözheti, hanem a probléma kódolási és bemutatási módját is. Ugyanez vonatkozik az ismert rejtvényekre is. Ha egy modell egy közeli változattal találkozott a képzés során, a helyes válasz inkább mintafelismerést vagy visszakeresést tükrözhet, nem pedig azt a képességet, hogy egy szabályt egy új esethez igazítson. A forrás nem határozza meg, milyen gyakran fordul elő egyik mechanizmus a telepített rendszerek között.
Ezek a korlátozások gyakorlati következményekkel járnak mindenki számára, aki az AI-t oktatásban, szoftverben, kutatásban, adminisztrációban vagy más olyan környezetben használja, amely ismeretlen esetekkel jár. A rutinpéldákon sikeres modell továbbra is kudarcot vallhat, ha a megfogalmazás megváltozik, több kényszer kölcsönhatásba lép, vagy a releváns információ vizuális, nem pedig szöveges. A funkció nem jelent új termék bevezetését, új modell kiadását vagy egy adott kereskedelmi rendszer ellenőrzött értékelését. Értéke magyarázó: konkrét módokat ad az olvasóknak, hogy meglássák, miért nem hoznak létre önmagukban robusztus érvelést a benchmark nyereségek és a csiszolt nyelvezet. A cikk megőriz egy fontos tulajdonságot is: az embereknek megvannak a saját előítéletei, és bizonyos problémák esetén lassabbak vagy kevésbé megbízhatóak.
Interaktív mechanizmus: Hogyan működik valójában
Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.
Which component of an AI application is the machine-learning model itself?
Mit nézzünk ezután
A jövőbeli értékeléseknél többet kell tesztelni, mint a főcím pontszámait. A fontos kérdések közé tartozik, hogy a modellek általánosíthatók-e ismeretlen problémákra, hogy a válaszaik függenek-e az információ megjelenítésétől, hogyan változik a teljesítmény a komplexitás növekedésével, és hogy a siker újrafelhasználható stratégiát vagy megjegyzett mintákat tükröz-e.
A következő hasznos fejlesztés a modellek és feladatformátumok szélesebb körű, reprodukálható tesztelése lenne. Az MIT Technology Review szolgáltatása nem biztosít egyetlen pontozókártyát, amely lefedi mind a hét tesztet, és a forrás sem ad meg modellneveket, verziókat, mintaméreteket, felszólítási feltételeket vagy hibaarányokat a legtöbb példa esetében. Ezekre a részletekre szükség lenne annak meghatározásához, hogy a jelentett gyengeségek széles körben elterjedtek-e, bizonyos modellcsaládokra koncentrálódnak-e, vagy érzékenyek a tesztek beadásának módjára.
A független értékeléseknek el kell különíteniük a vizuális észlelés kudarcait az érvelési kudarcoktól azáltal, hogy a mögöttes rejtvényt állandóan tartják, miközben megváltoztatják a reprezentációját. A kutatóknak és az értékelőknek azt is figyelniük kell, hogy a modellek javulnak-e a valódi általánosítás vagy a benchmark-szerű anyagoknak való nagyobb kitettség révén. A cikkben a Kapcsolatok rejtvények és a Knights and Knaves variációk bemutatása megmutatja, miért számít a szennyeződés és az ismerősség. Az a modell, amely jól teljesít a publikált vagy szorosan kapcsolódó kérdésekben, nem biztos, hogy egyformán képes az újonnan generált, azonos mögöttes szerkezettel rendelkező problémákra. A tesztelésnek ezért tartalmaznia kell a kinyújtott fejtörőket, a megváltozott szövegezést, az ismeretlen vizuális elrendezéseket és a köztes korlátok magyarázatát vagy ellenőrzését igénylő feladatokat anélkül, hogy feltételeznénk, hogy a meggyőző válasz helyes.
A komplexitás és a valós átvitel továbbra is nyitott kérdések maradnak. Az MIT Technology Review arról számol be, hogy a teljesítmény az elemek vagy a szükséges lépések számának növekedésével romolhat, de a forrás nem határozza meg, hogy ezek az eredmények hogyan fordíthatók gyakorlati rendszerekre eszközökkel, visszakereséssel, külső memóriával vagy emberi felügyelettel. A jövőbeni jelentéseknek nyomon kell követniük, hogy az ilyen kiegészítések javítják-e a megbízhatóságot, pusztán segítik-e a modellek hatékonyabb keresését, vagy új hibamódokat vezetnek be. Az olvasóknak figyelniük kell a stratégia minőségét mérő értékelésekre is, nem csak a végső válaszra, mert egy rideg vagy nem általánosítható szabály révén elért helyes eredmény nem biztos, hogy túléli a probléma kis változását.