Co se stalo
MIT Technology Review zveřejnila interaktivní funkci postavenou na sedmi hádankách, které zkoumají, jak modely umělé inteligence uvažují. Článek uvádí, že modely se v některých úkolech rychle zlepšily, ale stále se potýkají s prostorovou manipulací, jemnými variacemi známých problémů, vizuální abstrakcí a stále složitějším vícekrokovým uvažováním.
MIT Technology Review uvádí, že jeho funkce představuje sedm testů zahrnujících prostorové uvažování, paměť a adaptabilitu, abstraktní a vizuální uvažování, lidskou intuici a zvyšující se složitost. Článek zařazuje řešení hlavolamů do delší historie hodnocení AI a poznamenává, že hry jako dáma, šachy a Go byly používány jako testovací lůžka již od prvních let tohoto oboru. Říká se, že výkon hlavolamu se podstatně zlepšil: tým z Kolumbijské univerzity koncem roku 2024 zjistil, že přední modely vyřešily pouze 18 % hádanek New York Times Connections, zatímco začátkem roku 2025 je některé modely dokázaly vyřešit téměř dokonale pokaždé. Zdroj neidentifikuje modely ani neposkytuje standardizované srovnání mezi příklady ve funkci.
MIT Technology Review říká, že prostorové uvažování zůstává hlavní slabinou. Jeho sekce mentální rotace žádá čtenáře, aby identifikovali trojrozměrný objekt zobrazený z jiného úhlu, a článek uvádí, že jazykové modely se schopnostmi vizuálního vstupu si v takových úkolech stále vedou velmi špatně. Tato funkce spojuje tento problém s tvrzeními o systémech umělé inteligence vyvíjejících světové modely a tvrdí, že současné velké jazykové modely zřejmě nemanipulují s trojrozměrnými objekty stejným způsobem, jakým by to mohli udělat lidští prostoroví specialisté. Článek také popisuje problém paměti a adaptability: modely trénované na velkém množství informací mohou rozpoznat známý puzzle vzor a přehlédnout malou změnu. Jako důkaz tohoto znepokojení cituje studii Google z roku 2024 a University of Illinois Urbana-Champaign zahrnující variace hádanek Knights a Knaves.
Funkce se pak změní na dvourozměrnou abstrakci a vizuální uvažování. MIT Technology Review uvádí, že modely fungují lépe na hádankách ARC-AGI, když jsou mřížky poskytovány jako číselné řetězce kódující barvy buněk spíše než jako obrázky. Výzkum také zjistil, že modely mohou někdy dosáhnout správné odpovědi prostřednictvím komplikovaných, nezobecnitelných pravidel, zatímco lidé se mohou spoléhat na jednodušší vizuální koncepty. Článek představuje otázky SimpleBench, problémy Knights and Knaves a puzzle transformace ARC-AGI jako příklady úloh, které mohou tyto rozdíly odhalit.
Samostatně popisuje testy intuice, ve kterých lidé často dávají rychlé, ale nesprávné odpovědi, zatímco modely mohou reagovat záměrněji. Jeden příklad se ptá, jak dlouho by jeskyni trvalo, než by se zaplnila do poloviny, když se její populace netopýrů denně zdvojnásobí; další žádá čtenáře, aby identifikovali citát spojený s Alicí.
A konečně, MIT Technology Review uvádí, že výkon se často zhoršuje, když se problémy stávají složitějšími. Cituje studii Apple, která zjistila, že jazykové modely by mohly vyřešit jednoduché verze Hanojské věže a problémy s přechodem přes řeku, ale začaly ochabovat, když počet disků nebo lidí dosáhl šesti nebo více. Cituje také práci výzkumníků z Washingtonské univerzity, Stanfordské univerzity a Allenova institutu, kteří zjistili podobné potíže s logickými hádankami. Tato funkce poznamenává, že komentátoři se ptali, zda tyto výsledky odhalují jedinečně strojové omezení uvažování nebo jednoduše odrážejí skutečnost, že lidé také dělají více chyb, když se zvyšuje složitost. Jeho příklady křížení řek a logických sítí proto testují nejen to, zda model může poskytnout odpověď, ale také to, zda dokáže zachovat omezení napříč více spojenými srážkami.
Podrobnosti o zdroji: technologyreview.com ↗
Proč na tom záleží
Tato funkce ukazuje, proč mohou být široká tvrzení o inteligenci AI zavádějící. Model může fungovat dobře na triviálnosti nebo známém benchmarku, zatímco selže při malé změně formulace, vizuální transformaci nebo problému vyžadujícího několik závislých kroků. Tyto rozdíly jsou důležité, když se systémy používají spíše pro rozhodování než pro demonstrace.
Ústředním poučením je, že výkon v jedné třídě testu by neměl být považován za obecné měřítko inteligence. Příklady MIT Technology Review zahrnují úkoly, které vypadají povrchně jednoduše, ale vyžadují různé schopnosti: mentální otáčení objektu, sledování pravdy a nepravdy napříč výroky, odvození vizuálního pravidla, odolání zavádějící intuici nebo plánování sekvence pod omezeními. Systém může být v jedné oblasti neobvykle silný a v jiné nespolehlivý. Tato nerovnoměrnost je zvláště důležitá, když uživatelé interpretují plynulé odpovědi jako důkaz, že model pochopil základní problém.
Článek také upozorňuje na problém hodnocení: formát úkolu může podstatně ovlivnit výsledek. MIT Technology Review uvádí, že výkon ARC-AGI se zlepšuje, když jsou vizuální mřížky převedeny na numerické reprezentace. To naznačuje, že skóre může odrážet nejen schopnost modelu uvažovat, ale také způsob, jakým je problém zakódován a prezentován. Stejná obava platí pro známé hádanky. Pokud model během trénování narazil na blízkou variantu, správná odpověď může odrážet rozpoznání nebo vyhledání vzoru spíše než schopnost přizpůsobit pravidlo novému případu. Zdroj neurčuje, jak často se oba mechanismy vyskytují v nasazených systémech.
Tato omezení mají praktické důsledky pro každého, kdo používá AI ve vzdělávání, softwaru, výzkumu, správě nebo v jiných prostředích, která zahrnují neznámé případy. Model, který uspěje na rutinních příkladech, může stále selhat, když se změní formulace, na sebe působí několik omezení nebo jsou relevantní informace spíše vizuální než textové. Funkce nehlásí uvedení nového produktu na trh, vydání nového modelu ani řízené hodnocení konkrétního komerčního systému. Jeho hodnota je vysvětlující: poskytuje čtenářům konkrétní způsoby, jak zjistit, proč zisky srovnávacích testů a vybroušený jazyk samy o sobě nezakládají spolehlivé uvažování. Článek také zachovává důležitou kvalifikaci: lidé mají své vlastní předsudky a mohou být v některých problémech pomalejší nebo méně spolehliví.
Interaktivní mechanismus: Jak to vlastně funguje
Interaktivně prozkoumejte základní technologii tohoto vývoje.
Which component of an AI application is the machine-learning model itself?
Na co se dále dívat
Budoucí hodnocení budou muset otestovat více než jen hlavní skóre. Mezi důležité otázky patří, zda lze modely zobecnit na neznámé problémy, zda jejich odpovědi závisí na tom, jak jsou informace reprezentovány, jak se výkon mění s rostoucí složitostí a zda úspěch odráží znovu použitelnou strategii nebo zapamatované vzorce.
Dalším užitečným vývojem by bylo širší, reprodukovatelné testování napříč modely a formáty úloh. Funkce MIT Technology Review neposkytuje jedinou výsledkovou kartu pokrývající všech sedm testů, ani zdroj neuvádí názvy modelů, verze, velikosti vzorků, podmínky dotazování nebo chybovost pro většinu příkladů. Tyto podrobnosti by byly potřebné k určení, zda jsou hlášené nedostatky rozšířené, soustředěné v konkrétních modelových rodinách nebo citlivé na to, jak jsou testy prováděny.
Nezávislá hodnocení by také měla oddělit selhání vizuálního vnímání od selhání uvažování tím, že udrží základní hádanku konstantní a zároveň změní její reprezentaci. Výzkumníci a hodnotitelé by také měli sledovat, zda se modely zlepšují skutečným zobecněním nebo větším vystavením materiálu podobnému benchmarku. Diskuse v článku o hádankách Connections a variacích Knights and Knaves ukazuje, proč na kontaminaci a známosti záleží. Model, který funguje dobře v publikovaných nebo úzce souvisejících otázkách, nemusí být stejně schopný u nově generovaných problémů se stejnou základní strukturou. Testování by proto mělo zahrnovat zdlouhavé hádanky, pozměněné formulace, neznámé vizuální rozvržení a úkoly, které vyžadují vysvětlení nebo kontrolu mezilehlých omezení, aniž by se předpokládalo, že přesvědčivá odpověď je správná.
Složitost a přenos v reálném světě zůstávají otevřenými otázkami. MIT Technology Review uvádí, že výkon se může zhoršit se zvyšujícím se počtem prvků nebo požadovaných kroků, ale zdroj neuvádí, jak se tato zjištění promítají do praktických systémů s nástroji, vyhledáváním, externí pamětí nebo lidským dohledem. Budoucí zprávy by měly sledovat, zda takové doplňky zvyšují spolehlivost, pouze pomáhají efektivněji vyhledávat modely nebo zavádějí nové způsoby selhání. Čtenáři by také měli sledovat hodnocení, která měří kvalitu strategie, nejen konečnou odpověď, protože správný výsledek dosažený pomocí křehkého nebo nezobecnitelného pravidla nemusí přežít malou změnu problému.