Zpět na Novinky
InovaceInstruktáž AI Understanding

MIT Technology Review používá sedm hádanek k odhalení, kde modely umělé inteligence stále selhávají

MIT Technology Review představuje sedm hádanek, které testují prostorové uvažování, paměť, abstrakci, intuici a logické plánování a zdůrazňují mezery, které přetrvávají i přes rychlé zisky v některých měřítcích.

6 min readRead the original reporting
Source-provided image accompanying MIT Technology Review uses seven puzzles to expose where AI models still fail
Přiřazené hlášeníZdroj zaznamenán
Vydavatel
technologyreview.com
Odkaz na zdroj
technologyreview.comhttps://www.technologyreview.com/2026/08/26/1141952/puzzles-ai-models-flub-these-tests/
Typ zdroje
Zpravodajství – ne dokument první strany.

Co jsme nemohli nezávisle potvrdit: Tento nárok je připisován jmenované prodejně. Neověřovali jsme to podle dokumentu první strany. (technologyreview.com)

KontextPochopte to za 60 sekund

Začněte zde

Klíčové pojmy

AGI (obecná umělá inteligence)
Hypotetický systém umělé inteligence, který může provádět většinu intelektuálních úkolů na lidské úrovni v mnoha oblastech.
Paměť (paměť agenta)
Uložený kontext, který agent AI používá v krocích nebo relacích ke zlepšení kontinuity.
Zobecnění
Jak dobře si model vede na nových, neviditelných datech mimo trénovací sadu.
Otestujte seKvíz s vysvětlením modelů umělé inteligence

Co se stalo

MIT Technology Review zveřejnila interaktivní funkci postavenou na sedmi hádankách, které zkoumají, jak modely umělé inteligence uvažují. Článek uvádí, že modely se v některých úkolech rychle zlepšily, ale stále se potýkají s prostorovou manipulací, jemnými variacemi známých problémů, vizuální abstrakcí a stále složitějším vícekrokovým uvažováním.

MIT Technology Review uvádí, že jeho funkce představuje sedm testů zahrnujících prostorové uvažování, paměť a adaptabilitu, abstraktní a vizuální uvažování, lidskou intuici a zvyšující se složitost. Článek zařazuje řešení hlavolamů do delší historie hodnocení AI a poznamenává, že hry jako dáma, šachy a Go byly používány jako testovací lůžka již od prvních let tohoto oboru. Říká se, že výkon hlavolamu se podstatně zlepšil: tým z Kolumbijské univerzity koncem roku 2024 zjistil, že přední modely vyřešily pouze 18 % hádanek New York Times Connections, zatímco začátkem roku 2025 je některé modely dokázaly vyřešit téměř dokonale pokaždé. Zdroj neidentifikuje modely ani neposkytuje standardizované srovnání mezi příklady ve funkci.

MIT Technology Review říká, že prostorové uvažování zůstává hlavní slabinou. Jeho sekce mentální rotace žádá čtenáře, aby identifikovali trojrozměrný objekt zobrazený z jiného úhlu, a článek uvádí, že jazykové modely se schopnostmi vizuálního vstupu si v takových úkolech stále vedou velmi špatně. Tato funkce spojuje tento problém s tvrzeními o systémech umělé inteligence vyvíjejících světové modely a tvrdí, že současné velké jazykové modely zřejmě nemanipulují s trojrozměrnými objekty stejným způsobem, jakým by to mohli udělat lidští prostoroví specialisté. Článek také popisuje problém paměti a adaptability: modely trénované na velkém množství informací mohou rozpoznat známý puzzle vzor a přehlédnout malou změnu. Jako důkaz tohoto znepokojení cituje studii Google z roku 2024 a University of Illinois Urbana-Champaign zahrnující variace hádanek Knights a Knaves.

Funkce se pak změní na dvourozměrnou abstrakci a vizuální uvažování. MIT Technology Review uvádí, že modely fungují lépe na hádankách ARC-AGI, když jsou mřížky poskytovány jako číselné řetězce kódující barvy buněk spíše než jako obrázky. Výzkum také zjistil, že modely mohou někdy dosáhnout správné odpovědi prostřednictvím komplikovaných, nezobecnitelných pravidel, zatímco lidé se mohou spoléhat na jednodušší vizuální koncepty. Článek představuje otázky SimpleBench, problémy Knights and Knaves a puzzle transformace ARC-AGI jako příklady úloh, které mohou tyto rozdíly odhalit.

Samostatně popisuje testy intuice, ve kterých lidé často dávají rychlé, ale nesprávné odpovědi, zatímco modely mohou reagovat záměrněji. Jeden příklad se ptá, jak dlouho by jeskyni trvalo, než by se zaplnila do poloviny, když se její populace netopýrů denně zdvojnásobí; další žádá čtenáře, aby identifikovali citát spojený s Alicí.

A konečně, MIT Technology Review uvádí, že výkon se často zhoršuje, když se problémy stávají složitějšími. Cituje studii Apple, která zjistila, že jazykové modely by mohly vyřešit jednoduché verze Hanojské věže a problémy s přechodem přes řeku, ale začaly ochabovat, když počet disků nebo lidí dosáhl šesti nebo více. Cituje také práci výzkumníků z Washingtonské univerzity, Stanfordské univerzity a Allenova institutu, kteří zjistili podobné potíže s logickými hádankami. Tato funkce poznamenává, že komentátoři se ptali, zda tyto výsledky odhalují jedinečně strojové omezení uvažování nebo jednoduše odrážejí skutečnost, že lidé také dělají více chyb, když se zvyšuje složitost. Jeho příklady křížení řek a logických sítí proto testují nejen to, zda model může poskytnout odpověď, ale také to, zda dokáže zachovat omezení napříč více spojenými srážkami.

Podrobnosti o zdroji: technologyreview.com ↗

Proč na tom záleží

Tato funkce ukazuje, proč mohou být široká tvrzení o inteligenci AI zavádějící. Model může fungovat dobře na triviálnosti nebo známém benchmarku, zatímco selže při malé změně formulace, vizuální transformaci nebo problému vyžadujícího několik závislých kroků. Tyto rozdíly jsou důležité, když se systémy používají spíše pro rozhodování než pro demonstrace.

Ústředním poučením je, že výkon v jedné třídě testu by neměl být považován za obecné měřítko inteligence. Příklady MIT Technology Review zahrnují úkoly, které vypadají povrchně jednoduše, ale vyžadují různé schopnosti: mentální otáčení objektu, sledování pravdy a nepravdy napříč výroky, odvození vizuálního pravidla, odolání zavádějící intuici nebo plánování sekvence pod omezeními. Systém může být v jedné oblasti neobvykle silný a v jiné nespolehlivý. Tato nerovnoměrnost je zvláště důležitá, když uživatelé interpretují plynulé odpovědi jako důkaz, že model pochopil základní problém.

Článek také upozorňuje na problém hodnocení: formát úkolu může podstatně ovlivnit výsledek. MIT Technology Review uvádí, že výkon ARC-AGI se zlepšuje, když jsou vizuální mřížky převedeny na numerické reprezentace. To naznačuje, že skóre může odrážet nejen schopnost modelu uvažovat, ale také způsob, jakým je problém zakódován a prezentován. Stejná obava platí pro známé hádanky. Pokud model během trénování narazil na blízkou variantu, správná odpověď může odrážet rozpoznání nebo vyhledání vzoru spíše než schopnost přizpůsobit pravidlo novému případu. Zdroj neurčuje, jak často se oba mechanismy vyskytují v nasazených systémech.

Tato omezení mají praktické důsledky pro každého, kdo používá AI ve vzdělávání, softwaru, výzkumu, správě nebo v jiných prostředích, která zahrnují neznámé případy. Model, který uspěje na rutinních příkladech, může stále selhat, když se změní formulace, na sebe působí několik omezení nebo jsou relevantní informace spíše vizuální než textové. Funkce nehlásí uvedení nového produktu na trh, vydání nového modelu ani řízené hodnocení konkrétního komerčního systému. Jeho hodnota je vysvětlující: poskytuje čtenářům konkrétní způsoby, jak zjistit, proč zisky srovnávacích testů a vybroušený jazyk samy o sobě nezakládají spolehlivé uvažování. Článek také zachovává důležitou kvalifikaci: lidé mají své vlastní předsudky a mohou být v některých problémech pomalejší nebo méně spolehliví.

Interactive Mechanism

Interaktivní mechanismus: Jak to vlastně funguje

Interaktivně prozkoumejte základní technologii tohoto vývoje.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktivní kontrola konceptu+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Na co se dále dívat

Budoucí hodnocení budou muset otestovat více než jen hlavní skóre. Mezi důležité otázky patří, zda lze modely zobecnit na neznámé problémy, zda jejich odpovědi závisí na tom, jak jsou informace reprezentovány, jak se výkon mění s rostoucí složitostí a zda úspěch odráží znovu použitelnou strategii nebo zapamatované vzorce.

Dalším užitečným vývojem by bylo širší, reprodukovatelné testování napříč modely a formáty úloh. Funkce MIT Technology Review neposkytuje jedinou výsledkovou kartu pokrývající všech sedm testů, ani zdroj neuvádí názvy modelů, verze, velikosti vzorků, podmínky dotazování nebo chybovost pro většinu příkladů. Tyto podrobnosti by byly potřebné k určení, zda jsou hlášené nedostatky rozšířené, soustředěné v konkrétních modelových rodinách nebo citlivé na to, jak jsou testy prováděny.

Nezávislá hodnocení by také měla oddělit selhání vizuálního vnímání od selhání uvažování tím, že udrží základní hádanku konstantní a zároveň změní její reprezentaci. Výzkumníci a hodnotitelé by také měli sledovat, zda se modely zlepšují skutečným zobecněním nebo větším vystavením materiálu podobnému benchmarku. Diskuse v článku o hádankách Connections a variacích Knights and Knaves ukazuje, proč na kontaminaci a známosti záleží. Model, který funguje dobře v publikovaných nebo úzce souvisejících otázkách, nemusí být stejně schopný u nově generovaných problémů se stejnou základní strukturou. Testování by proto mělo zahrnovat zdlouhavé hádanky, pozměněné formulace, neznámé vizuální rozvržení a úkoly, které vyžadují vysvětlení nebo kontrolu mezilehlých omezení, aniž by se předpokládalo, že přesvědčivá odpověď je správná.

Složitost a přenos v reálném světě zůstávají otevřenými otázkami. MIT Technology Review uvádí, že výkon se může zhoršit se zvyšujícím se počtem prvků nebo požadovaných kroků, ale zdroj neuvádí, jak se tato zjištění promítají do praktických systémů s nástroji, vyhledáváním, externí pamětí nebo lidským dohledem. Budoucí zprávy by měly sledovat, zda takové doplňky zvyšují spolehlivost, pouze pomáhají efektivněji vyhledávat modely nebo zavádějí nové způsoby selhání. Čtenáři by také měli sledovat hodnocení, která měří kvalitu strategie, nejen konečnou odpověď, protože správný výsledek dosažený pomocí křehkého nebo nezobecnitelného pravidla nemusí přežít malou změnu problému.

Související průvodci a kvízy

Vysvětlení modelů AIŠkolení AITransformátoryOtestujte si, co víte – vyzkoušejte bezplatný kvíz AIVyhledejte si termín AI v našem slovníkuPostupujte podle sledování vydání modelu AI
Považujete to za užitečné?