Какво стана
MIT Technology Review публикува интерактивна функция, изградена около седем пъзела, които изследват как AI моделира разума. Статията съобщава, че моделите са се подобрили бързо при някои задачи, но все още се борят с пространствени манипулации, фини вариации на познати проблеми, визуална абстракция и все по-сложни многоетапни разсъждения.
MIT Technology Review съобщава, че функцията му представя седем теста, обхващащи пространствено мислене, памет и адаптивност, абстрактно и визуално мислене, човешка интуиция и нарастваща сложност. Статията поставя решаването на пъзели в по-дългата история на оценката на AI, като отбелязва, че игри като дама, шах и го са били използвани като тестови платформи от ранните години на полето. В него се казва, че производителността на пъзелите се е подобрила значително: екип от Колумбийския университет установи в края на 2024 г., че водещите модели решават само 18% от пъзелите на New York Times Connections, докато до началото на 2025 г. някои модели могат да ги решават почти перфектно всеки път. Източникът не идентифицира моделите или предоставя стандартизирано сравнение между примерите във функцията.
MIT Technology Review казва, че пространственото мислене остава основна слабост. Неговият раздел за ментално завъртане моли читателите да идентифицират триизмерен обект, показан от друг ъгъл, и статията съобщава, че езиковите модели с възможности за визуално въвеждане все още се представят много слабо при такива задачи. Характеристиката свързва тази трудност с твърдения за AI системи, разработващи модели на света, твърдейки, че сегашните големи езикови модели изглежда не манипулират триизмерни обекти по същия начин, както биха могли човешките пространствени специалисти. Статията също така описва проблем с паметта и адаптивността: моделите, обучени на големи количества информация, могат да разпознаят познат модел на пъзел и да пренебрегнат малка промяна. Той цитира проучване на Google от 2024 г. и Университета на Илинойс Урбана-Шампейн, включващо вариации на пъзели Knights и Knaves като доказателство за тази загриженост.
След това функцията се обръща към двуизмерна абстракция и визуално разсъждение. MIT Technology Review съобщава, че моделите се представят по-добре на пъзели ARC-AGI, когато решетките са предоставени като числови низове, кодиращи цветовете на клетките, а не като изображения. Той също така казва, че изследванията са установили, че моделите понякога могат да достигнат до правилния отговор чрез сложни, необобщаеми правила, докато хората могат да разчитат на по-прости визуални концепции. Статията представя въпроси на SimpleBench, проблеми с Knights и Knaves и пъзел за трансформация на ARC-AGI като примери за задачи, които могат да разкрият тези различия.
Отделно се описват тестове за интуиция, при които хората често дават бързи, но неправилни отговори, докато моделите могат да реагират по-съзнателно. Един пример пита колко време ще отнеме една пещера, за да се напълни наполовина, когато нейната популация от прилепи се удвоява всеки ден; друг моли читателите да идентифицират цитат, свързан с Алис.
И накрая, MIT Technology Review съобщава, че производителността често се влошава, когато проблемите стават по-сложни. Той цитира проучване на Apple, което установява, че езиковите модели могат да решат прости версии на Ханойската кула и проблеми с пресичането на реката, но започват да се провалят, когато броят на дисковете или хората достигне шест или повече. Той също така цитира работа на изследователи от Университета на Вашингтон, Станфордския университет и Института Алън, откриващи подобни трудности с пъзели с логическа решетка. Функцията отбелязва, че коментаторите се съмняват дали тези резултати разкриват уникално подобно на машината ограничение на разсъжденията или просто отразяват факта, че хората също правят повече грешки с нарастването на сложността. Следователно неговите примери за пресичане на река и логическа решетка тестват не само дали даден модел може да даде отговор, но дали може да поддържа ограничения в множество свързани изводи.
Детайли за източника: technologyreview.com ↗
Защо има значение
Функцията показва защо широките твърдения за AI интелигентността могат да бъдат подвеждащи. Един модел може да се представи добре при любопитни факти или познат бенчмарк, докато се проваля с малка промяна във формулировката, визуална трансформация или проблем, изискващ няколко зависими стъпки. Тези разлики имат значение, когато системите се използват за решения, а не за демонстрации.
Основният урок е, че представянето на един клас тест не трябва да се третира като обща мярка за интелигентност. Примерите на MIT Technology Review обхващат задачи, които изглеждат повърхностно прости, но изискват различни способности: мислено завъртане на обект, проследяване на истината и лъжата в твърденията, извеждане на визуално правило, противопоставяне на подвеждаща интуиция или планиране на последователност при ограничения. Една система може да бъде необичайно силна в една област и ненадеждна в друга. Тази неравномерност е особено уместна, когато потребителите тълкуват свободните отговори като доказателство, че моделът е разбрал основния проблем.
Статията също така подчертава проблем с оценката: форматът на задача може съществено да повлияе на резултата. MIT Technology Review съобщава, че производителността на ARC-AGI се подобрява, когато визуалните мрежи се преобразуват в числени представяния. Това предполага, че резултатът може да отразява не само способността за разсъждение на модела, но и начина, по който проблемът е кодиран и представен. Същата загриженост важи и за познатите пъзели. Ако даден модел е срещнал близък вариант по време на обучението, правилният отговор може да отразява разпознаване на образец или извличане, а не способността да се адаптира правило към нов случай. Източникът не установява колко често всеки механизъм се появява в разгърнатите системи.
Тези ограничения имат практически последици за всеки, който използва AI в образование, софтуер, изследвания, администрация или други настройки, които включват непознати случаи. Модел, който успее в рутинни примери, все още може да се провали, когато формулировката се промени, няколко ограничения си взаимодействат или съответната информация е визуална, а не текстова. Функцията не отчита пускане на нов продукт, пускане на нов модел или контролирана оценка на конкретна търговска система. Стойността му е обяснителна: той дава на читателите конкретни начини да разберат защо печалбите от бенчмарка и изчистеният език не създават сами по себе си солидна аргументация. Статията също така запазва важна квалификация: хората имат свои собствени пристрастия и могат да бъдат по-бавни или по-малко надеждни при някои проблеми.
Интерактивен механизъм: как всъщност работи
Разгледайте интерактивно основната технология зад тази разработка.
Which component of an AI application is the machine-learning model itself?
Какво да гледате след това
Бъдещите оценки ще трябва да тестват повече от заглавните резултати. Важни въпроси включват дали моделите могат да обобщават непознати проблеми, дали техните отговори зависят от това как е представена информацията, как се променя производителността с нарастване на сложността и дали успехът отразява стратегия за многократна употреба или запаметени модели.
Следващото полезно развитие би било по-широко, възпроизводимо тестване на модели и формати на задачи. Функцията на MIT Technology Review не предоставя единна карта с резултати, обхващаща всичките седем теста, нито източникът посочва имена на модели, версии, размери на извадката, условия за подсказване или проценти на грешки за повечето примери. Тези подробности ще бъдат необходими, за да се определи дали докладваните слабости са широко разпространени, концентрирани в конкретни фамилии модели или чувствителни към начина, по който се администрират тестовете.
Независимите оценки трябва също така да отделят неуспехите на визуалното възприятие от неуспехите в разсъжденията, като поддържат основния пъзел постоянен, като същевременно променят представянето му. Изследователите и оценителите също трябва да наблюдават дали моделите се подобряват чрез истинско обобщение или чрез по-голямо излагане на материал, подобен на бенчмарк. Обсъждането в статията на пъзелите Connections и вариациите Knights and Knaves показва защо замърсяването и познаването имат значение. Модел, който се представя добре при публикувани или тясно свързани въпроси, може да не е еднакво способен при новогенерирани проблеми със същата основна структура. Следователно тестването трябва да включва загадки, променени формулировки, непознати визуални оформления и задачи, които изискват обяснение или проверка на междинни ограничения, без да се предполага, че убедителният отговор е правилен.
Сложността и прехвърлянето в реалния свят остават открити въпроси. MIT Technology Review съобщава, че производителността може да се разпадне с увеличаване на броя на елементите или необходимите стъпки, но източникът не установява как тези констатации се превеждат в практически системи с инструменти, извличане, външна памет или човешки надзор. Бъдещите доклади трябва да проследяват дали подобни добавки подобряват надеждността, просто помагат на моделите да търсят по-ефективно или въвеждат нови режими на отказ. Читателите трябва също да следят за оценки, които измерват качеството на стратегията, а не само крайния отговор, тъй като правилен резултат, постигнат чрез крехко или необобщаващо правило, може да не оцелее след малка промяна в проблема.