Nini kilitokea
Mapitio ya Teknolojia ya MIT yalichapisha kipengele shirikishi kilichojengwa karibu na mafumbo saba ambayo yanachunguza jinsi mifano ya AI inavyosababu. Makala hayo yanaripoti kwamba miundo imeboreshwa kwa haraka kwenye baadhi ya kazi lakini bado inatatizika na upotoshaji wa anga, tofauti fiche za matatizo yanayojulikana, ufupisho wa kuona, na hoja tata za hatua nyingi zinazozidi kuwa ngumu.
Mapitio ya Teknolojia ya MIT inaripoti kwamba kipengele chake kinawasilisha majaribio saba yanayofunika mawazo ya anga, kumbukumbu na kubadilika, mawazo ya kufikirika na ya kuona, angavu ya binadamu, na ugumu unaoongezeka. Makala haya yanaweka utatuzi wa mafumbo katika historia ndefu ya tathmini ya AI, ikibainisha kuwa michezo kama vile cheki, chess na Go imetumika kama vitanda vya majaribio tangu miaka ya awali ya uwanja huo. Inasema utendakazi wa chemshabongo umeimarika sana: timu ya Chuo Kikuu cha Columbia iliyopatikana mwishoni mwa 2024 ambayo miundo bora ilitatua tu 18% ya mafumbo ya New York Times Connections, ilhali kufikia mapema 2025 baadhi ya miundo inaweza kuyatatua kwa karibu kila wakati. Chanzo hakitambui miundo au kutoa ulinganisho sanifu katika mifano yote katika kipengele.
Mapitio ya Teknolojia ya MIT yanasema hoja za anga zinabaki kuwa udhaifu mkubwa. Sehemu yake ya mzunguko wa kiakili huwauliza wasomaji kutambua kitu chenye mwelekeo-tatu kinachoonyeshwa kutoka kwa pembe nyingine, na makala inaripoti kwamba miundo ya lugha iliyo na uwezo wa kuingiza picha bado haifanyi kazi vibaya sana kwenye kazi kama hizo. Kipengele hiki huunganisha ugumu huu na madai kuhusu mifumo ya AI inayotengeneza miundo ya ulimwengu, kikisema kwamba miundo ya sasa ya lugha kubwa haionekani kuchezea vitu vyenye sura tatu kwa njia sawa na ambayo wataalamu wa anga wa binadamu wanaweza. Makala pia yanaelezea tatizo la kumbukumbu-na-kubadilika: miundo iliyofunzwa kuhusu kiasi kikubwa cha taarifa inaweza kutambua muundo wa mafumbo unaojulikana na kupuuza mabadiliko madogo. Inataja utafiti wa 2024 wa Google na Chuo Kikuu cha Illinois Urbana-Champaign unaohusisha tofauti za mafumbo ya Knights na Knaves kama ushahidi wa jambo hili.
Kipengele kisha hugeukia kwa ufupisho wa pande mbili na hoja za kuona. Mapitio ya Teknolojia ya MIT yanaripoti kuwa miundo hufanya vyema kwenye mafumbo ya ARC-AGI wakati gridi hutolewa kama nyuzi za nambari zinazosimba rangi za seli badala ya picha. Pia inasema utafiti umegundua kuwa wanamitindo wakati mwingine wanaweza kufikia jibu sahihi kupitia sheria ngumu, zisizoweza kujumlisha, wakati wanadamu wanaweza kutegemea dhana rahisi za kuona. Makala yanawasilisha maswali ya SimpleBench, matatizo ya Knights na Knaves, na fumbo la kubadilisha ARC-AGI kama mifano ya kazi zinazoweza kufichua tofauti hizi.
Inafafanua majaribio ya angavu ambayo mara nyingi watu hutoa majibu ya haraka lakini yasiyo sahihi, wakati miundo inaweza kujibu kwa makusudi zaidi. Mfano mmoja unauliza ni muda gani pango lingechukua kujaa nusu wakati idadi ya popo inaongezeka maradufu kila siku; mwingine huwauliza wasomaji kutambua nukuu inayohusishwa na Alice.
Mwishowe, Mapitio ya Teknolojia ya MIT yanaripoti kwamba utendaji mara nyingi huharibika kadiri shida zinavyozidi kuwa ngumu. Inanukuu uchunguzi wa Apple unaogundua kwamba miundo ya lugha inaweza kutatua matoleo rahisi ya Mnara wa Hanoi na matatizo ya kuvuka mto lakini ilianza kudorora idadi ya diski au watu ilipofikia sita au zaidi. Pia inataja kazi ya watafiti katika Chuo Kikuu cha Washington, Chuo Kikuu cha Stanford, na Taasisi ya Allen kupata matatizo sawa na mafumbo ya gridi ya mantiki. Kipengele hiki kinabainisha kuwa watoa maoni walitilia shaka iwapo matokeo haya yanaonyesha kizuizi cha kipekee cha mawazo kama mashine au yanaonyesha tu ukweli kwamba watu pia hufanya makosa zaidi kadiri utata unavyoongezeka. Kwa hivyo mifano yake ya kuvuka mto na gridi ya mantiki haijaribu tu ikiwa muundo unaweza kutoa jibu, lakini ikiwa unaweza kudumisha vizuizi katika makato mengi yaliyounganishwa.
Maelezo ya chanzo: technologyreview.com ↗
Kwa nini ni muhimu
Kipengele kinaonyesha kwa nini madai mapana kuhusu akili ya AI yanaweza kupotosha. Muundo unaweza kufanya vyema kwenye trivia au alama inayojulikana huku ukikosa mabadiliko madogo ya maneno, mabadiliko ya mwonekano, au tatizo linalohitaji hatua kadhaa tegemezi. Tofauti hizo ni muhimu wakati mifumo inatumiwa kwa maamuzi badala ya maandamano.
Somo kuu ni kwamba ufaulu kwenye darasa moja la jaribio haupaswi kuchukuliwa kama kipimo cha jumla cha akili. Mifano ya Mapitio ya Teknolojia ya MIT huchukua kazi ambazo zinaonekana rahisi juu juu lakini zinahitaji uwezo tofauti: kuzungusha kitu kiakili, kufuatilia ukweli na uwongo katika taarifa zote, kuashiria sheria ya kuona, kupinga uvumbuzi wa kupotosha, au kupanga mlolongo chini ya vizuizi. Mfumo unaweza kuwa na nguvu isiyo ya kawaida katika eneo moja na usiaminike katika eneo lingine. Ukosefu huo wa usawa ni muhimu haswa wakati watumiaji wanatafsiri majibu fasaha kama ushahidi kwamba mwanamitindo alielewa shida kuu.
Nakala hiyo pia inaangazia shida ya tathmini: muundo wa kazi unaweza kuathiri matokeo. Mapitio ya Teknolojia ya MIT yanaripoti kuwa utendaji wa ARC-AGI huboreka wakati gridi za kuona zinabadilishwa kuwa uwakilishi wa nambari. Hili linapendekeza kwamba alama inaweza kuakisi si uwezo wa kufikiri wa kielelezo pekee bali pia jinsi tatizo linavyosimbwa na kuwasilishwa. Wasiwasi sawa unatumika kwa puzzles inayojulikana. Iwapo muundo umekumbana na tofauti ya karibu wakati wa mafunzo, jibu sahihi linaweza kuonyesha utambuzi wa muundo au urejeshaji badala ya uwezo wa kurekebisha sheria kwa kesi mpya. Chanzo hakibainishi ni mara ngapi utaratibu wowote hutokea kwenye mifumo iliyotumwa.
Mapungufu haya yana athari za kivitendo kwa mtu yeyote anayetumia AI katika elimu, programu, utafiti, usimamizi au mipangilio mingine inayohusisha kesi zisizojulikana. Muundo unaofaulu kwenye mifano ya kawaida bado unaweza kushindwa wakati maneno yanapobadilika, vikwazo kadhaa vinapoingiliana, au maelezo muhimu yanaonekana badala ya maandishi. Kipengele hiki hakiripoti uzinduzi wa bidhaa mpya, toleo jipya la muundo, au tathmini inayodhibitiwa ya mfumo mahususi wa kibiashara. Thamani yake ni ya kufafanua: huwapa wasomaji njia madhubuti za kuona ni kwa nini faida za kigezo na lugha iliyoboreshwa hazianzishi hoja zenye nguvu. Kifungu hiki pia kinahifadhi sifa muhimu: wanadamu wana upendeleo wao wenyewe na wanaweza kuwa polepole au chini ya kutegemewa kwa shida fulani.
Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli
Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.
Which component of an AI application is the machine-learning model itself?
Nini cha kutazama baadaye
Tathmini za siku zijazo zitahitaji kupima zaidi ya alama za kichwa. Maswali muhimu yanajumuisha iwapo miundo inaweza kujumuisha matatizo yasiyojulikana, iwapo majibu yao yanategemea jinsi maelezo yanavyowakilishwa, jinsi utendakazi unavyobadilika kadiri utata unavyoongezeka, na kama mafanikio yanaonyesha mkakati unaoweza kutumika tena au ruwaza zilizokariri.
Uendelezaji unaofuata wa manufaa utakuwa ni majaribio mapana zaidi, yanayoweza kuzalishwa tena katika miundo na miundo ya kazi. Kipengele cha Mapitio ya Teknolojia ya MIT haitoi kadi moja ya alama inayofunika majaribio yote saba, wala chanzo hakiainishi majina ya mifano, matoleo, saizi za sampuli, hali ya ushawishi, au viwango vya makosa kwa mifano mingi. Maelezo hayo yangehitajika ili kubaini ikiwa udhaifu ulioripotiwa umeenea, umejikita katika familia maalum za kielelezo, au nyeti kuhusu jinsi majaribio yanavyosimamiwa.
Tathmini za kujitegemea zinapaswa pia kutenganisha kushindwa kwa mtazamo wa kuona na kushindwa kwa hoja kwa kuweka fumbo la msingi mara kwa mara huku likibadilisha uwakilishi wake. Watafiti na wakadiriaji wanapaswa pia kuangalia kama miundo inaboreka kupitia ujanibishaji halisi au kwa kufichuliwa zaidi kwa nyenzo zinazofanana na alama. Mjadala wa makala kuhusu mafumbo ya Muunganisho na tofauti za Knights na Knaves unaonyesha kwa nini uchafuzi na ujuzi ni muhimu. Muundo unaofanya vyema kwenye maswali yaliyochapishwa au yanayohusiana kwa karibu huenda usiwe na uwezo sawa wa matatizo mapya yaliyo na muundo sawa. Kwa hivyo majaribio yanapaswa kujumuisha mafumbo, maneno yaliyobadilishwa, miundo ya kuona isiyojulikana, na kazi zinazohitaji kueleza au kuangalia vikwazo vya kati bila kudhani kuwa jibu la kushawishi ni sahihi.
Utata na uhamishaji wa ulimwengu halisi husalia kuwa maswali wazi. Mapitio ya Teknolojia ya MIT yanaripoti kwamba utendaji unaweza kuharibika kadiri idadi ya vipengele au hatua zinazohitajika zinavyoongezeka, lakini chanzo hakiashirii jinsi matokeo hayo yanavyotafsiri kwa mifumo ya vitendo yenye zana, urejeshaji, kumbukumbu ya nje, au uangalizi wa kibinadamu. Kuripoti kwa siku zijazo kunapaswa kufuatilia kama nyongeza kama hizo zitaboresha kutegemewa, kusaidia tu miundo kutafuta kwa ufanisi zaidi, au kuanzisha hali mpya za kutofaulu. Wasomaji wanapaswa pia kuangalia tathmini zinazopima ubora wa mkakati, sio tu jibu la mwisho, kwa sababu matokeo sahihi yanayofikiwa kupitia sheria dhalili au isiyoweza kurekebishwa huenda yasibakie kwenye mabadiliko madogo katika tatizo.