Nini kilitokea
Watafiti walikagua upungufu katika alama za AI kwa kukusanya alama za miundo 51 kwenye vigezo 12. Wanaripoti kwamba jozi mbili za hufanya kama vibadala na kwamba kuondoa nakala hubadilisha viwango vya miundo mingi.
Chapisho la awali la arXiv la Zaruhi Navasardyan na Hrant Davtyan hukagua kama alama za AI halisi hutoa taarifa tofauti au kupima uwezo sawa na kurudia. Waandishi wanasema ripoti za modeli hutumia suti tofauti za , na kuacha muundo wa jumla wa benchmark kuwa chache na kufanya uhusiano kati ya vigezo kuwa vigumu kupima. Ukaguzi wao unachanganya alama kutoka kwa kadi za kielelezo na karatasi za alama na tathmini ya mwandishi mwenyewe inayofanywa chini ya kila itifaki rasmi ya benchmark.
Seti ya data inayotokana inashughulikia miundo 51 na alama 12 za AI halisi, iliyotolewa kutoka kwa sajili kubwa ya vigezo 51 na miundo 152. Karatasi inaripoti uthibitisho wa kiasi cha upunguzaji kazi kati ya vigezo 12. Muhtasari wake hubainisha jozi mbili mbadala, kumaanisha kuwa alama zilizooanishwa zinaonekana kutoa maelezo yanayopishana kuhusu utendakazi wa muundo. Muhtasari hautaji jozi hizo au kuelezea kazi mahususi ndani yake, kwa hivyo chanzo hakitumii akaunti mahususi zaidi ya uwezo unaorudiwa. Matokeo yaliyoripotiwa yanahusu muundo wa maelezo ya alama zilizokusanywa, si madai kwamba muundo wowote ni bora au mbaya zaidi katika matumizi ya kimwili ya AI.
Waandishi pia wanaripoti kuwa upungufu unaathiri viwango. Wakati jozi mbili mbadala zinapokunjwa katika safu wima moja, miundo 22 kati ya 51 husogea kwa angalau nafasi tatu chini ya wastani wa uzani sawa. Hii ni dalili thabiti kwamba muundo wa kundi la tathmini unaweza kuathiri kwa kiasi kikubwa matokeo linganishi. Chanzo hakitoi jedwali kamili la viwango, utambulisho wa miundo iliyoathiriwa, au nafasi za kabla na baada, kwa hivyo ukubwa wa mabadiliko zaidi ya kiwango kilichotajwa hauwezi kutathminiwa kutoka kwa muhtasari pekee.
Kisha utafiti hutumia utaratibu wa uteuzi wa pupa ili kuchagua alama kulingana na matumizi ambayo huchanganya mtawanyiko wa alama na tofauti ambazo hazijaelezewa na vigezo vilivyochaguliwa tayari. Waandishi wanaripoti kuwa sehemu ndogo ya alama nne inabakiza 78.5% ya matumizi ya vigezo vyote 12. Zinalingana na daraja la Bradley–Terry kwenye kitengo hicho kidogo, zikiwasilisha mbinu kama njia ya kupanga miundo kwa kutumia alama za kiwango cha alama wakati kuna mwingiliano wa kutosha. Karatasi hiyo inasema utaratibu huo sio maalum kwa AI halisi, lakini chanzo hakiashirii jinsi inavyofanya kazi katika nyanja zingine au ikiwa kitengo kidogo kilichochaguliwa kimethibitishwa dhidi ya matokeo ya ulimwengu halisi ya baadaye. Utayarishaji huu ni wasilisho la sasa la arXiv la tarehe 26 Agosti, 2026. Chanzo hutoa maelezo ya mukhtasari na ya biblia, lakini si mbinu za kina, majedwali, makadirio ya kutokuwa na uhakika, au matokeo ya tathmini yanayohitajika ili kutathmini kila chaguo la mbinu kwa kujitegemea. Matokeo kwa hivyo yanapaswa kusomwa kama matokeo ya waandishi yaliyoripotiwa kutoka kwa uchapishaji wa awali badala ya kama kiwango kilichowekwa cha kutathmini mifumo ya kimwili ya AI.
Maelezo ya chanzo: arxiv.org ↗
Kwa nini ni muhimu
Chaguo la kulinganisha linaweza kuathiri hitimisho kuhusu mifumo ya AI inayofanya kazi vizuri zaidi. Utafiti unatoa njia ya kitakwimu ya kutambua majaribio yanayopishana na kuchagua seti ndogo ya tathmini huku ikihifadhi taarifa nyingi katika mpangilio kamili.
Mifumo ya kimwili ya AI mara nyingi hulinganishwa kupitia mikusanyo ya majaribio badala ya kipimo kimoja kinachokubalika kote. Ikiwa majaribio kadhaa yatachukua ishara sawa, kumpa kila moja uzito sawa kunaweza kuhesabu uwezo zaidi ya mara moja. Mabadiliko ya cheo yaliyoripotiwa mapema yanaonyesha ni kwa nini hii ni muhimu: muundo wa alama si chaguo la usimamizi tu, lakini unaweza kuathiri upangaji dhahiri wa miundo. Kwa watafiti, wasanidi programu na wasomaji wa ripoti za vielelezo, nafasi inaweza kuonyesha kwa sehemu majaribio yalijumuishwa na jinsi yalivyopimwa.
Ukaguzi unaopendekezwa unaweza kufanya vyumba vya tathmini kuwa na ufanisi zaidi. Kulingana na karatasi, vigezo vinne vilivyochaguliwa huhifadhi 78.5% ya matumizi yaliyopimwa katika zote 12. Ikiwa matokeo hayo yatashikilia majaribio mapana, mashirika yanaweza kupunguza kazi ya tathmini iliyorudiwa, kupunguza muda na rasilimali zinazohitajika ili kulinganisha mifumo, na kufanya ripoti za modeli kuwa rahisi kufasiriwa. Seti ndogo inaweza pia kusaidia timu kuzingatia majaribio ambayo huchangia taarifa tofauti badala ya kukusanya alama kutoka kwa viwango vinavyofanana sana.
Kazi hii ni muhimu kwa sababu inachukulia uteuzi wa alama kama tatizo la takwimu linaloweza kupimika. Badala ya kudhani kuwa kila kigezo kinaongeza ushahidi huru, utaratibu unachunguza mtawanyiko wa alama na tofauti iliyoachwa bila kuelezewa na majaribio ambayo tayari yamechaguliwa. Uundaji huo unaweza kuunga mkono sera zilizo wazi zaidi za tathmini, haswa wakati muundo wa mfano kwa haujakamilika. Waandishi pia wanasema utaratibu huo unahitaji alama za kiwango cha benchmark na mwingiliano wa kutosha, ambayo inaonyesha kuwa inaweza kutumika hata wakati watafiti hawawezi kurudisha kila modeli kwenye kila jaribio.
Matokeo pia yanapunguza kile ambacho wastani wa unaweza kuwaambia umma. Alama ya juu ya jumla inaweza kuonyesha upana halisi, lakini inaweza pia kufaidika kutokana na vipimo vinavyorudiwa vya tabia sawa. Kinyume chake, nafasi ya mwanamitindo inaweza kushuka wakati majaribio yasiyohitajika yanaporomoka ingawa alama zake mahususi za benchmark hazibadiliki. Chanzo hakionyeshi ikiwa nafasi iliyorekebishwa inatabiri utendaji bora zaidi nje ya safu ya benchmark, kwa hivyo karatasi inaunga mkono tahadhari kuhusu ukalimani badala ya hitimisho kwamba cheo cha alama nne ni bora zaidi. Kuna mipaka muhimu kwa madai. Uchanganuzi unajumuisha miundo 51 na vigezo 12 vilivyochaguliwa, si sajili kamili ya vigezo 51 na miundo 152. Muhtasari hautambui miundo, vigezo, jozi mbadala, usambazaji wa alama, muundo wa data unaokosekana, au kutokuwa na uhakika kuhusu takwimu iliyoripotiwa ya 78.5%. Pia haibainishi ikiwa viwango vyote hutathmini kazi zinazoweza kulinganishwa, iwe tathmini za waandishi ziliigwa kwa kujitegemea, au jinsi matokeo ni nyeti kwa uzani sawa na utendakazi wa matumizi uliochaguliwa. Maelezo hayo yataamua jinsi matokeo yanapaswa kutumika kwa upana.
Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli
Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.
Which component of an AI application is the machine-learning model itself?
Nini cha kutazama baadaye
Matokeo ya karatasi yanapaswa kujaribiwa kwa data pana na iliyokusanywa kwa kujitegemea. Maswali muhimu yaliyo wazi ni pamoja na ni alama zipi ziliunda jozi mbadala, jinsi viwango vilivyo thabiti katika uchaguzi wa uzani, na ikiwa kitengo kidogo kinachopendekezwa kinatabiri utendaji katika utumiaji wa vitendo.
Kipaumbele cha kwanza ni akaunti kamili ya karatasi ya jozi mbili mbadala. Kujua ni alama zipi zinazoweza kubadilishwa kitakwimu kunaweza kuonyesha kama kutohitajika tena kunaonyesha kazi zinazofanana, data iliyoshirikiwa au itifaki, hali za kawaida za kushindwa, au uhusiano mwingine. Pia itafichua ikiwa mwingiliano ni mahususi kwa miundo na alama maalum zilizojumuishwa katika ukaguzi huu. Bila maelezo hayo, wasomaji wanaweza kutathmini matokeo ya kichwa cha habari lakini si maana yake ya kiufundi kwa undani wa kutosha ili kuunda upya kundi la tathmini kwa kuwajibika.
Watafiti wanapaswa pia kuchunguza uthabiti wa viwango vya mfano. Usogeaji wa sehemu tatu ulioripotiwa hutumia wastani ulio na uzani sawa, ilhali kitengo kidogo cha alama nne kilichochaguliwa kinategemea utendaji wa matumizi na cheo cha baadaye cha Bradley-Terry. Bado haijulikani ikiwa miundo sawa husogea chini ya uzani tofauti, mbinu mbadala za uteuzi, vipindi vya kujiamini, au alama zisizokamilika. Uchanganuzi unaoweza kuzalishwa kwa kutumia data iliyotolewa au alama zilizokusanywa kwa kujitegemea utasaidia kutofautisha athari thabiti ya nafasi na ile inayotegemea mawazo mahususi ya utafiti.
Swali la ziada ni uhalali wa nje. Waandishi wanasema utaratibu huo sio maalum kwa AI halisi, lakini chanzo hakitoi matokeo kutoka kwa lugha, maono, matibabu, au vikoa vingine vya tathmini vya AI. Utumiaji wa mbinu mahali pengine utahitaji kuangalia ikiwa alama za ulinganifu zina mwingiliano wa kutosha na kama ufanano wa takwimu unalingana na uwezo wa kiutendaji unaorudiwa. Matokeo ya alama nne haipaswi kujumuishwa kiotomatiki kwa nyanja zingine hadi majaribio kama haya yaripotiwe.
Jaribio la vitendo litakuwa ikiwa safu iliyopunguzwa inahifadhi habari ambayo ni muhimu nje ya majedwali ya alama. Kazi ya siku zijazo inaweza kulinganisha kiwango cha alama nne na matokeo kutoka kwa kazi mpya, hali ya utumiaji, au tathmini za AI iliyoundwa kwa kujitegemea. Chanzo hakiripoti uthibitishaji kama huo, kwa hivyo haijajulikana bado ikiwa kitengo kidogo kilichopendekezwa kinapima uwezo mpana au hasa kinabana ruwaza zilizopo katika alama za awali. Wasomaji wanapaswa kufuatilia ikiwa wasimamizi wa viwango na wasanidi wa vielelezo watapitisha ukaguzi wa upungufu katika ripoti za siku zijazo. Masasisho muhimu yatajumuisha jozi za alama zilizotajwa, alama za alama zilizotolewa, uchanganuzi wa unyeti, urudiaji, na ushahidi kwamba mbinu hiyo hupunguza mzigo wa tathmini bila kuficha udhaifu muhimu. Hadi wakati huo, mchango mkubwa zaidi wa karatasi unaoungwa mkono ni onyo na mfumo wa takwimu unaoweza kutekelezeka: vyumba vya kulinganisha vinaweza kuwa na ushahidi unaoingiliana, na viwango vinapaswa kufasiriwa kulingana na jinsi ushahidi huo unavyohesabiwa.