Nini kilitokea
Karatasi ya utafiti iliyochapishwa mnamo Agosti 5 inatumia mbinu kutoka kwa majaribio ya kielimu ili kupima alama za usalama za AI hunasa, kuchagua seti ndogo za vidokezo muhimu, na mabadiliko ya ukaguzi katika tabia ya mfano.
Watafiti wawili wa kujitegemea na watafiti wawili wanaoshirikiana na Taasisi ya Usalama ya AI ya Uingereza walitathmini miundo ya gumzo 192 kwenye vigezo nane vinavyofunika kukataliwa kwa ombi lenye madhara, kukataa kupita kiasi maombi yasiyofaa, madhara ya muktadha, na ukweli. Suti kamili ilikuwa na vishawishi 5,255 kabla ya kuchakatwa; uchanganuzi ulibaki 5,067 baada ya kuondoa majibu ambayo hayajapimwa na vipengee ambavyo havikutofautisha kati ya miundo iliyojaribiwa.
Timu ilichukulia miundo kama wafanya majaribio na vidokezo vya kuigwa kama vipengee vya majaribio, kwa kutumia nadharia ya majibu ya kipengee kukadiria ni vidokezo vipi vilikuwa vigumu na ni miundo ipi iliyotenganishwa vyema zaidi. Katika uchanganuzi wake wa sababu kuu, suluhu ya vipengele vitatu-iliyofupishwa kama ukali wa kukataa, ukweli, na madhara ya muktadha-ilifafanua 77% ya tofauti katika uwezo wa mfano, ikilinganishwa na 47% kwa kipengele kimoja.
Katika tathmini 20 zilizokamilishwa, majaribio matatu yasiyobadilika ya mara 25 yalipata mambo hayo matatu kwa kutumia chini ya 2% ya kitengo. Kwa HarmBench, SORRY-Bench, na OR-Bench-Hard, takribani vidokezo 10 vilivyochaguliwa kulingana na hali vilitoa tena viwango vya kiwango kamili na uwiano wa 0.92 hadi 0.94 na kupunguza idadi ya vidokezo kwa 97-99%; faida ilipungua kadri bajeti ya majaribio inavyokua.
Mfinyazo sio tu sampuli za nasibu. Nadharia ya majibu ya kipengee hukadiria jinsi kila kidokezo kilivyo kigumu na jinsi kinavyotenganisha miundo yenye mifumo tofauti ya majibu, kisha kuchagua vipengee vinavyohifadhi muundo wa jaribio kubwa zaidi. Waandishi walilinganisha fomu fupi fupi zisizobadilika na uteuzi unaobadilika na wakafanya tathmini badala ya kupima data inayotumiwa kuchagua vidokezo. Muundo huo unaunga mkono dai fupi zaidi kwamba baadhi ya viwango vya viwango vilivyopo vinaweza kutolewa tena kwa ufanisi; haionyeshi kuwa jaribio la vipengee 10 au 25 linaweza kugundua hali mpya kabisa ya kutofaulu.
Maelezo ya chanzo: Rivera and colleagues' research paper on arXiv ↗
Kwa nini ni muhimu
Utafiti unapendekeza kwamba vidokezo vilivyochaguliwa vyema vinaweza kufanya ukaguzi wa mara kwa mara wa usalama wa AI kuwa nafuu bila kujifanya kuwa kila alama hupima alama moja ya usalama ya ulimwengu wote.
Majaribio ya bei nafuu yanaweza kuruhusu wasanidi programu, maabara ndogo na wakaguzi huru kuangalia matoleo zaidi ya miundo wakati wa mafunzo, urekebishaji mzuri, ujazo na mabadiliko ya haraka ya mfumo. Matokeo yake ni kuhusu kuzalisha tena vipimo vilivyopo vya ulinganifu kwa ufanisi, sio kupanua kile ambacho alama hizo zinaweza kugundua.
Uchanganuzi wa sababu pia unafichua ubadilishaji wa alama. Vigezo vinavyokataa zawadi vinaweza kupishana, ilhali kigezo cha kuepusha kukataa kusiko lazima huthawabisha tabia iliyo kinyume. Kuziweka wastani bila kueleza uzani kunaweza kuficha ikiwa kielelezo kimekuwa salama zaidi, kizuiaji zaidi, au kisichofaa sana kwa maombi yasiyofaa.
Karatasi pia ilijaribu mbinu za ukaguzi wa kisanduku cheusi juu ya tabia iliyochochewa kimakusudi ya kuweka mchanga. Cheki ya muundo wa majibu ilinasa utendaji duni uliochaguliwa lakini ilikosa utendakazi sawa zaidi; kuongeza ukaguzi wa uwezo wa kihistoria uliinua ugunduzi uliojumuishwa hadi 94-97% katika visa vilivyoigizwa. Hiyo inasaidia ukaguzi wa tabaka badala ya kutegemea alama moja.
Kwa watengenezaji, thamani ya uendeshaji ni frequency. Tathmini fupi inaweza kurudiwa baada ya mabadiliko ya haraka ya mfumo, pasi ya kukadiria, kusasisha zana, kusasisha zana au masahihisho ya sera ya usalama bila kutumia bajeti ya kipimo kamili kila wakati. Lakini matokeo ni muhimu tu wakati timu zinaweka safu asili kama ukaguzi wa mara kwa mara, kuzungusha vidokezo vilivyobaki, na kuchunguza mabadiliko ya kushangaza badala ya kuboresha moja kwa moja kwa jaribio lililobanwa. Vinginevyo hundi ya bei nafuu inaweza kuwa lengo lingine la kuzidisha.
Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli
Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.
crm_get_transaction(id='4092').Which description best fits "narrow AI", the kind of AI in use today?
Nini cha kutazama baadaye
Tazama urudufishaji huru, uthibitishaji kwenye familia za vielelezo vya siku zijazo, na ushahidi kwamba majaribio yaliyofupishwa yanatabiri tabia nje ya viwango ambavyo viliundwa kuzalisha tena.
Hiki ni kichapo kipya, si hukumu iliyokamilika ya ukaguzi wa rika. Uchambuzi wa muundo uliofichwa ulitumia mifano 134, ambayo waandishi wanaona kuwa ni ndogo kwa viwango vya kawaida vya saikolojia, na njia mbadala ya uchimbaji ilibakiza sababu mbili badala ya tatu. Majina ya vipengele ni muhtasari wa majaribio, sio ufafanuzi uliothibitishwa wa usalama.
Kila kielelezo kilitoa jibu moja kwa kila onyesho linalopatikana kupitia OpenRouter, na kila kigezo kilitumia jaji wake wa kiotomatiki. Majaribio mafupi yanayotokana yanaweza kurithi dosari katika vidokezo asili, sheria za alama, utangazaji wa lugha, na waamuzi; waandishi husema waziwazi kwamba mbano haionyeshi kuwa alama hutabiri usalama wa upelekaji au hukaa kuarifu kwa mifano ya siku zijazo.
Majaribio ya kuweka mchanga yalitumia viumbe vya modeli badala ya vielelezo vilivyoboreshwa ili kukwepa tathmini, ambayo inaweza kuwa rahisi kugundua. Ukaguzi wa API huthibitisha mwendelezo wa tabia, si utambulisho wa uzani wa modeli fiche, na utafiti haukumjaribu adui aliyefunzwa mahususi kushinda mbinu za ukaguzi.
Mpaka muhimu zaidi wa karatasi ni kati ya ufanisi wa kipimo na uhakikisho wa usalama. Fomu fupi inaweza kukadiria vipengele fiche vilivyopo katika alama ya awali, lakini inarithi lugha ya benchmark, hakimu, uundaji wa papo hapo na sehemu zisizoonekana. Tathmini za siku zijazo zinapaswa kupima vidokezo vya lugha nyingi, mawakala wanaotumia zana, mazungumzo marefu, vielelezo vilivyosanifiwa vyema na maamuzi huru ya binadamu. Wanapaswa pia kuripoti alama iliyobanwa inapoyumba, kwa sababu uwiano nadhifu kwenye data iliyoshikiliwa unaweza kuficha kutofaulu kwa mfano wa familia unaofuata.
Kanuni ya vitendo ya kuasili hufuata kutokana na mapungufu hayo: tumia majaribio yaliyobanwa kama walinzi, si maamuzi. Timu zinaweza kuziendesha mara kwa mara ili kupata waliorudi nyuma, kisha kuongeza mabadiliko hadi kiwango kamili na ukaguzi wa kibinadamu wakati fomu fupi inaposogezwa bila kutarajiwa. Ushahidi wa utafiti wenyewe unaunga mkono mtiririko huo wa kazi kwa sababu muundo wa sababu ulitolewa kutoka kwa vidokezo maalum, waamuzi, na matokeo ya mfano. Kuchapisha vipengee vilivyochaguliwa, msimbo wa uteuzi, matokeo yasiyotarajiwa, na historia ya toleo kungeruhusu wakaguzi huru kukagua kama majaribio mafupi yatasalia kuwa ya kuelimisha baada ya wasanidi programu kuyaona na baada ya familia za muundo mpya kubadilisha usambazaji wa majibu.
Uwazi sawa ni muhimu wakati mtindo unasasishwa. Jaribio fupi lililoratibiwa kwa kizazi kimoja linaweza kuwa rahisi sana, finyu sana, au kupangiliwa kimakosa na kidokezo cha mfumo mpya. Timu zinapaswa kuhifadhi matoleo ya awali, kufichua wakati kipengee au hakimu inabadilika, na kuripoti vipindi vya uaminifu badala ya kuwasilisha nafasi iliyobanwa kama alama mahususi za usalama. Mazoea hayo yanageuza matokeo ya ufanisi wa karatasi kuwa programu ya ufuatiliaji inayoweza kukaguliwa huku ikiweka alama asilia inapatikana kwa ukaguzi wa kina.