InayofuataMwongozo unaofuata
California SB 53 na Frontier AI Transparency
Jamii
MWONGOZO wa Jamii
Mfumo wa usalama wa AI wa mipakani, kama vile sera inayowajibika ya kuongeza viwango, ni ahadi iliyochapishwa na maabara ya AI ili kujaribu miundo yake kwa uwezo hatari.
Iwapo modeli itavuka kiwango kilichowekwa, maabara hujitolea kuongeza ulinzi imara zaidi, au kutopeleka au kutotoa mafunzo zaidi hadi ulinzi huo uwekwe. Mifumo hii ni muhimu kwa sababu ndiyo njia kuu kwa sasa miundo ya hali ya juu zaidi ya AI hutawaliwa kwa hatari kubwa, ingawa nyingi ni za hiari na zimeandikwa na maabara zenyewe.
Anthropic ilichapisha Sera ya kwanza ya Kuongeza Uwajibikaji mnamo Septemba 2023. Ilianzisha Viwango vya Usalama vya AI (ASLs), zilizowekwa kielelezo cha viwango vya usalama wa viumbe hai, ambapo viwango vya juu vinahitaji ulinzi thabiti zaidi wa usalama na utumiaji. Toleo la baadaye, mnamo Oktoba 2024, lilirejelea sera hiyo kwa mujibu wa viwango vya juu vya uwezo na ulinzi unaohitajika na kueleza jukumu la Afisa Mwajiri wa Kuongeza Mizani. OpenAI ilitoa Mfumo wake wa Maandalizi kama beta mnamo Desemba 2023. Ilipata hatari katika kategoria zilizofuatiliwa, asili ikijumuisha vitisho vya CBRN, usalama wa mtandao, ushawishi na uhuru wa kielelezo. Sahihisho la 2025 liliipanga upya kulingana na vizingiti vya uwezo wa Juu na Muhimu na kupunguza ushawishi kama aina inayofuatiliwa. Google DeepMind ilichapisha Mfumo wake wa Usalama wa Mipaka Mei 2024 na imeufanyia marekebisho tangu wakati huo. Inafafanua Viwango Muhimu vya Uwezo (CCLs) ambavyo huanzisha mipango ya majibu. Katika Mkutano wa AI Seoul mnamo Mei 2024, kampuni 16 zilitia saini Ahadi za Usalama za Frontier AI. Walikubali kuchapisha mifumo ya usalama, kuweka vizingiti vya hatari isiyoweza kuvumilika, na kutokuza au kupeleka muundo ikiwa hatari zake hazingeweza kuwekwa chini ya vizingiti hivyo. Mifumo mingi ilichapishwa kabla ya Mkutano wa Kitendo wa Paris AI mnamo Februari 2025. Wakosoaji wanaashiria udhaifu kadhaa. Maabara huandika vizingiti vyao wenyewe na wanaweza kuvirekebisha wao wenyewe. Maneno kama vile "kuinua maana" huacha nafasi ya kufasiriwa. Uthibitishaji wa nje ni mdogo, na ushindani wa kibiashara huzipa maabara motisha ya kusoma matokeo kwa ukarimu. Dhana potofu ya kawaida ni kwamba mifumo hii ni sheria. Wengi ni wa hiari, ingawa hii inabadilika. SB 53 ya California inahitaji watengenezaji wakubwa wa mipaka kuchapisha mfumo kama huu, na Kanuni ya Matendo ya AI ya Madhumuni ya Jumla ya Umoja wa Ulaya, njia ya hiari ya kuonyesha utii wa Sheria ya AI, huwauliza waliotia saini waitumie.
Madhara makubwa na ya kila siku ya AI hutegemea ni nani anayeelewa hatari na ni nani anayeweza kuchukua hatua.
Usomaji wa umma na kitaaluma huchagiza ikiwa sera thabiti ya usalama inawezekana kisiasa.
Ufafanuzi wazi hupunguza kunasa kwa hype, PR ya maabara, na ukumbi wa michezo wa maadili usioeleweka.
Mifumo inasonga kutoka kwa ahadi za hiari kuelekea matarajio ya udhibiti. California sasa inahitaji watengenezaji wakubwa wa mipakani kuzichapisha, Kanuni za Matendo za Umoja wa Ulaya huwauliza waliotia saini kuzipitisha, na mamlaka zaidi zinaweza kufuata. Maswali ya wazi yanajumuisha nani anakagua utiifu, jinsi viwango vinavyosawazishwa katika maabara zote, na kama tathmini zinaweza kuendana na kuboresha kwa haraka mifumo ya mawakala. Mashirika huru ya upimaji, ikijumuisha taasisi za serikali za AI, yanaweza kuchukua jukumu kubwa katika kuangalia madai ya maabara. Mvutano wa kati utabaki: maabara hutengeneza sheria ambazo zinahukumiwa, ambayo hufanya uwazi na uchunguzi wa nje kuwa muhimu.
Kabla ya kuachiliwa, maabara hujaribu kama muundo mpya unatoa mwinuko wa maana kwa mtu anayejaribu kupata silaha za kibaolojia. Iwapo itavuka kizingiti, maabara huongeza vichujio vikali vya matumizi mabaya na usalama kabla ya kutumwa.
Mnamo Mei 2025, Anthropic ilisema kuwa imewezesha ulinzi wa uwekaji na ulinzi wa usalama wa ASL-3 kwa Claude Opus 4 kama tahadhari, kwa sababu haikuweza kukataa kuwa mtindo huo umefikia kikomo cha uwezo husika.
Mfumo wa Maandalizi wa OpenAI unaelekeza Kikundi cha Ushauri wa Usalama kukagua ripoti za uwezo na kushauri uongozi kuhusu kama ulinzi unafaa kabla ya kutolewa.
Ufuatiliaji wa urudufishaji unaojiendesha wa maabara au uharakishaji wa utafiti wa AI huendesha tathmini za mawakala. Hizi hujaribu kama modeli inaweza kukamilisha kazi ndefu, za hatua nyingi bila msaada wa mwanadamu.
Kutibu hatari iliyopo kama sci-fi huku uwezo ukichanganya.
Kuchanganya usalama wa bidhaa ya uso na upatanishi chini ya uhuru wa juu.
Inawaacha watazamaji wasio wa Kiingereza na wasio wataalamu wenye vyanzo vya ubora wa chini pekee.
Tenganisha madhara ya bidhaa, matumizi mabaya, na hasara ya udhibiti / hatari za kupotosha.
Uliza ni ushahidi gani unaweza kubadilisha maoni yako kuhusu kalenda na ukali.
Pendelea vyanzo vya msingi na tathmini thabiti kuliko madai ya uuzaji.
Tambua njia moja ya hatua: kazi, sera, ufadhili, au ujuzi - sio tu ufahamu.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mfumo wa usalama wa AI wa mipakani, kama vile sera inayowajibika ya kuongeza viwango, ni ahadi iliyochapishwa na maabara ya AI ili kujaribu miundo yake kwa uwezo hatari. Iwapo modeli itavuka kiwango kilichowekwa, maabara hujitolea kuongeza ulinzi imara zaidi, au kutopeleka au kutotoa mafunzo zaidi hadi ulinzi huo uwekwe. Mifumo hii ni muhimu kwa sababu ndiyo njia kuu kwa sasa miundo ya hali ya juu zaidi ya AI hutawaliwa kwa hatari kubwa, ingawa nyingi ni za hiari na zimeandikwa na maabara zenyewe.
Mifumo hii imejengwa juu ya ahadi za ikiwa-basi zinazofunga vizingiti vya uwezo na ulinzi unaohitajika.
Sera ya Kuongeza Uwajibikaji ya Septemba 2023 ya Anthropic ilianzisha ASL, zilizoundwa kwa njia isiyofaa kwa viwango vya usalama wa viumbe.
DeepMind hutumia Viwango Muhimu vya Uwezo (CCLs), ambavyo huanzisha mipango ya majibu inapofikiwa.
Ahadi za Usalama za Frontier AI zilikuwa ahadi za hiari za kuchapisha mifumo na kutoendelea ikiwa hatari hazingeweza kuwekwa chini ya vizingiti.
Marekebisho hayo yalipanga upya mfumo kuzunguka Vizingiti vya Juu na Muhimu na kuondoa ushawishi kama kitengo kinachofuatiliwa.
Endelea kujifunza
Miongozo zaidi imechaguliwa kwa mada hii
InayofuataMwongozo unaofuata
California SB 53 na Frontier AI Transparency
Jamii