Rudi kwa Habari
UsalamaAI Understanding muhtasari

Kigezo cha AWS hupata vigunduzi vya kuathiriwa vya AI msimbo salama wa bendera

Help Net Security inaripoti kwamba AWS ilijaribu miundo 12 ya AI kwenye kigezo kilichoundwa ili kutofautisha udhaifu unaoweza kutekelezwa na msimbo salama ambao unaonekana kuwa hatari pekee. Hakuna iliyofikia kiwango cha uzalishaji kilichobainishwa cha AWS kwa viwango vya uwongo-chanya na hasi vya uwongo.

4 min readRead the linked source
Source-provided image accompanying AWS benchmark finds AI vulnerability detectors flag safe code
Rejeleo la chanzoChanzo kimerekodiwa
Mchapishaji
helpnetsecurity.com
Kiungo cha chanzo
helpnetsecurity.comhttps://www.helpnetsecurity.com/2026/09/14/aws-deception-benchmark-security-vulnerabilities/
Aina ya chanzo
Chanzo kilichounganishwa - hali ya chanzo-msingi haijaanzishwa.
MuktadhaElewa hili katika sekunde 60

Anzia hapa

Masharti muhimu

Benchmark
Jaribio sanifu au seti ya data inayotumika kupima na kulinganisha utendakazi wa muundo.
Usahihi
Uwiano wa chanya zilizotabiriwa ambazo kwa kweli ni sahihi.
Jijaribu mwenyeweMaswali Yanayofafanuliwa kwa Miundo ya AI

Nini kilitokea

Help Net Security inaripoti kwamba AWS imetoa yake ya Udanganyifu hadharani, ambayo hujaribu kama miundo ya AI inaweza kutofautisha udhaifu halisi wa programu kutoka kwa msimbo salama ulio na mifumo ya kuathirika inayopotosha. Kigezo kinajumuisha sampuli 14,822 zinazotumia lugha 16 za programu na zaidi ya kategoria 70 za CWE; 9,695 ni alama na 5,127 zimechanganywa kama sampuli zisizo na alama.

Help Net Security inaripoti kwamba AWS ilitathmini miundo 12 ya madhumuni ya jumla kutoka kwa watoa huduma watano kwa kutumia kielelezo kilichoundwa kuzunguka chanya za uwongo. Mifano salama ya kielelezo ina mifumo halisi ya kuathirika pamoja na ulinzi unaozuia unyonyaji. Changamoto zingine hutofautiana hali ya utumiaji, kama vile sera za mtandao wa Kubernetes, kwa hivyo ni lazima mtindo uzingatie kanuni na mazingira yake.

Kulingana na ripoti, AWS ilizalisha na kuboreshwa mifano dhidi ya mifano ya mipaka, bila kujumuisha sampuli ambazo zilikuwa rahisi sana kuainisha. AWS inasema mchakato huu ulitumia makumi ya mabilioni ya ishara. Kampuni hutoa sampuli hadharani lakini inashikilia lebo zao; watumiaji huwasilisha ubashiri kwa AWS kwa alama zilizothibitishwa. Chanzo hakisemi iwapo ufikiaji wa bao unatoza ada au mahitaji mengine ya ustahiki.

Help Net Security inaripoti kwamba wakaguzi huru hukagua lebo bila kuona maamuzi ya mtu mwingine au hoja asili. Sampuli zinazobishaniwa hupokea uhakiki zaidi, na kesi ambazo hazijatatuliwa huhamishwa hadi seti isiyo na alama. AWS inasema chini ya 3% ya sampuli zilizopigwa husalia na ushindani baada ya kukaguliwa, huku lengo likiwa ni chini ya asilimia 1 ya ukaguzi wa kibinadamu uliosalia, na inaripoti kuwa hakuna makosa ya kuweka lebo katika ukaguzi wa sampuli 100 zilizochaguliwa bila mpangilio. Madai haya hayajathibitishwa kivyake hapa.

Maelezo ya chanzo: helpnetsecurity.com ↗

Kwa nini ni muhimu

Matokeo yanapendekeza kuwa utendakazi dhabiti katika kutafuta msimbo unaotiliwa shaka si lazima utafsiriwe kuwa majaribio yanayotegemeka ya uwezekano wa kuathiriwa. Viwango vya juu vya uwongo vinaweza kubeba timu za usalama na kudhoofisha imani katika arifa, huku mahitaji ya uthibitisho mkali zaidi yanaweza kusababisha miundo kukosa udhaifu halisi. Matokeo yanahusiana na mashirika yanayozingatia ukaguzi wa msimbo unaosaidiwa na AI au shughuli za usalama, lakini hayapimi bidhaa kamili za usalama wa kibiashara.

Alama hushughulikia udhaifu wa kiutendaji katika usalama unaosaidiwa na AI: kielelezo kinaweza kutambua muundo unaoonekana kuwa hatari bila kuelewa vidhibiti vinavyozuia unyonyaji. Usaidizi wa Mtandao wa Usalama unaripoti kwamba ushawishi wa moja kwa moja ulizalisha viwango vya uwongo vya 41% hadi 99%, wakati usahihi ulianzia 52% hadi 71%.

Kuuliza wanamitindo kuonyesha kwamba uwezekano wa kuathiriwa unaweza kutumiwa vibaya kumepunguza pointi chanya za uwongo kwa asilimia 17 hadi 74, kulingana na ripoti hiyo, lakini viwango vya uwongo-hasi viliongezeka hadi kati ya 7% na 44%. Upau wa chini wa uzalishaji uliobainishwa wa AWS ulikuwa chini ya 10% kwa hatua zote mbili, na hakuna usanidi uliojaribiwa uliofikia viwango vyote viwili.

Matokeo haya hayapaswi kusomwa kama orodha ya bidhaa kamili za usalama. AWS ilijaribu vidokezo vya zamu moja kwenye miundo ya madhumuni ya jumla, si mifumo iliyoundwa na ambayo hutumia zana, uthibitishaji unaorudiwa, au mtiririko wa kazi wa kikali. Kwa hivyo chanzo kinaunga mkono tahadhari kuhusu uamuzi wa kuathirika kwa kiwango cha modeli, si hitimisho kwamba bidhaa za usalama za AI kwa ujumla hazifanyi kazi.

Interactive Mechanism

Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli

Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Ukaguzi wa Dhana ya Kuingiliana+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Nini cha kutazama baadaye

Tazama tathmini huru kwa kutumia sampuli zilizotolewa, matokeo kutoka kwa kutumia zana au mifumo ya usalama ya hatua nyingi, na ushahidi kuhusu utendakazi katika mazingira halisi ya uzalishaji. Chanzo hakiandiki bei, ufikiaji wa kiwango cha huduma, au ikiwa mchakato wa kufunga wa AWS unapatikana bila vikwazo. Pia haithibitishi kuwa miundo iliyojaribiwa hufanya vivyo hivyo kwenye msimbo wa biashara ambao haujafichuliwa.

Watafiti huru wanaweza kutumia sampuli za umma na mchakato wa kutathmini bila kuunda tena gharama za uzalishaji data zilizoripotiwa za AWS, lakini lebo zilizoshikiliwa na alama zilizothibitishwa za AWS zinakusudiwa kupunguza uboreshaji mahususi. Uigaji na vikundi vya nje ungesaidia kupima matokeo yaliyoripotiwa na ubora wa lebo.

Tathmini za siku zijazo zinapaswa kulinganisha miundo ya pasi moja na mifumo inayokagua hazina, kutekeleza misimbo kwa usalama, sababu juu ya usanidi wa usambazaji, na kuhitaji ushahidi kabla ya kutoa arifa. Majaribio hayo yangeonyesha vyema ni kiasi gani cha zana za kiusalama kinachoboreshwa kwenye matokeo ya modeli pekee.

Chanzo huacha mambo yasiyojulikana muhimu: hakitambui usanidi wa modeli 12 zilizojaribiwa, hakiripoti matokeo ya kila modeli katika maandishi yaliyotolewa, bei ya hati au masharti ya ufikiaji kwa alama zilizothibitishwa, au kuonyesha jinsi utendakazi unavyohamishwa hadi kwa misingi ya umiliki na uendeshaji wa usalama wa moja kwa moja.

Miongozo & maswali yanayohusiana

Mifano ya AI ImefafanuliwaMaadili ya AIPrompt EngineeringJaribu unachojua - jaribu maswali ya AI bila malipoTafuta istilahi ya AI katika faharasa yetuFuata kifuatiliaji cha udhibiti wa AI
Je, umepata hii kuwa muhimu?