ወደ ዜና ተመለስ
ደህንነትAI Understanding አጭር መግለጫ

ጥናት የ AI ደህንነት መመዘኛዎች በጣም ጥቂት ሙከራዎችን ሊጠቀሙ ይችላሉ።

የዩኬ AI ደህንነት ኢንስቲትዩት ጋር የተያያዘ ቅድመ ማተሚያ በርካታ የደህንነት ማመሳከሪያ ውጤቶችን ከ97-99% ባነሰ መጠየቂያዎች ማባዛት፣ አጫጭር ሙከራዎች የገሃዱ ዓለም ደህንነትን እንደማያረጋግጡ ሲያስጠነቅቅ።

5 min readRead the primary source
ዋና-ምንጭ ሰነድምንጭ ተመዝግቧል
አታሚ
Rivera and colleagues' research paper on arXiv
ምንጭ አገናኝ
arxiv.orghttps://arxiv.org/abs/2608.05086
የምንጭ ዓይነት
ዋና ሰነድ - ኦፊሴላዊ ማስታወቂያ ፣ ወረቀት ፣ ፋይል ወይም የመጀመሪያ ወገን ገጽ በቀጥታ እናነባለን።
አውድይህንን በ60 ሰከንድ ውስጥ ይረዱት።

እዚ ጀምር

ቁልፍ ቃላት

AI ደህንነት
በ AI ሲስተሞች ውስጥ ጎጂ ባህሪያትን፣ ውድቀቶችን እና አላግባብ መጠቀም ስጋቶችን በመቀነስ ላይ ያተኮረ መስክ።
ኤፒአይ (የመተግበሪያ ፕሮግራሚንግ በይነገጽ)
አንድ የሶፍትዌር ስርዓት ከሌላ ስርዓት ጥያቄዎችን ለመላክ እና ምላሽ የሚቀበልበት የተቀናጀ መንገድ።
የስርዓት ጥያቄ
ለአብነት ባህሪን፣ ፖሊሲን እና የምላሽ ዘይቤን የሚያዘጋጅ ከፍተኛ ቅድሚያ የሚሰጠው መመሪያ።
እራስህን ፈትን።AI ምንድን ነው? ጥያቄ

ምን ተፈጠረ

በኦገስት 5 ላይ የተለጠፈው የጥናት ወረቀት የ AI የደህንነት መመዘኛዎች ምን እንደሚይዙ ለመለካት ከትምህርታዊ ፈተና ዘዴን ይተገበራል፣ ትናንሽ ጠቃሚ ጥያቄዎችን ለመምረጥ እና የሞዴል ባህሪ ለውጦችን ኦዲት ያደርጋል።

ሁለት ገለልተኛ ተመራማሪዎች እና ከዩኬ AI ሴኪዩሪቲ ኢንስቲትዩት ጋር ግንኙነት ያላቸው ሁለት ተመራማሪዎች ጎጂ-ጥያቄን እምቢተኝነትን፣ ጥሩ ያልሆኑ ጥያቄዎችን ከልክ በላይ አለመቀበል፣ አውዳዊ ጉዳት እና እውነተኝነትን የሚሸፍኑ 192 የውይይት ሞዴሎችን በስምንት መመዘኛዎች ገምግመዋል። ሙሉው ስብስብ ከቅድመ ሂደቱ በፊት 5,255 ጥያቄዎችን ይዟል. ያልተመዘገቡ ምላሾችን እና ከተሞከሩት ሞዴሎች መካከል የማይለዩ ንጥሎችን ካስወገደ በኋላ ትንታኔው 5,067 ይዞ ቆይቷል።

ቡድኑ ሞዴሎችን እንደ ሞካሪ እና የቤንችማርክ መጠየቂያዎች እንደ የሙከራ እቃዎች ወስደዋል፣ የንጥል ምላሽ ንድፈ ሃሳብን በመጠቀም የትኞቹ ጥያቄዎች አስቸጋሪ እንደሆኑ እና የትኞቹ ሞዴሎች በተሻለ ሁኔታ ተለይተው ይታወቃሉ። በዋና ፋክተር ትንተና፣ ባለ ሶስት አቅጣጫዊ መፍትሄ-እንደ እምቢታ ጥብቅነት፣ እውነትነት እና የዐውደ-ጽሑፋዊ ጉዳት ጠቅለል ባለ መልኩ 77 በመቶውን የሞዴል ችሎታዎች ልዩነት ገልጿል፣ ከ 47% ጋር ለአንድ ነጠላ ምክንያት።

ከ20 በላይ የተካሄዱ ግምገማዎች፣ ሶስት ቋሚ የ25-ፈጣን ሙከራዎች እነዚያን ሶስት ነገሮች ከ2% በታች በመጠቀም መልሰው አግኝተዋል። ለሃርምቤንች፣ SORRY-Bench፣ እና OR-Bench-Hard፣ በግምት 10 የሚለምደዉ የተመረጡ ጥያቄዎች የሙሉ ቤንችማርክ ደረጃዎችን ከ 0.92 እስከ 0.94 ጋር በማባዛት የጥያቄዎችን ብዛት በ97-99% ቆርጠዋል። የፈተናው በጀት እያደገ ሲሄድ ጥቅሙ እየጠበበ መጣ።

መጭመቂያው እንዲሁ የዘፈቀደ ናሙና አይደለም። የንጥል ምላሽ ንድፈ ሐሳብ እያንዳንዱ ጥያቄ ምን ያህል ከባድ እንደሆነ እና የተለያዩ የምላሽ ቅጦች ያላቸውን ሞዴሎች እንዴት እንደሚለይ ይገምታል፣ ከዚያም የትልቅ ፈተናን መዋቅር የሚጠብቁ ንጥሎችን ይመርጣል። ደራሲዎቹ ቋሚ አጫጭር ቅጾችን ከተለዋዋጭ ምርጫ ጋር በማነፃፀር እና ጥያቄዎችን ለመምረጥ ጥቅም ላይ የዋለውን መረጃ ብቻ ከመለካት ይልቅ ግምገማዎችን አካሂደዋል። ያ ንድፍ አንዳንድ ነባር የቤንችማርክ ደረጃዎች በብቃት ሊባዙ ይችላሉ የሚለውን ጠባብ ጥያቄ ይደግፋል። ባለ 10 ወይም 25-ንጥል ሙከራ ሙሉ ለሙሉ አዲስ የብልሽት ሁነታን እንደሚያገኝ አያሳይም።

የምንጭ ዝርዝሮች: Rivera and colleagues' research paper on arXiv ↗

ለምን አስፈላጊ ነው።

ጥናቱ እንደሚያመለክተው በተሻለ ሁኔታ የተመረጡ ማበረታቻዎች እያንዳንዱ መለኪያ አንድ ሁለንተናዊ የደህንነት ነጥብ እንደሚለካ በማስመሰል ተደጋጋሚ የ AI ደህንነት ፍተሻዎችን ርካሽ ሊያደርግ ይችላል።

ርካሽ ሙከራዎች ገንቢዎች፣ ትናንሽ ላቦራቶሪዎች እና ገለልተኛ ገምጋሚዎች በስልጠና፣ በጥራት ማስተካከያ፣ በቁጥር እና በስርአት አፋጣኝ ለውጦች ተጨማሪ የሞዴል ስሪቶችን እንዲፈትሹ ያስችላቸዋል። ውጤቱ ነባር የቤንችማርክ መለኪያዎችን በብቃት ማባዛት እንጂ እነዚያ መለኪያዎች የሚለዩትን ማስፋት አይደለም።

የፋክተር ትንታኔው የውጤት ልውውጥን ያጋልጣል። እምቢተኝነትን የሚሸልሙ ማመሳከሪያዎች እርስ በእርሳቸው ሊደራረቡ ይችላሉ, አላስፈላጊ እምቢታዎችን ለማስወገድ መለኪያ ግን ተቃራኒውን ባህሪ ይሸልማል. ክብደቶቹን ሳያብራራ በአማካይ እነሱን ማመጣጠን ሞዴሉ ይበልጥ ደህንነቱ የተጠበቀ፣ የበለጠ ገዳቢ ወይም ጥሩ በሆኑ ጥያቄዎች ላይ ጥቅም የሌለው መሆኑን መደበቅ ይችላል።

ወረቀቱ ሆን ተብሎ በተነሳ የአሸዋ ቦርሳ ባህሪ ላይ የጥቁር ቦክስ ኦዲት ዘዴዎችን ሞክሯል። የምላሽ-ስርዓተ-ጥለት ቼክ የተመረጠ ዝቅተኛ አፈጻጸም ተይዟል ነገር ግን አብዛኛው ወጥ የሆነ ዝቅተኛ አፈጻጸም አምልጦታል። ታሪካዊ የችሎታ ፍተሻን በማከል በተደረጉት ጉዳዮች ላይ ጥምር ምርመራን ወደ 94-97% ከፍ አድርጓል። በአንድ ነጥብ ላይ ከመታመን ይልቅ የተደራረቡ ኦዲቶችን ይደግፋል።

ለገንቢዎች, የአሰራር ዋጋው ድግግሞሽ ነው. የሙሉ ቤንችማርክ በጀትን በእያንዳንዱ ጊዜ ሳይወስድ አጭር ግምገማ ከስርአት ፈጣን ለውጥ፣ የቁጥር ማለፊያ፣ ጥሩ ማስተካከያ፣ መሳሪያ ዝማኔ ወይም የደህንነት ፖሊሲ ክለሳ በኋላ እንደገና ሊካሄድ ይችላል። ነገር ግን ውጤቱ ጠቃሚ የሚሆነው ቡድኖቹ ዋናውን ስብስብ እንደ ወቅታዊ ኦዲት ሲያቆዩ፣ የተያዙ ጥያቄዎችን ሲያዞሩ እና ለተጨመቀው ፈተና በቀጥታ ከማመቻቸት ይልቅ አስገራሚ ለውጦችን ሲመረምሩ ብቻ ነው። አለበለዚያ ርካሽ ቼክ ከመጠን በላይ ለመገጣጠም ሌላ ኢላማ ሊሆን ይችላል.

Interactive Mechanism

በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ

ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
በይነተገናኝ ጽንሰ-ሐሳብ ቼክ+10 Points
What is AI? Quiz

Which description best fits "narrow AI", the kind of AI in use today?

ቀጥሎ ምን እንደሚታይ

ራሱን የቻለ ማባዛት፣ የወደፊት ሞዴል ቤተሰቦችን ማረጋገጥ እና አጭር ሙከራዎች ለመራባት ከተነደፉት መመዘኛዎች ውጭ ባህሪን እንደሚተነብዩ ማስረጃዎችን ይመልከቱ።

ይህ አዲስ ቅድመ-ህትመት ነው እንጂ የተጠናቀቀ የአቻ ግምገማ ፍርድ አይደለም። የድብቅ-መዋቅር ትንተና 134 ሞዴሎችን ተጠቅሟል፣ ይህም ደራሲዎቹ በተለመደው የሳይኮሜትሪክ መመዘኛዎች ትንሽ እንደሆኑ እና አማራጭ የማውጣት ዘዴ ከሶስት ይልቅ ሁለት ነገሮችን ይዞ ቆይቷል። የምክንያት ስሞቹ ተጨባጭ ማጠቃለያዎች እንጂ የተረጋገጡ የደህንነት ፍቺዎች አይደሉም።

እያንዳንዱ ሞዴል በአንድ ጥያቄ በOpenRouter በኩል አንድ ምላሽ ይሰጣል፣ እና እያንዳንዱ ቤንችማርክ የታዘዘውን አውቶማቲክ ዳኛ ተጠቅሟል። የሚመነጩት አጫጭር ፈተናዎች በመጀመሪያዎቹ ጥያቄዎች፣ የውጤት አሰጣጥ ደንቦች፣ የቋንቋ ሽፋን እና ዳኞች ጉድለቶችን ሊወርሱ ይችላሉ። ደራሲዎቹ በግልጽ መጭመቅ አንድ ቤንችማርርክ የመሰማራትን ደህንነት እንደሚተነብይ ወይም ለወደፊት ሞዴሎች መረጃ ሰጪ ሆኖ እንደሚቆይ አያሳይም ይላሉ።

ጥቅም ላይ የዋለው የአሸዋ ከረጢት ሙከራዎች ግምገማን ለመገምገም በጥሩ ሁኔታ የተስተካከሉ ሞዴሎችን ሳይሆን የሞዴል ፍጥረታትን አነሳስቷቸዋል፣ ይህም ለማወቅ ቀላል ይሆናል። የኤፒአይ ፍተሻዎች የተደበቁ የሞዴል ክብደቶችን ማንነት ሳይሆን የባህሪን ቀጣይነት ይመሰርታሉ፣ እና ጥናቱ በተለይ የኦዲት ዘዴዎችን ለማሸነፍ የሰለጠነ ባላጋራን አልፈተነም።

የወረቀቱ በጣም አስፈላጊው ድንበር በመለኪያ ቅልጥፍና እና በደህንነት ማረጋገጫ መካከል ነው። አጭር ቅጽ በዋናው ቤንችማርክ ውስጥ ያሉትን ስውር ምክንያቶች ሊገምት ይችላል፣ነገር ግን ያንን የቤንችማርክ ቋንቋ፣ ዳኛ፣ ፈጣን ፍሬም እና ዓይነ ስውር ቦታዎችን ይወርሳል። ወደፊት የሚደረጉ ግምገማዎች የብዝሃ ቋንቋ ጥያቄዎችን፣ በመሳሪያ የነቁ ወኪሎችን፣ ረጅም ንግግሮችን፣ በተቃዋሚነት የተስተካከሉ ሞዴሎችን እና ገለልተኛ የሰው ፍርድን መሞከር አለባቸው። እንዲሁም የተጨመቀ ውጤት ያልተረጋጋ በሚሆንበት ጊዜ ሪፖርት ማድረግ አለባቸው፣ ምክንያቱም በተያዘው መረጃ ላይ ጥሩ ትስስር በሚቀጥለው ሞዴል ቤተሰብ ላይ ውድቀትን ሊደብቅ ይችላል።

ተግባራዊ የጉዲፈቻ ህግ ከእነዚያ ገደቦች ይከተላል፡ የተጨመቁ ሙከራዎችን እንደ ተላላኪዎች ተጠቀም እንጂ ብያኔ አይደለም። ቡድኖች ሪግሬሽንን ለመያዝ ብዙ ጊዜ ሊሯሯጡዋቸው ይችላሉ፣ ከዚያ አጭር ፎርሙ ሳይታሰብ ሲንቀሳቀስ ለውጡን ወደ ሙሉ ቤንችማርክ እና የሰው ግምገማ ማሳደግ ይችላሉ። የጥናቱ የራሱ ማስረጃዎች ያንን የተደራረበ የስራ ሂደት ይደግፋሉ ምክንያቱም የምክንያት አወቃቀሩ ከተወሰኑ ጥያቄዎች፣ ዳኞች እና የሞዴል ውጤቶች የተገኘ ነው። የተመረጡትን እቃዎች፣ የምርጫ ኮድ፣ የተያዙ ውጤቶችን እና የስሪት ታሪክን ማተም ነጻ ገምጋሚዎች አጫጭር ሙከራዎች ገንቢዎች ካዩዋቸው በኋላ እና አዲስ ሞዴል ቤተሰቦች የምላሾችን ስርጭት ከቀየሩ በኋላ መረጃ ሰጪ ሆነው መቆየታቸውን እንዲያረጋግጡ ያስችላቸዋል።

አንድ ሞዴል ሲዘመን ተመሳሳይ ግልጽነት አስፈላጊ ነው. በአንድ ትውልድ ላይ የተስተካከለ አጭር ፈተና በጣም ቀላል፣ በጣም ጠባብ ወይም በአጋጣሚ ከአዲስ የስርዓት ጥያቄ ጋር ሊጣጣም ይችላል። ቡድኖች ቀዳሚ ስሪቶችን መጠበቅ፣ አንድ ንጥል ወይም ዳኛ ሲቀየር ይፋ ማድረግ እና የታመቀ ደረጃን እንደ ትክክለኛ የደህንነት ነጥብ ከማቅረብ ይልቅ የመተማመንን ክፍተቶችን ማሳወቅ አለባቸው። እነዚያ ልምምዶች የወረቀቱን የውጤታማነት ውጤት ወደ ኦዲት ሊደረግ የሚችል የክትትል መርሃ ግብር ይለውጣሉ እና ዋናውን መመዘኛ ለጥልቅ ግምገማ እንዲገኝ ያደርጋሉ።

ተዛማጅ መመሪያዎች እና ጥያቄዎች

AI ምንድን ነው?ChatGPT እና LLMsየAI ሥነ ምግባርየሚያውቁትን ይሞክሩ - ነፃ የ AI ጥያቄዎችን ይሞክሩበእኛ የቃላት መፍቻ ውስጥ የ AI ቃልን ይፈልጉየ AI ደንብ መከታተያ ይከተሉ
ይህ ጠቃሚ ሆኖ ተገኝቷል?