የማህበረሰብ መመሪያ
የድንበር AI የደህንነት ማዕቀፎች እና ኃላፊነት የሚሰማቸው የመጠን ፖሊሲዎች
የድንበር AI የደህንነት ማዕቀፍ፣ እንደ ኃላፊነት የሚሰማው የመለኪያ ፖሊሲ፣ በ AI ላብራቶሪ የታተመ ቁርጠኝነት ሞዴሎቹን ለአደገኛ ችሎታዎች ለመሞከር ነው።
በዚህ ገጽ ላይ4 ደቂቃ አንብብ
አጠቃላይ እይታ
አንድ ሞዴል የተወሰነ ገደብ ካለፈ፣ ቤተ-ሙከራው የበለጠ ጠንከር ያሉ መከላከያዎችን ለመጨመር፣ ወይም እነዚያ ጥበቃዎች እስካልሆኑ ድረስ ተጨማሪ ስልጠና ላለመስጠት ወይም ላለማሰልጠን ቃል ገብቷል። እነዚህ ማዕቀፎች ጠቃሚ ናቸው ምክንያቱም በአሁኑ ጊዜ እጅግ በጣም የላቁ የ AI ሞዴሎች ለአደጋ ስጋት የሚተዳደሩበት ዋና መንገድ ናቸው ፣ ምንም እንኳን አብዛኛዎቹ በፈቃደኝነት እና በቤተ ሙከራ የተፃፉ ናቸው።
ጥልቅ ዳይቭ
Anthropic የመጀመሪያውን የኃላፊነት መለኪያ ፖሊሲ በሴፕቴምበር 2023 አሳተመ። የ AI የደህንነት ደረጃዎችን (ኤኤስኤልኤስን) አስተዋወቀ፣ በባዮሴፍቲ ደረጃዎች ላይ ልቅ በሆነ መልኩ ተቀርጿል፣ ይህም ከፍተኛ ደረጃዎች የበለጠ ጠንካራ ደህንነት እና የማሰማራት ጥበቃዎች የሚሹ ናቸው። የኋለኛው እትም በጥቅምት 2024 ፖሊሲውን ከአቅም ገደቦች እና ከሚያስፈልጉ ጥበቃዎች አንፃር ደግሟል እና የኃላፊነት መለኪያ መኮንን ሚና ገልጿል። OpenAI የዝግጅት ማዕቀፉን በዲሴምበር 2023 እንደ ቅድመ-ይሁንታ አውጥቷል። ክትትል በሚደረግባቸው ምድቦች ውስጥ አደጋን አስመዝግቧል፣ በመጀመሪያ የCBRN ስጋቶችን፣ የሳይበር ደህንነትን፣ ማሳመንን እና የሞዴል ራስን በራስ ማስተዳደርን ጨምሮ። የ2025 ክለሳ በከፍተኛ እና ወሳኝ የአቅም ገደቦች ዙሪያ እንደገና አደራጀው እና ማሳመንን እንደ ክትትል የሚደረግበት ምድብ አቋርጧል። Google DeepMind የድንበር ደህንነት ማዕቀፉን በሜይ 2024 አሳትሞ ከዚያ ወዲህ ከልሷል። የምላሽ ዕቅዶችን የሚያነቃቁ ወሳኝ የአቅም ደረጃዎችን (CCLs) ይገልጻል። በግንቦት 2024 በተካሄደው የአይ ሴኡል ስብሰባ፣ 16 ኩባንያዎች የFrontier AI ደህንነት ቁርጠኝነትን ፈርመዋል። የደህንነት ማዕቀፎችን ለማተም ተስማምተዋል፣ ሊቋቋሙት የማይችሉት አደጋዎች ደረጃዎችን ያስቀምጣሉ፣ እና ጉዳቱ ከነዚህ ጣራዎች በታች መቀመጥ ካልቻለ ሞዴልን ላለማሳደግ ወይም ለማሰማራት ተስማምተዋል። በየካቲት 2025 ከፓሪስ AI የድርጊት ጉባኤ በፊት ብዙ ማዕቀፎች ታትመዋል። ተቺዎች በርካታ ድክመቶችን ያመለክታሉ። ቤተ-ሙከራዎች የራሳቸው ገደቦችን ይጽፋሉ እና በራሳቸው መከለስ ይችላሉ። እንደ "ትርጉም ያለው መነሳት" ያሉ ቃላት ለትርጉም ቦታ ይተዋል. የውጭ ማረጋገጫ ውስን ነው፣ እና የንግድ ውድድር ላብራቶሪዎች ውጤቶችን በልግስና እንዲያነቡ ማበረታቻ ይሰጣል። የተለመደው የተሳሳተ ግንዛቤ እነዚህ ማዕቀፎች ህጎች ናቸው. አብዛኛዎቹ በፈቃደኝነት ላይ ናቸው, ምንም እንኳን ይህ እየተለወጠ ነው. የካሊፎርኒያ SB 53 ትላልቅ ድንበር ገንቢዎች እንደዚህ አይነት ማዕቀፍ እንዲያትሙ ይፈልጋል፣ እና የአውሮፓ ህብረት አጠቃላይ ዓላማ AI የስራ ልምድ ኮድ፣ የ AI ህግን ማክበርን ለማሳየት በፍቃደኝነት መንገድ ነው፣ ፈራሚዎች እንዲቀበሉ ይጠይቃል።
ስልታዊ ተጽእኖ
አደጋ እና ደህንነት
አስከፊ እና የዕለት ተዕለት የ AI ጉዳቶች ሁለቱም አደጋዎችን የሚረዳው እና ማን እርምጃ ሊወስድ በሚችል ላይ የተመካ ነው።
ግልጽ ውሳኔዎች
ህዝባዊ እና ሙያዊ ማንበብና መጻፍ ጠንካራ የደህንነት ፖሊሲ በፖለቲካዊ መልኩ ይቻል እንደሆነ ይቀርፃል።
በማበረታቻ መቁረጥ
ግልጽ ማብራሪያዎች በማስታወቂያ፣ በቤተ ሙከራ እና ግልጽ ያልሆነ የስነምግባር ቲያትር መያዝን ይቀንሳሉ።
የወደፊት የFrontier AI የደህንነት ማዕቀፎች እና ኃላፊነት የሚሰማቸው የመጠን ፖሊሲዎች
ማዕቀፎች ከበጎ ፈቃደኝነት ቃል ኪዳኖች ወደ ተቆጣጣሪ ተስፋዎች እየተሸጋገሩ ነው። ካሊፎርኒያ አሁን ትልልቅ ድንበር ገንቢዎችን እንዲያትሟቸው ይፈልጋል፣ የአውሮፓ ህብረት የተግባር ህግ ፈራሚዎችን እንዲቀበሉ ይጠይቃል፣ እና ተጨማሪ ስልጣኖች ሊከተሉ ይችላሉ። ክፍት ጥያቄዎች ማን ተገዢነትን እንደሚመረምር፣ በሁሉም ቤተ ሙከራዎች ውስጥ ደረጃዎች እንዴት ደረጃቸውን የጠበቁ እንደሚሆኑ፣ እና ግምገማዎች በፍጥነት እያሻሻሉ ያሉትን የወኪል ስርዓቶችን መቀጠል እንደሚችሉ ያካትታሉ። የመንግስት AI ተቋሞችን ጨምሮ ገለልተኛ የሙከራ አካላት የላብራቶሪ ይገባኛል ጥያቄዎችን በማጣራት ረገድ ትልቅ ሚና ሊጫወቱ ይችላሉ። ማዕከላዊው ውጥረት ሊቆይ ይችላል፡ ላቦራቶሪዎች የሚገመገሙበትን ህግ ይቀርፃሉ፣ ይህም ግልጽነትን እና የውጭ ምርመራን አስፈላጊ ያደርገዋል።
የእውነተኛ-ዓለም አተገባበር
ከመለቀቁ በፊት ላቦራቶሪ አዲስ ሞዴል ባዮሎጂካል መሳሪያዎችን ለማግኘት ለሚሞክር ሰው ትርጉም ያለው መሻሻል ይሰጠው እንደሆነ ይፈትሻል። ጣራውን ከተሻገረ፣ ቤተ-ሙከራው ከመሰማራቱ በፊት ጥብቅ አላግባብ መጠቀም ማጣሪያዎችን እና ደህንነትን ይጨምራል።
በግንቦት 2025 Anthropic ለ Claude Opus 4 የ ASL-3 ማሰማራትን እና የደህንነት ጥበቃዎችን እንደነቃ ገልጿል፣ ምክንያቱም ሞዴሉ ተገቢውን የችሎታ ደረጃ ላይ መድረሱን ማስቀረት አልቻለም።
የOpenAI ዝግጁነት ማዕቀፍ የደህንነት አማካሪ ቡድን የችሎታ ሪፖርቶችን እንዲገመግም እና ከመልቀቁ በፊት ጥበቃዎች በቂ መሆን አለመሆናቸውን እንዲመክር ይመራል።
ራሱን የቻለ ማባዛት ወይም የ AI ምርምር ማፋጠን ወኪል ግምገማዎችን የሚከታተል ላብራቶሪ። እነዚህ ሞዴሉ ያለ ሰው እርዳታ ረጅምና ባለብዙ ደረጃ ስራዎችን ማጠናቀቅ ይችል እንደሆነ ይፈትሻል።
አደጋዎች እና የጥበቃ መንገዶች
የችሎታ ውህዶች እያለ ነባራዊ ስጋትን እንደ sci-fi ማከም።
ግራ የሚያጋባ የገጽታ ምርት ደህንነት በከፍተኛ ራስን በራስ የማስተዳደር አሰላለፍ።
ዝቅተኛ ጥራት ባላቸው ምንጮች ብቻ እንግሊዝኛ ያልሆኑ እና ባለሙያ ያልሆኑ ታዳሚዎችን መተው።
የትግበራ ፍኖተ ካርታ
የተለየ የምርት ጉዳት፣ አላግባብ መጠቀም እና መቆጣጠርን ማጣት/የማዛመድ አደጋዎች።
በጊዜ እና በክብደት ላይ ያለዎትን አመለካከት ምን አይነት ማስረጃ እንደሚለውጥ ይጠይቁ።
ከገበያ የይገባኛል ጥያቄዎች ይልቅ ዋና ምንጮችን እና ተጨባጭ ግምገማዎችን ይምረጡ።
አንድ የድርጊት መንገድን ይለዩ፡ ሙያ፣ ፖሊሲ፣ የገንዘብ ድጋፍ ወይም ችሎታ - ግንዛቤን ብቻ አይደለም።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Frontier AI Safety Frameworks and Responsible Scaling Policies quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
የFrontier AI የደህንነት ማዕቀፎች እና ኃላፊነት የሚሰማቸው የመጠን ፖሊሲዎች ምንድን ናቸው?
የድንበር AI የደህንነት ማዕቀፍ፣ እንደ ኃላፊነት የሚሰማው የመለኪያ ፖሊሲ፣ በ AI ላብራቶሪ የታተመ ቁርጠኝነት ሞዴሎቹን ለአደገኛ ችሎታዎች ለመሞከር ነው። አንድ ሞዴል የተወሰነ ገደብ ካለፈ፣ ቤተ-ሙከራው የበለጠ ጠንከር ያሉ መከላከያዎችን ለመጨመር፣ ወይም እነዚያ ጥበቃዎች እስካልሆኑ ድረስ ተጨማሪ ስልጠና ላለመስጠት ወይም ላለማሰልጠን ቃል ገብቷል። እነዚህ ማዕቀፎች ጠቃሚ ናቸው ምክንያቱም በአሁኑ ጊዜ እጅግ በጣም የላቁ የ AI ሞዴሎች ለአደጋ ስጋት የሚተዳደሩበት ዋና መንገድ ናቸው ፣ ምንም እንኳን አብዛኛዎቹ በፈቃደኝነት እና በቤተ ሙከራ የተፃፉ ናቸው።
ኃላፊነት የሚሰማው የመጠን ፖሊሲ መሠረታዊ አመክንዮ ምንድን ነው?
እነዚህ ማዕቀፎች የተገነቡት የችሎታ ጣራዎችን ከሚፈለጉት ጥበቃዎች ጋር በሚያገናኙ ግዴታዎች ከሆነ ነው።
የትኛው ኩባንያ AI የደህንነት ደረጃዎችን (ኤኤስኤልኤስ) አስተዋወቀ?
የAnthropic ሴፕቴምበር 2023 ኃላፊነት የሚሰማው የልኬት ፖሊሲ ASLs አስተዋውቋል፣ በባዮሴፍቲ ደረጃ ላይ ልቅ ተመስለዋል።
Google DeepMind በፍሬንቲየር ደህንነት ማዕቀፍ ውስጥ ያሉትን ገደቦች ምን ብሎ ይጠራዋል?
DeepMind ሲደርሱ የምላሽ ዕቅዶችን የሚቀሰቅሱ ወሳኝ የአቅም ደረጃዎችን (CCLs) ይጠቀማል።
በግንቦት 2024 በኤአይ ሴኡል ስብሰባ ላይ ኩባንያዎች ምን ተስማሙ?
የFrontier AI ደህንነት ቁርጠኝነት ማዕቀፎችን ለማተም እና ስጋቶች ከደረጃዎቹ በታች ሊቀመጡ ካልቻሉ ላለመቀጠል በፍቃደኝነት ቃል የገቡ ነበሩ።
የOpenAI 2025 ዝግጁነት ማዕቀፍ ክለሳ እንደ ክትትል ምድብ የወደቀው የትኛው ምድብ ነው?
ማሻሻያው በከፍተኛ እና ወሳኝ ደረጃዎች ዙሪያ ያለውን ማዕቀፍ እንደገና አደራጀ እና ማሳመንን እንደ ክትትል የሚደረግበት ምድብ አስወግዷል።
መማርዎን ይቀጥሉ
ተዛማጅ መመሪያዎች
ለዚህ ርዕስ ተጨማሪ መመሪያዎች ተመርጠዋል