ምን ተፈጠረ
ተመራማሪዎች ፕሮብጋርድን በኦገስት 11 ቅድመ ህትመት እንደ ጥበቃ መንገድ አስተዋውቀዋል ይህም ያልተጠናቀቀ የቋንቋ-ሞዴል ምላሽ ደህንነቱ ያልተጠበቀ ይሆናል፣ከመጀመሪያዎቹ 10 የመጀመሪያዎቹ 10 የመግለጫ እርምጃዎች የውጤት ስርጭቶችን በመጠቀም።
አብዛኞቹ የጥበቃ መስመሮች አንድ ሞዴል አስቀድሞ ያዘጋጀውን ጽሑፍ ይመድባሉ። ProbGuard በምትኩ ትውልድ ገና እየጀመረ እያለ ለቀጣዮቹ ምልክቶች የተመደቡትን እድሎች ይመለከታል። በእያንዳንዱ እርምጃ ስርዓቱ 50 ምርጥ የማስመሰያ ፕሮባቢሊቲዎችን ይይዛል፣ ቶኬናይዘር-ተኮር እጩዎችን ወደ የጋራ መክተቻ ቦታ ይለውጣል እና እነዚያን ውክልናዎች በአቅም ይመዝናል። ምንም እንኳን ምንም እንኳን ማሰማራት አሁንም ብዙ የተዘጉ ሞዴል ኤፒአይዎች የማያጋልጡትን የማስመሰያ ደረጃ የውጤት እድሎችን ማግኘት የሚፈልግ ቢሆንም ደራሲዎቹ ንድፉን እንደ አርክቴክቸር-አግኖስቲክስ ይገልጹታል።
የሥልጠና ዒላማዎች ከአንድ የተጠናቀቀ መልስ ይልቅ ሊሆኑ ከሚችሉ ወደፊት ይመጣሉ። ለእያንዳንዱ የመጀመሪያ ትውልድ ሁኔታ፣ ተመራማሪዎቹ በሙቀት 1.0 እስከ 512 የሚደርሱ ቶከኖችን 16 ተከታታይ ናሙናዎችን ወስደዋል እና እያንዳንዱን ቀጣይነት ደህንነቱ የተጠበቀ ወይም ደህንነቱ የተጠበቀ ለመሰየም የተለየ ክላሲፋየር ተጠቅመዋል። ደህንነቱ ያልተጠበቀ ምልክት የተደረገበት ክፍልፋይ ለዚያ ቅድመ ቅጥያ የሚገመተው አደጋ ሆኗል። ፕሮብጋርድ ድህረ መሰልጠኑ የዚያን እድል በቀጥታ ከመጀመሪያው መጠየቂያ እና ከቅድመ-ቅጥያው ፕሮባቢሊቲ-ሚዛናዊ ውክልና ለመተንበይ ነው።
ግምገማው Llama 3 8B Instruct፣ Qwen3-8B እና Gemma 2 9B Instructን እንደ የተጠበቁ ሞዴሎች ተጠቅሟል። ስልጠና ከPKU፣ WildGuard እና SEval 3,000 የተቀነሱ ጎጂ ጥያቄዎችን አጣምሮ፤ ግምገማ ከእያንዳንዱ የውሂብ ስብስብ 1,000 የተያዙ ጥያቄዎችን ተጠቅሟል። ደራሲዎቹ ProbGuardን ከ13 እምነት፣ ከጠባቂ፣ የዥረት-ተቆጣጣሪ እና አግብር-መመርመሪያ መነሻ መስመሮች ጋር አነጻጽረው፣ ልኬትን ከ Brier ነጥብ እና የሚጠበቀው የመለኪያ ስህተት በዘጠኙ የሞዴል-የውሂብ ስብስቦች ውህዶች።
ባለ 10-ቶከን ቅድመ ቅጥያ፣ ወረቀቱ ባለ 8-ቢሊዮን-ፓራሜትር የፕሮብጋርድ ተለዋጭ ምርጥ የ Brier ነጥብ እና የሚጠበቀው የመለኪያ ስህተት እንደነበረው በእያንዳንዱ ሪፖርት ሞዴል-የውሂብ ስብስብ ጥምር ላይ ዘግቧል። በእያንዳንዱ መቼት ከጠንካራው መነሻ ጋር በአማካይ፣ ደራሲዎቹ በ Brier ነጥብ 79.6% እና በሚጠበቀው የካሊብሬሽን ስህተት 71.9% ቅናሽ ያሰላሉ። እነዚህ የምርምር ቡድኑ ቤንችማርክ ውጤቶች ከአዲስ፣ ከአቻ-ያልሆኑ ቅድመ-ህትመት ውጤቶች ናቸው። እስካሁን ድረስ ምንም ገለልተኛ ቡድን አላባዛቸውም።
የምንጭ ዝርዝሮች: ProbGuard research paper on arXiv ↗
ለምን አስፈላጊ ነው።
በደንብ የተስተካከለ የቅድመ ማስጠንቀቂያ ከመታየቱ በፊት ጎጂ ውጤትን ሊያቆም ይችላል፣ነገር ግን ኦፕሬተሮችን የአደጋ ነጥብ በመስጠት እያንዳንዱን ያልተሟላ ምላሽ ያለጊዜው ደህንነቱ የተጠበቀ ወይም ደህንነቱ ያልተጠበቀ መለያ ላይ በማስገደድ ፈንታ።
ተግባራዊ ልዩነቱ ጊዜ ነው. የድህረ-ትውልድ ማጣሪያ የተጠናቀቀውን ደህንነቱ ያልተጠበቀ መልስ ሊደብቅ ወይም ሊተካ ይችላል፣ ነገር ግን ዋናው ሞዴል አስቀድሞ ጊዜ አሳልፏል እና እሱን ለማምረት ያሰላል፣ እና የዥረት ትግበራዎች የመጨረሻውን ፍተሻ ከመደረጉ በፊት የተወሰነውን ክፍል ሊያጋልጥ ይችላል። ProbGuard ከትንሽ ቅድመ ቅጥያ በኋላ ጣልቃ ለመግባት የተነደፈ ነው። በወረቀቱ የጥቃት ሙከራዎች፣ 8B ሞኒተሪው አማካይ የጥቃት ስኬት ወደ 0.83% AdvBench እና 0.67% HarmBench ከ10 የመግለጫ እርምጃዎች በኋላ፣ ምንም መከላከያ ጥቅም ላይ ካልዋለ 53.83% እና 37.83% ጋር ሲነጻጸር።
መለካት አስፈላጊ ነው ምክንያቱም 0.8 ነጥብ ከ 0.2 ነጥብ የበለጠ ደህንነቱ ካልሆኑ ውጤቶች ጋር መዛመድ አለበት። ኦፕሬተሮች አሻሚ የሆነውን ቀደምት ጽሑፍን እንደ ርግጠኝነት ከመመልከት ይልቅ ለተለያዩ አውዶች ጣራዎችን መምረጥ ይችላሉ። ወረቀቱ ለProbGuard-8B 0.75% ጥምር አማካኝ የጥቃት-የስኬት መጠን እና 1.00% ለ 4B ስሪት ዘግቧል። የእሱ 0.6B ስሪት በአማካይ 2.83 በመቶ ደርሷል። ትንሹ ሞኒተር በ12.8 ሰከንድ ውስጥ 1,000 ናሙናዎችን ሰርቶ 3.32 ጊባ የጂፒዩ ማህደረ ትውስታን በደራሲዎች ቅንብር ውስጥ ተጠቅሟል፣ ይህም ከአንድ አስፈላጊ የሞኒተሪ መጠን ይልቅ የፍጥነት ወጪ ንግድ ሊኖር እንደሚችል ይጠቁማል።
አቀራረቡ በጽሑፍ-ብቻ ማጣሪያዎች እና በሞዴል-ውስጥ መመርመሪያዎች መካከል ጠቃሚ የሆነ መካከለኛ ቦታን ይፈትሻል። ድብቅ-ግዛት ማሳያዎች የውስጥ ምልክቶችን ሊይዙ ይችላሉ ነገር ግን ብዙ ጊዜ ለእያንዳንዱ አርክቴክቸር ብጁ መዳረሻ እና እንደገና ማሰልጠን ያስፈልጋቸዋል። ፕሮብጋርድ የእጩ ውጤቶችን በራሱ ውክልና ያስተካክላል፣ ስለዚህ አንድ ማሳያ በሶስት የተለያዩ ቶከናይዘር እና ሞዴል ቤተሰቦች ተገምግሟል። ያ ክፍት ሞዴሎችን ለሚያስተናግዱ ድርጅቶች ውህደትን ቀላል ሊያደርግ ይችላል ፣የእነሱ የማጣቀሻ ቁልል በእያንዳንዱ የመግለጫ ደረጃ ላይ አስተማማኝ የምዝግብ ማስታወሻዎችን ሊያጋልጥ ይችላል።
የህዝብ ጥቅም የተመካው በውሸት አወንታዊ እና በታገዱ ጥቃቶች ላይ ነው። ከመጠን በላይ ሚስጥራዊነት ያለው ተቆጣጣሪ በመድሃኒት፣ በደህንነት፣ በታሪክ ወይም በፖሊሲ ላይ ጥሩ ውይይትን ሊያቋርጥ ይችላል፣ ይህም አገልግሎቱን ከጥቅም ውጭ ያደርገዋል እና አንዳንድ ቋንቋዎችን ወይም ማህበረሰቦችን ፍትሃዊ ባልሆነ መልኩ ሊጎዳ ይችላል። የፕሮብጋርድ የካሊብሬሽን ውጤቶች ለተመረጡት የእንግሊዝኛ ቋንቋ የደህንነት መረጃ ስብስቦች አበረታች ናቸው፣ ነገር ግን ወረቀቱ በተለመደው የምርት ትራፊክ፣ ባለብዙ ቋንቋ ንግግሮች፣ ረጅም ምቹ ተግባራት፣ ወይም ጎጂ እና ህጋዊ ቋንቋዎች በሚደራረቡባቸው ልዩ ጎራዎች ላይ አፈጻጸምን አላስቀመጠም።
በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ
ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።
Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?
ቀጥሎ ምን እንደሚታይ
የመልቀቂያ በሩ በአዳዲስ እና በተዘጉ ሞዴሎች ፣ በተጨባጭ ትራፊክ ፣ ባለብዙ ቋንቋ ውሂብ ፣ አስማሚ ጥቃቶች እና የሐሰት ብሎኮች ፣ መዘግየት እና የመዳረሻ መስፈርቶች ላይ ገለልተኛ ማባዛት ነው።
በጣም ጠንካራው ገደብ ወሰን ነው. ጥበቃ የሚደረግላቸው ሞዴሎች ከ8B እስከ 9ቢ ባለው ክልል ውስጥ ያሉ ሶስት ክፍት ክብደት ሲስተሞች እንጂ የአሁን ድንበር-ልኬት የተስተናገዱ ሞዴሎች አይደሉም። ከAdvBench እና 100 ከሃርምቤንች 100 ጎጂ መጠይቆችን በመጠቀም ስድስቱም የ ቴክኒኮች በQwen3-8B ተገምግመዋል። የስራ ጣራዎች F1ን በማብዛት በተያዘው የPKU ክፍፍል ላይ ተመርጠዋል፣ እና GPT-5 ውጤቱን የጥቃት ምላሾችን ፈርዷል። ውጤቶቹ በተለያዩ ዳኞች፣ ገደቦች፣ የናሙና ቅንጅቶች፣ የሞዴል ሚዛኖች፣ ፈጣን ስርጭቶች ወይም በProbGuard ላይ በተመቻቹ ጥቃቶች ሊለወጡ ይችላሉ።
የሥልጠና ምልክቱ የሚገመተው ከመሠረታዊ እውነት ይልቅ ነው። በናሙና የተደረጉ አስራ ስድስት ተከታታይ ሂደቶች ከ128 ናሙና ማጣቀሻ ጋር ሲነጻጸር 3.6% የውሳኔ መጠን ፈጥረዋል፣ እና CalibEval የትኛዎቹ ቀጣይነት እንደ አደገኛ እንደሆኑ ተወስኗል። ወረቀቱ CalibEval በPKU የግምገማ ስብስብ ላይ 0.943 F1 እንደደረሰ ዘግቧል፣ ነገር ግን በዚያ ዳኛ ውስጥ ያሉ ማንኛቸውም ስልታዊ ስህተቶች ወደ ProbGuard ዒላማ ዕድሎች ሊዛመቱ ይችላሉ። የሰዎች ግምገማ እና ገለልተኛ የደህንነት መለያዎች የውጤቶቹ ውጤቶች ከአንድ የክላሲፋየር ወሰን ይልቅ የገሃዱ ዓለም ጉዳትን የሚያንፀባርቁ መሆናቸውን ለመፈተሽ ይረዳል።
የመዳረሻ እና ወጪ የምርት መለኪያዎችን ይፈልጋሉ. የተስተናገዱ ኤፒአይዎች በተለምዶ የመነጨ ጽሁፍ ወይም የተገደበ የምዝግብ ማስታወሻ ፕሮባቢሊቲ ውሂብን ብቻ ይመልሳሉ፣ ፕሮብጋርድ ግን በእያንዳንዱ እርምጃ ከፍተኛ 50 ፕሮባቢሊቲዎችን ይጠብቃል። በራሳቸው የሚስተናገዱ ኦፕሬተሮች እነዚያን ስርጭቶች ሊያጋልጡ ይችላሉ፣ ነገር ግን በትውልዱ ጊዜ ተጨማሪ ሞኒተር ማስኬድ እና ለአፍታ ማቆምን፣ የመግቢያ መሻገሮችን እና የመውደቅ ምላሾችን እንዴት እንደሚይዙ መወሰን አለባቸው። የወረቀቱ መዘግየት ቁጥሮች ከNVDIA RTX Pro 6000 ሃርድዌር ከ256 ጂቢ የሲስተም ማህደረ ትውስታ ጋር ይመጣሉ እና በአንድ ጊዜ ጭነት ከጫፍ እስከ ጫፍ የተጠቃሚ መዘግየትን አይዘግቡም።
በመጨረሻም ተመራማሪዎች የመላመድ ባህሪን መሞከር አለባቸው. ሞኒተሩን ቀደምት የመሆን እድልን እንደሚያነብ የሚያውቅ አጥቂ የመጀመሪያዎቹን ቶከኖች ጥሩ ለማድረግ፣ ዝቅተኛ እድል ባላቸው እጩዎች ላይ ስጋትን ለማሰራጨት ወይም አገልግሎቱን ለማዋረድ የውሸት አወንታዊ ውጤቶችን ለማስነሳት ሊሞክር ይችላል። ጠቃሚ የክትትል ማስረጃዎች የህዝብ ኮድ እና ክብደት፣ አስቀድሞ የተመዘገቡ ግምገማዎች፣ የብዙ ቋንቋ እና የመልቲሞዳል ፈተናዎች፣ የቀይ ቡድን ሙከራዎች በቀጥታ ወደ ተቆጣጣሪው ላይ ያነጣጠሩ እና ያልተመጣጠነ የታገዱ እነማንን ኦዲት ያካትታሉ። እስከዚያ ድረስ፣ ፕሮብጋርድ ተስፋ ሰጭ የምርምር ምሳሌ ነው፣ የእስር ማቋረጦች መፈታታቸውን ማረጋገጫ አይደለም።