ወደ ዜና ተመለስ
ፈጠራAI Understanding አጭር መግለጫ

ጥናት AI ኮድ ማድረጊያ መመሪያ ፋይሎችን ከሶስት እጥፍ በላይ አግኝቷል

በ1,867 ማከማቻዎች ላይ የተደረገ ትንታኔ የኤጀንት መመሪያ ፋይሎች ደንቦችን ጠባቂዎች ካስወገዱት በበለጠ ፍጥነት ያከማቹ ሲሆን ምክንያታዊ አስተያየቶች ደግሞ ቁጥጥር በሚደረግባቸው ሙከራዎች ውስጥ ያለውን ትርፍ እድገት በእጅጉ ቀንሰዋል።

6 min readRead the primary source
ዋና-ምንጭ ሰነድምንጭ ተመዝግቧል
አታሚ
Catastrophic remembering research paper on arXiv
ምንጭ አገናኝ
arxiv.orghttps://arxiv.org/abs/2608.11095
የምንጭ ዓይነት
ዋና ሰነድ - ኦፊሴላዊ ማስታወቂያ ፣ ወረቀት ፣ ፋይል ወይም የመጀመሪያ ወገን ገጽ በቀጥታ እናነባለን።
አውድይህንን በ60 ሰከንድ ውስጥ ይረዱት።

እዚ ጀምር

ቁልፍ ቃላት

ማህደረ ትውስታ (ወኪል ማህደረ ትውስታ)
የተከማቸ አውድ የኤ ወኪል ቀጣይነትን ለማሻሻል በሁሉም ደረጃዎች ወይም ክፍለ ጊዜዎች ይጠቀማል።
ማብራሪያ
የማሽን መማሪያ ሞዴሎችን ለማሰልጠን ወይም ለመገምገም የሚያገለግሉ በሰው የተጨመሩ መለያዎች ወይም ሜታዳታ።
ቤንችማርክ
የሞዴል አፈጻጸምን ለመለካት እና ለማነፃፀር የሚያገለግል ደረጃውን የጠበቀ ሙከራ ወይም የውሂብ ስብስብ።
እራስህን ፈትን።AI ወኪሎች ጥያቄዎች

ምን ተፈጠረ

በነሀሴ 11 ላይ የተለጠፈው አዲስ ቅድመ-ህትመት በወኪል ኮድ ማከማቻ ማከማቻዎች ውስጥ የታየ ውድቀት ሁነታን “አሰቃቂ ማስታወስ” የሚል ስም ሰጥቷል፡ የፕሮጀክት መመሪያ ፋይሎች ህጎችን ማከማቸታቸውን ይቀጥላሉ ምክንያቱም ጥንቃቄ መጨመር ርካሽ ነው፣ ነገር ግን የድሮውን ህግ በአስተማማኝ ሁኔታ መሰረዝ ዋናው ምክንያት ከጠፋ በኋላ ከባድ ይሆናል።

ተመራማሪዎቹ እንደ CLAUDE.md ያሉ ፋይሎችን ከያዙ 1,867 የህዝብ ማከማቻዎች 247,694 መመሪያዎችን እና 299,440 በቁርጠኝነት ለመሸጋገር ሰበሰቡ። የተናጠል መመሪያዎችን በአርትዖት ተከታትለዋል እና ፋይሎቹ በተመለከቱት የህይወት ዘመናቸው በ226% እንዳደጉ ሪፖርት አድርገዋል፣ ይህም በእያንዳንዱ ማሻሻያ ቁርጠኝነት በአማካይ 4.9 የተጣራ መመሪያዎችን ጨምሯል። ጥናቱ እነዚያን አሃዞች በናሙና ውስጥ ያለማቋረጥ መከማቸታቸውን ማስረጃ አድርጎ ይመለከታቸዋል እንጂ እያንዳንዱ መመሪያ አላስፈላጊ ስለመሆኑ ወይም ሁሉም ወኪል ኮድ ፕሮጄክቶች ተመሳሳይ ባህሪ እንዳላቸው ማረጋገጫ አይደለም።

የወረቀቱ ማዕከላዊ ዘዴ ያልተመጣጠነ ማስረጃ ነው። ተጠባባቂ ወይም ኮድ ሰጪ ወኪል አሁን ባሉት ደንቦች መካከል ያለውን እያንዳንዱን መስተጋብር እንደገና ሳይገነባ ከስህተት በኋላ አዲስ መመሪያን ማከል ይችላል። በኋላ ላይ ስረዛው የበለጠ አደገኛ ነው፡ አንዴ አበረታች ውድቀት እና በዙሪያው ያለው አውድ ከጠፋ፣ አንዱን መመሪያ ማስወገድ አሁንም በበርካታ የተቀሩት መመሪያዎች ውህዶች ስር ዳግም መሻሻልን የሚከላከል መሆኑን ማረጋገጥን ሊጠይቅ ይችላል። በማከማቻ ውሂቡ ውስጥ፣ የሚገመተው የስረዛ አደጋ እንደ መመሪያ እድሜው ወድቋል፣ ሪፖርት የተደረገ የሎግ-አደጋ ቁልቁለት በእያንዳንዱ ቁርጠኝነት -0.032።

መፍትሄውን ለመፈተሽ ደራሲዎቹ የIFEval ገደቦችን በመገልበጥ መመሪያን የሚከተሉ ተግባራትን ፈጠሩ፣ ከዚያም ባዶ ህጎችን የያዙ ጥያቄዎችን ከጥያቄዎች ጋር በማነፃፀር እያንዳንዱ ህግ ለምን እንደኖረ የሚገልጹ አጫጭር አስተያየቶችንም ያቆዩ። በተቆጣጠሩት አወቃቀራቸው፣ አስተያየት ያልተሰጡ ጥያቄዎች 211.3% ትርፍ መመሪያዎችን አከማችተዋል፣ አስተያየት የተሰጣቸው ጥያቄዎች ግን በ1.4% ብልጫ አብቅተዋል። አስተያየቶቹ ለአምሳያው ተጨማሪ ትዕዛዞች አልነበሩም; በኋላ የማስወገድ ውሳኔዎችን ኦዲት ለማድረግ የታቀዱ የታመቀ ፕሮቬንሽን ነበሩ።

ቡድኑ በተጨማሪም አነስ ያሉ፣ በተሻለ በሰነድ የተደገፉ ጥያቄዎች ወኪሎች መመሪያዎችን እንዲከተሉ የረዳቸው መሆኑን ገምግሟል። በWildIFEval-የመነጨ ቤንችማርክ ላይ፣ ወረቀቱ እስከ 23.1 በመቶ ነጥቦችን ሲመዘግብ ምክንያቶች ሲጠበቁ እና ጊዜ ያለፈባቸው ህጎች ሊወገዱ ይችላሉ። እነዚያ ውጤቶች አዲስ ከተለጠፈ፣ ከአቻ-ያልገመገመ ቅድመ-ህትመት የይገባኛል ጥያቄዎች ናቸው። ስራው አስተያየቶች ብቻ እያንዳንዱን የኮድ ወኪል፣ ማከማቻ፣ ቋንቋ እና የምርት የስራ ሂደት እንደሚያሻሽሉ ስራው አላረጋገጠም።

የምንጭ ዝርዝሮች: Catastrophic remembering research paper on arXiv ↗

ለምን አስፈላጊ ነው።

የማጠራቀሚያ ደረጃ የማስተማሪያ ፋይሎች ለኮድ ወኪሎች የሚበረክት የክወና ማህደረ ትውስታ እየሆኑ መጥተዋል፣ ስለዚህ ከቁጥጥር ውጪ የሆነ እድገት ማስመሰያ ወጪዎችን ከፍ ሊያደርግ፣ ያረጁ ገደቦችን ይጠብቃል፣ እና አውቶሜትድ ኮድ ለውጦችን የሚቆጣጠሩ ህጎች ሰዎች እንዲረዱት ያደርጋል።

ተግባራዊ አደጋ በቀላሉ ረጅም ፋይል አይደለም. እያንዳንዱ መመሪያ ለሞዴል ትኩረት ይወዳደራል እና ከአዳዲስ ደንቦች፣ የመሣሪያ መግለጫዎች፣ የኮድ አውድ እና የተጠቃሚው ጥያቄ ጋር መስተጋብር መፍጠር ይችላል። አንድ ታሪካዊ ውድቀትን ለመከላከል የተጻፈ መመሪያ የኮድ ቤዝ ከተቀየረ፣ ከአዲስ ፖሊሲ ጋር ከተጋጨ ወይም ተያያዥነት የሌላቸውን ስራዎች ከገደበ በኋላ አግባብነት ላይኖረው ይችላል። ለምን እንደሚኖር ማንም እንደገና መገንባት ካልቻለ፣ በጣም አስተማማኝው የአካባቢ ምርጫ ብዙውን ጊዜ እሱን ማቆየት ነው፣ ይህም የጽዳት ወጪዎችን ወደ ወደፊት ቁርጠኝነት ያንቀሳቅሳል።

ያ ስርዓተ-ጥለት ከCLAUDE.md በላይ አስፈላጊ ነው። ቡድኖች በማሽን ሊነበብ በሚችል የፕሮጀክት መመሪያ ውስጥ የውል ስምምነቶችን፣ የደህንነት ወሰኖችን፣ የሙከራ ትዕዛዞችን፣ የስነ-ህንፃ ውሳኔዎችን እና የማሰማራት ማስጠንቀቂያዎችን እያከማቻሉ ነው። እነዚህ ፋይሎች ወጥነትን ሊያሻሽሉ እና የተደጋገሙ ስህተቶችን ሊቀንሱ ይችላሉ፣ ነገር ግን የአስተዳደር ገጽ ይሆናሉ፡ ሰዎች አንድን ቀጣይ ህግ ማን እንዳመጣው፣ ምን ማስረጃ እንዳረጋገጠ እና ጡረታ እንዲወጣ የሚፈቅድለትን ሁኔታ መለየት መቻል አለባቸው። ምክንያታዊ አስተያየት የዚያ የኦዲት መንገድ ቀላል ክብደት ያለው ስሪት ነው።

ውጤቱ ለተወካዩ ማህደረ ትውስታ ጠቃሚ የንድፍ መርህ ይጠቁማል: ማስታወስ የመርሳት ሁኔታዎችን ማካተት አለበት. ስርዓቱ "ሁልጊዜ X አድርግ" ብቻ ከመቅዳት ይልቅ የታየውን ውድቀት፣ የደንቡን ወሰን፣ ተዛማጅ አካል ወይም ሙከራን እና የግምገማ ቀስቅሴን ሊጠብቅ ይችላል። ያ ስረዛን በራስ ሰር አያደርገውም፣ ነገር ግን እገዳው አሁንም ትክክለኝነትን የሚጠብቅ ወይም የድሮ አካባቢን የሚያንፀባርቅ መሆኑን ለመወሰን በኋላ ላይ ለቆየው ማስረጃ ይሰጣል።

የኮድ ወኪሎች የበለጠ ጠቃሚ ሶፍትዌሮችን ሲነኩ የህዝብ ፍላጎት አንግል አለ። የተጠራቀሙ የግል መመሪያዎች የደህንነት ውሳኔዎችን፣ የተደራሽነት ባህሪን፣ የውሂብ አያያዝን ወይም ወኪል ለውድቀቶች እንዴት ምላሽ እንደሚሰጥ በጸጥታ ሊቀርጽ ይችላል። ትናንሽ ፋይሎች በራስ-ሰር ደህንነታቸው የተጠበቀ አይደሉም፣ እና ኃይለኛ ማጽዳት አስፈላጊ መከላከያን ያስወግዳል። ጠቃሚው ውጤት መከታተያ ነው፡ ጥቂት ያልተብራሩ ሕጎች፣ ግልጽ ባለቤትነት እና የሰው ልጅ መደመርን እና ስረዛን እንዲቃወሙ የሚያስችሉ አሰራሮችን መገምገም ነው።

Interactive Mechanism

በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ

ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
በይነተገናኝ ጽንሰ-ሐሳብ ቼክ+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

ቀጥሎ ምን እንደሚታይ

የሚቀጥለው ፈተና በቋንቋዎች፣ በድርጅቶች፣ በወኪል ምርቶች እና ረጅም ዕድሜ ያላቸው ማከማቻዎች ላይ ራሱን የቻለ ማባዛት ነው፣ በመቀጠልም በሰነድ የተደገፈ ማፅዳት አስፈላጊ መከላከያዎችን ሳይሰርዝ የኮድ ጥራትን ማሻሻል አለመቻሉን የሚለኩ።

የእይታ ናሙናው የመምረጥ ገደቦች አሉት። የወኪል መመሪያ ሰነዶችን የሚፈጽሙ የህዝብ ማከማቻዎች ከግል ድርጅት ኮድቤዝ ሊለያዩ ይችላሉ፣ እና የማከማቻ ታሪክ ህግን ያነሳሳ እያንዳንዱን ከመድረክ ውጭ ውይይት ወይም ክስተት ሊገልጥ አይችልም። አንድ ፕሮጀክት ሲስፋፋ ዕድገቱ ምክንያታዊ ሊሆን ይችላል። ወደፊት የሚደረጉ ትንታኔዎች የአዳዲስ አካላትን ጠቃሚ ሽፋን ከተባዛ፣ ተቃራኒ ወይም ጊዜ ያለፈባቸው መመሪያዎች መለየት እና ውጤቶቹ እንዴት እንደ ማከማቻ ዕድሜ፣ መጠን፣ ቋንቋ፣ የአስተዋጽዖ አድራጊዎች ብዛት እና የወኪል መድረክ እንዴት እንደሚለያዩ ሪፖርት ማድረግ አለባቸው።

ቁጥጥር የተደረገባቸው ሙከራዎች ሰፋ ያለ ማረጋገጫ ያስፈልጋቸዋል. ተግባራቶቹ ለወራት ከቆየ የቀጥታ ሶፍትዌር ጥገና ይልቅ መመሪያን ከሚከተሉ ቤንችማርኮች የተገኙ ናቸው፣ እና የወረቀቱ ተዛማጅ የቧንቧ መስመር በ50-ሽግግር ናሙና ላይ ተፈትሸዋል። አንድ ደራሲ በማረጋገጫው በከፊል ጥቅም ላይ የዋለውን የእጅ ማብራሪያ አዘጋጅቷል። ጥናቱ የእንግሊዝኛ ያልሆኑ የማስተማሪያ ፋይሎችን አልሸፈነም፣ እና ለውጡ እንደ መፃፊያ ሲቆጠር ለመወሰን ጥቅም ላይ የሚውለውን እያንዳንዱን ደረጃ አልጠራራም ፣ እና መመሪያን ከመቀጠል ይልቅ።

አስተያየቶች የተሳሳቱ አመክንዮዎችን ልክ እንደ ትክክለኛዎቹ በቀላሉ ማቆየት ይችላሉ። ቡድኖቹ እንደ የተገናኙ ጉዳዮች፣ ያልተሳኩ የድጋሚ ፈተናዎች፣ የአገልግሎት ማብቂያ ቀናት፣ የባለቤትነት መስኮች ወይም አውቶማቲክ ቼኮች የተባዙ እና እርስ በርስ የሚጋጩ መመሪያዎችን በመሳሰሉ አማራጮች ላይ የተዋቀረ ፕሮቬንሽን መሞከር አለባቸው። በጣም ደህንነቱ የተጠበቀ የስራ ሂደት የማስወገጃ ሀሳብ ያቀርባል፣ ማስረጃዎችን እና የተጎዱ ሙከራዎችን ያሳያል፣ እና ተወካዩ ቶከኖችን ለማዳን ብቻ መመሪያዎችን እንዲቆርጥ ከመፍቀድ ይልቅ ከፍተኛ ተጽዕኖ ላላቸው ህጎች መከለስ ያስፈልገዋል።

ጠቃሚ የክትትል ማስረጃዎች ከጫፍ-እስከ-መጨረሻ ውጤቶችን ይለካሉ፡ ፈጣን መጠን፣ መመሪያን ማክበር፣ የተግባር ስኬት፣ ተሃድሶዎች፣ የግምገማ ጊዜ እና ከተሰረዙ በኋላ የተመለሱት ህጎች ብዛት። ተመራማሪዎች ሞዴሎች በትክክል እንደታሰበው ምክንያታዊ አስተያየቶችን መጠቀማቸውን ወይም አንዳንድ ጊዜ ለተጨማሪ መስፈርቶች መጠቀማቸውን መሞከር አለባቸው። እነዚያ ውጤቶች እስኪመጡ ድረስ፣ አሰቃቂ ማስታወስ የጸሐፊዎቹ የውሂብ ስብስብ እና ሙከራዎች በደንብ የተደገፈ መግለጫ እንጂ ዓለም አቀፋዊ ህግ ወይም የበሰለ የፕሮጀክት መመሪያ ጅምላ ሽያጭን ለማጥፋት ምክንያት አይደለም።

ተዛማጅ መመሪያዎች እና ጥያቄዎች

AI ወኪሎችAI ኮድ ማድረግPrompt EngineeringChatGPT እና LLMsየሚያውቁትን ይሞክሩ - ነፃ የ AI ጥያቄዎችን ይሞክሩበእኛ የቃላት መፍቻ ውስጥ የ AI ቃልን ይፈልጉየ AI ሞዴል መልቀቂያ መከታተያ ይከተሉ
ይህ ጠቃሚ ሆኖ ተገኝቷል?