የቴክኒክ መመሪያ

የማስመሰል ትምህርት

የማስመሰል ትምህርት AI ከሙከራ-እና-ስህተት ሽልማቶች ከመማር ይልቅ የባለሙያዎችን ማሳያ በመቅዳት አንድ ተግባር እንዲፈጽም ያስተምራል።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It matters because for many real tasks — driving, surgery, manipulation — it is far easier to show good behavior than to write a reward function.

ጥልቅ ዳይቭ

የማስመሰል ትምህርት ፖሊሲን ያሠለጥናል ከተመዘገበው ኤክስፐርት ምሳሌዎች፣በተለምዶ ጥንዶች ምልከታ እና ባለሙያው የወሰዳቸው እርምጃዎች። በጣም ቀላሉ ቅፅ፣ የባህሪ ክሎኒንግ፣ ይህንን እንደ ግልፅ ቁጥጥር የሚደረግበት ትምህርት ነው የሚመለከተው፡ የባለሞያውን መንግስት ለስቴቱ የሚሰጠውን እርምጃ ይተነብዩ። ሽልማቶችን ለመጥቀስ አስቸጋሪ ከሆነ ነገር ግን ብዙ ማሳያዎች ሲሆኑ፣ ልክ እንደ በሰው መንጃ ምዝግብ ማስታወሻዎች ላይ የሰለጠኑ መኪኖች ወይም በቴሌኦፐሬሽን በሚማሩ ሮቦቶች ላይ እንደሚደረጉት ማሳያዎች ብዙ ናቸው። የጥንታዊው ድክመት የስርጭት shift ወይም የማጣመር ስሕተት፡ ጥቃቅን ትንበያ ስህተቶች ወኪሉን ወደ ማይጎበኟቸው ግዛቶች ይገፋፋሉ፣ ይህም መመሪያ ወደሌለው እና ከመንገዱ የበለጠ ወደሚርቁበት። እንደ DAgger ያሉ ዘዴዎች ተማሪው በትክክል በሚደርስባቸው ግዛቶች ላይ ባለሙያውን ደጋግሞ በመጠየቅ ይህንን ያስተካክላሉ።

ቴክኒካዊ ግንዛቤ

የባህሪ ክሎኒንግ በተገመተው እና በተረጋገጡ ድርጊቶች መካከል ያለውን ክትትል የሚደረግበት ኪሳራ ይቀንሳል፣ነገር ግን ክልሎች ገለልተኛ እና በተመሳሳይ መልኩ የተከፋፈሉ ናቸው ብሎ ያስባል - በቅደም ተከተል ቁጥጥር ውስጥ ውሸት። DAgger (Dataset Aggregation) አሁን ያለውን ፖሊሲ ደጋግሞ በመልቀቅ፣ ኤክስፐርቱ የተጎበኙ ግዛቶችን እንዲሰይሙ በመጠየቅ እና እያደገ የመጣውን የተጠቃለለ የውሂብ ስብስብ ላይ እንደገና በማሰልጠን ይህንን ግምት ይሰብራል። ይህ የሥልጠና መረጃ ከተማሪው የራሱ የግዛት ስርጭት ጋር እንዲጣጣም ያቆያል፣ ይህም በረዥም አድማሶች ላይ የተወሳሰበ ስህተትን በእጅጉ ይቀንሳል።

ስልታዊ ተጽእኖ

ወጪ እና በጀት

የስነ-ህንፃ ውሳኔዎች ለዓመታት አፈጻጸምን እና የሥራ ማስኬጃ ወጪዎችን ያንቀሳቅሳሉ.

ግልጽ ውሳኔዎች

የቴክኒክ ትምህርት ቡድኖች አዲሱን ብቻ ሳይሆን ትክክለኛውን ቁልል እንዲመርጡ ይረዳል።

የጥራት ቁጥጥር

የተሻሉ የምህንድስና ምርጫዎች በምርት ውስጥ አስተማማኝነት ክስተቶችን ይቀንሳሉ.

የማስመሰል ትምህርት የወደፊት

የማስመሰል ትምህርት ለሮቦት ፋውንዴሽን ሞዴሎች እድገት ማዕከላዊ ነው፣ አንድ ፖሊሲ በትላልቅ ባለብዙ-ተግባር ቴሌኦፕሬሽን ዳታሴቶች ላይ የሰለጠኑ እና ለአዳዲስ ችሎታዎች የተስተካከለ። ሮቦቶች ከቪዲዮዎች ወይም መመሪያዎች ለመኮረጅ ከቋንቋ እና ከእይታ ጋር ጥብቅ ውህደትን ይጠብቁ እና ከክሎኒንግ ጋር የሚጫኑ ድቅል እና ከዚያም በማጠናከሪያ ትምህርት ያጠራሉ። የማሳያ ስብስብን በርካሽ በማስመሰል እና በተጨናነቀ የሰው ልጅ ጨዋታ ዳታ ማሳደግ ቁልፍ ማነቆ እና ንቁ ድንበር ሆኖ ይቆያል።

የእውነተኛ-ዓለም አተገባበር

በራስ የመንዳት የመኪና ግንዛቤ-ወደ-መሪ ሞዴሎች በሰዎች መንዳት ላይ የሰለጠኑ

የሮቦት ትጥቆች የልብስ ማጠቢያ ማጠፍ ወይም ነገሮችን በቴሌክ ኦፕሬተር ማሳያዎች መደርደር ይማራል።

የጨዋታ-ተጫዋች ወኪሎች ከ RL ጋር ጥሩ ማስተካከያ ከመደረጉ በፊት ከተቀዳው የሰው ድግግሞሾች ቡትስረዋል።

የቀዶ ጥገና እና አጋዥ ሮቦቶች ከባለሙያ ኦፕሬተር ማሳያዎች እንቅስቃሴዎችን ይማራሉ

አደጋዎች እና የጥበቃ መንገዶች

አንድ ቤንችማርክን ማሳደግ ሰፋ ያሉ የስርዓት ድክመቶችን ሊደብቅ ይችላል።

የመሠረተ ልማት እና የጥገና ወጪዎች ብዙ ጊዜ ዝቅተኛ ናቸው.

ስርዓቶች ይበልጥ ውስብስብ ሲሆኑ የደህንነት እና የታዛቢነት ክፍተቶች ሊያድጉ ይችላሉ።

የትግበራ ፍኖተ ካርታ

1

ከመተግበሩ በፊት የቆይታ፣ የጥራት እና የወጪ ግቦችን ይግለጹ።

2

ቤንችማርክ በእውነተኛ ጭነት እና የውሂብ ሁኔታዎች።

3

ለስህተቶች፣ ተንሸራታች እና የተጠቃሚ ተጽእኖ የመሳሪያ ክትትል።

4

ከመጠኑ በፊት የመመለሻ እና የአደጋ ምላሽ መንገዶችን ያዘጋጁ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Imitation Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

ከመስመር ውጭ የማጠናከሪያ ትምህርት

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is Imitation Learning?

የማስመሰል ትምህርት AI ከሙከራ-እና-ስህተት ሽልማቶች ከመማር ይልቅ የባለሙያዎችን ማሳያ በመቅዳት አንድ ተግባር እንዲፈጽም ያስተምራል። አስፈላጊ ነው ምክንያቱም ለብዙ እውነተኛ ተግባራት - መንዳት, ቀዶ ጥገና, ማጭበርበር - የሽልማት ተግባርን ከመጻፍ ይልቅ ጥሩ ባህሪን ማሳየት በጣም ቀላል ነው.

ከመኮረጅ ትምህርት በስተጀርባ ያለው ዋና ሀሳብ ምንድን ነው?

የማስመሰል ትምህርት አንድን ወኪል በባለሙያ ማሳያዎች ላይ የሚታየውን ባህሪ በሽልማት-ተኮር ሙከራ እና ስህተት ከማወቅ ይልቅ እንዲባዛ ያሠለጥናል።

የባህሪ ክሎኒንግ ክፈፎች አስመስሎ መማር እንደ የትኛው ችግር ነው?

የባህሪ ክሎኒንግ ማሳያዎችን እንደ ተለጣፊ መረጃዎች ይመለከታቸዋል እና ለእያንዳንዱ የታዘበ ሁኔታ የባለሙያውን እርምጃ በትክክል እንደ ክትትል የሚደረግበት ትምህርት መተንበይ ይማራል።

በረዥም የድርጊት ቅደም ተከተሎች ላይ የባህሪ ክሎኒንግ እንዲሳካ የሚያደርገው ምንድን ነው?

ትናንሽ የድርጊት ስህተቶች ተወካዩን ኤክስፐርቱ በጭራሽ ወደማያሳዩት ግዛቶች ይገፋፋሉ። እዚያ ምንም መመሪያ ሳይኖር, ስህተቶች ይከማቻሉ እና ተወካዩ ከኤክስፐርት አቅጣጫ የበለጠ ይርቃል.

የ DAgger ስልተ ቀመር ያንን ድክመት እንዴት ይፈታዋል?

DAgger የአሁኑን ፖሊሲ ያወጣል፣ ኤክስፐርቱ አዲስ የተጎበኙ ግዛቶችን እንዲሰይሙ እና በተቀናጀ የውሂብ ስብስብ ላይ በድጋሚ ስልጠና እንዲሰጥ በማድረግ የስልጠና መረጃ ከተማሪው የራሱ የግዛት ስርጭት ጋር እንዲዛመድ ያደርጋል።

እንደ መንዳት ላሉ ተግባራት ከማጠናከሪያ ትምህርት ይልቅ የማስመሰል ትምህርት ለምን ይመረጣል?

ለተወሳሰቡ የገሃዱ ዓለም ተግባራት፣ መልካም ባህሪን የሚይዝ ሽልማት መፃፍ ከባድ ነው፣ የመልካም ባህሪ ምሳሌዎችን ማሳየት (የሰው የመንዳት ምዝግብ ማስታወሻዎች) በአንፃራዊነት ቀላል ነው።