የቴክኒክ መመሪያ

ጥ-ትምህርት

Q-Learning የማጠናከሪያ ትምህርት ስልተ ቀመር ነው እያንዳንዱን እንቅስቃሴ በሙከራ እና በስህተት ቀስ በቀስ በመማር የትኛው እርምጃ የተሻለ ውጤት እንደሚያስገኝ የሚያስተምር።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It matters because it can find optimal behavior without ever being told the rules of its environment.

ጥልቅ ዳይቭ

Q-Learning Q(s,a) የሚባል ተግባር ይማራል፡ የሚጠበቀውን የረጅም ጊዜ ሽልማት በግዛት 'a' በመውሰድ እና ከዚያ በኋላ በጥሩ ሁኔታ መስራት። ወኪሉ ምንም ነገር አለማወቅ ይጀምራል፣ ድርጊቶችን ይሞክራል እና ሽልማቶችን ይመለከታል። ከእያንዳንዱ እርምጃ በኋላ የQ-እሴት ግምቱን አሁን ለተቀበለው ሽልማት እና ከቀጣዩ ግዛት የሚጠብቀውን ምርጥ ቅናሽ የወደፊት ዋጋን ያሳያል። በወሳኝ መልኩ፣ 'ከፖሊሲ ውጪ' እና 'ከሞዴል-ነጻ' ነው፡ በዘፈቀደ እየፈተሸ ምርጡን ፖሊሲ መማር ይችላል፣ እና አለም እንዴት እንደምትሸጋገር ሞዴል አያስፈልገውም። የእያንዳንዱን የስቴት-ድርጊት ጥንድ በበቂ ሁኔታ ማሰስ ከተሰጠን፣ የQ-እሴቶቹ ከምርጥ እሴቶች ጋር ይጣመራሉ፣ እና በማንኛውም ግዛት ውስጥ ያለው ምርጡ እርምጃ በቀላሉ ከፍተኛ Q ያለው ነው።

ቴክኒካዊ ግንዛቤ

ዋናው የቤልማን ማሻሻያ ነው፡ Q(s,a) <- Q(s,a) + alpha[r + gamma*max_a' Q(s',a') - Q(s,a)]. አልፋ የመማሪያ ተመን ነው፣የወደፊት ሽልማቶችን የሚመዝን ጋማ የቅናሽ ዋጋ ነው፣እና ቅንፍ ያለው ቃል ጊዜያዊ-ልዩነት ስህተት ነው። በሚቀጥሉት ድርጊቶች ላይ ያለው 'ከፍተኛ' ከፖሊሲ ውጭ የሚያደርገው እና ​​ስግብግብነትን በሚመረምርበት ጊዜም ቢሆን ጥሩውን ፖሊሲ እንዲማር ያስችለዋል። አሰሳ በተለምዶ የሚካሄደው በepsilon-ስግብግብ እርምጃ ምርጫ ነው።

ስልታዊ ተጽእኖ

ወጪ እና በጀት

የስነ-ህንፃ ውሳኔዎች ለዓመታት አፈጻጸምን እና የሥራ ማስኬጃ ወጪዎችን ያንቀሳቅሳሉ.

ግልጽ ውሳኔዎች

የቴክኒክ ትምህርት ቡድኖች አዲሱን ብቻ ሳይሆን ትክክለኛውን ቁልል እንዲመርጡ ይረዳል።

የጥራት ቁጥጥር

የተሻሉ የምህንድስና ምርጫዎች በምርት ውስጥ አስተማማኝነት ክስተቶችን ይቀንሳሉ.

የQ-ትምህርት የወደፊት

ክላሲክ ሠንጠረዡ Q-Learning የሚታገለው ስቴቶች በሠንጠረዥ ውስጥ ለማከማቸት በጣም ብዙ ሲሆኑ ነው። ዋናው አቅጣጫ ከነርቭ ኔትወርኮች ጋር በማጣመር ላይ ነው፣ ልክ እንደ Deep Q-Networks (DQN)፣ Q-እሴቶችን እንደ ፒክስሎች ካሉ ጥሬ ግብዓቶች ይገመታል። በተሞክሮ ድጋሚ ማጫወት፣ ኢላማ ኔትወርኮች፣ እና እንደ Double DQN እና የስርጭት ጥ-ትምህርት ባሉ ልዩነቶች በማረጋጋት ላይ ምርምር ቀጥሏል ከመጠን በላይ ግምትን የሚቀንሱ እና ነጠላ አማካዮችን ሳይሆን ሙሉ የመመለሻ ስርጭቶችን ይወክላሉ።

የእውነተኛ-ዓለም አተገባበር

Atari ጨዋታ የሚጫወቱ ወኪሎች (DeepMind's DQN) Breakout እና Pongን ከስክሪን ፒክስሎች በቀጥታ መጫወት ይማራሉ

አጠቃላይ የተሽከርካሪ የጥበቃ ጊዜን ለመቀነስ በመገናኛዎች ላይ የትራፊክ-ብርሃን ጊዜን ማመቻቸት

የሮቦት ዳሰሳ በፍርግርግ ወይም በሜዝ ውስጥ ሮቦቱ በጣም አጭር የሆነውን የሽልማት ከፍተኛውን መንገድ ይማራል

ተለዋዋጭ የዋጋ አወጣጥ እና የእቃ ዝርዝር ውሳኔዎች አንድ ወኪል የትኞቹ ድርጊቶች የረጅም ጊዜ ትርፍን እንደሚያሳድጉ ሲያውቅ

አደጋዎች እና የጥበቃ መንገዶች

አንድ ቤንችማርክን ማሳደግ ሰፋ ያሉ የስርዓት ድክመቶችን ሊደብቅ ይችላል።

የመሠረተ ልማት እና የጥገና ወጪዎች ብዙ ጊዜ ዝቅተኛ ናቸው.

ስርዓቶች ይበልጥ ውስብስብ ሲሆኑ የደህንነት እና የታዛቢነት ክፍተቶች ሊያድጉ ይችላሉ።

የትግበራ ፍኖተ ካርታ

1

ከመተግበሩ በፊት የቆይታ፣ የጥራት እና የወጪ ግቦችን ይግለጹ።

2

ቤንችማርክ በእውነተኛ ጭነት እና የውሂብ ሁኔታዎች።

3

ለስህተቶች፣ ተንሸራታች እና የተጠቃሚ ተጽእኖ የመሳሪያ ክትትል።

4

ከመጠኑ በፊት የመመለሻ እና የአደጋ ምላሽ መንገዶችን ያዘጋጁ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Q-Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

የትምህርት ደረጃ መርሐግብር

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is Q-Learning?

Q-Learning የማጠናከሪያ ትምህርት ስልተ ቀመር ነው እያንዳንዱን እንቅስቃሴ በሙከራ እና በስህተት ቀስ በቀስ በመማር የትኛው እርምጃ የተሻለ ውጤት እንደሚያስገኝ የሚያስተምር። የአካባቢን ህግጋት በጭራሽ ሳይነግሮት ጥሩ ባህሪን ማግኘት ስለሚችል አስፈላጊ ነው።

የQ-እሴት Q(ዎች፣ ሀ) ምንን ይወክላል?

ጥ(ዎች፣ ሀ) በግዛት s ውስጥ እርምጃ ከመውሰድ እና ከዚያ በኋላ ጥሩ ባህሪን ከማሳየት አጠቃላይ ቅናሽ የተደረገበትን የወደፊት ሽልማት ይገምታል።

ለምን Q-Learning 'ከፖሊሲ ውጪ' ተብሎ ተገልጿል?

በሚቀጥሉት ድርጊቶች ከፍተኛው ማለት Q-Learning የስግብግብ ጥሩ ፖሊሲን ዋጋ ይማራል ወኪሉ በተለየ የባህሪ ፖሊሲ እየዳሰሰ እንኳን።

በዝማኔ ደንብ ውስጥ፣ የቅናሽ ፋክተር ጋማ ምን ይቆጣጠራል?

ጋማ (በ 0 እና 1 መካከል) የወደፊት ሽልማቶችን ቅናሾች; በ 1 አቅራቢያ ያሉ እሴቶች ተወካዩን አርቆ አሳቢ ያደርጉታል፣ በ0 አቅራቢያ ያሉ እሴቶች አጭር እይታ ያደርጉታል።

በQ-Learning ውስጥ ያለው ጊዜያዊ-ልዩነት (TD) ስህተት ምንድን ነው?

የቲዲ ስህተቱ በአዲሱ የዒላማ ግምት (ሽልማት እና ምርጥ ቅናሽ የወደፊት ዋጋ) እና በአሮጌው Q ግምት መካከል ያለው ክፍተት ነው። ዝመናው ይህንን ክፍተት ይቀንሳል.

ለምንድነው ግልጽ ሠንጠረዡ ጥ-ትምህርት ከፒክሴል የመጡ የቪዲዮ ጨዋታዎች ካሉ ትልልቅ ችግሮች ጋር የሚታገለው?

የመፈለጊያ ሠንጠረዥ በእያንዳንዱ የግዛት-እርምጃ ጥንድ ግቤት ያስፈልገዋል፣ ይህም ግዛቶች በቢሊዮኖች ሲቆጠሩ የማይቻል ነው፣ ይህም እንደ DQN ያሉ የነርቭ አውታረ መረብ ግምቶችን ያነሳሳል።