መሰረታዊ መመሪያ

ለነርቭ ኔትወርኮች የመጠን ህጎች

የማሳያ ህጎች የሞዴሉን መጠን፣ የውሂብ ስብስብ መጠን እና ስሌት ሲያሳድጉ የነርቭ አውታረ መረብ ኪሳራ በሚገመተው ሁኔታ እንደሚቀንስ የሚያሳዩ ተጨባጭ ቀመሮች ናቸው።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

They matter because they let researchers forecast performance before spending millions on training a giant model.

ጥልቅ ዳይቭ

በOpenAI's 2020 በካፕላን እና ባልደረቦች የታወቁት የማሳያ ህጎች፣የፍተሻ ኪሳራ እንደ ለስላሳ ሃይል ህግ በሶስት መጠኖች እንደሚቀንስ ደርሰውበታል፡ፓራሜትር ቆጠራ (N)፣ የስልጠና ቶከኖች (D) እና ጠቅላላ ስሌት (ሲ)። በሎግ-ሎግ መጥረቢያዎች ላይ የተነደፈ፣ ከእያንዳንዱ ምክንያት ጋር ያለው ኪሳራ ብዙ ትዕዛዞችን የሚይዝ ቀጥተኛ መስመር ይመሰርታል። ግንኙነቶቹ Loss ≈ a + b·X^(-c) ቅጽ ይወስዳሉ፣ እሱም X የመጠን መለኪያ ነው። በወሳኝ ሁኔታ፣ የመጀመሪያው ስራ የአምሳያው መጠን ከመረጃ የበለጠ አስፈላጊ መሆኑን ጠቁሟል፣ ይህም እንደ GPT-3 175 ቢሊዮን መለኪያዎች ባሉ ምንጊዜም ትልልቅ ሞዴሎች ላይ ውድድር አነሳሳ። የመለኪያ ህጎች ከግምት ስራ ጥልቅ ትምህርት ወደ መተንበይ ወደሚችል የምህንድስና ዲሲፕሊን ቀየሩት፣ ይህም ቡድኖች ከትናንሽ ርካሽ ሙከራዎች ትልቅ ውጤትን እንዲተነብዩ ያስችላቸዋል።

ቴክኒካዊ ግንዛቤ

የሃይል-ህግ ቅፅ ማለት እያንዳንዱ ቋሚ ብዜት በኮምፒዩተር መጨመር በግምት የማያቋርጥ ተጨማሪ ኪሳራ ያስከትላል። ኪሳራ የሚለካው በናቶች ወይም ቢትስ በአንድ የመስቀል ኢንትሮፒ ምልክት ነው። አርቢው ሐ ትንሽ ስለሆነ (ብዙውን ጊዜ 0.05-0.1 አካባቢ)፣ ጥቅሞቹ እውን ናቸው ነገር ግን እየቀነሱ ናቸው፡ ድርብ ማስላት ከመጀመሪያዎቹ እጥፍ ያነሰ ይረዳል። በአስፈላጊ ሁኔታ፣ እነዚህ ህጎች የማይቀንስ-ፕላስ-የሚቀንስ ኪሳራን ይገልጻሉ፣ ይህም ቋሚ ቃል የትኛውም ሞዴል ሊመታ የማይችለውን የመረጃውን ውስጣዊ ኢንትሮፒ ይይዛል።

ስልታዊ ተጽእኖ

ግልጽ ውሳኔዎች

ግልጽ ቴክኒካዊ የይገባኛል ጥያቄዎችን ከገበያ ቋንቋ እንዲለዩ ያግዝዎታል።

ወጪ እና በጀት

ገንዘብን ወይም ጊዜን ከማጥፋትዎ በፊት የተሻሉ የትግበራ ጥያቄዎችን መጠየቅ ይችላሉ።

ቡድን እና የስራ ፍሰት

የጋራ ግንዛቤ ያላቸው ቡድኖች የተሻለ ምርት፣ ፖሊሲ እና የመማር ውሳኔዎችን ያደርጋሉ።

ለነርቭ አውታረ መረቦች የመጠን ህጎች የወደፊት ዕጣ

ተመራማሪዎች የማመዛዘን ህጎችን ከመጥፋት አስቀድሞ ከማሰልጠን ባለፈ ወደ ታችኛው የተግባር ትክክለኛነት፣ የመልቲሞዳል ሞዴሎች እና የፍላጎት ጊዜ ስሌት፣ የማመዛዘን ሞዴሎች በአንድ መጠይቅ የበለጠ ማሰብን ያሳልፋሉ። ከፍተኛ ጥራት ያለው ጽሑፍ እየቀነሰ ሲመጣ፣ ትኩረት ወደ የውሂብ ጥራት፣ ሰው ሰራሽ ውሂብ እና ተደጋጋሚ የውሂብ ልኬት ህጎች እየተሸጋገረ ነው። አንዳንዶች ጥሬ ልኬቱ የገንዘብ፣ የሃይል እና የጽሁፍ ገደቦችን በመምታት መስክን ወደ አልጎሪዝም ቅልጥፍና እና አዲስ አርክቴክቸር በቀላሉ ከመገንባት ይልቅ መግፋት ነው ብለው ይከራከራሉ።

የእውነተኛ-ዓለም አተገባበር

የጂፒዩ በጀት ከመውሰዱ በፊት ከተከታታይ 100ሚሊዮን መለኪያ ሙከራዎች የታቀደውን የ70 ቢሊዮን መለኪያ ሞዴል የመጨረሻውን ኪሳራ መተንበይ።

ቋሚ ስሌት በጀት ምን ያህል ትሪሊዮን ቶከኖች እንደሚሰበሰቡ መወሰን በቂ ባልሰለጠነ ሞዴል ላይ አይባክንም።

ሁለቱንም አርክቴክቸር በርካሽ ማነፃፀር የመለኪያ ኩርባዎቻቸውን በትንሽ መጠን በመግጠም ሁለቱንም በመጠን ከማሰልጠን ይልቅ።

ለባለሀብቶች ትክክለኛ ትክክለኝነት የሚጠበቁ ነገሮችን ማቀናበር ወይም የኪሳራውን አቅጣጫ ወደ ዒላማ ስሌት ደረጃ በማውጣት ለገምጋሚዎች መስጠት።

አደጋዎች እና የጥበቃ መንገዶች

የተለያዩ ቡድኖች ተመሳሳይ ቃል በተለያየ መንገድ ሊጠቀሙ ይችላሉ፣ ስለዚህ ወሰንን ቀደም ብለው ይግለጹ።

የገሃዱ ዓለም አፈጻጸም ያልተስተካከለ ሆኖ ሳለ ማመሳከሪያዎች ጠንካራ ሊመስሉ ይችላሉ።

የውሂብ ጥራት እና የግምገማ እቅዶችን ችላ ማለት ብዙውን ጊዜ ደካማ ውጤቶችን ይፈጥራል.

የትግበራ ፍኖተ ካርታ

1

የሚፈልጉትን ውጤት በግልፅ ቋንቋ ትርጉም ይጀምሩ።

2

ከመሞከርዎ በፊት አንድ የስኬት መለኪያ እና አንድ የውድቀት ሁኔታ ይምረጡ።

3

አንድ ትንሽ አብራሪ በተወካይ ውሂብ ያሂዱ እንጂ የተጣራ ማሳያ ስብስብ አይደለም።

4

ለነርቭ ኔትወርኮች የመለኪያ ሕጎች የሚረዱበት እና ቀላል ዘዴዎች የተሻሉበት ሰነድ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Scaling Laws for Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

ተለዋዋጭ የነርቭ አውታረ መረቦች

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is Scaling Laws for Neural Networks?

የማሳያ ህጎች የሞዴሉን መጠን፣ የውሂብ ስብስብ መጠን እና ስሌት ሲያሳድጉ የነርቭ አውታረ መረብ ኪሳራ በሚገመተው ሁኔታ እንደሚቀንስ የሚያሳዩ ተጨባጭ ቀመሮች ናቸው። ፋይዳ አላቸው ምክንያቱም ተመራማሪዎች ግዙፍ ሞዴልን ለማሰልጠን ሚሊዮኖችን ከማውጣታቸው በፊት አፈፃፀሙን እንዲተነብዩ ፈቅደዋል።

በሎግ ሎግ መጥረቢያዎች ላይ፣ በማስላት ህጎች መሰረት ሲጨምር የሙከራ መጥፋት እንዴት ይታያል?

ኪሳራ በተቃራኒ ስሌት፣ የሞዴል መጠን ወይም የውሂብ ሎግ-ሎግ ሴራዎች ላይ ቅርብ-ቀጥ ያለ መስመር ይመሰርታል፣የኃይል-ህግ ግንኙነት ፊርማ።

የመጀመሪያዎቹ የመለኪያ ህጎች የትኞቹን ሶስት መጠኖች ከመጥፋት ጋር ይዛመዳሉ?

ካፕላን እና ሌሎች. ኪሳራን እንደ ሃይል ህግ በፓራሜትር ቆጠራ (N)፣ የስልጠና ቶከኖች (D) እና ጠቅላላ ስሌት (C) አጥንቷል።

ለምንድነው የመለኪያ ህጎች ለ AI ላብራቶሪዎች በጣም ጠቃሚ የሆኑት?

ኩርባዎችን በትንሽ መጠን በመግጠም ቡድኖቹ ብዙ ገንዘብ ከማውጣታቸው በፊት የግዙፉን ሞዴል አፈጻጸም ይተነብያሉ።

በመለኪያ ህግ ኪሳራ ቀመር ውስጥ ያለው ቋሚ (የማይቀንስ) ቃል ምንን ይወክላል?

ኪሳራ ከሚዛን ጋር የሚቀንስ ሊቀንስ የሚችል ክፍል እና በመረጃው ተፈጥሮ በዘፈቀደ የተስተካከለ የማይቀንስ ወለል አለው።

ለምንድነው የማሸጋገር ግኝቶች 'እየቀነሱ' ተብለው የተገለጹት?

የሃይል-ህግ ገላጭ ትንሽ ስለሆነ፣ የእኩል ማባዛት ስሌት ምርቱ ያለማቋረጥ አነስተኛ ፍፁም ኪሳራ ቅነሳዎችን ይጨምራል።