የቺንቺላ ልኬት ህጎች
እ.ኤ.አ. በ2022 ከ DeepMind የመጣው የቺንቺላ ስኬሊንግ ህጎች እንደሚያሳዩት አብዛኞቹ ትላልቅ የቋንቋ ሞዴሎች በመጥፎ የሰለጠኑ ናቸው፡ ለቋሚ ስሌት በጀት፣ የሞዴሉን መጠን እና የስልጠና ውሂብን በእኩል መጠን ማመጣጠን አለቦት።
አጠቃላይ እይታ
It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.
ጥልቅ ዳይቭ
ከቺንቺላ በፊት፣ አዝማሚያው በአንጻራዊ ሁኔታ መጠነኛ የውሂብ መጠን ላይ እያሰለጠነ ሁልጊዜ ትልልቅ ሞዴሎችን (እንደ 175B-parameter GPT-3) መገንባት ነበር። DeepMind ከ400 በላይ ሞዴሎችን በብዙ መጠኖች እና በዳታ በጀቶች አሰልጥኗል፣ በመቀጠልም በቋሚ ስሌት (FLOP) በጀት ስር እንደ መለኪያዎች እና ቶከኖች ኪሳራን የሚተነብዩ ኩርባዎችን ያስተካክሉ። ግኝታቸው፡ መለኪያዎች እና የሥልጠና ቶከኖች አንድ ላይ መመዘን አለባቸው፣ በግምት ከ1-ለ1 ጥምርታ፣ ይህም በአንድ ግቤት ወደ 20 የሚጠጉ የሥልጠና መረጃዎችን ያሳያል። ይህንንም ለማረጋገጥ ቺንቺላ የተባለችውን ባለ 70ቢ-ፓራሜትር ሞዴል በ1.4 ትሪሊዮን ቶከኖች ላይ አሰልጥነዋል፣ይህም ተመሳሳይ ስሌት ቢጠቀምም እጅግ በጣም ትልቅ የሆነውን 280B-parameter Gopher በልጦታል፣ምክንያቱም በብዙ መረጃዎች የሰለጠነ ነው።
ቴክኒካዊ ግንዛቤ
ህጎቹ የሚመነጩት ፓራሜትሪክ ኪሳራ ተግባር L(N፣ D) ሲሆን N መለኪያዎች ሲሆኑ D ደግሞ የማይቀንስ ኪሳራ፣ የሞዴል መጠን እና የውሂብ መጠን ቃላትን ጨምሮ። በስሌት ገደብ ላይ የሚደርሰውን ኪሳራ መቀነስ (ስሌት ከ N ጊዜዎች D ጋር የሚመጣጠን ነው) ውጤቱን ያስገኛል ምርጥ N እና D ሁለቱም ተመሳሳይ ገላጭ ጋር እንደ ስሌት ሃይል ያድጋሉ፣ ስለዚህ የስሌት-ምርጥ ሬሾ በአንድ ግቤት 20 ቶከኖች አጠገብ ይቆያል።
ስልታዊ ተጽእኖ
ፍጥነት እና ልኬት
የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።
መድረስ እና መድረስ
በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።
ግልጽ ውሳኔዎች
አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።
የወደፊት የቺንቺላ ስኬል ህጎች
ቺንቺላ የሜዳውን መለኪያ ከማሳደድ ወደ ሞዴሎች እጅግ የላቀ ጥራት ያለው መረጃን ወደመመገብ ቀይራዋለች፣ እና ዘመናዊ ሞዴሎች ብዙ ጊዜ ግምቱን ርካሽ ለማድረግ ከ'ኮምፕዩት-አፕቲማል' ነጥብ በደንብ ያልፋሉ። ከፍተኛ ጥራት ያለው የድረ-ገጽ ጽሑፍ እየቀነሰ በሄደ ቁጥር ትኩረት ወደ ዳታ መጠገን፣ ሰው ሰራሽ ዳታ፣ በርካታ ኢፖክሶች እና የመልቲሞዳል ዳታ ሚዛን እየሰፋ ነው። ዋናው ትምህርቱ ጸንቶ ይቆያል፡ ዳታ እና ግቤቶች ሚዛናዊ መሆን አለባቸው፣ እና ጥሬው መጠን ብቻ ግቡ አይደለም።
የእውነተኛ-ዓለም አተገባበር
የ DeepMind 70B-parameter ቺንቺላ 280ቢ ጎፈርን በቤንችማርኮች እኩል ስሌትን በመጠቀም የበለጠ መረጃ በማሰልጠን ደበደበ።
ቡድኖች ከጭረት የጸዳ ሞዴል ሲያቅዱ በአንድ ግቤት ወደ 20 የሚጠጉ የሥልጠና ምልክቶችን በጀት እንዲያወጡ መምራት
እንደ ኤልኤኤምኤ ያሉ ትናንሽ እና በመረጃ የበለጸጉ ሞዴሎችን በማሳየት በዋጋ ጊዜ ለመስራት ርካሽ ናቸው።
የታቀደው ሞዴል 'ከሥልጠና ያልሰለጠነ' እና ከተጨማሪ መመዘኛዎች ይልቅ ከተጨማሪ መረጃ የበለጠ የሚጠቅም መሆኑን መገመት
አደጋዎች እና የጥበቃ መንገዶች
የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።
ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።
የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።
የትግበራ ፍኖተ ካርታ
ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።
ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።
ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።
የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
ለነርቭ ኔትወርኮች የመጠን ህጎች
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is Chinchilla Scaling Laws?
እ.ኤ.አ. በ2022 ከ DeepMind የመጣው የቺንቺላ ስኬሊንግ ህጎች እንደሚያሳዩት አብዛኞቹ ትላልቅ የቋንቋ ሞዴሎች በመጥፎ የሰለጠኑ ናቸው፡ ለቋሚ ስሌት በጀት፣ የሞዴሉን መጠን እና የስልጠና ውሂብን በእኩል መጠን ማመጣጠን አለቦት። አስፈላጊ የሆነው 'ምርጥ' የሞዴል መጠን ማለት ምን ማለት እንደሆነ እንደገና ስላስቀመጠ እና ላብራቶሪዎች እንዴት እንደሚያወጡት ስላስተካከለ ነው።
የቺንቺላ ልኬት ህጎች ማዕከላዊ ግኝት ምን ነበር?
ቺንቺላ ለአንድ የተወሰነ ስሌት በጀት፣ መለኪያዎች እና የሥልጠና ቶከኖች አንድ ላይ በግምት ከ1-ለ-1 ማደግ እንዳለባቸው አሳይቷል።
በግምት ስንት የሥልጠና ቶከኖች በመለኪያ ቺንቺላ ኮምፒዩት-ምርጥ መሆኑን ጠቁማለች?
የስሌት-ምርጥ ጥምርታ ለእያንዳንዱ ሞዴል ግቤት በግምት 20 የስልጠና ቶከኖች ይሰራል።
ቺንቺላ በጣም ትንሽ ብትሆንም ከየትኛው ሞዴል ይበልጣል?
የ70ቢ-መለኪያ ቺንቺላ የ DeepMind የራሱን 280B-parameter Gopher በተመሳሳይ ስሌት በመጠቀም አሸንፏል፣ምክንያቱም በብዙ መረጃዎች ላይ ስለሰለጠነ።
ቺንቺላ በወቅቱ እንደ GPT-3 ያሉ ሞዴሎች ምን ማለት ነው?
ብዙ የዛን ዘመን ትልልቅ ሞዴሎች የሰለጠኑ ነበሩ፣ ይህም ማለት ለመለኪያ ቁጥራቸው ብዙ ተጨማሪ መረጃዎችን በተሻለ ሁኔታ ይሰሩ ነበር።
በቺንቺላ ትንታኔ በግምት እንዴት ይሰላል?
የሥልጠና ስሌት (FLOPs) በሥልጠና ቶከኖች ብዛት ከተባዛው የመለኪያዎች ብዛት ጋር በግምት ተመጣጣኝ ነው።