የቺንቺላ ስሌት-ምርጥ ስልጠና
ቺንቺላ የ2022 DeepMind ግኝት ሲሆን አብዛኞቹ ትላልቅ የቋንቋ ሞዴሎች በመጥፎ የሰለጠኑ ናቸው፡ ለተወሰነ ስሌት በጀት ትልቅ ሞዴል መገንባት ብቻ ሳይሆን መለኪያዎችን እና መረጃዎችን በእኩል መጠን ማመጣጠን አለቦት።
አጠቃላይ እይታ
It reshaped how the industry balances model size against training data.
ጥልቅ ዳይቭ
የ DeepMind's Chinchilla paper ስኬቲንግን በድጋሚ ጎብኝቶ ከ400 በላይ ሞዴሎችን በማሰልጠን የኮምፒዩት-ምርጥ ሚዛኑን አሰልጥኗል። የአውራ ጣት ዋና ርዕስ፡ የሞዴል መጠን እና የሥልጠና ቶከኖች በመቆለፊያ ደረጃ ማደግ አለባቸው፣ በአንድ መለኪያ በግምት 20 የሥልጠና ቶከኖች። ይህንንም ለማረጋገጥ ቺንቺላ የተባለችውን 70 ቢሊዮን ፓራሜትር ሞዴል በ1.4 ትሪሊየን ቶከኖች ላይ አሰልጥነዋል። ቺንቺላ በአራት እጥፍ ያነሰ ብትሆንም ጎፈርን፣ ጂፒቲ-3 እና ሌሎች ግዙፎችን በሁሉም ቤንችማርክ በልጧል። ትምህርቱ ከውሂብ ይልቅ የሚወደድ መጠን የሚለውን የቀደመውን OpenAI ድምዳሜ ገልብጧል፣ ብዙ ዋና ዋና ሞዴሎች በጣም ትልቅ እና በመረጃ የተራቡ በመሆናቸው አፈጻጸምን በጠረጴዛው ላይ እንደሚተዉ ያሳያል።
ቴክኒካዊ ግንዛቤ
ቺንቺላ የሚስማማ ኪሳራ እንደ L(N፣D) = E + A·N^(-α) + B·D^(-β)፣ α እና β ሁለቱም በ0.34 አቅራቢያ ያሉት፣ ግቤቶች እና መረጃዎች በተመጣጣኝ መልኩ አስተዋፅዖ ያደርጋሉ። ይህንን በቋሚ ስሌት ገደብ ውስጥ ማመቻቸት (ማስላት ≈ 6 · N·D ለትራንስፎርመሮች) እኩል-ልኬት ውጤት ያስገኛል. አነስ ያለ፣ በመረጃ የበለጸገ ሞዴል በምርመራ ለመሮጥ ርካሽ ነው፣ ስለዚህ ጥቅሙ በማሰማራት ላይ እንጂ ስልጠና ብቻ አይደለም።
ስልታዊ ተጽእኖ
ግልጽ ውሳኔዎች
ግልጽ ቴክኒካዊ የይገባኛል ጥያቄዎችን ከገበያ ቋንቋ እንዲለዩ ያግዝዎታል።
ወጪ እና በጀት
ገንዘብን ወይም ጊዜን ከማጥፋትዎ በፊት የተሻሉ የትግበራ ጥያቄዎችን መጠየቅ ይችላሉ።
ቡድን እና የስራ ፍሰት
የጋራ ግንዛቤ ያላቸው ቡድኖች የተሻለ ምርት፣ ፖሊሲ እና የመማር ውሳኔዎችን ያደርጋሉ።
የወደፊቱ የቺንቺላ ስሌት-የተሻለ ስልጠና
እንደ ላማ 3 ያሉ ዘመናዊ ሞዴሎች ሆን ብለው ከቺንቺላ 20-ቶከኖች-በፓራሜትር ሬሾን በጣም ገፍተው፣ አነስተኛ ሞዴሎችን በትሪሊዮን የሚቆጠሩ ቶከኖች በማሰልጠን ግምቱን ርካሽ ለማድረግ፣ የላቀ የሥልጠና ስሌትን በመቀበል። ጥሩ መረጃ እየጠበበ ሲሄድ፣ ፍላጎት እየጨመረ በመጣው ዘመን፣ ሰው ሠራሽ መረጃ እና የጥራት ማጣሪያ ላይ ነው። ቺንቺላ የማመሳከሪያ ነጥብ ሆና ቆይታለች፣ ነገር ግን ምርጡ እየጨመረ የሚሄደው በአንድ ጊዜ የስልጠና በጀት ላይ ብቻ ሳይሆን በህይወት ዘመን ዋጋ ላይ ነው።
የእውነተኛ-ዓለም አተገባበር
ለተመሳሳይ በጀት በጣም ትንሽ በሆነ መረጃ ላይ ከ30-ቢሊየን ሞዴል ይልቅ ባለ 7-ቢሊየን ፓራሜትር ሞዴል በ2 ትሪሊየን ቶከኖች ላይ ለማሰልጠን መምረጥ።
ባለ 10-ቢሊየን መለኪያ ሞዴል በግምት 200 ቢሊየን ቶከኖች ከፍተኛውን የስሌት ጣፋጭ ቦታ ለመምታት እንደሚፈልግ መገመት።
ከትልቅ ተቀናቃኝ ጥራት ጋር በማዛመድ የጥያቄ ዋጋ ወጪዎችን ለመቀነስ ትንሽ የተዘረጋ ሞዴል ማረጋገጥ።
ያለውን ሞዴል ኦዲት ማድረግ እና መደምደሙ ከሥልጠና በታች ነበር፣ ከዚያም ከመለኪያ ጭማሪ ይልቅ ረዘም ያለ የሥልጠና ሩጫ ማቀድ።
አደጋዎች እና የጥበቃ መንገዶች
የተለያዩ ቡድኖች ተመሳሳይ ቃል በተለያየ መንገድ ሊጠቀሙ ይችላሉ፣ ስለዚህ ወሰንን ቀደም ብለው ይግለጹ።
የገሃዱ ዓለም አፈጻጸም ያልተስተካከለ ሆኖ ሳለ ማመሳከሪያዎች ጠንካራ ሊመስሉ ይችላሉ።
የውሂብ ጥራት እና የግምገማ እቅዶችን ችላ ማለት ብዙውን ጊዜ ደካማ ውጤቶችን ይፈጥራል.
የትግበራ ፍኖተ ካርታ
የሚፈልጉትን ውጤት በግልፅ ቋንቋ ትርጉም ይጀምሩ።
ከመሞከርዎ በፊት አንድ የስኬት መለኪያ እና አንድ የውድቀት ሁኔታ ይምረጡ።
አንድ ትንሽ አብራሪ በተወካይ ውሂብ ያሂዱ እንጂ የተጣራ ማሳያ ስብስብ አይደለም።
የቺንቺላ ስሌት-የተሻለ ስልጠና የሚረዳበት እና ቀላል ዘዴዎች የተሻሉበት ሰነድ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
የሙከራ ጊዜ ስልጠና
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is Chinchilla Compute-Optimal Training?
ቺንቺላ የ2022 DeepMind ግኝት ሲሆን አብዛኞቹ ትላልቅ የቋንቋ ሞዴሎች በመጥፎ የሰለጠኑ ናቸው፡ ለተወሰነ ስሌት በጀት ትልቅ ሞዴል መገንባት ብቻ ሳይሆን መለኪያዎችን እና መረጃዎችን በእኩል መጠን ማመጣጠን አለቦት። ኢንዱስትሪው የሞዴሉን መጠን ከስልጠና መረጃ ጋር እንዴት እንደሚያመዛዝን በአዲስ መልክ ቀርጿል።
ለኮምፒዩተር-ምርጥ ስልጠና የቺንቺላ ታዋቂው የአውራ ጣት ህግ ምንድነው?
DeepMind ግቤቶችን እና ቶከኖችን በአንድ ልኬት በግምት 20 ቶከኖች ለአንድ ስሌት በጀት አንድ ላይ ማመጣጠን አለባቸው።
የ70ቢ-መለኪያ ቺንቺላ ከ280ቢ-መለኪያ ጎፈር ጋር እንዴት ተነጻጽሯል?
በተመሳሳዩ ስሌት የሰለጠነችው ቺንቺላ ትልቁን ጎፈር በአብዛኛዎቹ መመዘኛዎች አሸንፋለች።
የቺንቺላ ወረቀት ስለቀደሙት ትላልቅ ሞዴሎች ምን ቁልፍ ችግር አሳይቷል?
እንደ GPT-3 እና Gopher ያሉ ሞዴሎች ከስልጠና ውሂባቸው አንፃር በጣም ትልቅ ስለነበሩ አፈፃፀሙን ሳይታወቅ ቀርቷል።
የቺንቺላ ህግ ለ10-ቢሊየን መለኪያ ሞዴል ምን ያህል ቶከኖች ይጠቁማል?
በ 20 ቶከኖች በአንድ መለኪያ፣ 10 ቢሊዮን መለኪያዎች ወደ 200 ቢሊዮን የሚጠጉ የሥልጠና ምልክቶችን ያመለክታሉ።
ከስልጠና ቅልጥፍና በተጨማሪ፣ ለምንድነው አነስ ያለ፣ በመረጃ የበለፀገ ሞዴል በስምሪት ውስጥ ማራኪ የሆነው?
ያነሱ መመዘኛዎች ዝቅተኛ የጥያቄ ስሌት ማለት ነው፣ ስለዚህ ሞዴሉ ጥቅም ላይ በዋለ ቁጥር የቁጠባ ውህድ ነው።