ግምታዊ ዲኮዲንግ ረቂቅ ሞዴሎች
ግምታዊ ዲኮዲንግ አንድ ትልቅ ሞዴል በአንድ ማለፊያ የሚያረጋግጡ በርካታ መጪ ምልክቶችን ለመገመት ትንሽ ፈጣን 'ረቂቅ' ሞዴል ይጠቀማል።
አጠቃላይ እይታ
It speeds up text generation 2-3x with no change to the output.
ጥልቅ ዳይቭ
ትላልቅ የቋንቋ ሞዴሎች ጽሑፍን በአንድ ጊዜ አንድ ምልክት ያመነጫሉ፣ እና እያንዳንዱ እርምጃ በቢሊዮኖች በሚቆጠሩ መመዘኛዎች ውስጥ ሙሉ በሙሉ ወደፊት ማለፍን ይፈልጋል - ዘገምተኛ እና ማህደረ ትውስታ-የተወሰነ። ግምታዊ ዲኮዲንግ ትልቁን 'ዒላማ' ሞዴል ከርካሽ 'ረቂቅ' ሞዴል ጋር በማጣመር ያጠቃዋል። ረቂቅ ሞዴሉ በፍጥነት ከ4-8 እጩ ቶከኖች አንድ ቁራጭ ያቀርባል። ትልቁ ሞዴል ሁሉንም በአንድ ትይዩ ወደፊት ማለፍ እና እያንዳንዳቸውን ይፈትሻል። ትልቁ ሞዴል ከሚያመርተው ጋር የሚዛመዱ ምልክቶች ተቀባይነት አላቸው; የመጀመሪያው አለመመጣጠን ተስተካክሎ የተቀረው ይጣላል. ብዙ ቶከኖችን በአንድ ጊዜ ማረጋገጥ አንድን ከማመንጨት ጋር ተመሳሳይ ስለሚሆን፣ ተቀባይነት ያላቸው ሩጫዎች ነጻ ናቸው። በወሳኝ ሁኔታ፣ የናሙና-ውድቅ እርምጃ የመጨረሻው ስርጭት ትልቁን ሞዴል ብቻውን ከማሄድ ጋር ተመሳሳይ መሆኑን ያረጋግጣል - የጥራት ኪሳራ ከሌለ ፍጥነት።
ቴክኒካዊ ግንዛቤ
ዋናው ዘዴ የተሻሻለው ውድቅ-ናሙና ፈተና ነው። ለእያንዳንዱ የተነደፈ ቶከን፣ የታለመው ሞዴል ዕድል ከረቂቁ ሞዴል ጋር ይነጻጸራል። ዒላማው እኩል ወይም ከፍ ያለ ዕድል ከሰጠ, ምልክቱ ተቀባይነት አለው; ያለበለዚያ ከሬሾው ጋር እኩል በሆነ ዕድል ተቀባይነት አለው ፣ እና ውድቅ ሲደረግ የተስተካከለ ቶከን ከተስተካከለ ቀሪ ስርጭት ናሙና ይወሰዳል። ይህ ሂሳብ ውጤቱን በቀጥታ ከትልቅ ሞዴል ናሙና ጋር እኩል ያደርገዋል።
ስልታዊ ተጽእኖ
ፍጥነት እና ልኬት
የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።
መድረስ እና መድረስ
በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።
ግልጽ ውሳኔዎች
አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።
የወደፊቱ የግምታዊ ዲኮዲንግ ረቂቅ ሞዴሎች
ረቂቅ ሞዴሎች እንደ vLLM እና TensorRT-LLM ባሉ የመረጃ አገልጋዮች ውስጥ መደበኛ መሠረተ ልማት እንዲሆኑ ይጠብቁ። የራስ-ግምት ልዩነቶች (ሜዱሳ፣ ኢኤግኤል) ቀላል ክብደት ያላቸውን ትንበያ ራሶች በመጨመር የተለየውን ረቂቅ ሞዴል ሙሉ በሙሉ ይጥላሉ፣ እና በዛፍ ላይ የተመሰረተ ረቂቅ ብዙ የእጩዎችን ቀጣይነት በአንድ ጊዜ ያረጋግጣል። የዐውደ-ጽሑፍ መስኮቶች እያደጉ ሲሄዱ እና ወጪዎችን ማገልገል ሲጀምሩ፣ ብልህ፣ ሞዴል-ተዛማጅ ረቂቆች እና ሃርድዌርን የሚያውቅ ማረጋገጫ የቅበላ ዋጋን እና ውጤቱን ከፍ ያደርገዋል።
የእውነተኛ-ዓለም አተገባበር
Anthropic፣ OpenAI እና Google በሚሊዮን የሚቆጠሩ ተጠቃሚዎችን በሚያገለግሉ የውይይት ረዳቶች ላይ መዘግየትን እና የአገልግሎት ወጪን ለመቀነስ ግምታዊ ዲኮዲንግ ይጠቀማሉ።
vLLM እና NVIDIA TensorRT-LLM መርከብ አብሮገነብ ግምታዊ ዲኮዲንግ በራስ አስተናጋጆች የላማ ወይም ሚስትራል ማሰማራትን ያፋጥኑታል።
የ7B ረቂቅ ሞዴልን ከ70B ዒላማ ጋር (ለምሳሌ የላማ-3 ቤተሰብ) በአንድ ጂፒዩ ላይ በግምት በሴኮንድ በእጥፍ ማጣመር።
የኮድ ማጠናቀቂያ መሳሪያዎች በትልቁ ሞዴል የሚያረጋግጠውን የቦይለር ሰሌዳ ለማቅረብ ትንሽ ረቂቅ ሞዴልን ይጠቀማሉ፣ ይህም የአስተያየት ጥቆማዎችን በአርታዒው ውስጥ በቀላሉ ያስቀምጣል።
አደጋዎች እና የጥበቃ መንገዶች
የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።
ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።
የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።
የትግበራ ፍኖተ ካርታ
ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።
ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።
ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።
የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding Draft Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
ለኮድ ሞዴሎች ግምታዊ አርትዖቶች
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is Speculative Decoding Draft Models?
ግምታዊ ዲኮዲንግ አንድ ትልቅ ሞዴል በአንድ ማለፊያ የሚያረጋግጡ በርካታ መጪ ምልክቶችን ለመገመት ትንሽ ፈጣን 'ረቂቅ' ሞዴል ይጠቀማል። በውጤቱ ላይ ምንም ለውጥ ሳይኖር 2-3x የጽሑፍ ማመንጨትን ያፋጥናል።
በግምታዊ ዲኮዲንግ ውስጥ የ'ረቂቅ' ሞዴል ዋና ሚና ምንድነው?
ትንሹ ረቂቅ ሞዴል መጪ ቶከኖችን በርካሽ ይገምታል፣ ይህም ትልቁ የዒላማ ሞዴል በአንድ ትይዩ ማለፊያ ይፈትሻል።
ብዙ የተነደፉ ቶከኖችን በአንድ ጊዜ ማረጋገጥ ለምን ጊዜ ይቆጥባል?
ትውልድ የማስታወስ ችሎታ ያለው ነው; በአንድ ጥቅል ማለፊያ ውስጥ ብዙ ቶከኖችን መፈተሽ የአንድ እርምጃ ያህል ርካሽ ነው፣ ስለዚህ ተቀባይነት ያላቸው ሩጫዎች ነጻ ናቸው።
የታለመው ሞዴል ውድቅ ካደረገው የመጀመሪያው ምልክት በኋላ የተነደፉት ቶከኖች ምን ይሆናሉ?
እስከ መጀመሪያው አለመግባባት ድረስ መቀበል ይቀጥላል; ማስመሰያው ተስተካክሏል እና ሁሉም ተከታይ የተነደፉ ቶከኖች ይጣላሉ።
ግምታዊ ዲኮዲንግ የውጤት ጥራት አለመበላሸቱን እንዴት ያረጋግጣል?
የተሻሻለው ውድቅ-ናሙና ሙከራ የመጨረሻውን የማስመሰያ ስርጭት በቀጥታ ከታለመው ሞዴል ናሙና ጋር እንደሚዛመድ ዋስትና ይሰጣል።
ከእነዚህ ውስጥ የተለየ ረቂቅ ሞዴልን የሚያስወግድ 'የራስ ግምት' አካሄድ የትኛው ነው?
Medusa እና EAGLE ቀላል ክብደት ያላቸውን ተጨማሪ ትንበያዎች ወደ ዋናው ሞዴል በማከል የራሱን የወደፊት ቶከኖች ማዘጋጀት ይችላል።