የቋንቋ AI መመሪያ

ለዐውድ ማራዘሚያ የአቋም መጠላለፍ

የአቀማመጥ ኢንተርፖሌሽን (PI) የቋንቋ ሞዴል ጥቅም ላይ የሚውለውን አውድ መስኮት ከስልጠናው ርዝማኔ በላይ በመዘርጋት የአቀማመጥ ኢንዴክሶችን ከቦታ ቦታ ከማስፋት ይልቅ የሚዘረጋ ዘዴ ነው።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It lets a model trained on, say, 2K or 4K tokens handle 32K or more with only light fine-tuning.

ጥልቅ ዳይቭ

አብዛኛዎቹ ዘመናዊ ኤል.ኤል.ኤም.ኤዎች በጥያቄ እና በቁልፍ ቬክተሮች ላይ የሚተገበሩ የማዞሪያ ማዕዘኖች ሆነው የሚያገለግሉ የ rotary positional embddings (RoPE) ይጠቀማሉ። በቀላሉ ረዣዥም ቅደም ተከተሎችን የምትመገቡ ከሆነ፣ ሞዴሉ ያልሰለጠነባቸውን ቦታዎች እና የማዞሪያ ማዕዘኖች ያያል፣ እና አፈጻጸም ወድቋል ምክንያቱም ትኩረት ከክልል ውጪ ለሆኑ ድግግሞሾች ጥሩ ያልሆነ። የአቀማመጥ ኢንተርፖሌሽን ኤክስትራክሽንን ያስወግዳል፡ ከርዝመት L እስከ L' ለመራዘም እያንዳንዱን የቦታ መረጃ ጠቋሚ በፋክታር L'/L ይከፋፍላል፣ አዲሱን ክልል ወደ ሰለጠነ ክፍተት በመጭመቅ። ሞዴሉ አሁን በስርጭት ላይ ያሉ ማዕዘኖችን ብቻ ነው የሚያየው፣ ልክ በይበልጥ ጥቅጥቅ ያለ ቦታ። አጭር ቅኝት (ብዙውን ጊዜ ከመቶ እስከ አንድ ሺህ ደረጃዎች) ከጥሩ ክፍተት ጋር እንዲላመድ ያስችለዋል፣ ይህም በትንሽ የቅድመ ስልጠና ወጪ የተረጋጋ የረጅም ጊዜ አውድ ባህሪን ይሰጣል።

ቴክኒካዊ ግንዛቤ

RoPE የልኬት ጥንዶችን በድግግሞሽ ያሽከረክራል። PI ቦታውን m ወደ m/s s = L'/L ያስተካክላል፣ ስለዚህ የማዞሪያ ማዕዘኖች ከመጠን በላይ ከመጨመር ይልቅ በሰለጠኑት ክልል ውስጥ ይቆያሉ። እንደ NTK-aware scaling እና YaRN ያሉ የድግግሞሽ ግንዛቤ ያላቸው ተለዋጮች ወደ ፊት ይሄዳሉ፡ ዝቅተኛ ድግግሞሾችን ይቀንሳሉ እና ከፍተኛ ድግግሞሾችን የበለጠ (ወይም በሞገድ ርዝመት ይገናኛሉ)፣ ዝቅተኛ ድግግሞሽ የረዥም ርቀት ተደራሽነትን ሲያራዝሙ ከፍተኛ-ድግግሞሽ የአካባቢ ዝርዝሮችን ይጠብቃሉ።

ስልታዊ ተጽእኖ

ፍጥነት እና ልኬት

የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።

መድረስ እና መድረስ

በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።

ግልጽ ውሳኔዎች

አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።

ለዐውድ ማራዘሚያ የአቋም መጠላለፍ የወደፊት ዕጣ

የአውድ ቅጥያ በፍጥነት እየሄደ ነው። እንደ NTK-aware RoPE scaling፣YaRN እና ተለዋዋጭ/ረጅም-RoPE ያሉ ዘዴዎች አሁን መስኮቶችን ወደ መቶ ሺዎች አልፎ ተርፎም በሚሊዮን የሚቆጠሩ ቶከኖች ይገፋሉ፣ አንዳንዴም ትንሽ ወይም ምንም ጥሩ ማስተካከያ ሳይደረግላቸው። እነዚህ የማስኬጃ ዘዴዎች ከተቀላጠፈ ትኩረት እና ከKV-cache compression ጋር እንዲጣመሩ እና በሞዴል ውቅሮች ውስጥ መደበኛ ኖቶች እንዲሆኑ ይጠብቁ። ሙሉው መስኮት ትክክለኝነትን ከፍ በማድረግ ላይ ምርምር ይቀጥላል ረጅም አውዶች በስም የሚደገፉ ሳይሆኑ በትክክል ጥቅም ላይ የሚውሉ ናቸው።

የእውነተኛ-ዓለም አተገባበር

ረጅም ሰነዶችን በአጭሩ ከተስተካከለ በኋላ ለማጠቃለል በ4K የሰለጠነ የኤልኤምኤ ሞዴል ወደ 32K አውድ ማራዘም።

አንድ ሙሉ ኮድ ቤዝ ወይም ትልቅ ህጋዊ ውል ወደ ፋይል-አቋራጭ ጥያቄ መልስ በመጫን ላይ።

በትንሹ ወይም ያለ ተጨማሪ ስልጠና አውድ ለማራዘም NTK-aware ወይም YaRN ልኬትን መጠቀም።

የROPE አቀማመጦችን በማጣቀሻ ጊዜ እንደገና በማስፋት ረጅም የውይይት ታሪኮችን ያለምንም መቆራረጥ ማገልገል።

አደጋዎች እና የጥበቃ መንገዶች

የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።

ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።

የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።

የትግበራ ፍኖተ ካርታ

1

ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።

2

ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።

3

ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።

4

የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Position Interpolation for Context Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

የYaRN እና የአውድ ርዝመት ማራዘሚያ

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is Position Interpolation for Context Extension?

የአቀማመጥ ኢንተርፖሌሽን (PI) የቋንቋ ሞዴል ጥቅም ላይ የሚውለውን አውድ መስኮት ከስልጠናው ርዝማኔ በላይ በመዘርጋት የአቀማመጥ ኢንዴክሶችን ከቦታ ቦታ ከማስፋት ይልቅ የሚዘረጋ ዘዴ ነው። በ2K ወይም 4K ቶከኖች ላይ የሰለጠነ ሞዴል 32K ወይም ከዚያ በላይ በብርሃን ማስተካከያ ብቻ እንዲይዝ ያስችለዋል።

የPosition Interpolation ዋና ሀሳብ ምንድን ነው?

PI የአቀማመጥ ኢንዴክሶችን በኤክስቴንሽን ፋክተር ይከፋፍላል፣ ሞዴሉ አስቀድሞ የተማረውን የውስጠ-ስርጭት ክልል ውስጥ መልሶ በማዘጋጀት ይረዝማል።

የPosition Interpolation ከየትኛው የአቀማመጥ ኢንኮዲንግ እቅድ ጋር በጣም የተያያዘ ነው?

PI በRoPE ላይ ለተመሰረቱ ሞዴሎች ታዋቂ ነበር፣ ይህም የማዞሪያ ማዕዘኖቹን በማስተካከል በሰለጠኑ ድግግሞሾች ውስጥ እንዲቆዩ አድርጓል።

ለምንድነው የዋህነት ወደ ረጅም አውድ መውጣት ወደ ውድቀት የሚሄደው?

ረዣዥም ቅደም ተከተሎችን መመገብ ሞዴሉን ከክልል ውጪ ላልሰለጠነ ማዕዘኖች ያጋልጠዋል፣ ይህም ትኩረት እና አፈጻጸም በከፍተኛ ሁኔታ እንዲቀንስ ያደርጋል።

የአውድ ርዝማኔን ከL ወደ L' ማራዘም ከሆነ፣ መሰረታዊ PI በቦታ m ላይ የሚሠራው ምን ዓይነት ዳግም ማመጣጠን ነው?

PI ካርታዎች ከ m እስከ m በፋክተር s = L'/L ተከፋፍሎ ረጅሙን ክልል ወደ መጀመሪያው የሰለጠነ ክፍተት በመጨመቅ።

NTK-Aware scaling እና YaRN ግልጽ በሆነ የአቋም መጠላለፍ ላይ እንዴት ይሻሻላሉ?

እነዚህ ዘዴዎች ዝቅተኛ እና ከፍተኛ ድግግሞሾችን በተለየ መንገድ ያስተካክላሉ፣ አሁንም ረጅም አውድ ላይ እየደረሱ ጥሩ ጥራት ያለው የአካባቢያዊ አቀማመጥ ዝርዝሮችን ይይዛሉ።