ንዑስ ቃል ማስመሰያ
የንዑስ ቃል ማስመሰያ ጽሑፍን ከቃላቶች ያነሱ ነገር ግን ከቁምፊዎች የበለጠ ወደ አሃዶች ይከፍላል፣ እንደ 'ቶከን' እና 'ization'።
አጠቃላይ እይታ
It is the standard way modern language models turn text into the discrete IDs they actually process, balancing vocabulary size against meaning.
ጥልቅ ዳይቭ
ቃላት ለመዘርዘር በጣም ብዙ ናቸው (መዝገበ-ቃላት በጣም ትልቅ እና ብርቅዬ ቃላትን ያመልጣሉ) ነጠላ ቁምፊዎች ትንሽ ትርጉም ያላቸው እና ቅደም ተከተሎችን በጣም ረጅም ያደርጋሉ። የንዑስ ቃል ማስመሰያ ማስታረቅ ነው፡ ተደጋጋሚ ቃላትን ሙሉ በሙሉ ይይዛል ነገር ግን ብርቅዬ ወይም ውስብስብ ቃላትን ወደ ትርጉም ቁርጥራጮች ይሰብራል። 'ደስታ ማጣት' 'አንድ'፣ 'ደስታ'፣ 'መሆን' ሊሆን ይችላል። ዋናዎቹ ስልተ ቀመሮች ባይት-ጥንድ ኢንኮዲንግ (በጂፒቲ ጥቅም ላይ የዋለ)፣ WordPiece (በ BERT ጥቅም ላይ የዋለ) እና ዩኒግራም/አረፍተ ነገር (በT5 እና በብዙ ቋንቋ ተናጋሪ ሞዴሎች ጥቅም ላይ የዋለ) ያካትታሉ። ይህ አካሄድ የማይታዩ ቃላትን በሚያምር ሁኔታ ያስተናግዳል፣ ቁርጥራጮቹን በተዛማጅ ቃላት ያካፍላል ('ተጫወት'፣ 'ተጫወተ'፣ 'ተጫወተ') እና ማንኛውንም ቋንቋ ይደግፋል። እያንዳንዱ ቁርጥራጭ ካርታ ወደ ኢንቲጀር መታወቂያ፣ እና እነዚህ መታወቂያዎች የአምሳያው የመክተት ንብርብር ወደ ቬክተር የሚለወጡ ናቸው።
ቴክኒካዊ ግንዛቤ
የተለያዩ ስልተ ቀመሮች ንዑስ ቃላትን በተለየ መንገድ ይመርጣሉ፡ BPE ተደጋጋሚ ጥንዶችን ከታች ወደ ላይ ያዋህዳል፣ WordPiece ውህዶችን ይመርጣል ይህም የኮርፐስ እድልን ይጨምራል፣ እና ዩኒግራም በትልቁ መዝገበ-ቃላት ይጀምራል እና እድልን የሚጎዱ ምልክቶችን ይቆርጣል። WordPiece የቃላት-ውስጥ ቁርጥራጮችን በ'##' ቅድመ ቅጥያ ምልክት ያደርጋል፣ ሴንትንስ ፒይስ ክፍተቶችን እንደ ልዩ ምልክት ስለሚመለከት ክፍት ቦታ ለሌላቸው ቋንቋዎች ተስማሚ በሆነ ነጭ ቦታ ላይ ሳይከፋፈል በቀጥታ በጥሬ ጽሑፍ ላይ ይሰራል።
ስልታዊ ተጽእኖ
ፍጥነት እና ልኬት
የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።
መድረስ እና መድረስ
በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።
ግልጽ ውሳኔዎች
አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።
የንዑስ ቃል ማስመሰያ የወደፊት
የንዑስ ቃል ማስመሰያ ፈጣን እና የታመቀ ስለሆነ የበላይ ሆኖ ይቆያል፣ ነገር ግን ድክመቶቹ፣ በሂሳብ፣ በኮድ እና ብርቅዬ ስክሪፕቶች፣ እና በቋንቋዎች ላይ ያልተስተካከሉ የማስመሰያ ወጪዎች፣ ጥናቶችን ወደ ባይት ደረጃ እና ከቶከን-ነጻ ሞዴሎች እየመሩ ነው። የእንግሊዝኛ ያልሆነ ጽሑፍ በአንድ ዓረፍተ ነገር በብዙ ምልክቶች እንዳይቀጣ የበለጠ ብልህ፣ ምናልባትም የተማሩ ወይም የሚለምደዉ ማስመሰያዎችን እና የተሻለ የብዙ ቋንቋ ፍትሃዊነትን ይጠብቁ።
የእውነተኛ-ዓለም አተገባበር
BERT የመጀመሪያዎቹን ቃላት እንደገና ለመገንባት እንደ '##ing' ያሉ ቀጣይ ክፍሎችን ምልክት በማድረግ የWordPiece ማስመሰያ ይጠቀማል።
T5 እና ብዙ ባለብዙ ቋንቋ ሞዴሎች እንደ ጃፓንኛ ያሉ ባዶ ቋንቋዎችን በቀጥታ የሚያስተናግደውን SentencePiece ይጠቀማሉ።
የውይይት ሞዴሎች ባልታወቀ ቃል ላይ ከመሳሳት ይልቅ ያልተለመደ ቴክኒካዊ ቃል ወደ ታዋቂ ቁርጥራጮች ይከፋፍሏቸዋል።
Tokenizers በ'ሩጫ'፣ 'ሩጫ' እና 'ሯጭ' ላይ ንዑስ ቃላትን ይጋራሉ፣ ይህም ሞዴሉ ሞርፎሎጂን በብቃት እንዲያጠቃልል ያስችለዋል።
አደጋዎች እና የጥበቃ መንገዶች
የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።
ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።
የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።
የትግበራ ፍኖተ ካርታ
ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።
ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።
ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።
የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Subword Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
የአረፍተ ነገር ቁራጭ ማስመሰያ
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is Subword Tokenization?
የንዑስ ቃል ማስመሰያ ጽሑፍን ከቃላቶች ያነሱ ነገር ግን ከቁምፊዎች የበለጠ ወደ አሃዶች ይከፍላል፣ እንደ 'ቶከን' እና 'ization'። የዘመናዊ ቋንቋ ሞዴሎች ጽሑፍን ወደ ሚሠሩት ልዩ መታወቂያዎች የሚቀይሩበት መደበኛ መንገድ ነው፣ የቃላት መጠንን ከትርጉም ጋር በማመጣጠን።
ሙሉ ቃላትን ከመጠቀም ጋር ሲነፃፀር ንዑስ ቃል ማስመሰያ ምን ችግር ይፈታል?
የሙሉ ቃል መዝገበ-ቃላት በጣም ግዙፍ ናቸው እና አሁንም ብርቅዬ ቃላትን ያመልጣሉ; ንዑስ ቃላቶች የማይታወቁ ቃላትን ለማስተዳደር እና በጸጋ የተከፋፈሉ ቃላትን ያቆያሉ።
ከእነዚህ ውስጥ በ BERT ጥቅም ላይ የሚውለው የንዑስ ቃል ማስመሰያ ስልተ-ቀመር የትኛው ነው?
BERT የስልጠና ኮርፐስ እድልን የሚጨምሩትን ውህዶችን የሚመርጥ WordPieceን ይጠቀማል።
WordPiece በተለምዶ አንድን ቃል የሚቀጥል ቁራጭ እንዴት ምልክት ያደርጋል?
WordPiece የቃላት-ውስጥ ንኡስ ቃላትን በ'##' ቅድመ ቅጥያ ያደርጋል፣ ስለዚህ 'መጫወት' 'play' እና '##ing' ይሆናል።
የአረፍተ ነገር ቁራጭ ለምን እንደ ጃፓንኛ ላሉ ቋንቋዎች ተስማሚ የሆነው?
SentencePiece በጥሬ ጽሑፍ ላይ ይሰራል እና ክፍተቶችን እንደ ልዩ ምልክት ያስቀምጣል፣ ስለዚህ በቃላት መካከል ያለ ክፍተቶች እንኳን ይሰራል።
ሞዴሉን ከመድረሱ በፊት እያንዳንዱ የንዑስ ቃል ቁርጥራጭ በመጨረሻ ምን ይገለጻል?
እያንዳንዱ ንዑስ ቃላቶች የኢንቲጀር መታወቂያ ተሰጥቷቸዋል፣ ይህም የመክተት ንብርብር ሞዴሉ ወደሚሰራው ቬክተርነት ይቀየራል።