WordPiece Tokenization
WordPiece BERT እና ብዙ Google ሞዴሎችን የሚያበረታታ ንዑስ ቃል ማስመሰያ ስልተ-ቀመር ሲሆን ቃላቶችን እንደገና ጥቅም ላይ በሚውሉ ቁርጥራጮች በመከፋፈል ሞዴሉ ማንኛውንም ጽሑፍ በቋሚ የቃላት ዝርዝር ማስተናገድ ይችላል።
አጠቃላይ እይታ
It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.
ጥልቅ ዳይቭ
WordPiece ከሙሉ ቃላት ወይም ነጠላ ቁምፊዎች ይልቅ የንዑስ ቃል ክፍሎችን መዝገበ ቃላት ይገነባል። ከግለሰባዊ ገፀ-ባህሪያት ጀምሮ፣ የስልጠና ኮርፐስን እድል የሚጨምሩትን ጥንድ ምልክቶች በስግብግብነት ያዋህዳል፣ ወደ ዒላማው የቃላት መጠን እስኪደርስ ድረስ ይደግማል (BERT ወደ 30,000 ቶከኖች ይጠቀማል)። በማጣቀሻነት፣ በስስት ከግራ ወደ ቀኝ ያሳያል፣ በቃላት ዝርዝሩ ውስጥ ካለው ረጅሙ ንዑስ ቃል ጋር ይዛመዳል፣ ከዚያም በቀሪው ላይ ይቀጥላል። በአንድ ቃል ውስጥ ያሉ ቀጣይ ክፍሎች በ'##' ቅድመ ቅጥያ ምልክት ተደርጎባቸዋል፣ ስለዚህ 'መጫወት' 'ጨዋታ' + '##ing' ይሆናል። ይህ ከቃላት ውጭ ያለውን ችግር ይፈታል፡- ብርቅዬ ወይም የማይታዩ ቃላቶች በቀላሉ ወደ ሚታወቁ ቁርጥራጮች ይበሰብሳሉ፣ ካስፈለገም ወደ ነጠላ ገጸ-ባህሪያት ይደርሳሉ፣ የተለመዱ ቃላቶች ደግሞ ለውጤታማነት ነጠላ ቶከን ሆነው ይቆያሉ።
ቴክኒካዊ ግንዛቤ
WordPiece በውህደት መስፈርት ከባይት-ጥንድ ኢንኮዲንግ ይለያል። BPE በጣም በተደጋጋሚ የተጠጋውን ጥንድ ያዋህዳል; WordPiece የሥልጠና-መረጃ እድሎችን ከፍ የሚያደርገውን ጥንድ ያዋህዳል፣በግምት የጋራ ድግግሞሾቹ ከክፍሎቹ ድግግሞሾች ምርት የሚበልጠውን ጥንድ ይመርጣል። የ'## ምልክት ማድረጊያ የቃላት-የመጀመሪያ ክፍሎችን ከቀጣይነት ይለያል፣ይህም ማስመሰያ ሰጭው ወደ ጽሑፍ ሲመለስ በማያሻማ መልኩ የቃላት ድንበሮችን እንደገና እንዲገነባ ያስችለዋል።
ስልታዊ ተጽእኖ
ፍጥነት እና ልኬት
የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።
መድረስ እና መድረስ
በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።
ግልጽ ውሳኔዎች
አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።
የWordPiece Tokenization የወደፊት ጊዜ
አዳዲስ ትላልቅ የቋንቋ ሞዴሎች በባይት ደረጃ BPE (ጂፒቲ ቤተሰብ) ወይም የአረፍተ ነገር ዩኒግራም ሞዴሎችን ይመርጣሉ፣ ቋንቋን-ተኮር ቅድመ ዝግጅትን የሚያስወግዱ እና ማንኛውንም የዩኒኮድ ግቤት የሚቆጣጠሩት። WordPiece በ BERT-የተገኙ ኢንኮድሮች ውስጥ አሁንም ለፍለጋ እና ለምደባ በሰፊው ተሰራጭቷል። ከቶኬናይዘር-ነጻ ባይት እና ቁምፊ ሞዴሎች ላይ ምርምር ጎን ለጎን በምርት NLP ውስጥ ቀጣይ አጠቃቀምን ይጠብቁ ፣ ይህም በመጨረሻ በቋሚ ንዑስ ቃላት መዝገበ-ቃላት ላይ መተማመንን ሊቀንስ ይችላል።
የእውነተኛ-ዓለም አተገባበር
BERT በGoogle ፍለጋ ውስጥ ያሉ የፍለጋ መጠይቆችን ያሳያል፣የማይታወቁ ቃላትን ወደ ንዑስ ቃላቶች ይሰብራል ስለዚህ ሞዴሉ አሁንም ከተዛማጅ ገጾች ጋር ማዛመድ ይችላል።
ማቀፍ Face's BertTokenizer ጥሬ ጽሁፍን ወደ BERT ለስሜት ትንተና እና ለተሰየመ አካል እውቅና ለመስጠት WordPieceን ይጠቀማል።
ባለብዙ ቋንቋ BERT በ100+ ቋንቋዎች የጋራ የWordPiece መዝገበ ቃላት ይጠቀማል፣ ይህም ቁርጥራጮች በተዛማጅ ስክሪፕቶች ላይ እንደገና ጥቅም ላይ እንዲውሉ ያስችላቸዋል።
DistilBERT እና ክሊኒካል/ባዮሜዲካል BERT ልዩነቶች የ WordPieceን ይወርሳሉ፣ እንደ 'pneumonoconiosis' ያሉ ብርቅዬ የህክምና ቃላትን ወደ ሚታወቁ ክፍሎች በመከፋፈል ይያዛሉ።
አደጋዎች እና የጥበቃ መንገዶች
የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።
ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።
የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።
የትግበራ ፍኖተ ካርታ
ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።
ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።
ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።
የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WordPiece Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
ንዑስ ቃል ማስመሰያ
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is WordPiece Tokenization?
WordPiece BERT እና ብዙ Google ሞዴሎችን የሚያበረታታ ንዑስ ቃል ማስመሰያ ስልተ-ቀመር ሲሆን ቃላቶችን እንደገና ጥቅም ላይ በሚውሉ ቁርጥራጮች በመከፋፈል ሞዴሉ ማንኛውንም ጽሑፍ በቋሚ የቃላት ዝርዝር ማስተናገድ ይችላል። ለዚህም ነው 'ደስታን' አይቶ የማያውቅ ሞዴል 'un'፣ '##ደስተኛ' እና '##መሆን' በማንበብ ሊረዳው የሚችለው።
በWordPiece ውፅዓት ውስጥ የ'##' ቅድመ ቅጥያ ምን ያሳያል?
WordPiece ንዑስ ቃላትን በ'##' ምልክት ያደርጋል፣ ስለዚህ 'መጫወት' 'play' + '##ing' ይሆናል፣ ይህም ዲኮደር የቃላትን ድንበሮች እንደገና እንዲገነባ ያስችለዋል።
በመጀመሪያው BERT የWordPiece መዝገበ ቃላት ምን ያህል ትልቅ ነው?
BERT ሽፋንን ከሠንጠረዡ መጠን ጋር በማመጣጠን ወደ 30,000 የሚጠጉ ንኡስ ቃላት ክፍሎችን የWordPiece መዝገበ ቃላት ይጠቀማል።
የWordPiece ውህደት መስፈርት ከመደበኛ ባይት-ጥንድ ኢንኮዲንግ እንዴት ይለያል?
BPE በጣም ተደጋጋሚውን ተጓዳኝ ጥንድ ያዋህዳል፣ WordPiece ደግሞ የኮርፐስ እድልን የሚጨምሩትን ጥንዶች በማዋሃድ የጋራ ድግግሞሽ ከክፍላቸው ምርት የሚበልጥ ጥንዶችን ይደግፋል።
WordPiece በስልጠና ወቅት ታይቶ የማያውቅ ቃል እንዴት ይቆጣጠራል?
የማይታዩ ቃላቶች ወደ ሚታወቁ ረጅሙ ተዛማጅ የሆኑ ንዑስ ቃላቶች ተከፋፍለዋል፣ ወደ ነጠላ ገጸ-ባህሪያት ይመለሳሉ፣ ይህም ከቃላት ውጭ ያለውን ችግር ይፈታል።
በግምገማ ጊዜ፣ WordPiece አንድን ቃል እንዴት እንደሚከፋፈል እንዴት ይመርጣል?
WordPiece በስግብግብነት ይመሰክራል፣ አሁን ካለው ቦታ ጀምሮ ካለው ረጅሙ የቃላት ግቤት ጋር ይዛመዳል፣ ከዚያም በቀሪው ላይ ይደግማል።