መስመራዊ ትኩረት እና ፈጻሚ ከርነሎች
የመስመራዊ ትኩረት በTransformers ውስጥ ያለውን ባለአራት ለስላሳ ማክስ ትኩረትን በቅደም ተከተል ርዝመት በመስመር በሚመዘን የሂሳብ ዘዴ ይተካል።
አጠቃላይ እይታ
Performer is a landmark method that approximates softmax using random feature kernels, making very long sequences computationally affordable.
ጥልቅ ዳይቭ
መደበኛ ትራንስፎርመር ትኩረት በእያንዳንዱ ጥንድ ማስመሰያዎች መካከል ያለውን ነጥብ ያሰላል፣ ጊዜ እና የማስታወስ ወጪ የሚጠይቀው በቅደም ተከተል ርዝመት ካሬ (O(n^2)) ነው። መስመራዊ ትኩረት ስሌቱን እንደገና ይጽፋል ስለዚህ ወጪው በመስመር (O(n)) ብቻ ያድጋል። ዋናው ሃሳብ፡ softmax ትኩረት softmax(QK^T)V ነው፣ነገር ግን softmax በ kernel feature map phi ብትተካ phi(Q)(phi(K)^T V) ታገኛለህ። ማትሪክስ ማባዛት ተጓዳኝ ስለሆነ በመጀመሪያ phi(K)^T V ያሰላሉ (ትንሽ d-by-d ማትሪክስ)፣ ግዙፉን n-by-n የውጤት ማትሪክስ ሙሉ በሙሉ በማስወገድ። ፈፃሚው፣ ከGoogle በ2020፣ የከርነሉን ግምት ያላዳላ እና የተረጋጋ እንዲሆን የሚያደርግ FAVOR+ (ፈጣን ትኩረት በአዎንታዊ orthogonal Random ባህሪያት) በመጠቀም የእውነተኛ softmax ታማኝ ግምታዊ ያደርገዋል።
ቴክኒካዊ ግንዛቤ
የአከናዋኝ FAVOR+ አወንታዊ የዘፈቀደ ባህሪያትን በመጠቀም የሶፍትማክስ ከርነል ኤክስፕ(q.k)ን ይገመግማል፡ መጠይቆችን እና ቁልፎችን በዘፈቀደ Gaussian ግምቶች ተጠቅልሎ ገላጭ በሆነ መልኩ ይቀርፃል፣ አሉታዊ ያልሆኑ ትኩረት ክብደቶችን ዋስትና ይሰጣል እና የቀድሞ ገምጋሚዎች የቁጥር አለመረጋጋትን ያስወግዳል። orthogonal የዘፈቀደ ባህሪያትን መጠቀም ልዩነትን ይቀንሳል። በወሳኝ መልኩ፣ n-by-n ትኩረት ማትሪክስ በፍፁም አልተሰራም፣ ስለዚህ የማስታወስ ችሎታ ከኳድራቲክ ወደ መስመራዊ ይወርዳል፣ ይህም በአስር ሺዎች የሚቆጠሩ ቶከኖች ቅደም ተከተሎችን ያስችላል።
ስልታዊ ተጽእኖ
ወጪ እና በጀት
የስነ-ህንፃ ውሳኔዎች ለዓመታት አፈጻጸምን እና የሥራ ማስኬጃ ወጪዎችን ያንቀሳቅሳሉ.
ግልጽ ውሳኔዎች
የቴክኒክ ትምህርት ቡድኖች አዲሱን ብቻ ሳይሆን ትክክለኛውን ቁልል እንዲመርጡ ይረዳል።
የጥራት ቁጥጥር
የተሻሉ የምህንድስና ምርጫዎች በምርት ውስጥ አስተማማኝነት ክስተቶችን ይቀንሳሉ.
የመስመር ላይ ትኩረት እና የአፈፃፀም ከርነሎች የወደፊት ዕጣ
ንፁህ የመስመራዊ ትኩረት ብዙውን ጊዜ በጥራት ላይ softmax ይከታተላል፣ ስለዚህ ሜዳው በተዳቀሉ ላይ ይሰበሰባል፡ የግዛት-ስፔስ ሞዴሎች (Mamba)፣ የታሸገ የመስመር ትኩረት እና ጥቂት የሙሉ ትኩረት ንጣፎችን ከብዙ መስመራዊዎች ጋር የሚያቀላቅሉ አርክቴክቸር። የአውድ መስኮቶች ወደ ሚሊዮኖች የሚቆጠሩ ቶከኖች ሲገፉ፣ መስመራዊ እና ንዑስ-ኳድራቲክ ስልቶች ለዋጋ ይበልጥ ማራኪ እየሆኑ መጥተዋል፣ እና ተደጋጋሚ የሆነ የመስመር ትኩረት ለተቀላጠፈ የዥረት መረጃ እና በመሳሪያ ላይ ሞዴሎች እንደገና እየተጎበኘ ነው።
የእውነተኛ-ዓለም አተገባበር
ሙሉ ኳድራቲክ ትኩረት የጂፒዩ ማህደረ ትውስታን የሚያሟጥጥ ረጅም የጂኖሚክ ወይም የፕሮቲን ቅደም ተከተሎችን ማካሄድ
የሰነድ-ደረጃ ማጠቃለያ በጣም ረጅም ሪፖርቶች ሳይቆራረጡ፣ የአፈጻጸም አይነት የጀርባ አጥንት በመጠቀም
ቅደም ተከተሎች በአስር ሺዎች የሚቆጠሩ ደረጃዎችን የሚሸፍኑበት ቀልጣፋ የረጅም ጊዜ ኦዲዮ ወይም የጊዜ ተከታታይ ሞዴሊንግ
አንዳንድ softmax ንብርብሮችን በመስመራዊ ትኩረት ተለዋጮች በመተካት በረጅም አውድ የውይይት ሞዴሎች ውስጥ የማመዛዘን ወጪን መቀነስ።
አደጋዎች እና የጥበቃ መንገዶች
አንድ ቤንችማርክን ማሳደግ ሰፋ ያሉ የስርዓት ድክመቶችን ሊደብቅ ይችላል።
የመሠረተ ልማት እና የጥገና ወጪዎች ብዙ ጊዜ ዝቅተኛ ናቸው.
ስርዓቶች ይበልጥ ውስብስብ ሲሆኑ የደህንነት እና የታዛቢነት ክፍተቶች ሊያድጉ ይችላሉ።
የትግበራ ፍኖተ ካርታ
ከመተግበሩ በፊት የቆይታ፣ የጥራት እና የወጪ ግቦችን ይግለጹ።
ቤንችማርክ በእውነተኛ ጭነት እና የውሂብ ሁኔታዎች።
ለስህተቶች፣ ተንሸራታች እና የተጠቃሚ ተጽእኖ የመሳሪያ ክትትል።
ከመጠኑ በፊት የመመለሻ እና የአደጋ ምላሽ መንገዶችን ያዘጋጁ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Linear Attention and Performer Kernels quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
RWKV መስመራዊ ትኩረት
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is Linear Attention and Performer Kernels?
የመስመራዊ ትኩረት በTransformers ውስጥ ያለውን ባለአራት ለስላሳ ማክስ ትኩረትን በቅደም ተከተል ርዝመት በመስመር በሚመዘን የሂሳብ ዘዴ ይተካል። አከናዋኝ በዘፈቀደ ባህሪ ከርነሎች በመጠቀም softmax የሚጠግን በጣም ረጅም ቅደም ተከተሎችን በስሌት ተመጣጣኝ ያደርገዋል።
ለምንድነው መደበኛ የሶፍትሜክስ ትኩረት ከቅደም ተከተል ርዝመት ጋር ደካማ የሆነው?
Softmax ትኩረት እያንዳንዱን ጥንድ ቶከኖች በማነጻጸር n-በ-n የውጤት ማትሪክስ ይፈጥራል፣ ስለዚህ ወጪ እንደ O(n^2) ያድጋል።
መስመራዊ ትኩረት ከ n-by-n ማትሪክስ እንዲርቅ የሚያደርገው የትኛው የሂሳብ ንብረት ነው?
ማትሪክስ ማባዛት ተጓዳኝ ስለሆነ፣ በphi(Q) phi(K)^T ምትክ phi(K)^T V፣ ትንሽ d-by-d ማትሪክስ ማስላት ይችላሉ።
የ Performer's FAVOR+ አሰራር ምን ይገመታል?
FAVOR+ ሙሉውን የትኩረት ማትሪክስ ሳይፈጥር ሰፊውን የሶፍትማክስ ከርነል ለመገመት አወንታዊ orthogonal የዘፈቀደ ባህሪያትን ይጠቀማል።
ለምንድነው Performer ከቀደምት ትሪግኖሜትሪክ ይልቅ አወንታዊ የዘፈቀደ ባህሪያትን የሚጠቀመው?
አወንታዊ ባህሪያት የከርነል ግምቶች አሉታዊ እንዳልሆኑ ያስቀምጧቸዋል, ይህም ቀደም ሲል ኃጢአት/ኮስ ባህሪ ካርታዎችን ያበላሹትን አለመረጋጋት እና አሉታዊ እሴቶችን በማስወገድ.
በቅደም ተከተል ርዝመት n ውስጥ ያለው የአከናዋኝ-ቅጥ መስመራዊ ትኩረት ግምታዊ ውስብስብነት ምንድነው?
ስሌቱን እንደገና በማዘዝ እና n-by-n ማትሪክስ በፍፁም በመገንባት፣ የወጪ ሚዛኖች ከቅደም ተከተል ርዝመት ጋር በመስመር ነው።