ብልጭታ ትኩረት
ፍላሽ አቴንሽን ግዙፉን ትኩረት ማትሪክስ ወደ ማህደረ ትውስታ ፍጥነት ሳይጽፍ በTransformers ውስጥ ያለውን የትኩረት ደረጃ ለማስላት ብልህ መንገድ ነው።
አጠቃላይ እይታ
It makes long-context models far faster and more memory-efficient without changing their math.
ጥልቅ ዳይቭ
መደበኛ ትኩረት እያንዳንዱን ቶከን ከሌላው ማስመሰያ ጋር ያወዳድራል፣ N-by-N የውጤት ማትሪክስ ከቅደም ተከተል ርዝመት ጋር በአራት ያድጋል። በዋህነት፣ ያ ማትሪክስ የሚፃፈው እና የሚነበበው ከጂፒዩ ከፍተኛ ባንድዊድዝ ማህደረ ትውስታ (ኤች.ቢ.ኤም.ኤም) ነው፣ እና ያ ማባዛት ሳይሆን - ትክክለኛው ማነቆ ነው። ፍላሽ ትኩረት፣ በTri Dao እና ባልደረቦች በ2022 አስተዋወቀ፣ ስሌቱን እንደገና ያደራጃል ስለዚህም ማትሪክስ ሙሉ በሙሉ እንዳይከማች። መጠይቆችን፣ ቁልፎችን እና እሴቶችን በፍጥነት በቺፕ SRAM ውስጥ በሚመጥኑ ትንንሽ ሰቆች ውስጥ ያስኬዳል፣ ከፊል ውጤቶችን ያሰላል እና በመስመር ላይ ሩጫ-softmax ተንኮል በመጠቀም ይሰፋል። ውጤቱ በሂሳብ ከተራ ትኩረት ጋር ተመሳሳይ ነው ነገር ግን መስመራዊ ማህደረ ትውስታን ይጠቀማል እና ብዙ ጊዜ በፍጥነት ይሰራል, በተለይም በረጅም ቅደም ተከተሎች.
ቴክኒካዊ ግንዛቤ
ዋናው ብልሃት ንጣፍ እና የመስመር ላይ softmax ነው። Softmax በመደበኛነት መለያውን ለማስላት አጠቃላይ የነጥብ መስመሮችን ይፈልጋል፣ ነገር ግን ፍላሽ ትኩረት እያንዳንዱን ንጣፍ በሚለቀቅበት ጊዜ ከፍተኛውን የሩጫ እና የሩጫ ድምር ይይዛል። መካከለኛ ውጤቶች በSRAM ውስጥ ስለሚቆዩ (ከHBM የክብደት መጠን በፍጥነት)፣ ስልተ ቀመሩ IO-aware ነው፡ ከጥሬ የሂሳብ ስራዎች ይልቅ የማስታወሻ ንባብ እና መፃፍ ይቀንሳል።
ስልታዊ ተጽእኖ
ወጪ እና በጀት
የስነ-ህንፃ ውሳኔዎች ለዓመታት አፈጻጸምን እና የሥራ ማስኬጃ ወጪዎችን ያንቀሳቅሳሉ.
ግልጽ ውሳኔዎች
የቴክኒክ ትምህርት ቡድኖች አዲሱን ብቻ ሳይሆን ትክክለኛውን ቁልል እንዲመርጡ ይረዳል።
የጥራት ቁጥጥር
የተሻሉ የምህንድስና ምርጫዎች በምርት ውስጥ አስተማማኝነት ክስተቶችን ይቀንሳሉ.
የፍላሽ ትኩረት የወደፊት
ፍላሽ ትኩረት እንደነባሪ የግንባታ ብሎክ ሆኗል፣ FlashAttention-2 እና FlashAttention-3 እንደ H100 ካሉ አዳዲስ ጂፒዩዎች የስራ ክፍፍልን በማሻሻል እና ዝቅተኛ ትክክለኛነትን የFP8 መንገዶችን በመጠቀም ተጨማሪ ውጤቶችን በመጭመቅ ነው። ከሃርድዌር ጋር ቀጣይነት ያለው የጋራ ዲዛይን፣ ወደ ስልጠና እና የማጣቀሻ ማዕቀፎች ጥብቅ ውህደት፣ እና ለትንንሽ፣ ተንሸራታች-መስኮት እና በጣም ረጅም-አውድ ትኩረት የተስተካከሉ ልዩነቶችን ይጠብቁ። የአውድ መስኮቶች ወደ ሚሊዮኖች የሚቆጠሩ ቶከኖች ሲዘረጉ፣ አይኦ የሚያውቁ አስኳሎች እንደዚህ ያሉ ትውስታዎችን እና ፍጥነትን ተግባራዊ ለማድረግ አስፈላጊ ናቸው።
የእውነተኛ-ዓለም አተገባበር
እንደ ላማ እና ጂፒቲ-ክፍል ያሉ ትልልቅ የቋንቋ ሞዴሎችን ከረጅም አውድ መስኮቶች ጋር በአነስተኛ የማስታወሻ ዋጋ ማሰልጠን።
ረጅም መጠየቂያ መጀመሪያ የሚነበብበትን የቅድመ-ሙላ ደረጃን በማፋጠን የውይይት ረዳቶችን በፍጥነት ማገልገል።
ረጅም ተከታታይ ትኩረትን በአንድ ጂፒዩ ላይ ተግባራዊ በማድረግ ሙሉውን መጽሐፍት ወይም ኮድ ቤዝ የሚያስገባ የሰነድ-ትንታኔ መሳሪያዎችን ማንቃት።
ከፍተኛ ጥራት ያላቸው ግብዓቶች በጣም ረጅም የማስመሰያ ቅደም ተከተሎችን የሚፈጥሩበት ቪዥን እና ኦዲዮ ትራንስፎርመሮችን ማጎልበት።
አደጋዎች እና የጥበቃ መንገዶች
አንድ ቤንችማርክን ማሳደግ ሰፋ ያሉ የስርዓት ድክመቶችን ሊደብቅ ይችላል።
የመሠረተ ልማት እና የጥገና ወጪዎች ብዙ ጊዜ ዝቅተኛ ናቸው.
ስርዓቶች ይበልጥ ውስብስብ ሲሆኑ የደህንነት እና የታዛቢነት ክፍተቶች ሊያድጉ ይችላሉ።
የትግበራ ፍኖተ ካርታ
ከመተግበሩ በፊት የቆይታ፣ የጥራት እና የወጪ ግቦችን ይግለጹ።
ቤንችማርክ በእውነተኛ ጭነት እና የውሂብ ሁኔታዎች።
ለስህተቶች፣ ተንሸራታች እና የተጠቃሚ ተጽእኖ የመሳሪያ ክትትል።
ከመጠኑ በፊት የመመለሻ እና የአደጋ ምላሽ መንገዶችን ያዘጋጁ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Flash Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
ትኩረት መስጠት እና የጭንቅላት መቁረጥ
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is Flash Attention?
ፍላሽ አቴንሽን ግዙፉን ትኩረት ማትሪክስ ወደ ማህደረ ትውስታ ፍጥነት ሳይጽፍ በTransformers ውስጥ ያለውን የትኩረት ደረጃ ለማስላት ብልህ መንገድ ነው። የረዥም አውድ ሞዴሎችን ሂሳብ ሳይቀይሩ በጣም ፈጣን እና የበለጠ ማህደረ ትውስታ ቆጣቢ ያደርጋቸዋል።
ፍላሽ ትኩረት ያነጣጠረው ዋናው ማነቆ ምንድነው?
የፍላሽ ትኩረት IO-ያውቀዋል፡ በፈጣን በቺፕ SRAM እና በዝግተኛ ባለ ከፍተኛ ባንድዊድዝ ማህደረ ትውስታ መካከል የተዘበራረቀውን መረጃ ይቀንሳል፣ ይህም ከአርቲሜቲክ እራሱ ይልቅ ትክክለኛው ማነቆ ነው።
የፍላሽ ትኩረት እንዴት ሙሉውን N-by-N ትኩረት ማትሪክስ እንዳይከማች ያደርጋል?
ስሌቱን ሰድሯል ስለዚህ እያንዳንዱ ብሎክ በ HBM ውስጥ ያለውን ማትሪክስ ሙሉ በሙሉ ሳያካትት ፣ በማስላት እና ከፊል ውፅዓቶችን በማሰባሰብ በፍጥነት SRAM ውስጥ እንዲገጣጠም ያደርጋል።
ፍላሽ ትኩረት ሙሉውን ረድፍ በአንድ ጊዜ ሳያየው softmax በትክክል እንዲሰላ የሚያደርገው የትኛው ዘዴ ነው?
የመስመር ላይ ሶፍትማክስ ሰቆች በዥረት በሚለቀቅበት ጊዜ ከፍተኛውን የሩጫ እና የሩጫ መጠን ይይዛል፣የቀደሙት ከፊል ውጽዓቶችን እንደገና በማስተካከል የመጨረሻው መደበኛነት ትክክለኛ ይሆናል።
ለምንድነው ፍላሽ ትኩረት በረጅም ቅደም ተከተሎች የሚረዳው?
የዋህ ትኩረት ማትሪክስ ልክ እንደ N-squared የማህደረ ትውስታ መጠን ይመዝናል፣ ስለዚህ ሙሉ ማከማቻውን መቆጠብ ቅደም ተከተሎች ሲረዝሙ በትክክል ትልቁን ቁጠባ ያስገኛል።
የፍላሽ ትኩረትን 'IO-aware' ንድፍ ለመቀነስ ቅድሚያ የሚሰጠው ምንድን ነው?
IO-aware ማለት ስልተ ቀመር የተነደፈው በማህደረ ትውስታ ተዋረድ ውስጥ መረጃን ለማንቀሳቀስ በሚወጣው ወጪ ሲሆን ይህም ከሂሳብ ስራዎች ይልቅ የHBM ትራፊክን ይቀንሳል።