የቋንቋ AI መመሪያ

ብልጭታ ትኩረት

ፍላሽ አቴንሽን ከመደበኛ ትራንስፎርመሮች ጋር አንድ አይነት ትኩረትን የሚያሰላ ማህደረ ትውስታ ቆጣቢ ስልተ-ቀመር ነው ነገር ግን የጂፒዩ ማህደረ ትውስታን ለማዘግየት ግዙፉን ትኩረት ማትሪክስ በጭራሽ ሳይፃፍ።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It made long-context training and inference dramatically faster and cheaper.

ጥልቅ ዳይቭ

መደበኛ ትኩረት ለእያንዳንዱ ጥንድ ማስመሰያ ነጥብ ያሰላል፣ N-by-N ማትሪክስ ይፈጥራል። ለ 4,000-ቶከን ቅደም ተከተል 16 ሚሊዮን ውጤቶች እና ማትሪክስ ከጂፒዩ ከፍተኛ ባንድዊድዝ ማህደረ ትውስታ (HBM) መፃፍ እና መመለስ አለበት። ያ የማስታወሻ ትራፊክ፣ ሂሳብ ሳይሆን፣ ትክክለኛው ማነቆ ነው። FlashAttention፣ በTri Dao እና ባልደረቦች በ2022 አስተዋውቋል፣ ስሌቱን እንደገና ያዋቅራል ስለዚህ ማትሪክስ ሙሉ በሙሉ እውን ሊሆን አይችልም። ቅደም ተከተሉን በጂፒዩ ጥቃቅን፣ እጅግ በጣም ፈጣን በቺፕ SRAM ውስጥ በሚመጥኑ ሰድሮች ውስጥ ያስኬዳል፣ ሲሄድም softmax እየጨመረ ነው። ውጤቱ በሂሳብ ደረጃ ከመደበኛ ትኩረት ጋር ተመሳሳይ ነው ነገር ግን በጣም ያነሰ ማህደረ ትውስታን ይጠቀማል እና ብዙ ጊዜ በፍጥነት ይሰራል፣ ይህም በጣም ረጅም የአውድ መስኮቶችን ያስችላል።

ቴክኒካዊ ግንዛቤ

ዘዴው 'የኦንላይን Softmax' ከቲሊንግ ጋር ተጣምሮ ነው። FlashAttention ትንንሽ ብሎኮችን መጠይቆችን፣ ቁልፎችን እና እሴቶችን ወደ SRAM ይጭናል፣ ከፊል ትኩረት ውጤቶችን ያሰላል፣ እና አዲስ ብሎኮች ሲመጡ የማስኬጃ ድምርን ያድሳል ስለዚህ የሶፍትማክስ መደበኛነት ሁሉንም ነጥቦች በአንድ ጊዜ ሳያይ ትክክል ይሆናል። ሙሉውን የN-by-N ማትሪክስ በHBM ውስጥ ፈጽሞ ስለማያከማች ማህደረ ትውስታ በአራት ሳይሆን በመስመራዊ ሚዛን ስለሚለካ እና ከርነሉ ወደ አንድ የጂፒዩ ኦፕሬሽን ተቀላቅሎ ቀርፋፋ የሚነበብ እና የሚፃፍ ማህደረ ትውስታን ለመቀነስ ነው።

ስልታዊ ተጽእኖ

ፍጥነት እና ልኬት

የቋንቋ የስራ ፍሰቶች ወጥነትን ሳያጠፉ በፍጥነት ሊንቀሳቀሱ ይችላሉ።

መድረስ እና መድረስ

በቋንቋዎች እና በመግባቢያ ዘይቤዎች ተደራሽነትን ያሰፋዋል።

ግልጽ ውሳኔዎች

አውቶሜሽን ድግግሞሹን ሲቆጣጠር ቡድኖች በፍርድ ላይ ብዙ ጊዜ ሊያጠፉ ይችላሉ።

የፍላሽ ትኩረት የወደፊት

FlashAttention ነባሪ የግንባታ እገዳ ሆኗል። FlashAttention-2 የተሻሻለ የጂፒዩ ሥራ ክፍፍል፣ እና FlashAttention-3 እንደ ያልተመሳሰለ እና ዝቅተኛ ትክክለኛነት FP8 ያሉ አዳዲስ የሆፐር ሃርድዌር ባህሪያትን ይጠቀማል። ከቺፕስ ጋር ቀጣይነት ያለው የጋራ ዲዛይን፣ ረጅም ሰነዶችን ወደ ኢንፈረንስ ሰርቨሮች ጥልቅ ውህደት እና ለተሳሳተ ወይም ተንሸራታች-መስኮት ትኩረት የተስተካከሉ አማራጮችን ይጠብቁ። አውድ መስኮቶች ወደ ሚሊዮኖች የሚቆጠሩ ቶከኖች ሲገፉ፣ እንደ አይኦ የሚያውቁ አስኳሎች ስልጠናን ለመጠበቅ እና ወጪዎችን ለመቆጣጠር አስፈላጊ እንደሆኑ ይቆያሉ።

የእውነተኛ-ዓለም አተገባበር

እንደ ላማ እና GPT-style ስርዓቶች ያሉ ትልልቅ የቋንቋ ሞዴሎችን በፍጥነት እና በአነስተኛ የጂፒዩ ወጪ ማሰልጠን

ማህደረ ትውስታ ሳያልቅ ሙሉ መጽሃፎችን ወይም ኮድ ቤዝ የሚያስገባ ረጅም አውድ የውይይት ረዳቶችን ማገልገል

በአንድ ጊዜ በአስር ሺዎች የሚቆጠሩ ቶከኖችን የሚያስኬዱ የሰነድ-ማጠቃለያ ቧንቧዎችን ማፋጠን

ረጅም ተከታታይ የምስል መጠገኛዎች ትኩረትን ውድ የሚያደርጉት ራዕይ እና መልቲሞዳል ትራንስፎርመሮች

አደጋዎች እና የጥበቃ መንገዶች

የተሳሳቱ እውነታዎች በጸጥታ ወደ ሪፖርቶች፣ የድጋፍ ፍሰቶች ወይም የምርምር ውጤቶችን ማስገባት ይችላሉ።

ፈጣን ትብነት በተመሳሳይ ጥያቄዎች ላይ የማይጣጣሙ ውጤቶችን ሊፈጥር ይችላል።

የመዳረሻ መቆጣጠሪያዎች ደካማ ከሆኑ ሚስጥራዊነት ያለው የጽሑፍ ውሂብ ሊጋለጥ ይችላል።

የትግበራ ፍኖተ ካርታ

1

ከመልቀቅዎ በፊት የውጤት ቅርጸትን፣ ድምጽን እና የጥራት ደረጃዎችን ይግለጹ።

2

ትክክለኛነት አስፈላጊ በሚሆንበት ጊዜ ሁሉ ከታመኑ ምንጮች ጋር ምላሾች።

3

ከፍተኛ ውጤት ለማግኘት የሰው የግምገማ ነጥብ አቆይ።

4

የውድቀት ንድፎችን ይከታተሉ እና ጥያቄዎችን ወይም የስራ ፍሰቶችን በመደበኛነት ያሠለጥኑ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FlashAttention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

ሮታሪ አቀማመጥ መክተቻዎች

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is FlashAttention?

ፍላሽ አቴንሽን ከመደበኛ ትራንስፎርመሮች ጋር አንድ አይነት ትኩረትን የሚያሰላ ማህደረ ትውስታ ቆጣቢ ስልተ-ቀመር ነው ነገር ግን የጂፒዩ ማህደረ ትውስታን ለማዘግየት ግዙፉን ትኩረት ማትሪክስ በጭራሽ ሳይፃፍ። የረጅም ጊዜ አውድ ስልጠና እና ግንዛቤ በሚያስደንቅ ፍጥነት እና ርካሽ አድርጓል።

በመደበኛ ትኩረት ላይ ዋናው የፍላሽ ትኩረት ኢላማዎች ምንድን ናቸው?

መደበኛ ትኩረት ከማህደረ ትውስታ ጋር የተቆራኘ ነው፡ ግዙፉን N-by-N ማትሪክስ ወደ ከፍተኛ ባንድዊድዝ ማህደረ ትውስታ መዘጋት ጊዜውን እንጂ አርቲሜቲክን አይገዛም።

የFlashAttention ውፅዓት ከመደበኛ ትኩረት ጋር እንዴት ይወዳደራል?

FlashAttention ትክክለኛ ተመሳሳይ ትኩረት እሴቶች ያሰላል; ሙሉ ማትሪክስ እንዳይሰራ ለማድረግ ስሌቱን እንደገና ያደራጃል.

ፍላሽ ትኩረት በሰቆች ውስጥ መረጃን በማዘጋጀት የትኛውን የጂፒዩ ማህደረ ትውስታ ይጠቀማል?

FlashAttention ትናንሽ ንጣፎችን ወደ ጂፒዩ ፈጣን በቺፕ SRAM ላይ ይጭናል፣ ይህም ከባድ ስራውን ወደ ስሌት አሃዶች እንዲጠጋ ያደርገዋል።

ፍላሽ አቴንሽን ሁሉንም ነጥቦች በአንድ ጊዜ ሳያይ softmax እንዲያሰላ የሚያደርገው የትኛው ዘዴ ነው?

የመስመር ላይ softmax ከፍተኛውን እና ድምርን ያቆያል፣ አዲስ ሰቆች ሲመጡ ከፊል ውጤቶችን እንደገና በማስፋት የመጨረሻው መደበኛነት ትክክል ነው።

FlashAttention-3 በተለይ የተጠቀመው ምንድን ነው?

FlashAttention-3 ያልተመሳሰለ አፈጻጸምን እና ዝቅተኛ ትክክለኛነትን FP8ን በመጠቀም ለቀጣይ ፍጥነት ከዘመናዊ ሆፐር ጂፒዩዎች ጋር በጋራ ተዘጋጅቷል።