FlashAttention
FlashAttention ni algoriti yenye ufanisi wa kumbukumbu ambayo hukusanya umakini sawa na vibadilishaji umeme vya kawaida lakini bila kuandika matrix kuu ya umakini ili kupunguza kasi ya kumbukumbu ya GPU.
Muhtasari
It made long-context training and inference dramatically faster and cheaper.
Dive ya kina
Umakini wa kawaida hukokotoa alama kwa kila jozi ya tokeni, na kutengeneza matrix ya N-by-N. Kwa mfuatano wa tokeni 4,000 hiyo ni alama milioni 16, na matrix lazima iandikwe na kusomwa kutoka kwenye kumbukumbu ya data-bandwidth ya juu ya GPU (HBM). Trafiki hiyo ya kumbukumbu, sio hesabu, ndio kizuizi halisi. FlashAttention, iliyoletwa na Tri Dao na wenzake mwaka wa 2022, inarekebisha hesabu ili matrix isiweze kutekelezwa kikamilifu. Huchakata mfuatano katika vigae vinavyotoshea kwenye SRAM ndogo ya GPU, yenye kasi ya juu zaidi kwenye chip, ikitengeneza softmax kwa kasi kadri inavyoendelea. Matokeo yake yanafanana kimahesabu na umakini wa kawaida lakini hutumia kumbukumbu ndogo sana na huendesha haraka mara kadhaa, kuwezesha madirisha marefu zaidi ya muktadha.
Ufahamu wa Kiufundi
Ujanja ni 'softmax ya mtandaoni' iliyojumuishwa na kuweka tiles. FlashAttention hupakia vizuizi vidogo vya hoja, funguo na thamani kwenye SRAM, hukusanya matokeo ya umakinifu kiasi, na huondoa hesabu zinazoendeshwa kadiri vizuizi vipya vinapowasili ili urekebishaji wa softmax usalie sawa bila kuona alama zote mara moja. Kwa sababu haihifadhi matrix kamili ya N-na-N katika HBM, mizani ya kumbukumbu kwa mstari badala ya quadratically, na punje inaunganishwa katika operesheni moja ya GPU ili kupunguza usomaji wa polepole wa kumbukumbu na kuandika.
Athari za kimkakati
Kasi na kiwango
Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.
Kufikia na kufikia
Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.
Maamuzi ya wazi zaidi
Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.
Mustakabali wa FlashAttention
FlashAttention imekuwa msingi wa ujenzi. FlashAttention-2 iliyoboreshwa ya kugawa kazi kwa GPU, na FlashAttention-3 hutumia vipengele vipya vya maunzi vya Hopper kama vile ulandanishi na FP8 ya usahihi wa chini. Tarajia uundaji pamoja unaoendelea na chip, ujumuishaji wa kina katika seva za uelekezaji kwa hati ndefu, na vibadala vilivyowekwa kwa uangalifu mdogo au wa kuteleza. Madirisha ya muktadha yanaposogea kuelekea mamilioni ya tokeni, kokwa zinazofahamu IO kama hii husalia kuwa muhimu ili kuweka gharama za mafunzo na uwasilishaji kudhibitiwa.
Utekelezaji wa Ulimwengu Halisi
Kufunza miundo mikubwa ya lugha kama vile mifumo ya Llama na GPT kwa haraka na kwa gharama ya chini ya GPU
Inahudumia wasaidizi wa gumzo wa muktadha mrefu ambao humeza vitabu vizima au misingi ya msimbo bila kukosa kumbukumbu
Kuharakisha mabomba ya muhtasari wa hati ambayo huchakata makumi ya maelfu ya tokeni mara moja
Maono ya nguvu na transfoma ya aina nyingi ambapo mlolongo mrefu wa viraka vya picha hufanya umakini kuwa ghali
Hatari & Walinzi
Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.
Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.
Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.
Ramani ya Utekelezaji
Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.
Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.
Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.
Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FlashAttention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Upachikaji wa Nafasi ya Rotary
Maswali yanayoulizwa mara kwa mara
What is FlashAttention?
FlashAttention ni algoriti yenye ufanisi wa kumbukumbu ambayo hukusanya umakini sawa na vibadilishaji umeme vya kawaida lakini bila kuandika matrix kuu ya umakini ili kupunguza kasi ya kumbukumbu ya GPU. Ilifanya mafunzo ya muktadha mrefu na uelekezaji haraka na kwa bei nafuu.
Je, ni shabaha gani kuu za FlashAttention katika umakini wa kawaida?
Uangalifu wa kawaida hufungamana na kumbukumbu: kuhamisha matrix kubwa ya N-na-N kwenda na kutoka kwa kumbukumbu ya kipimo data cha juu hutawala wakati, si hesabu yenyewe.
Matokeo ya FlashAttention yanalinganishwaje na umakini wa kawaida?
FlashAttention hujumuisha maadili sawa ya umakini; inapanga tu hesabu ili kuzuia kutokeza matrix kamili.
FlashAttention hutumia kumbukumbu gani ya GPU kwa kuchakata data kwenye vigae?
FlashAttention hupakia vigae vidogo kwenye SRAM yenye kasi ya juu ya GPU ya GPU, ikiweka kazi nzito karibu na vitengo vya kukokotoa.
Ni mbinu gani huruhusu FlashAttention kukokotoa softmax bila kuona alama zote mara moja?
softmax ya mtandaoni hudumisha viwango vya juu na hesabu, na kuongeza matokeo kwa sehemu kadiri vigae vipya vinavyofika ili urekebishaji wa mwisho uwe sahihi.
FlashAttention-3 ilichukua faida gani haswa?
FlashAttention-3 iliundwa kwa pamoja na Hopper GPU za kisasa, kwa kutumia utekelezaji usiolingana na FP8 ya usahihi wa chini kwa kasi zaidi.