የቴክኒክ መመሪያ

PagedAttention እና vLLM

PagedAttention የአንድ ቋንቋ ሞዴል ትኩረት መሸጎጫ ከአንድ ትልቅ ተጓዳኝ ቁራጭ ይልቅ እንደገና ጥቅም ላይ በሚውሉ ትንንሽ ብሎኮች ውስጥ የሚያከማች የማህደረ ትውስታ አስተዳደር ቴክኒክ ነው።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.

ጥልቅ ዳይቭ

የቋንቋ ሞዴል ጽሑፍ ሲያመነጭ፣ ለሚያየው እያንዳንዱ ማስመሰያ 'KV cache' (ቁልፍ እና እሴት ቬክተር) ያስቀምጣል። በተለምዶ እያንዳንዱ ጥያቄ ቅደም ተከተሎች ሲያጥሩ ወይም ርዝመታቸው ሲለያይ ከፍተኛ መጠን በማባከን አንድ ትልቅ የጂፒዩ ማህደረ ትውስታ መጠን ያለው ንጣፍ ይይዛል። PagedAttention፣ ከዩሲ በርክሌይ በ2023 vLLM ወረቀት ላይ አስተዋውቋል፣ የቨርቹዋል ሚሞሪ ፓጂንግ ሃሳብን ከኦፕሬቲንግ ሲስተሞች ወስዷል፡ የ KV መሸጎጫውን በየትኛውም ቦታ በማስታወሻ ውስጥ ሊኖሩ እና በፍላጎት ሊመደቡ ወደ ሚችሉ ቋሚ መጠን ብሎኮች ይከፍላቸዋል። የመፈለጊያ ሠንጠረዥ አመክንዮአዊ ማስመሰያ ቦታዎችን ወደ አካላዊ ብሎኮች ያዘጋጃል። ይህ የማህደረ ትውስታ መበታተንን ያስወግዳል እና ብሎኮች እንዲጋሩ ያስችላቸዋል፣ ለምሳሌ ከተመሳሳዩ መጠየቂያ ውጤቶች ውስጥ።

ቴክኒካዊ ግንዛቤ

የKV መሸጎጫ ወደ ቋሚ መጠን ገፆች የተከፈለ ነው፣ እያንዳንዱም ለተወሰኑ ቶከኖች ቁልፎችን እና እሴቶችን ይይዛል። በየቅደም ተከተላቸው ብሎክ ሰንጠረዡ አመክንዮአዊ አቀማመጦችን ወደ አካላዊ ገጽ ቦታዎች ያዘጋጃል፣ ስለዚህ የተከታታይ መሸጎጫ ተከታታይ መሆን የለበትም። ተመሳሳይ ቅድመ-ቅጥያዎች (የተጋራ የስርዓት መጠየቂያ ወይም የጨረር ፍለጋ ቅርንጫፎች) ወደ ተመሳሳዩ አካላዊ ገፆች በቅጂ-ላይ-ፃፍ ሊጠቁሙ ስለሚችሉ፣ ማህደረ ትውስታ ከተባዛ ይልቅ እንደገና ጥቅም ላይ ይውላል፣ ቆሻሻን ከ60% በላይ ወደ ጥቂት በመቶ ይቀንሳል።

ስልታዊ ተጽእኖ

ወጪ እና በጀት

የስነ-ህንፃ ውሳኔዎች ለዓመታት አፈጻጸምን እና የሥራ ማስኬጃ ወጪዎችን ያንቀሳቅሳሉ.

ግልጽ ውሳኔዎች

የቴክኒክ ትምህርት ቡድኖች አዲሱን ብቻ ሳይሆን ትክክለኛውን ቁልል እንዲመርጡ ይረዳል።

የጥራት ቁጥጥር

የተሻሉ የምህንድስና ምርጫዎች በምርት ውስጥ አስተማማኝነት ክስተቶችን ይቀንሳሉ.

የ PagedAttention እና vLLM የወደፊት

vLLM ነባሪ የክፍት ምንጭ የማጣቀሻ የጀርባ አጥንት ሆኗል፣ እና PagedAttention ሀሳቦች አሁን በአብዛኛዎቹ የአገልግሎት ቁልል ላይ ይታያሉ። ጠለቅ ያለ ቅድመ ቅጥያ መሸጎጫ (የተሸጎጡ የስርዓት ጥያቄዎችን በተጠቃሚዎች ላይ እንደገና መጠቀም)፣ የተከፋፈለ ቅድመ-ሙላ እና በተለየ ማሽኖች ላይ ኮድ መፍታት፣ የበለጠ ብልህ የማስወጣት ፖሊሲዎች እና ከቁጥራዊ እና ግምታዊ መፍታት ጋር ጥብቅ ውህደት ይጠብቁ። የአውድ መስኮቶች ወደ ሚሊዮኖች የሚቆጠሩ ቶከኖች እያደጉ ሲሄዱ፣ ቀልጣፋ ገጽ ያለው የKV አስተዳደር አገልግሎቱን በተመጣጣኝ ዋጋ ለማቆየት ይበልጥ ማዕከላዊ ይሆናል።

የእውነተኛ-ዓለም አተገባበር

vLLM ከአንድ ጂፒዩ ከፍተኛ መጠን ያለው የውይይት ተጠቃሚ የሚያደርግበት ክፍት ምንጭ LLM ኤፒአይን ማስተናገድ

በቅድመ ቅጥያ መሸጎጫ በኩል ረጅም የስርዓት መጠየቂያ ማጋራት አንድ ጊዜ እንጂ ተደጋጋሚ አይደለም

የጨረር ፍለጋን ማስኬድ ወይም ለጋራ መጠየቂያው KV ብሎኮችን የሚጋሩ በርካታ ናሙና ማጠናቀቂያዎች በቅጂ ላይ መጻፍ

አቅራቢው በተመሳሳይ ሃርድዌር ላይ ተጨማሪ በአንድ ጊዜ ክፍለ ጊዜዎችን ማሸግ እንዲችል የጂፒዩ ማህደረ ትውስታ ቆሻሻን ከመከፋፈል መቁረጥ

አደጋዎች እና የጥበቃ መንገዶች

አንድ ቤንችማርክን ማሳደግ ሰፋ ያሉ የስርዓት ድክመቶችን ሊደብቅ ይችላል።

የመሠረተ ልማት እና የጥገና ወጪዎች ብዙ ጊዜ ዝቅተኛ ናቸው.

ስርዓቶች ይበልጥ ውስብስብ ሲሆኑ የደህንነት እና የታዛቢነት ክፍተቶች ሊያድጉ ይችላሉ።

የትግበራ ፍኖተ ካርታ

1

ከመተግበሩ በፊት የቆይታ፣ የጥራት እና የወጪ ግቦችን ይግለጹ።

2

ቤንችማርክ በእውነተኛ ጭነት እና የውሂብ ሁኔታዎች።

3

ለስህተቶች፣ ተንሸራታች እና የተጠቃሚ ተጽእኖ የመሳሪያ ክትትል።

4

ከመጠኑ በፊት የመመለሻ እና የአደጋ ምላሽ መንገዶችን ያዘጋጁ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PagedAttention and vLLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is PagedAttention and vLLM?

PagedAttention የአንድ ቋንቋ ሞዴል ትኩረት መሸጎጫ ከአንድ ትልቅ ተጓዳኝ ቁራጭ ይልቅ እንደገና ጥቅም ላይ በሚውሉ ትንንሽ ብሎኮች ውስጥ የሚያከማች የማህደረ ትውስታ አስተዳደር ቴክኒክ ነው። አንድ ጂፒዩ ምን ያህል ጥያቄዎችን ማስተናገድ እንደሚችል በሚያስደንቅ ሁኔታ የሚጨምር vLLM የሆነውን ክፍት ምንጭ የሚያገለግል ሞተርን ያበረታታል።

ጽሑፍ በሚፈጠርበት ጊዜ 'KV cache' ምን ያከማቻል?

የKV መሸጎጫ ለእያንዳንዱ የቅድሚያ ማስመሰያ ቁልፍ እና ዋጋ ያላቸውን ቬክተሮች ይይዛል፣ ይህም ሞዴሉ እያንዳንዱን እርምጃ እንደገና ሳያሰላ ወደ ሙሉ አውድ እንዲከታተል ያስችለዋል።

Paged ትኩረትን ያነሳሳው የትኛው የስርዓተ ክወና ፅንሰ-ሀሳብ ነው?

PagedAttention ቨርቹዋል ሚሞሪ ፔጅ ይበደራል፡ የKV cache በየቦታው ሊኖሩ በሚችሉ ቋሚ መጠን ገፆች ተከፍሎ በብሎክ ሠንጠረዥ ተዘጋጅቷል።

በባህላዊ የKV መሸጎጫ ምደባ ላይ PagedAttention የሚፈታው የትኛውን ችግር ነው?

ለከፍተኛው ርዝመት መጠን በጥያቄ አንድ ትልቅ ተከታታይ ንጣፍ ማስቀመጥ ከፍተኛ መጠን ያለው የጂፒዩ ማህደረ ትውስታን አባክኗል። ፔጂንግ በፍላጎት ትናንሽ ብሎኮችን ይመድባል ፣ ቆሻሻን ይቀንሳል።

PagedAttention እንዴት ነው ብዙ ውፅዓቶች ለጋራ መጠየቂያ ማህደረ ትውስታን እንዲያጋሩ የሚፈቅደው?

ተመሳሳይ ቅድመ ቅጥያዎች (የተጋሩ መጠየቂያዎች ወይም የጨረር ፍለጋ ቅርንጫፎች) ተመሳሳይ አካላዊ KV ገጾችን ይጠቅሳሉ፣ ቅርንጫፍ ሲለያይ ብቻ ይገለበጣሉ።

vLLM እና PagedAttention መጀመሪያ የተገነባው የት ነበር?

vLLM እና PagedAttention Algorithm ከዩሲ በርክሌይ በ2023 ወረቀት ወጥተው በፍጥነት በሰፊው ጥቅም ላይ የዋለ የክፍት ምንጭ አገልግሎት ሞተር ሆነዋል።