ራዕይ ትራንስፎርመር
ቪዥን ትራንስፎርመሮች (ViTs) ChatGPTን ወደ ምስሎች የሚያንቀሳቅሰውን የትራንስፎርመር አርክቴክቸር ይተገብራሉ፣ ሥዕልን ከፒክሴል ፍርግርግ ይልቅ እንደ ተከታታዮች ያያሉ።
አጠቃላይ እይታ
ዘመናዊ የምስል ዕውቅና ለማግኘት ውዝግቦች እንደማይፈልጉ አረጋግጠዋል።
ጥልቅ ዳይቭ
ለአመታት፣ convolutional neural networks (CNNs) በምስል ላይ ትናንሽ ማጣሪያዎችን በመቃኘት የኮምፒውተር እይታን ተቆጣጠሩ። ከGoogle የ2020 ወረቀቱ 'አንድ ምስል 16x16 ቃላቶች አሉት' ይህንን ተቃውመዋል። እያንዳንዱ ጠጋኝ 'ቶከን' ይሆናል፣ ልክ በአረፍተ ነገር ውስጥ እንዳለ ቃል። ሞዴሉ እራስን ትኩረትን ይጠቀማል ስለዚህ እያንዳንዱ ጠጋኝ ከሌላው ፕላስተር ጋር በቀጥታ ይዛመዳል, የረጅም ርቀት ግንኙነቶችን በመያዝ ትንሽ ኮንቮሉሽን ማጣሪያ በአንድ እርምጃ ማየት አይችልም. የሚይዘው፡ ቪቲዎች በመረጃ የተራቡ ናቸው ምክንያቱም አብሮገነብ የሲኤንኤን ግምቶች ስለሌላቸው። እንደ JFT-300M ባሉ ግዙፍ የመረጃ ቋቶች የሰለጠኑ፣ ምርጡን ሲ ኤን ኤን አመሳስለው ወይም አሸንፈዋል፣ ዘመናዊ የእይታ ጥናትን አሻሽለዋል።
ቴክኒካዊ ግንዛቤ
ቪቲት ምስሉን ወደማይደራረቡ ጠጋዎች ይከፋፍላል፣ እያንዳንዱን መስመር ወደ መክተት በቀጥታ ፕሮጄክቶች ያደርጋል፣ እና የአቀማመጥ ኢንኮዲንግ በማከል ሞዴሉ እያንዳንዱ ጠጋኝ በመጀመሪያው ምስል የት እንደተቀመጠ ያውቃል። ልዩ መማር የሚችል 'ክፍል ቶከን' ተዘጋጅቷል፤ የመጨረሻው ውክልና ምደባን ያንቀሳቅሳል. የተደራረቡ የራስ ትኩረት ንጣፎች እያንዳንዱ ፕላች ከሌሎች መረጃዎችን እንዲመዘን ያስችለዋል፣ ይህም ከንብርብር አንድ አለምአቀፍ መቀበያ መስክ ይሰጣል። ትኩረት በአራት ደረጃ ከጥፍጣፎች ብዛት ጋር ስለሚዛመድ ከፍተኛ ጥራት ያላቸው ምስሎች ውድ ይሆናሉ፣ለዚህም የፕላስተር መጠን እና ቀልጣፋ የትኩረት ልዩነቶች አስፈላጊ ናቸው።
ስልታዊ ተጽእኖ
ፍጥነት እና ልኬት
ቪዥዋል AI የመመርመሪያ፣ የማወቅ እና የመለያ ስራዎችን በሚዛን መጠን በራስ ሰር ሊያደርግ ይችላል።
ምርጫዎችን ይገንቡ
የፈጠራ ቡድኖች በጥቂት የእጅ ክለሳዎች ጽንሰ-ሀሳቦችን በፍጥነት መተየብ ይችላሉ።
ቡድን እና የስራ ፍሰት
ክዋኔዎች ከዚህ ቀደም ለማስኬድ አስቸጋሪ የነበሩትን የምስል እና የቪዲዮ ምልክቶችን መጠቀም ይችላሉ።
የእይታ ትራንስፎርመር የወደፊት
ቪቲዎች እና ሲኤንኤን-ትራንስፎርመር ዲቃላዎች አሁን የእይታ ስርዓቶችን ኃይል ይሰጣሉ፣ እና አርክቴክቸር ምስሎችን ከጽሑፍ ጋር የሚያዋህዱ መልቲሞዳል ሞዴሎችን ይደግፋል፣ እንደ CLIP እና የዘመናዊ የእይታ ቋንቋ ረዳቶች። ለከፍተኛ ጥራት እና ለቪዲዮ ትኩረትን ርካሽ ለማድረግ ቀጣይ ስራን ይጠብቁ እና በራስ የሚተዳደር ቅድመ ስልጠና (እንደ ጭንብል-ምስል ሞዴሊንግ) ትልቅ መለያ የተደረገበትን-መረጃ የምግብ ፍላጎት የሚቀንስ። ስሌት ሲያድግ በ'ቋንቋ ሞዴል' እና 'vision model' መካከል ያለው መስመር እየደበዘዘ ይሄዳል፣ ትራንስፎርመሮች ልዩ ንድፎችን ከመለየት ይልቅ እንደ የጋራ የጀርባ አጥንት ሆነው ያገለግላሉ።
የእውነተኛ-ዓለም አተገባበር
የ _AIU_PROTECTED_11__ የትራንስፎርመር የጀርባ አጥንቶችን የወሰዱት የምስል ምደባ እና የፍለጋ ደረጃ ሲስተሞች ከቪቲ በኋላ ከ CNN ጋር መወዳደር ችለዋል
ፎቶዎች እና መግለጫ ጽሑፎች በጋራ ቦታ ላይ እንዲመሳሰሉ ቪቲትን የሚጠቀሙ CLIP እና ሌሎች የምስል-ጽሑፍ ሞዴሎች
በአካባቢያዊ ሸካራዎች ብቻ ሳይሆን በጠቅላላው ቅኝት ላይ ንድፎችን ለመለየት ViTsን በመጠቀም የሕክምና ኢሜጂንግ ምርምር
በጠቅላላው የእይታ መስክ ላይ ለትዕይንት ግንዛቤ የVT አይነት ትኩረትን የሚያጣምሩ የራስ መንዳት እና የሮቦቲክስ ግንዛቤ ቁልል
አደጋዎች እና የጥበቃ መንገዶች
የምስል መብቶች እና ፈቃድ ግልጽ ካልሆነ ህጋዊ አደጋዎች ሊሆኑ ይችላሉ።
የሞዴል አፈጻጸም በብርሃን፣ በስነ-ሕዝብ እና በአካባቢው ሊለያይ ይችላል።
የመተማመን ገደቦች ካልተቆጣጠሩ የውሸት አወንታዊ ነገሮች ላይታዩ ይችላሉ።
የትግበራ ፍኖተ ካርታ
ለትክክለኛነት፣ ለማስታወስ እና ለስህተት ወጪዎች የመቀበያ መስፈርቶችን ይግለጹ።
ከእውነተኛ የምርት ሁኔታዎች ጋር በሚዛመድ ውሂብ ይሞክሩ።
ለዝቅተኛ እምነት ወይም ከፍተኛ ተጽዕኖ ትንበያ የሰው ግምገማን ያክሉ።
ከካሜራ ወይም የውሂብ ስብስብ ለውጦች በኋላ የሞዴሉን ተንሸራታች ይከታተሉ እና እንደገና ያረጋግጡ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
CLIP እና ራዕይ-ቋንቋ ሞዴሎች
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
ቪዥን ትራንስፎርመር ምንድን ነው?
ቪዥን ትራንስፎርመሮች (ViTs) ChatGPTን ወደ ምስሎች የሚያንቀሳቅሰውን የትራንስፎርመር አርክቴክቸር ይተገብራሉ፣ ሥዕልን ከፒክሴል ፍርግርግ ይልቅ እንደ ተከታታዮች ያያሉ። ዘመናዊ የምስል ዕውቅና ለማግኘት convolutions እንደማትፈልግ አረጋግጠዋል።
ቪዥን ትራንስፎርመር በመጀመሪያ የግቤት ምስልን እንዴት ይሰራል?
ቪቲቲ ምስሉን ወደ ቋሚ ጥገናዎች ይከፍላል (ብዙውን ጊዜ 16x16 ፒክሰሎች) ፣ እያንዳንዱን ንጣፍ እንደ ማስመሰያ ይከተታል እና ቅደም ተከተሎችን ወደ ትራንስፎርመር ይመገባል።
አንድ ቪቲ የሩቅ ክፍሎችን እርስ በርስ ለማዛመድ የሚያስችለው የትኛው ቁልፍ ዘዴ ነው?
ለራስ ትኩረት መስጠት እያንዳንዱ ፕላስተር ከእያንዳንዱ ፕላስተር መረጃን በቀጥታ እንዲመዘን ያስችለዋል።
ለምን ግልጽ ቪዥን ትራንስፎርመሮች በጣም ትልቅ የሥልጠና ዳታ ስብስቦችን ለበለጠ የሚያስፈልጋቸው?
ከሲኤንኤን በተለየ፣ ቪቲዎች የአካባቢ ወይም የትርጉም ልዩነት አይገምቱም፣ ስለዚህ እነዚህን ንድፎች ከብዙ ውሂብ መማር አለባቸው።
በቪዥን ትራንስፎርመር ውስጥ የአቀማመጥ ኢንኮዲንግ ዓላማ ምንድን ነው?
ለራስ ትኩረት መስጠት ቅደም-ተከተል-አግኖስቲክ ነው፣ ስለዚህ የአቀማመጥ ኢንኮዲንግ የእያንዳንዱን ጠጋኝ ቦታ ወደነበረበት ይመልሳል።
የትኛው መግለጫ በኮምፒዩተር እይታ ላይ የ ViTን ተፅእኖ በተሻለ ሁኔታ የሚያንፀባርቅ ነው?
በቂ ዳታ እና ሚዛን ያለው ንፁህ ትራንስፎርመር ምርጡን የኮንቮሉሽን አውታሮች ሊወዳደር ወይም ሊያልፍ እንደሚችል ቪቲ አሳይቷል።