ቪዥዋል AI መመሪያ

ከዜሮ-1-ወደ-3 ልቦለድ እይታ ስርጭት

ዜሮ-1-3 የነገሩን ነጠላ ፎቶ ከየትኛውም አዲስ ማእዘን የሚታየውን ተመሳሳይ ነገር ወደ ምስሎች ይለውጣል፣ ይህም በጠየቁት የካሜራ ማሽከርከር ላይ የተስተካከለ የስርጭት ሞዴልን በመጠቀም።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It matters because it lets you reconstruct 3D-consistent views without ever scanning the object from multiple sides.

ጥልቅ ዳይቭ

ዜሮ-1-ወደ-3 (ከኮሎምቢያ፣ 2023) ጥሩ ዜማዎች Stable Diffusion ዜሮ-ሾት ልቦለድ እይታ ውህደትን ከአንድ የግቤት ምስል ማከናወን ይችላል። ነጠላ ምስል እና አንጻራዊ የካሜራ ለውጥ (መዞር እና ትንሽ ትርጉም) ትመግበዋለህ እና ሞዴሉ ከአዲሱ እይታ አንጻር ነገሩ ምን እንደሚመስል ያመነጫል። ዋናው ሃሳብ በግዙፍ የድር ምስል ስብስቦች የሰለጠኑ ትልልቅ የ2D ስርጭት ሞዴሎች ነገሮች በ3D ውስጥ እንዴት እንደሚመስሉ ጂኦሜትሪክ እና ፊዚካዊ ቅድመ ሁኔታዎችን በተዘዋዋሪ ወስደዋል። ከብዙ ቁጥጥር የካሜራ ማዕዘኖች (Objaverseን በመጠቀም) በተሰራው የነገሮች ሰው ሰራሽ ዳታ ስብስብ ላይ በጥሩ ሁኔታ በማስተካከል ሞዴሉ የቀደሙትን ወደ ግልጽ የካሜራ መቆጣጠሪያ ካርታ ይማራል። የተፈጠሩት እይታዎች የታች 3D መልሶ ግንባታን መመገብ ይችላሉ።

ቴክኒካዊ ግንዛቤ

በምንጭ ምስሉ ላይ ያለው የሞዴል ሁኔታ በሁለት መንገድ፡- CLIP መክተት ከአንፃራዊ የካሜራ አቀማመጥ (አዚሙዝ፣ ከፍታ፣ ራዲየስ) ጋር ተጣምሮ ትኩረትን ለመምራት ጥሬው ምስሉ ከጫጫታ ድብቅ ነገር ጋር ተጣምሮ ጥሩ ዝርዝሮች እና ማንነት ተጠብቀዋል። ስልጠና ከ CAD ነገሮች የተሰሩ የምስል አቀማመጥ-ምስል ሶስት ጊዜዎችን ይጠቀማል ፣ ስለሆነም አውታረ መረቡ በአመለካከት ለውጥ እና በተፈጠረው የፒክሰል ለውጥ መካከል ያለውን ቁጥጥር ካርታ ይማራል።

ስልታዊ ተጽእኖ

ፍጥነት እና ልኬት

ቪዥዋል AI የመመርመሪያ፣ የማወቅ እና የመለያ ስራዎችን በሚዛን መጠን በራስ ሰር ሊያደርግ ይችላል።

ምርጫዎችን ይገንቡ

የፈጠራ ቡድኖች በጥቂት የእጅ ክለሳዎች ጽንሰ-ሀሳቦችን በፍጥነት መተየብ ይችላሉ።

ቡድን እና የስራ ፍሰት

ክዋኔዎች ከዚህ ቀደም ለማስኬድ አስቸጋሪ የነበሩትን የምስል እና የቪዲዮ ምልክቶችን መጠቀም ይችላሉ።

የዜሮ-1-ለ-3 ልብወለድ እይታ ስርጭት የወደፊት ጊዜ

ከዜሮ-1 እስከ 3 የምስል-ወደ-3-ል ቧንቧዎችን ሞገድ ዘርቷል። እንደ Zero123-XL፣ SyncDreamer እና One-2-3-45 ያሉ ተተኪዎች ወደ ባለብዙ እይታ ወጥነት እና ፈጣን፣ ይበልጥ አስተማማኝ የ3D mesh ውፅዓት ይገፋሉ፣ ከ Gaussian Splatting እና ከትልቅ የመልሶ ግንባታ ሞዴሎች ጋር መቀላቀል የትውልዱን ጊዜ ከደቂቃ ወደ ሰከንድ እየጠበበ ነው። እነዚህ የአመለካከት-ቁጥጥር ስርጭቶች ሞዴሎች ለይዘት ፈጠራ መደበኛ መሳሪያዎች ሲበስሉ ጥብቅ እይታን ፣ ከፍተኛ ጥራትን እና የገሃዱን ዓለም (ሰው ሰራሽ-ነገር ብቻ ሳይሆን) አጠቃላይ ይጠብቁ።

የእውነተኛ-ዓለም አተገባበር

የኢ-ኮሜርስ ዝርዝር ንጥሉን ከሁሉም አቅጣጫ ማሳየት እንዲችል የአንድ ነጠላ ምርት ፎቶ ማዞሪያ እይታዎችን መፍጠር

ለኤአር ቅድመ እይታዎች ከአንድ ተራ የስልክ ቅጽበታዊ ገጽ እይታ የአንድ ነገር ቴክስቸርድ 3D ጥልፍልፍ በማስነሳት ላይ

ለጨዋታ እና የፊልም ፅንሰ-ሀሳብ አርቲስቶች የአንድ ገጸ ባህሪ ወይም ፕሮፖዛል ወጥ የሆነ ባለብዙ ማእዘን ማጣቀሻ ጥበብ መፍጠር

የማይታየውን ጂኦሜትሪ ለመሙላት የተዋሃዱ ልብ ወለድ እይታዎችን ወደ NeRF ወይም Gaussian Splatting መልሶ ግንባታ መመገብ

አደጋዎች እና የጥበቃ መንገዶች

የምስል መብቶች እና ፈቃድ ግልጽ ካልሆነ ህጋዊ አደጋዎች ሊሆኑ ይችላሉ።

የሞዴል አፈጻጸም በብርሃን፣ በስነ-ሕዝብ እና በአካባቢው ሊለያይ ይችላል።

የመተማመን ገደቦች ካልተቆጣጠሩ የውሸት አወንታዊ ነገሮች ላይታዩ ይችላሉ።

የትግበራ ፍኖተ ካርታ

1

ለትክክለኛነት፣ ለማስታወስ እና ለስህተት ወጪዎች የመቀበያ መስፈርቶችን ይግለጹ።

2

ከእውነተኛ የምርት ሁኔታዎች ጋር በሚዛመድ ውሂብ ይሞክሩ።

3

ለዝቅተኛ እምነት ወይም ከፍተኛ ተጽዕኖ ትንበያ የሰው ግምገማን ያክሉ።

4

ከካሜራ ወይም የውሂብ ስብስብ ለውጦች በኋላ የሞዴሉን ተንሸራታች ይከታተሉ እና እንደገና ያረጋግጡ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Zero-1-to-3 Novel View Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

ልብ ወለድ እይታ ውህደት

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is Zero-1-to-3 Novel View Diffusion?

ዜሮ-1-3 የነገሩን ነጠላ ፎቶ ከየትኛውም አዲስ ማእዘን የሚታየውን ተመሳሳይ ነገር ወደ ምስሎች ይለውጣል፣ ይህም በጠየቁት የካሜራ ማሽከርከር ላይ የተስተካከለ የስርጭት ሞዴልን በመጠቀም። ጉዳዩን ከበርካታ አቅጣጫዎች ሳትቃኙ ባለ 3-ል-ወጥ እይታዎችን መልሰው እንዲገነቡ ስለሚያደርግ አስፈላጊ ነው።

አዲስ እይታ ለመፍጠር ከአንድ ምስል በተጨማሪ ከዜሮ-1 እስከ 3 ያለው ዋና ግብዓት ምንድነው?

ዜሮ-1-ወደ-3 በአንድ ምስል እና አንጻራዊ የካሜራ አቀማመጥ ላይ የተስተካከለ ነው፣ ስለዚህ ሽክርክሪቱን እና ትርጉሙን ወደሚፈለገው እይታ ይገልጻሉ።

ከዜሮ-1 እስከ 3 የሚገነባው በጥሩ ማስተካከያ የተገነባው የትኛው ዓይነት ሞዴል ነው?

ከድር ምስሎች በተዘዋዋሪ የተማሩትን ጂኦሜትሪክ ቀዳሚዎች ለመጠቀም ትልቅ ቀድሞ የሰለጠነ 2D ስርጭት ሞዴልን በደንብ ያስተካክላል።

ለምንድነው 2D ስርጭት ሞዴል ዜሮ-ሾት ልብ ወለድ እይታ ውህደትን በጭራሽ ማከናወን የሚችለው?

ትልቅ መጠን ያለው 2D ስልጠና እቃዎች በ3D ውስጥ እንዴት እንደሚታዩ ግልፅ እውቀትን ይሰጣል ፣ይህም በጥሩ ሁኔታ ማስተካከል በካሜራ ፖዝ በኩል ቁጥጥር ያደርጋል።

ዜሮ-1-ለ-3ን ለማሰልጠን ማዕከላዊ የሆነው የ3-ል ነገሮች ስብስብ የትኛው ነው?

እንደ Objaverse ካሉ ከትላልቅ ሰው ሰራሽ 3D የነገሮች ስብስቦች በተሰራው የምስል አቀማመጥ-ምስል ላይ የሰለጠነው።

የምንጭ ምስል ጥሩ ዝርዝር በትውልዱ ውስጥ እንዴት ይጠበቃል?

ጥሬው ምስሉ ጫጫታ ካለው ድብቅ ጋር በሰርጥ የተሳሰረ ነው (ከCLIP ለትርጉም ትምህርት ጋር አብሮ) ስለዚህ ማንነት እና ዝርዝር ሁኔታ ይፈጸማል።