ጽሑፍ-ወደ-3D ትውልድ
ከጽሑፍ ወደ 3ዲ ትውልድ እንደ 'Vintage skin armchair' የጽሁፍ ጥያቄን ወደ ሙሉ 3D ሞዴል ይቀይረዋል ወደ ጨዋታ ወይም ትእይንት ማሽከርከር፣ ማብራት እና መጣል ይችላሉ።
አጠቃላይ እይታ
የምስል ማመንጫዎች ለሥዕሎች ያደረጉትን ለ3-ል ንብረቶች ለማድረግ ቃል ገብቷል።
ጥልቅ ዳይቭ
የጽሑፍ-ወደ-3-ል ስርዓቶች ከአንድ አረፍተ ነገር የ3-ል ውክልና (መረብ፣ የነጥብ ደመና ወይም የጨረር መስክ) ይፈጥራሉ። እንደ Google's DreamFusion (2022) ያሉ ቀደምት ግኝቶች የውጤት ማጣራት ናሙናን ተጠቅመዋል፡ በ3D መረጃ ላይ ከማሰልጠን ይልቅ 2D እይታ ለቀዘቀዘ 2D ምስል አሳማኝ እንዲመስል NeRF አመቻችተዋል። ይህ 3D ቅርጾችን ከ2D በፊት አስጀምሯል ነገር ግን ቀርፋፋ ነበር በአንድ ነገር ሰአታት የሚወስድ እና ብዙ ጊዜ ፍጡር ብዙ ፊት የሚያድግበትን 'የጃኑስ ችግር' ይፈጥራል። አዳዲስ መጋቢ-አስተላላፊ ሞዴሎች (OpenAI's Point-E እና Shap-E፣ እና Gaussian-splating and ትልቅ የመልሶ ግንባታ ሞዴሎች) ከሰከንዶች እስከ ደቂቃ ውስጥ ንብረቶችን ያመነጫሉ። ጥራት ያለው፣ ባለብዙ እይታ ወጥነት፣ ንጹህ ቶፖሎጂ እና ጥቅም ላይ የሚውሉ ሸካራዎች ንቁ ተግዳሮቶች ሆነው ይቆያሉ።
ቴክኒካዊ ግንዛቤ
DreamFusion's core trick፣ Score Distillation Sampling (SDS)፣ ምንም የ3D የሥልጠና ውሂብ አያስፈልገውም። ስለ NeRF የዘፈቀደ እይታዎችን ያቀርባል፣ ጫጫታ ይጨምራል፣ እና ቀድሞ የሰለጠነ 2D ስርጭት ሞዴል እንዴት ወደ ጽሁፍ መጠየቂያው መቃወም እንደሚቻል ይጠይቃል። ያ የውድቀት ምልክት የNeRF መለኪያዎችን የሚያጎላ ቅልመት ይሆናል ስለዚህም እያንዳንዱ እይታ ከጥያቄው ጋር ይዛመዳል። የ2ዲ አምሳያው የምስል እውቀቱን ወደ አንድ ወጥ የሆነ የ3-ል ነገር በማሰራጨት እንደ ተቺ ይሰራል።
ስልታዊ ተጽእኖ
ፍጥነት እና ልኬት
ቪዥዋል AI የመመርመሪያ፣ የማወቅ እና የመለያ ስራዎችን በሚዛን መጠን በራስ ሰር ሊያደርግ ይችላል።
ምርጫዎችን ይገንቡ
የፈጠራ ቡድኖች በጥቂት የእጅ ክለሳዎች ጽንሰ-ሀሳቦችን በፍጥነት መተየብ ይችላሉ።
ቡድን እና የስራ ፍሰት
ክዋኔዎች ከዚህ ቀደም ለማስኬድ አስቸጋሪ የነበሩትን የምስል እና የቪዲዮ ምልክቶችን መጠቀም ይችላሉ።
የጽሑፍ-ወደ-3-ል ትውልድ የወደፊት
በንፁህ ቶፖሎጂ ፣የተለያዩ ቁሶች እና የዩቪ ካርታዎች በሰከንዶች ውስጥ ለምርት ዝግጁ የሆኑ ጥልፍሮችን ወደሚያመነጩ በየነገር ማመቻቸት ከዘገየ በእያንዳንዱ ነገር ማመቻቸት ወደ ፈጣን ምግብ አስተላላፊዎች ሽግግር ይጠብቁ። 3D Gaussian splatting እና ትልቅ የመልሶ ግንባታ ሞዴሎች ይህን እያፋጠነው ነው። ወደ ጨዋታ ሞተሮች፣ CAD እና ኤአር ቧንቧዎች፣ ከጽሑፍ-ወደ-4D (አኒሜሽን፣ ተንቀሳቃሽ ነገሮች) ጋር መቀላቀል የውይይት ንብረት መፍጠርን መደበኛ ያደርገዋል፣ ምንም እንኳን የሰው ልጅ ለመጭበርበር እና ለጨዋታ-ስፔክ ተገዢነት የሚቀጥል ቢሆንም።
የእውነተኛ-ዓለም አተገባበር
አንድ የጨዋታ ስቱዲዮ አርቲስቶች የጀግና ንብረቶቹን ከማጣራታቸው በፊት ደረጃዎችን ለመሙላት የጀርባ ፕሮፖኖችን (ሳጥኖች፣ መብራቶች፣ ቅጠሎች) ከጽሑፍ ማበረታቻዎች ይቀርፃል።
የኢ-ኮሜርስ ጣቢያ በራስ-ሰር የሚሽከረከር የ3-ል ምርት ቅድመ-እይታዎችን ከካታሎግ መግለጫዎች ለ AR 'በክፍልዎ እይታ' ባህሪያት ያመነጫል።
አንድ አርክቴክት የንብረት ቤተመጻሕፍትን ከመቃኘት ይልቅ 'የመካከለኛው ክፍለ ዘመን ሶፋ' በመተየብ የቤት ዕቃዎችን የመራመጃ ዝግጅት በፍጥነት ይሞላል።
የፊልም ቅድመ-ቪዝ ቡድን የመጨረሻ ሞዴሎችን ከመገንባቱ በፊት የካሜራ ማዕዘኖችን ለመፈተሽ የአንድን ትዕይንት ልብስ ከስክሪፕት መግለጫ ያግዳል።
አደጋዎች እና የጥበቃ መንገዶች
የምስል መብቶች እና ፈቃድ ግልጽ ካልሆነ ህጋዊ አደጋዎች ሊሆኑ ይችላሉ።
የሞዴል አፈጻጸም በብርሃን፣ በስነ-ሕዝብ እና በአካባቢው ሊለያይ ይችላል።
የመተማመን ገደቦች ካልተቆጣጠሩ የውሸት አወንታዊ ነገሮች ላይታዩ ይችላሉ።
የትግበራ ፍኖተ ካርታ
ለትክክለኛነት፣ ለማስታወስ እና ለስህተት ወጪዎች የመቀበያ መስፈርቶችን ይግለጹ።
ከእውነተኛ የምርት ሁኔታዎች ጋር በሚዛመድ ውሂብ ይሞክሩ።
ለዝቅተኛ እምነት ወይም ከፍተኛ ተጽዕኖ ትንበያ የሰው ግምገማን ያክሉ።
ከካሜራ ወይም የውሂብ ስብስብ ለውጦች በኋላ የሞዴሉን ተንሸራታች ይከታተሉ እና እንደገና ያረጋግጡ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Text-to-3D Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
Magic3D ጽሑፍ-ወደ-3D የቧንቧ መስመር
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
ከጽሑፍ-ወደ-3D ትውልድ ምንድን ነው?
ከጽሑፍ ወደ 3ዲ ትውልድ እንደ 'Vintage skin armchair' የጽሁፍ ጥያቄን ወደ ሙሉ 3D ሞዴል ይቀይረዋል ወደ ጨዋታ ወይም ትእይንት ማሽከርከር፣ ማብራት እና መጣል ይችላሉ። የምስል አመንጪዎች ለሥዕሎች ያደረጉትን ለ 3D ንብረቶች እንደሚያደርግ ቃል ገብቷል።
የ DreamFusion (2022) ቁልፍ ፈጠራ ምን ነበር?
DreamFusion NeRFን አመቻችቷል ስለዚህ እያንዳንዱ የ2ዲ እይታ የቀዘቀዘ 2D ምስል ስርጭት ሞዴልን ያረካል፣ SDS በመጠቀም እና ምንም የ3D የሥልጠና መረጃ አያስፈልገውም።
በጽሑፍ-ወደ-3D ውስጥ ያለው 'የጃኑስ ችግር' ምንድን ነው?
ባለ ሁለት ፊት የሮማውያን አምላክ የተሰየመው፣ የጃኑስ ችግር አንድ ነገር ተጨማሪ ፊቶችን ሲያድግ ነው ምክንያቱም እያንዳንዱ 2D እይታ በተወሰነ ደረጃ ራሱን የቻለ ነው።
የትኛዎቹ ጥንድ የOpenAI ቀደምት የጽሑፍ-ወደ-3D መጋቢ አስተላላፊ ሞዴሎች ነበሩ?
OpenAI 3D ንብረቶችን ከማመቻቸት ላይ ከተመሠረቱ ዘዴዎች የሚያመነጩትን ነጥብ-ኢ (ነጥብ ደመና) እና ሻፕ-ኢን ተለቀቁ።
እንደ DreamFusion ያሉ ቀደምት ማመቻቸት ላይ የተመሰረቱ ዘዴዎች ለምን ቀርፋፋ ነበሩ?
እያንዳንዱ ነገር በንብረት ላይ ብዙ ጊዜ የሚፈጅበት ብዙ ጫጫታ በሚታይባቸው መንገዶች ሁሉ ኒአርኤፍን ደጋግሞ ለማመቻቸት ይፈልጋል።
በእነዚህ ሥርዓቶች የሚመረተው የተለመደ 3D ውክልና ያልሆነው የትኛው የውጤት ቅርጸት ነው?
የጽሑፍ-ወደ-3-ል ስርዓቶች ጥልፍልፍ፣ የነጥብ ደመና ወይም የጨረር መስኮችን ያወጣሉ፤ MP3 የኦዲዮ ቅርጸት እንጂ የ3-ል ውክልና አይደለም።