টেক্সট-টু-3ডি জেনারেশন
টেক্সট-টু-3ডি জেনারেশন 'একটি ভিনটেজ লেদার আর্মচেয়ার'-এর মতো একটি লিখিত প্রম্পটকে একটি পূর্ণ 3D মডেলে পরিণত করে যা আপনি একটি গেম বা দৃশ্যে ঘোরাতে, আলো করতে এবং ড্রপ করতে পারেন৷
ওভারভিউ
It promises to do for 3D assets what image generators did for pictures.
গভীর ডুব
টেক্সট-টু-3ডি সিস্টেমগুলি একটি বাক্য থেকে একটি 3D উপস্থাপনা (একটি জাল, বিন্দু মেঘ, বা দীপ্তি ক্ষেত্র) তৈরি করে। Google-এর ড্রিমফিউশন (2022) এর মতো প্রাথমিক সাফল্য স্কোর ডিস্টিলেশন স্যাম্পলিং ব্যবহার করেছে: 3D ডেটার প্রশিক্ষণের পরিবর্তে, তারা একটি NeRF অপ্টিমাইজ করেছে যাতে প্রতিটি রেন্ডার করা 2D ভিউ একটি হিমায়িত 2D ইমেজ ডিফিউশন মডেলের কাছে বিশ্বাসযোগ্য দেখায়। এই বুটস্ট্র্যাপ করা 3D আকার 2D পূর্বের থেকে কিন্তু ধীর ছিল, প্রতি বস্তুর প্রতি ঘন্টা সময় নেয় এবং প্রায়শই 'জানুস সমস্যা' তৈরি করে যেখানে একটি প্রাণী একাধিক মুখ বৃদ্ধি করে। নতুন ফিড-ফরোয়ার্ড মডেল (OpenAI এর Point-E এবং Shap-E, প্লাস গাউসিয়ান-স্প্ল্যাটিং এবং বড় পুনর্গঠন মডেল) সেকেন্ড থেকে মিনিটের মধ্যে সম্পদ তৈরি করে। গুণমান, মাল্টি-ভিউ সামঞ্জস্য, পরিচ্ছন্ন টপোলজি এবং ব্যবহারযোগ্য টেক্সচার সক্রিয় চ্যালেঞ্জ রয়ে গেছে।
প্রযুক্তিগত অন্তর্দৃষ্টি
ড্রিমফিউশনের মূল কৌশল, স্কোর ডিস্টিলেশন স্যাম্পলিং (এসডিএস), কোন 3D প্রশিক্ষণ ডেটার প্রয়োজন নেই। এটি একটি NeRF এর এলোমেলো দৃষ্টিভঙ্গি রেন্ডার করে, শব্দ যোগ করে এবং একটি পূর্বপ্রশিক্ষিত 2D ডিফিউশন মডেলকে জিজ্ঞাসা করে কিভাবে পাঠ্য প্রম্পটের দিকে ডিনোাইজ করা যায়। এই ডিনোইসিং সিগন্যালটি একটি গ্রেডিয়েন্টে পরিণত হয় যা NeRF এর পরামিতিগুলিকে নাজ করে যাতে প্রতিটি দৃষ্টিকোণ প্রম্পটের সাথে মেলে। 2D মডেলটি একটি সমালোচক হিসাবে কাজ করে যার ইমেজ জ্ঞানকে একটি সামঞ্জস্যপূর্ণ 3D অবজেক্টে পরিণত করে।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।
পছন্দগুলি তৈরি করুন
সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।
টিম এবং ওয়ার্কফ্লো
অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।
টেক্সট-টু-3ডি জেনারেশনের ভবিষ্যত
ধীর প্রতি-অবজেক্ট অপ্টিমাইজেশান থেকে দ্রুত ফিড-ফরোয়ার্ড জেনারেটরে একটি স্থানান্তর আশা করুন যা সেকেন্ডের মধ্যে পরিষ্কার টপোলজি, পৃথক করা উপকরণ এবং UV মানচিত্র সহ উত্পাদন-প্রস্তুত জাল নির্গত করে। 3D গাউসিয়ান স্প্ল্যাটিং এবং বড় পুনর্গঠন মডেলগুলি এটিকে ত্বরান্বিত করছে। গেম ইঞ্জিন, CAD, এবং AR পাইপলাইনগুলির মধ্যে একীকরণ, এবং টেক্সট-টু-4D (অ্যানিমেটেড, মুভিং অবজেক্ট), কথোপকথনমূলক সম্পদ তৈরির রুটিন তৈরি করবে, যদিও কারচুপি এবং গেম-স্পেক কমপ্লায়েন্সের জন্য মানবিক পরিচ্ছন্নতা অব্যাহত থাকবে।
বাস্তব-বিশ্ব বাস্তবায়ন
একটি গেম স্টুডিও টেক্সট থেকে ব্যাকগ্রাউন্ড প্রপস (ক্রেট, ল্যাম্প, ফোলিজ) প্রোটোটাইপ করে শিল্পীরা নায়কের সম্পদগুলিকে পরিমার্জন করার আগে স্তরগুলি পূরণ করতে অনুরোধ করে৷
একটি ই-কমার্স সাইট AR 'আপনার ঘরে দেখুন' বৈশিষ্ট্যগুলির জন্য ক্যাটালগ বিবরণ থেকে আবর্তনযোগ্য 3D পণ্যের পূর্বরূপ স্বয়ংক্রিয়ভাবে তৈরি করে।
একজন স্থপতি দ্রুত সম্পদ লাইব্রেরি ব্রাউজ করার পরিবর্তে 'মধ্য শতাব্দীর সোফা' টাইপ করে আসবাবপত্রের সাথে একটি ওয়াকথ্রু রেন্ডার তৈরি করেন।
একটি ফিল্ম প্রাক-ভিজ দল চূড়ান্ত মডেল তৈরি করার আগে ক্যামেরার কোণ পরীক্ষা করার জন্য স্ক্রিপ্টের বিবরণ থেকে একটি দৃশ্যের সেট ড্রেসিং ব্লক করে।
ঝুঁকি এবং প্রহরী
প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।
মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।
আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।
বাস্তবায়ন রোডম্যাপ
নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।
প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।
কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।
মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Text-to-3D Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
Magic3D পাঠ্য থেকে 3D পাইপলাইন
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Text-to-3D Generation?
টেক্সট-টু-3ডি জেনারেশন 'একটি ভিনটেজ লেদার আর্মচেয়ার'-এর মতো একটি লিখিত প্রম্পটকে একটি পূর্ণ 3D মডেলে পরিণত করে যা আপনি একটি গেম বা দৃশ্যে ঘোরাতে, আলো করতে এবং ড্রপ করতে পারেন৷ এটি 3D সম্পদের জন্য প্রতিশ্রুতি দেয় যে ইমেজ জেনারেটরগুলি ছবির জন্য কী করেছিল৷
DreamFusion (2022) এর মূল উদ্ভাবন কি ছিল?
DreamFusion একটি NeRF অপ্টিমাইজ করেছে যাতে প্রতিটি রেন্ডার করা 2D ভিউ একটি হিমায়িত 2D ইমেজ ডিফিউশন মডেলকে সন্তুষ্ট করে, SDS ব্যবহার করে এবং কোন 3D প্রশিক্ষণ ডেটার প্রয়োজন হয় না।
টেক্সট-টু-3ডিতে 'জানুস সমস্যা' কী?
দুই মুখের রোমান দেবতার নামানুসারে, জানুস সমস্যা হল যখন একটি বস্তু অতিরিক্ত মুখ বৃদ্ধি করে কারণ প্রতিটি 2D ভিউ কিছুটা স্বাধীনভাবে অপ্টিমাইজ করা হয়।
কোন জুটি OpenAI এর প্রাথমিক পাঠ্য থেকে 3D ফিড-ফরোয়ার্ড মডেল ছিল?
OpenAI Point-E (পয়েন্ট ক্লাউড) এবং Shap-E প্রকাশ করেছে, যা অপ্টিমাইজেশান-ভিত্তিক পদ্ধতির চেয়ে অনেক দ্রুত 3D সম্পদ তৈরি করে।
ড্রিমফিউশনের মতো প্রাথমিক অপ্টিমাইজেশন-ভিত্তিক পদ্ধতিগুলি কেন ধীর ছিল?
প্রতিটি অবজেক্টের জন্য পুনরাবৃত্তিমূলকভাবে একটি NeRF অপ্টিমাইজ করা প্রয়োজন অনেকগুলি নয়েজড রেন্ডার জুড়ে, প্রায়শই সম্পদ প্রতি ঘন্টা সময় নেয়।
কোন আউটপুট বিন্যাস এই সিস্টেমগুলি দ্বারা উত্পাদিত একটি সাধারণ 3D উপস্থাপনা নয়?
টেক্সট-টু-3ডি সিস্টেম আউটপুট মেশ, পয়েন্ট ক্লাউড, বা রেডিয়েন্স ফিল্ড; MP3 একটি অডিও বিন্যাস, একটি 3D উপস্থাপনা নয়।