মিউজ মাস্কড জেনারেটিভ ইমেজিং
মিউজ হল Google থেকে একটি পাঠ্য-টু-ইমেজ মডেল যা একযোগে মুখোশযুক্ত চিত্র টোকেনগুলি পূরণ করে ছবি তৈরি করে, এটি ধাপে ধাপে ছড়িয়ে দেওয়ার চেয়ে অনেক দ্রুততর করে তোলে৷
ওভারভিউ
It matters because it showed you can get high-quality, well-aligned images without the slow iterative denoising that most generators rely on.
গভীর ডুব
মিউজ একটি ছবির বিচ্ছিন্ন টোকেন স্পেসে কাজ করে। একটি পূর্বপ্রশিক্ষিত VQGAN একটি ছবিকে পূর্ণসংখ্যা টোকেনের একটি গ্রিডে পরিণত করে, যেমন ভিজ্যুয়াল বিল্ডিং ব্লকের শব্দভাণ্ডার। প্রশিক্ষণের সময়, এই টোকেনের একটি বড় অংশ মুখোশ হয়ে যায়, এবং একটি ট্রান্সফরমার হিমায়িত বৃহৎ ভাষার মডেল (T5-XXL) থেকে পাঠ্য এম্বেডিংয়ের শর্তযুক্ত, সেগুলিকে পূর্বাভাস দিতে শেখে। প্রজন্মের সময়ে Muse একটি সমস্ত মুখোশযুক্ত গ্রিড থেকে শুরু করে এবং সমান্তরাল রাউন্ডে ডিকোড করে, প্রতি ধাপে অনেকগুলি টোকেনের পূর্বাভাস দেয় এবং সর্বনিম্ন আত্মবিশ্বাসীকে পুনরায় মাস্ক করে। একটি দ্বি-পর্যায়ের নকশা প্রথমে একটি কম-রেজোলিউশন টোকেন গ্রিড তৈরি করে, তারপর একটি সুপার-রেজোলিউশন মডেল একটি উচ্চ-রেজোলিউশন গ্রিড পূরণ করে। যেহেতু কয়েক ডজন টোকেন একই সাথে সমাধান করে, 900M এবং 3B প্যারামিটার মডেলগুলি একটি 256 বা 512 পিক্সেল ইমেজ তৈরি করে মাত্র কয়েকটি ফরোয়ার্ড পাসে।
প্রযুক্তিগত অন্তর্দৃষ্টি
মূল কৌশল হল আত্মবিশ্বাস-ভিত্তিক রিমাস্কিংয়ের সাথে সমান্তরাল ডিকোডিং, যাকে প্রায়ই মাস্কজিআইটি-স্টাইল স্যাম্পলিং বলা হয়। এক সময়ে একটি টোকেন ভবিষ্যদ্বাণী করার পরিবর্তে (অটোরিগ্রেসিভ) বা শত শত বার (ডিফিউশন) অস্বীকার করার পরিবর্তে, মিউজ সমস্ত মুখোশযুক্ত টোকেনগুলির পূর্বাভাস দেয়, সবচেয়ে আত্মবিশ্বাসী রাখে এবং পরবর্তী রাউন্ডের জন্য বাকিগুলিকে পুনরায় মাস্ক করে। একটি হিমায়িত T5-XXL টেক্সট এনকোডার ব্যবহার করে বিনামূল্যের জন্য শক্তিশালী ভাষা বোঝার সুবিধা পাওয়া যায়, এবং বিচ্ছিন্ন টোকেনগুলিতে কাজ করার মাধ্যমে চিত্রগুলিকে আরও শব্দের মতো মডেল করার সুযোগ দেয়৷
কৌশলগত প্রভাব
গতি এবং স্কেল
ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।
পছন্দগুলি তৈরি করুন
সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।
টিম এবং ওয়ার্কফ্লো
অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।
মিউজ মাস্কড জেনারেটিভ ইমেজিংয়ের ভবিষ্যত
জেনারেটরের দিকে মুখোশযুক্ত সমান্তরাল ডিকোডিং পয়েন্ট যা উচ্চ মানের এবং সত্যিকারের দ্রুত, যা ইন্টারেক্টিভ সম্পাদনা এবং ডিভাইসে ব্যবহারের জন্য অপরিহার্য। টোকেন-ভবিষ্যদ্বাণী ধারণাটি প্রসারণ এবং অটোরিগ্রেসিভ ভিডিও পদ্ধতির সাথে একত্রিত হবে এবং তাত্ক্ষণিক ইনপেইন্টিং, আউটপেইন্টিং এবং মাস্ক-মুক্ত সম্পাদনাকে পাওয়ার আশা করুন। বিচ্ছিন্ন টোকেনাইজারগুলির উন্নতির সাথে সাথে, মুখোশযুক্ত ইমেজিং ভিডিও এবং 3D তে পরিষ্কারভাবে প্রসারিত হতে পারে, যেখানে সমান্তরাল ডিকোডিং অনেকগুলি ফ্রেম বা ভিউ তৈরির খরচ নাটকীয়ভাবে কমাতে পারে।
বাস্তব-বিশ্ব বাস্তবায়ন
দ্রুত ধারণা শিল্প এবং মেজাজ বোর্ড যেখানে একজন শিল্পীর মিনিটের চেয়ে সেকেন্ডে অনেকগুলি চিত্র বৈচিত্র্যের প্রয়োজন।
জিরো-শট ইনপেইন্টিং, যেমন একটি বস্তু অপসারণ করা এবং মডেলটি মুখোশযুক্ত অঞ্চলটিকে চারপাশের সাথে ধারাবাহিকভাবে পূরণ করা।
ব্যানার বা ভিন্ন আকৃতির অনুপাতের জন্য একটি ফটোকে তার আসল সীমানার বাইরে প্রসারিত করতে আউটপেইন্টিং।
মাস্ক-মুক্ত সম্পাদনা, যেমন টেক্সট প্রম্পট সম্পাদনা করে এবং প্রভাবিত টোকেনগুলি পুনরায় ডিকোড করে একটি কুকুরের রঙ বা সূর্যাস্তের জন্য আকাশ পরিবর্তন করা।
ঝুঁকি এবং প্রহরী
প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।
মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।
আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।
বাস্তবায়ন রোডম্যাপ
নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।
প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।
কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।
মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Muse Masked Generative Imaging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
মুখোশযুক্ত অটোএনকোডার
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Muse Masked Generative Imaging?
মিউজ হল Google থেকে একটি পাঠ্য-টু-ইমেজ মডেল যা একযোগে মুখোশযুক্ত চিত্র টোকেনগুলি পূরণ করে ছবি তৈরি করে, এটি ধাপে ধাপে ছড়িয়ে দেওয়ার চেয়ে অনেক দ্রুততর করে তোলে৷ এটি গুরুত্বপূর্ণ কারণ এটি দেখায় যে আপনি উচ্চ-মানের, ভাল-সংযুক্ত চিত্রগুলি পেতে পারেন ধীর পুনরাবৃত্তিমূলক ডিনোইসিং ছাড়াই যা বেশিরভাগ জেনারেটর নির্ভর করে।
পিক্সেল ডিনোইসিং এর পরিবর্তে প্রজন্মের সময় মিউজ কী ভবিষ্যদ্বাণী করে?
মিউজ একটি বিচ্ছিন্ন টোকেন স্পেসে কাজ করে, সরাসরি পিক্সেলগুলিতে কাজ করার পরিবর্তে ভিকিউজিএএন টোকেনাইজার দ্বারা উত্পাদিত মুখোশযুক্ত চিত্র টোকেনগুলির পূর্বাভাস দেয়।
কেন মিউজ সাধারণত স্ট্যান্ডার্ড ডিফিউশন মডেলের চেয়ে দ্রুত?
মিউজ একই সাথে অনেকগুলি মুখোশযুক্ত টোকেন পূরণ করে এবং এর জন্য শুধুমাত্র কয়েকটি ডিকোডিং রাউন্ডের প্রয়োজন, ডিফিউশনের অনেকগুলি অনুক্রমিক ডিনোইসিং ধাপগুলির বিপরীতে।
কোথায় Muse পাঠ্য প্রম্পট তার বোঝার পায়?
একটি হিমায়িত পূর্ব-প্রশিক্ষিত T5-XXL ভাষা মডেল থেকে পাঠ্য এমবেডিং-এর উপর পরিস্থিতি তৈরি করে, এটি শক্তিশালী ভাষা বোঝার সুযোগ দেয়।
মিউজে আত্মবিশ্বাস-ভিত্তিক রিমাস্কিংয়ের ভূমিকা কী?
প্রতিটি সমান্তরাল ভবিষ্যদ্বাণীর পরে, Muse সবচেয়ে আত্মবিশ্বাসী টোকেনগুলিকে ধরে রাখে এবং পরপর রাউন্ডে পরিমার্জিত করার জন্য সবচেয়ে কম আত্মবিশ্বাসীকে পুনরায় মাস্ক করে।
মিউজ কীভাবে উচ্চ-রেজোলিউশনের ছবি তৈরি করে?
মিউজ প্রথমে একটি কম-রেজোলিউশন টোকেন গ্রিড তৈরি করে, তারপর একটি দ্বিতীয় সুপার-রেজোলিউশন মডেল একটি উচ্চ-রেজোলিউশন টোকেন গ্রিড তৈরি করে।