সুপ্ত প্রসারণ মডেল
সুপ্ত প্রসারণ মডেলগুলি কম্পিউট খরচ কমিয়ে, কাঁচা পিক্সেলের পরিবর্তে একটি সংকুচিত সুপ্ত স্থানে ছড়িয়ে দেওয়ার প্রক্রিয়া চালিয়ে ছবি তৈরি করে।
ওভারভিউ
তারা Stable Diffusion এবং সর্বাধিক আধুনিক ওপেন সোর্স ইমেজ জেনারেটরের পিছনে ইঞ্জিন।
গভীর ডুব
একটি স্ট্যান্ডার্ড ডিফিউশন মডেল একটি শব্দ প্রক্রিয়াকে বিপরীত করতে শেখে: এটি বিশুদ্ধ শব্দ থেকে শুরু হয় এবং ধীরে ধীরে একটি চিত্রে পরিণত হয়। পিক্সেলগুলিতে সরাসরি এটি করা ব্যয়বহুল কারণ একটি 512x512 চিত্রের কয়েক হাজার মান রয়েছে। 2022 সালে Rombach এবং সহকর্মীদের দ্বারা প্রবর্তিত সুপ্ত প্রসারণ, প্রথমে একটি ছোট সুপ্ত গ্রিডে (প্রায়ই 64x64x4, মোটামুটি 48x ছোট) একটি চিত্রকে সংকুচিত করতে একটি পূর্বপ্রশিক্ষিত ভেরিয়েশনাল অটোএনকোডার (VAE) ব্যবহার করে। ডিফিউশন ইউ-নেট তখন সেই কম্প্যাক্ট সুপ্ত স্থানের ভিতরে ডিনোাইজ করতে শেখে, ক্রস-অ্যাটেনশনের মাধ্যমে পাঠ্য দ্বারা পরিচালিত হয়। অবশেষে VAE ডিকোডার পূর্ণ-রেজোলিউশন পিক্সেল পুনর্গঠন করে। এই অনুধাবনগত সংকোচন অর্থপূর্ণভাবে অর্থপূর্ণ তথ্য রাখে যখন অদৃশ্য বিশদটি বাতিল করে, ভোক্তা জিপিইউগুলিতে উচ্চ-মানের প্রজন্মকে সম্ভব করে তোলে।
প্রযুক্তিগত অন্তর্দৃষ্টি
মূল কৌতুক হল জেনারেটিভ মডেলিং থেকে উপলব্ধিগত কম্প্রেশনকে আলাদা করা। VAE উচ্চ-ফ্রিকোয়েন্সি পিক্সেল বিশদ একবার পরিচালনা করে, এবং U-Net শুধুমাত্র নিম্ন-মাত্রিক সুপ্ত বন্টন মডেল করে। টেক্সট কন্ডিশনিং ক্রস-অ্যাটেনশন লেয়ারের মাধ্যমে ইনজেকশন করা হয়, যেখানে U-Net-এর স্থানিক বৈশিষ্ট্যগুলি CLIP-এর মতো টেক্সট এনকোডার থেকে টোকেন এম্বেডিংয়ে উপস্থিত থাকে। যেহেতু ল্যাটেন্টগুলি পিক্সেলের চেয়ে প্রায় 48 গুণ ছোট, প্রতিটি ডিনোইসিং স্টেপ মেমরি এবং FLOP উভয় ক্ষেত্রেই নাটকীয়ভাবে সস্তা।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।
পছন্দগুলি তৈরি করুন
সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।
টিম এবং ওয়ার্কফ্লো
অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।
সুপ্ত প্রসারণ মডেলের ভবিষ্যত
সুপ্ত প্রসারণ চিত্রের বাইরে ভিডিও (স্থির ভিডিও ডিফিউশন), 3D সম্পদ এবং অডিও স্পেকট্রোগ্রামে প্রসারিত হচ্ছে, সবই একই কম্প্রেস-তখন-ডিনোইস রেসিপি ব্যবহার করে। গবেষণা পাতন এবং সামঞ্জস্যপূর্ণ মডেলের মাধ্যমে কম নমুনা নেওয়ার পদক্ষেপের দিকে ঠেলে দিচ্ছে, আরও ভাল VAE যা সূক্ষ্ম টেক্সট এবং মুখগুলি সংরক্ষণ করে এবং স্থিতিশীল ডিফিউশন 3-এর মতো সংশোধন-প্রবাহ ফর্মুলেশন যা দ্রুত, তীক্ষ্ণ ফলাফলের জন্য প্রজন্মের গতিপথকে সোজা করে।
বাস্তব-বিশ্ব বাস্তবায়ন
একটি একক ভোক্তা GPU-তে টেক্সট প্রম্পট থেকে স্থিতিশীল ডিফিউশন তৈরি আর্টওয়ার্ক এবং ধারণা ডিজাইন
অ্যাডোব এবং ক্যানভা পাওয়ারিং টেক্সট-টু-ইমেজ এবং জেনারেটিভ-ফিল বৈশিষ্ট্যগুলি সুপ্ত প্রসারণ ব্যাকবোনে নির্মিত
প্রাক-উৎপাদনকে ত্বরান্বিত করতে টেক্সচার ম্যাপ, স্প্রাইট এবং পরিবেশের ধারণা শিল্প তৈরি করে গেম স্টুডিও
স্টক-ইমেজ এবং বিপণন দলগুলি ফটোশুট ছাড়াই অন-ব্র্যান্ড পণ্য মকআপ এবং বিজ্ঞাপন ভিজ্যুয়াল তৈরি করে
ঝুঁকি এবং প্রহরী
প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।
মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।
আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।
বাস্তবায়ন রোডম্যাপ
নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।
প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।
কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।
মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
ভিডিও ডিফিউশন মডেল
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
সুপ্ত বিস্তার মডেল কি?
সুপ্ত প্রসারণ মডেলগুলি কম্পিউট খরচ কমিয়ে, কাঁচা পিক্সেলের পরিবর্তে একটি সংকুচিত সুপ্ত স্থানে ছড়িয়ে দেওয়ার প্রক্রিয়া চালিয়ে ছবি তৈরি করে। তারা স্থিতিশীল বিস্তার এবং সবচেয়ে আধুনিক ওপেন-সোর্স ইমেজ জেনারেটরের পিছনে ইঞ্জিন।
পিক্সেল-স্পেস ডিফিউশনের তুলনায় সুপ্ত প্রসারণ মডেলগুলির প্রধান উদ্ভাবন কী?
সুপ্ত প্রসারণ একটি VAE ব্যবহার করে চিত্রগুলিকে একটি ছোট সুপ্ত স্থানে সংকুচিত করে, তাই ব্যয়বহুল ডিনোইসিং সম্পূর্ণ পিক্সেলের তুলনায় অনেক কম মানগুলিতে ঘটে।
কোন উপাদানটি একটি চিত্রকে সুপ্ত স্থানের মধ্যে সংকুচিত করে এবং পরে এটি পুনর্গঠন করে?
একটি পূর্ব-প্রশিক্ষিত VAE চিত্রটিকে একটি কম্প্যাক্ট সুপ্ত গ্রিডে এনকোড করে এবং এর ডিকোডার শেষে পূর্ণ-রেজোলিউশন পিক্সেল পুনর্গঠন করে।
সুপ্ত প্রসারণে টেক্সট সাধারণত ডিনোইসিং ইউ-নেটে কীভাবে প্রবেশ করা হয়?
একটি টেক্সট এনকোডার থেকে টোকেন এম্বেডিংগুলিকে ক্রস-অ্যাটেনশন লেয়ারে দেওয়া হয়, যা স্থানিক বৈশিষ্ট্যগুলিকে প্রম্পটে উপস্থিত হতে দেয়।
কেন সুপ্ত স্থানে অপারেটিং গণনামূলক খরচ হ্রাস করে?
অপেক্ষা করুন — সঠিক কারণ হল যে সুপ্ত গ্রিডটি পিক্সেল চিত্রের তুলনায় অনেক ছোট (প্রায়ই ~48x), তাই প্রতিটি ডিনোইসিং ধাপে অনেক কম FLOP এবং মেমরির প্রয়োজন হয়৷
কোন বহুল ব্যবহৃত ওপেন সোর্স মডেলটি সুপ্ত প্রসারণকে জনপ্রিয় করেছে?
স্থির বিস্তার, 2022 সালে প্রকাশিত, ভোক্তা হার্ডওয়্যার এবং ব্যাপক গ্রহণের জন্য সুপ্ত বিস্তার এনেছে।