ভিজ্যুয়াল এআই গাইড

Stable Diffusion

স্ট্যাবল ডিফিউশন হল একটি ওপেন-সোর্স টেক্সট-টু-ইমেজ মডেল, যা 2022 সালে স্টেবিলিটি AI দ্বারা প্রকাশিত হয়েছে, যা র্যান্ডম স্টার্টিং পয়েন্ট থেকে ধীরে ধীরে শব্দ অপসারণ করে ছবি তৈরি করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

Being open and runnable on consumer GPUs, it sparked a massive community of tools, fine-tunes, and apps.

গভীর ডুব

ডিফিউশন মডেলগুলি একটি গোলমাল প্রক্রিয়া বিপরীত করতে শেখে। প্রশিক্ষণের সময়, বাস্তব চিত্রগুলি স্থির না হওয়া পর্যন্ত ধাপে ধাপে এলোমেলো শব্দ যুক্ত হয়; মডেল ভবিষ্যদ্বাণী করতে এবং শব্দ বিয়োগ করতে শেখে. জেনারেট করতে, এটি বিশুদ্ধ শব্দ থেকে শুরু হয় এবং আপনার পাঠ্য প্রম্পট দ্বারা পরিচালিত একটি সুসংগত চিত্র প্রদর্শিত না হওয়া পর্যন্ত বারবার অস্বীকার করে। স্থিতিশীল ডিফিউশনের মূল দক্ষতার কৌশল হল 'সুপ্ত' অংশ: পূর্ণ-রেজোলিউশন পিক্সেলগুলিতে কাজ করার পরিবর্তে, এটি একটি ভেরিয়েশনাল অটোএনকোডার ব্যবহার করে ছবিগুলিকে একটি ছোট সুপ্ত স্থানে সংকুচিত করে, সেখানে ধীরগতির ডিনোইসিং চালায়, তারপরে পিক্সেলে ফিরে ডিকোড করে। এই কারণেই এটি ডেটা সেন্টারের পরিবর্তে একটি সাধারণ গেমিং জিপিইউতে চলতে পারে। একটি টেক্সট এনকোডার (প্রাথমিক সংস্করণে CLIP) আপনার প্রম্পটকে নির্দেশনায় রূপান্তরিত করে এবং একটি U-Net ডিনোইসিং করে। এর খোলা ওজন কন্ট্রোলনেট, লোরা ফাইন-টিউনস এবং অগণিত সৃজনশীল সরঞ্জামকে সক্ষম করেছে।

প্রযুক্তিগত অন্তর্দৃষ্টি

স্থিতিশীল প্রসারণ একটি সুপ্ত প্রসারণ মডেল। একটি অটোএনকোডার একটি 512x512 চিত্রকে একটি কমপ্যাক্ট সুপ্ত গ্রিডে সঙ্কুচিত করে, গণনাকে নাটকীয়ভাবে কাটায়। একটি U-Net প্রতিটি টাইমস্টেপে যোগ করা শব্দের পূর্বাভাস দেওয়ার জন্য প্রশিক্ষিত, ক্রস-অ্যাটেনশনের মাধ্যমে টেক্সট এমবেডিং এর উপর শর্তযুক্ত। ক্লাসিফায়ার-মুক্ত নির্দেশিকা আপনাকে শর্তযুক্ত এবং শর্তহীন ভবিষ্যদ্বাণী মিশ্রিত করে চিত্রটি কতটা দৃঢ়ভাবে প্রম্পট অনুসরণ করে তা ডায়াল করতে দেয়। অনুমানে, একজন স্যাম্পলার (যেমন ডিডিআইএম বা অয়লার) একটি নির্বাচিত সংখ্যক ডিনোইসিং পদক্ষেপ নেয়; আরো পদক্ষেপ সাধারণত গতির খরচে পরিচ্ছন্ন ফলাফল বোঝায়।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।

পছন্দগুলি তৈরি করুন

সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।

টিম এবং ওয়ার্কফ্লো

অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।

স্থিতিশীল বিস্তারের ভবিষ্যত

ওপেন ইকোসিস্টেম ত্বরান্বিত হতে থাকে: নতুন আর্কিটেকচার (ট্রান্সফরমার-ভিত্তিক ডিফিউশন এবং দ্রুত কয়েক ধাপ বা পাতিত স্যাম্পলার সহ) প্রজন্মকে কয়েক ডজন ধাপ থেকে এক বা দুই পর্যন্ত কেটে দেয়, কাছাকাছি-রিয়েল-টাইম সৃষ্টিকে সক্ষম করে। আরও শক্তিশালী টেক্সট রেন্ডারিং, আরও ভাল প্রম্পট আনুগত্য, এবং নির্বিঘ্ন ইমেজ এডিটিং, প্লাস ভিডিও এবং 3D এক্সটেনশন আশা করুন। ওপেন ওয়েটগুলি বিশেষায়িত সূক্ষ্ম সুরগুলিকে জ্বালাতন করতে থাকবে, তবে তারা প্রশিক্ষণ-ডেটা সম্মতি, ডিপফেক এবং ওয়াটারমার্কিং নিয়ে বিতর্ককেও তীব্র করে তোলে, তাই মডেলগুলির পাশাপাশি সনাক্তকরণ এবং প্রোভেনেন্স টুলিং বৃদ্ধি পাবে৷

বাস্তব-বিশ্ব বাস্তবায়ন

কাস্টম LoRA ফাইন-টিউনের সাথে শিল্পী এবং শখের লোকেরা তাদের নিজস্ব GPU-তে স্থানীয়ভাবে ধারণা শিল্প এবং চিত্র তৈরি করে

একটি ভঙ্গি কঙ্কাল, গভীরতা মানচিত্র, বা সুনির্দিষ্ট রচনার জন্য প্রান্ত স্কেচ সহ একটি প্রজন্মকে সীমাবদ্ধ করতে ControlNet ব্যবহার করে

ফটো এডিট করতে, বস্তু অপসারণ করতে বা একটি দৃশ্যকে এর আসল সীমানা ছাড়িয়ে প্রসারিত করতে ইনপেইন্টিং এবং আউটপেইন্টিং

ইন্ডি গেম স্টুডিও এবং ডিজাইনাররা দ্রুত এবং সস্তায় টেক্সচার, মুড বোর্ড এবং সম্পদের বৈচিত্র তৈরি করে

ঝুঁকি এবং প্রহরী

প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।

মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।

আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।

2

প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।

3

কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।

4

মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stable Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

স্থিতিশীল ভিডিও বিস্তার

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Stable Diffusion?

স্ট্যাবল ডিফিউশন হল একটি ওপেন-সোর্স টেক্সট-টু-ইমেজ মডেল, যা 2022 সালে স্টেবিলিটি AI দ্বারা প্রকাশিত হয়েছে, যা র্যান্ডম স্টার্টিং পয়েন্ট থেকে ধীরে ধীরে শব্দ অপসারণ করে ছবি তৈরি করে। ভোক্তা GPU-তে খোলা এবং চালানোর যোগ্য হওয়ায়, এটি টুলস, ফাইন-টিউনস এবং অ্যাপের একটি বিশাল সম্প্রদায়ের জন্ম দিয়েছে।

একটি উচ্চ স্তরে, কিভাবে একটি প্রসারিত মডেল একটি ইমেজ তৈরি করে?

ডিফিউশন মডেলগুলি একটি শোরগোল প্রক্রিয়াকে বিপরীত করতে শেখে: গোলমাল থেকে শুরু করে, একটি সুসংগত চিত্র আবির্ভূত হওয়া পর্যন্ত তারা পুনরাবৃত্তিমূলকভাবে অস্বীকার করে।

একটি ভোক্তা GPU তে চালানোর জন্য স্থিতিশীল ডিফিউশনকে কী যথেষ্ট দক্ষ করে তোলে?

স্থিতিশীল ডিফিউশন হল একটি সুপ্ত প্রসারণ মডেল: একটি অটোএনকোডার চিত্রগুলিকে সংকুচিত করে যাতে ভারী ডিনোইসিং একটি ছোট সুপ্ত স্থানে চলে।

কিভাবে আপনার টেক্সট প্রম্পট জেনারেট করা ইমেজকে প্রভাবিত করে?

একটি টেক্সট এনকোডার প্রম্পটকে এমবেডিং-এ রূপান্তরিত করে যা ইউ-নেটকে ক্রস-অ্যাটেনশনের মাধ্যমে কন্ডিশন করে, ফলাফলকে স্টিয়ারিং করে।

ক্লাসিফায়ার-মুক্ত নির্দেশিকা আপনাকে কী নিয়ন্ত্রণ করতে দেয়?

ক্লাসিফায়ার-মুক্ত নির্দেশিকা শর্তযুক্ত এবং শর্তহীন ভবিষ্যদ্বাণীগুলিকে মিশ্রিত করে, আপনাকে তাত্ক্ষণিক আনুগত্যকে উপরে বা নীচে চালু করতে দেয়।

কেন স্থিতিশীল প্রসারণ কন্ট্রোলনেট এবং লোআরএর মতো সরঞ্জামগুলির এত বড় ইকোসিস্টেমকে স্ফুলিঙ্গ করেছিল?

ওপেন ওয়েটস সম্প্রদায়কে সুন্দরভাবে সুরক্ষিত করতে এবং মডেলকে প্রসারিত করতে দেয়, কন্ট্রোলনেট এবং লাইটওয়েট LoRA অ্যাডাপ্টারের মতো অ্যাড-অন তৈরি করে।