ডিফিউশন ট্রান্সফরমার
ডিফিউশন ট্রান্সফরমার (DiTs) একটি ট্রান্সফরমার ব্যাকবোনের জন্য ইমেজ এবং ভিডিও জেনারেটরের কেন্দ্রস্থলে কনভোলিউশনাল ইউ-নেট অদলবদল করে।
ওভারভিউ
This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.
গভীর ডুব
ডিফিউশন মডেলগুলি বিশুদ্ধ শব্দ থেকে শুরু করে এবং পুনরাবৃত্তভাবে এটিকে একটি সুসংগত ছবিতে অস্বীকার করে চিত্র তৈরি করে। বছরের পর বছর ধরে যে নেটওয়ার্কটি ডিনোইসিং করছে তা ছিল একটি ইউ-নেট, একটি বিবর্তনীয় স্থাপত্য। ডিফিউশন ট্রান্সফরমার, 2022 সালে Peebles এবং Xie দ্বারা প্রবর্তিত, একটি ট্রান্সফরমার দিয়ে U-Net প্রতিস্থাপন করে। চিত্রটি প্রথমে একটি সুপ্ত স্থানে সংকুচিত হয়, ছোট প্যাচগুলিতে বিভক্ত হয় এবং প্রতিটি প্যাচ একটি টোকেন হয়ে ওঠে, অনেকটা ভাষার মডেলের শব্দের মতো। ট্রান্সফরমার তারপর প্রতিটি ডিনোইসিং ধাপে স্ব-মনোযোগ সহ এই টোকেনগুলি প্রক্রিয়া করে। একটি মূল অনুসন্ধান ছিল যে আপনি পরিষ্কার স্কেলিং আইন অনুসরণ করে মডেলের আকার বাড়াতে এবং প্যাচের আকার হ্রাস করার সাথে সাথে ডিআইটি কর্মক্ষমতা অনুমানযোগ্যভাবে উন্নত হয়। এই মাপযোগ্যতার কারণেই টেক্সট-টু-ভিডিও এবং হাই-এন্ড টেক্সট-টু-ইমেজ সিস্টেমগুলি মূলত ট্রান্সফরমার ব্যাকবোনে স্থানান্তরিত হয়েছে।
প্রযুক্তিগত অন্তর্দৃষ্টি
একটি মূল উদ্ভাবন হল কিভাবে DiTs টাইমস্টেপ এবং টেক্সট প্রম্পটের মতো কন্ডিশনিং ইনজেক্ট করে। সাধারণ সংমিশ্রণের পরিবর্তে, তারা অ্যাডাপটিভ লেয়ার নরমালাইজেশন (এডাএলএন) ব্যবহার করে, যেখানে নেটওয়ার্ক কন্ডিশনিং সিগন্যাল থেকে নরমালাইজেশন লেয়ারের জন্য স্কেল এবং শিফট প্যারামিটারের পূর্বাভাস দেয়। adaLN-শূন্য ভেরিয়েন্ট এগুলিকে শুরু করে যাতে প্রতিটি ব্লক একটি পরিচয় ফাংশন হিসাবে শুরু হয়, প্রশিক্ষণকে স্থিতিশীল করে। প্যাচগুলি টোকেনগুলিতে সমতল করা হয়, স্ব-মনোযোগ সহ স্ট্যান্ডার্ড ট্রান্সফরমার ব্লক দ্বারা প্রক্রিয়া করা হয়, তারপরে পুনরায় একত্রিত করা হয় এবং পিক্সেলগুলিতে ডিকোড করা হয়।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।
পছন্দগুলি তৈরি করুন
সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।
টিম এবং ওয়ার্কফ্লো
অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।
ডিফিউশন ট্রান্সফরমারের ভবিষ্যত
ডিফিউশন ট্রান্সফরমারগুলি জেনারেটিভ মিডিয়ার জন্য ডিফল্ট ব্যাকবোন হয়ে উঠছে। তাদের টোকেন-ভিত্তিক ডিজাইন তাদের একত্রিত করা চিত্র, ভিডিও এবং এমনকি মাল্টিমোডাল প্রজন্মকে একটি মাপযোগ্য আর্কিটেকচারের অধীনে স্বাভাবিক করে তোলে। অনেক টোকেনের চতুর্মুখী খরচ কমাতে গবেষণা দীর্ঘ ভিডিও, উচ্চতর রেজোলিউশন এবং আরও দক্ষ মনোযোগের দিকে ঠেলে দিচ্ছে। ভাষা এবং দৃষ্টি মডেলের মধ্যে একত্রিত হওয়ার আশা করুন, যেখানে একই রকম ট্রান্সফরমার স্কেলিং রেসিপি এবং পরিকাঠামো উভয়ই পরিবেশন করে, বিশ্ব মডেল এবং ইন্টারেক্টিভ ভিডিওতে অগ্রগতি ত্বরান্বিত করে।
বাস্তব-বিশ্ব বাস্তবায়ন
OpenAI এর Sora টেক্সট প্রম্পট থেকে মিনিট-দীর্ঘ, উচ্চ-বিশ্বস্ত ভিডিও তৈরি করতে স্পেসটাইম প্যাচের উপর একটি ট্রান্সফরমার ব্যাকবোন ব্যবহার করে।
স্টেবল ডিফিউশন 3 একটি মাল্টিমোডাল ডিফিউশন ট্রান্সফরমার (MMDiT) গ্রহণ করে যাতে জেনারেট করা ছবিগুলিকে বিস্তারিত টেক্সট বর্ণনার সাথে আরও ভালভাবে সারিবদ্ধ করা যায়।
গবেষকরা বিলিয়ন প্যারামিটারে একটি DiT স্কেল করেন এবং চিত্রের গুণমানকে অনুমানযোগ্যভাবে উন্নত করে, গণনা-বাজেটের সিদ্ধান্তগুলিকে নির্দেশ করে।
একটি স্টুডিও ছোট ক্লিপগুলি প্রসারিত করার জন্য একটি ডিআইটি-ভিত্তিক মডেল ব্যবহার করে, অতিরিক্ত ভিডিও ফ্রেমকে অতিরিক্ত প্যাচ টোকেন হিসাবে ব্যবহার করে।
ঝুঁকি এবং প্রহরী
প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।
মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।
আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।
বাস্তবায়ন রোডম্যাপ
নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।
প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।
কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।
মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
স্থানিক ট্রান্সফরমার নেটওয়ার্ক
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Diffusion Transformers?
ডিফিউশন ট্রান্সফরমার (DiTs) একটি ট্রান্সফরমার ব্যাকবোনের জন্য ইমেজ এবং ভিডিও জেনারেটরের কেন্দ্রস্থলে কনভোলিউশনাল ইউ-নেট অদলবদল করে। এই স্থাপত্যটি স্থিতিশীল ডিফিউশন 3 এবং OpenAI এর Sora এর মতো অগ্রগণ্য সিস্টেমগুলিকে শক্তি দেয় এবং আপনি কম্পিউট যোগ করার সাথে সাথে এটি অসাধারণভাবে স্কেল করে।
প্রথাগত ডিফিউশন মডেলের তুলনায় একটি ডিফিউশন ট্রান্সফরমার কোন উপাদান প্রতিস্থাপন করে?
ডিআইটিগুলি ইউ-নেট প্রতিস্থাপন করে, একটি ট্রান্সফরমার ব্যাকবোন দিয়ে ডিনোইসিং সঞ্চালিত কনভোল্যুশনাল নেটওয়ার্ক।
কীভাবে একটি ডিআইটি একটি চিত্রকে এমন কিছুতে পরিণত করে যা একটি ট্রান্সফরমার প্রক্রিয়া করতে পারে?
সুপ্ত চিত্রটি ছোট ছোট প্যাচগুলিতে বিভক্ত, এবং প্রতিটি প্যাচ একটি টোকেন হয়ে ওঠে, একটি ভাষার মডেলের শব্দগুলির সাথে সাদৃশ্যপূর্ণ।
মূল ডিআইটি কাগজে স্কেলিং সম্পর্কে কী পাওয়া গেছে?
ডিআইটি গুণমান একটি পরিষ্কার, অনুমানযোগ্য উপায়ে উন্নত হয় যখন আপনি মডেল গণনা বাড়ান এবং স্কেলিং আইন অনুসরণ করে ছোট প্যাচ ব্যবহার করেন।
কিভাবে DiTs সাধারণত টাইমস্টেপ এবং টেক্সট প্রম্পটের মতো কন্ডিশনিং ইনজেক্ট করে?
ডিআইটি কন্ডিশনিং সিগন্যাল থেকে স্বাভাবিককরণ স্তরগুলির জন্য স্কেল এবং স্থানান্তর পরামিতিগুলির পূর্বাভাস দিতে অভিযোজিত স্তর স্বাভাবিককরণ ব্যবহার করে।
'adaLN-শূন্য' আরম্ভ কি সম্পন্ন করে?
adaLN-zero মডুলেশন শুরু করে তাই প্রতিটি ব্লক প্রাথমিকভাবে পরিচয় হিসাবে কাজ করে, যা প্রশিক্ষণকে স্থিতিশীল করে এবং উন্নত করে।