চিত্র ভিডিও ক্যাসকেড
ইমেজেন ভিডিও হল Google এর 2022 টেক্সট-টু-ভিডিও সিস্টেম যা সাতটি ডিফিউশন মডেলের ক্যাসকেডের মাধ্যমে একটি ক্লিপ তৈরি করে, প্রতিটিতে আরও ফ্রেম বা আরও বেশি রেজোলিউশন যোগ করা হয়।
ওভারভিউ
এটি গুরুত্বপূর্ণ কারণ এটি দেখিয়েছিল যে কীভাবে স্ট্যাকিং বিশেষায়িত পর্যায়গুলি একক প্রম্পট থেকে উচ্চ-সংজ্ঞা, অস্থায়ীভাবে মসৃণ ভিডিও তৈরি করতে পারে।
গভীর ডুব
ইমেজেন ভিডিও, অক্টোবর 2022 সালে Google গবেষণা দ্বারা প্রবর্তিত, ইমেজেন টেক্সট-টু-ইমেজ পদ্ধতিকে গতিতে প্রসারিত করে। একটি হিমায়িত T5 টেক্সট এনকোডার প্রম্পটকে সমৃদ্ধ ভাষা এম্বেডিং-এ পরিণত করে যা প্রতিটি পর্যায়ে কন্ডিশন করে। একটি বেস ডিফিউশন মডেল প্রথমে একটি ছোট, কম-ফ্রেম-রেট ভিডিও তৈরি করে, তারপরে আরও ছয়টি ডিফিউশন মডেলের একটি ক্যাসকেড পর্যায়ক্রমে টেম্পোরাল সুপার-রেজোলিউশন (বিদ্যমানগুলির মধ্যে ফ্রেম যুক্ত করা) এবং স্থানিক সুপার-রেজোলিউশন (পিক্সেল রেজোলিউশন বৃদ্ধি) সঞ্চালন করে। সম্পূর্ণ পাইপলাইন প্রতি সেকেন্ডে 24 ফ্রেমে প্রায় 1280x768 ভিডিও আউটপুট করে, কয়েক সেকেন্ড দীর্ঘ। যেহেতু গভীর ভাষা বোঝা টেক্সট এনকোডারে বাস করে, ইমেজেন ভিডিও সুস্পষ্ট স্টাইল করা পাঠ্য, বৈচিত্র্যময় শৈল্পিক নান্দনিকতা এবং 3D-সচেতন অবজেক্ট মোশন রেন্ডার করতে পারে, এটি প্রদর্শন করে যে সতর্ক স্টেজিং বিটগুলি একটি বিশাল মডেলে সবকিছু করার চেষ্টা করে।
প্রযুক্তিগত অন্তর্দৃষ্টি
ক্যাসকেড একটি অসম্ভব কঠিন এক-শট প্রজন্মকে পরিচালনাযোগ্য উপ-সমস্যাগুলিতে বিভক্ত করে। সাতটি ডিফিউশন মডেল ক্রমানুসারে চলে: একটি বেস জেনারেটর প্লাস তিনটি স্থানিক এবং তিনটি টেম্পোরাল সুপার-রেজোলিউশন মডেল। প্রত্যেকটি প্রম্পট এম্বেডিং এবং পূর্ববর্তী পর্যায়ের আউটপুটের উপর শর্তযুক্ত। ভি-প্রেডিকশন প্যারামিটারাইজেশন এবং প্রগতিশীল পাতনের মতো কৌশলগুলি নমুনা তৈরির গতি বাড়ায়, যখন শ্রেণীবিন্যাস-মুক্ত নির্দেশিকা চেইনের প্রতিটি পর্যায়ে তাত্ক্ষণিক আনুগত্যকে শক্তিশালী করে।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।
পছন্দগুলি তৈরি করুন
সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।
টিম এবং ওয়ার্কফ্লো
অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।
ইমেজেন ভিডিও ক্যাসকেডের ভবিষ্যত
ক্যাসকেডেড পিক্সেল-স্পেস পাইপলাইনগুলি ধারণাটি প্রমাণ করেছে তবে গণনা-ভারী এবং ধীর। ক্ষেত্রটি মূলত সুপ্ত প্রসারণ এবং ট্রান্সফরমার ব্যাকবোনের দিকে স্থানান্তরিত হয়েছে যা একটি সংকুচিত স্থানে উৎপন্ন করে, গুণমান বজায় রেখে খরচ কমিয়ে দেয়। তবুও, ইমেজেন ভিডিওর পাঠ, 'কী,' 'কীভাবে চলে,' এবং 'কতটা তীক্ষ্ণ'-এর কাজগুলিকে আলাদা করে বহু-পর্যায় এবং পরিমার্জিত নকশাগুলিকে অবহিত করে চলেছে, এবং এর T5-কন্ডিশনিং শৈলী পরবর্তীতে উচ্চ-বিশ্বস্ততা, পাঠ্য-বিশ্বস্ত জেনারেটরকে প্রভাবিত করেছে।
বাস্তব-বিশ্ব বাস্তবায়ন
একটি প্রম্পট থেকে সুপাঠ্য স্টাইলাইজড অন-স্ক্রীন পাঠ্য সহ একটি উচ্চ-সংজ্ঞা ক্লিপ তৈরি করা
জলরঙ থেকে কাদামাটি পর্যন্ত একাধিক শিল্প শৈলীতে একই বর্ণিত দৃশ্য রেন্ডার করা
সংক্ষিপ্ত 3D-সচেতন বস্তুর অ্যানিমেশন তৈরি করা যেমন একটি ঘূর্ণায়মান, চলমান ভাস্কর্য
একটি লিখিত বিবরণ থেকে সরাসরি মসৃণ 24fps মার্কেটিং বা ধারণা ক্লিপ তৈরি করা
ঝুঁকি এবং প্রহরী
প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।
মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।
আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।
বাস্তবায়ন রোডম্যাপ
নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।
প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।
কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।
মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Imagen Video Cascades quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
Sora এবং টেক্সট-টু-ভিডিও
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
ইমেজেন ভিডিও ক্যাসকেডস কী?
ইমেজেন ভিডিও হল Google এর 2022 টেক্সট-টু-ভিডিও সিস্টেম যা সাতটি ডিফিউশন মডেলের ক্যাসকেডের মাধ্যমে একটি ক্লিপ তৈরি করে, প্রতিটিতে আরও ফ্রেম বা আরও বেশি রেজোলিউশন যোগ করা হয়। এটি গুরুত্বপূর্ণ কারণ এটি দেখিয়েছে যে কীভাবে স্পেশালাইজড স্টেজ স্ট্যাকিং একটি একক প্রম্পট থেকে উচ্চ-সংজ্ঞা, অস্থায়ীভাবে মসৃণ ভিডিও তৈরি করতে পারে।
কতটি ডিফিউশন মডেল ইমেজেন ভিডিও ক্যাসকেড তৈরি করে?
ইমেজেন ভিডিও সাতটি ডিফিউশন মডেল ব্যবহার করে: একটি বেস জেনারেটর প্লাস তিনটি স্থানিক এবং তিনটি টেম্পোরাল সুপার-রেজোলিউশন মডেল।
একটি টেম্পোরাল সুপার-রেজোলিউশন স্টেজ ক্যাসকেডে কী করে?
টেম্পোরাল সুপার-রেজোলিউশন ফ্রেম রেট বাড়াতে অতিরিক্ত ফ্রেমকে ইন্টারপোলেট করে, যখন স্থানিক সুপার-রেজোলিউশন পিক্সেল রেজোলিউশন বাড়ায়।
ইমেজেন ভিডিওতে কোন কম্পোনেন্ট টেক্সট প্রম্পটকে এনকোড করে?
ইমেজেন ভিডিও, ইমেজেনের মতো, একটি বড় হিমায়িত T5 পাঠ্য এনকোডার ব্যবহার করে এমবেডিং তৈরি করতে যা প্রতিটি ডিফিউশন পর্যায়ে শর্ত দেয়।
কেন একটি বড় মডেল পরিবর্তে একটি ক্যাসকেড মধ্যে প্রজন্ম বিভক্ত?
প্রতিটি পর্যায় একটি সংকীর্ণ কাজ সমাধান করে, একটি মোটা ড্রাফ্ট তৈরি করে, ফ্রেম যোগ করে, বা রেজোলিউশন যোগ করে, যা একবারে সবকিছু করার চেয়ে আরও সহজ।
ইমেজেন ভিডিও উল্লেখযোগ্যভাবে কোন ক্ষমতা প্রদর্শন করেছে?
এর শক্তিশালী T5 পাঠ্য বোঝার জন্য ধন্যবাদ, ইমেজেন ভিডিও পাঠযোগ্য স্টাইলযুক্ত পাঠ্য এবং শৈল্পিক নন্দনতত্ত্বের বিস্তৃত পরিসর রেন্ডার করতে পারে।