টিউন-এ-ভিডিও ওয়ান-শট এডিটিং
টিউন-এ-ভিডিও একটি একক ভিডিওতে একটি পূর্বপ্রশিক্ষিত টেক্সট-টু-ইমেজ ডিফিউশন মডেলকে সূক্ষ্ম-টিউন করে যাতে এটি নতুন পাঠ্য প্রম্পট থেকে সেই ক্লিপটিকে পুনরায় সম্পাদনা করতে পারে।
ওভারভিউ
It matters because it showed you don't need massive video datasets to get text-driven video editing working.
গভীর ডুব
টিউন-এ-ভিডিও, 2022 সালের শেষের দিকে প্রবর্তিত, 'ওয়ান-শট ভিডিও জেনারেশন'-কে সামলাচ্ছে: আপনি এটিকে একটি সোর্স ভিডিও এবং একটি ক্যাপশন দেন এবং এটি মূল গতি বজায় রেখে নতুন প্রম্পটের অধীনে সেই ভিডিওটি পুনরায় তৈরি করার জন্য যথেষ্ট শেখে (একটি বিষয়, শৈলী বা বৈশিষ্ট্য পরিবর্তন করা)। স্ক্র্যাচ থেকে একটি ভিডিও মডেলকে প্রশিক্ষণ দেওয়ার পরিবর্তে, এটি 2D কনভল্যুশন এবং সময় অক্ষ জুড়ে মনোযোগ প্রসারিত করে একটি ছদ্ম-ভিডিও মডেলে একটি পূর্ব-প্রশিক্ষিত পাঠ্য-টু-ইমেজ মডেল (স্থিতিশীল ডিফিউশন) স্ফীত করে। এটি তখন একক ক্লিপে শুধুমাত্র প্যারামিটারের একটি ছোট সেট ঠিক করে। অনুমানে, সোর্স ফ্রেমের ডিডিআইএম ইনভার্সন স্ট্রাকচারকে অ্যাঙ্কর করে তাই এডিটগুলি ফ্রেম-টু-ফ্রেমে ঝিমঝিম করার পরিবর্তে সাময়িকভাবে সামঞ্জস্যপূর্ণ থাকে।
প্রযুক্তিগত অন্তর্দৃষ্টি
মূল কৌশলটি হল 'এক-শট টিউনিং' স্পার্স স্প্যাটিও-টেম্পোরাল মনোযোগ সহ। ইমেজ মডেলের স্ব-মনোযোগ পুনর্বিন্যাস করা হয়েছে যাতে প্রতিটি ফ্রেম প্রথম ফ্রেম এবং পূর্ববর্তী ফ্রেমে উপস্থিত থাকে, উপস্থিতি প্রচার করে এবং গতির সমন্বয় জোরদার করে। শুধুমাত্র মনোযোগ অভিক্ষেপ ম্যাট্রিক্স (এবং টেম্পোরাল লেয়ার) আপডেট করা হয়, টিউনিং দ্রুত এবং সস্তা রেখে। ডিডিআইএম ইনভার্সন সোর্স ফ্রেমগুলিকে আবার নয়েজে রূপান্তরিত করে যাতে জেনারেশন এলোমেলো শব্দের পরিবর্তে গঠন-সংরক্ষণকারী সুপ্ত থেকে শুরু হয়।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।
পছন্দগুলি তৈরি করুন
সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।
টিম এবং ওয়ার্কফ্লো
অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।
টিউন-এ-ভিডিও ওয়ান-শট সম্পাদনার ভবিষ্যত
টিউন-এ-ভিডিও টিউনিং-মুক্ত এবং শূন্য-শট উত্তরসূরির (ভিডিও-পি2পি, ফেটজিরো, টেক্সট2ভিডিও-জিরো, পিক্স2ভিডিও) একটি তরঙ্গ তৈরি করেছে যা সম্পূর্ণভাবে প্রতি-ক্লিপ প্রশিক্ষণ এড়িয়ে চলে। প্রবণতাটি শক্তিশালী টেম্পোরাল মডিউল এবং নেটিভ ভিডিও ডিফিউশন ব্যাকবোনগুলির সাথে তাত্ক্ষণিকভাবে নির্বিচারে ক্লিপগুলি সম্পাদনা করার দিকে। ফাউন্ডেশন ভিডিও মডেল যেমন Sora-শৈলী সিস্টেমগুলি সূক্ষ্ম-টিউনিং কাজের পরিবর্তে একটি অন্তর্নির্মিত ক্ষমতা সামঞ্জস্যপূর্ণ, প্রম্পট-চালিত সম্পাদনা করে তোলে হিসাবে এক-শট পদ্ধতির ম্লান হওয়ার প্রত্যাশা করুন।
বাস্তব-বিশ্ব বাস্তবায়ন
মূল খোদাই গতি সংরক্ষণ করার সময় 'একজন মানুষ স্কিইং'-এর একটি ক্লিপকে 'স্পাইডার-ম্যান স্কিইং'-এ পরিণত করা
একটি বাস্তব হাঁটা-কুকুর ভিডিও একটি ভ্যান গগ বা জলরঙের অ্যানিমেটেড চেহারাতে রিস্টাইল করা
একটি বিষয়ের বৈশিষ্ট্যগুলিকে অদলবদল করা, যেমন একটি পান্ডা খাওয়া বাঁশকে কোয়ালা খাওয়া বাঁশে পরিণত করা
বিভিন্ন প্রম্পট সহ একটি রেফারেন্স ক্লিপ সম্পাদনা করে বিজ্ঞাপনের জন্য সংক্ষিপ্ত ধারণা অ্যানিমেশনের প্রোটোটাইপিং
ঝুঁকি এবং প্রহরী
প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।
মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।
আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।
বাস্তবায়ন রোডম্যাপ
নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।
প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।
কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।
মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tune-A-Video One-Shot Editing quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
মেক-এ-ভিডিও টেক্সট-টু-ভিডিও
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Tune-A-Video One-Shot Editing?
টিউন-এ-ভিডিও একটি একক ভিডিওতে একটি পূর্বপ্রশিক্ষিত টেক্সট-টু-ইমেজ ডিফিউশন মডেলকে সূক্ষ্ম-টিউন করে যাতে এটি নতুন পাঠ্য প্রম্পট থেকে সেই ক্লিপটিকে পুনরায় সম্পাদনা করতে পারে। এটি গুরুত্বপূর্ণ কারণ এটি দেখিয়েছে যে পাঠ্য-চালিত ভিডিও সম্পাদনা কাজ করার জন্য আপনার বিশাল ভিডিও ডেটাসেটের প্রয়োজন নেই।
ভিডিওর জন্য মানিয়ে নেওয়ার আগে টিউন-এ-ভিডিও কোন বেস মডেল থেকে শুরু হয়?
টিউন-এ-ভিডিও বিশাল ভিডিও কর্পোরার উপর প্রশিক্ষণের পরিবর্তে একটি ছদ্ম-ভিডিও মডেলে একটি পূর্বপ্রশিক্ষিত পাঠ্য-থেকে-ইমেজ ডিফিউশন মডেলকে 'স্ফীত করে'৷
টিউন-এ-ভিডিওতে 'ওয়ান-শট' কী বোঝায়?
এক-শট মানে মডেলটি একটি একক ইনপুট ভিডিও এবং এর ক্যাপশনে সম্পাদনার জন্য পুনরায় অনুরোধ জানানোর আগে সূক্ষ্ম সুর করা হয়েছে৷
কীভাবে টিউন-এ-ভিডিও সম্পাদিত ফ্রেমগুলি সাময়িকভাবে সামঞ্জস্যপূর্ণ রাখে?
ক্রস-ফ্রেম (স্পার্স স্প্যাটিও-টেম্পোরাল) মনোযোগ প্রতিটি ফ্রেমকে প্রথম এবং আগের ফ্রেমের দিকে তাকাতে দেয়, চেহারা এবং গতি প্রচার করে।
ডিডিআইএম ইনভার্সন অনুমানের সময়ে কী ভূমিকা পালন করে?
ডিডিআইএম ইনভার্সন আসল ফ্রেমগুলিকে আবার শব্দে ম্যাপ করে, তাই প্রজন্ম একটি সুপ্ত থেকে শুরু হয় যা মূল কাঠামো এবং গতি সংরক্ষণ করে।
টিউনিংয়ের সময়, টিউন-এ-ভিডিও প্রাথমিকভাবে দক্ষ থাকার জন্য কী আপডেট করে?
এটি একটি সীমিত উপসেটকে সূক্ষ্ম সুর করে, প্রধানত মনোযোগের অনুমান এবং অস্থায়ী স্তর, প্রক্রিয়াটিকে হালকা রাখে।