পরবর্তী আপপরবর্তী গাইড
এআই ইমেজ এবং অডিওর জন্য অদৃশ্য ওয়াটারমার্ক
ভিজ্যুয়াল এআই
ভিজ্যুয়াল এআই গাইড
অডিও-চালিত AI ঠোঁট সিঙ্ক একটি মুখের ভিডিও সম্পাদনা করে যাতে এর মুখের নড়াচড়া একটি নতুন স্পিচ ট্র্যাকের সাথে মেলে, শব্দ থেকেই মুখের আকারের পূর্বাভাস দেয়।
পাঠ এবং চলচ্চিত্রগুলিকে অন্যান্য ভাষায় ডাব করার জন্য এবং পুনরায় রেকর্ড করা সংলাপ ঠিক করার জন্য এটি গুরুত্বপূর্ণ। একই কৌশল সত্যিকারের লোকেদের এমন কথা বলতে দেখাতে পারে যা তারা কখনও বলেনি।
Wav2Lip, 2020 সালে IIIT হায়দ্রাবাদের (ACM মাল্টিমিডিয়া) গবেষকদের দ্বারা প্রকাশিত, হল সবচেয়ে পরিচিত ওপেন লিপ সিঙ্ক মডেল এবং ক্ষেত্রের জন্য একটি দরকারী টেমপ্লেট৷ প্রতিটি টার্গেট ফ্রেমের জন্য, জেনারেটর তিনটি ইনপুট পায়: মুখের নীচের অর্ধেক মুখোশ, একই ব্যক্তির একটি রেফারেন্স ফ্রেম যা উপস্থিতি সরবরাহ করে এবং সেই মুহূর্তের চারপাশে অডিওর একটি ছোট মেল-স্পেকট্রোগ্রাম উইন্ডো। একটি এনকোডার-ডিকোডার নেটওয়ার্ক তারপর মুখের অঞ্চলে রঙ করে, এবং ফলাফলটি মূল ভিডিওতে মিশ্রিত হয়। মূল অবদান ছিল SyncNet-এর উপর ভিত্তি করে প্রাক-প্রশিক্ষিত "বিশেষজ্ঞ" সিঙ্ক বৈষম্যকারী। এটি প্রশিক্ষণের সময় হিমায়িত থাকে এবং মুখের ফ্রেমের একটি সংক্ষিপ্ত রান অডিওর সাথে মেলে কিনা তা বিচার করে। পূর্বের পদ্ধতিগুলি জেনারেটরের সাথে যৌথভাবে একটি সিঙ্ক বৈষম্যকারীকে প্রশিক্ষিত করেছিল এবং সেই বৈষম্যকারীরা সিঙ্কের দুর্বল বিচারক হিসাবে পরিণত হয়েছিল। Wav2Lip একটি পৃথক ভিজ্যুয়াল-গুণমান বৈষম্যকারীও ব্যবহার করেছে। এর দুর্বলতা ছিল কম-রেজোলিউশনের মুখের ফসল, ঝাপসা দাঁত এবং দৃশ্যমান সীম বা মুখোশের সীমানায় ঝাঁকুনি। পরবর্তী সিস্টেম যেমন VideoReTalking, MuseTalk এবং ডিফিউশন-ভিত্তিক LatentSync এর লক্ষ্য তীক্ষ্ণ, আরও স্থিতিশীল ফলাফলের জন্য। গুণমান বিভিন্ন উপায়ে বিচার করা হয়। LSE-D SyncNet-এর অডিও এবং ভিডিও এম্বেডিংয়ের মধ্যে দূরত্ব পরিমাপ করে, যেখানে কম হলে ভাল। LSE-C SyncNet-এর আত্মবিশ্বাস পরিমাপ করে, যেখানে উচ্চতর ভাল। ছবি-গুণমানের মেট্রিক্স যেমন FID এবং মানুষের রেটিং বাস্তবতাকে কভার করে। একটি সাধারণ ভুল ধারণা হল একটি ভাল সিঙ্ক স্কোর মানে একটি বাস্তবসম্মত ভিডিও। অতিরঞ্জিত মুখের গতি ভাল স্কোর করতে পারে এবং এখনও ভুল দেখতে পারে, তাই মানুষের মূল্যায়ন অপরিহার্য। একটি চ্যালেঞ্জ হল যে অনেক ফোনেম একই দৃশ্যমান মুখের আকৃতি বা ভিসেম ভাগ করে, তাই অডিও-টু-মাউথ ম্যাপিং অনেক-টু-এক। অপব্যবহার সরাসরি প্রযুক্তি থেকে অনুসরণ করে: ঠোঁট সিঙ্কের সাথে একটি ক্লোন করা ভয়েস যুক্ত করা বিশ্বাসযোগ্য জাল বিবৃতি তৈরি করতে পারে। গবেষকরা দেখিয়েছেন যে ফোনেম এবং ভিসেমের মধ্যে অমিল, বিশেষ করে 'm', 'b' এবং 'p'-এ ঠোঁট বন্ধ না হওয়া, এই ধরনের নকল প্রকাশ করতে পারে।
ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।
সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।
অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।
ঠোঁট সিঙ্ক ডাবিং এবং ভিডিও স্থানীয়করণ সরঞ্জামগুলির একটি আদর্শ বৈশিষ্ট্য হয়ে উঠছে, এবং গবেষণা উচ্চতর রেজোলিউশন, স্থিতিশীল দাঁত এবং জিহ্বা, এবং শুধুমাত্র মুখের পরিবর্তে পুরো মুখের অভিব্যক্তি এবং মাথার গতি সিঙ্ক করার দিকে এগিয়ে চলেছে৷ সনাক্তকরণ একটি অস্ত্রের প্রতিযোগিতা: জেনারেটরের উন্নতির সাথে সাথে ফোনমে-ভিসিমে অমিলের মতো ফরেনসিক সংকেতগুলি দুর্বল হয়ে যায়। কিছু বিচারব্যবস্থা প্রতারণামূলক সিন্থেটিক মিডিয়া নিয়ন্ত্রণ করতে শুরু করেছে, বিশেষ করে নির্বাচনকে ঘিরে। দেখানো ব্যক্তির কাছ থেকে সম্মতি, স্পষ্ট প্রকাশ, এবং উত্স লেবেলিং সম্ভবত দায়িত্বশীল ব্যবহারের কেন্দ্রে থাকবে।
একজন অনলাইন কোর্স প্রদানকারী একটি বক্তৃতা স্প্যানিশ ভাষায় ডাব করে এবং ঠোঁট সিঙ্ক ব্যবহার করে যাতে প্রশিক্ষকের মুখ অনুবাদকৃত অডিওর সাথে মেলে, ভিডিওর বিবরণে সম্পাদনাটি লক্ষ্য করে।
একজন ভিডিও এডিটর দৃশ্যটি পুনঃশুট করার পরিবর্তে অভিনেতার সম্মতিতে শুটিংয়ের পরে পুনরায় রেকর্ড করা সংলাপের একটি লাইনে অভিনেতার মুখের সাথে সিঙ্ক করে।
একজন ফ্যাক্ট-চেকার একজন রাজনীতিকের ভাইরাল ক্লিপ পরীক্ষা করেন এবং লক্ষ্য করেন যে 'b', 'p' এবং 'm' ধ্বনিতে ঠোঁট কখনই পুরোপুরি বন্ধ হয় না, এটি একটি ঠোঁট-সিঙ্ক করা নকলের একটি পরিচিত চিহ্ন।
একজন গবেষক টক-হেড ক্লিপগুলির একটি সেটে Wav2Lip চালান এবং LSE-D এবং LSE-C এর সাথে ফলাফলগুলিকে একটি নতুন ডিফিউশন-ভিত্তিক লিপ সিঙ্ক মডেলের সাথে তুলনা করতে স্কোর করেন।
প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।
মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।
আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।
নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।
প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।
কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।
মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
অডিও-চালিত AI ঠোঁট সিঙ্ক একটি মুখের ভিডিও সম্পাদনা করে যাতে এর মুখের নড়াচড়া একটি নতুন স্পিচ ট্র্যাকের সাথে মেলে, শব্দ থেকেই মুখের আকারের পূর্বাভাস দেয়। পাঠ এবং চলচ্চিত্রগুলিকে অন্যান্য ভাষায় ডাব করার জন্য এবং পুনরায় রেকর্ড করা সংলাপ ঠিক করার জন্য এটি গুরুত্বপূর্ণ। একই কৌশল সত্যিকারের লোকেদের এমন কথা বলতে দেখাতে পারে যা তারা কখনও বলেনি।
আসল মুখ লুকিয়ে রেখে, মুখের আকৃতি নির্ধারণ করতে জেনারেটরকে অডিওর উপর নির্ভর করতে হবে।
জেনারেটরের সাথে যৌথভাবে প্রশিক্ষিত বৈষম্যকারীরা সিঙ্কের দুর্বল বিচারক ছিল। একটি হিমায়িত বিশেষজ্ঞ একটি নির্ভরযোগ্য সংকেত দেয়।
LSE-D একটি দূরত্ব, তাই ছোট মান মানে অডিও এবং মুখ এম্বেডিং কাছাকাছি, যার মানে আরও ভাল সিঙ্ক৷
রেফারেন্স ফ্রেম পরিচয় এবং টেক্সচার প্রদান করে। অডিও মুখের আকৃতি প্রদান করে।
Wav2Lip ছোট মুখের ফসলে কাজ করে, তাই মুখ এবং দাঁত প্রায়শই তীক্ষ্ণ পার্শ্ববর্তী ফ্রেমের পাশে নরম দেখায়।
শিখতে থাকুন
এই বিষয়ের জন্য বাছাই করা আরও গাইড
পরবর্তী আপপরবর্তী গাইড
এআই ইমেজ এবং অডিওর জন্য অদৃশ্য ওয়াটারমার্ক
ভিজ্যুয়াল এআই