ভিজ্যুয়াল এআই গাইড

VQGAN এবং কোডবুক ইমেজ সংশ্লেষণ

VQGAN একটি শেখা কোডবুক থেকে আঁকা বিচ্ছিন্ন টোকেনগুলির একটি গ্রিডে চিত্রগুলিকে সংকুচিত করে, একটি ট্রান্সফরমারকে ভাষা মডেলগুলি যেভাবে পাঠ্য তৈরি করে একইভাবে চিত্রগুলি তৈরি করতে দেয়৷

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

গভীর ডুব

VQGAN, 2021-এর গবেষণাপত্র 'Taming Transformers for High-Resolution Image Synthesis'-এ প্রবর্তিত, একটি ভেক্টর-কোয়ান্টাইজড অটোএনকোডার (VQVAE) প্রতিপক্ষ এবং অনুধাবনমূলক প্রশিক্ষণের সাথে একত্রিত করে। একটি এনকোডার ফিচার ভেক্টরের একটি ছোট গ্রিডে একটি ছবি ম্যাপ করে; প্রতিটি ভেক্টরকে 1024টি বিযুক্ত কোডের একটি শেখা কোডবুকের নিকটতম এন্ট্রিতে স্ন্যাপ করা হয়, যা ইমেজটিকে পূর্ণসংখ্যা টোকেনের একটি অনুক্রমে পরিণত করে। একটি ডিকোডার সেই টোকেনগুলি থেকে চিত্রটিকে পুনর্গঠন করে, একটি GAN বৈষম্যকারী এবং উপলব্ধিগত ক্ষতির সাথে প্রশিক্ষিত হয় যাতে পুনর্গঠনগুলি ঝাপসা না হয়ে তীক্ষ্ণ দেখায়৷ যেহেতু ছবিগুলি এখন বিচ্ছিন্ন টোকেন সিকোয়েন্স, একটি অটোরিগ্রেসিভ ট্রান্সফরমার সেগুলিকে ভাষার মতো মডেল করতে পারে, একের পর এক টোকেনগুলির ভবিষ্যদ্বাণী করে৷ VQGAN বিখ্যাতভাবে চালিত প্রারম্ভিক টেক্সট-টু-ইমেজ আর্ট টুলস যখন CLIP গাইডেন্সের সাথে পেয়ার করা হয়।

প্রযুক্তিগত অন্তর্দৃষ্টি

মূল অপারেশনটি হল ভেক্টর কোয়ান্টাইজেশন: ক্রমাগত এনকোডার আউটপুটগুলি তাদের নিকটতম কোডবুক ভেক্টর দ্বারা প্রতিস্থাপিত হয়, একটি 'স্ট্রেইট-থ্রু' গ্রেডিয়েন্ট এস্টিমেটর সহ, যাতে এনকোডার অ-পার্থক্যপূর্ণ সন্ধান সত্ত্বেও শিখতে পারে। অটোএনকোডারের উপরে একটি প্যাচ-ভিত্তিক GAN ডিসক্রিমিনেটর যোগ করা যা VQGAN-কে VQVAE-এর তুলনায় অনেক ছোট টোকেন গ্রিড (যেমন 16x16) ব্যবহার করতে দেয় যখন টেক্সচারগুলি খাস্তা রাখে, ট্রান্সফরমার মডেলিংকে ট্র্যাক্টেবল করে।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।

পছন্দগুলি তৈরি করুন

সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।

টিম এবং ওয়ার্কফ্লো

অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।

VQGAN এবং কোডবুক ইমেজ সংশ্লেষণের ভবিষ্যত

VQGAN এর বিচ্ছিন্ন-টোকেন রেসিপি টোকেন-ভিত্তিক ইমেজ এবং ভিডিও মডেলগুলির ভিত্তি হয়ে উঠেছে, মাস্কজিআইটি থেকে মাল্টিমোডাল সিস্টেম যা একটি ট্রান্সফরমারে চিত্র এবং পাঠ্য টোকেনগুলিকে মিশ্রিত করে। গবেষণা এখন বৃহত্তর, সসীম-স্কেলার বা লুক-আপ-মুক্ত কোডবুকগুলির দিকে ঠেলে দেয় যা কোডবুকের পতন এড়ায় এবং একীভূত মডেলগুলির দিকে যেখানে একই শব্দভাণ্ডার চিত্র, অডিও এবং ভাষাকে বিস্তৃত করে, যে কোনও প্রজন্মকে সক্ষম করে৷

বাস্তব-বিশ্ব বাস্তবায়ন

কোডবুক টোকেনগুলির একটি 16x16 গ্রিডে একটি ফটো এনকোড করা হচ্ছে যাতে একটি ট্রান্সফরমার এটিকে মডেল এবং পুনরায় তৈরি করতে পারে

2021 সালে ভাইরাল হওয়া পরাবাস্তব 'VQGAN+CLIP' AI আর্ট তৈরি করতে CLIP নির্দেশিকা সহ VQGAN-কে যুক্ত করা

দক্ষ স্টোরেজ বা ডাউনস্ট্রিম জেনারেটিভ প্রশিক্ষণের জন্য চিত্রগুলিকে কম্প্যাক্ট বিযুক্ত কোডগুলিতে সংকুচিত করা

মাস্কজিআইটি এবং মাল্টিমোডাল ট্রান্সফরমারের মতো বৃহত্তর টোকেন-ভিত্তিক জেনারেটরের মধ্যে ইমেজ টোকেনাইজার হিসাবে পরিবেশন করা

ঝুঁকি এবং প্রহরী

প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।

মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।

আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।

2

প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।

3

কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।

4

মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

SPADE শব্দার্থিক চিত্র সংশ্লেষণ

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is VQGAN and Codebook Image Synthesis?

VQGAN একটি শেখা কোডবুক থেকে আঁকা বিচ্ছিন্ন টোকেনগুলির একটি গ্রিডে চিত্রগুলিকে সংকুচিত করে, একটি ট্রান্সফরমারকে ভাষা মডেলগুলি যেভাবে পাঠ্য তৈরি করে একইভাবে চিত্রগুলি তৈরি করতে দেয়৷

বিযুক্ত টোকেন হিসাবে একটি চিত্রকে উপস্থাপন করতে VQGAN কী ব্যবহার করে?

VQGAN একটি শেখা কোডবুকের নিকটতম এন্ট্রিতে এনকোডার বৈশিষ্ট্যগুলিকে পরিমাপ করে, চিত্রটিকে বিচ্ছিন্ন কোড সূচকগুলির একটি ক্রমতে পরিণত করে।

কেন VQGAN একটি VQVAE এর উপরে একটি GAN বৈষম্যকারী যোগ করে?

প্রতিকূলতামূলক এবং উপলব্ধিগত ক্ষতিগুলি VQGAN কে একটি কমপ্যাক্ট টোকেন গ্রিড থেকে খাস্তা চিত্রগুলিকে পুনর্গঠন করতে দেয়, যা VQVAE একাই ঝাপসা করে দেয়।

একবার একটি চিত্র টোকেনের একটি ক্রম হলে, কোন মডেলটি নতুন চিত্র তৈরি করে?

যেহেতু ছবিগুলি বিচ্ছিন্ন টোকেন সিকোয়েন্সে পরিণত হয়, একটি ট্রান্সফরমার পাঠ্য তৈরি করার মতোই সেগুলিকে স্বয়ংক্রিয়ভাবে মডেল করতে পারে।

কোন কৌশলটি গ্রেডিয়েন্টকে অ-পার্থক্যযোগ্য পরিমাপকরণ ধাপের মাধ্যমে প্রবাহিত করতে দেয়?

ভেক্টর কোয়ান্টাইজেশন অ-পার্থক্যযোগ্য, তাই VQGAN এনকোডারকে প্রশিক্ষিত করার জন্য একটি স্ট্রেইট-থ্রু গ্রেডিয়েন্ট এস্টিমেটর ব্যবহার করে।

2021 সালে VQGAN কোন বিখ্যাত AI শিল্প প্রবণতা তৈরি করতে সাহায্য করেছিল?

VQGAN কে CLIP গাইডেন্সের সাথে পেয়ার করা ব্যাপকভাবে শেয়ার করা 'VQGAN+CLIP' শিল্প তৈরি করেছে যা পাঠ্য-চালিত চিত্র প্রজন্মকে জনপ্রিয় করেছে।