ভিশন ট্রান্সফরমার
ভিশন ট্রান্সফরমার (ViTs) ট্রান্সফরমার আর্কিটেকচার প্রয়োগ করে যা ChatGPT ছবিগুলিতে ক্ষমতা দেয়, একটি ছবিকে পিক্সেলের গ্রিডের পরিবর্তে প্যাচের ক্রম হিসাবে বিবেচনা করে।
ওভারভিউ
They proved that you do not need convolutions to achieve state-of-the-art image recognition.
গভীর ডুব
বছরের পর বছর ধরে, কনভোলিউশনাল নিউরাল নেটওয়ার্ক (CNNs) একটি ইমেজ জুড়ে ছোট ফিল্টার স্ক্যান করে কম্পিউটার ভিশনে আধিপত্য বিস্তার করে। Google-এর 2020 কাগজ 'An Image Is Worth 16x16 Words' একটি ইমেজকে স্থির প্যাচে, সাধারণত 16x16 পিক্সেল, প্রতিটিকে একটি ভেক্টরে চ্যাপ্টা করে, এবং ফলাফলের ক্রমটিকে একটি আদর্শ ট্রান্সফরমারে খাওয়ানোর মাধ্যমে এটিকে চ্যালেঞ্জ করেছে৷ প্রতিটি প্যাচ একটি 'টোকেন' হয়ে ওঠে, অনেকটা বাক্যে একটি শব্দের মতো। মডেলটি তখন স্ব-মনোযোগ ব্যবহার করে যাতে প্রতিটি প্যাচ সরাসরি অন্য প্রতিটি প্যাচের সাথে সম্পর্কিত হতে পারে, দীর্ঘ-পরিসরের সম্পর্কগুলিকে ক্যাপচার করে একটি ছোট কনভোল্যুশনাল ফিল্টার এক ধাপে দেখতে পারে না। ধরা: ViTs ডেটা-ক্ষুধার্ত কারণ তাদের মধ্যে CNN-এর অন্তর্নির্মিত অনুমানের অভাব রয়েছে। JFT-300M-এর মতো বিশাল ডেটাসেটের উপর প্রশিক্ষিত, তারা সেরা CNN-এর সাথে মিলে যায় বা পরাজিত করে, আধুনিক দৃষ্টি গবেষণাকে নতুন আকার দেয়।
প্রযুক্তিগত অন্তর্দৃষ্টি
একটি ViT একটি ইমেজকে নন-ওভারল্যাপিং প্যাচগুলিতে বিভক্ত করে, রৈখিকভাবে প্রতিটিকে একটি এম্বেডিংয়ে প্রজেক্ট করে এবং অবস্থানগত এনকোডিং যোগ করে যাতে মডেলটি জানে যে প্রতিটি প্যাচ আসল ছবিতে কোথায় বসেছে। একটি বিশেষ শেখার যোগ্য 'ক্লাস টোকেন' পূর্বে লেখা হয়; এর চূড়ান্ত উপস্থাপনা শ্রেণীবিভাগ চালায়। স্তুপীকৃত স্ব-মনোযোগ স্তরগুলি প্রতিটি প্যাচকে অন্য সমস্ত থেকে তথ্য ওজন করতে দেয়, স্তর এক থেকে একটি বিশ্বব্যাপী গ্রহণযোগ্য ক্ষেত্র দেয়। কারণ মনোযোগ স্কেল প্যাচের সংখ্যার সাথে চতুর্মুখীভাবে, উচ্চ-রেজোলিউশনের ছবিগুলি ব্যয়বহুল হয়ে ওঠে, এই কারণেই প্যাচের আকার এবং দক্ষ মনোযোগের বৈচিত্রগুলি গুরুত্বপূর্ণ।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।
পছন্দগুলি তৈরি করুন
সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।
টিম এবং ওয়ার্কফ্লো
অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।
ভিশন ট্রান্সফরমারের ভবিষ্যত
ViTs এবং CNN-ট্রান্সফরমার হাইব্রিডগুলি এখন নেতৃত্বদানকারী ভিশন সিস্টেমগুলিকে শক্তি দেয়, এবং আর্কিটেকচার মাল্টিমোডাল মডেলগুলিকে আন্ডারপিন করে যা CLIP এবং আধুনিক দৃষ্টি-ভাষা সহকারীর মতো পাঠ্যের সাথে চিত্রগুলিকে ফিউজ করে৷ উচ্চ-রেজোলিউশন এবং ভিডিওর জন্য মনোযোগকে সস্তা করার জন্য অবিরত কাজ আশা করুন, এছাড়াও স্ব-তত্ত্বাবধানে প্রি-ট্রেনিং (যেমন মাস্কড-ইমেজ মডেলিং) যা প্রচুর লেবেলযুক্ত-ডেটা ক্ষুধা হ্রাস করে। কম্পিউট বাড়ার সাথে সাথে, 'ভাষা মডেল' এবং 'ভিশন মডেল'-এর মধ্যে লাইনটি অস্পষ্ট হতে থাকে, ট্রান্সফরমারগুলি পৃথক বিশেষ ডিজাইনের পরিবর্তে মোডালিটি জুড়ে একটি ভাগ করা ব্যাকবোন হিসাবে কাজ করে।
বাস্তব-বিশ্ব বাস্তবায়ন
Google এর চিত্র শ্রেণীবিভাগ এবং অনুসন্ধান র্যাঙ্কিং সিস্টেম যা ভিআইটি সিএনএন-এর সাথে প্রতিযোগিতামূলক প্রমাণিত হওয়ার পরে ট্রান্সফরমার ব্যাকবোন গ্রহণ করেছিল
CLIP এবং অন্যান্য ইমেজ-টেক্সট মডেল যেগুলি ছবি এনকোড করার জন্য একটি ViT ব্যবহার করে যাতে ফটো এবং ক্যাপশন শেয়ার করা যায়গায় মেলে
শুধুমাত্র স্থানীয় টেক্সচারের পরিবর্তে একটি সম্পূর্ণ স্ক্যান জুড়ে প্যাটার্ন চিহ্নিত করতে ViTs ব্যবহার করে মেডিকেল ইমেজিং গবেষণা
স্ব-ড্রাইভিং এবং রোবোটিক্স উপলব্ধি স্ট্যাক যা দৃশ্যের সম্পূর্ণ ক্ষেত্র জুড়ে দৃশ্য বোঝার জন্য ভিআইটি-স্টাইল মনোযোগকে একত্রিত করে
ঝুঁকি এবং প্রহরী
প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।
মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।
আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।
বাস্তবায়ন রোডম্যাপ
নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।
প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।
কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।
মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
CLIP এবং ভিশন-ভাষা মডেল
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Vision Transformers?
ভিশন ট্রান্সফরমার (ViTs) ট্রান্সফরমার আর্কিটেকচার প্রয়োগ করে যা ChatGPT ছবিগুলিতে ক্ষমতা দেয়, একটি ছবিকে পিক্সেলের গ্রিডের পরিবর্তে প্যাচের ক্রম হিসাবে বিবেচনা করে। তারা প্রমাণ করেছে যে অত্যাধুনিক চিত্রের স্বীকৃতি অর্জনের জন্য আপনার কনভোল্যুশনের প্রয়োজন নেই।
কিভাবে একটি ভিশন ট্রান্সফরমার প্রাথমিকভাবে একটি ইনপুট ইমেজ প্রক্রিয়া করে?
একটি ViT চিত্রটিকে নির্দিষ্ট প্যাচে (প্রায়শই 16x16 পিক্সেল) ভাগ করে, প্রতিটি প্যাচকে একটি টোকেন হিসাবে এম্বেড করে এবং ক্রমটিকে একটি ট্রান্সফরমারে ফিড করে।
কোন মূল প্রক্রিয়া একটি ViT একটি ছবির দূরবর্তী অংশ একে অপরের সাথে সম্পর্কিত করতে দেয়?
স্ব-মনোযোগ প্রতিটি প্যাচকে অন্য প্রতিটি প্যাচ থেকে সরাসরি তথ্য ওজন করতে দেয়, প্রথম স্তর থেকে একটি বিশ্বব্যাপী দৃষ্টিভঙ্গি দেয়।
কেন প্লেইন ভিশন ট্রান্সফরমারদের সাধারণত এক্সেল করার জন্য খুব বড় প্রশিক্ষণ ডেটাসেটের প্রয়োজন হয়?
সিএনএন-এর বিপরীতে, ভিআইটিগুলি স্থানীয়তা বা অনুবাদের পরিবর্তনের অনুমান করে না, তাই তাদের অবশ্যই প্রচুর পরিমাণে ডেটা থেকে এই নিদর্শনগুলি শিখতে হবে।
একটি ভিশন ট্রান্সফরমারে অবস্থানগত এনকোডিংয়ের উদ্দেশ্য কী?
স্ব-মনোযোগ আদেশ-অজ্ঞেয়বাদী, তাই অবস্থানগত এনকোডিং প্রতিটি প্যাচের স্থানিক অবস্থান পুনরুদ্ধার করে।
কোন বিবৃতি কম্পিউটার দৃষ্টিতে ViT-এর প্রভাবকে সর্বোত্তমভাবে প্রতিফলিত করে?
ভিআইটি প্রমাণ করেছে যে একটি বিশুদ্ধ ট্রান্সফরমার, পর্যাপ্ত ডেটা এবং স্কেল সহ, সেরা কনভোলিউশনাল নেটওয়ার্কগুলির প্রতিদ্বন্দ্বী বা অতিক্রম করতে পারে।