ভিজ্যুয়াল এআই গাইড

অঞ্চল ভিত্তিক সিএনএন

অঞ্চল-ভিত্তিক সিএনএন (আর-সিএনএন) হল অবজেক্ট ডিটেক্টরের একটি পরিবার যা প্রথমে একটি ছবিতে প্রার্থীর অঞ্চল প্রস্তাব করে, তারপর প্রতিটি বস্তুকে শ্রেণীবদ্ধ করতে এবং সুনির্দিষ্টভাবে বক্স করার জন্য একটি সিএনএন ব্যবহার করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

They turned image classification into full object detection, locating and labeling many objects at once.

গভীর ডুব

ছবির শ্রেণীবিভাগ উত্তর 'এই ছবিতে কী আছে?' কিন্তু সনাক্তকরণেরও উত্তর দিতে হবে 'কোথায়, কতজন?' মূল R-CNN (2014) একটি বহিরাগত অ্যালগরিদম (নির্বাচিত অনুসন্ধান) ব্যবহার করে প্রায় 2,000 অঞ্চল প্রস্তাব করেছে, প্রতিটিকে একটি নির্দিষ্ট আকারে বিকৃত করেছে, এবং প্রতিটিতে একটি সিএনএন চালায়, যা সঠিক কিন্তু বেদনাদায়কভাবে ধীর ছিল। দ্রুত R-CNN পুরো চিত্রের উপর একবার CNN চালিয়ে এবং অঞ্চল প্রতি বৈশিষ্ট্যগুলি পুল করে (RoI পুলিং) এর গতি বাড়িয়েছে। দ্রুততর R-CNN তারপর সিলেক্টিভ সার্চকে একটি শেখা অঞ্চল প্রস্তাব নেটওয়ার্ক (RPN) দিয়ে প্রতিস্থাপিত করেছে, পুরো পাইপলাইনকে এন্ড-টু-এন্ড এবং রিয়েল-টাইমের কাছাকাছি করে। মাস্ক R-CNN প্রতিটি সনাক্ত করা বস্তুর জন্য পিক্সেল-স্তরের মাস্ক আউটপুট করার জন্য এটিকে আরও প্রসারিত করেছে।

প্রযুক্তিগত অন্তর্দৃষ্টি

মূল কার্যকারিতা লিপ হল RoI পুলিং: প্রতিটি প্রস্তাবিত বাক্সে একটি CNN পুনরায় চালানোর পরিবর্তে, নেটওয়ার্ক চিত্রের জন্য একটি ভাগ করা বৈশিষ্ট্য মানচিত্র গণনা করে, তারপর একটি নির্দিষ্ট গ্রিডে আগ্রহের প্রতিটি অঞ্চলের মধ্যে বৈশিষ্ট্যগুলিকে ক্রপ করে এবং পুনরায় আকার দেয়৷ দ্রুততর R-CNN-এর RPN সেই বৈশিষ্ট্য মানচিত্রের উপর স্লাইড করে 'অবজেক্টনেস' স্কোর এবং বিভিন্ন আকার এবং আকৃতির অনুপাতের প্রিসেট অ্যাঙ্কর বক্সের জন্য বক্স সমন্বয়ের পূর্বাভাস দেয়, প্রায় বিনামূল্যে প্রস্তাবগুলি তৈরি করে।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।

পছন্দগুলি তৈরি করুন

সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।

টিম এবং ওয়ার্কফ্লো

অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।

অঞ্চল ভিত্তিক সিএনএন এর ভবিষ্যত

দুই-পর্যায়ের R-CNN ডিটেক্টরগুলি শক্তিশালী থাকে যেখানে নির্ভুলতা সবচেয়ে গুরুত্বপূর্ণ, কিন্তু একক-পর্যায়ের ডিটেক্টর (YOLO, SSD) এবং DETR-এর মতো ট্রান্সফরমার-ভিত্তিক ডিটেক্টর, যেগুলি হস্ত-পরিকল্পিত অ্যাঙ্কর এবং প্রস্তাবনাগুলি সম্পূর্ণভাবে এড়িয়ে যায়, গতি এবং সরলতার জন্য ক্রমবর্ধমান জনপ্রিয়। প্রবণতা এন্ড-টু-এন্ড, অ্যাঙ্কর-মুক্ত, ক্যোয়ারী-ভিত্তিক সনাক্তকরণের দিকে। তবুও, R-CNN বংশের মূল ধারণা, ভাগ করা বৈশিষ্ট্য এবং অঞ্চল-স্তরের যুক্তি, বিভাজন, ভিডিও এবং 3D সনাক্তকরণ সিস্টেমকে প্রভাবিত করে চলেছে।

বাস্তব-বিশ্ব বাস্তবায়ন

ইনভেন্টরি ম্যানেজমেন্টের জন্য খুচরা তাকগুলিতে পণ্যগুলি সনাক্ত করা এবং গণনা করা

মাস্ক আর-সিএনএন ব্যবহার করে মেডিকেল স্ক্যানে কোষ বা অঙ্গগুলির বিভাজন

একটি কারখানার উৎপাদন লাইনে ত্রুটি এবং তাদের অবস্থান চিহ্নিত করা

স্বায়ত্তশাসিত-ড্রাইভিং ক্যামেরা ফিডে একাধিক যানবাহন এবং পথচারীদের সনাক্ত করা

ঝুঁকি এবং প্রহরী

প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।

মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।

আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।

2

প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।

3

কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।

4

মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Region-Based CNNs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

স্কোর-ভিত্তিক জেনারেটিভ মডেল

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Region-Based CNNs?

অঞ্চল-ভিত্তিক সিএনএন (আর-সিএনএন) হল অবজেক্ট ডিটেক্টরের একটি পরিবার যা প্রথমে একটি ছবিতে প্রার্থীর অঞ্চল প্রস্তাব করে, তারপর প্রতিটি বস্তুকে শ্রেণীবদ্ধ করতে এবং সুনির্দিষ্টভাবে বক্স করার জন্য একটি সিএনএন ব্যবহার করে। তারা চিত্রের শ্রেণীবিভাগকে সম্পূর্ণ অবজেক্ট সনাক্তকরণে পরিণত করেছে, একসাথে অনেকগুলি বস্তুর অবস্থান এবং লেবেল করা হয়েছে।

একটি অঞ্চল ভিত্তিক CNN এর মূল ধারণা কি?

R-CNNs এমন অঞ্চলের প্রস্তাব করে যাতে বস্তু থাকতে পারে, তারপর প্রতিটি অঞ্চলকে শ্রেণীবদ্ধ করতে এবং এর বাউন্ডিং বক্সকে পরিমার্জিত করতে একটি CNN চালান।

কেন মূল R-CNN (2014) ধীর ছিল?

আসল আর-সিএনএন সিএনএনকে স্বাধীনভাবে প্রতি ছবিতে প্রায় 2,000টি অঞ্চলের প্রস্তাবে চালায়, যা অত্যন্ত গণনামূলকভাবে ব্যয়বহুল ছিল।

নির্বাচনী অনুসন্ধান প্রতিস্থাপনের জন্য দ্রুত আর-সিএনএন কী প্রবর্তন করেছে?

দ্রুততর R-CNN একটি শিক্ষিত অঞ্চল প্রস্তাবনা নেটওয়ার্ক চালু করেছে, যা প্রপোজাল জেনারেশনকে প্রশিক্ষিত নেটওয়ার্কের অংশ এবং আরও দ্রুততর করে তুলেছে।

RoI পুলিং কি সম্পন্ন করে?

RoI পুলিং অঞ্চল প্রতি একটি একক ভাগ করা বৈশিষ্ট্য মানচিত্র থেকে ফিক্সড-সাইজ ফিচার গ্রিড বের করে, পুনর্গণনা এড়ায় এবং সনাক্তকরণ দ্রুত করে।

মাস্ক আর-সিএনএন কী অতিরিক্ত ক্ষমতা যোগ করে?

মাস্ক R-CNN প্রতিটি বস্তুর জন্য একটি সুনির্দিষ্ট পিক্সেল-স্তরের মুখোশ ভবিষ্যদ্বাণী করে, উদাহরণ বিভাজন সক্ষম করে দ্রুত R-CNN প্রসারিত করে।