ভিজ্যুয়াল এআই গাইড

ভিজ্যুয়াল স্লাম

ভিজ্যুয়াল SLAM একটি চলমান ক্যামেরাকে একটি অজানা স্থানের একটি মানচিত্র তৈরি করতে দেয় এবং একই সাথে সেই মানচিত্রের ভিতরে তার নিজস্ব অবস্থান ট্র্যাক করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It is the spatial backbone of robots, drones, AR headsets, and self-driving features.

গভীর ডুব

SLAM এর অর্থ হল একযোগে স্থানীয়করণ এবং ম্যাপিং, এবং ভিজ্যুয়াল ভেরিয়েন্টটি লিডার বা রাডারের পরিবর্তে (বা পাশাপাশি) ক্যামেরা ব্যবহার করে এটি সমাধান করে। ক্যামেরা নড়াচড়া করার সাথে সাথে, সিস্টেমটি কোণ এবং প্রান্তের মতো স্বতন্ত্র বৈশিষ্ট্যগুলি সনাক্ত করে, সেগুলিকে ফ্রেমে মেলে এবং দৃশ্যের 3D কাঠামো এবং ক্যামেরার গতিপথ উভয় অনুমান করতে সেই বিন্দুগুলির আপাত গতি ব্যবহার করে। কঠিন অংশটি হল মুরগি-এবং-ডিম জোড়া: আপনি কোথায় আছেন তা জানার জন্য আপনার একটি মানচিত্র প্রয়োজন, তবে মানচিত্রটি তৈরি করতে আপনাকে কোথায় তা জানতে হবে। ভিজ্যুয়াল SLAM এটিকে যৌথভাবে মোকাবেলা করে, প্রায়ই হাজার হাজার পয়েন্ট এবং পোজ একবারে পরিমার্জন করে। এটি ARKit, ARCore, Meta কোয়েস্টের ভিতরের-আউট ট্র্যাকিং, মার্স রোভার, এবং গুদামঘর রোবটগুলিকে ক্ষমতা দেয়, যেখানে GPS ব্যর্থ হয় বাড়ির ভিতরে কাজ করে৷

প্রযুক্তিগত অন্তর্দৃষ্টি

একটি সাধারণ পাইপলাইনের একটি ফ্রন্ট এন্ড থাকে যা ফিচার ফ্রেম টু ফ্রেম (ORB, SIFT বা সরাসরি ফটোমেট্রিক পদ্ধতি ব্যবহার করে) ট্র্যাক করে এবং একটি পিছনের প্রান্ত যা মানচিত্রটিকে অপ্টিমাইজ করে। বান্ডেল সামঞ্জস্য যৌথভাবে অনেক ক্যামেরার ভঙ্গি এবং 3D পয়েন্ট জুড়ে রিপ্রজেকশন ত্রুটি কমিয়ে দেয়, যখন লুপ ক্লোজার সনাক্ত করে যখন ক্যামেরা একটি জায়গা পুনঃভিজিট করে এবং জমা ড্রিফট সংশোধন করে। মনোকুলার SLAM পরম স্কেল পুনরুদ্ধার করতে পারে না, তাই এটি ঠিক করতে স্টেরিও ক্যামেরা বা একটি জড়তা পরিমাপ ইউনিট (IMU) মিশ্রিত করা হয়।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভিজ্যুয়াল এআই স্কেলে পরিদর্শন, সনাক্তকরণ এবং ট্যাগিং কাজগুলি স্বয়ংক্রিয়ভাবে করতে পারে।

পছন্দগুলি তৈরি করুন

সৃজনশীল দলগুলি কম ম্যানুয়াল সংশোধন সহ ধারণাগুলিকে দ্রুত প্রোটোটাইপ করতে পারে।

টিম এবং ওয়ার্কফ্লো

অপারেশনগুলি ইমেজ এবং ভিডিও সংকেত ব্যবহার করতে পারে যা আগে প্রক্রিয়া করা কঠিন ছিল।

ভিজ্যুয়াল SLAM এর ভবিষ্যত

ক্ষেত্রটি হস্ত-নির্মিত বৈশিষ্ট্য থেকে শিক্ষিত বৈশিষ্ট্য, শেখার গভীরতা এবং এন্ড-টু-এন্ড নিউরাল SLAM-এর দিকে স্থানান্তরিত হচ্ছে যা টেক্সচার-হীন দেয়াল, মোশন ব্লার এবং পরিবর্তনশীল আলোতে আরও শক্তিশালী। নিউরাল রেডিয়েন্স ক্ষেত্র এবং গাউসিয়ান স্প্ল্যাটিং স্পেস পয়েন্ট মেঘের পরিবর্তে ঘন, ফটোরিয়্যালিস্টিক মানচিত্র তৈরি করতে SLAM-এ মিশে যাচ্ছে। ফোন এবং হেডসেটগুলিতে আরও টাইট ভিজ্যুয়াল-ইনর্শিয়াল ফিউশন আশা করুন, প্লাস শব্দার্থিক SLAM যা বস্তুকে লেবেল করে, রোবটগুলিকে একটি দৃশ্য সম্পর্কে যুক্তি দিতে সক্ষম করে, কেবল তার জ্যামিতিতে নেভিগেট করে না।

বাস্তব-বিশ্ব বাস্তবায়ন

Meta কোয়েস্ট এবং অ্যাপল ভিশন প্রো হেডসেটগুলিতে ইনসাইড-আউট পজিশনাল ট্র্যাকিং, বাহ্যিক বেস স্টেশন ছাড়াই একটি ঘরে ব্যবহারকারীকে সনাক্ত করা

Apple ARKit এবং Google ARCore ভার্চুয়াল আসবাবপত্র বা গেমের চরিত্রগুলিকে ফোনে আসল মেঝে এবং টেবিলে নোঙ্গর করে

নাসার মঙ্গল গ্রহের রোভারগুলি ভিজ্যুয়াল ওডোমেট্রি এবং ম্যাপিং ব্যবহার করে ভূখণ্ড নেভিগেট করার জন্য যেখানে কোনও জিপিএস নেই

স্বায়ত্তশাসিত গুদাম রোবট এবং ইনডোর ডেলিভারি রোবট মেঝে মানচিত্র তৈরি করে এবং তাকগুলির মধ্যে স্থানীয়করণ করে

ঝুঁকি এবং প্রহরী

প্রমাণ অস্পষ্ট হলে ছবির অধিকার এবং সম্মতি আইনি ঝুঁকিতে পরিণত হতে পারে।

মডেলের কর্মক্ষমতা আলো, জনসংখ্যা এবং পরিবেশ জুড়ে পরিবর্তিত হতে পারে।

আস্থার থ্রেশহোল্ডগুলি পর্যবেক্ষণ করা না হলে মিথ্যা ইতিবাচকগুলি অলক্ষিত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

নির্ভুলতা, প্রত্যাহার, এবং ত্রুটি খরচের জন্য গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করুন।

2

প্রকৃত উৎপাদন অবস্থার সাথে মেলে এমন ডেটা দিয়ে পরীক্ষা করুন।

3

কম-আস্থা বা উচ্চ-প্রভাব ভবিষ্যদ্বাণীর জন্য মানুষের পর্যালোচনা যোগ করুন।

4

মডেল ড্রিফ্ট ট্র্যাক করুন এবং ক্যামেরা বা ডেটাসেট পরিবর্তনের পরে পুনরায় যাচাই করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual SLAM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

ভিজ্যুয়াল রিজনিং

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Visual SLAM?

ভিজ্যুয়াল SLAM একটি চলমান ক্যামেরাকে একটি অজানা স্থানের একটি মানচিত্র তৈরি করতে দেয় এবং একই সাথে সেই মানচিত্রের ভিতরে তার নিজস্ব অবস্থান ট্র্যাক করে। এটি রোবট, ড্রোন, এআর হেডসেট এবং স্ব-ড্রাইভিং বৈশিষ্ট্যগুলির স্থানিক মেরুদণ্ড।

SLAM এর সংক্ষিপ্ত রূপ কিসের জন্য দাঁড়ায়?

SLAM মানে একযোগে স্থানীয়করণ এবং ম্যাপিং: একই সময়ে আপনার অবস্থান খুঁজে বের করার সময় একটি মানচিত্র তৈরি করা।

কেন মনোকুলার (একক-ক্যামেরা) ভিজ্যুয়াল SLAM তার নিজের উপর পরম স্কেল পুনরুদ্ধার করতে অক্ষম?

একটি ক্যামেরা এবং অন্য কোন কিউ না থাকলে, একটি ছোট আশেপাশের দৃশ্য এবং একটি বড় দূরের দৃশ্য একই রকম দেখতে পারে, তাই সত্যিকারের মেট্রিক স্কেলটি স্টেরিও বা একটি IMU ছাড়াই অস্পষ্ট।

একটি SLAM সিস্টেমে লুপ বন্ধ করার উদ্দেশ্য কি?

ছোট ট্র্যাকিং ত্রুটিগুলি সময়ের সাথে ড্রিফট হিসাবে জমা হয়; ক্যামেরা একটি পরিচিত স্থানে ফিরে এসেছে তা সনাক্ত করা সিস্টেমটিকে পুরো ট্র্যাজেক্টোরি সংশোধন করতে দেয়।

SLAM ব্যাক এন্ডে বান্ডেল সমন্বয় কী অপ্টিমাইজ করে?

বান্ডেল সামঞ্জস্য যৌথভাবে অনেক ক্যামেরা অবস্থান এবং মানচিত্র পয়েন্টগুলিকে পরিমার্জন করে যাতে প্রজেক্ট করা 3D পয়েন্টগুলি সবথেকে ভাল মেলে যেখানে বৈশিষ্ট্যগুলি আসলে চিত্রগুলিতে উপস্থিত হয়৷

কেন একটি IMU (জড়তা পরিমাপ ইউনিট) প্রায়ই ভিজ্যুয়াল SLAM-এ ক্যামেরার সাথে মিশ্রিত করা হয়?

অ্যাক্সিলোমিটার এবং জাইরোস্কোপগুলি গতি অনুমান সরবরাহ করে যা মোশন ব্লার মাধ্যমে ট্র্যাকিংকে স্থিতিশীল করে এবং স্কেল সমাধানে সহায়তা করে, যা একটি একক ক্যামেরা পারে না।