পরবর্তী আপপরবর্তী গাইড
দ্বিতীয় ক্রম অপ্টিমাইজেশান এবং নিউটন পদ্ধতি
টেকনিক্যাল
প্রযুক্তিগত গাইড
হ্যালুসিনেশন সনাক্তকরণ হল মডেল আউটপুট ফ্ল্যাগ করার কৌশলগুলির সেট যা মিথ্যা বা প্রমাণ দ্বারা সমর্থিত নয়।
প্রধান পদ্ধতিগুলি হল বেশ কয়েকটি উত্তরের নমুনা তৈরি করা এবং তারা সম্মত কিনা তা পরীক্ষা করা, প্রতিটি দাবি উৎস নথি দ্বারা প্রযোজ্য কিনা তা পরীক্ষা করা, টোকেন সম্ভাব্যতার মতো অনিশ্চয়তার সংকেত পড়া এবং বিচারক হিসাবে কাজ করার জন্য একটি দ্বিতীয় মডেলকে বলা। এটা গুরুত্বপূর্ণ কারণ হ্যালুসিনেটেড টেক্সট প্রায়শই সাবলীলভাবে এবং আত্মবিশ্বাসের সাথে পড়ে, তাই ব্যবহারকারীদের কাছে ত্রুটি পৌঁছানোর আগে উত্পাদন সিস্টেমের স্বয়ংক্রিয় পরীক্ষা প্রয়োজন।
সনাক্তকরণ একটি সংকীর্ণ প্রশ্ন জিজ্ঞাসা করে কেন মডেলগুলি হ্যালুসিনেট করে: একটি আউটপুট দেওয়া হলে, এটি কি বিশ্বাস করা যেতে পারে? শক্তিশালী সিস্টেমগুলি সাধারণত নীচের কয়েকটি পদ্ধতিকে একত্রিত করে। স্ব-সংগতি পরীক্ষাগুলি একটি সাধারণ পর্যবেক্ষণের উপর নির্ভর করে। যখন একটি মডেল একটি সত্য জানে, বারবার নমুনাগুলি একমত হতে থাকে, যখন বানোয়াট বিবরণ পরিবর্তিত হয়। SelfCheckGPT (Manakul et al., 2023) এটিকে আনুষ্ঠানিক করেছে। এটি বিভিন্ন প্রতিক্রিয়া তৈরি করে এবং মূল উত্তরের প্রতিটি বাক্য অন্যদের দ্বারা সমর্থিত কিনা তা পরিমাপ করে। পদ্ধতির কোন বাহ্যিক উৎসের প্রয়োজন নেই। ত্রুটিগুলি হল অতিরিক্ত মডেল কল এবং একটি মডেল যখন প্রতিবার একই ভুল উত্তর পুনরাবৃত্তি করে তখন এটি মিস করা ত্রুটিগুলি। উৎস-ভিত্তিক চেকগুলি রেফারেন্স টেক্সটের সাথে আউটপুট তুলনা করে, যা পুনরুদ্ধার-বর্ধিত সিস্টেমের জন্য উপযুক্ত। উত্তরটি পারমাণবিক দাবিতে বিভক্ত, এবং প্রতিটি দাবি পুনরুদ্ধার করা প্যাসেজের বিরুদ্ধে এনটেইলমেন্টের জন্য পরীক্ষা করা হয়। Entailment মানে উত্তরণ যৌক্তিকভাবে দাবি সমর্থন করে। পরীক্ষাটি হয় একটি প্রাকৃতিক ভাষা অনুমান মডেল বা একটি এলএলএম ব্যবহার করে। এই চেকগুলি উত্সগুলির প্রতি বিশ্বস্ততা পরিমাপ করে, যা উত্সগুলি ভুল হলে সত্যের মতো নয়৷ অনিশ্চয়তা সংকেত মডেলের নিজস্ব সম্ভাব্যতা ব্যবহার করে। কম টোকেন সম্ভাবনা বা কী স্প্যানে উচ্চ এনট্রপি যেমন নাম, সংখ্যা এবং তারিখ অনুমান নির্দেশ করতে পারে। শব্দার্থিক এনট্রপি (ফারকুহার এট আল।, 2024 সালে প্রকৃতিতে প্রকাশিত) অনিশ্চয়তা পরিমাপ করার আগে অর্থের ভিত্তিতে উত্তরের নমুনা তৈরি করে, তাই একই উত্তরের বিভিন্ন শব্দকে মতবিরোধ হিসাবে গণনা করা হয় না। টোকেন-স্তরের সংকেতগুলির লগ সম্ভাব্যতাগুলিতে অ্যাক্সেস প্রয়োজন, যা কিছু API সীমাবদ্ধ করে। বিচারক মডেলরা একটি শক্তিশালী এলএলএমকে অসমর্থিত দাবিগুলির জন্য একটি উত্তর গ্রেড করতে বলে, সাধারণত উত্স এবং একটি রুব্রিক সংযুক্ত করে। তারা ভাল মাপকাঠি, কিন্তু বিচারকদের নিজস্ব পক্ষপাত এবং ত্রুটির হার আছে, তাই মানব লেবেলের বিরুদ্ধে তাদের পরীক্ষা করুন। একটি সাধারণ ভুল ধারণা হল যে একজন মডেলকে জিজ্ঞাসা করা 'আপনি কি নিশ্চিত?' নির্ভরযোগ্যভাবে ত্রুটি ধরা. মডেলরা সঠিক উত্তর ত্যাগ করতে পারে বা ভুলগুলিকে রক্ষা করতে পারে। স্ট্রাকচার্ড চেক আরো নির্ভরযোগ্য.
আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।
কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।
ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।
AI পণ্যগুলিতে সনাক্তকরণ একটি আদর্শ স্তর হয়ে উঠছে, এবং মূল্যায়ন প্ল্যাটফর্ম এবং ক্লাউড প্রদানকারীরা এখন গ্রাউন্ডেডনেস এবং বিশ্বস্ততা পরীক্ষা অফার করে। একটি মডেলের অভ্যন্তরীণ অ্যাক্টিভেশন থেকে অনিশ্চয়তার লক্ষণগুলি পড়ার উপর গবেষণা চলতে থাকে এবং প্রশিক্ষণের মডেলগুলি পরিহার করার জন্য বা ক্যালিব্রেটেড আত্মবিশ্বাসকে রাষ্ট্র করার জন্য। কোন পদ্ধতি সম্পূর্ণ নয়। গ্রাউন্ডিং চেকগুলি ভুল উত্সগুলিকে ঠিক করতে পারে না এবং অনিশ্চয়তার সংকেতগুলি আত্মবিশ্বাসী ত্রুটিগুলি মিস করে৷ সম্ভাব্য দিকটি একটি একক আবিষ্কারকের পরিবর্তে স্তরযুক্ত প্রতিরক্ষা। সস্তা নির্ধারক চেক প্রথমে আসে, তারপর গ্রাউন্ডেড ভেরিফিকেশন, হাই-স্টেক আউটপুটের জন্য মানুষের পর্যালোচনা সহ।
একটি আইনি গবেষণা টুল খসড়া উত্তর থেকে প্রতিটি ক্ষেত্রে উদ্ধৃতি বের করে এবং উত্তর দেখানোর আগে প্রতিটি মামলা-আইন ডাটাবেসে বিদ্যমান কিনা তা পরীক্ষা করে।
একটি সমর্থন বট যা পুনরুদ্ধার ব্যবহার করে তার উত্তরকে পৃথক দাবিতে বিভক্ত করে এবং পুনরুদ্ধার করা সহায়তা নিবন্ধগুলির বিরুদ্ধে প্রতিটি পরীক্ষা করে। কোন সমর্থন ছাড়া দাবি একটি নোট যে তারা নিশ্চিত করা যায়নি সঙ্গে প্রতিস্থাপিত হয়.
একটি সিস্টেম নমুনা র্যান্ডমনেস চালু করে পাঁচবার একই বাস্তব প্রশ্ন জিজ্ঞাসা করে। যদি প্রত্যাবর্তিত জন্ম তারিখ ভিন্ন হয়, উত্তরটি কম আত্মবিশ্বাস হিসাবে চিহ্নিত করা হয়।
প্রতিদিন, একজন বিচারক মডেল অসমর্থিত বিবৃতিগুলির জন্য একটি রুব্রিকের বিপরীতে উত্পন্ন সারাংশের একটি নমুনাকে গ্রেড করে এবং একজন ব্যক্তি এটি ফ্ল্যাগ করে এমন কিছু পর্যালোচনা করে।
একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।
অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।
সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।
বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।
বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।
ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।
স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
হ্যালুসিনেশন সনাক্তকরণ হল মডেল আউটপুট ফ্ল্যাগ করার কৌশলগুলির সেট যা মিথ্যা বা প্রমাণ দ্বারা সমর্থিত নয়। প্রধান পদ্ধতিগুলি হল বেশ কয়েকটি উত্তরের নমুনা তৈরি করা এবং তারা সম্মত কিনা তা পরীক্ষা করা, প্রতিটি দাবি উৎস নথি দ্বারা প্রযোজ্য কিনা তা পরীক্ষা করা, টোকেন সম্ভাব্যতার মতো অনিশ্চয়তার সংকেত পড়া এবং বিচারক হিসাবে কাজ করার জন্য একটি দ্বিতীয় মডেলকে বলা। এটা গুরুত্বপূর্ণ কারণ হ্যালুসিনেটেড টেক্সট প্রায়শই সাবলীলভাবে এবং আত্মবিশ্বাসের সাথে পড়ে, তাই ব্যবহারকারীদের কাছে ত্রুটি পৌঁছানোর আগে উত্পাদন সিস্টেমের স্বয়ংক্রিয় পরীক্ষা প্রয়োজন।
নমুনা জুড়ে চুক্তি জ্ঞানের জন্য একটি প্রক্সি। নমুনা থেকে নমুনাতে পরিবর্তিত বিবরণগুলি মডেলটি অনুমান করছে বলে প্রস্তাব করে৷
যদি একটি মডেল আত্মবিশ্বাসের সাথে এবং ধারাবাহিকভাবে ভুল হয়, তার নমুনা সম্মত হয় এবং চেক পাস হয়। বেশ কিছু নমুনা তৈরি করা খরচ যোগ করে।
এই চেকগুলি রেফারেন্স টেক্সট দ্বারা দাবি সমর্থিত কিনা তা পরীক্ষা করে। রেফারেন্স ভুল হলে, একটি বিশ্বস্ত উত্তর এখনও মিথ্যা হতে পারে.
অর্থ দ্বারা গোষ্ঠীবদ্ধ করা মানে একই উত্তরের বিভিন্ন শব্দকে মতবিরোধ হিসাবে গণনা করা হয় না। শুধুমাত্র সত্যিকারের ভিন্ন উত্তর অনিশ্চয়তা স্কোর বাড়ায়।
একটি প্রয়োজনীয় উদ্ধৃতি উৎসের বিরুদ্ধে যান্ত্রিকভাবে পরীক্ষা করা যেতে পারে, যা যাচাইকারীকে ধরে রাখে যা তাদের ন্যায্যতা আবিষ্কার করে।
শিখতে থাকুন
এই বিষয়ের জন্য বাছাই করা আরও গাইড
পরবর্তী আপপরবর্তী গাইড
দ্বিতীয় ক্রম অপ্টিমাইজেশান এবং নিউটন পদ্ধতি
টেকনিক্যাল