সংবাদে ফিরে যান
নিরাপত্তাAI Understanding ব্রিফিং

প্রতিকূল পরীক্ষাগুলি এলএলএম শেখার ক্ষেত্রে বড় ফাঁকগুলি প্রকাশ করে

একটি প্রিপ্রিন্ট রিপোর্ট করে যে ভাষার মডেলগুলি কৌশলগত প্রতিকূল প্রম্পটের অধীনে এটি পুনরুদ্ধার করার সময় সাধারণ পরীক্ষার অধীনে লক্ষ্যযুক্ত তথ্য ভুলে যেতে পারে বলে মনে হতে পারে।

6 min readRead the primary source
Primary-source image accompanying Adversarial tests expose major gaps in LLM unlearning
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.21606
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বড় ভাষা মডেল (LLM)
টেক্সট তৈরি এবং বিশ্লেষণ করার জন্য বিশাল টেক্সট কর্পোরার উপর প্রশিক্ষিত একটি ভাষা মডেল।
বিচারক হিসেবে এলএলএম
মূল্যায়নের সময় অন্যান্য মডেল থেকে আউটপুট স্কোর বা তুলনা করার জন্য একটি ভাষা মডেল ব্যবহার করা।
ফাইন-টিউনিং
একটি নির্দিষ্ট কাজের জন্য একটি প্রাক-প্রশিক্ষিত মডেলকে মানিয়ে নিতে ডোমেন-নির্দিষ্ট ডেটার উপর অবিরত প্রশিক্ষণ।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

গবেষকরা একটি ভাষা মডেল থেকে লক্ষ্যযুক্ত তথ্য অপসারণের জন্য প্রম্পট-ভিত্তিক এবং সূক্ষ্ম-টিউনিং-ভিত্তিক পদ্ধতিগুলি মূল্যায়ন করেছেন। তারা দেখেছে যে স্ট্যান্ডার্ড ক্লিন-কোয়েরি মেট্রিক্সে ভাল স্কোর করার পদ্ধতিগুলি অনুমিতভাবে ভুলে যাওয়া তথ্য পুনরুদ্ধার করার জন্য প্রতিপক্ষের প্রচেষ্টার জন্য অত্যন্ত ঝুঁকিপূর্ণ ছিল।

arXiv প্রিপ্রিন্ট মেশিন আনলার্নিং পরীক্ষা করে, একটি মডেলের অন্যান্য ক্ষমতা সংরক্ষণ করার সময় নির্বাচিত প্রশিক্ষণ ডেটার প্রভাব অপসারণের উদ্দেশ্যে কৌশলগুলির একটি পরিবার। লেখকরা একটি মৌলিক মূল্যায়ন সমস্যার উপর ফোকাস করেন: একটি মডেল সরাসরি জিজ্ঞাসা করা হলে তথ্য প্রকাশ করা বন্ধ করে দিতে পারে, তবুও সতর্কতার সাথে পরিকল্পিত প্রম্পটের মাধ্যমে সেই তথ্য পুনরুদ্ধার করার জন্য একজন দৃঢ় সংকল্প ব্যবহারকারীর জন্য যথেষ্ট পরিমাণে শেখা উপস্থাপনা বজায় রাখে। তাদের কেন্দ্রীয় দাবি হল যে সাধারণ পরীক্ষার অধীনে আপাত ভুলে যাওয়াকে শক্তিশালী দুর্গমতার প্রমাণ হিসাবে বিবেচনা করা উচিত নয়।

গবেষকরা Meta-এর Llama-3.2-3B-ইন্সট্রাক্ট মডেল ব্যবহার করে TOFU বেঞ্চমার্কে প্রম্পট-ভিত্তিক এবং সূক্ষ্ম-টিউনিং-ভিত্তিক অশিক্ষার পদ্ধতিগুলির একটি সমন্বিত মূল্যায়ন পরিচালনা করেন। তারা প্রথমে এমন পদ্ধতিগুলি সনাক্ত করে যা স্ট্যান্ডার্ড মেট্রিক্সের অধীনে দৃঢ়ভাবে কাজ করে, তারপর সেই পদ্ধতিগুলিকে প্রতিকূল দৃঢ়তা পরীক্ষার বিষয়বস্তু করে। কাগজে আটটি অ্যাটাক স্যুট বর্ণনা করা হয়েছে যা আপাতদৃষ্টিতে সফলভাবে অশিক্ষা সত্ত্বেও লক্ষ্যযুক্ত তথ্য বের করা যায় কিনা তা তদন্ত করার উদ্দেশ্যে। উত্সটি তার বিমূর্তটিতে নির্দিষ্ট করে না যে প্রতিটি স্যুটে কতগুলি পৃথক উদাহরণ বা প্রম্পট ব্যবহার করা হয়েছিল৷

কাগজটি অ্যাটাক সাকসেস রেট, বা ASR, একটি LLM-বিচারক পরিমাপ প্রবর্তন করে যা বিপক্ষ প্রতিক্রিয়ার ভগ্নাংশ হিসাবে সংজ্ঞায়িত করা হয়েছে যার ফাঁসের স্কোর 0.2 ছাড়িয়ে গেছে। রিপোর্ট করা পরীক্ষা-নিরীক্ষায়, বেশ কিছু ফাইন-টিউনিং-ভিত্তিক পদ্ধতি পরিচ্ছন্ন মূল্যায়নের অধীনে 0.91-এর উপরে ফরগেট কোয়ালিটি অর্জন করেছে, কিন্তু তাদের প্রতিকূল ASR 72.8% থেকে 84.3% পর্যন্ত ছিল। অরক্ষিত বেস মডেলের ASR ছিল 87.5%, যা এই আক্রমণের অধীনে পরীক্ষিত অশিক্ষার পদ্ধতিগুলিকে তুলনামূলকভাবে আসল মডেলের কাছাকাছি রেখেছিল। তুলনা করে, পরিষ্কার বহুভাষিক সংস্কারগুলি 2.95% এর পরিমাপিত ফুটো হার তৈরি করেছে। লেখক নিজেও দশটি ক্ষেত্রে নিরীক্ষা করেছেন। তারা এই সাতটি ক্ষেত্রে বাইনারি ASR সিদ্ধান্ত এবং মানুষের বাস্তব মূল্যায়নের মধ্যে চুক্তির রিপোর্ট করে, এটি প্রমাণ হিসাবে উপস্থাপন করে যে ASR আচরণগত পুনরুদ্ধারযোগ্যতার একটি দরকারী কিন্তু অপূর্ণ সংকেত।

উত্সটি কাজটিকে পিয়ার-রিভিউ করা প্রকাশনার পরিবর্তে 21 আগস্ট, 2026-এ জমা দেওয়া একটি arXiv প্রিপ্রিন্ট হিসাবে চিহ্নিত করে৷ এটির বিমূর্ত প্রতিবেদন ফলাফল, কিন্তু এটি প্রতিষ্ঠিত করে না যে পরীক্ষিত কৌশলগুলি মডেল পরামিতিগুলি থেকে স্থায়ীভাবে তথ্য মুছে দেয় বা প্রতিকূল প্রম্পটিংয়ের প্রতিটি ফর্ম একই ফলাফল তৈরি করবে।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

ফলাফলগুলি পরামর্শ দেয় যে কেবলমাত্র ক্লিন-কোয়েরি স্কোরগুলি প্রমাণ করার জন্য যথেষ্ট নয় যে একটি এলএলএম নির্ভরযোগ্যভাবে ডেটা ভুলে গেছে। গোপনীয়তা, ডেটা-অপসারণ, এবং সুরক্ষা দাবিগুলি মূল্যায়নকারী বিকাশকারীদের জন্য আরও শক্তিশালী পরীক্ষা গুরুত্বপূর্ণ হতে পারে, যদিও অধ্যয়নটি একটি বেঞ্চমার্ক, একটি মডেল এবং লেখকদের মূল্যায়ন ডিজাইনের মধ্যে সীমাবদ্ধ।

প্রায়োগিক তাত্পর্য প্রযুক্তিগত যতটা পদ্ধতিগত। যদি একটি মডেলকে শুধুমাত্র প্রত্যক্ষ, অ-বিরোধী প্রশ্ন দিয়ে মূল্যায়ন করা হয়, তাহলে ডেভেলপাররা উপসংহারে আসতে পারেন যে একটি টার্গেট করা আইটেম সরানো হয়েছে যখন মডেলটি শুধুমাত্র সেই সংকীর্ণ সেটিংয়ে এটি প্রকাশ না করতে শিখেছে। অধ্যয়নের ফলাফলগুলি নির্দেশ করে যে একটি উত্তর দমন করা এবং তথ্য পুনরুদ্ধার করার মডেলের ক্ষমতা বাদ দেওয়ার মধ্যে পার্থক্যটি সুস্পষ্ট পরীক্ষার দাবিদার। তথ্য অপসারণ সম্পর্কে দাবি করা সংস্থাগুলির জন্য, পার্থক্যটি প্রভাবিত করতে পারে তারা কতটা আস্থা রাখে তা অশিক্ষার ফলাফলে।

রিপোর্ট করা সংখ্যাগুলি অধ্যয়নের সেটআপের মধ্যে ব্যবধানকে কংক্রিট করে। 0.91-এর উপরে গুণমান ভুলে যান সাধারণত বেঞ্চমার্কের পরিচ্ছন্ন মূল্যায়নে শক্তিশালী পারফরম্যান্সের পরামর্শ দেয়, যখন 72.8% থেকে 84.3% পর্যন্ত প্রতিপক্ষের ASR ইঙ্গিত দেয় যে বেশিরভাগ পরীক্ষিত আক্রমণ প্রচেষ্টা এখনও কাগজের ফাঁস থ্রেশহোল্ড অতিক্রম করেছে। 87.5% বেস-মডেল ASR-এর সাথে তুলনা যথেষ্ট পরিমাণে অবশিষ্ট পুনরুদ্ধারের পরামর্শ দেয়, কিন্তু এটি দেখায় না যে অশিক্ষার কোন মূল্য নেই। এটি দেখায় যে স্ট্যান্ডার্ড মেট্রিক এবং প্রতিপক্ষ মেট্রিক বিভিন্ন বৈশিষ্ট্য পরিমাপ করে এবং একই পদ্ধতির তীব্রভাবে ভিন্ন মূল্যায়ন তৈরি করতে পারে।

কাজটি AI নিরাপত্তার সাথেও প্রাসঙ্গিক কারণ এটি মূল্যায়নকে আক্রমণের পৃষ্ঠ হিসাবে বিবেচনা করে। রুটিন প্রম্পটের অধীনে একটি মডেলের আচরণ প্রকাশ নাও করতে পারে যে ব্যবহারকারীরা এর দুর্বলতা বোঝেন বা কৌশলগতভাবে তাদের শব্দের পরিবর্তন করেন তাদের দ্বারা কী বের করা যেতে পারে। লেখকের বহুভাষিক সংস্কারের ফলাফল আরও শক্তিশালী করে যে প্রতিটি বিকল্প প্রম্পট সমানভাবে কার্যকর নয়: সেই পরিচ্ছন্ন সংস্কারগুলি শুধুমাত্র 2.95% পরিমাপিত লিকেজ দিয়েছে, যখন বিস্তৃত প্রতিপক্ষের স্যুটগুলি অনেক বেশি পুনরুদ্ধারের হার তৈরি করেছে। এই বৈসাদৃশ্যটি আক্রমণের গুণমান এবং কভারেজ পরীক্ষা করার জন্য যুক্তি দেখায় যে সাধারণ প্যারাফ্রেজিং একটি যথেষ্ট স্ট্রেস পরীক্ষা।

জনস্বার্থের উপসংহারে গুরুত্বপূর্ণ সীমা আছে। উত্সটি একটি বেঞ্চমার্ক এবং Llama-3.2-3B-নির্দেশের উপর পরীক্ষা-নিরীক্ষার প্রতিবেদন করে, তাই এটি কীভাবে ফলাফলগুলি বৃহত্তর মডেল, অন্যান্য আর্কিটেকচার, মালিকানাধীন সিস্টেম বা বাস্তব-বিশ্বের ডেটাসেটে স্থানান্তরিত হয় তা প্রতিষ্ঠিত করে না। ASR একজন LLM বিচারকের উপর নির্ভর করে এবং দশটি নিরীক্ষিত মামলার মধ্যে মাত্র সাতটিতে মানবিক বাস্তব মূল্যায়নের সাথে মিলে যায়, তাই মেট্রিক একটি নির্দিষ্ট গ্রাউন্ড-ট্রুথ পরিমাপ নয়। কাগজটি একটি উত্পাদন ঘটনা, একটি আইনি ব্যর্থতা, বা একটি মুছে ফেলার অনুরোধকে সম্মান করতে একটি নির্দিষ্ট সংস্থার অক্ষমতা প্রদর্শন করে না।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

প্রধান ফলো-আপ প্রশ্নগুলি হ'ল ব্যবধানটি বৃহত্তর এবং বিভিন্ন মডেলগুলিতে বজায় থাকে কিনা, অন্যান্য অশিক্ষার পদ্ধতিগুলি আরও ভাল কার্য সম্পাদন করে কিনা এবং প্রস্তাবিত আক্রমণের সাফল্যের হার কতটা নির্ভরযোগ্যভাবে বাস্তবিক ফুটোকে প্রতিফলিত করে। অতিরিক্ত ডেটাসেটের স্বাধীন প্রতিলিপি এবং পরীক্ষা গুরুত্বপূর্ণ হবে।

প্রথম অগ্রাধিকার হল মডেল এবং ডেটাসেট জুড়ে প্রতিলিপি। ভবিষ্যৎ মূল্যায়নের পরীক্ষা করা উচিত যে একই পরিচ্ছন্ন-বনাম-প্রতিপক্ষের ব্যবধান বৃহত্তর ভাষার মডেল, বিভিন্ন ডেটাতে প্রশিক্ষিত মডেল, এবং বিকল্প শিক্ষা পদ্ধতি ব্যবহার করে এমন সিস্টেমে দেখা যায় কিনা। যেহেতু বর্তমান ফলাফলটি TOFU এবং একটি Llama মডেলের সাথে আবদ্ধ, তাই রিপোর্ট করা ASR পরিসরকে এলএলএম অশিক্ষার একটি সাধারণ সম্পত্তি হিসাবে বিবেচনা করার আগে বিস্তৃত পরীক্ষা প্রয়োজন।

গবেষকদের আরও আক্রমণের ধরন এবং আরও স্বাধীন মূল্যায়নকারীদের তুলনা করা উচিত। কাগজের আটটি অ্যাটাক স্যুট দেখায় যে কৌশলগতভাবে ডিজাইন করা প্রম্পটগুলি গুরুত্বপূর্ণ হতে পারে, তবে বিমূর্তটি তাদের সম্পূর্ণ নির্মাণ বা আপেক্ষিক অসুবিধা বর্ণনা করে না। স্বাধীন দলগুলি পরীক্ষা করতে পারে যে ফলাফলগুলি নির্দিষ্ট প্রম্পট টেমপ্লেট, 0.2 এর ফুটো থ্রেশহোল্ড বা এলএলএম বিচারকের ব্যবহারের উপর নির্ভর করে কিনা। একটি বৃহত্তর নমুনার মানব পর্যালোচনা নির্ধারণ করতে সাহায্য করবে কখন ASR সঠিকভাবে প্রকৃত পুনরুদ্ধার সনাক্ত করে এবং কখন এটি লিকেজ বেশি বা কম গণনা করে।

দেখার জন্য একটি দ্বিতীয় ক্ষেত্র হল আচরণগত পুনরুদ্ধারযোগ্যতা এবং অভ্যন্তরীণ মুছে ফেলার মধ্যে সম্পর্ক। অধ্যয়নটি মূল্যায়ন করে যে মডেল প্রতিক্রিয়া থেকে তথ্য বের করা যায় কিনা; এর বিমূর্তটি মডেলের ভিতরে নির্দিষ্ট উপস্থাপনা অপসারণের পরিদর্শন বা প্রমাণ করার দাবি করে না। ভবিষ্যত কাজের জন্য বিভিন্ন ফলাফলের পার্থক্য করতে হতে পারে: উত্তর দিতে অস্বীকার করা, পরীক্ষিত প্রম্পটের অধীনে উত্তর দিতে ব্যর্থ হওয়া, পুনরুদ্ধারের সম্ভাবনা হ্রাস করা এবং প্রকৃতপক্ষে লক্ষ্যযুক্ত প্রশিক্ষণের প্রভাব অপসারণ করা। এই ফলাফলগুলির গোপনীয়তা এবং নিরাপত্তা নিশ্চিতকরণের জন্য বিভিন্ন প্রভাব থাকবে।

অবশেষে, বিকাশকারী এবং মূল্যায়নকারীরা অশিক্ষার মেট্রিকগুলি পরিষ্কার করার জন্য একটি আদর্শ পরিপূরক হিসাবে প্রতিপক্ষের চাপ-পরীক্ষাকে বিবেচনা করা শুরু করতে পারে। লেখক সুস্পষ্টভাবে সেই পন্থাটিকে অনুপ্রাণিত করেন, কিন্তু উত্সটি বলে না যে কোনও প্ল্যাটফর্ম, নিয়ন্ত্রক বা মডেল প্রদানকারী এটি গ্রহণ করেছে। যেটি অজানা থেকে যায় তা হল একটি বিশ্বাসযোগ্য দাবির জন্য প্রয়োজনীয় ন্যূনতম পরীক্ষা, শক্তিশালী অশিক্ষা প্রয়োগ করা হলে কতটা সক্ষমতা সংরক্ষণ হারিয়ে যায়, এবং প্রতিরক্ষাগুলি মডেলের অন্য কোথাও নতুন দুর্বলতা তৈরি না করে প্রতিপক্ষের পুনরুদ্ধার কমাতে পারে কিনা।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই নীতিশাস্ত্রএআই প্রশিক্ষণChatGPT ও এলএলএমআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই রেগুলেশন ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?