কি হয়েছে
গবেষকরা একটি ভাষা মডেল থেকে লক্ষ্যযুক্ত তথ্য অপসারণের জন্য প্রম্পট-ভিত্তিক এবং সূক্ষ্ম-টিউনিং-ভিত্তিক পদ্ধতিগুলি মূল্যায়ন করেছেন। তারা দেখেছে যে স্ট্যান্ডার্ড ক্লিন-কোয়েরি মেট্রিক্সে ভাল স্কোর করার পদ্ধতিগুলি অনুমিতভাবে ভুলে যাওয়া তথ্য পুনরুদ্ধার করার জন্য প্রতিপক্ষের প্রচেষ্টার জন্য অত্যন্ত ঝুঁকিপূর্ণ ছিল।
arXiv প্রিপ্রিন্ট মেশিন আনলার্নিং পরীক্ষা করে, একটি মডেলের অন্যান্য ক্ষমতা সংরক্ষণ করার সময় নির্বাচিত প্রশিক্ষণ ডেটার প্রভাব অপসারণের উদ্দেশ্যে কৌশলগুলির একটি পরিবার। লেখকরা একটি মৌলিক মূল্যায়ন সমস্যার উপর ফোকাস করেন: একটি মডেল সরাসরি জিজ্ঞাসা করা হলে তথ্য প্রকাশ করা বন্ধ করে দিতে পারে, তবুও সতর্কতার সাথে পরিকল্পিত প্রম্পটের মাধ্যমে সেই তথ্য পুনরুদ্ধার করার জন্য একজন দৃঢ় সংকল্প ব্যবহারকারীর জন্য যথেষ্ট পরিমাণে শেখা উপস্থাপনা বজায় রাখে। তাদের কেন্দ্রীয় দাবি হল যে সাধারণ পরীক্ষার অধীনে আপাত ভুলে যাওয়াকে শক্তিশালী দুর্গমতার প্রমাণ হিসাবে বিবেচনা করা উচিত নয়।
গবেষকরা Meta-এর Llama-3.2-3B-ইন্সট্রাক্ট মডেল ব্যবহার করে TOFU বেঞ্চমার্কে প্রম্পট-ভিত্তিক এবং সূক্ষ্ম-টিউনিং-ভিত্তিক অশিক্ষার পদ্ধতিগুলির একটি সমন্বিত মূল্যায়ন পরিচালনা করেন। তারা প্রথমে এমন পদ্ধতিগুলি সনাক্ত করে যা স্ট্যান্ডার্ড মেট্রিক্সের অধীনে দৃঢ়ভাবে কাজ করে, তারপর সেই পদ্ধতিগুলিকে প্রতিকূল দৃঢ়তা পরীক্ষার বিষয়বস্তু করে। কাগজে আটটি অ্যাটাক স্যুট বর্ণনা করা হয়েছে যা আপাতদৃষ্টিতে সফলভাবে অশিক্ষা সত্ত্বেও লক্ষ্যযুক্ত তথ্য বের করা যায় কিনা তা তদন্ত করার উদ্দেশ্যে। উত্সটি তার বিমূর্তটিতে নির্দিষ্ট করে না যে প্রতিটি স্যুটে কতগুলি পৃথক উদাহরণ বা প্রম্পট ব্যবহার করা হয়েছিল৷
কাগজটি অ্যাটাক সাকসেস রেট, বা ASR, একটি LLM-বিচারক পরিমাপ প্রবর্তন করে যা বিপক্ষ প্রতিক্রিয়ার ভগ্নাংশ হিসাবে সংজ্ঞায়িত করা হয়েছে যার ফাঁসের স্কোর 0.2 ছাড়িয়ে গেছে। রিপোর্ট করা পরীক্ষা-নিরীক্ষায়, বেশ কিছু ফাইন-টিউনিং-ভিত্তিক পদ্ধতি পরিচ্ছন্ন মূল্যায়নের অধীনে 0.91-এর উপরে ফরগেট কোয়ালিটি অর্জন করেছে, কিন্তু তাদের প্রতিকূল ASR 72.8% থেকে 84.3% পর্যন্ত ছিল। অরক্ষিত বেস মডেলের ASR ছিল 87.5%, যা এই আক্রমণের অধীনে পরীক্ষিত অশিক্ষার পদ্ধতিগুলিকে তুলনামূলকভাবে আসল মডেলের কাছাকাছি রেখেছিল। তুলনা করে, পরিষ্কার বহুভাষিক সংস্কারগুলি 2.95% এর পরিমাপিত ফুটো হার তৈরি করেছে। লেখক নিজেও দশটি ক্ষেত্রে নিরীক্ষা করেছেন। তারা এই সাতটি ক্ষেত্রে বাইনারি ASR সিদ্ধান্ত এবং মানুষের বাস্তব মূল্যায়নের মধ্যে চুক্তির রিপোর্ট করে, এটি প্রমাণ হিসাবে উপস্থাপন করে যে ASR আচরণগত পুনরুদ্ধারযোগ্যতার একটি দরকারী কিন্তু অপূর্ণ সংকেত।
উত্সটি কাজটিকে পিয়ার-রিভিউ করা প্রকাশনার পরিবর্তে 21 আগস্ট, 2026-এ জমা দেওয়া একটি arXiv প্রিপ্রিন্ট হিসাবে চিহ্নিত করে৷ এটির বিমূর্ত প্রতিবেদন ফলাফল, কিন্তু এটি প্রতিষ্ঠিত করে না যে পরীক্ষিত কৌশলগুলি মডেল পরামিতিগুলি থেকে স্থায়ীভাবে তথ্য মুছে দেয় বা প্রতিকূল প্রম্পটিংয়ের প্রতিটি ফর্ম একই ফলাফল তৈরি করবে।
কেন এটা গুরুত্বপূর্ণ
ফলাফলগুলি পরামর্শ দেয় যে কেবলমাত্র ক্লিন-কোয়েরি স্কোরগুলি প্রমাণ করার জন্য যথেষ্ট নয় যে একটি এলএলএম নির্ভরযোগ্যভাবে ডেটা ভুলে গেছে। গোপনীয়তা, ডেটা-অপসারণ, এবং সুরক্ষা দাবিগুলি মূল্যায়নকারী বিকাশকারীদের জন্য আরও শক্তিশালী পরীক্ষা গুরুত্বপূর্ণ হতে পারে, যদিও অধ্যয়নটি একটি বেঞ্চমার্ক, একটি মডেল এবং লেখকদের মূল্যায়ন ডিজাইনের মধ্যে সীমাবদ্ধ।
প্রায়োগিক তাত্পর্য প্রযুক্তিগত যতটা পদ্ধতিগত। যদি একটি মডেলকে শুধুমাত্র প্রত্যক্ষ, অ-বিরোধী প্রশ্ন দিয়ে মূল্যায়ন করা হয়, তাহলে ডেভেলপাররা উপসংহারে আসতে পারেন যে একটি টার্গেট করা আইটেম সরানো হয়েছে যখন মডেলটি শুধুমাত্র সেই সংকীর্ণ সেটিংয়ে এটি প্রকাশ না করতে শিখেছে। অধ্যয়নের ফলাফলগুলি নির্দেশ করে যে একটি উত্তর দমন করা এবং তথ্য পুনরুদ্ধার করার মডেলের ক্ষমতা বাদ দেওয়ার মধ্যে পার্থক্যটি সুস্পষ্ট পরীক্ষার দাবিদার। তথ্য অপসারণ সম্পর্কে দাবি করা সংস্থাগুলির জন্য, পার্থক্যটি প্রভাবিত করতে পারে তারা কতটা আস্থা রাখে তা অশিক্ষার ফলাফলে।
রিপোর্ট করা সংখ্যাগুলি অধ্যয়নের সেটআপের মধ্যে ব্যবধানকে কংক্রিট করে। 0.91-এর উপরে গুণমান ভুলে যান সাধারণত বেঞ্চমার্কের পরিচ্ছন্ন মূল্যায়নে শক্তিশালী পারফরম্যান্সের পরামর্শ দেয়, যখন 72.8% থেকে 84.3% পর্যন্ত প্রতিপক্ষের ASR ইঙ্গিত দেয় যে বেশিরভাগ পরীক্ষিত আক্রমণ প্রচেষ্টা এখনও কাগজের ফাঁস থ্রেশহোল্ড অতিক্রম করেছে। 87.5% বেস-মডেল ASR-এর সাথে তুলনা যথেষ্ট পরিমাণে অবশিষ্ট পুনরুদ্ধারের পরামর্শ দেয়, কিন্তু এটি দেখায় না যে অশিক্ষার কোন মূল্য নেই। এটি দেখায় যে স্ট্যান্ডার্ড মেট্রিক এবং প্রতিপক্ষ মেট্রিক বিভিন্ন বৈশিষ্ট্য পরিমাপ করে এবং একই পদ্ধতির তীব্রভাবে ভিন্ন মূল্যায়ন তৈরি করতে পারে।
কাজটি AI নিরাপত্তার সাথেও প্রাসঙ্গিক কারণ এটি মূল্যায়নকে আক্রমণের পৃষ্ঠ হিসাবে বিবেচনা করে। রুটিন প্রম্পটের অধীনে একটি মডেলের আচরণ প্রকাশ নাও করতে পারে যে ব্যবহারকারীরা এর দুর্বলতা বোঝেন বা কৌশলগতভাবে তাদের শব্দের পরিবর্তন করেন তাদের দ্বারা কী বের করা যেতে পারে। লেখকের বহুভাষিক সংস্কারের ফলাফল আরও শক্তিশালী করে যে প্রতিটি বিকল্প প্রম্পট সমানভাবে কার্যকর নয়: সেই পরিচ্ছন্ন সংস্কারগুলি শুধুমাত্র 2.95% পরিমাপিত লিকেজ দিয়েছে, যখন বিস্তৃত প্রতিপক্ষের স্যুটগুলি অনেক বেশি পুনরুদ্ধারের হার তৈরি করেছে। এই বৈসাদৃশ্যটি আক্রমণের গুণমান এবং কভারেজ পরীক্ষা করার জন্য যুক্তি দেখায় যে সাধারণ প্যারাফ্রেজিং একটি যথেষ্ট স্ট্রেস পরীক্ষা।
জনস্বার্থের উপসংহারে গুরুত্বপূর্ণ সীমা আছে। উত্সটি একটি বেঞ্চমার্ক এবং Llama-3.2-3B-নির্দেশের উপর পরীক্ষা-নিরীক্ষার প্রতিবেদন করে, তাই এটি কীভাবে ফলাফলগুলি বৃহত্তর মডেল, অন্যান্য আর্কিটেকচার, মালিকানাধীন সিস্টেম বা বাস্তব-বিশ্বের ডেটাসেটে স্থানান্তরিত হয় তা প্রতিষ্ঠিত করে না। ASR একজন LLM বিচারকের উপর নির্ভর করে এবং দশটি নিরীক্ষিত মামলার মধ্যে মাত্র সাতটিতে মানবিক বাস্তব মূল্যায়নের সাথে মিলে যায়, তাই মেট্রিক একটি নির্দিষ্ট গ্রাউন্ড-ট্রুথ পরিমাপ নয়। কাগজটি একটি উত্পাদন ঘটনা, একটি আইনি ব্যর্থতা, বা একটি মুছে ফেলার অনুরোধকে সম্মান করতে একটি নির্দিষ্ট সংস্থার অক্ষমতা প্রদর্শন করে না।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
প্রধান ফলো-আপ প্রশ্নগুলি হ'ল ব্যবধানটি বৃহত্তর এবং বিভিন্ন মডেলগুলিতে বজায় থাকে কিনা, অন্যান্য অশিক্ষার পদ্ধতিগুলি আরও ভাল কার্য সম্পাদন করে কিনা এবং প্রস্তাবিত আক্রমণের সাফল্যের হার কতটা নির্ভরযোগ্যভাবে বাস্তবিক ফুটোকে প্রতিফলিত করে। অতিরিক্ত ডেটাসেটের স্বাধীন প্রতিলিপি এবং পরীক্ষা গুরুত্বপূর্ণ হবে।
প্রথম অগ্রাধিকার হল মডেল এবং ডেটাসেট জুড়ে প্রতিলিপি। ভবিষ্যৎ মূল্যায়নের পরীক্ষা করা উচিত যে একই পরিচ্ছন্ন-বনাম-প্রতিপক্ষের ব্যবধান বৃহত্তর ভাষার মডেল, বিভিন্ন ডেটাতে প্রশিক্ষিত মডেল, এবং বিকল্প শিক্ষা পদ্ধতি ব্যবহার করে এমন সিস্টেমে দেখা যায় কিনা। যেহেতু বর্তমান ফলাফলটি TOFU এবং একটি Llama মডেলের সাথে আবদ্ধ, তাই রিপোর্ট করা ASR পরিসরকে এলএলএম অশিক্ষার একটি সাধারণ সম্পত্তি হিসাবে বিবেচনা করার আগে বিস্তৃত পরীক্ষা প্রয়োজন।
গবেষকদের আরও আক্রমণের ধরন এবং আরও স্বাধীন মূল্যায়নকারীদের তুলনা করা উচিত। কাগজের আটটি অ্যাটাক স্যুট দেখায় যে কৌশলগতভাবে ডিজাইন করা প্রম্পটগুলি গুরুত্বপূর্ণ হতে পারে, তবে বিমূর্তটি তাদের সম্পূর্ণ নির্মাণ বা আপেক্ষিক অসুবিধা বর্ণনা করে না। স্বাধীন দলগুলি পরীক্ষা করতে পারে যে ফলাফলগুলি নির্দিষ্ট প্রম্পট টেমপ্লেট, 0.2 এর ফুটো থ্রেশহোল্ড বা এলএলএম বিচারকের ব্যবহারের উপর নির্ভর করে কিনা। একটি বৃহত্তর নমুনার মানব পর্যালোচনা নির্ধারণ করতে সাহায্য করবে কখন ASR সঠিকভাবে প্রকৃত পুনরুদ্ধার সনাক্ত করে এবং কখন এটি লিকেজ বেশি বা কম গণনা করে।
দেখার জন্য একটি দ্বিতীয় ক্ষেত্র হল আচরণগত পুনরুদ্ধারযোগ্যতা এবং অভ্যন্তরীণ মুছে ফেলার মধ্যে সম্পর্ক। অধ্যয়নটি মূল্যায়ন করে যে মডেল প্রতিক্রিয়া থেকে তথ্য বের করা যায় কিনা; এর বিমূর্তটি মডেলের ভিতরে নির্দিষ্ট উপস্থাপনা অপসারণের পরিদর্শন বা প্রমাণ করার দাবি করে না। ভবিষ্যত কাজের জন্য বিভিন্ন ফলাফলের পার্থক্য করতে হতে পারে: উত্তর দিতে অস্বীকার করা, পরীক্ষিত প্রম্পটের অধীনে উত্তর দিতে ব্যর্থ হওয়া, পুনরুদ্ধারের সম্ভাবনা হ্রাস করা এবং প্রকৃতপক্ষে লক্ষ্যযুক্ত প্রশিক্ষণের প্রভাব অপসারণ করা। এই ফলাফলগুলির গোপনীয়তা এবং নিরাপত্তা নিশ্চিতকরণের জন্য বিভিন্ন প্রভাব থাকবে।
অবশেষে, বিকাশকারী এবং মূল্যায়নকারীরা অশিক্ষার মেট্রিকগুলি পরিষ্কার করার জন্য একটি আদর্শ পরিপূরক হিসাবে প্রতিপক্ষের চাপ-পরীক্ষাকে বিবেচনা করা শুরু করতে পারে। লেখক সুস্পষ্টভাবে সেই পন্থাটিকে অনুপ্রাণিত করেন, কিন্তু উত্সটি বলে না যে কোনও প্ল্যাটফর্ম, নিয়ন্ত্রক বা মডেল প্রদানকারী এটি গ্রহণ করেছে। যেটি অজানা থেকে যায় তা হল একটি বিশ্বাসযোগ্য দাবির জন্য প্রয়োজনীয় ন্যূনতম পরীক্ষা, শক্তিশালী অশিক্ষা প্রয়োগ করা হলে কতটা সক্ষমতা সংরক্ষণ হারিয়ে যায়, এবং প্রতিরক্ষাগুলি মডেলের অন্য কোথাও নতুন দুর্বলতা তৈরি না করে প্রতিপক্ষের পুনরুদ্ধার কমাতে পারে কিনা।