জেলব্রেকিং এবং রেড-টিমিং
জেলব্রেকিং হল প্রম্পট তৈরি করার অভ্যাস যা একটি এআই মডেলকে এর নিরাপত্তা বিধি উপেক্ষা করে চালায়, অন্যদিকে রেড-টিমিং হল খারাপ অভিনেতাদের আগে সেই দুর্বলতাগুলি খুঁজে বের করার সংগঠিত প্রচেষ্টা।
ওভারভিউ
Together they form the adversarial testing loop that makes deployed AI systems safer.
গভীর ডুব
বৃহৎ ভাষার মডেলগুলিকে ক্ষতিকারক অনুরোধ প্রত্যাখ্যান করার জন্য প্রশিক্ষিত করা হয়, কিন্তু সেই গার্ডেলগুলি পরিসংখ্যানগত, সম্পূর্ণ নয়। জেলব্রেকগুলি একটি নিষিদ্ধ অনুরোধের পুনর্বিন্যাস করে এটিকে কাজে লাগায় যাতে এটি মডেলের শেখা প্রত্যাখ্যানগুলিকে অতিক্রম করে। ক্লাসিক কৌশলগুলির মধ্যে রয়েছে রোল-প্লে ('ভান করুন আপনি কোনও নিয়ম ছাড়াই একজন AI'), কুখ্যাত 'DAN' (এখনই কিছু করুন) ব্যক্তিত্ব, অনুমানমূলক ফ্রেমিং, লুকানো নির্দেশাবলীর মাধ্যমে প্রম্পট ইনজেকশন, বেস64 বা লিটস্পিকের মতো এনকোডিং কৌশল এবং 'অনেক-শট' জেলব্রেকিং যা জানালার দীর্ঘ উদাহরণের সাথে প্লাবিত করে। রেড-টিমিং এটিকে ঘুরিয়ে দেয়: উত্সর্গীকৃত দল এবং স্বয়ংক্রিয় সিস্টেমগুলি মুক্তির আগে হাজার হাজার প্রতিকূল প্রম্পট সহ একটি মডেল অনুসন্ধান করে, ব্যর্থতার তালিকা তৈরি করে যাতে ইঞ্জিনিয়াররা তাদের সূক্ষ্ম-টিউনিং, মানুষের প্রতিক্রিয়া থেকে শক্তিবৃদ্ধি শেখার মাধ্যমে প্যাচ করতে পারে এবং ক্লাসিফায়ার ফিল্টার যোগ করতে পারে।
প্রযুক্তিগত অন্তর্দৃষ্টি
সুরক্ষা আচরণ ফাইন-টিউনিং এবং RLHF এর মাধ্যমে শেখা হয়, একটি মডেলের উপর একটি পাতলা 'অস্বীকার সীমানা' তৈরি করে যা ইতিমধ্যে বিশাল জ্ঞান শোষণ করেছে। জেলব্রেকগুলি নিরাপত্তা প্রশিক্ষণের সময় ব্যবহৃত উদাহরণগুলি থেকে ইনপুট বিতরণকে দূরে সরিয়ে কাজ করে, তাই মডেলের সহায়ক ড্রাইভ তার দুর্বল প্রত্যাখ্যান সংকেতকে ওভাররাইড করে। প্রতিরক্ষা স্তর একাধিক চেক: ইনপুট/আউটপুট ক্লাসিফায়ার, সাংবিধানিক এআই স্ব-সমালোচনা, এবং প্রতিপক্ষ প্রশিক্ষণ যা আবিষ্কৃত জেলব্রেকগুলিকে আবার প্রশিক্ষণ সেটে যোগ করে।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।
অ্যাক্সেস এবং পৌঁছানো
এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।
সুস্পষ্ট সিদ্ধান্ত
অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।
জেলব্রেকিং এবং রেড-টিমিংয়ের ভবিষ্যত
একটি চলমান অস্ত্র প্রতিযোগিতা আশা. স্বয়ংক্রিয় রেড-টিমিং, যেখানে একটি মডেল অন্যটিকে আক্রমণ করে, ম্যানুয়াল পরীক্ষার চেয়ে দ্রুত স্কেলিং করছে এবং বহিরাগত ব্যর্থতাগুলিকে দেখা দিচ্ছে৷ ডিফেন্ডাররা 'ডিফেন্স ইন ডিপ্থ'-এর দিকে অগ্রসর হচ্ছে: সাংবিধানিক শ্রেণিবিন্যাসকারী, রিয়েল-টাইম মনিটরিং এবং টেম্পার-প্রতিরোধী প্রশিক্ষণ যা প্রত্যাখ্যানকে ওজনের গভীরে নিয়ে যায়। নিয়ন্ত্রক এবং স্ট্যান্ডার্ড সংস্থাগুলির উচ্চ-ক্ষমতার মডেলগুলি পাঠানোর আগে নথিভুক্ত রেড-টিমের ফলাফলগুলি ক্রমবর্ধমানভাবে প্রয়োজন, প্রতিপক্ষের পরীক্ষাকে একটি রুটিন, AI রিলিজ পাইপলাইনের নিরীক্ষাযোগ্য অংশ হিসাবে পরিণত করে।
বাস্তব-বিশ্ব বাস্তবায়ন
Anthropic একটি সর্বজনীন 'জেলব্রেক বাউন্টি' চালিয়েছে, হাজার হাজার পরীক্ষককে এর সাংবিধানিক শ্রেণীবিভাগ ভঙ্গ করার জন্য আমন্ত্রণ জানিয়েছে এবং যে কেউ সার্বজনীন জেলব্রেক খুঁজে পেয়েছে তাকে পুরস্কৃত করেছে।
গবেষকরা 'অনেক-শট জেলব্রেকিং' প্রদর্শন করেছেন, দেখিয়েছেন যে শত শত জাল ক্ষতিকারক প্রশ্নোত্তর জোড়া দিয়ে একটি দীর্ঘ প্রসঙ্গ উইন্ডো পূরণ করা একটি মডেলের প্রত্যাখ্যানকে ক্ষয় করতে পারে।
OpenAI, Google, এবং Anthropic অভ্যন্তরীণ রেড টিম এবং বাহ্যিক বিশেষজ্ঞ নেটওয়ার্কগুলি বজায় রাখে যা লঞ্চের আগে জৈব অস্ত্র, সাইবার এবং শিশু-নিরাপত্তা ঝুঁকির মডেলগুলি পরীক্ষা করে৷
সিকিউরিটি ফার্মগুলো এখন LLM পেনিট্রেশন টেস্টিং অফার করে, ব্যাঙ্কিং এবং হেলথ কেয়ার অ্যাসিস্ট্যান্টের মতো গ্রাহক-মুখী অ্যাপে প্রম্পট-ইনজেকশন হোলসের জন্য চ্যাটবট স্ক্যান করে।
ঝুঁকি এবং প্রহরী
হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।
প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।
অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।
বাস্তবায়ন রোডম্যাপ
রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।
যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।
উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।
ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jailbreaking and Red-Teaming quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
এজেন্টিক টুল অর্কেস্ট্রেশন
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Jailbreaking and Red-Teaming?
জেলব্রেকিং হল প্রম্পট তৈরি করার অভ্যাস যা একটি এআই মডেলকে এর নিরাপত্তা বিধি উপেক্ষা করে চালায়, অন্যদিকে রেড-টিমিং হল খারাপ অভিনেতাদের আগে সেই দুর্বলতাগুলি খুঁজে বের করার সংগঠিত প্রচেষ্টা। তারা একসাথে প্রতিপক্ষের পরীক্ষার লুপ তৈরি করে যা স্থাপন করা AI সিস্টেমগুলিকে নিরাপদ করে তোলে।
একটি জেলব্রেক প্রম্পটের প্রাথমিক লক্ষ্য কি?
একটি জেলব্রেক বিশেষভাবে তৈরি করা হয় যাতে একটি মডেলকে উপেক্ষা করা যায় বা সেফটি গার্ডেলগুলি অনুসরণ করার জন্য প্রশিক্ষিত করা হয়েছিল।
এআই সুরক্ষায় 'রেড-টিমিং' কী বোঝায়?
রেড-টিমিং বন্ধুত্বপূর্ণ আক্রমণকারীদের জন্য সুরক্ষা শব্দটি ধার করে যারা দুর্বলতাগুলি প্রকাশ করার জন্য একটি সিস্টেমের তদন্ত করে যাতে সেগুলি ঠিক করা যায়।
কনটেক্সট উইন্ডো দীর্ঘ হওয়ার সাথে সাথে কেন বহু-শট জেলব্রেকগুলি আরও ভাল কাজ করে?
বহু-শট জেলব্রেকিং শত শত বানোয়াট ক্ষতিকারক প্রশ্নোত্তর উদাহরণকে একটি দীর্ঘ প্রেক্ষাপটে প্যাক করে, প্রসঙ্গ শিক্ষার মাধ্যমে সম্মতির দিকে মডেলটিকে পক্ষপাতদুষ্ট করে।
এর মধ্যে কোনটি জেলব্রেকের বিরুদ্ধে স্বীকৃত প্রতিরক্ষা?
স্তরযুক্ত ক্লাসিফায়ার যা ইনকামিং প্রম্পট এবং বহির্গামী প্রতিক্রিয়া উভয়ই পরিদর্শন করে জেলব্রেকগুলির বিরুদ্ধে একটি মূল 'গভীরতা রক্ষা' কৌশল।
কেন একটি মডেলের নিরাপত্তা প্রহরীদের 'পরিসংখ্যানগত, পরম নয়' হিসাবে বর্ণনা করা হয়?
ফাইন-টিউনিং এবং RLHF এর মাধ্যমে নিরাপত্তা শেখানো হয়, তাই এটি একটি শেখা প্রবণতা যে প্রশিক্ষণ বিতরণের বাইরের প্রতিপক্ষের ইনপুট কখনও কখনও পরাজিত করতে পারে।