কি হয়েছে
22 অগাস্ট arXiv-এ জমা দেওয়া একটি পেপার বাংলাভিলগার্ড, একটি বাংলা-প্রথম নিরাপত্তা বেঞ্চমার্ক এবং বৃহৎ ভাষার মডেলের জন্য লাইটওয়েট প্রম্পট গার্ড উপস্থাপন করে। এটি ছয়টি ভাষার রূপ মূল্যায়ন করে: প্রমিত বাংলা, রোমানাইজড বাংলা, বাংলা, বাংলা-ইংরেজি কোড-মিক্সিং, কোলাহলপূর্ণ বাংলা এবং উপভাষা বাংলা।
লেখকরা BanglaVeilGuard-কে দুটি সংযুক্ত উপাদান হিসেবে পরিচয় করিয়ে দিয়েছেন: একটি কমপ্যাক্ট নিরাপত্তা বেঞ্চমার্ক এবং একটি লাইটওয়েট প্রম্পট গার্ড। বেঞ্চমার্কে 2,366টি গুণমান-ফিল্টার করা প্রম্পট রয়েছে, যেখানে 354টি প্রম্পটের একটি হোল্ড-আউট মূল্যায়ন বিভাজন রয়েছে। প্রম্পটগুলি অনিরাপদ অনুরোধ, নিরাপদ অনুরোধ এবং নিরাপদ-সংবেদনশীল অনুরোধগুলিকে বিস্তৃত করে, যা কেবলমাত্র এটি ক্ষতিকারক সামগ্রীকে ব্লক করে কিনা তা নয় বরং এটি বৈধ সংবেদনশীল প্রশ্নের অ্যাক্সেস সংরক্ষণ করে কিনা তাও সিস্টেমটিকে মূল্যায়ন করার অনুমতি দেয়। উত্সটি কাজটিকে কম্পিউটিং অ্যাডভান্সমেন্টের 4র্থ আন্তর্জাতিক সম্মেলনে গৃহীত একটি আট পৃষ্ঠার কাগজ হিসাবে চিহ্নিত করে এবং 22 আগস্ট, 2026-এ একটি arXiv প্রিপ্রিন্ট হিসাবে পোস্ট করা হয়েছিল।
বাংলা কীভাবে লেখা হয় তার ভিন্নতাকে কেন্দ্র করে বেঞ্চমার্ক তৈরি করা হয়েছে। এর ছয়টি রূপ হল প্রমিত বাংলা, রোমানাইজড বাংলা, বাংলা, কোড-মিশ্রিত বাংলা-ইংরেজি, কোলাহলপূর্ণ বাংলা এবং উপভাষা বাংলা। এই নকশাটি কাগজের কেন্দ্রীয় দাবিকে প্রতিফলিত করে যে নিরাপত্তা মূল্যায়ন অসম্পূর্ণ হতে পারে যখন এটি একটি প্রমিত স্ক্রিপ্ট বা একটি বানান রীতি অনুমান করে। উত্সটি দ্বান্দ্বিক উপাদানের ভৌগলিক কভারেজ, বিভাগগুলিকে সংজ্ঞায়িত করার জন্য ব্যবহৃত প্রক্রিয়া বা কীভাবে প্রম্পটগুলি নির্বাচন করা হয়েছিল এবং সেটটি গুণমান-ফিল্টার করা হয়েছে তা উল্লেখ করার বাইরেও গুণমান-ফিল্টার করা হয়েছে তা বর্ণনা করে না।
গার্ড অ-ধ্বংসাত্মক মাল্টি-ভিউ স্বাভাবিকীকরণ, একটি প্রম্পট-রিস্ক ক্লাসিফায়ার এবং একটি থ্রেশহোল্ড প্রাক-প্রজন্মের গেট ব্যবহার করে। ব্যবহারিক শর্তে, পদ্ধতিটি প্রজন্মের আগে একটি ইনকামিং প্রম্পট স্ক্রীন করে এবং সুরক্ষিত মডেলের ওজন পরিবর্তন করে না। কাগজটি বলে যে পদ্ধতিটি ভিন্ন ভিন্ন লক্ষ্য মডেল জুড়ে প্রয়োগ করা যেতে পারে। উত্সটি উল্লেখ করে না যে গার্ডটি কোড হিসাবে উপলব্ধ কিনা, এটি কতটা গণনা বা লেটেন্সি যোগ করে, প্রতিটি পরীক্ষায় কী থ্রেশহোল্ড বেছে নেওয়া হয়েছিল, বা ব্যবহারকারীরা ইচ্ছাকৃতভাবে বিভিন্ন লেখার ফর্ম একত্রিত করলে এটি কীভাবে আচরণ করে।
অ্যাবস্ট্রাক্টে নাম দেওয়া টার্গেট-মডেল পরিবার জুড়ে, লেখকরা রিপোর্ট করেছেন যে জেডএক্সকিউএআইইউ0কিউএক্সজেড ওপাস 4.8, বাংলালামা এবং টিটুএলএলএম-এর জন্য 93.8% থেকে 100.0% থেকে 6.3% পর্যন্ত ডিটারমিনিস্টিক রেসপন্স স্কোরিংয়ের অধীনে রক্ষিত রান আক্রমণের সাফল্য হ্রাস করেছে। TigerLLM-1B-এর জন্য, কাগজটি বাংলাভিলগার্ডের সাথে 78.2% নির্ভুলতা এবং 8.8% আক্রমণ-সাফল্যের হার রিপোর্ট করে। গার্ডের অনিরাপদ প্রত্যাহার 88.5% হিসাবে রিপোর্ট করা হয়েছে, যা মূল্যায়ন করা প্রম্পট-অনলি গার্ড বেসলাইনগুলির থেকে উল্লেখযোগ্যভাবে উপরে। এগুলি রিপোর্ট করা কাগজের ফলাফল, একটি স্বাধীন প্রতিলিপি নয়।
লেখকরা একটি খরচও চিহ্নিত করেছেন: সিস্টেমটি কিছু সৌম্য প্রম্পটকে অতিরিক্ত-প্রত্যাখ্যান করে, বিশেষ করে যেগুলি দ্বান্দ্বিক বা কোলাহলপূর্ণ বাংলায় লেখা। এই অনুসন্ধানটি গুরুত্বপূর্ণ কারণ একটি সুরক্ষা স্তর ক্ষতিকারক আউটপুট হ্রাস করতে পারে এবং বৈধ ব্যবহারকে অবরুদ্ধ করতে পারে। উত্সটি এটিকে একটি কংক্রিট সুরক্ষা-সহায়কতা সীমান্ত হিসাবে ফ্রেম করে, তবে বিমূর্তটি মিথ্যা-অস্বীকারের হারকে পরিমাপ করে না বা ভাষা ফর্ম, মডেল, প্রম্পট প্রকার বা তীব্রতা দ্বারা এটিকে ভেঙে দেয় না।
কেন এটা গুরুত্বপূর্ণ
কাজটি নিরাপত্তা পরীক্ষার ক্ষেত্রে একটি ব্যবহারিক দুর্বলতাকে সম্বোধন করে: একটি মডেল যেটি মান-লিপি বাংলা পরিচালনা করে সে একই অনুরোধে নিরাপদে সাড়া নাও দিতে পারে যখন এটি একটি আঞ্চলিক রেজিস্টারে লিপিলিপি, ভুল বানান, কোড-মিশ্রিত বা লেখা হয়। রিপোর্ট করা ফলাফলগুলি প্রস্তাব করে যে ক্রস-স্ক্রিপ্ট মূল্যায়ন ইংরেজি-কেন্দ্রিক বা স্ট্যান্ডার্ড-স্ক্রিপ্ট পরীক্ষার দ্বারা মিস করা ঝুঁকিগুলিকে প্রকাশ করতে পারে।
ভাষার বৈচিত্র্য একটি নিরাপত্তার সমস্যা যখন মডেলগুলি এমন লোকেদের দ্বারা ব্যবহার করা হয় যারা ধারাবাহিকভাবে একটি প্রমিত আকারে লেখেন না। একটি ক্ষতিকারক অনুরোধ ল্যাটিন অক্ষরে প্রতিলিপি করা হতে পারে, ইংরেজির সাথে মিশ্রিত, অনানুষ্ঠানিক বানান দ্বারা পরিবর্তিত বা একটি আঞ্চলিক রেজিস্টারে প্রকাশ করা হতে পারে। যদি একটি নিরাপত্তা ব্যবস্থা স্ট্যান্ডার্ড-স্ক্রিপ্ট প্রশিক্ষণ এবং মূল্যায়ন ডেটাতে উপস্থিত শুধুমাত্র পৃষ্ঠের নিদর্শনগুলিকে স্বীকৃতি দেয়, তবে এর আপাত কার্যকারিতা সাধারণ বহুভাষিক ব্যবহারে এটি কীভাবে আচরণ করে তা প্রতিনিধিত্ব করতে পারে না। BanglaVeilGuard সেই মূল্যায়ন সমস্যাটিকে অধ্যয়নের সরাসরি বিষয় করে তোলে।
কাগজের অবদান তাই আংশিক পদ্ধতিগত। বাংলাকে একটি একক ইনপুট বিভাগ হিসাবে বিবেচনা করার পরিবর্তে, এটি একটি বেঞ্চমার্কে একাধিক ফর্ম পরীক্ষা করার এবং ঝুঁকি শ্রেণীবিভাগের আগে স্বাভাবিককরণ প্রয়োগের প্রস্তাব করে। এটি মডেল বিকাশকারীদের স্ক্রিপ্ট এবং বানানের পরিবর্তনের জন্য একটি প্রত্যাখ্যান নীতি শক্তিশালী কিনা তা সনাক্ত করতে সহায়তা করতে পারে। পদ্ধতিটি কাগজের বর্ণনায় তুলনামূলকভাবে হালকা: এটি একটি প্রাক-প্রজন্মের গেট হিসাবে কাজ করে এবং সুরক্ষিত মডেলের ওজন পরিবর্তন করার প্রয়োজন হয় না। যদি রিপোর্ট করা ফলাফলগুলি সাধারণ করা হয়, তবে সেই নকশাটি সেই সংস্থাগুলির জন্য প্রাসঙ্গিক হতে পারে যেগুলি তাদের স্থাপন করা প্রতিটি মডেলকে পুনরায় প্রশিক্ষণ বা সূক্ষ্ম-টিউন করতে পারে না।
লেখকদের সেটআপের মধ্যে আক্রমণের সাফল্যের রিপোর্টকৃত হ্রাস যথেষ্ট। গবেষণাপত্রটি বলেছে যে তিনটি নামধারী মডেল পরিবার 93.8%-100.0% আক্রমণ সাফল্য থেকে গার্ড ছাড়া 6.3% এ চলে গেছে, যেখানে TigerLLM-1B 78.2% নির্ভুলতার পাশাপাশি কম রিপোর্ট করা আক্রমণ-সাফল্যের হার অর্জন করেছে। উত্স এছাড়াও 88.5% অনিরাপদ প্রত্যাহার রিপোর্ট. এই সংখ্যাগুলি ইঙ্গিত করে যে গার্ড বাংলার একাধিক ফর্ম জুড়ে অনেকগুলি অনিরাপদ প্রম্পট ধরতে পারে, তবে তারা নিজেরাই প্রতিষ্ঠিত করে না যে অন্তর্নিহিত মডেলগুলি নিরাপদ বা প্রতিরক্ষা অভিযোজিত আক্রমণ সহ্য করবে।
পাবলিক-ফেসিং সিস্টেমের জন্য ট্রেড-অফ ব্যাপার। অতিরিক্ত প্রত্যাখ্যান ব্যবহারকারীদের সৌম্য তথ্যের অ্যাক্সেস অস্বীকার করতে পারে, বিশেষ করে যখন দ্বান্দ্বিক বা কোলাহলপূর্ণ ভাষা ভুলভাবে সন্দেহজনক হিসাবে বিবেচিত হয়। এটি অসামঞ্জস্যপূর্ণভাবে সেই ব্যক্তিদের প্রভাবিত করতে পারে যাদের দৈনন্দিন লেখা মানদণ্ডের সাথে মেলে না। উৎসটি এই ত্রুটির সামাজিক বন্টন স্থাপন করে না, তাই এর ব্যবহারিক প্রভাব একটি উন্মুক্ত প্রশ্ন থেকে যায়। যাইহোক, এটি প্রমাণ প্রদান করে যে নিরাপত্তা সনাক্তকরণ উন্নত করা এবং সহায়কতা সংরক্ষণ করা পৃথক লক্ষ্যগুলির পরিবর্তে সংযুক্ত ইঞ্জিনিয়ারিং সমস্যা।
কাজটি সেই বৃহত্তর প্রশ্নের সাথেও প্রাসঙ্গিক যে নিরাপত্তা মূল্যায়নে মানুষ আসলে কীভাবে যোগাযোগ করে তা প্রতিফলিত করা উচিত কিনা। উত্সটি একটি সংকীর্ণ উপসংহার সমর্থন করে: এই কাগজটি একটি বেঞ্চমার্ক এবং গার্ড উপস্থাপন করে এবং লেখকরা তাদের বিবৃত মূল্যায়নের অধীনে উন্নত ফলাফলের প্রতিবেদন করে। এটি প্রতিষ্ঠিত করে না যে সমস্ত বাংলা মডেলের একই দুর্বলতা রয়েছে, ক্রস-স্ক্রিপ্টের ভিন্নতা নিরাপত্তা ব্যর্থতার প্রধান উৎস, অথবা পদ্ধতিটি নতুন ডেটা এবং পরীক্ষা ছাড়াই অন্য ভাষায় স্থানান্তরিত হবে।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
মূল প্রশ্ন হল রিপোর্ট করা লাভগুলি কাগজের মূল্যায়ন সেটআপের বাইরে থাকে কিনা। উত্সটি সম্পূর্ণ লক্ষ্য-মডেল কনফিগারেশন, আক্রমণ নির্মাণ, বেসলাইন বাস্তবায়ন, স্কোরিং পদ্ধতি বা বাস্তব-বিশ্ব স্থাপনার বিষয়ে বিশদ প্রদান করে না এবং এটি একটি অমীমাংসিত সীমাবদ্ধতা হিসাবে সৌম্য দ্বান্দ্বিক এবং শোরগোল প্রম্পটে অতিরিক্ত-অস্বীকৃতি সনাক্ত করে।
আরও যাচাই-বাছাই বেঞ্চমার্ক দিয়েই শুরু করা উচিত। উত্সটি মোট প্রম্পটের সংখ্যা এবং হোল্ড-আউট স্প্লিট দেয়, তবে ছয়টি ভাষার ফর্ম জুড়ে অনিরাপদ, নিরাপদ এবং নিরাপদ-সংবেদনশীল উদাহরণগুলির বিতরণ নয়। প্রতিটি ঝুঁকি বিভাগের কতগুলি প্রম্পট রয়েছে, কীভাবে আক্রমণ তৈরি হয়েছিল, বা মূল্যায়ন সেটটি গার্ডের বিকাশের ডেটা থেকে স্বাধীনভাবে তৈরি করা হয়েছিল কিনা তাও বলে না। রিপোর্ট করা আক্রমণ-সাফল্য এবং প্রত্যাহার পরিসংখ্যানগুলিকে কতটা আত্মবিশ্বাসের সাথে ব্যাখ্যা করা যায় তা এই বিবরণগুলিকে প্রভাবিত করবে।
মূল্যায়ন প্রোটোকল আরেকটি গুরুত্বপূর্ণ অজানা. ফলাফলগুলি নির্ধারক প্রতিক্রিয়া স্কোরিং ব্যবহার করে, তবে উত্সটি স্কোরিং রুব্রিককে সংজ্ঞায়িত করে না, ব্যাখ্যা করে যে প্রতিক্রিয়াগুলি স্বয়ংক্রিয়ভাবে বা লোকেদের দ্বারা বিচার করা হয়েছিল, বা সীমারেখা প্রত্যাখ্যানগুলি কীভাবে পরিচালনা করা হয়েছিল তা দেখায়। এটি মূল্যায়িত প্রম্পট-অনলি গার্ড বেসলাইনগুলিও বর্ণনা করে না। স্বাধীন পরীক্ষা কার্যকর হবে, বিশেষ করে র্যান্ডমাইজড নমুনা, প্যারাফ্রেজ, অদেখা ট্রান্সলিটারেশন, ডেভেলপমেন্ট ডেটাতে উপস্থাপিত নয় এমন উপভাষা এবং গার্ডের মুক্তির পরে ডিজাইন করা প্রতিকূল প্রম্পট।
মডেলের ফলাফলগুলিকে মডেল নিরাপত্তা সম্পর্কে সাধারণ দাবি থেকে আলাদা করা দরকার। বিমূর্ত নাম Claude Opus 4.8, BanglaLLama এবং TituLLM, এবং TigerLLM-1B-এর জন্য একটি পৃথক ফলাফল দেয়, কিন্তু এটি মডেল সংস্করণ, অ্যাক্সেসের শর্ত, সিস্টেম প্রম্পট, ডিকোডিং সেটিংস ডিটারমিনিস্টিক স্কোরিং বা কার্যগুলির সঠিক বন্টন প্রদান করে না। উত্সটি লেটেন্সি, মেমরি ব্যবহার, অপারেটিং খরচ বা প্রাপ্যতা রিপোর্ট করে না। এই বাদ দেওয়া অনিশ্চয়তা ছেড়ে দেয় যে পদ্ধতিটি কত সহজে উৎপাদন ব্যবস্থায় একত্রিত হতে পারে।
সবচেয়ে তাৎক্ষণিক প্রযুক্তিগত সমস্যা হল অতিরিক্ত প্রত্যাখ্যান। লেখকরা বিশেষভাবে সৌম্য দ্বান্দ্বিক এবং কোলাহলপূর্ণ প্রম্পটগুলিকে দুর্বলতা হিসাবে চিহ্নিত করেছেন, তবে উত্সটি ত্রুটির পরিমাণ নির্ধারণ করে না বা থ্রেশহোল্ড পরিবর্তনগুলি ভারসাম্যকে উন্নত করতে পারে কিনা তা দেখায় না। ভবিষ্যত মূল্যায়নগুলি ভাষা ফর্ম দ্বারা সৌম্য-প্রম্পট গ্রহণের সাথে একসাথে নিরাপত্তা প্রত্যাহার রিপোর্ট করা উচিত এবং স্বাভাবিককরণ নিজেই অর্থপূর্ণ দ্বান্দ্বিক পার্থক্য মুছে দেয় বা প্রম্পটের অভিপ্রায় পরিবর্তন করে কিনা তা পরীক্ষা করা উচিত।
অবশেষে, কাগজের অবস্থা এবং সুযোগ পরিষ্কার থাকা উচিত। এটি একটি arXiv সংস্করণ 22 আগস্ট জমা দেওয়া হয়েছে এবং পৃষ্ঠাটি বলছে যে এটি ICCA 2026-এ গৃহীত হয়েছিল; উত্সটি কোনও স্বাধীন প্রতিলিপি বা স্থাপনার প্রমাণ সরবরাহ করে না। রিপোর্ট করা সংখ্যাগুলি ফলস্বরূপ একটি গবেষণা মূল্যায়নের ফলাফল হিসাবে সেরা হিসাবে বিবেচিত হয়। এরপরে যা দেখতে হবে তা হল কোড বা ডেটা প্রকাশ, স্বাধীন প্রজনন, অভিযোজিত আক্রমণের বিরুদ্ধে পরীক্ষা এবং বাংলার বিভিন্ন লিখিত ফর্ম জুড়ে সহায়কতার বিস্তৃত পরিমাপ।