সংবাদে ফিরে যান
নিরাপত্তাAI Understanding ব্রিফিং

BanglaVeilGuard বাংলা ভাষার ছয়টি ফর্ম জুড়ে নিরাপত্তা ফাঁক পরীক্ষা করে

একটি নতুন পেপার বাংলাভিলগার্ড প্রবর্তন করেছে, একটি বেঞ্চমার্ক এবং লাইটওয়েট প্রম্পট গার্ড যা স্ট্যান্ডার্ড, রোমানাইজড, কোড-মিশ্রিত, কোলাহলপূর্ণ এবং ডায়ালেক্টাল ফর্ম জুড়ে বাংলা ভাষার মডেল পরীক্ষা করার জন্য ডিজাইন করা হয়েছে। লেখকরা তাদের মূল্যায়নে তীব্রভাবে কম আক্রমণের সাফল্যের রিপোর্ট করেছেন, তবে এটিও খুঁজে পেয়েছেন যে গার্ড কিছু সৌম্যকে অতিরিক্ত-প্রত্যাখ্যান করেছে...

7 min readRead the primary source
Source-page capture accompanying BanglaVeilGuard tests safety gaps across six forms of Bangla
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.21880
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

মেমরি (এজেন্ট মেমরি)
সঞ্চিত প্রসঙ্গ একটি এআই এজেন্ট ধারাবাহিকতা উন্নত করতে বিভিন্ন ধাপ বা সেশন জুড়ে ব্যবহার করে।
শ্রেণীবিভাগ
একটি টাস্ক যেখানে একটি মডেল এক বা একাধিক পূর্বনির্ধারিত বিভাগে একটি ইনপুট বরাদ্দ করে৷
মূল্যায়ন সেট
প্রশিক্ষণের পরে মডেলের গুণমান পরিমাপ করতে ব্যবহৃত একটি হোল্ড-আউট ডেটাসেট।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

22 অগাস্ট arXiv-এ জমা দেওয়া একটি পেপার বাংলাভিলগার্ড, একটি বাংলা-প্রথম নিরাপত্তা বেঞ্চমার্ক এবং বৃহৎ ভাষার মডেলের জন্য লাইটওয়েট প্রম্পট গার্ড উপস্থাপন করে। এটি ছয়টি ভাষার রূপ মূল্যায়ন করে: প্রমিত বাংলা, রোমানাইজড বাংলা, বাংলা, বাংলা-ইংরেজি কোড-মিক্সিং, কোলাহলপূর্ণ বাংলা এবং উপভাষা বাংলা।

লেখকরা BanglaVeilGuard-কে দুটি সংযুক্ত উপাদান হিসেবে পরিচয় করিয়ে দিয়েছেন: একটি কমপ্যাক্ট নিরাপত্তা বেঞ্চমার্ক এবং একটি লাইটওয়েট প্রম্পট গার্ড। বেঞ্চমার্কে 2,366টি গুণমান-ফিল্টার করা প্রম্পট রয়েছে, যেখানে 354টি প্রম্পটের একটি হোল্ড-আউট মূল্যায়ন বিভাজন রয়েছে। প্রম্পটগুলি অনিরাপদ অনুরোধ, নিরাপদ অনুরোধ এবং নিরাপদ-সংবেদনশীল অনুরোধগুলিকে বিস্তৃত করে, যা কেবলমাত্র এটি ক্ষতিকারক সামগ্রীকে ব্লক করে কিনা তা নয় বরং এটি বৈধ সংবেদনশীল প্রশ্নের অ্যাক্সেস সংরক্ষণ করে কিনা তাও সিস্টেমটিকে মূল্যায়ন করার অনুমতি দেয়। উত্সটি কাজটিকে কম্পিউটিং অ্যাডভান্সমেন্টের 4র্থ আন্তর্জাতিক সম্মেলনে গৃহীত একটি আট পৃষ্ঠার কাগজ হিসাবে চিহ্নিত করে এবং 22 আগস্ট, 2026-এ একটি arXiv প্রিপ্রিন্ট হিসাবে পোস্ট করা হয়েছিল।

বাংলা কীভাবে লেখা হয় তার ভিন্নতাকে কেন্দ্র করে বেঞ্চমার্ক তৈরি করা হয়েছে। এর ছয়টি রূপ হল প্রমিত বাংলা, রোমানাইজড বাংলা, বাংলা, কোড-মিশ্রিত বাংলা-ইংরেজি, কোলাহলপূর্ণ বাংলা এবং উপভাষা বাংলা। এই নকশাটি কাগজের কেন্দ্রীয় দাবিকে প্রতিফলিত করে যে নিরাপত্তা মূল্যায়ন অসম্পূর্ণ হতে পারে যখন এটি একটি প্রমিত স্ক্রিপ্ট বা একটি বানান রীতি অনুমান করে। উত্সটি দ্বান্দ্বিক উপাদানের ভৌগলিক কভারেজ, বিভাগগুলিকে সংজ্ঞায়িত করার জন্য ব্যবহৃত প্রক্রিয়া বা কীভাবে প্রম্পটগুলি নির্বাচন করা হয়েছিল এবং সেটটি গুণমান-ফিল্টার করা হয়েছে তা উল্লেখ করার বাইরেও গুণমান-ফিল্টার করা হয়েছে তা বর্ণনা করে না।

গার্ড অ-ধ্বংসাত্মক মাল্টি-ভিউ স্বাভাবিকীকরণ, একটি প্রম্পট-রিস্ক ক্লাসিফায়ার এবং একটি থ্রেশহোল্ড প্রাক-প্রজন্মের গেট ব্যবহার করে। ব্যবহারিক শর্তে, পদ্ধতিটি প্রজন্মের আগে একটি ইনকামিং প্রম্পট স্ক্রীন করে এবং সুরক্ষিত মডেলের ওজন পরিবর্তন করে না। কাগজটি বলে যে পদ্ধতিটি ভিন্ন ভিন্ন লক্ষ্য মডেল জুড়ে প্রয়োগ করা যেতে পারে। উত্সটি উল্লেখ করে না যে গার্ডটি কোড হিসাবে উপলব্ধ কিনা, এটি কতটা গণনা বা লেটেন্সি যোগ করে, প্রতিটি পরীক্ষায় কী থ্রেশহোল্ড বেছে নেওয়া হয়েছিল, বা ব্যবহারকারীরা ইচ্ছাকৃতভাবে বিভিন্ন লেখার ফর্ম একত্রিত করলে এটি কীভাবে আচরণ করে।

অ্যাবস্ট্রাক্টে নাম দেওয়া টার্গেট-মডেল পরিবার জুড়ে, লেখকরা রিপোর্ট করেছেন যে জেডএক্সকিউএআইইউ0কিউএক্সজেড ওপাস 4.8, বাংলালামা এবং টিটুএলএলএম-এর জন্য 93.8% থেকে 100.0% থেকে 6.3% পর্যন্ত ডিটারমিনিস্টিক রেসপন্স স্কোরিংয়ের অধীনে রক্ষিত রান আক্রমণের সাফল্য হ্রাস করেছে। TigerLLM-1B-এর জন্য, কাগজটি বাংলাভিলগার্ডের সাথে 78.2% নির্ভুলতা এবং 8.8% আক্রমণ-সাফল্যের হার রিপোর্ট করে। গার্ডের অনিরাপদ প্রত্যাহার 88.5% হিসাবে রিপোর্ট করা হয়েছে, যা মূল্যায়ন করা প্রম্পট-অনলি গার্ড বেসলাইনগুলির থেকে উল্লেখযোগ্যভাবে উপরে। এগুলি রিপোর্ট করা কাগজের ফলাফল, একটি স্বাধীন প্রতিলিপি নয়।

লেখকরা একটি খরচও চিহ্নিত করেছেন: সিস্টেমটি কিছু সৌম্য প্রম্পটকে অতিরিক্ত-প্রত্যাখ্যান করে, বিশেষ করে যেগুলি দ্বান্দ্বিক বা কোলাহলপূর্ণ বাংলায় লেখা। এই অনুসন্ধানটি গুরুত্বপূর্ণ কারণ একটি সুরক্ষা স্তর ক্ষতিকারক আউটপুট হ্রাস করতে পারে এবং বৈধ ব্যবহারকে অবরুদ্ধ করতে পারে। উত্সটি এটিকে একটি কংক্রিট সুরক্ষা-সহায়কতা সীমান্ত হিসাবে ফ্রেম করে, তবে বিমূর্তটি মিথ্যা-অস্বীকারের হারকে পরিমাপ করে না বা ভাষা ফর্ম, মডেল, প্রম্পট প্রকার বা তীব্রতা দ্বারা এটিকে ভেঙে দেয় না।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

কাজটি নিরাপত্তা পরীক্ষার ক্ষেত্রে একটি ব্যবহারিক দুর্বলতাকে সম্বোধন করে: একটি মডেল যেটি মান-লিপি বাংলা পরিচালনা করে সে একই অনুরোধে নিরাপদে সাড়া নাও দিতে পারে যখন এটি একটি আঞ্চলিক রেজিস্টারে লিপিলিপি, ভুল বানান, কোড-মিশ্রিত বা লেখা হয়। রিপোর্ট করা ফলাফলগুলি প্রস্তাব করে যে ক্রস-স্ক্রিপ্ট মূল্যায়ন ইংরেজি-কেন্দ্রিক বা স্ট্যান্ডার্ড-স্ক্রিপ্ট পরীক্ষার দ্বারা মিস করা ঝুঁকিগুলিকে প্রকাশ করতে পারে।

ভাষার বৈচিত্র্য একটি নিরাপত্তার সমস্যা যখন মডেলগুলি এমন লোকেদের দ্বারা ব্যবহার করা হয় যারা ধারাবাহিকভাবে একটি প্রমিত আকারে লেখেন না। একটি ক্ষতিকারক অনুরোধ ল্যাটিন অক্ষরে প্রতিলিপি করা হতে পারে, ইংরেজির সাথে মিশ্রিত, অনানুষ্ঠানিক বানান দ্বারা পরিবর্তিত বা একটি আঞ্চলিক রেজিস্টারে প্রকাশ করা হতে পারে। যদি একটি নিরাপত্তা ব্যবস্থা স্ট্যান্ডার্ড-স্ক্রিপ্ট প্রশিক্ষণ এবং মূল্যায়ন ডেটাতে উপস্থিত শুধুমাত্র পৃষ্ঠের নিদর্শনগুলিকে স্বীকৃতি দেয়, তবে এর আপাত কার্যকারিতা সাধারণ বহুভাষিক ব্যবহারে এটি কীভাবে আচরণ করে তা প্রতিনিধিত্ব করতে পারে না। BanglaVeilGuard সেই মূল্যায়ন সমস্যাটিকে অধ্যয়নের সরাসরি বিষয় করে তোলে।

কাগজের অবদান তাই আংশিক পদ্ধতিগত। বাংলাকে একটি একক ইনপুট বিভাগ হিসাবে বিবেচনা করার পরিবর্তে, এটি একটি বেঞ্চমার্কে একাধিক ফর্ম পরীক্ষা করার এবং ঝুঁকি শ্রেণীবিভাগের আগে স্বাভাবিককরণ প্রয়োগের প্রস্তাব করে। এটি মডেল বিকাশকারীদের স্ক্রিপ্ট এবং বানানের পরিবর্তনের জন্য একটি প্রত্যাখ্যান নীতি শক্তিশালী কিনা তা সনাক্ত করতে সহায়তা করতে পারে। পদ্ধতিটি কাগজের বর্ণনায় তুলনামূলকভাবে হালকা: এটি একটি প্রাক-প্রজন্মের গেট হিসাবে কাজ করে এবং সুরক্ষিত মডেলের ওজন পরিবর্তন করার প্রয়োজন হয় না। যদি রিপোর্ট করা ফলাফলগুলি সাধারণ করা হয়, তবে সেই নকশাটি সেই সংস্থাগুলির জন্য প্রাসঙ্গিক হতে পারে যেগুলি তাদের স্থাপন করা প্রতিটি মডেলকে পুনরায় প্রশিক্ষণ বা সূক্ষ্ম-টিউন করতে পারে না।

লেখকদের সেটআপের মধ্যে আক্রমণের সাফল্যের রিপোর্টকৃত হ্রাস যথেষ্ট। গবেষণাপত্রটি বলেছে যে তিনটি নামধারী মডেল পরিবার 93.8%-100.0% আক্রমণ সাফল্য থেকে গার্ড ছাড়া 6.3% এ চলে গেছে, যেখানে TigerLLM-1B 78.2% নির্ভুলতার পাশাপাশি কম রিপোর্ট করা আক্রমণ-সাফল্যের হার অর্জন করেছে। উত্স এছাড়াও 88.5% অনিরাপদ প্রত্যাহার রিপোর্ট. এই সংখ্যাগুলি ইঙ্গিত করে যে গার্ড বাংলার একাধিক ফর্ম জুড়ে অনেকগুলি অনিরাপদ প্রম্পট ধরতে পারে, তবে তারা নিজেরাই প্রতিষ্ঠিত করে না যে অন্তর্নিহিত মডেলগুলি নিরাপদ বা প্রতিরক্ষা অভিযোজিত আক্রমণ সহ্য করবে।

পাবলিক-ফেসিং সিস্টেমের জন্য ট্রেড-অফ ব্যাপার। অতিরিক্ত প্রত্যাখ্যান ব্যবহারকারীদের সৌম্য তথ্যের অ্যাক্সেস অস্বীকার করতে পারে, বিশেষ করে যখন দ্বান্দ্বিক বা কোলাহলপূর্ণ ভাষা ভুলভাবে সন্দেহজনক হিসাবে বিবেচিত হয়। এটি অসামঞ্জস্যপূর্ণভাবে সেই ব্যক্তিদের প্রভাবিত করতে পারে যাদের দৈনন্দিন লেখা মানদণ্ডের সাথে মেলে না। উৎসটি এই ত্রুটির সামাজিক বন্টন স্থাপন করে না, তাই এর ব্যবহারিক প্রভাব একটি উন্মুক্ত প্রশ্ন থেকে যায়। যাইহোক, এটি প্রমাণ প্রদান করে যে নিরাপত্তা সনাক্তকরণ উন্নত করা এবং সহায়কতা সংরক্ষণ করা পৃথক লক্ষ্যগুলির পরিবর্তে সংযুক্ত ইঞ্জিনিয়ারিং সমস্যা।

কাজটি সেই বৃহত্তর প্রশ্নের সাথেও প্রাসঙ্গিক যে নিরাপত্তা মূল্যায়নে মানুষ আসলে কীভাবে যোগাযোগ করে তা প্রতিফলিত করা উচিত কিনা। উত্সটি একটি সংকীর্ণ উপসংহার সমর্থন করে: এই কাগজটি একটি বেঞ্চমার্ক এবং গার্ড উপস্থাপন করে এবং লেখকরা তাদের বিবৃত মূল্যায়নের অধীনে উন্নত ফলাফলের প্রতিবেদন করে। এটি প্রতিষ্ঠিত করে না যে সমস্ত বাংলা মডেলের একই দুর্বলতা রয়েছে, ক্রস-স্ক্রিপ্টের ভিন্নতা নিরাপত্তা ব্যর্থতার প্রধান উৎস, অথবা পদ্ধতিটি নতুন ডেটা এবং পরীক্ষা ছাড়াই অন্য ভাষায় স্থানান্তরিত হবে।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

মূল প্রশ্ন হল রিপোর্ট করা লাভগুলি কাগজের মূল্যায়ন সেটআপের বাইরে থাকে কিনা। উত্সটি সম্পূর্ণ লক্ষ্য-মডেল কনফিগারেশন, আক্রমণ নির্মাণ, বেসলাইন বাস্তবায়ন, স্কোরিং পদ্ধতি বা বাস্তব-বিশ্ব স্থাপনার বিষয়ে বিশদ প্রদান করে না এবং এটি একটি অমীমাংসিত সীমাবদ্ধতা হিসাবে সৌম্য দ্বান্দ্বিক এবং শোরগোল প্রম্পটে অতিরিক্ত-অস্বীকৃতি সনাক্ত করে।

আরও যাচাই-বাছাই বেঞ্চমার্ক দিয়েই শুরু করা উচিত। উত্সটি মোট প্রম্পটের সংখ্যা এবং হোল্ড-আউট স্প্লিট দেয়, তবে ছয়টি ভাষার ফর্ম জুড়ে অনিরাপদ, নিরাপদ এবং নিরাপদ-সংবেদনশীল উদাহরণগুলির বিতরণ নয়। প্রতিটি ঝুঁকি বিভাগের কতগুলি প্রম্পট রয়েছে, কীভাবে আক্রমণ তৈরি হয়েছিল, বা মূল্যায়ন সেটটি গার্ডের বিকাশের ডেটা থেকে স্বাধীনভাবে তৈরি করা হয়েছিল কিনা তাও বলে না। রিপোর্ট করা আক্রমণ-সাফল্য এবং প্রত্যাহার পরিসংখ্যানগুলিকে কতটা আত্মবিশ্বাসের সাথে ব্যাখ্যা করা যায় তা এই বিবরণগুলিকে প্রভাবিত করবে।

মূল্যায়ন প্রোটোকল আরেকটি গুরুত্বপূর্ণ অজানা. ফলাফলগুলি নির্ধারক প্রতিক্রিয়া স্কোরিং ব্যবহার করে, তবে উত্সটি স্কোরিং রুব্রিককে সংজ্ঞায়িত করে না, ব্যাখ্যা করে যে প্রতিক্রিয়াগুলি স্বয়ংক্রিয়ভাবে বা লোকেদের দ্বারা বিচার করা হয়েছিল, বা সীমারেখা প্রত্যাখ্যানগুলি কীভাবে পরিচালনা করা হয়েছিল তা দেখায়। এটি মূল্যায়িত প্রম্পট-অনলি গার্ড বেসলাইনগুলিও বর্ণনা করে না। স্বাধীন পরীক্ষা কার্যকর হবে, বিশেষ করে র্যান্ডমাইজড নমুনা, প্যারাফ্রেজ, অদেখা ট্রান্সলিটারেশন, ডেভেলপমেন্ট ডেটাতে উপস্থাপিত নয় এমন উপভাষা এবং গার্ডের মুক্তির পরে ডিজাইন করা প্রতিকূল প্রম্পট।

মডেলের ফলাফলগুলিকে মডেল নিরাপত্তা সম্পর্কে সাধারণ দাবি থেকে আলাদা করা দরকার। বিমূর্ত নাম Claude Opus 4.8, BanglaLLama এবং TituLLM, এবং TigerLLM-1B-এর জন্য একটি পৃথক ফলাফল দেয়, কিন্তু এটি মডেল সংস্করণ, অ্যাক্সেসের শর্ত, সিস্টেম প্রম্পট, ডিকোডিং সেটিংস ডিটারমিনিস্টিক স্কোরিং বা কার্যগুলির সঠিক বন্টন প্রদান করে না। উত্সটি লেটেন্সি, মেমরি ব্যবহার, অপারেটিং খরচ বা প্রাপ্যতা রিপোর্ট করে না। এই বাদ দেওয়া অনিশ্চয়তা ছেড়ে দেয় যে পদ্ধতিটি কত সহজে উৎপাদন ব্যবস্থায় একত্রিত হতে পারে।

সবচেয়ে তাৎক্ষণিক প্রযুক্তিগত সমস্যা হল অতিরিক্ত প্রত্যাখ্যান। লেখকরা বিশেষভাবে সৌম্য দ্বান্দ্বিক এবং কোলাহলপূর্ণ প্রম্পটগুলিকে দুর্বলতা হিসাবে চিহ্নিত করেছেন, তবে উত্সটি ত্রুটির পরিমাণ নির্ধারণ করে না বা থ্রেশহোল্ড পরিবর্তনগুলি ভারসাম্যকে উন্নত করতে পারে কিনা তা দেখায় না। ভবিষ্যত মূল্যায়নগুলি ভাষা ফর্ম দ্বারা সৌম্য-প্রম্পট গ্রহণের সাথে একসাথে নিরাপত্তা প্রত্যাহার রিপোর্ট করা উচিত এবং স্বাভাবিককরণ নিজেই অর্থপূর্ণ দ্বান্দ্বিক পার্থক্য মুছে দেয় বা প্রম্পটের অভিপ্রায় পরিবর্তন করে কিনা তা পরীক্ষা করা উচিত।

অবশেষে, কাগজের অবস্থা এবং সুযোগ পরিষ্কার থাকা উচিত। এটি একটি arXiv সংস্করণ 22 আগস্ট জমা দেওয়া হয়েছে এবং পৃষ্ঠাটি বলছে যে এটি ICCA 2026-এ গৃহীত হয়েছিল; উত্সটি কোনও স্বাধীন প্রতিলিপি বা স্থাপনার প্রমাণ সরবরাহ করে না। রিপোর্ট করা সংখ্যাগুলি ফলস্বরূপ একটি গবেষণা মূল্যায়নের ফলাফল হিসাবে সেরা হিসাবে বিবেচিত হয়। এরপরে যা দেখতে হবে তা হল কোড বা ডেটা প্রকাশ, স্বাধীন প্রজনন, অভিযোজিত আক্রমণের বিরুদ্ধে পরীক্ষা এবং বাংলার বিভিন্ন লিখিত ফর্ম জুড়ে সহায়কতার বিস্তৃত পরিমাপ।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই নীতিশাস্ত্রএআই প্রশিক্ষণPrompt Engineeringআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই রেগুলেশন ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?