সোসাইটি গাইড

ভাষা জুড়ে টোকেনাইজেশন বৈষম্য

টোকেনাইজেশন বৈষম্য মানে একই বার্তা ইংরেজির তুলনায় কিছু ভাষায় অনেক বেশি টোকেন নিতে পারে, কারণ বেশিরভাগ টোকেনাইজার টেক্সট থেকে তৈরি করা হয়েছিল যা বেশিরভাগ ইংরেজি।

  • 4 মিনিট পড়া
  • সর্বশেষ আপডেট করা হয়েছে
এই পৃষ্ঠায়4 মিনিট পড়া
  1. ওভারভিউ
  2. গভীর ডুব
  3. কৌশলগত প্রভাব
  4. ভাষা জুড়ে টোকেনাইজেশন বৈষম্যের ভবিষ্যত
  5. বাস্তব-বিশ্ব বাস্তবায়ন
  6. ঝুঁকি এবং প্রহরী
  7. বাস্তবায়ন রোডম্যাপ
  8. অন্বেষণ চালিয়ে যান
  9. প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

ওভারভিউ

যেহেতু AI পরিষেবাগুলি টোকেন দ্বারা চার্জ করে এবং একটি প্রসঙ্গ উইন্ডোতে কতগুলি টোকেন ফিট করে তা সীমাবদ্ধ করে, সেই ভাষার স্পিকাররা বেশি অর্থ প্রদান করতে পারে, কম পাঠ্য ফিট করতে পারে এবং একই কাজের জন্য আরও অপেক্ষা করতে পারে। এটি টোকেনাইজার ডিজাইনকে একটি ন্যায্যতার সমস্যা এবং সেইসাথে একটি প্রযুক্তিগত সমস্যা করে তোলে।

গভীর ডুব

একটি টোকেনাইজার একটি প্রশিক্ষণ কর্পাস অধ্যয়ন করে পাঠ্যের কোন অংশগুলিকে একক টোকেন হিসাবে বিবেচনা করতে হবে তা শিখে। সাধারণ স্ট্রিং তাদের নিজস্ব টোকেন পায়; বিরল স্ট্রিংগুলিকে ছোট ছোট টুকরোতে বিভক্ত করা হয়, কখনও কখনও পৃথক বাইট পর্যন্ত। যখন সেই কর্পাসটি ইংরেজি এবং কয়েকটি উচ্চ-সম্পদ ভাষার দ্বারা প্রাধান্য পায়, তখন সেই ভাষাগুলি সম্পূর্ণ শব্দ এবং সাধারণ শব্দ অংশগুলির জন্য দক্ষ টোকেন পায়। যে ভাষাগুলি প্রায়ই কম দেখা যায়, অথবা যেগুলি স্ক্রিপ্ট ব্যবহার করে যেখানে প্রতিটি অক্ষর UTF-8 এনকোডিং-এ বেশ কয়েকটি বাইট নেয়, যেমন অনেক দক্ষিণ এশীয়, দক্ষিণ-পূর্ব এশীয় এবং আফ্রিকান স্ক্রিপ্ট, আরও অনেক টুকরোতে বিভক্ত হয়ে যায়। প্রভাব পরিমাপযোগ্য। 2023 সালে প্রকাশিত গবেষণা, যার মধ্যে পেট্রোভ এবং সহকর্মীদের দ্বারা টোকেনাইজারের অন্যায় কাজ করা হয়েছে, দেখা গেছে যে একই পাঠ্যের অনুবাদের জন্য ইংরেজির তুলনায় কিছু ভাষায় কয়েকগুণ বেশি টোকেনের প্রয়োজন হতে পারে, যেখানে নির্দিষ্ট ভাষা এবং টোকেনাইজারদের জন্য সবচেয়ে বড় ফাঁক দশগুণ বেশি। এটি তিনটি নির্দিষ্ট উপায়ে গুরুত্বপূর্ণ। খরচ: প্রতি টোকেন এপিআই মূল্য নির্ধারণ করা হয়, তাই একটি দীর্ঘ টোকেন গণনা একই সামগ্রীর জন্য সরাসরি মূল্য বৃদ্ধি। প্রসঙ্গ: একটি স্থির প্রসঙ্গ উইন্ডোতে প্রকৃত পাঠ্য কম থাকে, তাই নথিগুলিকে অবশ্যই কেটে ফেলতে হবে এবং কথোপকথনগুলি শীঘ্রই আগের বাঁকগুলি হারাবে৷ গতি এবং গুণমান: আরও টোকেন মানে আরও প্রজন্মের পদক্ষেপ, এবং ভারী বিভক্তকরণ মডেলের জন্য শব্দের ভাল উপস্থাপনা শিখতে কঠিন করে তুলতে পারে, যা সেই ভাষাগুলিতে দুর্বল কর্মক্ষমতার জন্য অবদান রাখতে পারে। প্রদানকারীরা আংশিকভাবে সাড়া দিয়েছে। যখন OpenAI 2024 সালে GPT-4o প্রকাশ করে, তখন এটি একটি বড় টোকেনাইজার প্রবর্তন করে এবং বলে যে এটি অনেক অ-ইংরেজি ভাষার জন্য কম টোকেন ব্যবহার করেছে। বৃহত্তর শব্দভান্ডার এবং আরও ভারসাম্যপূর্ণ প্রশিক্ষণ ডেটা সাহায্য করে, কিন্তু তারা ব্যবধান সম্পূর্ণভাবে দূর করে না। একটি সাধারণ ভ্রান্ত ধারণা হল যে কিছু ভাষা কেবল শব্দময়। অনুবাদের দৈর্ঘ্য ভিন্ন হয়, কিন্তু বড় টোকেন ফাঁক প্রধানত আসে কিভাবে টোকেনাইজার তৈরি করা হয়েছিল, ভাষা থেকে নয়।

কৌশলগত প্রভাব

ঝুঁকি এবং নিরাপত্তা

বিপর্যয়কর এবং দৈনন্দিন এআই ক্ষতি উভয়ই নির্ভর করে কে ঝুঁকি বুঝতে পারে এবং কে কাজ করতে পারে।

সুস্পষ্ট সিদ্ধান্ত

জনসাধারণের এবং পেশাদার সাক্ষরতা গঠন করে যে শক্তিশালী নিরাপত্তা নীতি রাজনৈতিকভাবে সম্ভব কিনা।

হাইপের মাধ্যমে কাটা

স্পষ্ট ব্যাখ্যা হাইপ, ল্যাব পিআর, এবং অস্পষ্ট নীতিশাস্ত্র থিয়েটার দ্বারা ক্যাপচার হ্রাস করে।

ভাষা জুড়ে টোকেনাইজেশন বৈষম্যের ভবিষ্যত

টোকেনাইজার শব্দভাণ্ডার ক্রমবর্ধমান হচ্ছে, এবং বেশ কিছু প্রদানকারী এখন অ-ইংরেজি পাঠ্যের জন্য উন্নতি প্রচার করছে, তাই ব্যাপকভাবে কথ্য ভাষার জন্য ব্যবধানটি সংকুচিত হতে পারে। প্রশিক্ষণের ডেটা এবং টোকেনাইজার ডিজাইন ইচ্ছাকৃতভাবে অন্তর্ভুক্ত না করা পর্যন্ত নিম্ন-সম্পদ ভাষাগুলি পিছিয়ে যেতে পারে। বাইট-স্তরের এবং গতিশীলভাবে গোষ্ঠীবদ্ধ মডেলগুলিতে গবেষণা একটি নির্দিষ্ট শব্দভান্ডারের উপর নির্ভরতা কমাতে পারে, যদিও সেই ডিজাইনগুলির নিজস্ব গণনা খরচ রয়েছে। আপাতত, বহুভাষিক শ্রোতাদের পরিবেশনকারী সংস্থাগুলিকে তাদের সমর্থন করা প্রতিটি ভাষায় টোকেন সংখ্যা পরিমাপ করা উচিত এবং অ্যাক্সেসিবিলিটি পরিকল্পনার অংশ হিসাবে প্রতি-ভাষা খরচ এবং প্রসঙ্গ সীমা বিবেচনা করা উচিত।

বাস্তব-বিশ্ব বাস্তবায়ন

একটি স্বাস্থ্য অলাভজনক সংস্থা একই রোগীর লিফলেট ইংরেজি, হিন্দি এবং আমহারিক ভাষায় অনুবাদ করে এবং দেখতে পায় যে অ-ইংরেজি সংস্করণগুলি কয়েকগুণ বেশি টোকেন ব্যবহার করে, তাই সেই ভাষার জন্য এর API বিল অনেক বেশি।

বার্মিজ স্পিকারদের জন্য একটি চ্যাটবট ইংরেজি সংস্করণের তুলনায় অনেক কম কথোপকথনের মোড়ের পরে প্রসঙ্গ সীমা অতিক্রম করে, তাই এটি আগের বার্তাগুলিকে শীঘ্রই ভুলে যায়।

একজন ডেভেলপার একটি টোকেনাইজার ভিউয়ারের সাথে একটি কোরিয়ান সাপোর্ট আর্টিকেল চেক করেন এবং দেখেন অনেক শব্দ ছোট টুকরোতে বিভক্ত হয়ে গেছে, যখন ইংরেজি মূল বেশিরভাগ শব্দ প্রতি একটি টোকেনে ম্যাপ করে।

একটি গবেষণা দল একই প্রদানকারীর একটি পুরানো এবং একটি নতুন টোকেনাইজারের তুলনা করে এবং দেখতে পায় যে নতুনটি তাদের আরবি এবং তামিল নথিগুলির জন্য লক্ষণীয়ভাবে কম টোকেন ব্যবহার করে৷

ঝুঁকি এবং প্রহরী

  • সক্ষমতা যৌগিক অবস্থায় অস্তিত্বগত ঝুঁকিকে সাই-ফাই হিসাবে বিবেচনা করা।

  • উচ্চ স্বায়ত্তশাসনের অধীনে প্রান্তিককরণের সাথে বিভ্রান্তিকর পৃষ্ঠ পণ্য নিরাপত্তা।

  • অ-ইংরেজি এবং অ-বিশেষজ্ঞ শ্রোতাদের শুধুমাত্র নিম্ন-মানের উত্স সহ ত্যাগ করা।

বাস্তবায়ন রোডম্যাপ

  1. পৃথক পণ্য ক্ষতি, অপব্যবহার, এবং ক্ষতি-অব-নিয়ন্ত্রণ/বিভ্রান্তির ঝুঁকি।

  2. জিজ্ঞাসা করুন কি প্রমাণ সময়সীমা এবং তীব্রতা আপনার দৃষ্টিভঙ্গি পরিবর্তন করবে.

  3. বিপণন দাবির চেয়ে প্রাথমিক উত্স এবং কংক্রিট ইভাল পছন্দ করুন।

  4. একটি কর্ম পথ চিহ্নিত করুন: কর্মজীবন, নীতি, অর্থায়ন, বা দক্ষতা - শুধুমাত্র সচেতনতা নয়।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tokenization Disparities Across Languages quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

ভাষা জুড়ে টোকেনাইজেশন বৈষম্য কি?

টোকেনাইজেশন বৈষম্য মানে একই বার্তা ইংরেজির তুলনায় কিছু ভাষায় অনেক বেশি টোকেন নিতে পারে, কারণ বেশিরভাগ টোকেনাইজার টেক্সট থেকে তৈরি করা হয়েছিল যা বেশিরভাগ ইংরেজি। যেহেতু AI পরিষেবাগুলি টোকেন দ্বারা চার্জ করে এবং একটি প্রসঙ্গ উইন্ডোতে কতগুলি টোকেন ফিট করে তা সীমাবদ্ধ করে, সেই ভাষার স্পিকাররা বেশি অর্থ প্রদান করতে পারে, কম পাঠ্য ফিট করতে পারে এবং একই কাজের জন্য আরও অপেক্ষা করতে পারে। এটি টোকেনাইজার ডিজাইনকে একটি ন্যায্যতার সমস্যা এবং সেইসাথে একটি প্রযুক্তিগত সমস্যা করে তোলে।

ভাষার মধ্যে বড় টোকেন-গণনা ফাঁকের প্রধান কারণ কী?

টোকেনাইজাররা তাদের প্রশিক্ষণ কর্পাসে সাধারণ স্ট্রিংগুলিতে দক্ষ টোকেন দেয়। উপস্থাপিত ভাষাগুলি আরও, ছোট টুকরোগুলিতে বিভক্ত হয়ে যায়।

কেন দেবনাগরী বা থাই-এর মতো স্ক্রিপ্টগুলি প্রায়শই বাইট-ভিত্তিক টোকেনাইজারের অধীনে বেশি টোকেন তৈরি করে?

এই স্ক্রিপ্টগুলির প্রতিটি অক্ষর বেশ কয়েকটি UTF-8 বাইট। যদি টোকেনাইজার খুব কমই সেই বাইট ক্রমগুলিকে একত্রিত করে, একটি অক্ষর একাধিক টোকেন হয়ে উঠতে পারে।

গাইডে নাম দেওয়া উচ্চতর টোকেন সংখ্যার তিনটি প্রভাবের মধ্যে কোনটি নয়?

গাইড মূল্য, প্রসঙ্গ স্থান, এবং গতি বা গুণমান তালিকাভুক্ত করে। স্বয়ংক্রিয়ভাবে প্রত্যাখ্যান টোকেন গণনার ফলাফল নয়।

এই প্রসঙ্গে উর্বরতা শব্দটির অর্থ কী?

উর্বরতা পরিমাপ শব্দ প্রতি টোকেন. উচ্চ উর্বরতা মানে টেক্সট আরো টুকরা বিভক্ত এবং আরো খরচ.

2024 সালে GPT-4o রিলিজ করার সময় OpenAI কোন পরিবর্তনের বর্ণনা দিয়েছে?

GPT-4o একটি বৃহত্তর শব্দভান্ডারের টোকেনাইজার নিয়ে এসেছে যা OpenAI বলেছে যে অনেক অ-ইংরেজি ভাষার জন্য আরও দক্ষ।