মৌলিক নির্দেশিকা

টোকেনাইজেশন

টোকেনাইজেশন হল এমন একটি ধাপ যা পাঠ্যকে ছোট ছোট টুকরো করে টোকেন বলে, একক যা একটি ভাষা মডেল আসলে পড়ে এবং ভবিষ্যদ্বাণী করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It quietly shapes cost, context limits, and even how well a model handles spelling and rare words.

গভীর ডুব

একটি মডেল আপনার পাঠ্যটি দেখার আগে, একটি টোকেনাইজার এটিকে টোকেনে বিভক্ত করে, যা সাধারণত পুরো শব্দ বা একক অক্ষরের পরিবর্তে সাবওয়ার্ড খণ্ড হয়। 'অসুখ' শব্দটি 'আন', 'সুখ' হয়ে উঠতে পারে বা 'টোকেনাইজেশন' 'টোকেন' এবং 'ইজেশন'-এ বিভক্ত হতে পারে। সাধারণ শব্দগুলি প্রায়শই একটি একক টোকেনে ম্যাপ করে, যখন বিরল শব্দ, নাম বা কোডগুলি কয়েকটিতে বিভক্ত হয়। প্রতিটি টোকেন তারপর একটি আইডি নম্বরে ম্যাপ করা হয় যা মডেলটি একটি ভেক্টরে রূপান্তরিত হয়। এটি কার্যত গুরুত্বপূর্ণ কারণ মডেলগুলিতে টোকেনে পরিমাপ করা কনটেক্সট উইন্ডো এবং প্রতি টোকেন এপিআই বিল রয়েছে, তাই একটি রুক্ষ ইংরেজি নিয়ম হল প্রায় 4টি অক্ষর বা 0.75 শব্দ প্রতি টোকেন। টোকেনাইজেশন ক্লাসিক মডেলের অদ্ভুততাও ব্যাখ্যা করে: অক্ষর গণনা করা বা সঠিক বানান করা কঠিন কারণ মডেলটি পৃথক অক্ষর নয়, খণ্ডগুলি দেখে।

প্রযুক্তিগত অন্তর্দৃষ্টি

বেশিরভাগ আধুনিক এলএলএম সাবওয়ার্ড টোকেনাইজেশন ব্যবহার করে যেমন বাইট পেয়ার এনকোডিং (বিপিই) বা এর বাইট-লেভেল ভেরিয়েন্ট। BPE অক্ষর থেকে শুরু হয় এবং একটি নির্দিষ্ট শব্দভাণ্ডার তৈরি করতে বারবার সবচেয়ে ঘন ঘন সংলগ্ন জোড়া একত্রিত করে (প্রায়শই 30,000 থেকে 100,000+ টোকেন)। এটি দুটি চরম ভারসাম্য রাখে: শব্দ-স্তরের টোকেনাইজেশন অদেখা শব্দগুলি পরিচালনা করতে পারে না, যখন অক্ষর-স্তর ক্রমগুলিকে খুব দীর্ঘ করে তোলে। সাবওয়ার্ডগুলি মডেলটিকে টাইপো এবং নতুন শব্দ সহ যে কোনও স্ট্রিংকে উপস্থাপন করতে দেয়, পরিচিত অংশগুলি রচনা করে, ক্রমগুলিকে যুক্তিসঙ্গতভাবে ছোট রেখে৷

কৌশলগত প্রভাব

সুস্পষ্ট সিদ্ধান্ত

এটি আপনাকে বিপণনের ভাষা থেকে স্পষ্ট প্রযুক্তিগত দাবিগুলি আলাদা করতে সহায়তা করে।

খরচ ও বাজেট

অর্থ বা সময় ব্যয় করার আগে আপনি আরও ভাল বাস্তবায়ন প্রশ্ন জিজ্ঞাসা করতে পারেন।

টিম এবং ওয়ার্কফ্লো

ভাগ করা বোঝাপড়া সহ দলগুলি আরও ভাল পণ্য, নীতি এবং শেখার সিদ্ধান্ত নেয়।

টোকেনাইজেশনের ভবিষ্যত

টোকেনাইজেশন একটি সক্রিয় গবেষণা ক্ষেত্র সঠিকভাবে কারণ এটি দক্ষতা এবং ন্যায্যতা সীমাবদ্ধ করে। যে ভাষাগুলিকে আরও টুকরো করে টোকেনাইজ করা হয় সেগুলির দাম বেশি হয় এবং প্রসঙ্গ দ্রুত ব্যবহার করে, তাই বহুভাষিক ন্যায্যতা একটি আসল উদ্বেগের বিষয় যা আরও ভাল, আরও ভারসাম্যপূর্ণ শব্দভান্ডার দিয়ে সমাধান করা হয়৷ গবেষকরা টোকেন-মুক্ত বা বাইট-স্তরের মডেলগুলিও (যেমন ByT5) অন্বেষণ করছেন এবং শিখেছেন টোকেনাইজেশন যা ভঙ্গুর হাত-টিউন করা পদক্ষেপকে সম্পূর্ণরূপে সরিয়ে দিতে পারে। আপাতত, বৃহত্তর শব্দভাণ্ডার, বুদ্ধিমান বহুভাষিক টোকেনাইজার এবং টোকেন-ভিত্তিক মূল্য এবং প্রসঙ্গ বাজেটের ক্রমবর্ধমান ব্যবহারকারীর সচেতনতা আশা করুন।

বাস্তব-বিশ্ব বাস্তবায়ন

GPT এবং Claude-এর মত মডেলগুলির জন্য API মূল্য ইনপুট এবং আউটপুট টোকেন প্রতি বিল করা হয়, তাই টোকেন গণনা সরাসরি খরচকে প্রভাবিত করে।

প্রসঙ্গ-উইন্ডো সীমা (যেমন, 128K বা 200K টোকেন) টোকেনে পরিমাপ করা হয়, আপনি কতটা পাঠ্য বা কোড অন্তর্ভুক্ত করতে পারেন তা ক্যাপ করে।

ডেভেলপাররা অনুরোধ পাঠানোর আগে প্রম্পট সাইজ এবং ট্রিম কন্টেন্ট অনুমান করতে টোকেনাইজার (যেমন টিকটকেন) ব্যবহার করে।

টোকেনাইজেশন ব্যাখ্যা করে কেন মডেলরা একটি শব্দে অক্ষর গণনা করতে বা একটি স্ট্রিংকে বিপরীত করতে লড়াই করে, যেহেতু তারা অক্ষর নয়, সাবওয়ার্ড খণ্ডগুলি দেখে।

ঝুঁকি এবং প্রহরী

বিভিন্ন দল একই শব্দটি ভিন্নভাবে ব্যবহার করতে পারে, তাই সুযোগটি আগে থেকেই নির্ধারণ করুন।

বেঞ্চমার্কগুলি শক্তিশালী দেখাতে পারে যখন বাস্তব-বিশ্বের কর্মক্ষমতা অসম হয়।

ডেটা গুণমান এবং মূল্যায়ন পরিকল্পনা উপেক্ষা করা প্রায়ই ভঙ্গুর ফলাফল তৈরি করে।

বাস্তবায়ন রোডম্যাপ

1

আপনার প্রয়োজনীয় ফলাফলের একটি সরল-ভাষা সংজ্ঞা দিয়ে শুরু করুন।

2

পরীক্ষার আগে একটি সাফল্যের মেট্রিক এবং একটি ব্যর্থতার শর্ত বাছুন।

3

একটি পালিশ ডেমো সেট নয়, প্রতিনিধি ডেটা সহ একটি ছোট পাইলট চালান৷

4

নথি যেখানে টোকেনাইজেশন সাহায্য করে এবং যেখানে সহজ পদ্ধতিগুলি ভাল।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

সেন্টেন্সপিস টোকেনাইজেশন

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Tokenization?

টোকেনাইজেশন হল এমন একটি ধাপ যা পাঠ্যকে ছোট ছোট টুকরো করে টোকেন বলে, একক যা একটি ভাষা মডেল আসলে পড়ে এবং ভবিষ্যদ্বাণী করে। এটি নিঃশব্দে ব্যয়, প্রসঙ্গ সীমা এবং এমনকি একটি মডেল কতটা ভালোভাবে বানান এবং বিরল শব্দ পরিচালনা করে তা নির্ধারণ করে।

একটি ভাষা মডেলের প্রসঙ্গে একটি 'টোকেন' কি?

টোকেন হল একক যা একটি মডেল প্রক্রিয়া করে, সাধারণত সাবওয়ার্ড খণ্ড, কখনও কখনও সম্পূর্ণ শব্দ বা একক অক্ষর।

বেশিরভাগ আধুনিক এলএলএম কোন টোকেনাইজেশন পদ্ধতি ব্যবহার করে?

সাবওয়ার্ড পদ্ধতি যেমন BPE ঘন ঘন অক্ষর জোড়া একত্রিত করে, বিশুদ্ধ শব্দ-স্তর এবং অক্ষর-স্তরের পদ্ধতির দুর্বলতাগুলির ভারসাম্য বজায় রাখে।

কেন টোকেনাইজেশন এলএলএম-এর জন্য একটি শব্দে অক্ষর গণনার মতো কাজকে কঠিন করে তোলে?

যেহেতু পাঠ্যকে সাবওয়ার্ড টোকেনগুলিতে গোষ্ঠীভুক্ত করা হয়েছে, মডেলটি প্রতিটি অক্ষরকে সরাসরি উপলব্ধি করে না, অক্ষর-স্তরের কাজগুলিকে ত্রুটি-প্রবণ করে তোলে।

কেন API খরচ এবং প্রসঙ্গ সীমার জন্য টোকেনাইজেশন গুরুত্বপূর্ণ?

প্রতি টোকেন প্রদানকারীর বিল এবং প্রসঙ্গ উইন্ডোগুলিকে টোকেনে আকার দেওয়া হয়, তাই টোকেন গণনা মূল্য এবং আপনি কতটা অন্তর্ভুক্ত করতে পারেন উভয়ই নির্দেশ করে৷

কেন একই বাক্য ইংরেজির চেয়ে কিছু ভাষায় বেশি টোকেন খরচ করতে পারে?

ইংরেজিতে প্রশিক্ষিত শব্দভান্ডারগুলি অন্যান্য ভাষাকে আরও টোকেনে বিভক্ত করে, খরচ বাড়ায় এবং প্রসঙ্গ দ্রুত ব্যবহার করে।