ভাষা এআই গাইড

অনুমানমূলক ডিকোডিং খসড়া মডেল

অনুমানমূলক ডিকোডিং একটি ছোট, দ্রুত 'ড্রাফ্ট' মডেল ব্যবহার করে বেশ কয়েকটি আসন্ন টোকেন অনুমান করতে যা একটি বড় মডেল একটি পাসে যাচাই করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It speeds up text generation 2-3x with no change to the output.

গভীর ডুব

বড় ভাষার মডেলগুলি একবারে একটি টোকেন টেক্সট তৈরি করে, এবং প্রতিটি ধাপে বিলিয়ন প্যারামিটারের মধ্য দিয়ে একটি সম্পূর্ণ ফরওয়ার্ড পাস প্রয়োজন — ধীর এবং মেমরি-বাউন্ড৷ একটি সস্তা 'ড্রাফ্ট' মডেলের সাথে বড় 'টার্গেট' মডেলকে জোড়া লাগানোর মাধ্যমে অনুমানমূলক ডিকোডিং এটিকে আক্রমণ করে। খসড়া মডেলটি দ্রুত 4-8 প্রার্থীর টোকেনের একটি অংশ প্রস্তাব করে। বড় মডেল তারপর একটি একক সমান্তরাল ফরওয়ার্ড পাসে তাদের সব প্রক্রিয়া করে এবং প্রতিটি পরীক্ষা করে। যে টোকেনগুলি বড় মডেল তৈরি করবে তার সাথে মেলে; প্রথম অমিলটি সংশোধন করা হয়েছে এবং বাকিটি বাতিল করা হয়েছে। কারণ একবারে একাধিক টোকেন যাচাই করা মোটামুটি একটি তৈরি করার মতোই খরচ হয়, গৃহীত রানগুলি প্রায় বিনামূল্যে। অত্যন্ত গুরুত্বপূর্ণভাবে, একটি প্রত্যাখ্যান-স্যাম্পলিং ধাপ গ্যারান্টি দেয় যে চূড়ান্ত বন্টনটি একা বড় মডেল চালানোর অনুরূপ — গুণমানের ক্ষতি ছাড়াই গতি।

প্রযুক্তিগত অন্তর্দৃষ্টি

মূল কৌশলটি একটি পরিবর্তিত প্রত্যাখ্যান-নমুনা পরীক্ষা। প্রতিটি খসড়া টোকেনের জন্য, লক্ষ্য মডেলের সম্ভাব্যতা খসড়া মডেলের সাথে তুলনা করা হয়। যদি লক্ষ্য সমান বা উচ্চতর সম্ভাবনা বরাদ্দ করে, টোকেন গ্রহণ করা হয়; অন্যথায় এটি অনুপাতের সমান সম্ভাব্যতার সাথে গৃহীত হয় এবং প্রত্যাখ্যান করার সময় একটি সংশোধন করা টোকেন একটি সামঞ্জস্যকৃত অবশিষ্ট বিতরণ থেকে নমুনা করা হয়। এই গণিতটি আউটপুটটিকে বড় মডেল থেকে সরাসরি নমুনা নেওয়ার সমতুল্য করে তোলে।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।

অ্যাক্সেস এবং পৌঁছানো

এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।

সুস্পষ্ট সিদ্ধান্ত

অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।

অনুমানমূলক ডিকোডিং খসড়া মডেলের ভবিষ্যত

ভিএলএলএম এবং টেনসরআরটি-এলএলএম-এর মতো ইনফারেন্স সার্ভারগুলিতে ড্রাফ্ট মডেলগুলি স্ট্যান্ডার্ড অবকাঠামো হয়ে উঠবে বলে আশা করুন। স্ব-অনুমান ভেরিয়েন্ট (মেডুসা, ঈগল) হালকা ওজনের ভবিষ্যদ্বাণী হেড যোগ করে সম্পূর্ণ আলাদা খসড়া মডেলটি ড্রপ করে, এবং গাছ-ভিত্তিক খসড়া একযোগে অনেক প্রার্থীর ধারাবাহিকতা যাচাই করে। কনটেক্সট উইন্ডো বৃদ্ধি এবং পরিবেশন খরচ আধিপত্য হিসাবে, স্মার্ট, মডেল-ম্যাচড ড্রাফটার এবং হার্ডওয়্যার-সচেতন যাচাইকরণ গ্রহণযোগ্যতার হার এবং থ্রুপুট উচ্চতর হবে।

বাস্তব-বিশ্ব বাস্তবায়ন

Anthropic, OpenAI, এবং Google লেটেন্সি কমানোর জন্য অনুমানমূলক ডিকোডিং ব্যবহার করে এবং চ্যাট অ্যাসিস্ট্যান্টদের পরিষেবা প্রদানের খরচ লক্ষ লক্ষ ব্যবহারকারীকে পরিবেশন করে৷

vLLM এবং NVIDIA TensorRT-LLM জাহাজ অন্তর্নির্মিত অনুমানমূলক ডিকোডিং যাতে স্ব-হোস্টাররা লামা বা মিস্ট্রাল স্থাপনার গতি বাড়াতে পারে।

একটি 70বি টার্গেটের সাথে একটি 7B ড্রাফ্ট মডেল যুক্ত করা (যেমন, Llama-3 পরিবার) একটি একক GPU-তে প্রতি সেকেন্ডে প্রায় দ্বিগুণ টোকেন।

কোড-সম্পূর্ণতা সরঞ্জামগুলি বয়লারপ্লেট প্রস্তাব করার জন্য একটি ছোট খসড়া মডেল ব্যবহার করে যা বৃহত্তর মডেলটি যাচাই করে, পরামর্শগুলি সম্পাদকে চটকদার রাখে৷

ঝুঁকি এবং প্রহরী

হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।

প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।

অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।

2

যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।

3

উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।

4

ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding Draft Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

কোড মডেলের জন্য অনুমানমূলক সম্পাদনা

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Speculative Decoding Draft Models?

অনুমানমূলক ডিকোডিং একটি ছোট, দ্রুত 'ড্রাফ্ট' মডেল ব্যবহার করে বেশ কয়েকটি আসন্ন টোকেন অনুমান করতে যা একটি বড় মডেল একটি পাসে যাচাই করে। এটি আউটপুটে কোনো পরিবর্তন ছাড়াই টেক্সট জেনারেশনের গতি বাড়িয়ে দেয় 2-3x।

অনুমানমূলক ডিকোডিংয়ে 'খসড়া' মডেলের প্রাথমিক ভূমিকা কী?

ছোট খসড়া মডেলটি আসন্ন টোকেনগুলিকে সস্তায় অনুমান করে, যা বড় লক্ষ্য মডেলটি একটি একক সমান্তরাল পাসে পরীক্ষা করে।

কেন একবারে একাধিক খসড়া টোকেন যাচাই করা সময় বাঁচায়?

প্রজন্ম স্মৃতি আবদ্ধ; একটি ব্যাচড পাসে একাধিক টোকেন চেক করা প্রায় এক ধাপের মতোই সস্তা, তাই গৃহীত রান প্রায় বিনামূল্যে।

প্রথম টোকেন টার্গেট মডেল প্রত্যাখ্যান করার পরে খসড়া করা টোকেনগুলির কী হবে?

প্রথম মতবিরোধ না হওয়া পর্যন্ত গ্রহণযোগ্যতা অগ্রসর হয়; সেই টোকেন সংশোধন করা হয় এবং পরবর্তী সমস্ত খসড়া টোকেন ফেলে দেওয়া হয়।

কিভাবে অনুমানমূলক ডিকোডিং নিশ্চিত করে যে আউটপুট গুণমান অবনতি হয় না?

একটি সংশোধিত প্রত্যাখ্যান-নমুনা পরীক্ষা সরাসরি লক্ষ্য মডেল থেকে চূড়ান্ত টোকেন বিতরণের নমুনা মিলের গ্যারান্টি দেয়।

এইগুলির মধ্যে কোনটি একটি 'স্ব-জল্পনা' পদ্ধতি যা একটি পৃথক খসড়া মডেল এড়িয়ে যায়?

মেডুসা এবং ঈগল প্রধান মডেলে লাইটওয়েট অতিরিক্ত ভবিষ্যদ্বাণী হেড যোগ করে যাতে এটি নিজস্ব ভবিষ্যত টোকেন তৈরি করতে পারে।