YaRN এবং প্রসঙ্গ দৈর্ঘ্য এক্সটেনশন
ইয়াআরএন (এখনও আরেকটি রোপিই এক্সটেনশন) একটি মডেলের ব্যবহারযোগ্য প্রসঙ্গ উইন্ডোকে প্রসারিত করার জন্য একটি দক্ষ কৌশল যা এটিকে প্রশিক্ষিত করা হয়েছিল তার থেকেও বেশি।
ওভারভিউ
It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.
গভীর ডুব
বেশিরভাগ আধুনিক এলএলএম টোকেন পজিশনকে রোপিই (রোটারি পজিশন এমবেডিংস) দিয়ে এনকোড করে, যা পজিশনের সাথে আবদ্ধ কোণ দ্বারা কোয়েরি এবং কী ভেক্টর ঘোরায়। আপনি যখন প্রশিক্ষণের দৈর্ঘ্যের চেয়ে দীর্ঘ ক্রমগুলি ফিড করেন, তখন এই ঘূর্ণনগুলি অদেখা পরিসরে প্রবেশ করে এবং মডেলটি ভেঙে যায়। ইয়াআরএন, বোয়েন পেং এবং সহযোগীদের দ্বারা 2023 সালে প্রবর্তিত, প্রতি ফ্রিকোয়েন্সি প্রয়োগ করা NTK-সচেতন ইন্টারপোলেশনের সাথে এটি ঠিক করে: এটি কম-ফ্রিকোয়েন্সি মাত্রাগুলিকে (যা দীর্ঘ-পরিসরের অবস্থানকে ট্র্যাক করে) ইন্টারপোলেট করার সময় উচ্চ-ফ্রিকোয়েন্সি মাত্রাগুলি (যা স্থানীয়, স্বল্প-পরিসরের সম্পর্কগুলিকে ক্যাপচার করে) বেশিরভাগই অস্পৃশ্য রাখে। ইয়াআরএন দীর্ঘ প্রেক্ষাপট থেকে আসা এনট্রপি পরিবর্তনগুলিকে মোকাবেলায় মনোযোগের জন্য একটি তাপমাত্রা সামঞ্জস্য যুক্ত করে। ফলাফল শুধুমাত্র একটি ক্ষুদ্র ভগ্নাংশের উপর সূক্ষ্ম-টিউনিং করার পরে শক্তিশালী দীর্ঘ-প্রসঙ্গ কর্মক্ষমতা এবং নিষ্পাপ পদ্ধতির জন্য প্রয়োজনীয় পদক্ষেপগুলি।
প্রযুক্তিগত অন্তর্দৃষ্টি
RoPE প্রতিটি এমবেডিং মাত্রাকে একটি ঘূর্ণন ফ্রিকোয়েন্সি নির্ধারণ করে। নিষ্পাপ রৈখিক ইন্টারপোলেশন সমস্ত ফ্রিকোয়েন্সি সমানভাবে সংকুচিত করে, উচ্চ-ফ্রিকোয়েন্সি মাত্রার ক্ষতি করে যা সূক্ষ্ম স্থানীয় বিবরণ এনকোড করে। YaRN একটি র্যাম্প ফাংশন ব্যবহার করে শুধুমাত্র নিম্ন-ফ্রিকোয়েন্সি (দীর্ঘ-তরঙ্গদৈর্ঘ্য) মাত্রাগুলিকে প্রসারিত করার জন্য উচ্চ-ফ্রিকোয়েন্সিগুলি সংরক্ষণ করে, এছাড়াও একটি 1/sqrt(t) মনোযোগ তাপমাত্রা স্কেলিং যা ক্রম দৈর্ঘ্য বৃদ্ধির সাথে সাথে softmax তীক্ষ্ণতা স্থিতিশীল রাখে। এই NTK-বাই-পার্টস পদ্ধতিটি অনেক কম অবনতির সাথে প্রসঙ্গকে প্রসারিত করে।
কৌশলগত প্রভাব
খরচ ও বাজেট
আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।
সুস্পষ্ট সিদ্ধান্ত
কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।
মান নিয়ন্ত্রণ
ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।
ইয়াআরএন এবং প্রসঙ্গ দৈর্ঘ্য এক্সটেনশনের ভবিষ্যত
কনটেক্সট এক্সটেনশন এখন স্ট্যান্ডার্ড প্র্যাকটিস: ওপেন মডেলগুলি নিয়মিতভাবে YaRN-এক্সটেন্ডেড ভেরিয়েন্টগুলি 128K টোকেন বা তার পরে পৌঁছে দেয়। গবেষণা এমন পদ্ধতির দিকে অগ্রসর হচ্ছে যা শূন্য বা প্রায়-শূন্য ফাইন-টিউনিংয়ের সাথে প্রসঙ্গ প্রসারিত করে, মনোযোগ-প্যাটার্ন কৌশলগুলির সাথে RoPE রিস্কেলিংকে একত্রিত করে এবং শুধুমাত্র প্রান্তের পরিবর্তে পুরো উইন্ডো জুড়ে গুণমান বজায় রাখে। পূর্বপ্রশিক্ষণে এই কৌশলগুলির কঠোর সংহতকরণের প্রত্যাশা করুন তাই দীর্ঘ প্রসঙ্গটি রেট্রোফিটেডের পরিবর্তে স্থানীয়।
বাস্তব-বিশ্ব বাস্তবায়ন
সংক্ষিপ্ত ফাইন-টিউনিং সহ দীর্ঘ-নথি প্রশ্নের উত্তরের জন্য একটি খোলা 4K-প্রসঙ্গ মডেলকে 32K বা 128K-তে প্রসারিত করা
পুনরুদ্ধার-বর্ধিত সিস্টেমগুলিকে ছেঁটে ফেলা ছাড়াই অনেকগুলি সংযুক্ত প্যাসেজ গ্রহণ করতে সক্ষম করা
পাওয়ারিং কোড অ্যাসিস্ট্যান্ট যাদের একটি সম্পূর্ণ বৃহৎ সংগ্রহস্থল ফাইল বা একটি প্রম্পটে একাধিক ফাইল প্রয়োজন
দীর্ঘ মাল্টি-টার্ন কথোপকথনের জন্য একটি বেস মডেল মানিয়ে নেওয়া যা বড় চ্যাট ইতিহাস জমা করে
ঝুঁকি এবং প্রহরী
একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।
অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।
সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।
বাস্তবায়ন রোডম্যাপ
বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।
বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।
ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।
স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN and Context Length Extension quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
প্রসঙ্গ এক্সটেনশনের জন্য অবস্থান ইন্টারপোলেশন
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is YaRN and Context Length Extension?
ইয়াআরএন (এখনও আরেকটি রোপিই এক্সটেনশন) একটি মডেলের ব্যবহারযোগ্য প্রসঙ্গ উইন্ডোকে প্রসারিত করার জন্য একটি দক্ষ কৌশল যা এটিকে প্রশিক্ষিত করা হয়েছিল তার থেকেও বেশি। এটি চতুরতার সাথে ঘূর্ণমান অবস্থান এমবেডিংগুলিকে পুনরায় স্কেল করে যাতে প্রশিক্ষিত একটি মডেল, বলুন, 4K টোকেন ন্যূনতম ফাইন-টিউনিং সহ 32K বা তার বেশি পরিচালনা করতে পারে৷
প্রসঙ্গ প্রসারিত করতে YaRN কোন অবস্থান-এনকোডিং পদ্ধতি পরিবর্তন করে?
ইয়াআরএন, যার নামের অর্থ হল আরেকটা রোপিই এক্সটেনশন, বেশিরভাগ আধুনিক এলএলএম-এ ব্যবহৃত রোটারি পজিশন এমবেডিংগুলিকে রিস্কেল করে।
যখন একটি RoPE মডেল তার প্রশিক্ষণের দৈর্ঘ্যের চেয়ে দীর্ঘ ক্রমগুলি দেখে তখন কী ভুল হয়?
প্রশিক্ষণের বাইরে অবস্থানগুলি ঘূর্ণন কোণ তৈরি করে যা মডেলটি কখনও দেখেনি, তাই মনোযোগের আচরণ তীব্রভাবে হ্রাস পায়।
ইয়াআরএন কীভাবে বিভিন্ন RoPE ফ্রিকোয়েন্সি মাত্রার সাথে আচরণ করে?
ইয়াআরএন একটি এনটিকে-বাই-পার্টস র্যাম্প ব্যবহার করে যা দীর্ঘ-তরঙ্গদৈর্ঘ্যের কম-ফ্রিকোয়েন্সি ডিমসকে ইন্টারপোলেট করে এবং স্বল্প-পরিসরের উচ্চ-ফ্রিকোয়েন্সি ম্লানগুলি বেশিরভাগই অক্ষত রাখে।
ফ্রিকোয়েন্সি রিস্কেল করার পাশাপাশি, ইয়াআরএন কী অতিরিক্ত সমন্বয় প্রয়োগ করে?
YaRN প্রসঙ্গ বৃদ্ধির সাথে সাথে ঘটতে থাকা এনট্রপি শিফ্টগুলিকে প্রতিহত করার জন্য মনোযোগ লগিটগুলিতে একটি তাপমাত্রা স্কেলিং যুক্ত করে।
নিষ্পাপ ইন্টারপোলেশনের উপর YaRN-এর একটি মূল ব্যবহারিক সুবিধা কী?
YaRN নিখুঁত পদ্ধতিতে প্রয়োজনীয় ডেটার একটি ছোট অংশে সূক্ষ্ম-টিউনিং করার পরে শক্তিশালী দীর্ঘ-প্রসঙ্গ গুণমান অর্জন করে।