কঙ্কাল-অফ-থট প্যারালাল ডিকোডিং
Skeleton-of-Thought (SoT) হল একটি প্রম্পটিং এবং ডিকোডিং কৌশল যা প্রথমে একটি ভাষা মডেলকে উত্তর পয়েন্টগুলির একটি সংক্ষিপ্ত কঙ্কালের রূপরেখা দিতে বলে, তারপর সমান্তরালভাবে প্রতিটি বিন্দুকে প্রসারিত করে।
ওভারভিউ
It matters because it can cut the wall-clock latency of long answers by roughly 2x without retraining the model.
গভীর ডুব
বড় ভাষার মডেলগুলি সাধারণত একবারে একটি টোকেন তৈরি করে, তাই একটি দীর্ঘ উত্তর ধীর হয় কারণ প্রতিটি শব্দ তার আগে একটির জন্য অপেক্ষা করে। Skeleton-of-Thought, 2023 সালে Tsinghua এবং Microsoft এর গবেষকদের দ্বারা প্রবর্তিত, কাজটিকে পুনর্গঠন করে। একটি প্রথম কল মডেলটিকে একটি স্থির কঙ্কালের জন্য জিজ্ঞাসা করে: 3 থেকে 10 পয়েন্ট শিরোনামের একটি সংখ্যাযুক্ত তালিকা, প্রতিটি মাত্র কয়েকটি শব্দ। কলগুলির একটি দ্বিতীয় ব্যাচ তারপর প্রতিটি পয়েন্টকে স্বাধীনভাবে এবং একই সাথে প্রসারিত করে, কারণ পয়েন্টগুলি একে অপরের উপর নির্ভর করে না। সম্প্রসারণগুলি চূড়ান্ত উত্তরে একসাথে সেলাই করা হয়। যেহেতু ধীর সম্প্রসারণ পর্যায় সমান্তরালভাবে চলে, মোট লেটেন্সি এমন প্রশ্নগুলির জন্য তীব্রভাবে হ্রাস পায় যার উত্তরগুলি স্বাভাবিকভাবে স্বাধীন অংশে বিভক্ত হয়ে যায়, যেমন তালিকার টিপস বা তুলনা বিকল্পগুলি।
প্রযুক্তিগত অন্তর্দৃষ্টি
SoT শোষণ করে যে ডিকোডার অনুমান লেটেন্সি-বাউন্ড, সবসময় কম্পিউট-বাউন্ড নয়: একটি একক অনুরোধ প্রায়ই জিপিইউকে কম ব্যবহার করে ফেলে। একটি ব্যাচ হিসাবে চলমান পয়েন্ট সম্প্রসারণ হার্ডওয়্যারকে ব্যস্ত রাখে এবং প্রতি-পয়েন্ট প্রজন্মকে ওভারল্যাপ করে। এপিআই মডেলগুলির সাথে, সম্প্রসারণগুলি সমকালীন অনুরোধ হিসাবে জারি করা হয়; স্থানীয় মডেলের সাথে, তারা একটি ব্যাচড ফরওয়ার্ড পাস ভাগ করে নেয়। কঙ্কাল পর্যায় একটি নির্দিষ্ট সংক্ষিপ্ত ওভারহেড যোগ করে, তাই নেট স্পিডআপ উত্তরের দৈর্ঘ্য এবং স্বাধীন বিন্দুর সংখ্যার সাথে বৃদ্ধি পায়।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।
অ্যাক্সেস এবং পৌঁছানো
এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।
সুস্পষ্ট সিদ্ধান্ত
অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।
কঙ্কাল-অফ-থট সমান্তরাল ডিকোডিংয়ের ভবিষ্যত
SoT ধারণাগুলি অভিযোজিত রাউটিং-এ একত্রিত হওয়ার প্রত্যাশা করুন: সিস্টেমগুলি সনাক্ত করবে যখন একটি প্রশ্ন পরিষ্কারভাবে পচে যায় এবং সমান্তরাল প্রসারণে স্যুইচ করে, গণিত প্রমাণের মতো শক্তভাবে নির্ভরশীল কাজের জন্য অনুক্রমিক যুক্তিতে ফিরে আসে। গতিশীল গ্রাফ নির্ভরতা সহ SoT এর মত বৈকল্পিকগুলি একে অপরকে উল্লেখ করে এমন পয়েন্টগুলিকে অনুমতি দেয়। পরিবেশনকারী ফ্রেমওয়ার্কগুলি নেটিভ ব্যাচড সাব-রিকোয়েস্ট সমর্থন এবং অনুমানমূলক ডিকোডিং যুক্ত করে, সমান্তরাল-পচন কৌশলগুলি একটি ম্যানুয়াল প্রম্পট কৌশলের পরিবর্তে একটি স্ট্যান্ডার্ড লেটেন্সি-রিডাকশন লেয়ার হয়ে উঠবে।
বাস্তব-বিশ্ব বাস্তবায়ন
একটি চ্যাটবটকে ত্বরান্বিত করা যা 'ক্লাউড খরচ কমানোর জন্য আমাকে 8 টি টিপস দাও' উত্তর দেয় সমস্ত আটটি টিপস একবারে প্রসারিত করে৷
একটি গ্রাহক-সমর্থন সহকারী নিম্ন প্রতিক্রিয়া বিলম্ব সহ একটি কাঠামোগত বহু-বিভাগের সমস্যা সমাধানের নির্দেশিকা তৈরি করে৷
একটি তুলনামূলক উত্তর তৈরি করা (দুটি পণ্যের সুবিধা এবং অসুবিধা) যেখানে প্রতিটি বুলেট একই সাথে পূর্ণ হয়।
ব্যাকএন্ড সার্ভিং সিস্টেমগুলি দীর্ঘ-ফর্ম জেনারেশনের সময় GPU ব্যবহার বাড়াতে স্বাধীন উত্তর বিভাগগুলি ব্যাচ করে।
ঝুঁকি এবং প্রহরী
হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।
প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।
অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।
বাস্তবায়ন রোডম্যাপ
রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।
যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।
উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।
ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Skeleton-of-Thought Parallel Decoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
মাস্কজিআইটি সমান্তরাল টোকেন ডিকোডিং
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Skeleton-of-Thought Parallel Decoding?
Skeleton-of-Thought (SoT) হল একটি প্রম্পটিং এবং ডিকোডিং কৌশল যা প্রথমে একটি ভাষা মডেলকে উত্তর পয়েন্টগুলির একটি সংক্ষিপ্ত কঙ্কালের রূপরেখা দিতে বলে, তারপর সমান্তরালভাবে প্রতিটি বিন্দুকে প্রসারিত করে। এটি গুরুত্বপূর্ণ কারণ এটি মডেলটিকে পুনরায় প্রশিক্ষণ না দিয়ে প্রায় 2x দীর্ঘ উত্তরগুলির প্রাচীর-ঘড়ির লেটেন্সি কাটতে পারে৷
Skeleton-of-Thought-এর প্রথম পর্যায় কী উৎপন্ন করে?
SoT প্রথমে মডেলটিকে বিন্দু শিরোনামের একটি ছোট কঙ্কাল নির্গত করতে অনুরোধ করে, যা পরে আলাদাভাবে প্রসারিত হয়।
কেন বিন্দু-প্রসারণ পর্যায় সমান্তরালভাবে চলতে পারে?
কঙ্কালের বিন্দুগুলি স্বাধীন হওয়ার জন্য ডিজাইন করা হয়েছে, তাই তাদের প্রসারিত করার জন্য ভাইবোনের জন্য অপেক্ষা করার প্রয়োজন নেই।
সাধারণ এলএলএম ডিকোডিং-এ প্রধান বাধার SoT লক্ষ্যগুলি কী?
স্ট্যান্ডার্ড ডিকোডিং লেটেন্সি-বাউন্ড কারণ প্রতিটি টোকেন আগেরটির জন্য অপেক্ষা করে; দেয়াল ঘড়ির সময় কমাতে SoT ওভারল্যাপ কাজ করে।
কোন ধরনের প্রশ্নের জন্য SoT সবচেয়ে বড় গতি দেয়?
অনেকগুলি স্বাধীন অংশে পচনশীল উত্তরগুলি সবচেয়ে বেশি উপকৃত হয়, যেহেতু প্রতিটি অংশ একই সাথে প্রসারিত হয়।
একটি একক অনুক্রমিক প্রজন্মের তুলনায় SoT কি ওভারহেড যোগ করে?
কঙ্কাল পর্যায় একটি ছোট স্থির লেটেন্সি যোগ করে, যা দীর্ঘ উত্তরের সমান্তরাল প্রসারণের দ্বারা ছাড়িয়ে যায়।