প্রযুক্তিগত গাইড

প্রম্পট ক্যাশিং

প্রম্পট ক্যাশিং একটি এআই মডেলকে প্রতিবার পুনঃপ্রক্রিয়া করার পরিবর্তে পাঠ্যের পুনরাবৃত্ত অংশে যে গণনামূলক কাজটি করেছিল তা পুনরায় ব্যবহার করতে দেয়।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It dramatically cuts cost and latency when the same long instructions, documents, or examples appear in request after request.

গভীর ডুব

যখন একটি ভাষা মডেল একটি প্রম্পট পড়ে, তখন এটি প্রতিটি টোকেনকে তার মনোযোগ স্তরগুলির মাধ্যমে কী-মান (KV) ভেক্টর নামক অভ্যন্তরীণ সংখ্যাসূচক অবস্থায় রূপান্তর করে। সাধারণত এটি প্রতিটি অনুরোধে তাজা হয়, এমনকি যদি প্রম্পটের 90% অভিন্ন হয়। প্রম্পট ক্যাশিং একটি চিহ্নিত উপসর্গের জন্য সেই প্রাক-কম্পিউটেড কেভি স্টেটগুলিকে সঞ্চয় করে, তাই একই পাঠ্য দিয়ে শুরু হওয়া পরবর্তী অনুরোধ সরাসরি নতুন অংশে চলে যেতে পারে। Anthropic এবং OpenAI এর মত প্রদানকারীরা আপনাকে একটি স্থিতিশীল উপসর্গ পতাকাঙ্কিত করার মাধ্যমে এটি প্রকাশ করে; ক্যাশে হিটগুলি একটি খাড়া ডিসকাউন্টে বিল করা হয় (প্রায়ই ইনপুট খরচে 90% ছাড়) এবং দ্রুত প্রতিক্রিয়া জানায়৷ এটি ফিক্সড সিস্টেম প্রম্পট সহ চ্যাটবট, একই ডকুমেন্ট পুনঃব্যবহারকারী আরএজি পাইপলাইন, বা দীর্ঘ ইতিহাস পুনরায় চালানোর এজেন্টদের জন্য আদর্শ।

প্রযুক্তিগত অন্তর্দৃষ্টি

ক্যাশিং কাজ করে কারণ ট্রান্সফরমার মনোযোগ কার্যকারণ: প্রতিটি টোকেন শুধুমাত্র টোকেনের আগে উপস্থিত থাকে। সুতরাং আপনি যখন পরবর্তীতে নতুন টোকেন যুক্ত করবেন তখন একটি উপসর্গের জন্য KV স্টেটগুলি কখনই পরিবর্তিত হবে না। ক্যাশে সেই প্রিফিক্সের একটি সঠিক টোকেন-ফর-টোকেন মিলের উপর চাবি করা হয়, যে কারণে প্রম্পটের প্রথম দিকে একটি অক্ষর সম্পাদনা সমস্ত কিছুকে বাতিল করে দেয়। ক্যাশেগুলি স্বল্পস্থায়ী (মিনিট), প্রতি-প্রদানকারীর জন্য সংরক্ষণ করা হয় এবং ক্যাশেযোগ্য ব্লক সাধারণত একটি সর্বনিম্ন টোকেন গণনা অতিক্রম করতে হবে।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

প্রম্পট ক্যাশিং এর ভবিষ্যত

ক্যাশিং স্বয়ংক্রিয় এবং দীর্ঘস্থায়ী হওয়ার প্রত্যাশা করুন, প্রদানকারীরা ম্যানুয়াল মার্কারগুলির প্রয়োজনের পরিবর্তে পুনরায় ব্যবহারযোগ্য স্প্যান সনাক্ত করে৷ অনুক্রমিক এবং আংশিক ক্যাশিং উভয় দিকে অপরিবর্তিত অংশগুলিকে প্রম্পটের মাঝখানে সম্পাদনা করতে দেয়। যেহেতু এজেন্টরা বিশাল প্রসঙ্গ এবং টুলের ইতিহাস ঘাঁটাঘাঁটি করে, সাধারণ সিস্টেম প্রম্পটের জন্য ক্রস-সেশন এবং ক্রস-ইউজার শেয়ার করা ক্যাশে মিলিয়ন-টোকেন কনটেক্সটকে অর্থনৈতিকভাবে কার্যকর করার মূল চাবিকাঠি হবে, এবং অন-ডিভাইস মডেলগুলি দ্রুত স্থানীয় অনুমানের জন্য অনুরূপ KV পুনঃব্যবহার গ্রহণ করবে।

বাস্তব-বিশ্ব বাস্তবায়ন

একটি গ্রাহক-সমর্থন চ্যাটবট তার 5,000-টোকেন নীতি এবং টোন সিস্টেম প্রম্পট ক্যাশ করে যাতে প্রতিটি ব্যবহারকারীর বার্তা শুধুমাত্র নতুন প্রশ্নের জন্য সম্পূর্ণ মূল্য প্রদান করে।

একটি পুনরুদ্ধার-বর্ধিত (RAG) অ্যাপ একবার একটি বড় রেফারেন্স নথি ক্যাশ করে, তারপর খরচের একটি ভগ্নাংশে এটি সম্পর্কে অনেক প্রশ্নের উত্তর দেয়।

একটি কোডিং সহকারী একটি স্থির উপসর্গ হিসাবে একটি বড় কোডবেস বা ফাইলের বিষয়বস্তু ক্যাশ করে যখন বিকাশকারী ক্রমাগত ফলো-আপ প্রশ্ন জিজ্ঞাসা করে।

একটি AI এজেন্ট তার দীর্ঘ, ক্রমবর্ধমান টুল-ব্যবহারের ট্রান্সক্রিপ্ট ক্যাশ করে যাতে প্রতিটি নতুন পদক্ষেপ পুরো পূর্বের কথোপকথনের পুনরায় বিল না করে।

ঝুঁকি এবং প্রহরী

একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

1

বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

2

বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

3

ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

4

স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prompt Caching quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

এআই প্রম্পট নিরাপত্তা

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Prompt Caching?

প্রম্পট ক্যাশিং একটি এআই মডেলকে প্রতিবার পুনঃপ্রক্রিয়া করার পরিবর্তে পাঠ্যের পুনরাবৃত্ত অংশে যে গণনামূলক কাজটি করেছিল তা পুনরায় ব্যবহার করতে দেয়। অনুরোধের পরে অনুরোধে একই দীর্ঘ নির্দেশাবলী, নথি বা উদাহরণ উপস্থিত হলে এটি নাটকীয়ভাবে খরচ এবং বিলম্বিতা হ্রাস করে।

প্রম্পট ক্যাশিং প্রাথমিকভাবে কি সঞ্চয় করে এবং পুনরায় ব্যবহার করে?

ক্যাশিং একটি স্থিতিশীল উপসর্গের জন্য গণনা করা KV মনোযোগের অবস্থা সংরক্ষণ করে যাতে প্রতিটি অনুরোধে তাদের পুনরায় গণনা করতে হয় না।

কেন একটি ক্যাশ করা প্রিফিক্স ঠিক মেলে, টোকেনের জন্য টোকেন?

যেহেতু প্রতিটি টোকেন শুধুমাত্র আগের টোকেনগুলিতে উপস্থিত থাকে, তাই একটি প্রাথমিক টোকেন পরিবর্তন করা প্রতিটি স্টেটকে বাতিল করে দেয় যা এটির উপর নির্ভর করে, ক্যাশে ভাঙ্গা৷

প্রম্পট ক্যাশিং থেকে কোন পরিস্থিতিতে সবচেয়ে বেশি সুবিধা হয়?

একটি স্থির সিস্টেম প্রম্পট বা ভাগ করা নথির মতো অনেক অনুরোধে যখন একটি বড়, অভিন্ন খণ্ড পুনরায় ব্যবহার করা হয় তখন ক্যাশিং পরিশোধ করে।

প্রধান প্রদানকারীর সাথে ইনপুট টোকেনগুলিতে ক্যাশে হিট করা মোটামুটি কত সস্তা?

প্রদানকারীরা সাধারণত ক্যাশে করা ইনপুটকে স্বাভাবিক ইনপুট হারে প্রায় 90% ছাড় দেয়, প্রধান কারণ ক্যাশিং অর্থ সাশ্রয় করে।

ক্যাশে হিট সর্বাধিক করার জন্য পুনরায় ব্যবহারযোগ্য সামগ্রী কোথায় রাখা উচিত?

স্থিতিশীল বিষয়বস্তুকে একটি উপসর্গ হিসেবে প্রথমে রাখা এবং পরবর্তীতে পরিবর্তন করা বিষয়বস্তু ক্যাশে করা উপসর্গকে পুনরায় ব্যবহার করতে দেয় যখন শুধুমাত্র নতুন টোকেন প্রক্রিয়া করা হয়।