টেস্ট-টাইম কম্পিউট স্কেলিং
টেস্ট-টাইম কম্পিউট স্কেলিং মানে একটি মডেলকে প্রশিক্ষণের সময় এটিকে বড় করার পরিবর্তে, একটি প্রশ্নের উত্তর দেওয়ার সময় আরও চিন্তা করার সময় এবং গণনা করা।
ওভারভিউ
It is the breakthrough behind 'reasoning models' that can solve hard math and coding problems by deliberating before responding.
গভীর ডুব
বছরের পর বছর ধরে, এআই অগ্রগতির অর্থ স্কেলিং প্রশিক্ষণ: আরও ডেটা, আরও প্যারামিটার, আরও প্রাক-প্রশিক্ষণ গণনা। টেস্ট-টাইম কম্পিউট স্কেলিং একটি দ্বিতীয় অক্ষ যোগ করে, অনুমানে আরও গণনা ব্যয় করে। তাত্ক্ষণিকভাবে একটি উত্তর নির্গত করার পরিবর্তে, একটি যুক্তি মডেল চিন্তার একটি দীর্ঘ অভ্যন্তরীণ শৃঙ্খল তৈরি করে, পদক্ষেপগুলি অন্বেষণ করে, কাজ পরীক্ষা করে এবং ব্যাকট্র্যাক করে৷ কৌশলগুলির মধ্যে রয়েছে বর্ধিত চেইন-অফ-থট, অনেক প্রার্থীর সমাধানের নমুনা নেওয়া এবং সেরাটি বেছে নেওয়া (স্ব-সংগতি বা সেরা-অফ-এন), এবং যাচাইকারী বা পুরস্কার মডেল দ্বারা পরিচালিত ট্রি-স্টাইল অনুসন্ধান। OpenAI এর o1 এবং o3, DeepSeek-R1, এবং Claude এর বর্ধিত চিন্তাভাবনা এটিকে জনপ্রিয় করেছে: প্রতিযোগিতার গণিত এবং প্রোগ্রামিং এর নির্ভুলতা তীব্রভাবে লাফিয়ে ওঠে কারণ আপনি মডেলটিকে 'আরো চিন্তা করুন', ট্রেডিং লেটেন্সি এবং উত্তর সমস্যার সঠিকতার জন্য খরচ করতে দেন।
প্রযুক্তিগত অন্তর্দৃষ্টি
মডেলটিকে কার্যকর যুক্তি টোকেন তৈরি করার জন্য শক্তিবৃদ্ধি শেখার প্রশিক্ষণ দেওয়া হয়, তারপরে আপনি একটি 'চিন্তামূলক বাজেট' বরাদ্দ করেন। আরও টোকেন এটিকে সমস্যাগুলিকে পচতে দেয়, এর নিজস্ব ত্রুটিগুলি ধরতে দেয় এবং স্ব-যাচাই করতে দেয়৷ সেরা-অফ-N স্যাম্পলিং এবং যাচাইকারী-নির্দেশিত অনুসন্ধান সমান্তরাল গণনা যোগ করুন: অনেক প্রচেষ্টা তৈরি করুন, সেগুলি স্কোর করুন, বিজয়ী রাখুন৷ গুরুত্বপূর্ণভাবে, উদার টেস্ট-টাইম কম্পিউট সহ ছোট মডেলগুলি অনেক বড় মডেলের সাথে মিলতে পারে যা তাত্ক্ষণিকভাবে উত্তর দেয়, খরচ বক্ররেখাকে পুনরায় আকার দেয়।
কৌশলগত প্রভাব
গতি এবং স্কেল
ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।
অ্যাক্সেস এবং পৌঁছানো
এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।
সুস্পষ্ট সিদ্ধান্ত
অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।
টেস্ট-টাইম কম্পিউট স্কেলিং এর ভবিষ্যত
টেস্ট-টাইম কম্পিউট এখন প্রশিক্ষণের পাশাপাশি একটি প্রাথমিক স্কেলিং লিভার। অভিযোজিত বাজেটের প্রত্যাশা করুন যেখানে মডেলটি সিদ্ধান্ত নেয় কতটা কঠিন সমস্যার উপর ভিত্তি করে চিন্তা করা যায়, দীর্ঘ চেইনকে ছোট করে পাতনের মাধ্যমে সস্তা যুক্তি, এবং 'এজেন্টিক' লুপ যা টুল কল এবং ওয়েব অনুসন্ধানের সাথে চিন্তাভাবনাকে আন্তঃস্খলিত করে। ইনফারেন্স হার্ডওয়্যার উন্নত হওয়ার সাথে সাথে, বৈজ্ঞানিক গবেষণা, সফ্টওয়্যার ইঞ্জিনিয়ারিং এবং জটিল পরিকল্পনার মতো উচ্চ-স্টেকের কাজগুলির জন্য ইচ্ছাকৃত যুক্তি ডিফল্ট হয়ে যাবে, যখন দ্রুত সন্ধান দ্রুত এবং সস্তা থাকবে।
বাস্তব-বিশ্ব বাস্তবায়ন
OpenAI-এর o1 এবং o3 মডেলগুলি ধাপে ধাপে অলিম্পিয়াড-স্তরের গণিত সমস্যার মধ্য দিয়ে চিন্তা করে, নাটকীয়ভাবে AIME এবং প্রতিযোগিতার বেঞ্চমার্কগুলিতে তাত্ক্ষণিক-উত্তর মডেলগুলিকে ছাড়িয়ে যায়৷
DeepSeek-R1 দীর্ঘ চেইন-অফ-থট রিজনিং শেখানোর জন্য রিইনফোর্সমেন্ট লার্নিং ব্যবহার করেছে, খোলাখুলিভাবে অতিরিক্ত অনুমান গণনা থেকে বড় নির্ভুলতা লাভ প্রদর্শন করেছে।
Claude এর বর্ধিত চিন্তা মোড ডেভেলপারদের একটি টোকেন বাজেট সেট করতে দেয় যাতে মডেলটি উত্তর দেওয়ার আগে জটিল কোডিং বা বিশ্লেষণের কাজগুলিকে দীর্ঘায়িত করে।
আলফাকোড এবং অনুরূপ সিস্টেমগুলি পরীক্ষার সময়ে হাজার হাজার প্রার্থীর প্রোগ্রামের নমুনা দেয়, তারপরে প্রতিযোগিতামূলক প্রোগ্রামিং চ্যালেঞ্জগুলি সমাধান করতে ফিল্টার এবং র্যাঙ্ক করে।
ঝুঁকি এবং প্রহরী
হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।
প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।
অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।
বাস্তবায়ন রোডম্যাপ
রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।
যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।
উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।
ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Test-Time Compute Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
টেস্ট-টাইম অগমেন্টেশন
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Test-Time Compute Scaling?
টেস্ট-টাইম কম্পিউট স্কেলিং মানে একটি মডেলকে প্রশিক্ষণের সময় এটিকে বড় করার পরিবর্তে, একটি প্রশ্নের উত্তর দেওয়ার সময় আরও চিন্তা করার সময় এবং গণনা করা। এটি 'রিজনিং মডেল'-এর পিছনে অগ্রগতি যা উত্তর দেওয়ার আগে চিন্তা করে কঠিন গণিত এবং কোডিং সমস্যার সমাধান করতে পারে।
'পরীক্ষার সময় গণনা' কী বোঝায়?
টেস্ট-টাইম (ইনফারেন্স-টাইম) গণনা হল একটি উত্তর তৈরি করার সময় করা কাজ, যা প্রাক-প্রশিক্ষণের সময় ব্যবহৃত গণনা থেকে আলাদা।
কিভাবে o1 মত যুক্তি মডেল অতিরিক্ত পরীক্ষা-সময় গণনা ব্যবহার করে?
তারা বর্ধিত ধাপে ধাপে যুক্তি, অন্বেষণ এবং একটি চূড়ান্ত প্রতিক্রিয়া প্রতিশ্রুতি দেওয়ার আগে সমাধান পরীক্ষা করে।
টেস্ট-টাইম কম্পিউট স্কেলিং এর মূল ট্রেড-অফ কি?
একটি মডেলকে দীর্ঘ সময় চিন্তা করতে দেওয়া কঠিন সমস্যাগুলির সঠিকতা উন্নত করে কিন্তু প্রতিক্রিয়ার সময় এবং গণনামূলক খরচ বাড়ায়।
'বেস্ট-অফ-এন' স্যাম্পলিং কী?
বেস্ট-অফ-এন সমান্তরালভাবে একাধিক সমাধানের প্রচেষ্টা তৈরি করে এবং সবচেয়ে শক্তিশালীকে রাখতে একটি স্কোরার বা যাচাইকারী ব্যবহার করে, যা পরীক্ষার সময় স্কেলিং এর একটি রূপ।
কেন পরীক্ষার সময় গণনা একটি নতুন 'স্কেলিং অক্ষ' হিসাবে বিবেচিত হয়?
বছর ধরে স্কেলিং মানে বড় প্রশিক্ষণ রান; টেস্ট-টাইম কম্পিউট অনুমানে আরও কম্পিউট করে ক্ষমতা বাড়ানোর দ্বিতীয় উপায় যোগ করে।