প্রশ্ন-শিক্ষা
কিউ-লার্নিং হল একটি রিইনফোর্সমেন্ট লার্নিং অ্যালগরিদম যা একটি এজেন্টকে শেখায় যে ক্রিয়াগুলি পরীক্ষা এবং ত্রুটির মাধ্যমে ধীরে ধীরে প্রতিটি পদক্ষেপের মূল্য শিখে সর্বোত্তম অর্থ প্রদান করে।
ওভারভিউ
It matters because it can find optimal behavior without ever being told the rules of its environment.
গভীর ডুব
Q-Learning Q(s, a) নামক একটি ফাংশন শেখে: রাজ্য 's'-এ 'a' অ্যাকশন নেওয়ার এবং তারপরে সর্বোত্তমভাবে কাজ করার প্রত্যাশিত দীর্ঘমেয়াদী পুরস্কার। এজেন্ট কিছুই না জেনে শুরু করে, কাজ করার চেষ্টা করে এবং পুরষ্কার দেখে। প্রতিটি পদক্ষেপের পরে এটি তার Q-মূল্য অনুমানকে সবেমাত্র প্রাপ্ত পুরস্কারের সাথে সাথে পরবর্তী রাজ্য থেকে আশা করা সেরা ছাড়যুক্ত ভবিষ্যত মূল্যের দিকে নিয়ে যায়। গুরুত্বপূর্ণভাবে, এটি 'অফ-পলিসি' এবং 'মডেল-মুক্ত': এলোমেলোভাবে অন্বেষণ করার সময় এটি সর্বোত্তম নীতি শিখতে পারে, এবং কীভাবে বিশ্ব পরিবর্তন হয় তার একটি মডেলের প্রয়োজন হয় না। প্রতিটি স্টেট-অ্যাকশন পেয়ারের পর্যাপ্ত অন্বেষণের কারণে, Q-মানগুলি সম্ভবত সর্বোত্তম মানগুলিতে একত্রিত হয়, এবং যে কোনও রাজ্যে সর্বোত্তম ক্রিয়াটি কেবল সর্বোচ্চ Q সহ।
প্রযুক্তিগত অন্তর্দৃষ্টি
মূল হল বেলম্যান আপডেট: Q(s,a) <- Q(s,a) + alpha[r + gamma*max_a' Q(s',a') - Q(s,a)]। আলফা হল শেখার হার, গামা হল ডিসকাউন্ট ফ্যাক্টর যা ভবিষ্যৎ পুরষ্কারগুলি ওজন করে এবং বন্ধনী শব্দটি হল সাময়িক-পার্থক্য ত্রুটি৷ পরবর্তী অ্যাকশনগুলির উপর 'সর্বোচ্চ' যা এটিকে নীতির বাইরে তৈরি করে এবং এটি অন্বেষণ করার সময়ও লোভী সর্বোত্তম নীতি শিখতে দেয়। অনুসন্ধান সাধারণত এপসিলন-লোভী অ্যাকশন নির্বাচনের মাধ্যমে পরিচালিত হয়।
কৌশলগত প্রভাব
খরচ ও বাজেট
আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।
সুস্পষ্ট সিদ্ধান্ত
কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।
মান নিয়ন্ত্রণ
ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।
কিউ-লার্নিং এর ভবিষ্যত
ক্লাসিক টেবুলার Q-লার্নিং সংগ্রাম করে যখন একটি টেবিলে সংরক্ষণ করার জন্য রাজ্যগুলি অনেক বেশি হয়। প্রভাবশালী দিকটি এটিকে নিউরাল নেটওয়ার্কের সাথে একত্রিত করছে, যেমন ডিপ কিউ-নেটওয়ার্কস (ডিকিউএন), যা পিক্সেলের মতো কাঁচা ইনপুট থেকে আনুমানিক Q-মূল্য নির্ণয় করে। অভিজ্ঞতার রিপ্লে, টার্গেট নেটওয়ার্ক এবং ডাবল ডিকিউএন এবং ডিস্ট্রিবিউশনাল কিউ-লার্নিং এর মতো ভেরিয়েন্টের মাধ্যমে এটিকে স্থিতিশীল করার উপর গবেষণা অব্যাহত রয়েছে যা অত্যধিক মূল্যায়ন পক্ষপাত কমায় এবং একক গড়ের পরিবর্তে সম্পূর্ণ রিটার্ন বিতরণকে প্রতিনিধিত্ব করে।
বাস্তব-বিশ্ব বাস্তবায়ন
আটারি গেম-প্লেয়িং এজেন্ট (ডিপমাইন্ডের ডিকিউএন) সরাসরি স্ক্রীন পিক্সেল থেকে ব্রেকআউট এবং পং খেলতে শিখছে
মোট যানবাহনের অপেক্ষার সময় কমাতে ইন্টারসেকশনে ট্রাফিক-লাইট টাইমিং অপ্টিমাইজ করা
একটি গ্রিড বা গোলকধাঁধার মাধ্যমে রোবট নেভিগেশন যেখানে রোবট সবচেয়ে সংক্ষিপ্ততম পুরস্কার-সর্বাধিক পথ শেখে
গতিশীল মূল্য এবং ইনভেন্টরি সিদ্ধান্ত যেখানে একজন এজেন্ট শেখে কোন ক্রিয়াগুলি দীর্ঘমেয়াদী লাভকে সর্বাধিক করে তোলে
ঝুঁকি এবং প্রহরী
একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।
অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।
সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।
বাস্তবায়ন রোডম্যাপ
বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।
বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।
ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।
স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।
অন্বেষণ চালিয়ে যান
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Q-Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
পরবর্তী গাইড
শেখার হার নির্ধারণ
প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী
What is Q-Learning?
কিউ-লার্নিং হল একটি রিইনফোর্সমেন্ট লার্নিং অ্যালগরিদম যা একটি এজেন্টকে শেখায় যে ক্রিয়াগুলি পরীক্ষা এবং ত্রুটির মাধ্যমে ধীরে ধীরে প্রতিটি পদক্ষেপের মূল্য শিখে সর্বোত্তম অর্থ প্রদান করে। এটি গুরুত্বপূর্ণ কারণ এটি তার পরিবেশের নিয়ম না বলে সর্বোত্তম আচরণ খুঁজে পেতে পারে।
Q-মান Q(s, a) কিসের প্রতিনিধিত্ব করে?
Q(s, a) শুধুমাত্র তাৎক্ষণিক পুরষ্কার নয়, রাজ্যে পদক্ষেপ নেওয়া এবং তার পরে সর্বোত্তম আচরণ করা থেকে মোট ছাড় দেওয়া ভবিষ্যত পুরস্কারের অনুমান করে।
কেন কিউ-লার্নিংকে 'অফ-পলিসি' হিসাবে বর্ণনা করা হয়?
পরবর্তী অ্যাকশনের সর্বোচ্চ মানে Q-লার্নিং লোভী সর্বোত্তম নীতির মূল্য শেখে এমনকি যখন এজেন্ট একটি ভিন্ন আচরণ নীতির সাথে অনুসন্ধান করে।
আপডেটের নিয়মে, ডিসকাউন্ট ফ্যাক্টর গামা নিয়ন্ত্রণ করে কি?
গামা (0 এবং 1 এর মধ্যে) ভবিষ্যত পুরস্কারে ছাড় দেয়; 1 এর কাছাকাছি মানগুলি এজেন্টকে দূরদর্শী করে তোলে, 0 এর কাছাকাছি মানগুলি এটিকে অদূরদর্শী করে তোলে।
Q-Learning-এ টেম্পোরাল-ডিফারেন্স (TD) ত্রুটি কী?
TD ত্রুটি হল নতুন লক্ষ্য অনুমান (পুরস্কার এবং সেরা ছাড়যুক্ত ভবিষ্যত মূল্য) এবং পুরানো Q অনুমানের মধ্যে ব্যবধান; আপডেট এই ফাঁক সঙ্কুচিত.
কেন প্লেইন ট্যাবুলার Q-লার্নিং পিক্সেল থেকে ভিডিও গেমের মতো বড় সমস্যাগুলির সাথে লড়াই করে?
একটি লুকআপ টেবিলের জন্য প্রতি স্টেট-অ্যাকশন পেয়ারের জন্য একটি এন্ট্রির প্রয়োজন, যা অসম্ভাব্য যখন রাজ্যের সংখ্যা বিলিয়ন, DQN-এর মতো নিউরাল-নেটওয়ার্ক আনুমানিকদের অনুপ্রাণিত করে।