কি হয়েছে
গবেষকরা DataKernelBench প্রবর্তন করেছেন, বড় ভাষার মডেলগুলি GPU-তে অনিয়মিত, ডেটা-আন্দোলন-ভারী ডাটাবেস ক্রিয়াকলাপগুলিকে অপ্টিমাইজ করতে পারে কিনা তা পরীক্ষা করার জন্য একটি বেঞ্চমার্ক। সিস্টেমটি এসকিউএল কোয়েরিগুলিকে বৈধ PyTorch TorchPlan প্রোগ্রামগুলিতে অনুবাদ করে, তারপরে মডেলগুলিকে মূল্যায়ন করে কারণ তারা হয় একটি কেন্দ্রীয় টেনসর-বাউন্ডেড কোড বিভাগ বা CUDA বা Triton-এ সম্পূর্ণ ক্যোয়ারী অপ্টিমাইজ করে।
কাগজটি, 25 আগস্ট, 2026-এ arXiv-এ জমা দেওয়া হয়েছিল এবং EMNLP 2026-এ গৃহীত উত্স হিসাবে চিহ্নিত করা হয়েছে, বিশেষ করে GPU-তে ডেটাবেস কোয়েরির AI-উত্পাদিত অপ্টিমাইজেশনের জন্য একটি মূল্যায়ন হিসাবে DataKernelBench উপস্থাপন করে৷ লেখকরা যুক্তি দেন যে বিদ্যমান এলএলএম কার্নেল বেঞ্চমার্কগুলি পর্যাপ্তভাবে ডাটাবেস-স্টাইল অপারেটরদের পরীক্ষা করে না, যা অনিয়মিত, ভিন্নধর্মী এবং ডেটা চলাচলের দ্বারা প্রভাবিত হতে পারে। এটি বেঞ্চমার্কের লক্ষ্যকে আরও নিয়মিত অপারেটর থেকে আলাদা করে তোলে যা প্রায়শই জেনারেট করা GPU কোড মূল্যায়ন করতে ব্যবহৃত হয়।
DataKernelBench এসকিউএলকে বৈধ PyTorch TorchPlan প্রোগ্রামে রূপান্তর করে। তারপর মডেলগুলিকে CUDA বা Triton ব্যবহার করে একটি কোর টেনসর-বাউন্ডেড স্নিপেট বা সম্পূর্ণ ক্যোয়ারী অপ্টিমাইজ করতে বলা হয়। মূল্যায়নে এক্সিকিউশন-নির্দেশিত মেরামত অন্তর্ভুক্ত রয়েছে, যার অর্থ উৎপন্ন প্রোগ্রামগুলি তাদের সম্পাদন থেকে প্রতিক্রিয়ার মাধ্যমে পরীক্ষা এবং সংশোধন করা হয়। বিমূর্তটি বলে যে গবেষণাটি একটি H100 GPU ব্যবহার করে TPC-H SF10 কাজের চাপে দশটি মালিকানাধীন এবং ওপেন-ওয়েট মডেল কভার করে।
কাগজের রিপোর্ট করা ফলাফল অনুসারে, সবচেয়ে শক্তিশালী পূর্ণ-ক্যোয়ারী CUDA কনফিগারেশন সম্পূর্ণ পাস হারে তুলনা বেসলাইনের তুলনায় 2.11× গতি অর্জন করেছে। উৎসটি বেসলাইনের নাম প্রকাশ করে না কারণ বিমূর্তটিতে সেই অবস্থানে একটি বিকৃত লিঙ্ক রয়েছে, তাই সরবরাহকৃত উপাদান থেকে সুনির্দিষ্ট রেফারেন্স পয়েন্ট সনাক্ত করা যায় না। লেখকরা একটি বৃহত্তর-স্কেল এক্সটেনশনেরও রিপোর্ট করেছেন: টর্চপ্ল্যানকে GPU মেমরির চেয়ে বড় ডেটার জন্য Dask-cuDF এর সাথে একত্রিত করা হয়েছিল, এবং TPC-H SF100-এ চারটি H100 GPU ব্যবহার করে, সিস্টেমটি একটি রিপোর্ট করা 2.54× গতি অর্জন করেছে।
একসাথে নেওয়া, সেটআপটি কোয়েরি উপস্থাপনা থেকে জেনারেট করা প্রোগ্রাম এক্সিকিউশন এবং রিপোর্ট করা কর্মক্ষমতা পর্যন্ত একটি ক্রম সংজ্ঞায়িত করে। এসকিউএল ইনপুট একটি বৈধ টর্চপ্ল্যান প্রোগ্রাম হিসাবে উপস্থাপিত হয়, যখন অপ্টিমাইজেশান টার্গেট হয় একটি কেন্দ্রীয় টেনসর-বাউন্ডেড বিভাগ বা সম্পূর্ণ ক্যোয়ারী হতে পারে। মডেল-উত্পন্ন ফলাফল শুধুমাত্র লেখা হয়েছে বলে সম্পূর্ণরূপে গণ্য করা হয় না; মূল্যায়ন এক্সিকিউশন-নির্দেশিত মেরামত ব্যবহার করে এক্সিকিউশন থেকে প্রতিক্রিয়ার মাধ্যমে প্রোগ্রামগুলি পরীক্ষা এবং সংশোধন করতে। হার্ডওয়্যার এবং ওয়ার্কলোড সেটিংসও রিপোর্ট করা পরীক্ষার অংশ: বিমূর্ত দশটি মালিকানাধীন এবং ওপেন-ওয়েট মডেল, TPC-H SF10 ওয়ার্কলোড এবং একটি H100 GPU বর্ণনা করে। এটি আলাদাভাবে চারটি H100 GPU সহ TPC-H SF100-এ বড়-স্কেল টর্চপ্ল্যান এবং Dask-cuDF কনফিগারেশন বর্ণনা করে। সেই কাঠামোর মধ্যে, রিপোর্ট করা স্পিডআপগুলি বিবৃত কনফিগারেশন এবং পাস অবস্থার ফলাফল, যখন বিকৃত বেসলাইন লিঙ্ক সরবরাহকৃত উত্সে তুলনামূলক রেফারেন্সটি নামহীন রেখে দেয়। বেঞ্চমার্ক এবং তার রিপোর্ট করা মূল্যায়ন সম্পর্কে বিমূর্তটি যা প্রদান করে তার সুযোগ এটি। বর্ণনা ফলস্বরূপ অপ্টিমাইজ করা বস্তু, প্রোগ্রামিং পছন্দ, মেরামত পদ্ধতি, মূল্যায়নকৃত কাজের চাপ, হার্ডওয়্যার সেটিংস এবং দুটি রিপোর্ট করা কর্মক্ষমতার ফলাফল চিহ্নিত করে, কিন্তু এটি বিমূর্তটিতে সরবরাহ করাগুলির বাইরে বিশদ যোগ করে না।
কেন এটা গুরুত্বপূর্ণ
কাজটি বিদ্যমান এলএলএম কোডিং বেঞ্চমার্কের একটি ফাঁককে সম্বোধন করে, যা লেখকরা বলেছেন যেটি মূলত ডাটাবেস কাজের চাপের পরিবর্তে মেশিন-লার্নিং অপারেটরগুলিতে ফোকাস করেছে। যদি রিপোর্ট করা ফলাফলগুলি বৃহত্তর কাজের লোড জুড়ে থাকে, ভাষা মডেলগুলি GPU-এক্সিলারেটেড ডাটাবেসগুলিকে দ্রুততর করার জন্য প্রয়োজনীয় বিশেষ কার্নেল ইঞ্জিনিয়ারিংয়ের জন্য দরকারী সহায়ক হয়ে উঠতে পারে।
ব্যবহারিক তাৎপর্য হল যে ডাটাবেসের কর্মক্ষমতা প্রায়শই কাজের চাপ-নির্দিষ্ট বাস্তবায়ন পছন্দের উপর নির্ভর করে, শুধুমাত্র একটি দ্রুততর সাধারণ-উদ্দেশ্য সিস্টেম নির্বাচন করার উপর নয়। কাগজটির কেন্দ্রীয় দাবি হল যে এলএলএমগুলি সম্পূর্ণ প্রশ্নের জন্য GPU প্রোগ্রাম তৈরি এবং মেরামত করে এই বিশেষ অপ্টিমাইজেশন প্রক্রিয়াতে অংশগ্রহণ করতে পারে। এটি মডেলটিকে একটি বেঞ্চমার্কের তুলনায় একটি প্রকৃত ডাটাবেস ওয়ার্কলোডের কাঠামোর কাছাকাছি রাখে যা বিচ্ছিন্ন মেশিন-লার্নিং কার্নেলগুলিকে মূল্যায়ন করে।
রিপোর্ট করা ফলাফলগুলি মডেল ক্ষমতা এবং কাজের চাপের তথ্যের মধ্যে শ্রমের বিভাজনের দিকেও নির্দেশ করে। লেখক বলেছেন উচ্চ-সম্পাদনা বাস্তবায়ন সাধারণত কার্নেল ফিউশন ব্যবহার করে এবং কার্যকরী কৌশল পরিবর্তন করে। তারা আরও রিপোর্ট করে যে হার্ডওয়্যার প্রসঙ্গের চেয়ে কাজের চাপের প্রসঙ্গ বেশি গুরুত্বপূর্ণ, এবং শক্তিশালী মডেলগুলি সম্পূর্ণ-কোয়েরি বিশেষীকরণ থেকে সবচেয়ে বেশি উপকৃত হয়। ব্যবহারিক পরিভাষায়, ফলাফলটি পরামর্শ দেয় যে কোয়েরির বিশদ বিবরণ সহ মডেল সরবরাহ করা এবং এর ডেটা কেবলমাত্র GPU বর্ণনা করার চেয়ে বেশি গুরুত্বপূর্ণ হতে পারে যার উপর কোডটি চলবে৷
ফলাফলগুলি গবেষণার দিকনির্দেশ হিসাবে ফলপ্রসূ, তবে তারা প্রমাণ নয় যে ডাটাবেস ইঞ্জিনিয়ারিং উৎপাদনে স্বয়ংক্রিয় হয়েছে। উত্সটি একটি বেঞ্চমার্ক এবং নিয়ন্ত্রিত পরীক্ষাগুলি বর্ণনা করে, একটি লাইভ ডাটাবেস পরিষেবাতে স্থাপনার নয়। এটি এটিও প্রতিষ্ঠিত করে না যে জেনারেট করা কোডটি পরীক্ষিত প্রশ্নের বাইরে ধারাবাহিকভাবে সঠিক, মানব-লিখিত কার্নেলের তুলনায় এটি তৈরি করা সস্তা, বা গতিশীলতা ডেটা বিতরণ এবং অপারেশনাল প্রয়োজনীয়তা পরিবর্তন করে বেঁচে থাকবে। এই সীমাগুলি গুরুত্বপূর্ণ কারণ একটি দ্রুত প্রশ্ন যা একটি প্রান্ত ক্ষেত্রে ব্যর্থ হয় একটি ব্যবহারযোগ্য ডাটাবেস অপ্টিমাইজেশান নয়।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
মূল প্রশ্নগুলি হল পরীক্ষা করা TPC-H কাজের চাপের বাইরে ফলাফলগুলি সাধারণীকরণ করে কিনা, বেঞ্চমার্ক কীভাবে একটি পূর্ণ পাসকে সংজ্ঞায়িত করে এবং উন্নয়ন, বৈধতা এবং হার্ডওয়্যার খরচের জন্য অ্যাকাউন্টিংয়ের পরে রিপোর্ট করা গতি বজায় থাকে কিনা। সরবরাহকৃত উৎস একটি বিমূর্ত, তাই সেই বিবরণ এবং স্বাধীন প্রতিলিপি অমীমাংসিত থেকে যায়।
দেখার জন্য প্রথম সমস্যা হল প্রজননযোগ্যতা। বিমূর্তটি মডেলের সংখ্যা এবং বিস্তৃত প্রকার, হার্ডওয়্যার এবং TPC-H স্কেল ফ্যাক্টর সনাক্ত করে, কিন্তু এটি মডেলগুলির নাম দেয় না, তাদের প্রম্পটগুলি বর্ণনা করে, পাস-রেট গণনা নির্দিষ্ট করে, বা সম্পূর্ণ তুলনা বেসলাইন প্রদান করে। এই বিবরণগুলি নির্ধারণ করবে যে সিস্টেমগুলি কতটা ন্যায্যভাবে মূল্যায়ন করা হয়েছিল এবং কত সহজে অন্যরা পরীক্ষাগুলি পুনরাবৃত্তি করতে পারে।
সাধারণীকরণ আরেকটি খোলা প্রশ্ন। রিপোর্ট করা পরীক্ষাগুলি একটি H100 GPU-তে TPC-H SF10 এবং চারটি H100 GPU-তে TPC-H SF100 ব্যবহার করে। DataKernelBench অন্যান্য ক্যোয়ারী ফ্যামিলি, ডাটাবেস ইঞ্জিন, ডাটা ডিস্ট্রিবিউশন, GPU জেনারেশন বা মিক্সড CPU-GPU ডিপ্লোয়মেন্টকে কভার করে কিনা তা জানায় না। কম কাঠামোগত উপায়ে যখন ডেটা মেমরিকে ছাড়িয়ে যায়, বা যখন পরিবর্তনশীল উত্পাদন লোডের অধীনে সঠিকতা এবং বিলম্ব বজায় রাখা আবশ্যক তখন পদ্ধতিটি কীভাবে আচরণ করে তাও এটি স্থাপন করে না।
পরিশেষে, ভবিষ্যৎ মূল্যায়ন একটি LLM-ভিত্তিক অপ্টিমাইজার ব্যবহার করার সম্পূর্ণ খরচ থেকে কাঁচা সম্পাদনের গতিকে আলাদা করা উচিত। প্রাসঙ্গিক ব্যবস্থাগুলির মধ্যে প্রজন্মের সময়, মেরামতের প্রচেষ্টার সংখ্যা, বৈধকরণ ওভারহেড, GPU ব্যবহার, মেমরি ব্যবহার এবং ব্যর্থ বা প্রত্যাখ্যান করা প্রোগ্রামগুলির খরচ অন্তর্ভুক্ত থাকবে। উত্সটি বলে যে মৃত্যুদন্ড-নির্দেশিত মেরামত পদ্ধতির অংশ, তবে বিমূর্তটি সেই প্রক্রিয়াটির জন্য কোনও পরিসংখ্যান দেয় না। যতক্ষণ না এই অজানাগুলি রিপোর্ট করা হয় এবং স্বাধীনভাবে পরীক্ষা করা হয়, 2.11× এবং 2.54× পরিসংখ্যানগুলিকে এই কাগজের দ্বারা দাবি করা ফলাফল হিসাবে বিবেচনা করা উচিত তার উল্লিখিত পরীক্ষামূলক অবস্থার অধীনে, সাধারণ কর্মক্ষমতা গ্যারান্টি হিসাবে নয়।