সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

DataKernelBench পরীক্ষা করে যে LLMs GPU ডাটাবেস প্রশ্নগুলি অপ্টিমাইজ করতে পারে কিনা

একটি নতুন বেঞ্চমার্ক মূল্যায়ন করে যে ভাষা মডেলগুলি ডেটাবেস-স্টাইলের প্রশ্নের জন্য GPU কোড তৈরি করতে এবং উন্নত করতে পারে কিনা, একটি H100 GPU-তে 2.11× পর্যন্ত পেপার রিপোর্টিং স্পিডআপ এবং চারটি H100 GPU জুড়ে 2.54×।

5 min readRead the primary source
Primary-source image accompanying DataKernelBench tests whether LLMs can optimize GPU database queries
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.25061
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বড় ভাষা মডেল (LLM)
টেক্সট তৈরি এবং বিশ্লেষণ করার জন্য বিশাল টেক্সট কর্পোরার উপর প্রশিক্ষিত একটি ভাষা মডেল।
মেমরি (এজেন্ট মেমরি)
সঞ্চিত প্রসঙ্গ একটি এআই এজেন্ট ধারাবাহিকতা উন্নত করতে বিভিন্ন ধাপ বা সেশন জুড়ে ব্যবহার করে।
সাধারণীকরণ
প্রশিক্ষণ সেটের বাইরে একটি মডেল নতুন, অদেখা ডেটাতে কতটা ভালো পারফর্ম করে।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

গবেষকরা DataKernelBench প্রবর্তন করেছেন, বড় ভাষার মডেলগুলি GPU-তে অনিয়মিত, ডেটা-আন্দোলন-ভারী ডাটাবেস ক্রিয়াকলাপগুলিকে অপ্টিমাইজ করতে পারে কিনা তা পরীক্ষা করার জন্য একটি বেঞ্চমার্ক। সিস্টেমটি এসকিউএল কোয়েরিগুলিকে বৈধ PyTorch TorchPlan প্রোগ্রামগুলিতে অনুবাদ করে, তারপরে মডেলগুলিকে মূল্যায়ন করে কারণ তারা হয় একটি কেন্দ্রীয় টেনসর-বাউন্ডেড কোড বিভাগ বা CUDA বা Triton-এ সম্পূর্ণ ক্যোয়ারী অপ্টিমাইজ করে।

কাগজটি, 25 আগস্ট, 2026-এ arXiv-এ জমা দেওয়া হয়েছিল এবং EMNLP 2026-এ গৃহীত উত্স হিসাবে চিহ্নিত করা হয়েছে, বিশেষ করে GPU-তে ডেটাবেস কোয়েরির AI-উত্পাদিত অপ্টিমাইজেশনের জন্য একটি মূল্যায়ন হিসাবে DataKernelBench উপস্থাপন করে৷ লেখকরা যুক্তি দেন যে বিদ্যমান এলএলএম কার্নেল বেঞ্চমার্কগুলি পর্যাপ্তভাবে ডাটাবেস-স্টাইল অপারেটরদের পরীক্ষা করে না, যা অনিয়মিত, ভিন্নধর্মী এবং ডেটা চলাচলের দ্বারা প্রভাবিত হতে পারে। এটি বেঞ্চমার্কের লক্ষ্যকে আরও নিয়মিত অপারেটর থেকে আলাদা করে তোলে যা প্রায়শই জেনারেট করা GPU কোড মূল্যায়ন করতে ব্যবহৃত হয়।

DataKernelBench এসকিউএলকে বৈধ PyTorch TorchPlan প্রোগ্রামে রূপান্তর করে। তারপর মডেলগুলিকে CUDA বা Triton ব্যবহার করে একটি কোর টেনসর-বাউন্ডেড স্নিপেট বা সম্পূর্ণ ক্যোয়ারী অপ্টিমাইজ করতে বলা হয়। মূল্যায়নে এক্সিকিউশন-নির্দেশিত মেরামত অন্তর্ভুক্ত রয়েছে, যার অর্থ উৎপন্ন প্রোগ্রামগুলি তাদের সম্পাদন থেকে প্রতিক্রিয়ার মাধ্যমে পরীক্ষা এবং সংশোধন করা হয়। বিমূর্তটি বলে যে গবেষণাটি একটি H100 GPU ব্যবহার করে TPC-H SF10 কাজের চাপে দশটি মালিকানাধীন এবং ওপেন-ওয়েট মডেল কভার করে।

কাগজের রিপোর্ট করা ফলাফল অনুসারে, সবচেয়ে শক্তিশালী পূর্ণ-ক্যোয়ারী CUDA কনফিগারেশন সম্পূর্ণ পাস হারে তুলনা বেসলাইনের তুলনায় 2.11× গতি অর্জন করেছে। উৎসটি বেসলাইনের নাম প্রকাশ করে না কারণ বিমূর্তটিতে সেই অবস্থানে একটি বিকৃত লিঙ্ক রয়েছে, তাই সরবরাহকৃত উপাদান থেকে সুনির্দিষ্ট রেফারেন্স পয়েন্ট সনাক্ত করা যায় না। লেখকরা একটি বৃহত্তর-স্কেল এক্সটেনশনেরও রিপোর্ট করেছেন: টর্চপ্ল্যানকে GPU মেমরির চেয়ে বড় ডেটার জন্য Dask-cuDF এর সাথে একত্রিত করা হয়েছিল, এবং TPC-H SF100-এ চারটি H100 GPU ব্যবহার করে, সিস্টেমটি একটি রিপোর্ট করা 2.54× গতি অর্জন করেছে।

একসাথে নেওয়া, সেটআপটি কোয়েরি উপস্থাপনা থেকে জেনারেট করা প্রোগ্রাম এক্সিকিউশন এবং রিপোর্ট করা কর্মক্ষমতা পর্যন্ত একটি ক্রম সংজ্ঞায়িত করে। এসকিউএল ইনপুট একটি বৈধ টর্চপ্ল্যান প্রোগ্রাম হিসাবে উপস্থাপিত হয়, যখন অপ্টিমাইজেশান টার্গেট হয় একটি কেন্দ্রীয় টেনসর-বাউন্ডেড বিভাগ বা সম্পূর্ণ ক্যোয়ারী হতে পারে। মডেল-উত্পন্ন ফলাফল শুধুমাত্র লেখা হয়েছে বলে সম্পূর্ণরূপে গণ্য করা হয় না; মূল্যায়ন এক্সিকিউশন-নির্দেশিত মেরামত ব্যবহার করে এক্সিকিউশন থেকে প্রতিক্রিয়ার মাধ্যমে প্রোগ্রামগুলি পরীক্ষা এবং সংশোধন করতে। হার্ডওয়্যার এবং ওয়ার্কলোড সেটিংসও রিপোর্ট করা পরীক্ষার অংশ: বিমূর্ত দশটি মালিকানাধীন এবং ওপেন-ওয়েট মডেল, TPC-H SF10 ওয়ার্কলোড এবং একটি H100 GPU বর্ণনা করে। এটি আলাদাভাবে চারটি H100 GPU সহ TPC-H SF100-এ বড়-স্কেল টর্চপ্ল্যান এবং Dask-cuDF কনফিগারেশন বর্ণনা করে। সেই কাঠামোর মধ্যে, রিপোর্ট করা স্পিডআপগুলি বিবৃত কনফিগারেশন এবং পাস অবস্থার ফলাফল, যখন বিকৃত বেসলাইন লিঙ্ক সরবরাহকৃত উত্সে তুলনামূলক রেফারেন্সটি নামহীন রেখে দেয়। বেঞ্চমার্ক এবং তার রিপোর্ট করা মূল্যায়ন সম্পর্কে বিমূর্তটি যা প্রদান করে তার সুযোগ এটি। বর্ণনা ফলস্বরূপ অপ্টিমাইজ করা বস্তু, প্রোগ্রামিং পছন্দ, মেরামত পদ্ধতি, মূল্যায়নকৃত কাজের চাপ, হার্ডওয়্যার সেটিংস এবং দুটি রিপোর্ট করা কর্মক্ষমতার ফলাফল চিহ্নিত করে, কিন্তু এটি বিমূর্তটিতে সরবরাহ করাগুলির বাইরে বিশদ যোগ করে না।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

কাজটি বিদ্যমান এলএলএম কোডিং বেঞ্চমার্কের একটি ফাঁককে সম্বোধন করে, যা লেখকরা বলেছেন যেটি মূলত ডাটাবেস কাজের চাপের পরিবর্তে মেশিন-লার্নিং অপারেটরগুলিতে ফোকাস করেছে। যদি রিপোর্ট করা ফলাফলগুলি বৃহত্তর কাজের লোড জুড়ে থাকে, ভাষা মডেলগুলি GPU-এক্সিলারেটেড ডাটাবেসগুলিকে দ্রুততর করার জন্য প্রয়োজনীয় বিশেষ কার্নেল ইঞ্জিনিয়ারিংয়ের জন্য দরকারী সহায়ক হয়ে উঠতে পারে।

ব্যবহারিক তাৎপর্য হল যে ডাটাবেসের কর্মক্ষমতা প্রায়শই কাজের চাপ-নির্দিষ্ট বাস্তবায়ন পছন্দের উপর নির্ভর করে, শুধুমাত্র একটি দ্রুততর সাধারণ-উদ্দেশ্য সিস্টেম নির্বাচন করার উপর নয়। কাগজটির কেন্দ্রীয় দাবি হল যে এলএলএমগুলি সম্পূর্ণ প্রশ্নের জন্য GPU প্রোগ্রাম তৈরি এবং মেরামত করে এই বিশেষ অপ্টিমাইজেশন প্রক্রিয়াতে অংশগ্রহণ করতে পারে। এটি মডেলটিকে একটি বেঞ্চমার্কের তুলনায় একটি প্রকৃত ডাটাবেস ওয়ার্কলোডের কাঠামোর কাছাকাছি রাখে যা বিচ্ছিন্ন মেশিন-লার্নিং কার্নেলগুলিকে মূল্যায়ন করে।

রিপোর্ট করা ফলাফলগুলি মডেল ক্ষমতা এবং কাজের চাপের তথ্যের মধ্যে শ্রমের বিভাজনের দিকেও নির্দেশ করে। লেখক বলেছেন উচ্চ-সম্পাদনা বাস্তবায়ন সাধারণত কার্নেল ফিউশন ব্যবহার করে এবং কার্যকরী কৌশল পরিবর্তন করে। তারা আরও রিপোর্ট করে যে হার্ডওয়্যার প্রসঙ্গের চেয়ে কাজের চাপের প্রসঙ্গ বেশি গুরুত্বপূর্ণ, এবং শক্তিশালী মডেলগুলি সম্পূর্ণ-কোয়েরি বিশেষীকরণ থেকে সবচেয়ে বেশি উপকৃত হয়। ব্যবহারিক পরিভাষায়, ফলাফলটি পরামর্শ দেয় যে কোয়েরির বিশদ বিবরণ সহ মডেল সরবরাহ করা এবং এর ডেটা কেবলমাত্র GPU বর্ণনা করার চেয়ে বেশি গুরুত্বপূর্ণ হতে পারে যার উপর কোডটি চলবে৷

ফলাফলগুলি গবেষণার দিকনির্দেশ হিসাবে ফলপ্রসূ, তবে তারা প্রমাণ নয় যে ডাটাবেস ইঞ্জিনিয়ারিং উৎপাদনে স্বয়ংক্রিয় হয়েছে। উত্সটি একটি বেঞ্চমার্ক এবং নিয়ন্ত্রিত পরীক্ষাগুলি বর্ণনা করে, একটি লাইভ ডাটাবেস পরিষেবাতে স্থাপনার নয়। এটি এটিও প্রতিষ্ঠিত করে না যে জেনারেট করা কোডটি পরীক্ষিত প্রশ্নের বাইরে ধারাবাহিকভাবে সঠিক, মানব-লিখিত কার্নেলের তুলনায় এটি তৈরি করা সস্তা, বা গতিশীলতা ডেটা বিতরণ এবং অপারেশনাল প্রয়োজনীয়তা পরিবর্তন করে বেঁচে থাকবে। এই সীমাগুলি গুরুত্বপূর্ণ কারণ একটি দ্রুত প্রশ্ন যা একটি প্রান্ত ক্ষেত্রে ব্যর্থ হয় একটি ব্যবহারযোগ্য ডাটাবেস অপ্টিমাইজেশান নয়।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

মূল প্রশ্নগুলি হল পরীক্ষা করা TPC-H কাজের চাপের বাইরে ফলাফলগুলি সাধারণীকরণ করে কিনা, বেঞ্চমার্ক কীভাবে একটি পূর্ণ পাসকে সংজ্ঞায়িত করে এবং উন্নয়ন, বৈধতা এবং হার্ডওয়্যার খরচের জন্য অ্যাকাউন্টিংয়ের পরে রিপোর্ট করা গতি বজায় থাকে কিনা। সরবরাহকৃত উৎস একটি বিমূর্ত, তাই সেই বিবরণ এবং স্বাধীন প্রতিলিপি অমীমাংসিত থেকে যায়।

দেখার জন্য প্রথম সমস্যা হল প্রজননযোগ্যতা। বিমূর্তটি মডেলের সংখ্যা এবং বিস্তৃত প্রকার, হার্ডওয়্যার এবং TPC-H স্কেল ফ্যাক্টর সনাক্ত করে, কিন্তু এটি মডেলগুলির নাম দেয় না, তাদের প্রম্পটগুলি বর্ণনা করে, পাস-রেট গণনা নির্দিষ্ট করে, বা সম্পূর্ণ তুলনা বেসলাইন প্রদান করে। এই বিবরণগুলি নির্ধারণ করবে যে সিস্টেমগুলি কতটা ন্যায্যভাবে মূল্যায়ন করা হয়েছিল এবং কত সহজে অন্যরা পরীক্ষাগুলি পুনরাবৃত্তি করতে পারে।

সাধারণীকরণ আরেকটি খোলা প্রশ্ন। রিপোর্ট করা পরীক্ষাগুলি একটি H100 GPU-তে TPC-H SF10 এবং চারটি H100 GPU-তে TPC-H SF100 ব্যবহার করে। DataKernelBench অন্যান্য ক্যোয়ারী ফ্যামিলি, ডাটাবেস ইঞ্জিন, ডাটা ডিস্ট্রিবিউশন, GPU জেনারেশন বা মিক্সড CPU-GPU ডিপ্লোয়মেন্টকে কভার করে কিনা তা জানায় না। কম কাঠামোগত উপায়ে যখন ডেটা মেমরিকে ছাড়িয়ে যায়, বা যখন পরিবর্তনশীল উত্পাদন লোডের অধীনে সঠিকতা এবং বিলম্ব বজায় রাখা আবশ্যক তখন পদ্ধতিটি কীভাবে আচরণ করে তাও এটি স্থাপন করে না।

পরিশেষে, ভবিষ্যৎ মূল্যায়ন একটি LLM-ভিত্তিক অপ্টিমাইজার ব্যবহার করার সম্পূর্ণ খরচ থেকে কাঁচা সম্পাদনের গতিকে আলাদা করা উচিত। প্রাসঙ্গিক ব্যবস্থাগুলির মধ্যে প্রজন্মের সময়, মেরামতের প্রচেষ্টার সংখ্যা, বৈধকরণ ওভারহেড, GPU ব্যবহার, মেমরি ব্যবহার এবং ব্যর্থ বা প্রত্যাখ্যান করা প্রোগ্রামগুলির খরচ অন্তর্ভুক্ত থাকবে। উত্সটি বলে যে মৃত্যুদন্ড-নির্দেশিত মেরামত পদ্ধতির অংশ, তবে বিমূর্তটি সেই প্রক্রিয়াটির জন্য কোনও পরিসংখ্যান দেয় না। যতক্ষণ না এই অজানাগুলি রিপোর্ট করা হয় এবং স্বাধীনভাবে পরীক্ষা করা হয়, 2.11× এবং 2.54× পরিসংখ্যানগুলিকে এই কাগজের দ্বারা দাবি করা ফলাফল হিসাবে বিবেচনা করা উচিত তার উল্লিখিত পরীক্ষামূলক অবস্থার অধীনে, সাধারণ কর্মক্ষমতা গ্যারান্টি হিসাবে নয়।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই প্রশিক্ষণট্রান্সফরমারআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?