সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

IDEA ছাঁটাই ছোট ভাষার মডেলের জন্য মডেল বৃদ্ধি এবং ছাঁটাইকে একীভূত করে

Apple মেশিন লার্নিং রিসার্চ একটি সমন্বিত পাইপলাইন বর্ণনা করে যা কাঠামোগতভাবে ছাঁটাই এবং পুনরুদ্ধার করার আগে একটি বর্ধিত ভাষা মডেলকে প্রশিক্ষিত করে, 2.8B-প্যারামিটার মডেলগুলিকে 1.3B প্যারামিটারে সংকুচিত করার সময় শক্তিশালী ফলাফলের প্রতিবেদন করে।

6 min readRead the primary source
Primary-source image accompanying IDEA Prune integrates model enlargement and pruning for smaller language models
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
machinelearning.apple.com
উৎস লিঙ্ক
machinelearning.apple.comhttps://machinelearning.apple.com/research/idea-prune-pipeline
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

ছাঁটাই
আকার এবং গণনা কমাতে কম গুরুত্বপূর্ণ মডেল ওজন বা নিউরন অপসারণ।
মেশিন লার্নিং (ML)
পদ্ধতি যা সিস্টেমগুলিকে ডেটা থেকে প্যাটার্ন শিখতে এবং সময়ের সাথে সাথে উন্নতি করতে দেয়।
মেমরি (এজেন্ট মেমরি)
সঞ্চিত প্রসঙ্গ একটি এআই এজেন্ট ধারাবাহিকতা উন্নত করতে বিভিন্ন ধাপ বা সেশন জুড়ে ব্যবহার করে।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

Apple মেশিন লার্নিং রিসার্চ IDEA Prune প্রকাশ করেছে, একটি পদ্ধতি যা একটি প্রশিক্ষণ পাইপলাইনের মধ্যে বর্ধিত-মডেল প্রাক-প্রশিক্ষণ, কাঠামোগত ছাঁটাই এবং পুনরুদ্ধারকে একত্রিত করে। লেখকরা 2.8-বিলিয়ন-প্যারামিটার জেনারেটিভ ল্যাঙ্গুয়েজ মডেলগুলিকে 1.3 বিলিয়ন প্যারামিটারে সংকুচিত করে 2 ট্রিলিয়ন প্রিট্রেনিং টোকেন ব্যবহার করে রিপোর্ট করেছেন এবং বলেছেন যে ফল ছাঁটাই করা মডেলগুলি কাগজে অধ্যয়ন করা বিকল্পগুলিকে ছাড়িয়ে গেছে৷

আইডিইএ প্রুনকে জেনারেটিভ ল্যাঙ্গুয়েজ মডেল প্রাক-প্রশিক্ষণের জন্য একটি ইন্টিগ্রেটেড এনলার্জ-এন্ড-প্রুন পাইপলাইন হিসাবে উপস্থাপন করা হয়েছে। লেখকরা এই পর্যবেক্ষণ থেকে শুরু করেন যে স্ক্র্যাচ থেকে চূড়ান্ত লক্ষ্য আকারে একটি মডেলকে প্রশিক্ষণ দেওয়ার চেয়ে কাঠামোগত ছাঁটাই আরও বেশি টোকেন-দক্ষ হতে পারে, তবে যুক্তি দেন যে পূর্বের কাজ প্রায়শই কম্প্রেশনের আগে একটি বর্ধিত মডেলকে প্রশিক্ষণ দেওয়ার ভূমিকাকে উপেক্ষা করে। তাদের প্রথম গবেষণা প্রশ্ন তাই এমন একটি মডেলের উপর প্রশিক্ষণ সংস্থান ব্যয় করা যা কখনই স্থাপন করা হবে না তা এখনও শেষ পর্যন্ত উত্পাদিত ছোট মডেলটিকে উন্নত করতে পারে কিনা। তাদের দ্বিতীয়টি হল কীভাবে বিচ্ছিন্ন পর্যায়গুলির পরিবর্তে একটি সিস্টেম হিসাবে বৃদ্ধি, ছাঁটাই এবং পুনরুদ্ধারকে অপ্টিমাইজ করা যায়।

প্রস্তাবিত পাইপলাইনটি তিনটি পর্যায়কে একত্রিত করে: একটি বর্ধিত মডেলকে প্রশিক্ষণ দেওয়া, কাঠামোগত ছাঁটাইয়ের মাধ্যমে পরামিতিগুলি অপসারণ করা এবং ছাঁটাই করা মডেল পুনরুদ্ধার করা। Apple-এর গবেষণা পৃষ্ঠা বলে যে এই ধাপগুলি একটি একক কোসাইন-অ্যানিলিং লার্নিং-রেট সময়সূচী ব্যবহার করে। কাগজটি একটি পুনরাবৃত্তিমূলক কাঠামোগত-ছাঁটাই পদ্ধতিও প্রবর্তন করে যা পরামিতিগুলিকে ধীরে ধীরে সরিয়ে দেয়। উত্স অনুসারে, এই নকশাটি আরও সহজ-সরল বৃদ্ধি এবং ছাঁটাই পদ্ধতিতে ক্রমবর্ধমান শিক্ষার হারের সাথে সম্পর্কিত জ্ঞানের ক্ষতি হ্রাস করার উদ্দেশ্যে তৈরি করা হয়েছে, যেখানে অবশিষ্ট নিউরনগুলিকে কম্প্রেশন প্রক্রিয়ার সাথে সাথে মডেল ক্ষমতা পুনরায় বিতরণ করার অনুমতি দেয়।

রিপোর্ট করা পরীক্ষাগুলি 2.8-বিলিয়ন-প্যারামিটার মডেলগুলিকে প্রাক-প্রশিক্ষণের সময় 1.3 বিলিয়ন প্যারামিটারে সংকুচিত করার উপর ফোকাস করে, 2 ট্রিলিয়ন পর্যন্ত টোকেন ব্যবহার করে। লেখকরা পরীক্ষাগুলিকে ব্যাপক হিসাবে বর্ণনা করেছেন এবং বলেছেন যে সমন্বিত পদ্ধতিটি ছাঁটাই করা মডেলগুলির জন্য উচ্চতর কর্মক্ষমতা প্রদান করে, সেইসাথে বর্ধিত-মডেল প্রাক-প্রশিক্ষণের টোকেন দক্ষতা সম্পর্কে প্রমাণ। এগুলি কাগজের লেখকদের দ্বারা করা দাবি এবং Apple এর গবেষণা পৃষ্ঠায় সংক্ষিপ্ত করা হয়েছে; উৎসটি সাংখ্যিক কর্মক্ষমতা ফলাফল প্রদান করে না, নাম দেওয়া বেঞ্চমার্ক টাস্ক, বেসলাইন স্কোর, ডেটাসেট কম্পোজিশন বা পরিসংখ্যানগত অনিশ্চয়তা।

উৎসটি লেখক হিসেবে Yixiao Li, Xianzhi Du, Ajay Jaiswal, Tao Lei, Tuo Zhao, Chong Wang এবং Jianyu Wang-কে চিহ্নিত করেছে। এটি কিছু অবদানকারীদের জন্য জর্জিয়া ইনস্টিটিউট অফ টেকনোলজি এবং ইউনিভার্সিটি অফ টেক্সাস অ্যাট অস্টিন অ্যাফিলিয়েশনের তালিকা করে এবং নোট করে যে লেখকরা Apple এ থাকাকালীন কিছু কাজ করা হয়েছিল। পৃষ্ঠাটি বলে না যে Apple একটি বাণিজ্যিক ভাষার মডেলে IDEA Prune স্থাপন করেছে, সফ্টওয়্যার প্রকাশ করেছে বা মডেল ওজন উপলব্ধ করেছে৷ এটি একটি গবেষণা প্রকাশনা বর্ণনা করে, একটি পণ্য ঘোষণা নয়।

উত্স বিবরণ: machinelearning.apple.com ↗

কেন এটা গুরুত্বপূর্ণ

কাজটি জেনারেটিভ AI-তে একটি ব্যবহারিক সমস্যা সমাধান করে: খুব বেশি ক্ষমতা পরিত্যাগ না করে মডেলের আকার এবং অনুমানের চাহিদা হ্রাস করা। এর কেন্দ্রীয় দাবি হল যে একটি মডেল তার চূড়ান্ত স্থাপন করা আকারের চেয়ে বড় প্রশিক্ষিত হওয়ার দ্বারা উপকৃত হতে পারে, যদি বর্ধিতকরণ এবং ছাঁটাই একসাথে অপ্টিমাইজ করা হয়। এটি প্রভাবিত করতে পারে যে কীভাবে বিকাশকারীরা পরিবেশন দক্ষতার বিরুদ্ধে প্রশিক্ষণ ব্যয়ের বাণিজ্য করে, যদিও উত্সটি লাভের পরিমাণ নির্ধারণ বা উত্পাদন প্রস্তুতি স্থাপনের জন্য যথেষ্ট বিশদ সরবরাহ করে না।

মডেল কম্প্রেশন গুরুত্বপূর্ণ কারণ জেনারেটিভ ল্যাঙ্গুয়েজ মডেলগুলিকে গণনা, মেমরি এবং অনুমান বাজেটের সীমার মধ্যে কাজ করতে হবে। একটি ছোট মডেল সাধারণত নিম্ন পরিবেশন প্রয়োজনীয়তার দিকে একটি পথ অফার করে, তবে ছাঁটাই ক্ষমতাগুলিকে সরিয়ে দিতে পারে বা নেটওয়ার্ক কীভাবে কাজ করে তা ব্যাহত করতে পারে। IDEA Prune-এর অবদান, যেমনটি এর লেখকদের দ্বারা বর্ণিত হয়েছে, চূড়ান্ত ছোট মডেলটিকে একটি সমন্বিত প্রশিক্ষণ প্রক্রিয়ার ফলাফল হিসাবে বিবেচনা করা হয়, কেবলমাত্র একটি সমাপ্ত মডেল বা প্রশিক্ষণকে শুধুমাত্র লক্ষ্য আকারে কেটে ফেলার পরিবর্তে।

কাগজের সবচেয়ে ফলাফলমূলক দাবি হল যে অস্থায়ী ওভার-প্যারামিটারাইজেশন স্থায়ীভাবে ছোট মডেলের গুণমান উন্নত করতে পারে। যদি পুনরুত্পাদন করা হয়, তবে এটি স্ক্র্যাচ থেকে একটি লক্ষ্য-আকারের মডেলকে প্রশিক্ষণ এবং একটি বড়টিকে সংকুচিত করার মধ্যে স্বাভাবিক তুলনাকে জটিল করে তুলবে। বর্ধিত মডেলটি অতিরিক্ত প্রশিক্ষণের কাজ চাপিয়ে দেবে, তবে উত্সটি যুক্তি দেয় যে সংকুচিত মডেল তৈরির জন্য ফলস্বরূপ প্রক্রিয়াটি আরও টোকেন-দক্ষ হতে পারে। উচ্চতর অগ্রিম প্রশিক্ষণ খরচ কম চলমান অনুমান খরচ দ্বারা ন্যায়সঙ্গত কিনা তা সিদ্ধান্ত নেওয়া সংস্থাগুলির জন্য এটি প্রাসঙ্গিক হতে পারে।

পুনরাবৃত্ত ছাঁটাই নকশা কাঠামোগত সংকোচনের ক্ষেত্রে একটি ব্যবহারিক চ্যালেঞ্জের কথাও বলে। ক্রমান্বয়ে পরামিতি অপসারণ একটি মডেলের বেঁচে থাকা অংশগুলিকে একটি আকস্মিক ছাঁটাই ধাপের চেয়ে মানিয়ে নেওয়ার আরও সুযোগ দিতে পারে। উত্সটি বিশেষভাবে জ্ঞান সংরক্ষণ এবং বেঁচে থাকা নিউরনের মধ্যে ক্ষমতার পুনর্বন্টন পদ্ধতিটিকে লিঙ্ক করে। যাইহোক, এটি স্থাপন করে না যে কীভাবে এই প্রভাবগুলি স্থাপত্য, মডেল পরিবার, ভাষা বা অ্যাপ্লিকেশনগুলিতে পরিবর্তিত হয়, তাই জনসাধারণের তাত্পর্য একটি প্রদর্শিত সাধারণ সমাধানের পরিবর্তে একটি গবেষণা অনুসন্ধান হিসাবে রয়ে গেছে।

পদ্ধতিটি শেষ পর্যন্ত এমন সিস্টেমগুলির জন্য গুরুত্বপূর্ণ হতে পারে যেগুলিকে সীমাবদ্ধ অনুমান বাজেটের অধীনে চালানো দরকার, তবে উত্সটি মেমরি সঞ্চয়, বিলম্বতা, বিদ্যুৎ খরচ বা অপারেটিং খরচের পরিমাণ নির্ধারণ করে না। এটিও দেখায় না যে সংকুচিত মডেলগুলি নিরাপত্তা, বাস্তবতা, দৃঢ়তা বা বিশেষ কাজের ক্ষেত্রে বড় মডেলের সাথে মেলে। তুলনামূলক বিন্দু, মূল্যায়নের শর্ত এবং অতিরিক্ত পূর্বপ্রশিক্ষণ এবং পরে স্থাপনার সঞ্চয়ের মধ্যে ট্রেডঅফ না জেনে ব্যবহারিক মূল্য নির্ধারণের জন্য "উচ্চতর কর্মক্ষমতা" যথেষ্ট নয়।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

গুরুত্বপূর্ণ পরবর্তী প্রশ্নগুলি হল রিপোর্ট করা কর্মক্ষমতা উন্নতি কতটা বড়, কোন কাজ এবং ডেটাসেটগুলি সেগুলি তৈরি করে এবং বর্ধিত প্রাক-প্রশিক্ষণের জন্য অ্যাকাউন্টিংয়ের পরে পদ্ধতিটি মোট খরচ হ্রাস করে কিনা। উত্সটি হার্ডওয়্যার প্রয়োজনীয়তা, কোড বা মডেলের প্রাপ্যতা, বা স্থাপনার ফলাফল সনাক্ত করে না। মডেলের আকার, স্থাপত্য এবং ভাষা জুড়ে স্বাধীন প্রজনন এবং তুলনা আইডিইএ প্রুন বিস্তৃতভাবে কার্যকর বা প্রধানত রিপোর্ট করা পরীক্ষায় কার্যকর কিনা তা নির্ধারণ করতে সাহায্য করবে।

ফলো-আপের জন্য প্রথম অগ্রাধিকার হল কাগজের বিশদ মূল্যায়ন। আইডিইএ প্রুন উচ্চতর ছাঁটাই করা মডেল তৈরি করে এমন দাবিকে সমর্থন করার জন্য পাঠকদের সঠিক বেঞ্চমার্ক, ডেটাসেট, ক্ষতির বক্ররেখা এবং বেসলাইনগুলি সন্ধান করা উচিত। স্ক্র্যাচ থেকে সরাসরি প্রশিক্ষিত 1.3-বিলিয়ন-প্যারামিটার মডেল, প্রচলিতভাবে ছাঁটাই করা 2.8-বিলিয়ন-প্যারামিটার মডেল, বা অন্যান্য কম্প্রেশন পদ্ধতির বিরুদ্ধে উন্নতিগুলি পরিমাপ করা হয় কিনা তাও গুরুত্বপূর্ণ। উত্স সারাংশ এই তুলনা নির্দিষ্ট করে না.

দ্বিতীয় বিষয় হলো অর্থনীতি। 2 ট্রিলিয়ন পর্যন্ত টোকেন এবং একটি বর্ধিত মধ্যবর্তী মডেল সহ প্রশিক্ষণের জন্য যথেষ্ট অতিরিক্ত গণনার প্রয়োজন হতে পারে। একটি দরকারী মূল্যায়ন মেমরি, লেটেন্সি এবং শক্তি সহ একটি 1.3-বিলিয়ন-প্যারামিটার মডেল পরিবেশন থেকে সঞ্চয়ের সাথে মোট প্রশিক্ষণ খরচের তুলনা করবে। উত্সটি কোনও হার্ডওয়্যার, রানটাইম বা খরচের পরিসংখ্যান সরবরাহ করে না, তাই সরবরাহ করা তথ্য থেকে সামগ্রিকভাবে পদ্ধতিটি সস্তা বলে উপসংহারে আসা সম্ভব নয়।

গবেষক এবং অনুশীলনকারীদেরও পরীক্ষা করা উচিত যে পদ্ধতিটি রিপোর্ট করা কম্প্রেশন সেটিং এর বাইরে স্থানান্তর করে কিনা। উত্সটি একটি হ্রাসের নাম দেয়, 2.8 বিলিয়ন থেকে 1.3 বিলিয়ন পরামিতি, কিন্তু অন্যান্য অনুপাত, স্থাপত্য, ভাষা বা নিম্নধারার কাজগুলির জন্য ফলাফল বর্ণনা করে না। স্বাধীন অধ্যয়নগুলি দেখাতে পারে যে পদ্ধতিটি নির্দিষ্ট প্রশিক্ষণের সময়সূচী বা ছাঁটাই কাঠামোর উপর নির্ভর করে এবং ক্ষমতা পুনর্বন্টন আরও আক্রমণাত্মক কম্প্রেশন স্তরে কার্যকর থাকে কিনা।

অবশেষে, বাস্তবায়ন এবং স্থাপনার প্রমাণের জন্য দেখুন। Apple পৃষ্ঠাটি উল্লেখ করে না যে কোড, চেকপয়েন্ট বা একটি পুনরুত্পাদনযোগ্য প্রশিক্ষণ রেসিপি প্রকাশ করা হয়েছে, এবং এটি কোনও উত্পাদন ব্যবহারের রিপোর্ট করে না। আরও কাজ মানসম্পন্ন কর্মক্ষমতা ছাড়াও নির্ভরযোগ্যতা, নিরাপত্তা এবং ক্ষমতা রিগ্রেশনের জন্য সংকুচিত মডেলগুলি পরীক্ষা করা উচিত। যতক্ষণ না এই বিশদগুলি পাওয়া যায়, ততক্ষণ পর্যন্ত IDEA Prune একটি সম্ভাব্য উপযোগী প্রশিক্ষণ গবেষণা ফলাফল হিসাবে বোঝা যায় যার ব্যবহারিক সীমানা অমীমাংসিত থেকে যায়।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই প্রশিক্ষণট্রান্সফরমারএআই-এর ভবিষ্যৎআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?