কি হয়েছে
Apple মেশিন লার্নিং রিসার্চ IDEA Prune প্রকাশ করেছে, একটি পদ্ধতি যা একটি প্রশিক্ষণ পাইপলাইনের মধ্যে বর্ধিত-মডেল প্রাক-প্রশিক্ষণ, কাঠামোগত ছাঁটাই এবং পুনরুদ্ধারকে একত্রিত করে। লেখকরা 2.8-বিলিয়ন-প্যারামিটার জেনারেটিভ ল্যাঙ্গুয়েজ মডেলগুলিকে 1.3 বিলিয়ন প্যারামিটারে সংকুচিত করে 2 ট্রিলিয়ন প্রিট্রেনিং টোকেন ব্যবহার করে রিপোর্ট করেছেন এবং বলেছেন যে ফল ছাঁটাই করা মডেলগুলি কাগজে অধ্যয়ন করা বিকল্পগুলিকে ছাড়িয়ে গেছে৷
আইডিইএ প্রুনকে জেনারেটিভ ল্যাঙ্গুয়েজ মডেল প্রাক-প্রশিক্ষণের জন্য একটি ইন্টিগ্রেটেড এনলার্জ-এন্ড-প্রুন পাইপলাইন হিসাবে উপস্থাপন করা হয়েছে। লেখকরা এই পর্যবেক্ষণ থেকে শুরু করেন যে স্ক্র্যাচ থেকে চূড়ান্ত লক্ষ্য আকারে একটি মডেলকে প্রশিক্ষণ দেওয়ার চেয়ে কাঠামোগত ছাঁটাই আরও বেশি টোকেন-দক্ষ হতে পারে, তবে যুক্তি দেন যে পূর্বের কাজ প্রায়শই কম্প্রেশনের আগে একটি বর্ধিত মডেলকে প্রশিক্ষণ দেওয়ার ভূমিকাকে উপেক্ষা করে। তাদের প্রথম গবেষণা প্রশ্ন তাই এমন একটি মডেলের উপর প্রশিক্ষণ সংস্থান ব্যয় করা যা কখনই স্থাপন করা হবে না তা এখনও শেষ পর্যন্ত উত্পাদিত ছোট মডেলটিকে উন্নত করতে পারে কিনা। তাদের দ্বিতীয়টি হল কীভাবে বিচ্ছিন্ন পর্যায়গুলির পরিবর্তে একটি সিস্টেম হিসাবে বৃদ্ধি, ছাঁটাই এবং পুনরুদ্ধারকে অপ্টিমাইজ করা যায়।
প্রস্তাবিত পাইপলাইনটি তিনটি পর্যায়কে একত্রিত করে: একটি বর্ধিত মডেলকে প্রশিক্ষণ দেওয়া, কাঠামোগত ছাঁটাইয়ের মাধ্যমে পরামিতিগুলি অপসারণ করা এবং ছাঁটাই করা মডেল পুনরুদ্ধার করা। Apple-এর গবেষণা পৃষ্ঠা বলে যে এই ধাপগুলি একটি একক কোসাইন-অ্যানিলিং লার্নিং-রেট সময়সূচী ব্যবহার করে। কাগজটি একটি পুনরাবৃত্তিমূলক কাঠামোগত-ছাঁটাই পদ্ধতিও প্রবর্তন করে যা পরামিতিগুলিকে ধীরে ধীরে সরিয়ে দেয়। উত্স অনুসারে, এই নকশাটি আরও সহজ-সরল বৃদ্ধি এবং ছাঁটাই পদ্ধতিতে ক্রমবর্ধমান শিক্ষার হারের সাথে সম্পর্কিত জ্ঞানের ক্ষতি হ্রাস করার উদ্দেশ্যে তৈরি করা হয়েছে, যেখানে অবশিষ্ট নিউরনগুলিকে কম্প্রেশন প্রক্রিয়ার সাথে সাথে মডেল ক্ষমতা পুনরায় বিতরণ করার অনুমতি দেয়।
রিপোর্ট করা পরীক্ষাগুলি 2.8-বিলিয়ন-প্যারামিটার মডেলগুলিকে প্রাক-প্রশিক্ষণের সময় 1.3 বিলিয়ন প্যারামিটারে সংকুচিত করার উপর ফোকাস করে, 2 ট্রিলিয়ন পর্যন্ত টোকেন ব্যবহার করে। লেখকরা পরীক্ষাগুলিকে ব্যাপক হিসাবে বর্ণনা করেছেন এবং বলেছেন যে সমন্বিত পদ্ধতিটি ছাঁটাই করা মডেলগুলির জন্য উচ্চতর কর্মক্ষমতা প্রদান করে, সেইসাথে বর্ধিত-মডেল প্রাক-প্রশিক্ষণের টোকেন দক্ষতা সম্পর্কে প্রমাণ। এগুলি কাগজের লেখকদের দ্বারা করা দাবি এবং Apple এর গবেষণা পৃষ্ঠায় সংক্ষিপ্ত করা হয়েছে; উৎসটি সাংখ্যিক কর্মক্ষমতা ফলাফল প্রদান করে না, নাম দেওয়া বেঞ্চমার্ক টাস্ক, বেসলাইন স্কোর, ডেটাসেট কম্পোজিশন বা পরিসংখ্যানগত অনিশ্চয়তা।
উৎসটি লেখক হিসেবে Yixiao Li, Xianzhi Du, Ajay Jaiswal, Tao Lei, Tuo Zhao, Chong Wang এবং Jianyu Wang-কে চিহ্নিত করেছে। এটি কিছু অবদানকারীদের জন্য জর্জিয়া ইনস্টিটিউট অফ টেকনোলজি এবং ইউনিভার্সিটি অফ টেক্সাস অ্যাট অস্টিন অ্যাফিলিয়েশনের তালিকা করে এবং নোট করে যে লেখকরা Apple এ থাকাকালীন কিছু কাজ করা হয়েছিল। পৃষ্ঠাটি বলে না যে Apple একটি বাণিজ্যিক ভাষার মডেলে IDEA Prune স্থাপন করেছে, সফ্টওয়্যার প্রকাশ করেছে বা মডেল ওজন উপলব্ধ করেছে৷ এটি একটি গবেষণা প্রকাশনা বর্ণনা করে, একটি পণ্য ঘোষণা নয়।
উত্স বিবরণ: machinelearning.apple.com ↗
কেন এটা গুরুত্বপূর্ণ
কাজটি জেনারেটিভ AI-তে একটি ব্যবহারিক সমস্যা সমাধান করে: খুব বেশি ক্ষমতা পরিত্যাগ না করে মডেলের আকার এবং অনুমানের চাহিদা হ্রাস করা। এর কেন্দ্রীয় দাবি হল যে একটি মডেল তার চূড়ান্ত স্থাপন করা আকারের চেয়ে বড় প্রশিক্ষিত হওয়ার দ্বারা উপকৃত হতে পারে, যদি বর্ধিতকরণ এবং ছাঁটাই একসাথে অপ্টিমাইজ করা হয়। এটি প্রভাবিত করতে পারে যে কীভাবে বিকাশকারীরা পরিবেশন দক্ষতার বিরুদ্ধে প্রশিক্ষণ ব্যয়ের বাণিজ্য করে, যদিও উত্সটি লাভের পরিমাণ নির্ধারণ বা উত্পাদন প্রস্তুতি স্থাপনের জন্য যথেষ্ট বিশদ সরবরাহ করে না।
মডেল কম্প্রেশন গুরুত্বপূর্ণ কারণ জেনারেটিভ ল্যাঙ্গুয়েজ মডেলগুলিকে গণনা, মেমরি এবং অনুমান বাজেটের সীমার মধ্যে কাজ করতে হবে। একটি ছোট মডেল সাধারণত নিম্ন পরিবেশন প্রয়োজনীয়তার দিকে একটি পথ অফার করে, তবে ছাঁটাই ক্ষমতাগুলিকে সরিয়ে দিতে পারে বা নেটওয়ার্ক কীভাবে কাজ করে তা ব্যাহত করতে পারে। IDEA Prune-এর অবদান, যেমনটি এর লেখকদের দ্বারা বর্ণিত হয়েছে, চূড়ান্ত ছোট মডেলটিকে একটি সমন্বিত প্রশিক্ষণ প্রক্রিয়ার ফলাফল হিসাবে বিবেচনা করা হয়, কেবলমাত্র একটি সমাপ্ত মডেল বা প্রশিক্ষণকে শুধুমাত্র লক্ষ্য আকারে কেটে ফেলার পরিবর্তে।
কাগজের সবচেয়ে ফলাফলমূলক দাবি হল যে অস্থায়ী ওভার-প্যারামিটারাইজেশন স্থায়ীভাবে ছোট মডেলের গুণমান উন্নত করতে পারে। যদি পুনরুত্পাদন করা হয়, তবে এটি স্ক্র্যাচ থেকে একটি লক্ষ্য-আকারের মডেলকে প্রশিক্ষণ এবং একটি বড়টিকে সংকুচিত করার মধ্যে স্বাভাবিক তুলনাকে জটিল করে তুলবে। বর্ধিত মডেলটি অতিরিক্ত প্রশিক্ষণের কাজ চাপিয়ে দেবে, তবে উত্সটি যুক্তি দেয় যে সংকুচিত মডেল তৈরির জন্য ফলস্বরূপ প্রক্রিয়াটি আরও টোকেন-দক্ষ হতে পারে। উচ্চতর অগ্রিম প্রশিক্ষণ খরচ কম চলমান অনুমান খরচ দ্বারা ন্যায়সঙ্গত কিনা তা সিদ্ধান্ত নেওয়া সংস্থাগুলির জন্য এটি প্রাসঙ্গিক হতে পারে।
পুনরাবৃত্ত ছাঁটাই নকশা কাঠামোগত সংকোচনের ক্ষেত্রে একটি ব্যবহারিক চ্যালেঞ্জের কথাও বলে। ক্রমান্বয়ে পরামিতি অপসারণ একটি মডেলের বেঁচে থাকা অংশগুলিকে একটি আকস্মিক ছাঁটাই ধাপের চেয়ে মানিয়ে নেওয়ার আরও সুযোগ দিতে পারে। উত্সটি বিশেষভাবে জ্ঞান সংরক্ষণ এবং বেঁচে থাকা নিউরনের মধ্যে ক্ষমতার পুনর্বন্টন পদ্ধতিটিকে লিঙ্ক করে। যাইহোক, এটি স্থাপন করে না যে কীভাবে এই প্রভাবগুলি স্থাপত্য, মডেল পরিবার, ভাষা বা অ্যাপ্লিকেশনগুলিতে পরিবর্তিত হয়, তাই জনসাধারণের তাত্পর্য একটি প্রদর্শিত সাধারণ সমাধানের পরিবর্তে একটি গবেষণা অনুসন্ধান হিসাবে রয়ে গেছে।
পদ্ধতিটি শেষ পর্যন্ত এমন সিস্টেমগুলির জন্য গুরুত্বপূর্ণ হতে পারে যেগুলিকে সীমাবদ্ধ অনুমান বাজেটের অধীনে চালানো দরকার, তবে উত্সটি মেমরি সঞ্চয়, বিলম্বতা, বিদ্যুৎ খরচ বা অপারেটিং খরচের পরিমাণ নির্ধারণ করে না। এটিও দেখায় না যে সংকুচিত মডেলগুলি নিরাপত্তা, বাস্তবতা, দৃঢ়তা বা বিশেষ কাজের ক্ষেত্রে বড় মডেলের সাথে মেলে। তুলনামূলক বিন্দু, মূল্যায়নের শর্ত এবং অতিরিক্ত পূর্বপ্রশিক্ষণ এবং পরে স্থাপনার সঞ্চয়ের মধ্যে ট্রেডঅফ না জেনে ব্যবহারিক মূল্য নির্ধারণের জন্য "উচ্চতর কর্মক্ষমতা" যথেষ্ট নয়।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
গুরুত্বপূর্ণ পরবর্তী প্রশ্নগুলি হল রিপোর্ট করা কর্মক্ষমতা উন্নতি কতটা বড়, কোন কাজ এবং ডেটাসেটগুলি সেগুলি তৈরি করে এবং বর্ধিত প্রাক-প্রশিক্ষণের জন্য অ্যাকাউন্টিংয়ের পরে পদ্ধতিটি মোট খরচ হ্রাস করে কিনা। উত্সটি হার্ডওয়্যার প্রয়োজনীয়তা, কোড বা মডেলের প্রাপ্যতা, বা স্থাপনার ফলাফল সনাক্ত করে না। মডেলের আকার, স্থাপত্য এবং ভাষা জুড়ে স্বাধীন প্রজনন এবং তুলনা আইডিইএ প্রুন বিস্তৃতভাবে কার্যকর বা প্রধানত রিপোর্ট করা পরীক্ষায় কার্যকর কিনা তা নির্ধারণ করতে সাহায্য করবে।
ফলো-আপের জন্য প্রথম অগ্রাধিকার হল কাগজের বিশদ মূল্যায়ন। আইডিইএ প্রুন উচ্চতর ছাঁটাই করা মডেল তৈরি করে এমন দাবিকে সমর্থন করার জন্য পাঠকদের সঠিক বেঞ্চমার্ক, ডেটাসেট, ক্ষতির বক্ররেখা এবং বেসলাইনগুলি সন্ধান করা উচিত। স্ক্র্যাচ থেকে সরাসরি প্রশিক্ষিত 1.3-বিলিয়ন-প্যারামিটার মডেল, প্রচলিতভাবে ছাঁটাই করা 2.8-বিলিয়ন-প্যারামিটার মডেল, বা অন্যান্য কম্প্রেশন পদ্ধতির বিরুদ্ধে উন্নতিগুলি পরিমাপ করা হয় কিনা তাও গুরুত্বপূর্ণ। উত্স সারাংশ এই তুলনা নির্দিষ্ট করে না.
দ্বিতীয় বিষয় হলো অর্থনীতি। 2 ট্রিলিয়ন পর্যন্ত টোকেন এবং একটি বর্ধিত মধ্যবর্তী মডেল সহ প্রশিক্ষণের জন্য যথেষ্ট অতিরিক্ত গণনার প্রয়োজন হতে পারে। একটি দরকারী মূল্যায়ন মেমরি, লেটেন্সি এবং শক্তি সহ একটি 1.3-বিলিয়ন-প্যারামিটার মডেল পরিবেশন থেকে সঞ্চয়ের সাথে মোট প্রশিক্ষণ খরচের তুলনা করবে। উত্সটি কোনও হার্ডওয়্যার, রানটাইম বা খরচের পরিসংখ্যান সরবরাহ করে না, তাই সরবরাহ করা তথ্য থেকে সামগ্রিকভাবে পদ্ধতিটি সস্তা বলে উপসংহারে আসা সম্ভব নয়।
গবেষক এবং অনুশীলনকারীদেরও পরীক্ষা করা উচিত যে পদ্ধতিটি রিপোর্ট করা কম্প্রেশন সেটিং এর বাইরে স্থানান্তর করে কিনা। উত্সটি একটি হ্রাসের নাম দেয়, 2.8 বিলিয়ন থেকে 1.3 বিলিয়ন পরামিতি, কিন্তু অন্যান্য অনুপাত, স্থাপত্য, ভাষা বা নিম্নধারার কাজগুলির জন্য ফলাফল বর্ণনা করে না। স্বাধীন অধ্যয়নগুলি দেখাতে পারে যে পদ্ধতিটি নির্দিষ্ট প্রশিক্ষণের সময়সূচী বা ছাঁটাই কাঠামোর উপর নির্ভর করে এবং ক্ষমতা পুনর্বন্টন আরও আক্রমণাত্মক কম্প্রেশন স্তরে কার্যকর থাকে কিনা।
অবশেষে, বাস্তবায়ন এবং স্থাপনার প্রমাণের জন্য দেখুন। Apple পৃষ্ঠাটি উল্লেখ করে না যে কোড, চেকপয়েন্ট বা একটি পুনরুত্পাদনযোগ্য প্রশিক্ষণ রেসিপি প্রকাশ করা হয়েছে, এবং এটি কোনও উত্পাদন ব্যবহারের রিপোর্ট করে না। আরও কাজ মানসম্পন্ন কর্মক্ষমতা ছাড়াও নির্ভরযোগ্যতা, নিরাপত্তা এবং ক্ষমতা রিগ্রেশনের জন্য সংকুচিত মডেলগুলি পরীক্ষা করা উচিত। যতক্ষণ না এই বিশদগুলি পাওয়া যায়, ততক্ষণ পর্যন্ত IDEA Prune একটি সম্ভাব্য উপযোগী প্রশিক্ষণ গবেষণা ফলাফল হিসাবে বোঝা যায় যার ব্যবহারিক সীমানা অমীমাংসিত থেকে যায়।