ভাষা এআই গাইড

গভীরতার মিশ্রণ

গভীরতার মিশ্রণ (MoD) একটি ট্রান্সফরমারকে প্রতিটি স্তরের ভারী গণনার মাধ্যমে শুধুমাত্র 'গুরুত্বপূর্ণ' টোকেনকে রাউটিং করে বিভিন্ন টোকেনে বিভিন্ন পরিমাণ গণনা করতে দেয়।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.

গভীর ডুব

স্ট্যান্ডার্ড ট্রান্সফরমার প্রতিটি স্তর প্রতিটি টোকেনে প্রয়োগ করে, এমনকি বিরাম চিহ্নের মতো তুচ্ছ। 2024 সালে Google DeepMind দ্বারা প্রবর্তিত গভীরতার মিশ্রণ, প্রতিটি ব্লকে একটি ছোট রাউটার যোগ করে যা সম্পূর্ণ স্ব-মনোযোগ এবং MLP গণনার মধ্য দিয়ে টোকেনের একটি নির্দিষ্ট টপ-কে ভগ্নাংশ নির্বাচন করে; অবশিষ্টাংশ একটি অবশিষ্ট সংযোগের মাধ্যমে ব্লকটি এড়িয়ে যান। যেহেতু প্রতি স্তরে শুধুমাত্র k টোকেনগুলি প্রক্রিয়া করা হয়, তাই মোট গণনা (FLOPs) ক্যাপ করা হয় এবং আগে থেকেই পরিচিত হয়, পূর্বের গতিশীল-গভীরতা পদ্ধতিগুলির বিপরীতে যা অপ্রত্যাশিতভাবে পরিবর্তিত হয়। এটি ব্যাচিং এবং হার্ডওয়্যার ব্যবহার দক্ষ করে তোলে। MoD-প্রশিক্ষিত মডেলগুলি ফরওয়ার্ড পাসে কম FLOP ব্যবহার করে একটি বেসলাইন ট্রান্সফরমারের গুণমানের সাথে মিলতে পারে, বা একই কম্পিউটে উচ্চতর গুণমানে পৌঁছাতে পারে এবং ধারণাটি স্বাভাবিকভাবেই মিক্সচার-অফ-বিশেষজ্ঞদের সাথে 'MoDE' মডেলগুলিকে গভীরতা এবং প্রস্থ উভয় ক্ষেত্রেই দিতে পারে।

প্রযুক্তিগত অন্তর্দৃষ্টি

প্রতিটি MoD ব্লকে, একটি শেখা লিনিয়ার রাউটার প্রতিটি টোকেন স্কোর করে এবং স্কোর অনুসারে টপ-কে রাখে; নির্বাচিত টোকেনগুলি মনোযোগ এবং এমএলপির মধ্য দিয়ে যায়, যখন অনির্বাচিত টোকেনগুলি অবশিষ্ট পথের দ্বারা অপরিবর্তিতভাবে এগিয়ে যায়। একটি নির্দিষ্ট টপ-কে ব্যবহার করে (প্রতি-টোকেন থ্রেশহোল্ডের পরিবর্তে) গণনা গ্রাফটিকে স্থির করে তোলে এবং টেনসরের আকারগুলি ধ্রুবক, যা হার্ডওয়্যার-বান্ধব। রাউটারটি বাকি নেটওয়ার্কের সাথে প্রশিক্ষিত, এবং কার্যকারণ প্রজন্ম সহায়ক ভবিষ্যদ্বাণী ব্যবহার করে যাতে রাউটিং সিদ্ধান্তগুলি ভবিষ্যতের টোকেনগুলিতে উঁকি দেয় না।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।

অ্যাক্সেস এবং পৌঁছানো

এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।

সুস্পষ্ট সিদ্ধান্ত

অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।

গভীরতার মিশ্রণের ভবিষ্যত

মডেল স্কেল হিসাবে দক্ষতার জন্য শর্তসাপেক্ষ গণনা একটি প্রধান লিভার, এবং MoD হল একটি প্রাথমিক, পরিষ্কার উদাহরণ। মিক্সচার-অফ-এক্সপার্টস (গভীরতা এবং বিশেষজ্ঞ উভয়ের উপর রাউটিং), অভিযোজিত বাজেট যা সহজ ইনপুটগুলির জন্য সঙ্কুচিত হয় এবং শেখা রাউটারগুলির সাথে আরও গভীর একীকরণের প্রত্যাশা করুন যা সঠিকভাবে কোন টোকেনগুলির গভীর প্রক্রিয়াকরণের প্রয়োজন তা আরও ভালভাবে সনাক্ত করে৷ যেহেতু অনুমান খরচগুলি স্থাপনার অর্থনীতিতে আধিপত্য বিস্তার করে, সেই কৌশলগুলি যেগুলি মডেলগুলিকে 'কঠিন চিন্তা' করতে দেয় শুধুমাত্র যেখানে প্রয়োজন হয়, অনুমানযোগ্য বিলম্ব বজায় রেখে, বড় আকারের আর্কিটেকচারে মান হয়ে উঠতে পারে।

বাস্তব-বিশ্ব বাস্তবায়ন

ফিলার টোকেনগুলিতে গভীর গণনা বাদ দিয়ে দীর্ঘ নথিগুলি প্রক্রিয়া করার জন্য প্রয়োজনীয় FLOPগুলি হ্রাস করা

কম কম্পিউটে বেসলাইন মানের সাথে মেলে এমন একটি মডেলকে প্রশিক্ষণ দেওয়া, পরিবেশন খরচ কম করে

লেয়ারের গভীরতা এবং বিশেষজ্ঞের পছন্দ উভয়ের জন্যই মিক্সচার-অফ-এক্সপার্টস (MoDE) এর সাথে একত্রিত করা

অনুমানযোগ্য, টোকেন প্রতি নির্দিষ্ট বিলম্ব বজায় রাখা কারণ প্রতি-স্তর গণনা বাজেট আগাম স্থির করা হয়েছে

ঝুঁকি এবং প্রহরী

হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।

প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।

অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।

2

যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।

3

উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।

4

ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Depths quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

এজেন্টের মিশ্রণ

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is Mixture of Depths?

গভীরতার মিশ্রণ (MoD) একটি ট্রান্সফরমারকে প্রতিটি স্তরের ভারী গণনার মাধ্যমে শুধুমাত্র 'গুরুত্বপূর্ণ' টোকেনকে রাউটিং করে বিভিন্ন টোকেনে বিভিন্ন পরিমাণ গণনা করতে দেয়। এটি একটি নির্দিষ্ট, অনুমানযোগ্য গণনা বাজেট রাখার সময় সহজ টোকেন প্রক্রিয়াকরণের খরচ কমিয়ে দেয়।

টোকেন জুড়ে গভীরতার মিশ্রণ কি পরিবর্তিত হয়?

MoD প্রতিটি স্তরের ভারী গণনার মাধ্যমে শুধুমাত্র কিছু টোকেন রুট করে, তাই বিভিন্ন টোকেন কার্যকরভাবে ভিন্ন গভীরতা পায়।

MoD কিভাবে তার গণনা বাজেট অনুমানযোগ্য রাখে?

প্রতি ব্লক ক্যাপ FLOP-এর জন্য একটি নির্দিষ্ট টপ-কে টোকেন বেছে নেওয়া এবং টেনসরের আকারগুলিকে স্থির রাখে, যা হার্ডওয়্যার-বান্ধব।

রাউটার একটি প্রদত্ত ব্লকে নির্বাচন করে না এমন টোকেনগুলির কী হবে?

অনির্বাচিত টোকেনগুলি ব্লকের গণনাকে বাইপাস করে এবং অবশিষ্ট পাথ দ্বারা অপরিবর্তিত এগিয়ে নিয়ে যায়।

গভীরতার মিশ্রণ কে প্রবর্তন করেন?

গভীরতার মিশ্রণটি Google ডিপমাইন্ড দ্বারা 2024 সালের একটি ডায়নামিক ট্রান্সফরমার কম্পিউটে প্রবর্তন করা হয়েছিল।

মিক্সচার-অফ-বিশেষজ্ঞদের সাথে MoD একত্রিত করলে কী উৎপন্ন হয়?

বিশেষজ্ঞ রাউটিং এর সাথে গভীরতা রাউটিং একত্রিত করলে 'MoDE' মডেল পাওয়া যায় যা স্তর এবং বিশেষজ্ঞ উভয়ের উপরই গণনা করে।