ভাষা এআই গাইড

ফ্ল্যাশ অ্যাটেনশন

FlashAttention হল একটি মেমরি-দক্ষ অ্যালগরিদম যা স্ট্যান্ডার্ড ট্রান্সফরমারের মতো ঠিক একই মনোযোগ গণনা করে কিন্তু GPU মেমরি ধীর করার জন্য দৈত্যাকার মনোযোগ ম্যাট্রিক্স না লিখে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

It made long-context training and inference dramatically faster and cheaper.

গভীর ডুব

স্ট্যান্ডার্ড অ্যাটেনশন প্রতিটি জোড়া টোকেনের জন্য একটি স্কোর গণনা করে, একটি এন-বাই-এন ম্যাট্রিক্স তৈরি করে। একটি 4,000-টোকেন সিকোয়েন্সের জন্য যা 16 মিলিয়ন স্কোর, এবং ম্যাট্রিক্স অবশ্যই লিখতে হবে এবং GPU এর উচ্চ-ব্যান্ডউইথ মেমরি (HBM) থেকে পড়তে হবে। সেই মেমরি ট্র্যাফিক, গণিত নয়, আসল বাধা। 2022 সালে ট্রাই ডাও এবং সহকর্মীদের দ্বারা প্রবর্তিত FlashAttention, গণনার পুনর্গঠন করে যাতে ম্যাট্রিক্স সম্পূর্ণরূপে বাস্তবায়িত হয় না। এটি জিপিইউ-এর ক্ষুদ্র, অতি-দ্রুত অন-চিপ এসআরএএম-এর সাথে মানানসই টাইলসের ক্রম প্রক্রিয়া করে, সফটম্যাক্স ক্রমবর্ধমানভাবে কম্পিউটিং করে। ফলাফলটি গাণিতিকভাবে মানক মনোযোগের অনুরূপ কিন্তু অনেক কম মেমরি ব্যবহার করে এবং বহুগুণ দ্রুত সঞ্চালিত হয়, অনেক দীর্ঘ প্রসঙ্গ উইন্ডো সক্ষম করে।

প্রযুক্তিগত অন্তর্দৃষ্টি

কৌশলটি হল টাইলিং এর সাথে মিলিত 'অনলাইন সফটম্যাক্স'। FlashAttention SRAM-এ ক্যোয়ারী, কী এবং মানগুলির ছোট ব্লক লোড করে, আংশিক মনোযোগের আউটপুট গণনা করে, এবং নতুন ব্লক আসার সাথে সাথে চলমান যোগফল পুনরায় স্কেল করে যাতে একযোগে সমস্ত স্কোর না দেখে সফটম্যাক্স স্বাভাবিককরণ সঠিক থাকে। কারণ এটি কখনই HBM-এ সম্পূর্ণ এন-বাই-এন ম্যাট্রিক্স সংরক্ষণ করে না, মেমরি চতুর্মাত্রিক না হয়ে রৈখিকভাবে স্কেল করে এবং ধীর মেমরি রিড এবং রাইট কমানোর জন্য কার্নেলটিকে একটি একক GPU অপারেশনে যুক্ত করা হয়।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।

অ্যাক্সেস এবং পৌঁছানো

এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।

সুস্পষ্ট সিদ্ধান্ত

অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।

ফ্ল্যাশ অ্যাটেনশনের ভবিষ্যত

FlashAttention একটি ডিফল্ট বিল্ডিং ব্লক হয়ে গেছে। FlashAttention-2 উন্নত GPU কাজের পার্টিশনিং, এবং FlashAttention-3 নতুন হপার হার্ডওয়্যার বৈশিষ্ট্য যেমন অ্যাসিঙ্ক্রোনি এবং কম-নির্ভুলতা FP8 ব্যবহার করে। চিপগুলির সাথে অবিরত সহ-ডিজাইন, দীর্ঘ নথিগুলির জন্য অনুমান সার্ভারগুলিতে গভীর একীকরণ এবং স্পারস বা স্লাইডিং-উইন্ডো মনোযোগের জন্য টিউন করা বৈকল্পিক আশা করুন। যেহেতু কনটেক্সট উইন্ডোগুলি লক্ষ লক্ষ টোকেনের দিকে ঠেলে দেয়, এই ধরনের IO-সচেতন কার্নেলগুলি প্রশিক্ষণ এবং পরিবেশন খরচগুলি পরিচালনাযোগ্য রাখার জন্য অপরিহার্য।

বাস্তব-বিশ্ব বাস্তবায়ন

লামা এবং GPT-শৈলী সিস্টেমের মতো বড় ভাষা মডেলগুলিকে দ্রুত এবং কম GPU খরচে প্রশিক্ষণ দেওয়া

দীর্ঘ-প্রসঙ্গ চ্যাট সহকারী পরিবেশন করা যা মেমরি ফুরিয়ে না গিয়ে পুরো বই বা কোডবেসগুলিকে গ্রাস করে

দস্তাবেজ-সারাংশ পাইপলাইনগুলিকে ত্বরান্বিত করা যা একবারে কয়েক হাজার টোকেন প্রক্রিয়া করে

পাওয়ারিং ভিশন এবং মাল্টিমোডাল ট্রান্সফরমার যেখানে ইমেজ প্যাচের দীর্ঘ ক্রম মনোযোগকে ব্যয়বহুল করে তোলে

ঝুঁকি এবং প্রহরী

হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।

প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।

অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।

2

যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।

3

উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।

4

ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the FlashAttention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

ঘূর্ণমান অবস্থান এমবেডিং

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is FlashAttention?

FlashAttention হল একটি মেমরি-দক্ষ অ্যালগরিদম যা স্ট্যান্ডার্ড ট্রান্সফরমারের মতো ঠিক একই মনোযোগ গণনা করে কিন্তু GPU মেমরি ধীর করার জন্য দৈত্যাকার মনোযোগ ম্যাট্রিক্স না লিখে। এটি দীর্ঘ-প্রসঙ্গ প্রশিক্ষণ এবং অনুমান নাটকীয়ভাবে দ্রুত এবং সস্তা করেছে।

স্ট্যান্ডার্ড মনোযোগের প্রধান বাধা ফ্ল্যাশএটেনশন লক্ষ্য কি?

স্ট্যান্ডার্ড মনোযোগ মেমরি-বাউন্ড: উচ্চ-ব্যান্ডউইথ মেমরিতে এবং থেকে বিশাল এন-বাই-এন ম্যাট্রিক্স শাটল করা সময়কে প্রাধান্য দেয়, নিজেই গাণিতিক নয়।

কিভাবে FlashAttention এর আউটপুট স্ট্যান্ডার্ড মনোযোগের সাথে তুলনা করে?

FlashAttention ঠিক একই মনোযোগ মান গণনা করে; সম্পূর্ণ ম্যাট্রিক্সকে বাস্তবায়িত করা এড়াতে এটি কেবল গণনাকে পুনর্গঠন করে।

কোন GPU মেমরি FlashAttention টাইলগুলিতে ডেটা প্রক্রিয়াকরণের মাধ্যমে শোষণ করে?

FlashAttention GPU-এর দ্রুত অন-চিপ SRAM-এ ছোট টাইলস লোড করে, ভারী কাজকে কম্পিউট ইউনিটের কাছাকাছি রেখে।

কোন কৌশল FlashAttention কে একযোগে সমস্ত স্কোর না দেখে সফটম্যাক্স গণনা করতে দেয়?

একটি অনলাইন সফটম্যাক্স চলমান সর্বোচ্চ এবং যোগফল বজায় রাখে, নতুন টাইলস আসার সাথে সাথে আংশিক ফলাফল পুনরায় স্কেল করে যাতে চূড়ান্ত স্বাভাবিককরণ সঠিক হয়।

FlashAttention-3 বিশেষভাবে কি সুবিধা নিয়েছে?

FlashAttention-3 আধুনিক হপার জিপিইউগুলির সাথে সহ-ডিজাইন করা হয়েছিল, আরও গতির জন্য অ্যাসিঙ্ক্রোনাস এক্সিকিউশন এবং কম-নির্ভুলতা FP8 ব্যবহার করে।