Език AI РЪКОВОДСТВО

Механизми на вниманието

Вниманието позволява на модела да реши кои други думи в изречението са най-важни при тълкуването на всяка дума.

2 min readПоследна актуализация

Преглед

It is the core idea that made the transformer — and therefore modern AI like ChatGPT — possible.

Дълбоко гмуркане

Вниманието отговаря на прост въпрос за всяка дума: кои други думи трябва да погледна, за да разбера тази? Документът от 2017 г. „Вниманието е всичко, от което се нуждаете“ от Vaswani и колеги от Google представи трансформатора, който използва вниманието като основен двигател и премахва по-старите повтарящи се дизайни. Всеки токен се превръща в три вектора: заявка (какво търся?), ключ (какво предлагам?) и стойност (информацията, която нося). Заявката на токен се сравнява с всеки друг ключ на токен, за да се получат тегла на вниманието, които след това смесват стойностите заедно. Самовниманието прави това в рамките на една последователност, така че всяка дума може директно да се обърне към всяка друга дума. Вниманието с много глави извършва много такива сравнения паралелно, като всяко се фокусира върху различни модели.

Техническа информация

Математиката е мащабирано внимание на точков продукт: softmax(QK^T / √d_k) V. Точковият продукт на заявки и ключове оценява колко уместна е всяка двойка; разделянето на корен квадратен от ключовото измерение (√d_k) предпазва тези резултати от нарастване твърде много; softmax ги превръща в тегла, които сумират до едно; и умножаването по V създава претеглен микс от стойности. Тъй като всеки токен се сравнява с всеки друг, цената нараства с квадрата на дължината на последователността — O(n²) — поради което дългите входове са скъпи и защо съществуват оптимизации като FlashAttention.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на механизмите за внимание

Вниманието е тук, за да остане, но неговата квадратична цена води до интензивни изследвания. FlashAttention направи стандартното внимание много по-бързо и по-ефективно за паметта чрез пренареждане на изчисленията. По-новите насоки включват рядко и линейно внимание, групирано внимание и внимание с множество заявки за свиване на паметта по време на генериране и хибридни дизайни, които смесват вниманието с модели на пространството на състоянието като Mamba за много дълги входове. Очаквайте бъдещите системи да запазят гъвкавостта на вниманието, като същевременно огъват кривата на разходите, така че обработката на входове с дължина на книга или множество документи да стане рутинна и достъпна.

Внедряване в реалния свят

Машинен превод, при който моделът обръща внимание на съответните изходни думи, когато произвежда всяка преведена дума.

Обобщение, където вниманието помага на модела да се съсредоточи върху най-важните изречения в дълга статия.

Асистенти за код, които се връщат към по-ранни дефиниции на променливи, когато предвиждат следващия ред.

Отговор на въпрос върху документ, където вниманието свързва въпросителните думи с пасажа, който съдържа отговора.

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Attention Mechanisms quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Плъзгащ се прозорец Внимание

Frequently asked questions

What is Attention Mechanisms?

Вниманието позволява на модела да реши кои други думи в изречението са най-важни при тълкуването на всяка дума. Това е основната идея, която направи трансформатора — и следователно модерния AI като ChatGPT — възможен.

С едно изречение, какво прави механизмът за внимание?

Attention изчислява тегла, които решават колко всеки токен трябва да черпи от другите токени, когато формира своето представяне.

Кой забележителен документ от 2017 г. въвежда трансформаторната архитектура?

„Вниманието е всичко, от което се нуждаете“ (Vaswani et al., 2017) предлага трансформатора, който разчита на вниманието вместо на повтаряне.

Какви са трите вектора, изчислени за всеки токен на внимание?

Всеки токен създава заявка, ключ и стойност; заявките се съпоставят с ключове за претегляне на стойностите.

Във формулата softmax(QK^T / √d_k) V защо да разделяме на √d_k?

Мащабирането чрез корен квадратен от ключовото измерение предотвратява големите точкови продукти, които биха изместили softmax в малки градиенти, поддържайки стабилно обучението.

Защо стандартното самовнимание става скъпо за много дълги входове?

Всеки токен се грижи за всеки друг токен, така че броят на сравненията се мащабира като n², което прави дългите последователности скъпи във времето и паметта.