РЪКОВОДСТВО по основи

Клетки с дълга краткосрочна памет

Клетките на дългата краткосрочна памет (LSTM) са специален вид повтаряща се невронна мрежа, създадена да запомня информация в дълги последователности.

2 min readПоследна актуализация

Преглед

They solved the vanishing-gradient problem that crippled earlier RNNs, powering a decade of breakthroughs in language, speech, and translation.

Дълбоко гмуркане

Въведена от Sepp Hochreiter и Jurgen Schmidhuber през 1997 г., клетката LSTM поддържа „клетъчно състояние“, което действа като конвейерна лента от памет, преминаваща през последователността. Три научени порти го контролират: портата за забравяне решава какво да изтрие, входната врата решава каква нова информация да се съхранява, а изходната врата решава какво да изложи като изход на клетката. Всеки гейт използва сигмоид (извеждащ от 0 до 1), за да действа като мек превключвател. Тъй като състоянието на клетката се актуализира най-вече чрез добавяне, а не чрез многократно умножение, градиентите могат да текат назад през много времеви стъпки, без да се свиват до нула, позволявайки на LSTM да научават зависимости на стотици стъпки една от друга. Преди Transformers, LSTM бяха в основата на Google Превод, разпознаване на реч и генериране на текст.

Техническа информация

Корекцията на изчезващия градиент идва от почти линейната актуализация на състоянието на клетката: c_t = f_t * c_{t-1} + i_t * g_t. Вратата за забравяне f_t (сигмоид) може да остане близо до 1, създавайки „въртележка с постоянни грешки“, така че сигналите за грешка да оцелеят при обратно разпространение във времето през дълги интервали. Портите сами по себе си са малки невронни слоеве (сигмоид за стробиране, tanh за кандидат стойности), всички обучени съвместно чрез градиентно спускане. Това стробиране позволява на мрежата да научи какво да запази и какво да изхвърли.

Стратегическо въздействие

Clearer decisions

Помага ви да отделите ясните технически твърдения от маркетинговия език.

Cost and budget

Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.

Team and workflow

Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.

Бъдещето на клетките с дълга краткосрочна памет

Трансформаторите до голяма степен са изпреварили LSTM за широкомащабни езикови задачи, защото паралелизират последователност и улавят дългосрочен контекст чрез внимание, докато LSTM обработват токени стъпка по стъпка. Все пак LSTM остават ценни за стрийминг, настройки с ниска латентност и ограничени ресурси, както и за скромни времеви серии от данни. Скорошна работа като xLSTM (2024) преразглежда и модернизира архитектурата с нови стробиране и памет, за да се конкурира в мащаб, показвайки, че идеята не е завършена.

Внедряване в реалния свят

Задвижване на машинния превод в началото на Google невронната система на Translate, преди Transformers да поеме управлението.

Разпознаване на реч към текст в гласови асистенти и софтуер за диктовка.

Прогнозиране на бъдещи стойности във времеви редове като търсене на енергия, показания на сензори или цени на акции.

Генериране на текст или музика един знак по един и автоматично довършване на последователности.

Рискове и предпазни огради

Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.

Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.

Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.

Пътна карта за изпълнение

1

Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.

2

Изберете един показател за успех и едно условие за неуспех преди тестване.

3

Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.

4

Документирайте къде Long Short-Term Memory Cells помага и къде по-простите методи са по-добри.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Long Short-Term Memory Cells quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Управление на паметта на GPU и фрагментиране

Frequently asked questions

What is Long Short-Term Memory Cells?

Клетките на дългата краткосрочна памет (LSTM) са специален вид повтаряща се невронна мрежа, създадена да запомня информация в дълги последователности. Те разрешиха проблема с изчезващия градиент, който осакати по-ранните RNN, задвижвайки десетилетие на пробиви в езика, речта и превода.

Кои три порта контролират информационния поток в стандартна LSTM клетка?

LSTM използва врата за забравяне (какво да се изтрие), входна врата (какво да се съхранява) и изходна врата (какво да се изложи), всяка от които е научена сигмоида.

Какъв основен проблем с по-ранните RNN решиха LSTM?

Стандартните RNN страдат от изчезващи градиенти, които предотвратяват научаването на дългосрочни зависимости; адитивното състояние на клетките на LSTM позволява запазване на градиентите.

Кой въведе LSTM и през коя година?

Сеп Хохрайтер и Юрген Шмидхубер публикуваха LSTM през 1997 г.

Защо състоянието на клетката LSTM помага на градиентите да оцелеят през много времеви стъпки?

Адитивната актуализация („въртележката с постоянни грешки“) избягва повтарящите се умножения, които свиват градиентите, така че сигналите за грешки текат обратно през дълги интервали.

Каква функция за активиране обикновено използват портите LSTM, за да действат като меки превключватели за включване/изключване?

Гейтс използва сигмоид, чийто изход от 0 към 1 мащабира колко информация преминава, действайки като мек превключвател.