基础知识指南

长短期记忆细胞

长短期记忆 (LSTM) 细胞是一种特殊的循环神经网络单元,旨在记住长序列中的信息。

阅读时间:2分钟最后更新

概述

They solved the vanishing-gradient problem that crippled earlier RNNs, powering a decade of breakthroughs in language, speech, and translation.

深入探讨

LSTM 单元由 Sepp Hochreiter 和 Jurgen Schmidhuber 于 1997 年提出,它维持一种“单元状态”,就像一条贯穿序列的记忆传送带。三个学习门控制它:忘记门决定删除什么,输入门决定存储什么新信息,输出门决定将什么公开为单元的输出。每个门都使用一个 sigmoid(输出 0 到 1)作为软开关。由于细胞状态主要通过加法而不是重复乘法来更新,因此梯度可以在多个时间步上向后流动而不会缩小到零,从而让 LSTM 学习相隔数百步的依赖关系。在《变形金刚》出现之前,LSTM 是 Google 翻译、语音识别和文本生成的基础。

技术洞察

梯度消失修复来自单元状态的近线性更新:c_t = f_t * c_{t-1} + i_t * g_t。忘记门 f_t(s 型函数)可以保持在 1 附近,创建一个“恒定误差轮播”,因此误差信号可以在长跨度上通过时间反向传播。门本身就是小型神经层(sigmoid 用于门控,tanh 用于候选值),全部通过梯度下降联合训练。这种门控让网络了解保留什么和丢弃什么。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

长短期记忆细胞的未来

在大规模语言任务中,Transformer 在很大程度上取代了 LSTM,因为它们在序列上并行并通过注意力捕获远程上下文,而 LSTM 一次一步地处理标记。尽管如此,LSTM 对于流媒体、低延迟、资源受限的环境以及适度的时间序列数据仍然很有价值。最近的工作,如 xLSTM (2024),通过新的门控和内存重新审视并现代化了架构,以进行大规模竞争,这表明这个想法尚未完成。

现实世界的实施

在变形金刚接管之前,为 Google Translate 的神经系统早期的机器翻译提供动力。

语音助手和听写软件中的语音到文本识别。

预测时间序列的未来值,例如能源需求、传感器读数或股票价格。

一次生成一个标记的文本或音乐并自动完成序列。

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录长短期记忆细胞在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Long Short-Term Memory Cells quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

GPU 内存管理和碎片

常见问题

What is Long Short-Term Memory Cells?

长短期记忆 (LSTM) 细胞是一种特殊的循环神经网络单元,旨在记住长序列中的信息。他们解决了困扰早期 RNN 的梯度消失问题,为语言、语音和翻译领域十年来的突破提供了动力。

标准 LSTM 单元中的哪三个门控制信息流?

LSTM 使用遗忘门(要删除什么)、输入门(要存储什么)和输出门(要公开什么),每个门都是一个学习的 sigmoid。

LSTM 解决了早期 RNN 的哪些主要问题?

标准 RNN 存在梯度消失问题,无法学习长程依赖性; LSTM 的加性细胞状态让梯度持续存在。

谁在哪一年引入了 LSTM?

Sepp Hochreiter 和 Jurgen Schmidhuber 于 1997 年发布了 LSTM。

为什么 LSTM 细胞状态有助于梯度在多个时间步长内保持不变?

加法更新(“恒定误差轮播”)避免了缩小梯度的重复乘法,因此误差信号会在较长的跨度内回流。

LSTM 门通常使用什么激活函数来充当软开关?

门使用 sigmoid,其 0 到 1 的输出可缩放信息传递量,就像软开关一样。