基础知识指南

循环神经网络

循环神经网络 (RNN) 旨在处理文本、语音和时间序列等序列。

阅读时间:2分钟最后更新

概述

They process data one step at a time while carrying a memory of what came before, making order and context matter.

深入探讨

与同时查看所有输入的标准网络不同,RNN 逐步读取序列,将前一步的输出反馈回自身。这个循环创建了一个隐藏状态,即迄今为止所看到的所有内容的运行摘要,因此“银行”一词在“河流”之后的解释与“储蓄”之后的解释不同。普通 RNN 很难处理长序列,因为训练过程中梯度会收缩或爆炸,导致它们忘记远处的上下文。门控变体解决了这个问题:长短期记忆(LSTM,1997)和更简单的门控循环单元(GRU)使用门来决定保留、更新或丢弃什么,让网络在多个步骤中保留信息。在 Transformer 很大程度上取代它们之前,RNN 为早期的机器翻译、语音识别和预测文本提供了支持。

技术洞察

定义特征是反馈循环:在每个时间步,网络将当前输入与先前的隐藏状态相结合以产生新的隐藏状态。训练使用随时间的反向传播,这会展开所有步骤的循环并将误差向后传播。这就是梯度消失问题的关键所在,因为跨多个步骤相乘的梯度趋向于零。 LSTM 添加了单独的单元状态以及输入门、遗忘门和输出门,因此信息可以在几乎不变的长跨度上流动。

战略影响

更清晰的判决

它可以帮助您将清晰的技术声明与营销语言分开。

成本与预算

在花费金钱或时间之前,您可以提出更好的实施问题。

团队与工作流程

具有共同理解的团队可以做出更好的产品、政策和学习决策。

循环神经网络的未来

对于大多数大规模语言任务,Transformer 已经取代了 RNN,因为它们并行处理序列并能更好地捕获远程链接。然而 RNN 远未过时:它们的逐步、恒定内存处理适合流音频、低功耗设备和实时控制。像 Mamba 这样的较新的状态空间模型以现代效率复兴了递归式思想,可以廉价地处理很长的序列。在数据持续到达或计算和内存紧张的情况下,循环和状态空间方法有望保持强大的优势。

现实世界的实施

为早期 Google 翻译和语音转文本听写系统提供支持

预测智能手机键盘自动完成和滑动打字中的下一个单词

根据历史时间序列数据预测股票价格、能源需求和天气

生成和分析音乐或检测流传感器数据中的异常

风险与防护栏

不同的团队可能会以不同的方式使用同一术语,因此请尽早定义范围。

基准测试可能看起来很强大,但实际性能却参差不齐。

忽视数据质量和评估计划通常会产生脆弱的结果。

实施路线图

1

从您需要的结果的简单语言定义开始。

2

在测试之前选择一种成功指标和一种失败条件。

3

使用代表性数据运行小型试点,而不是完善的演示集。

4

记录循环神经网络在哪些方面有帮助以及在哪些方面更简单的方法更好。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Recurrent Neural Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

图神经网络

常见问题

What is Recurrent Neural Networks?

循环神经网络 (RNN) 旨在处理文本、语音和时间序列等序列。它们一次一步地处理数据,同时保留之前发生的事情的记忆,这使得顺序和上下文很重要。

RNN 与标准前馈网络有何不同?

RNN 具有反馈循环:每个步骤的隐藏状态都会向前传递,为网络提供序列早期部分的记忆。

RNN 中的“隐藏状态”是什么?

隐藏状态充当网络的记忆,在每一步更新以总结截至该点处理的序列。

什么问题导致普通 RNN 忘记序列中较远的信息?

当梯度在许多时间步长上相乘时,它们往往会缩小到零(或爆炸),因此早期信息不再影响学习。

LSTM 和 GRU 如何改进普通 RNN?

LSTM 和 GRU 等门控单元学习调节信息流,让有用的上下文在长序列中持续存在,并减少梯度消失问题。

RNN 专门针对哪种类型的数据而设计?

RNN 擅长处理上下文和序列很重要的有序数据,例如句子、音频流和随时间的测量。