深度循环神经网络

news2025/7/6 1:50:40

在深度循环神经网络中，隐状态的信息被传递到当前层的下一时间步和下一层的当前时间步。

有许多不同风格的深度循环神经网络，如长短期记忆网络、门控循环单元、或经典循环神经网络。这些模型在深度学习框架的高级API中都有涵盖。

总体而言，深度循环神经网络需要大量的调参（如学习率和修剪）来确保合适的收敛，模型的初始化也需要谨慎。

之前讨论过具有一个单向隐藏层的循环神经网络（循环神经网络（MLP——＞RNN，困惑度)_流萤数点的博客-CSDN博客），其中，隐变量和观测值与具体的函数形式的交互方式是相当随意的。只要交互类型建模具有足够的灵活性，这就不是一个大问题。然而，对一个单层来说，这可能具有相当的挑战性。之前在线性模型中，通过添加更多的层来解决这个问题。而在循环神经网络中，我们首先需要确定如何添加更多的层，以及在哪里添加额外的非线性，因此这个问题有点棘手。

事实上，我们可以将多层循环神经网络堆叠在一起，通过对几个简单层的组合，产生了一个灵活的机制。特别是，数据可能与不同层的堆叠有关。例如，我们可能希望保持有关金融市场状况（熊市或牛市）的宏观数据可用，而微观数据只记录较短期的时间动态。

图9.3.1描述了一个具有L个隐藏层的深度循环神经网络，每个隐状态都连续地传递到当前层的下一个时间步和下一层的当前时间步。

1.函数依赖关系

我们可以将深度架构中的函数依赖关系形式化，这个架构是由图9.3.1中描述了L个隐藏层构成。后续的讨论主要集中在经典的循环神经网络模型上，但是这些讨论也适应于其他序列模型。

与多层感知机一样，隐藏层数目L和隐藏单元数目h都是超参数。也就是说，它们可以由我们调整的。另外，用门控循环单元或长短期记忆网络的隐状态来代替 (9.3.1)中的隐状态进行计算，可以很容易地得到深度门控循环神经网络或深度长短期记忆神经网络。

2.简洁实现

实现多层循环神经网络所需的许多逻辑细节在高级API中都是现成的。简单起见，我们仅示范使用此类内置函数的实现方式。以长短期记忆网络模型为例，该代码与之前在长短期记忆网络（LSTM）_流萤数点的博客-CSDN博客中使用的代码非常相似，实际上唯一的区别是我们指定了层的数量，而不是使用单一层这个默认值。像往常一样，我们从加载数据集开始。

pip install mxnet==1.7.0.post1

pip install d2l==0.15.0

from mxnet import npx
from mxnet.gluon import rnn
from d2l import mxnet as d2l

npx.set_np()

batch_size, num_steps = 32, 35
train_iter, vocab = d2l.load_data_time_machine(batch_size, num_steps)

像选择超参数这类架构决策也跟长短期记忆网络（LSTM）_流萤数点的博客-CSDN博客中的决策非常相似。因为我们有不同的词元，所以输入和输出都选择相同数量，即vocab_size。隐藏单元的数量仍然是256。唯一的区别是，我们现在通过num_layers的值来设定隐藏层数。

vocab_size, num_hiddens, num_layers = len(vocab), 256, 2
device = d2l.try_gpu()
lstm_layer = rnn.LSTM(num_hiddens, num_layers)
model = d2l.RNNModel(lstm_layer, len(vocab))

3.训练与预测

由于使用了长短期记忆网络模型来实例化两个层，因此训练速度被大大降低了。

num_epochs, lr = 500, 2
d2l.train_ch8(model, train_iter, vocab, lr*1.0, num_epochs, device)

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.coloradmin.cn/o/124352.html

如若内容造成侵权/违法违规/事实不符，请联系多彩编程网进行投诉反馈，一经查实，立即删除！

深度循环神经网络

1.函数依赖关系

2.简洁实现

3.训练与预测

相关文章

第三方库react-redux基础使用容器UI组件使用数据管理优化

【计组】数据通路和流水线设计--《深入浅出计算机组成原理》（三）

Python爬虫进行正则数据解析实战

第三十二章数论——组合数详解（1）

Numpy学习记录

图片如何批量重命名？一步一步教会你

线性代数基础----矩阵

阳了在家没事干？教大家用python在家做一个万能看视频软件，绝对正经啦~

如何删除掉设备和驱动器下百度网盘的图标

12月小报｜读小报，涨知识

Weda创建视图表格

马上又是新的一年了 “跨年倒计时”送给大家

pytorch 深度学习

年关在即，源站安全如何保障？｜ScanV（云监测）重保哨兵值守

如何去掉任务栏的英伟达图标，并阻止英伟达服务自启动

WebGL

炒股经验总结

正点原子IMX6ULL-Linux驱动开发

专利申请与专利转让有什么区别？

公司想要做自动化测试，那么自动化测试发展和价值回报有哪些？