【机器学习】循环神经网络(RNN)介绍

news2024/9/21 12:44:28

鑫宝Code

🌈个人主页: 鑫宝Code
🔥热门专栏: 闲话杂谈| 炫酷HTML | JavaScript基础
💫个人格言: "如无必要,勿增实体"


文章目录

  • 循环神经网络(RNN)介绍
    • 什么是RNN?
    • RNN的基本原理
      • 递归神经网络单元
      • 前向传播
      • 反向传播(BPTT)
    • RNN变体
      • LSTM
      • GRU
      • 其他RNN变体
    • RNN在序列建模中的应用
    • 小结

循环神经网络(RNN)介绍

什么是RNN?

循环神经网络(Recurrent Neural Network, RNN)是一种特殊类型的人工神经网络,专门设计用于处理序列数据,如文本、语音、视频等。与传统的前馈神经网络不同,RNN在隐藏层之间引入了循环连接,使得网络能够捕捉序列数据中的动态行为和时间依赖性。

在这里插入图片描述

上图展示了一个简单的RNN结构,其中 x t x_t xt 表示时间步 t t t 的输入, h t h_t ht 表示时间步 t t t 的隐藏状态, o t o_t ot 表示时间步 t t t 的输出。可以看到,隐藏状态 h t h_t ht 不仅取决于当前输入 x t x_t xt,还取决于前一时间步的隐藏状态 h t − 1 h_{t-1} ht1,这就形成了一个循环结构,使得RNN能够捕捉序列数据中的长期依赖关系。

RNN的基本原理

在这里插入图片描述

递归神经网络单元

RNN的核心是一个递归神经网络单元,它根据当前输入 x t x_t xt 和前一时间步的隐藏状态 h t − 1 h_{t-1} ht1 计算当前时间步的隐藏状态 h t h_t ht,计算公式如下:

h t = f ( x t , h t − 1 ) h_t = f(x_t, h_{t-1}) ht=f(xt,ht1)

其中, f f f 是一个非线性函数,通常使用 tanh 或 ReLU 作为激活函数。

前向传播

在前向传播过程中,RNN按照时间步骤依次计算每个时间步的隐藏状态和输出,具体过程如下:

  1. 初始化隐藏状态 h 0 h_0 h0,通常将其设置为全0向量。
  2. 对于每个时间步 t t t:
    • 计算当前时间步的隐藏状态: h t = f ( x t , h t − 1 ) h_t = f(x_t, h_{t-1}) ht=f(xt,ht1)
    • 计算当前时间步的输出: o t = g ( h t ) o_t = g(h_t) ot=g(ht),其中 g g g 是一个输出函数,如softmax或线性函数。

反向传播(BPTT)

RNN的训练过程使用反向传播算法,但由于引入了循环连接,需要使用一种称为"反向传播through

time"(BPTT)的特殊算法。BPTT的基本思想是:

  1. 前向传播计算每个时间步的隐藏状态和输出。
  2. 在最后一个时间步,计算输出与目标值之间的误差。
  3. 从最后一个时间步开始,反向计算每个时间步的误差梯度。
  4. 使用这些梯度更新RNN的权重。

BPTT算法的复杂度与序列长度成正比,这导致了RNN在处理长序列时容易出现梯度消失或梯度爆炸的问题。

RNN变体

为了解决简单RNN存在的梯度问题,研究人员提出了多种RNN变体,其中最著名的有LSTM(Long Short-Term Memory)和GRU(Gated Recurrent Unit)。
在这里插入图片描述

LSTM

LSTM是一种特殊的RNN,它通过精心设计的门控机制,能够更好地捕捉长期依赖关系。LSTM的核心思想是使用三个门(遗忘门、输入门和输出门)来控制信息的流动,从而避免梯度消失或爆炸的问题。

LSTM的前向传播过程可以用以下公式表示:

f t = σ ( W f ⋅ [ h t − 1 , x t ] + b f ) 遗忘门 i t = σ ( W i ⋅ [ h t − 1 , x t ] + b i ) 输入门 C ~ t = tanh ⁡ ( W C ⋅ [ h t − 1 , x t ] + b C ) 候选细胞状态 C t = f t ⊙ C t − 1 + i t ⊙ C ~ t 细胞状态 o t = σ ( W o ⋅ [ h t − 1 , x t ] + b o ) 输出门 h t = o t ⊙ tanh ⁡ ( C t ) 隐藏状态 \begin{aligned} f_t &= \sigma(W_f\cdot[h_{t-1}, x_t] + b_f) & \text{遗忘门} \\ i_t &= \sigma(W_i\cdot[h_{t-1}, x_t] + b_i) & \text{输入门} \\ \tilde{C}_t &= \tanh(W_C\cdot[h_{t-1}, x_t] + b_C) & \text{候选细胞状态} \\ C_t &= f_t \odot C_{t-1} + i_t \odot \tilde{C}_t & \text{细胞状态} \\ o_t &= \sigma(W_o\cdot[h_{t-1}, x_t] + b_o) & \text{输出门} \\ h_t &= o_t \odot \tanh(C_t) & \text{隐藏状态} \end{aligned} ftitC~tCtotht=σ(Wf[ht1,xt]+bf)=σ(Wi[ht1,xt]+bi)=tanh(WC[ht1,xt]+bC)=ftCt1+itC~t=σ(Wo[ht1,xt]+bo)=ottanh(Ct)遗忘门输入门候选细胞状态细胞状态输出门隐藏状态

其中, σ \sigma σ 表示sigmoid函数, ⊙ \odot 表示元素wise乘积, W W W b b b 分别表示权重和偏置。

GRU

GRU(Gated Recurrent Unit)是另一种流行的RNN变体,它相比LSTM结构更加简单,计算量也更小。GRU通过重置门和更新门来控制信息的流动,公式如下:

r t = σ ( W r ⋅ [ h t − 1 , x t ] ) 重置门 z t = σ ( W z ⋅ [ h t − 1 , x t ] ) 更新门 h ~ t = tanh ⁡ ( W h ⋅ [ r t ⊙ h t − 1 , x t ] ) 候选隐藏状态 h t = ( 1 − z t ) ⊙ h t − 1 + z t ⊙ h ~ t 隐藏状态 \begin{aligned} r_t &= \sigma(W_r\cdot[h_{t-1}, x_t]) & \text{重置门} \\ z_t &= \sigma(W_z\cdot[h_{t-1}, x_t]) & \text{更新门} \\ \tilde{h}_t &= \tanh(W_h\cdot[r_t \odot h_{t-1}, x_t]) & \text{候选隐藏状态} \\ h_t &= (1 - z_t) \odot h_{t-1} + z_t \odot \tilde{h}_t & \text{隐藏状态} \end{aligned} rtzth~tht=σ(Wr[ht1,xt])=σ(Wz[ht1,xt])=tanh(Wh[rtht1,xt])=(1zt)ht1+zth~t重置门更新门候选隐藏状态隐藏状态

GRU相比LSTM计算更高效,但在某些任务上的表现略差于LSTM。

其他RNN变体

除了LSTM和GRU,还有一些其他的RNN变体,如:

  • Bi-directional RNN: 能够同时捕捉序列的前向和后向信息。
  • Deep RNN: 将多层RNN堆叠在一起,以提高模型的表达能力。
  • Attention-based RNN: 引入注意力机制,使模型能够更好地关注序列中的关键部分。
  • Clockwork RNN: 通过分层循环机制,减少计算复杂度。

RNN在序列建模中的应用

由于RNN擅长处理序列数据,因此它在许多序列建模任务中发挥着重要作用,包括:

  1. 语言模型: 用于预测文本序列中的下一个单词或字符。
  2. 机器翻译: 将一种语言的句子翻译成另一种语言。
  3. 语音识别: 将语音信号转录为文本。
  4. 手写识别: 将手写字符序列转换为计算机可识别的文本。
  5. 时间序列预测: 预测未来的时间序列数据,如股票价格、天气等。

小结

循环神经网络(RNN)是一种强大的序列建模工具,它通过引入循环连接,使网络能够捕捉序列数据中的动态行为和长期依赖关系。虽然简单RNN存在梯度消失/爆炸的问题,但后来提出的LSTM、GRU等变体很好地解决了这一问题。RNN及其变体已被广泛应用于自然语言处理、语音识别、时间序列预测等领域,取得了卓越的成绩。

虽然RNN在处理序列数据方面表现出色,但它也存在一些局限性,如无法完全并行化计算、对长序列的依赖性建模能力有限等。因此,近年来出现了一些新的序列建模架构,如Transformer等,它们在某些任务上表现更加出色。但无论如何,RNN仍然是序列建模领域的基础和重要组成部分,了解RNN的原理和发展对于深入学习更先进的序列建模方法至关重要。

End

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/2092556.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

Ubuntu下安装和配置MQTT服务器Mosquitto

MQTT(Message Queuing Telemetry Transport)是一种轻量级的通信协议,设计用于物联网设备之间的低带宽、不稳定网络环境下的高效通信。MQTT允许设备通过发布(publish)和订阅(subscribe)模式进行消…

清华2024内地录取3500人,其中900多人是走这个政策进来的... ...

2024年, 清华大学共录取本科新生3800余人,其中内地学生3500余人,覆盖全国31个省份1000 多所生源中学;港澳台学生60余人,国际学生约230人。 大李露个脸 清华大学2024年新生数据 普通批提前批共录取1549人,占比44% 强基计…

火龙果检测-目标检测数据集(包括VOC格式、YOLO格式)

火龙果检测-目标检测数据集(包括VOC格式、YOLO格式) 数据集: 链接:https://pan.baidu.com/s/1NdRBsHnYCK9xZd7bzQoN5w?pwd779l 提取码:779l 数据集信息介绍: 共有 1106 张图像和一一对应的标注文件 标注…

macos OneNote 2016 for Mac 官方pkg下载地址 - macos 10.15 Catalion 可用Onenote版本官方下载地址

macos 10.15 Catalion 版本的系统已经无法正常从应用商店下载到可用的Onenote 应用,原因是版本不受支持, 而且onenote官方链接的应用商店地址https://apps.apple.com/us/app/microsoft-onenote/id784801555?mt12在中国地区也无法访问, 所以中国地区用户如果想使用onenote应用…

【云原生系列之SkyWalking的部署】

1、分布式链路追踪 1.1概念 在较大的web集群和微服务环境中,客户端的一次请求需要经过不同的模块,多个不同中间件,多个不同机器一起相互协作才能处理完成客户端的请求,而在这一系列的请求过程之中,处理流程可能是串行执行,也可能…

华为云征文|基于Flexus云服务器X实例之安装长亭雷池waf教程

🔴大家好,我是雄雄,欢迎关注微信公众号:雄雄的小课堂 先看这里 写在前面何为长亭雷池waf安装社区版雷池雷池环境要求查看华为云Flexus云服务器X实例的配置一条命令安装雷池waf检查查看是否安装成功 雷池使用登录雷池配置站点 写在…

51单片机.之ADC数字模拟转换

1、数字转模拟电路&#xff0c;输出波形&#xff0c;示波器采集来显示波形 单片机通过i2c给&#xff0c;模数转换器&#xff0c;写入数字信号&#xff0c;定时器1s扫描按键的切换 1、key.c 切换波形 #include <reg52.h>sbit KEY_IN_1 P2^4; sbit KEY_IN_2 P2^5; …

五、Selenium操作指南(一)

文章目录 一、基本用法&#xff08;一&#xff09;初始化浏览器对象&#xff08;二&#xff09;访问页面&#xff08;三&#xff09;设置浏览器大小&#xff08;四&#xff09;刷新页面&#xff08;五&#xff09;前进后退 二、获取页面基础属性三、定位页面元素&#xff08;一…

【QNX+Android虚拟化方案】112 - 获取 88Q5152 Switch Port1、Port2 端口的主从模式 / 传输速率 / 链路状态

【QNX+Android虚拟化方案】112 - 获取 88Q5152 Switch Port1、Port2 端口的主从模式 / 传输速率 / 链路状态 1. 读取 P1、P2 端口 主从模式 / 传输速率2. 读取 P1、P2 端口 Link Status3. 读取 P1、P2 端口 Duplex 全双工/半双工模式4. 读取 P1、P2 链路信号SQI质量5. 完整代码…

基于单片机的肺活量检测仪设计

本设计主要对其中的一种测量方法和原理进行介绍与运用&#xff0c;设计了一款基于STC12C5A60S2单片机的肺活量检测仪&#xff0c;包括供电模块、气流检测模块、按键模块、显示模块、语音输出模块和蓝牙模块&#xff0c;实现对肺活量的数值检测&#xff0c;并对数据进行语音播报…

linux固定ip

背景 VMware&#xff0c;centos7 查询 网关 linux指执行 ip addr 命令 拿到自动分配的ip : 192.168.150.102 [rootlocalhost ~]# cd /etc/sysconfig/network-scripts/ 执行: cd /etc/sysconfig/network-scripts/ 进入到network-scripts文件中 执行: vi ifcfg-ens33 编辑ifc…

PPT到PDF转换器:一个功能强大的Python GUI应用(unzip,convert,replace,merge)

在当今的数字时代,文档格式转换已成为一项常见需求。特别是将PowerPoint演示文稿转换为PDF格式,这不仅可以确保文档的一致性,还能方便分享和打印。今天,我们将深入探讨一个使用Python开发的强大GUI应用程序,它不仅可以将PPT转换为PDF,还具备文本替换、PDF处理和文件合并等多项功…

TDesign 微信小程序组件库配置

文章目录 1.安装 npm 包2. 构建 npm3. 构建完成后即可使用 npm 包。4.修改 app.json5.修改 tsconfig.json6.使用组件 1.安装 npm 包 在小程序 package.json 所在的目录中执行命令安装 npm 包&#xff1a; npm install结果报错 PS C:\WeChatProjects\miniprogram-1> npm i…

七、库存管理——调拨、预留业务

1、库存管理业务总览 2、转储过账和库存转移 3、转储过账 3.1 库存状态到库存状态&#xff08;类型较多&#xff09; 3.1.1 从质检库存转移到非限制使用库存 转储模式&#xff1a;事务类型A08&#xff08;转移过账&#xff09;凭证类型R10&#xff08;其他&#xff09;移动类…

Having trouble using OpenAI API

题意&#xff1a;"使用OpenAI API遇到困难" 问题背景&#xff1a; I am having trouble with this code. I want to implement AI using OpenAI API in my React.js project but I cannot seem to get what the issue is. I ask it a question in the search bar in…

java 教程-我的第一个JAVA程序

Java视频教程 我的第一个JAVA程序 以下我们通过一个简单的实例来展示Java编程&#xff0c;本实例输出"编程字典&#xff0c;Java教程&#xff01;"&#xff0c;这也是所有语言入门的第一个实例程序&#xff1a; packagecodingdict.com; publicclassHelloWorld{ publi…

REGTR: End-to-end Point Cloud Correspondences with Transformers 论文解读

目录 一、导言 二、先导知识 1、3DRegNet 2、Kabsch-Umeyama算法 3、InfoNCE损失函数 三、相关工作 1、基于对应关系的配准 2、全局配准工作 3、过滤问题 4、Transformer 四、REGTR网络 1、降采样和特征提取 2、Transformer 交叉编码器 Transformer为什么要用FF…

MySQL高阶练习题2-没有广告的剧集

目录 题目 准备数据 分析数据 实现代码 总结 题目 找出所有没有广告出现过的剧集。 返回结果 无顺序要求 。 准备数据 create database db; use db;Create table If Not Exists Playback(session_id int,customer_id int,start_time int,end_time int); Create table I…

数据结构:(LeetCode 965)相同的树

给你两棵二叉树的根节点 p 和 q &#xff0c;编写一个函数来检验这两棵树是否相同。 如果两个树在结构上相同&#xff0c;并且节点具有相同的值&#xff0c;则认为它们是相同的。 示例 1&#xff1a; 输入&#xff1a;p [1,2,3], q [1,2,3] 输出&#xff1a;true示例 2&…

「草莓」即将上线,OpenAI新旗舰大模型曝光,代号「猎户座」

本月初,OpenAI 创始人、CEO 山姆・奥特曼突然在 X 上发了一张照片,勾起了大家强烈的好奇心。 「四个红草莓,其中还有一个未成熟的青色草莓,这不妥妥地是在说下一代 AI 大模型 GPT-5 要来了吗?」奥特曼在回应网友时也在暗示,惊喜马上就来。 据科技媒体 The Information 报…