RNN中的梯度消失與梯度爆炸

原創

2020-06-16 05:23

1. 引入

我們可以在[1]中，看到RNN的結構，如下圖所示。

假設我們輸入兩個句子如下：

The cat, which already xxx yyy zzz …, was full.
The cats, which alrady xxx yyy zzz …, were full.

這兩句話中，“xxx yyy zzz …”表示句子中間有很長的文本，此處略去。我們只看單數與複數，最後一個逗號後，也要對應was和were。我們期望RNN網絡能學到這種單數複數的語法。

但是由於句子太長了，而RNN本身是不擅長捕捉這種長期依賴效應（very long-term dependencies）的。

這是爲什麼呢？

2. 梯度消失

在文章[3]中，我們解釋過一種情況：普通的多層神經網絡中，如果網絡深度很深，則“激活函數將會成指數級遞增”，最終導致在反向傳播過程中梯度很難向前傳遞，也就是“梯度消失”。這就是從y輸出的梯度，很難傳播回去。

RNN也具有同樣的問題，各個時刻激活函數的輸出值a累乘到一起，傳到靠後的時刻後，值已經很小了，在反向傳播過程中，就很容易出現“梯度消失”。

所以，需要在序列後面生成單複數was或were，也是比較困難的，因爲前面序列傳過來的a，可能到後面就消失了。

正因如此，輸出序列某個值，是比較容易受到附近值的影響，但不容易受到離他很遠的值的影響。比如y<10>，容易被x<9>,x<8>,x<7>影響到，但不容易被x<2>影響到。

3. 梯度爆炸

除了“梯度消失”，RNN訓練過程中也可能遇到“梯度爆炸”。但對RNN來說，“梯度消失”更嚴重。爲什麼呢？

因爲“梯度爆炸”會導致你的網絡參數大到崩潰，所以“梯度爆炸”更容易被發現。“梯度爆炸”時，你可以觀測到網絡參數出現數值溢出（數據過大）。

出現“梯度爆炸”時，可以用梯度修剪的方法來解決：

觀察梯度向量，如果它大於某個閾值，就縮放梯度向量，保證它不會太大。

這種梯度修剪法，相對是比較魯棒的方法。而梯度消失則很難解決。

4. 總結

在訓練很深的神經網絡時，隨着層數的增加，導數可能呈指數型的下降或增加，所以我們會遇到“梯度消失”（使得你的網絡無法捕獲長期依賴）或“梯度爆炸”。

如果一個RNN處理10000個值的序列，這就是一個10000個層的神經網絡（因爲前面時刻激活函數的輸出值a會不斷疊加到後面時刻）。

其中，“梯度爆炸”問題用梯度修剪法基本就能解決。但“梯度消失”則很難解決（可以用GRU來解決，後面再介紹，門控循環單元網絡）。

參考

[1]. 理解RNN的結構+特點+計算公式. https://blog.csdn.net/ybdesire/article/details/103449597
[2]. 序列模型用途介紹及數學符號. https://blog.csdn.net/ybdesire/article/details/102963683
[3]. 深度學習中的梯度消失與梯度爆炸. https://blog.csdn.net/ybdesire/article/details/79618727
[4]. Andrew Ng Sequence Models video

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

Stable Diffusion中的embedding

Stable Diffusion中的embedding 嵌入，也稱爲文本反轉，是在 Stable Diffusion 中控制圖像樣式的另一種方法。在這篇文章中，我們將學習什麼是嵌入，在哪裏可以找到它們，以及如何使用它們。什麼是嵌入embe

2024-04-25 21:31:13

京東廣告研發 —— 京東推薦廣告排序機制演化

1、序言：廣告排序機制的前世今生 1.1、簡介：廣告排序機制在線廣告是國內外各大互聯網公司的重要收入來源之一，而在線廣告與傳統廣告最大的區別就在於其超大規模的實時競價環境：數以萬計的廣告主在一天內可以參與億級別的流量競拍。在這複雜的實

2024-04-24 23:17:14

03-爲啥大模型LLM還沒能完全替代你？

1 不具備記憶能力的它是零狀態的，我們平常在使用一些大模型產品，尤其在使用他們的API的時候，我們會發現那你和它對話，尤其是多輪對話的時候，經過一些輪次後，這些記憶就消失了，因爲它也記不住那麼多。 2 上下文窗口的限制大模型對其inpu

2024-04-23 01:07:00

輕鬆復現一張AI圖片

輕鬆復現一張AI圖片現在有一個非常漂亮的AI圖片，你是不是想知道他是怎麼生成的？今天我會交給大家三種方法，學會了，什麼圖都可以手到擒來了。需要的軟件在本教程中，我們將使用AUTOMATIC1111 stable diffusio

2024-04-22 21:30:45

01-大語言模型發展

AI大模型的相關的一些基礎知識，一些背景和基礎知識。多模型強應用AI 2.0時代應用開發者的機會。 0 大綱 AI產業的拆解和常見名詞應用級開發者，在目前這樣一個大背景下的一個職業上面的一些機會實戰部分的，做這個agent，即所謂智

2024-04-22 01:12:50

AI從入門到入門之手寫數字識別模型java方式Dense全連接神經網絡實現

前言：授人以魚不如授人以漁.先學會用，在學原理，在學創造，可能一輩子用不到這種能力，但是不能不具備這種能力。這篇文章主要是介紹算法入門Helloword之手寫圖片識別模型java中如何實現以及部分解釋。目前大家對於人工智能-機器學習-神經網

2024-04-19 23:17:21

深入解析大模型NLP LLaMa

在人工智能和自然語言處理（NLP）領域，LLaMa（Language-Model-driven Learning, aMplification and aDAptation）流程已經成爲處理大規模模型訓練的關鍵技術。它基於語言模型的學習、增

2024-04-18 11:29:54

文檔圖像大模型

隨着信息技術的快速發展，文檔處理已經成爲日常生活和工作中不可或缺的一部分。傳統的文檔處理方法往往需要人工參與，效率低下且易出錯。近年來，隨着深度學習技術的突破，文檔圖像大模型在智能文檔處理領域嶄露頭角，爲提升文檔處理性能提供了新的解決方案。

2024-04-18 11:29:52

從零開始學習大模型

隨着人工智能技術的快速發展，大模型已成爲許多領域的熱門話題。然而，大模型的創建並不是一件容易的事情。在本文中，我們將從零開始學習如何創建一個大模型，幫助讀者掌握大模型的創建過程。一、數據收集創建大模型的首要任務是收集數據。數據是大模型的

2024-04-16 11:29:26

倒計時4天！百度Create AI開發者大會“大模型與深度學習技術”論壇亮點搶鮮看！

作爲人工智能的核心基礎技術，深度學習具有很強的通用性，大模型技術在深度學習的基礎上，通過構建更加龐大神經網絡模型和應用transformer等更加領先的算法，使模型的處理能力產生質的飛躍。飛槳（PaddlePaddle）以百度多年的深度學習

2024-04-12 21:33:07

深度解析大模型推理框架：原理、應用與實踐

在當今數據驅動的時代，大模型推理框架已經成爲人工智能領域的重要支柱。本文將通過簡明扼要、清晰易懂的方式，帶領讀者深入瞭解大模型推理框架的原理、應用領域和實踐經驗，幫助讀者更好地掌握這一技術，並在實際工作中發揮其價值。一、大模型推理框架簡介

2024-04-11 23:28:49

金融領域中的大模型Lora微調：實戰應用與性能優化

隨着金融行業的快速發展，大數據和人工智能技術的應用越來越廣泛。在這個背景下，深度學習模型在金融領域的應用逐漸受到重視。然而，傳統的深度學習模型在金融場景中面臨着數據量大、模型複雜度高、計算資源有限等挑戰。爲了解決這個問題，Lora框架應運而

2024-04-11 23:28:47

RAG 修煉手冊｜一文講透 RAG 背後的技術

在之前的文章中《RAG 修煉手冊｜RAG敲響喪鐘？大模型長上下文是否意味着向量檢索不再重要》，我們已經介紹過 RAG 對於解決大模型幻覺問題的不可或缺性，也回顧瞭如何藉助向量數據庫提升 RAG 實戰效果。今天我們繼續剖析 RAG，將爲大

2024-04-10 21:20:11

一站式解讀多模態——Transformer、Embedding、主流模型與通用任務實戰（上）

本文章由飛槳星河社區開發者高宏偉貢獻。高宏偉，飛槳開發者技術專家（PPDE），飛槳領航團團長，長期在自媒體領域分享 AI 技術知識，博客粉絲 9w+，飛槳星河社區 ID 爲 GoAI 。分享分爲上下兩期，本期分享從多模態概念與意義、任務類型

2024-04-08 11:42:41

百億大規模圖在廣告場景的應用

本文通過搜索推薦項目進行外賣搜索廣告弱供給填充，提高流量變現效率。我們提出外賣多場景異構大圖、異構大圖在線建模技術演進路線，解決外賣搜索推薦業務多渠道、即時化的挑戰。相關成果發表CIKM2023會議一篇。聯合機器學習平臺搭建大規模圖訓練、

2024-03-29 21:16:38

24小時熱門文章

DAPPER 事務 TRANSACTION

最新文章

最新評論文章