在大規模翻譯任務的經驗中,簡單的堆疊LSTM層最多可以工作4層,很少工作6層,超過8層就很差了。
Redisual connection有助於梯度的反向傳播,能夠幫助lstm堆疊更多層,實現更深層的訓練,但是一般也就是最多到8層。
參考文獻:
在大規模翻譯任務的經驗中,簡單的堆疊LSTM層最多可以工作4層,很少工作6層,超過8層就很差了。
Redisual connection有助於梯度的反向傳播,能夠幫助lstm堆疊更多層,實現更深層的訓練,但是一般也就是最多到8層。
參考文獻:
去megaton裏面的屍鬼.那裏買藥, 把破爛賣給他. 然後傳送到其他地圖, 再傳送回來, 他就又有錢和新藥了.繼續賣破爛, 買藥.刷幾次就夠了.