Patlayan gradyan: sorun ortalama değil, kuyruk
Gradyan normu bir sayı değil, bir dağılım. Partilerin çoğu sorunsuz, bir avucu eğitimi tek adımda bozuyor.
4 adım
175 XP
Ücretsiz hesap gerekiyor
Derse başla →
Kaynaklar
- Pascanu, R., Mikolov, T. & Bengio, Y. 2013 · On the Difficulty of Training Recurrent Neural Networks · ICML 2013
- Bengio, Y., Simard, P. & Frasconi, P. 1994 · Learning Long-Term Dependencies with Gradient Descent is Difficult · IEEE Trans. Neural Networks 5(2)
- Zhang, J. ve ark. 2020 · Why Gradient Clipping Accelerates Training · ICLR 2020
ML Academy · tarayıcıda çalışan interaktif makine öğrenmesi kursu ·
Bütün dersler